شفرة يونكس الموسعة

يُعد Extended Unix Code ( EUC ) نظام ترميز متعدد البايتات يستخدم بشكل أساسي للغة اليابانية والكورية والصينية المبسطة ( الأحرف) .

تُعدّ رموز EUC الأكثر شيوعًا هي رموز ترميز متغيرة الطول ، حيث يشغل الحرف المنتمي إلى مجموعة أحرف مُرمّزة متوافقة مع معيار ISO/IEC 646 (مثل ASCII ) بايتًا واحدًا، بينما يُمثّل الحرف المنتمي إلى مجموعة أحرف مُرمّزة 94×94 (مثل GB 2312 ) ببايتين. يُعدّ كلٌّ من EUC-CN و EUC-KR مثالين على هذه الرموز ثنائية البايت. يتضمن EUC-JP أحرفًا مُمثّلة بما يصل إلى ثلاثة بايتات، بما في ذلك رمز الإزاحة الأولي ، بينما قد يشغل الحرف الواحد في EUC-TW ما يصل إلى أربعة بايتات.

من المرجح أن تستخدم التطبيقات الحديثة ترميز UTF-8 ، الذي يدعم جميع رموز ترميز EUC، وأكثر من ذلك، وهو عمومًا أكثر قابلية للتنقل مع اختلافات وأخطاء أقل بين الموردين. ومع ذلك، لا يزال ترميز EUC شائعًا جدًا، وخاصة EUC-KR لكوريا الجنوبية.

بنية التشفير

العلاقة بين ملفات تعريف EUC المعبأة وملفات تعريف ISO 2022 الأخرى ذات 8 بت

يعتمد هيكل EUC على معيار ISO/IEC 2022 ، الذي يحدد نظامًا لمجموعات الأحرف الرسومية التي يمكن تمثيلها بتسلسل من 94 بايتًا، كل منها مكون من 7 بتات، من 0x21 إلى 0x7E، أو بديلًا عن ذلك من 0xA1 إلى 0xFE إذا كان هناك بت ثامن متاح. يتيح هذا النظام مجموعات من 94 حرفًا رسوميًا، أو 8836 حرفًا (94 بتًا )، أو 830584 حرفًا (94 بتًا ). مع أن 0x20 و0x7F كانا في البداية يُستخدمان دائمًا كمسافة وحذف ، بينما لم يُستخدم 0xA0 و0xFF، إلا أن الإصدارات اللاحقة من معيار ISO/IEC 2022 سمحت باستخدام البايتات 0xA0 و0xFF (أو 0x20 و0x7F) ضمن المجموعات في ظروف معينة، مما أتاح إمكانية تضمين مجموعات من 96 حرفًا. يتم استخدام النطاقات 0x00–1F و 0x80–9F لرموز التحكم C0 و C1 .

EUC هي عائلة من ملفات تعريف 8 بت لمعيار ISO/IEC 2022 ، على عكس ملفات تعريف 7 بت مثل ISO-2022-JP . ولذلك، لا يمكن أن تتخذ أشكال EUC إلا مجموعات الأحرف المتوافقة مع معيار ISO 2022. يمكن تمثيل ما يصل إلى أربع مجموعات أحرف مشفرة (يُشار إليها بـ G0 وG1 وG2 وG3 أو بمجموعات الرموز 0 و1 و2 و3) باستخدام نظام EUC. يتم تعيين مجموعة G0 إلى مجموعة أحرف مشفرة متوافقة مع معيار ISO/IEC 646 مثل ASCII أو ISO 646:KR ( KS X 1003 ) أو ISO 646:JP (النصف السفلي من JIS X 0201 ) ويتم استدعاؤها على GL (أي 0x21–0x7E، مع مسح البت الأكثر أهمية). [ 1 ] في حالة استخدام ASCII، يصبح الرمز عبارة عن ترميز ASCII موسع . إن أكثر الانحرافات شيوعًا عن ASCII هو أن 0x5C ( الشرطة المائلة العكسية في ASCII) غالبًا ما يتم استخدامها لتمثيل علامة الين في EUC-JP (انظر أدناه) وعلامة الوون في EUC-KR.

يتم استدعاء مجموعات الرموز الأخرى عبر GR (أي مع ضبط البت الأكثر أهمية). وبالتالي، للحصول على شكل EUC لحرف ما، يتم ضبط البت الأكثر أهمية لكل بايت ترميز (أي ما يعادل إضافة 128 إلى كل بايت ترميز مكون من 7 بتات، أو إضافة 160 إلى كل رقم في رمز kuten )؛ وهذا يسمح للبرنامج بالتمييز بسهولة ما إذا كان بايت معين في سلسلة أحرف ينتمي إلى رمز ISO 646 أو الرمز الموسع. تُسبق الأحرف في مجموعتي الرموز 2 و3 برموز التحكم SS2 (0x8E) و SS3 (0x8F) على التوالي، ويتم استدعاؤها عبر GR. بالإضافة إلى رمز الإزاحة الأولي، فإن أي بايت خارج النطاق 0xA0–0xFF يظهر في حرف من مجموعات الرموز من 1 إلى 3 لا يُعد رمز EUC صالحًا. [ 1 ]

لا يستخدم رمز EUC نفسه تسلسلات الإعلان والتسمية من معيار ISO 2022. [ 1 ] ومع ذلك، فإن مواصفات الرمز تعادل التسلسل التالي المكون من أربعة تسلسلات إعلانية من معيار ISO 2022 ، مع تفصيل المعاني كما يلي. [ 1 ]

تسلسل فرديالنظام الست عشريميزة من ميزات EUC المشار إليها
ESC SP C1B 20 43ISO-8 (8 بت، G0 في GL، G1 في GR)
ESC SP Z1B 20 5Aتم الوصول إلى G2 باستخدام SS2
ESC SP [1B 20 5Bتم الوصول إلى G3 باستخدام SS3
ESC SP \1B 20 5Cاستدعاءات الإزاحة الفردية على GR

تنسيق ثابت الطول

تصميم تنسيق الطول الثابت للغة اليابانية

يُشار أحيانًا إلى ترميز الطول المتغير القائم على معيار ISO-2022 والموصوف أعلاه باسم تنسيق EUC المضغوط ، وهو تنسيق الترميز الذي يُطلق عليه عادةً اسم EUC. مع ذلك، قد تستخدم المعالجة الداخلية لبيانات EUC تنسيق تحويل ثابت الطول يُسمى تنسيق EUC الكامل ثنائي البايت . وهذا يُمثل: [ 2 ]

  • مجموعة التعليمات البرمجية 0 عبارة عن بايتين في النطاق 0x21–0x7E (باستثناء أن الأول قد يكون 0x00).
  • مجموعة التعليمات البرمجية 1 عبارة عن بايتين في النطاق 0xA0–0xFF (باستثناء أن الأول قد يكون 0x80).
  • مجموعة التعليمات البرمجية 2 كبايت في النطاق 0x21–0x7E (أو 0x00) متبوعًا ببايت في النطاق 0xA0–0xFF.
  • مجموعة التعليمات البرمجية 3 كبايت في النطاق 0xA0–0xFF (أو 0x80) متبوعًا ببايت في النطاق 0x21–0x7E.

تُستخدم البايتات الأولية 0x00 و0x80 في الحالات التي تستخدم فيها مجموعة التعليمات البرمجية بايتًا واحدًا فقط. يوجد أيضًا تنسيق ثابت الطول مكون من أربعة بايتات. [ 2 ] تُناسب تنسيقات التشفير ثابتة الطول هذه المعالجة الداخلية، ونادرًا ما تُستخدم في التبادل.

تم تسجيل ترميز EUC-JP لدى هيئة IANA بكلتا الصيغتين، الصيغة المضغوطة باسم "EUC-JP" أو "csEUCPkdFmtJapanese"، والصيغة ذات العرض الثابت باسم "csEUCFixWidJapanese". [ 3 ] الصيغة المضغوطة فقط هي المُدرجة في معيار ترميز WHATWG المُستخدم في HTML5 . [ 4 ]

EUC-CN

EUC-CN [ 6 ] هو الشكل المشفر المعتاد لمعيار GB 2312 للأحرف الصينية المبسطة . على عكس معياري JIS X 0208 الياباني و ISO-2022-JP ، لا يُستخدم GB 2312 عادةً في إصدار ترميز ISO 2022 ذي 7 بتات ، [ أ ] على الرغم من استخدام شكل بديل يُسمى HZ (الذي يُحدد نص GB 2312 بتسلسلات ASCII) أحيانًا على شبكة USENET .

يُمثَّل حرف ASCII بترميزه المعتاد. أما الحرف من GB 2312 فيُمثَّل ببايتين، كلاهما من النطاق 0xA1–0xFE.

رمز 748

يُعدّ رمز "748" أحد رموز التشفير المرتبطة بنظام EUC-CN، وهو الرمز المستخدم في نظام WITS للطباعة الذي طورته شركة Founder Technology في بكين (والذي أصبح الآن نظام FITS الأحدث للطباعة قديمًا). يحتوي رمز 748 على جميع عناصر GB 2312 ، ولكنه لا يتوافق مع معيار ISO 2022 ، وبالتالي فهو ليس رمز EUC حقيقيًا. (يستخدم بايتًا رئيسيًا من 8 بتات، ولكنه يميز بين بايت ثانٍ تكون فيه البتة الأكثر أهمية مُفعّلة، وبايت ثانٍ تكون فيه البتة الأكثر أهمية غير مُفعّلة، ولذلك فهو أقرب في بنيته إلى نظام Big5 وأنظمة تشفير DBCS الأخرى غير المتوافقة مع معيار ISO 2022 ). يحتوي الجزء غير المتوافق مع GB2312 من رمز 748 على الأحرف التقليدية وأحرف هونغ كونغ، بالإضافة إلى رموز أخرى تُستخدم في طباعة الصحف.

صفحات رموز IBM 1380 و1381 و1382 و1383

تتألف صفحة ترميز IBM رقم 1381 ( CCSID 1381) من صفحة الترميز أحادية البايت رقم 1115 (CPGID 1115 كـ CCSID 1115) وصفحة الترميز ثنائية البايت رقم 1380 (CPGID 1380 كـ CCSID 1380)، [ 7 ] والتي ترمز GB 2312 بنفس طريقة EUC-CN، ولكنها تختلف عن بنية EUC بتمديد نطاق البايت الرئيسي إلى 0x8C، وإضافة 31 حرفًا مختارة من قبل IBM في النطاق من 0x8CE0 إلى 0x8CFE، وإضافة 1880 حرفًا معرفًا من قبل المستخدم مع بايتات رئيسية من 0x8D إلى 0xA0. [ 8 ]

تتألف صفحة ترميز IBM رقم 1383 (CCSID 1383) من صفحة الترميز أحادية البايت رقم 367 وصفحة الترميز ثنائية البايت رقم 1382 (CPGID 1382 كـ CCSID 1382)، [ 9 ] والتي تختلف عنها في أنها تتوافق مع بنية EUC، وتضيف الأحرف الـ 31 التي اختارتها IBM في النطاق من 0xFEE0 إلى 0xFEFE، وتتضمن فقط 1360 حرفًا مُعرَّفًا من قِبل المستخدم، موزعة في المواضع غير المستخدمة في GB 2312. [ 10 ] أما CCSID 5479 البديل [ 11 ] فيُستخدم لصفحة ترميز EUC-CN البحتة: فهو يستخدم CCSID 9574 كمجموعة ثنائية البايت، والتي تستخدم CPGID 1382 ولكنها تستثني الأحرف التي اختارتها IBM والأحرف المُعرَّفة من قِبل المستخدم. [ 12 ]

GBK و GB 18030

GBK هو امتداد لـ GB 2312. وهو يُعرّف شكلاً موسعاً لترميز EUC-CN قادراً على تمثيل مجموعة أكبر من أحرف CJK المستمدة في الغالب من Unicode 1.1 ، بما في ذلك الأحرف الصينية التقليدية والأحرف المستخدمة في اللغة اليابانية فقط . مع ذلك، فهو ليس رمز EUC حقيقياً، لأن بايتات ASCII قد تظهر كبايتات لاحقة ( وبايتات C1 ، غير المقتصرة على الإزاحات الفردية، قد تظهر كبايتات سابقة أو لاحقة)، وذلك بسبب الحاجة إلى مساحة ترميز أكبر.

يتم تنفيذ متغيرات GBK بواسطة صفحة ترميز Windows 936 ( صفحة ترميز Microsoft Windows للغة الصينية المبسطة)، وبواسطة صفحة ترميز IBM 1386.

يُعرّف ترميز الأحرف GB 18030، المُستند إلى يونيكود، امتدادًا لترميز GBK قادرًا على ترميز يونيكود بالكامل . مع ذلك، فإن يونيكود المُرمّز باستخدام GB 18030 هو ترميز ذو طول متغير، وقد يستخدم ما يصل إلى أربعة بايتات لكل حرف، نظرًا للحاجة إلى مساحة ترميز أكبر. وباعتباره امتدادًا لـ GBK، فهو مجموعة شاملة لـ EUC-CN، ولكنه ليس رمز EUC حقيقيًا بحد ذاته. وباعتباره ترميز يونيكود، فإن نطاقه مطابق لنطاق تنسيقات تحويل يونيكود الأخرى، مثل UTF-8 .

نظام التشغيل ماك أو إس باللغة الصينية المبسطة

تتضمن متغيرات EUC-CN الأخرى التي تختلف عن آلية EUC، نص Mac OS الصيني المبسط الكلاسيكي (المعروف بصفحة الترميز 10008 أو x-mac-chinesesimp). [ 13 ] يستخدم هذا النص البايتات 0x80، 0x81، 0x82، 0xA0، 0xFD، 0xFE، و0xFF للحرف U مع علامة التشكيل (ü)، وحرفين خاصين من رموز الخطوط، والمسافة غير القابلة للكسر ، وعلامة حقوق النشر (©)، وعلامة العلامة التجارية (™)، وعلامة الحذف (...) على التوالي. [ 6 ] يختلف هذا في تعريف الحرف أحادي البايت مقابل البايت الأول من الحرف ثنائي البايت، وذلك في كل من EUC (حيث يُعرَّف البايتان 0xFD و0xFE كبايتات رائدة) وGBK (حيث يُعرَّف البايتات 0x81، 0x82، 0xFD، و0xFE كبايتات رائدة).

يتوافق استخدام 0xA0 و 0xFD و 0xFE و 0xFF مع متغير Shift_JIS الخاص بشركة Apple .

إلى جانب هذه التغييرات في نطاق البايت الرئيسي، تتمثل السمة المميزة الأخرى لجزء البايت المزدوج من نظام التشغيل Mac OS الصيني المبسط في تضمين امتدادين لمجموعة GB  2312-80 الأساسية في الصفين 6 و8. [ 6 ] يُعتبر هذان الامتدادان "امتدادين قياسيين لمجموعة GB  2312"، ولا يُعد أي منهما ملكية خاصة لشركة Apple: فقد أُخذ امتداد الصف 8 من GB 6345.1 ، [ 6 ] وكلا الامتدادين مُضمنان في GB/T 12345 (النسخة الصينية التقليدية من GB  2312)، [ 14 ] وكلا الامتدادين مُضمنان في GB 18030 (النسخة اللاحقة لـ GB  2312). [ 15 ]

EUC-JP

EUC-JP هو ترميز متغير الطول يُستخدم لتمثيل عناصر ثلاثة معايير لمجموعات الأحرف اليابانية ، وهي JIS X 0208 و JIS X 0212 و JIS X 0201. يُعرف هذا الترميز أيضًا باسم Unixized JIS (أو UJIS ) و AT&T JIS . [ 2 ] يستخدم أقل من 0.1% من صفحات الويب EUC-JP اعتبارًا من فبراير 2026، [ 16 ] بينما يستخدم 2.1% من مواقع الويب المكتوبة باللغة اليابانية هذا الترميز، وهو ثاني أكثر الترميزات شيوعًا (بالنسبة للغة اليابانية) [ 17 ] ( وهو أكثر من Shift JIS، وكلاهما أقل استخدامًا بكثير من UTF-8 ). يُطلق عليه اسم صفحة الترميز 954 من قِبل IBM. [ 18 ] [ 19 ] لدى Microsoft رقمان لصفحة الترميز لهذا الترميز (51932 و20932).

يسمح نظام التشفير هذا بالخلط السهل بين ASCII ذي 7 بتات واللغة اليابانية ذات 8 بتات دون الحاجة إلى أحرف الهروب المستخدمة في ISO-2022-JP ، والتي تعتمد على نفس معايير مجموعة الأحرف، ودون ظهور بايتات ASCII كبايتات لاحقة (على عكس Shift JIS ).

هناك ترميز ذو صلة ومتوافق جزئيًا، يسمى EUC-JISx0213 أو EUC-JIS-2004 ، يقوم بترميز JIS X 0201 و JIS X 0213 [ 20 ] (على غرار Shift_JISx0213 ، نظيره القائم على Shift_JIS).

مقارنةً بـ EUC-CN أو EUC-KR، لم ينتشر استخدام EUC-JP على نطاق واسع في أنظمة الكمبيوتر الشخصي وأنظمة ماكنتوش في اليابان، التي كانت تستخدم Shift JIS أو امتداداتها ( صفحة ترميز ويندوز 932 على نظام مايكروسوفت ويندوز ، و MacJapanese على نظام ماك الكلاسيكي )، على الرغم من استخدامه بكثرة في أنظمة يونكس أو الأنظمة الشبيهة بيونكس (باستثناء HP-UX ). لذلك، يعتمد استخدام المواقع اليابانية لـ EUC-JP أو Shift_JIS غالبًا على نظام التشغيل الذي يستخدمه المؤلف.

يتم ترميز الأحرف على النحو التالي:

  • باعتبارها ترميزًا متوافقًا مع EUC/ ISO 2022 ، يتم تمثيل أحرف التحكم C0 والمسافة وDEL كما في ASCII.
  • يُمثَّل الحرف الرسومي من ASCII (مجموعة الرموز 0) بتمثيله المعتاد المكون من بايت واحد، في النطاق 0x21 0x7E. بينما تُشفِّر بعض إصدارات EUC-JP النصف السفلي من JIS X 0201 هنا، فإن معظمها يُشفِّر ASCII، [ 21 ] بما في ذلك معيار التشفير W3C/WHATWG المستخدم في HTML5 ، [ 22 ] وكذلك EUC-JIS-2004. [ 20 ] مع أن هذا يعني أن 0x5C يُرسم عادةً في Unicode كـ U+005C REVERSE SOLIDUS ( علامة الخط المائل العكسي في ASCII )، إلا أنه قد يُعرض U+005C كرمز ين بواسطة بعض الخطوط اليابانية، مثلاً على نظام Microsoft Windows، وذلك للتوافق مع النصف السفلي من JIS X 0201. [ 23 ] [ 24 ]
  • يُمثَّل الحرف من معيار JIS X 0208 (مجموعة الرموز 1) ببايتين، كلاهما في النطاق 0xA1 0xFE. ويختلف هذا عن تمثيل ISO-2022-JP بوجود البت الأعلى مُفعَّلاً. قد تحتوي مجموعة الرموز هذه أيضًا على امتدادات خاصة بالموردين في بعض إصدارات EUC-JP. في EUC-JIS-2004، يُشفَّر المستوى الأول من JIS X 0213 هنا، وهو في الواقع مجموعة فرعية من معيار JIS X 0208. [ 20 ]
  • يُمثَّل الحرف من النصف العلوي من معيار JIS X 0201 ( كانا نصف العرض ، مجموعة الرموز 2) ببايتين، الأول هو 0x8E، والثاني هو التمثيل المعتاد لمعيار JIS X 0201 في النطاق 0xA1 0xDF. قد تحتوي هذه المجموعة على امتدادات خاصة بمورد IBM في بعض الإصدارات.
  • يُمثَّل الحرف من معيار JIS X 0212 (مجموعة الرموز 3) في EUC-JP بثلاثة بايتات، أولها 0x8F، والبايتان التاليان في النطاق 0xA1 0xFE، أي مع ضبط البت الأعلى. بالإضافة إلى معيار JIS X 0212 ، قد تحتوي مجموعة الرموز 3 في بعض إصدارات EUC-JP على امتدادات في الصفين 83 و84 لتمثيل أحرف من امتدادات Shift JIS الخاصة بشركة IBM والتي تفتقر إلى خرائط معيار JIS X 0212، والتي يمكن ترميزها بأحد تخطيطين، أحدهما مُعرَّف من قِبل IBM نفسها والآخر مُعرَّف من قِبل OSF . [ 25 ] [ 26 ] في EUC-JIS-2004، يتم ترميز المستوى الثاني من JIS X 0213 هنا، [ 20 ] وهو لا يتعارض مع الصفوف المُخصصة في معيار JIS X 0212 . [ 27 ] تسمح بعض تطبيقات معيار EUC-JIS-2004، مثل التطبيق المستخدم في بايثون ، باستخدام كل من أحرف المستوى 2 من معياري JIS X 0212 و JIS X 0213 في هذه المجموعة. [ 27 ]

غالبًا ما يتم تخصيص امتدادات البائعين لـ EUC-JP (من، على سبيل المثال، مؤسسة البرمجيات المفتوحة ، أو IBM أو NEC ) داخل مجموعات التعليمات البرمجية الفردية، [ 25 ] [ 26 ] على عكس استخدام تسلسلات EUC غير الصالحة (كما هو الحال في الامتدادات الشائعة لـ EUC-CN و EUC-KR).

مع ذلك، تتوافق بعض الترميزات الخاصة بالبائعين جزئيًا مع ترميز EUC-JP، نظرًا لترميز JIS X 0208 عبر GR، لكنها لا تتبع بنية EUC المضغوطة. غالبًا، لا تتضمن هذه الترميزات استخدام الإزاحات الفردية من EUC-JP، وبالتالي فهي ليست امتدادًا مباشرًا لـ EUC-JP، باستثناء Super DEC Kanji.

ديسمبر كانجي

تُعرّف شركة Digital Equipment Corporation نوعين من ترميز EUC-JP، أحدهما يتوافق جزئيًا مع تنسيق EUC المضغوط، والآخر يُظهر بعض التشابه مع التنسيق الكامل ثنائي البايت. يتوافق التنسيق العام لترميز "DEC Kanji" في الغالب مع ترميز EUC ذي الطول الثابت (ثنائي البايت الكامل)؛ ومع ذلك، لا يُشترط إضافة بايتات فارغة إلى يسار مجموعة الرموز 0 (كما هو الحال في التنسيق المضغوط). [ 28 ] يُستخدم ترميز JIS X 0208، كالمعتاد، لمجموعة الرموز 1؛ أما مجموعة الرموز 2 (الكاتاكانا بنصف العرض) فهي غير موجودة. يتم ترميز مجموعة الرموز 3 مثل تنسيق العرض الثابت ثنائي البايت (أي بدون بايت إزاحة ومع تعيين البت العالي الأول فقط)، ولكنها تُستخدم للأحرف المُعرَّفة من قِبل المستخدم ثنائية البايت بدلاً من تحديدها لمعيار JIS X 0212. [ 28 ] في ترميز "DEC Kanji" الأساسي، تُستخدم الصفوف الـ 31 الأولى فقط من مجموعة الرموز 3 للأحرف المُعرَّفة من قِبل المستخدم: الصفوف من 32 إلى 94 محجوزة، على غرار الصفوف غير المستخدمة في مجموعة الرموز 1. [ 29 ]

تقبل ترميز "Super DEC Kanji" رموزًا من ترميز "DEC Kanji" ومن ترميز EUC ذي التنسيق المضغوط، ليصبح المجموع خمس مجموعات رموز. [ 28 ] كما يسمح باستخدام مجموعة الرموز المُعرَّفة من قِبل المستخدم بالكامل، والصفوف غير المستخدمة في نهايتي مجموعتي رموز JIS X 0208 وJIS X 0212 (الصفوف 85-94 و78-94 على التوالي)، للأحرف المُعرَّفة من قِبل المستخدم. [ 29 ]

HP-16

تُعرّف شركة هيوليت-باكارد ترميزًا يُشار إليه باسم "HP-16". ويُصاحب هذا الترميز ترميز "HP-15"، وهو أحد أنواع ترميز Shift JIS . يقوم ترميز HP-16 بترميز JIS X 0208 باستخدام نفس البايتات المستخدمة في EUC-JP، ولكنه لا يستخدم رموز الإزاحة الفردية (وبالتالي يحذف مجموعتي الرموز 2 و3)، ويضيف ثلاث مناطق مُعرّفة من قِبل المستخدم لا تتبع بنية EUC ذات التنسيق المُضغوط: [ 28 ]

  • بايتات البداية 0xA1–C2، بايتات النهاية 0x21–7E
  • بايتات البداية 0xC3–E3، بايتات النهاية 0x21–3F
  • بايتات البداية 0xC3–E1، بايتات النهاية 0x40–64

إيكيس

يُشابه ترميز IKIS (نظام معلومات الكانجي التفاعلي) المُستخدم من قِبل شركة Data General ترميز EUC-JP بدون إزاحات فردية، أي باستخدام مجموعتي الرموز 0 و1 فقط. أما حروف الكاتاكانا ذات العرض النصفي، فتُدرج في الصف 8 من معيار JIS X 0208 (متداخلة مع أحرف رسم المربعات المُضافة إلى المعيار عام 1983). وتُستخدم الصفوف من 9 إلى 12 من معيار JIS X 0208 للأحرف المُعرّفة من قِبل المستخدم. [ 28 ] [ 29 ]

تعديلات EUC-JP لـ EBCDIC

نظام KEIS (نظام المعلومات الموسع لمعالجة الكانجي) هو ترميز EBCDIC تستخدمه شركة هيتاشي ، [ 29 ] ويتضمن أحرفًا ثنائية البايت (ترميز DBCS-Host) باستخدام تسلسلات إزاحة، مما يجعله ترميزًا ذا حالة . تحديدًا، يتحول التسلسل 0x0A 0x41إلى وضع البايت الواحد، ثم يتحول التسلسل 0x0A 0x42إلى وضع البايت المزدوج. [ ب ] مع ذلك، تُرمَّز أحرف JIS X 0208 باستخدام تسلسلات البايت نفسها المستخدمة لترميزها في EUC-JP. ينتج عن ذلك ترميزات مكررة للمساحة التصويرية - 0x4040 وفقًا لبنية رمز DBCS-Host، و0xA1A1 كما في EUC-JP. يختلف هذا عن ترميز DBCS-Host الخاص بشركة IBM للغة اليابانية، والذي يعتمد تصميمه على إصدارات تسبق JIS X 0208 تمامًا. تم توسيع نطاق البايتات الرئيسية إلى 0x59، حيث تم تخصيص البايتات الرئيسية من 0x81 إلى A0 للأحرف التي يحددها المستخدم، [ 28 ] أما الباقي فيُستخدم للأحرف التي تحددها الشركة، بما في ذلك أحرف الكانجي وغير الكانجي. [ 29 ]

JEF (ميزة المعالجة اليابانية الموسعة) [ 29 ] هو ترميز EBCDIC يُستخدم على أجهزة Fujitsu FACOM الرئيسية، على عكس FMR (أحد أنواع Shift  JIS) المستخدم على أجهزة Fujitsu الشخصية. ومثل KEIS، فإن JEF ترميز ذو حالة، حيث ينتقل إلى وضع DBCS-Host ثنائي البايت باستخدام تسلسلات إزاحة (حيث 0x29ينتقل إلى وضع أحادي البايت ثم 0x28ينتقل إلى وضع ثنائي البايت). [ 30 ] وكما هو الحال في KEIS، تُمثل رموز JIS X 0208 بنفس طريقة تمثيلها في EUC-JP. [ 28 ] يمتد نطاق البايت الرئيسي إلى 0x41، مع تخصيص 0x80–0xA0 لتعريف المستخدم؛ وتُخصص أرقام الصفوف من 101 إلى 163 للبايتات الرئيسية من 0x41 إلى 0x7F لأغراض kuten ، على الرغم من أن الصف 162 (البايت الرئيسي 0x7E) غير مستخدم. [ 28 ] [ 29 ] تُستخدم الصفوف من 101 إلى 148 للكانجي الممتد، بينما تُستخدم الصفوف من 149 إلى 163 للرموز غير الكانجي الممتدة. [ 29 ]

EUC-KR

EUC-KR هو ترميز متغير الطول لتمثيل النصوص الكورية باستخدام مجموعتين من الأحرف المشفرة، هما KS X 1001 (المعروفة سابقًا باسم KS C 5601) [ 31 ] [ 32 ] ، وإما ISO 646 :KR ( KS X 1003 ، المعروفة سابقًا باسم KS C 5636 ) أو ASCII ، وذلك حسب الإصدار. يحدد معيار KS X 2901 (المعروف سابقًا باسم KS C 5861 ) هذا الترميز، وقد أطلق عليه RFC 1557 اسم EUC-KR. 

يتم ترميز الحرف المستخرج من KS X 1001 (G1، مجموعة الترميز 1) على أنه بايتان في GR (0xA1–0xFE) ويأخذ الحرف من KS X 1003 أو ASCII (G0، مجموعة الترميز 0) بايتًا واحدًا في GL (0x21–0x7E).

يُشار إليه عادةً باسم Wansung ( بالكورية : 완성 ؛ باللاتينية : Wanseong ؛ وتعني حرفيًا " مُسبق التركيب " [ 33 ] ) في جمهورية كوريا . تشير IBM إلى مُكوّن البايت المزدوج برقم الصفحة 971 ، [ 34 ] وإلى EUC-KR مع ASCII برقم الصفحة 970. [ 35 ] [ 36 ] [ 37 ] وقد تم تنفيذه برقم الصفحة 20949 ("Wansung الكوري") [ 38 ] [ 39 ] ورقم الصفحة 51949 ("EUC الكوري") من قِبل Microsoft. [ 38 ]   

اعتبارًا من مارس 2026 أقل من 0.06% من صفحات الويب عالميًا تُعلن استخدامها لترميز EUC-KR، [ 40 ] بينما تستخدمه 3.8% من صفحات الويب في كوريا الجنوبية. [ 41 ] يُعد هذا الترميز، بما في ذلك الامتدادات، أكثر ترميز الأحرف القديمة استخدامًا في كوريا على جميع المنصات الرئيسية الثلاث ( macOS ، وأنظمة التشغيل الأخرى الشبيهة بنظام Unix، وWindows)، إلا أن استخدامه يتحول ببطء شديد إلى UTF-8 مع ازدياد شعبيته، خاصةً على Linux وmacOS.

كما هو الحال مع معظم الترميزات الأخرى، يُفضل الآن استخدام UTF-8 في الاستخدامات الجديدة، مما يحل مشاكل التناسق بين المنصات والموردين.

رمز الهانغول الموحد

يُعدّ رمز الهانغول الموحد ( 통합형 한글 코드 ؛ Tonghabhyeong Hangeul Kodeu ، [ 42 ] أو 통합 완성형 ؛ Tonghab Wansunghyung ) امتدادًا شائعًا لرمز اللغة الكورية الموحد (EUC-KR) ، وهو رمز اللغة الكورية الافتراضي في نظام التشغيل مايكروسوفت ويندوز. يُخصّص له رقم صفحة الرمز 949 من قِبل مايكروسوفت، و1261 [ 43 ] أو 1363 [ 44 ] من قِبل آي بي إم. يُذكر أن رقم صفحة الرمز 949 الخاص بآي بي إم هو امتداد مختلف وغير مرتبط برمز اللغة الكورية الموحد (EUC-KR).

يُوسّع رمز الهانغول الموحد (Unified Hangul Code) معيار EUC-KR باستخدام رموز لا تتوافق مع بنية EUC، وذلك لإضافة مقاطع صوتية إضافية، مُكملاً بذلك تغطية المقاطع الصوتية المركبة المتوفرة في Johab و Unicode. ويُدمج معيار ترميز W3C / WHATWG المُستخدم في HTML5 امتدادات رمز الهانغول الموحد في تعريفه لمعيار EUC-KR. [ 45 ]

نظام التشغيل ماك باللغة الكورية (هانغول توك)

تتضمن الترميزات الأخرى التي تستخدم ترميز EUC-KR كجزء منه، ترميز نظام التشغيل Mac OS الكوري (المعروف باسم صفحة الترميز 10003 أو x-mac-korean) [ 13 ] ، والذي استخدمه نظام HangulTalk (MacOS-KH)، وهو النسخة الكورية من نظام التشغيل Mac OS الكلاسيكي . وقد طُوّر هذا الترميز بواسطة شركة Elex Computer ( 일렉스 )، التي كانت آنذاك الموزع المعتمد لأجهزة كمبيوتر Apple Macintosh في كوريا الجنوبية. [ 46 ] [ 29 ]

يُضيف HangulTalk أحرفًا إضافيةً تبدأ بالبايتات بين 0xA1 و0xAD، سواءً في المساحة غير المستخدمة ضمن مستوى EUC-KR GR (البايتات اللاحقة 0xA1 0xFE)، أو باستخدام رموز غير EUC خارجه (البايتات اللاحقة 0x41 – 0xA0). بعض هذه الأحرف عبارة عن رموز زخرفية مُنمّقة لا تعتمد على نمط الخط . [ 29 ] لا يمتلك العديد من هذه الأحرف تطابقًا دقيقًا مع رموز Unicode، ولذلك يقوم برنامج Apple بربط هذه الحالات بطرق مختلفة ، إما بتسلسلات مُدمجة ، أو بتطابقات تقريبية مع إضافة حرف خاص كمُعدِّل لأغراض النقل، أو بأحرف خاصة. [ 47 ]

تستخدم Apple أيضًا بعض الرموز أحادية البايت خارج نطاق EUC-KR لأحرف إضافية: 0x80 للمسافة المطلوبة ، و0x81 لعلامة الـ ₩ ، و0x82 لعلامة الشرطة المتوسطة ( )، و0x83 لعلامة حقوق النشر ( © )، و0x84 لعلامة الشرطة السفلية العريضة ( _ )، و0xFF لعلامة الحذف (...). [ 47 ] على الرغم من أن أيًا من هذه الرموز الإضافية أحادية البايت لا يقع ضمن نطاق البايت الرئيسي لـ EUC-KR (على عكس امتدادات Apple لـ EUC-CN، انظر أعلاه )، إلا أن بعضها يقع ضمن نطاق البايت الرئيسي لرمز الهانغول الموحد (وتحديدًا، 0x81 و0x82 و0x83 و0x84).

EUC-KP

على غرار معيار KS X 1001، يُستخدم معيار KPS 9566 الكوري الشمالي عادةً بصيغة EUC؛ وفي هذه السياقات، يُشار إليه أحيانًا باسم EUC-KP. [ 48 ] وتُوسّع الإصدارات الأحدث من المعيار تمثيل EUC ليشمل أحرفًا تستخدم رموزًا ثنائية البايت غير EUC، على غرار رمز الهانغول الموحد. [ 49 ]

EUC-TH

على الرغم من أن بعض ترميزات البايت الواحد، مثل سلسلة ISO/IEC 8859، تتوافق تقنيًا مع بنية EUC، إلا أنها نادرًا ما تُصنّف على أنها EUC. ومع ذلك، eucTHيُستخدم هذا التصنيف في نظام Solaris كعلامة لـ TIS-620 . [ 50 ]

EUC-TW

EUC-TW هو ترميز متغير الطول يدعم ASCII و16 مستوى من CNS 11643 ، كل منها بحجم 94×94 بكسل. وهو ترميز نادر الاستخدام للأحرف الصينية التقليدية المستخدمة في تايوان . تُعدّ متغيرات Big5 أكثر شيوعًا من EUC-TW، مع العلم أن Big5 يُرمّز فقط المستويين الأولين من أحرف CNS 11643  ، بينما يزداد استخدام UTF-8 .

  • باعتبارها ترميز EUC/ ISO 2022 ، يتم ترميز أحرف التحكم C0 ومسافة ASCII وDEL كما هو الحال في ASCII.
  • يتم ترميز الحرف الرسومي من ASCII (G0، مجموعة الرموز 0) في GL كتمثيله المعتاد أحادي البايت (0x21–0x7E).
  • يتم ترميز حرف من CNS 11643 المستوى 1 (مجموعة الرموز 1) على شكل بايتين في GR (0xA1–0xFE).
  • يتم ترميز حرف في المستويات من 1 إلى 16 من CNS 11643 (مجموعة الرموز 2) على شكل أربعة بايتات:
    • البايت الأول دائمًا هو 0x8E (إزاحة واحدة 2).
    • يشير البايت الثاني (0xA1–0xB0) إلى المستوى، ويتم الحصول على رقمه عن طريق طرح 0xA0 من ذلك البايت.
    • البايت الثالث والرابع موجودان في GR (0xA1–0xFE).

لاحظ أن المستوى 1 من CNS 11643 مشفر مرتين كمجموعة رموز 1 وجزء من مجموعة الرموز 2.

انظر أيضاً

ملحوظات

  1. تتضمنإصدارات رمز ISO 2022 ذات 7 بت التي تدعم GB 2312 كلاً من ISO-2022-CN (مع رموز الإزاحة) و ISO-2022-JP-2 (بدون رموز الإزاحة)، وكلاهما يدعم أيضًا مجموعات أخرى غير ASCII.
  2. تتطابق هذه المتتاليات مع الأشكال السداسية العشرية التي عرضها DEC [ 30 ] والأشكال العشرية (10 65و10 66) التي أدرجها لوندي. [ 28 ] يسرد لوندي الأشكال السداسية العشرية لكليهما على أنها0xA0 0x42، على ما يبدو عن طريق الخطأ.

مراجع

  1. 1 2 3 4 IBM . "Charter Data Representation Architecture (CDRA)" . IBM . ص 157-162 . 
  2. 1 2 3 لوندي، كين (2008). معالجة المعلومات CJKV: الحوسبة الصينية واليابانية والكورية والفيتنامية . أورايلي. ص 242-244 . ISBN  9780596800925.
  3. "مجموعات الأحرف" . IANA.
  4. "4.2. الأسماء والتسميات" . معيار الترميز . WHATWG.
  5. ^ تشو، هايفنغ؛ هو، داويوان؛ وانغ، تشيغوان. كاو، تيان تشيو؛ تشانغ، ون تشونغ. كريسبين، مارك (مارس 1996). ترميز الأحرف الصينية لرسائل الإنترنت . مجموعة عمل الشبكة. دوى : 10.17487/RFC1922 . آر إف سي 1922 .معلوماتي. القسم 2.1: CN-GB).
  6. 1 2 3 4 "خريطة (نسخة خارجية) من ترميز نظام التشغيل Mac OS الصيني المبسط إلى Unicode 3.0 والإصدارات الأحدث" . شركة Apple, Inc.
  7. "بيانات S-Ch PC المختلطة (IBM GB) بما في ذلك 1880 حرفًا من رموز UDC، و31 حرفًا من رموز IBM المختارة، و5 أحرف من رموز SAA SB" . عولمة IBM: معرّفات مجموعات الأحرف المشفرة . IBM . مؤرشف من الأصل بتاريخ 26-03-2016.
  8. "مجموعة الأحرف الرسومية الصينية المبسطة من IBM" (ملف PDF) . IBM . 1993. CH 3-3220-130 1993-11.
  9. "CCSID 1383: مجموعة S-Ch EUC G0، مجموعة ASCII G1، مجموعة GB 2312-80 (1382)" . عولمة IBM: معرّفات مجموعات الأحرف المشفرة . IBM . مؤرشف من الأصل بتاريخ 28-03-2016.
  10. "مجموعة الأحرف الرسومية الصينية المبسطة من IBM لرمز UNIX الموسع (EUC)" (ملف PDF) . IBM . 1994. CH 3-3220-132 1994-06.
  11. "CCSID 5479: مجموعة S-Ch EUC G0، مجموعة ASCII G1، مجموعة GB 2312-80 (5478)" . عولمة IBM: معرّفات مجموعات الأحرف المشفرة . IBM . مؤرشف من الأصل بتاريخ 27-03-2016.
  12. "CCSID 9574: مجموعة S-Ch DBCS PC GB 2312-80، باستثناء 31 حرفًا مختارة من IBM و1360 حرفًا من UDC. يُستخدم أيضًا في T-Ch 2022-CN TCP" . عولمة IBM: معرّفات مجموعات الأحرف المشفرة . IBM . مؤرشف من الأصل بتاريخ 27-03-2016.
  13. 1 2 "خاصية Encoding.WindowsCodePage - إطار عمل .NET (الإصدار الحالي)" . MSDN . مايكروسوفت.
  14. ^ لوند ، كين (1998). “معالجة معلومات CJKV”. الملحق و: GB/T 12345 (PDF) . أورايلي وسائل الإعلام . رقم ISBN 9781565922242.
  15. إدارة التقييس الصينية (SAC) (18-11-2005). GB 18030-2005: تكنولوجيا المعلومات - مجموعة الأحرف المشفرة الصينية .
  16. "الاتجاهات التاريخية في استخدام ترميز الأحرف للمواقع الإلكترونية" . W3Techs.
  17. "توزيع ترميزات الأحرف بين المواقع الإلكترونية التي تستخدم اللغة اليابانية" . w3techs.com . تم الاطلاع عليه بتاريخ 2026-02-08 .
  18. "وثيقة معلومات CCSID 954" . مؤرشفة من الأصل بتاريخ 27-03-2016.
  19. المكونات الدولية لليونيكود (ICU)، ibm-954_P101-2007.ucm ، 2002-12-03
  20. 1 2 3 4 "جداول ربط رموز JIS X 0213" . x0213.org.
  21. "الغموض في التحويل من ترميز EUC الياباني إلى يونيكود (غير معياري)" . ملف تعريف XML الياباني . W3C.
  22. "مفكك ترميز EUC-JP" . معيار الترميز . WHATWG."إذا كان البايت بايت ASCII، فأرجع نقطة رمزية قيمتها بايت."
  23. "3.1.1 تفاصيل المشاكل" . مشاكل وحلول لأحرف يونيكود والأحرف المُعرَّفة من قِبل المستخدم/المورِّد . مجموعة أوبن جروب اليابان. مؤرشف من الأصل بتاريخ 3 فبراير 1999. تم الاطلاع عليه بتاريخ 14 أغسطس 2019 .
  24. كابلان، مايكل س. (2005-09-17). "متى لا تكون الشرطة المائلة شرطة مائلة؟" .
  25. 1 2 "4.2 عملية مراجعة قواعد تحويل مجموعة الرموز بين eucJP-open وUCS" . مشاكل وحلول لليونيكود والأحرف المُعرَّفة من قِبل المستخدم/المورِّد . مجموعة Open Group Japan. مؤرشف من الأصل في 3 فبراير 1999. تم الاطلاع عليه في 14 أغسطس 2019 .
  26. 1 2 لوندي، كين (13 يناير 2009). "الملحق ي: مجموعات الأحرف اليابانية" (ملف PDF) . معالجة معلومات CJKV ( الطبعة الثانية). ISBN  978-0-596-51447-1.
  27. 1 2 تشانغ، هيشيك (8 ديسمبر 2021). "ملف تعليمات لبرامج ترميز CJK" . سي بايثون . مؤسسة برمجيات بايثون.
  28. 1 2 3 4 5 6 7 8 9 لوندي، كين (13 يناير 2009). "الملحق F: طرق ترميز الموردين" (ملف PDF) . معالجة المعلومات CJKV ( الطبعة الثانية). ISBN  978-0-596-51447-1.
  29. 1 2 3 4 5 6 7 8 9 10 لوندي، كين (2009). "الملحق هـ: معايير مجموعة الأحرف الخاصة بالبائعين" (ملف PDF) . معالجة المعلومات CJKV: الحوسبة الصينية واليابانية والكورية والفيتنامية ( الطبعة الثانية). سيباستوبول، كاليفورنيا : أورايلي . ISBN  978-0-596-51447-1.
  30. 1 2 "2: مجموعات الرموز وتحويل مجموعات الرموز" . مرجع تقني لنظام ديجيتال يونكس لاستخدام الميزات اليابانية . شركة ديجيتال إكويبمنت ، كومباك .
  31. "KS X 1001:1992" (PDF) .
  32. هيئة المواصفات الكورية (1988-10-01). KS C 5601:1987 (PDF) . ITSCJ/ IPSJ . ISO-IR -149.
  33. لوندي، كين (2009). "الفصل 3: معايير مجموعة الأحرف" . معالجة معلومات لغات CJKV . دار نشر أورايلي ميديا، ص 146. ISBN  978-0596514471.
  34. "عولمة IBM - معرّفات مجموعة الأحرف المشفرة - CCSID 971" . مؤرشف من الأصل بتاريخ 30 نوفمبر 2014. تم الاطلاع عليه بتاريخ 3 سبتمبر 2021 .
  35. "CCSID 970" . عولمة IBM . IBM. مؤرشف من الأصل بتاريخ 2014-12-01.
  36. "ibm-970_P110_P110-2006_U2 (الاسم المستعار euc-kr)" . برنامج Converter Explorer - عرض توضيحي لوحدة التحكم المتكاملة (ICU) . المكونات الدولية لليونيكود.
  37. المكونات الدولية لليونيكود (ICU)، ibm-970_P110_P110-2006_U2.ucm ، 2002-12-03
  38. 1 2 "معرفات صفحة الترميز" . مركز مطوري ويندوز. مايكروسوفت. 7 يناير 2021.
  39. جوليارد، ألكسندر (11 مارس 2021). "dump_krwansung_codepage: إنشاء جدول Wansung الكوري من ملف KSX1001" . make_unicode: إنشاء ملفات .c لصفحة الترميز من أوصاف ftp.unicode.org . مشروع Wine .
  40. "إحصائيات الاستخدام وحصة السوق لـ EUC-KR للمواقع الإلكترونية، مارس 2025" . w3techs.com . تاريخ الاسترجاع: 9 يوليو 2025 .
  41. "توزيع ترميزات الأحرف بين المواقع الإلكترونية التي تستخدم نطاق .kr" . w3techs.com . تم الاطلاع عليه بتاريخ 2026-03-02 .
  42. ^ “한글 코드에 대하여” (في الكورية). W3C. مؤرشفة من الأصلي بتاريخ 24-05-2013 . تم الاسترجاع 2019-01-07 .
  43. في ucnv_lmb.cpp ، وهو ملف صادر من IBM ومضمن في شجرة مصدر المكونات الدولية لـ Unicode ، تم التعليق على البايت الرئيسي 0x11 على أنه يشير إلى "Korean: ibm-1261" بعد تعريفULMBCS_GRP_KO، ويتم تعيينه إلى"windows-949"برنامج الترميز ICU فيOptGroupByteToCPNameالمصفوفة لاحقًا في الملف.
  44. "معرفات مجموعة الأحرف المشفرة - CCSID 1363" ، قسم العولمة في شركة IBM ، IBM، مؤرشف من الأصل بتاريخ 29 نوفمبر 2014
  45. ^ "5. الفهارس (§ فهرس EUC-KR)" ، معيار الترميز ، WHATWG
  46. جيل، هوجين. "HangulTalk: بيئة Hangul القياسية الفعلية لنظام Mac" . دليل استخدام Hangul على نظام Macintosh .
  47. 1 2 أبل (2005-04-05). "خريطة (نسخة خارجية) من ترميز اللغة الكورية لنظام التشغيل ماك إلى يونيكود 3.2 والإصدارات الأحدث" . اتحاد يونيكود .
  48. كيم، كيونغسوك (30-11-2002). "جداول مرجعية ثلاثية الاتجاهات - KS X 1001، KPS 9566، وUCS" (ملف PDF) . ISO/IEC JTC 1/SC 2 /WG 2 N2564.[ملاحظة: تم تحديث روابط الجداول المرفقة بالوثيقة:]
  49. تشونغ، جايمين (2018-01-05). "معلومات عن أحدث إصدار من KPS 9566 (KPS 9566-2011؟)" (ملف PDF) . UTC L2/18-011.
  50. IBM (2001-05-07). "solaris-eucTH-2.7" . icu-data . اتحاد يونيكود / المكونات الدولية ليونيكود .