UTF-EBCDIC
يُعدّ UTF-EBCDIC ترميزًا للأحرف قادرًا على ترميز جميع نقاط ترميز الأحرف الصالحة البالغ عددها 1,112,064 في يونيكود باستخدام 1 إلى 5 بايتات (مقارنةً بـ 4 بايتات كحد أقصى في UTF-8 ). [ 1 ] وهو مصمم ليكون متوافقًا مع EBCDIC ، بحيث يمكن لتطبيقات EBCDIC القديمة على الحواسيب المركزية معالجة الأحرف بسهولة. وتتشابه مزاياه للأنظمة الحالية القائمة على EBCDIC مع مزايا UTF-8 للأنظمة الحالية القائمة على ASCII . تُفصّل المعلومات المتعلقة بـ UTF-EBCDIC في التقرير الفني رقم 16 من يونيكود.
لإنتاج نسخة مشفرة بنظام UTF-EBCDIC لسلسلة من نقاط ترميز Unicode، يُطبَّق أولًا ترميز قائم على UTF-8 (يُعرف في المواصفات باسم UTF-8-Mod) (مما يُنشئ ما يُسمى في المواصفات بتسلسل I8). يتمثل الاختلاف الرئيسي بين هذا الترميز وUTF-8 في أنه يسمح بتمثيل نقاط ترميز Unicode من U+0080 إلى U+009F ( رموز التحكم C1 ) كبايت واحد، وبالتالي ربطها لاحقًا برموز التحكم EBCDIC المقابلة. ولتحقيق ذلك، يستخدم UTF-8-Mod التنسيق 101xxxxx بدلًا من 10xxxxxx كبايتات لاحقة في تسلسل متعدد البايتات. ولأن هذا التنسيق لا يستوعب سوى 5 بتات بدلًا من 6، فإن ترميز UTF-8-Mod لنقاط الترميز التي تزيد عن U+03FF يكون أكبر من ترميز UTF-8.
يُبقي تحويل UTF-8-Mod البيانات بتنسيق ASCII (على سبيل المثال، لا يزال U+0041 "A" مُشفّرًا كـ 0x41 )، لذا يُمرّر كل بايت عبر جدول بحث عكسي (واحد لواحد) لإنتاج ترميز UTF-EBCDIC النهائي. على سبيل المثال، يُقابل 0x41 في هذا الجدول 0xC1 ؛ وبالتالي فإن ترميز UTF-EBCDIC لـ U+0041 (حرف "A" في Unicode) هو 0xC1 (حرف "A" في EBCDIC).
نادرًا ما يُستخدم ترميز UTF-EBCDIC، حتى على الحواسيب المركزية التي تعتمد على ترميز EBCDIC والتي صُمم من أجلها. عادةً ما تستخدم أنظمة تشغيل الحواسيب المركزية من IBM ، مثل z/OS ، ترميز UTF-16 لدعم كامل لترميز Unicode. على سبيل المثال، يدعم كل من IBM Db2 و COBOL و PL/I و Java ومجموعة أدوات IBM XML ترميز UTF-16 على الحواسيب المركزية من IBM.
تخطيط صفحة التعليمات البرمجية
يحتوي ترميز UTF-EBCDIC على 160 حرفًا بترميز أحادي البايت (مقارنةً بـ 128 حرفًا في UTF-8). وكما هو واضح، فإن الجزء أحادي البايت مشابه لترميز IBM-1047 وليس IBM-37 نظرًا لموقع الأقواس المربعة. يحتوي ترميز CCSID 37 على الأقواس المربعة [] في الموضعين BA وBB بالنظام الست عشري، بدلًا من الموضعين AD وBD على التوالي.
| 0 | 1 | 2 | 3 | 4 | 5 | 6 | 7 | 8 | 9 | أ | ب | ج | د | هـ | F | |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 0x | نول | SOH | STX | ETX | شارع | HT | إدارة الضمان الاجتماعي | دل | وكالة حماية البيئة | رود آيلاند | SS2 | فيرمونت | FF | CR | لذا | SI |
| 1x | DLE | DC1 | DC2 | دي سي 3 | OSC | LF | بكالوريوس العلوم | وكالة الفضاء الأوروبية | يستطيع | EM | PU2 | SS3 | FS | جي إس | آر إس | نحن |
| 2x | وسادة | هوب | تضخم البروستاتا الحميد | إن بي إتش | الهند | نيل | ETB | خروج | HTS | HTJ | VTS | PLD | PLU | ENQ | إقرار | بل |
| 3x | DCS | PU1 | سين | STS | سي سي إتش | MW | منتجع صحي | نهاية الوقت | نداء استغاثة | SGCI | العلوم | سي إس آي | دي سي 4 | ناك | مساءً | فرعي |
| 4x | إس بي | • | • | • | • | • | • | • | • | • | • | . | < | ( | + | | |
| 5x | و | • | • | • | • | • | • | • | • | • | ! | دولار | * | ) | ; | ^ |
| 6x | - | / | • | • | • | • | • | • | • | • | • | ، | % | _ | > | ؟ |
| 7x | • | • | • | • | 2 | 2 | 2 | 2 | 2 | ` | : | 8 | @ | ' | = | " |
| 8x | 2 | أ | ب | ج | د | هـ | و | ز | ح | أنا | 2 | 2 | 2 | 2 | 2 | 2 |
| 9x | 2 | ج | ك | ل | م | ن | o | ص | q | ر | 2 | 2 | 2 | 2 | 2 | 2 |
| الفأس | 2 | ~ | s | ت | u | v | w | x | y | z | 2 | 2 | 2 | [ | 2 | 2 |
| Bx | 2 | 2 | 2 | 2 | 2 | 2 | 2 | 3 | 3 | 3 | 3 | 3 | 3 | ] | 3 | 3 |
| Cx | { | أ | ب | ج | د | هـ | F | جي | ح | أنا | 3 | 3 | 3 | 3 | 3 | 3 |
| التشخيص | } | ج | ك | ل | م | شمال | يا | P | سؤال | R | 3 | 3 | 4 | 4 | 4 | 4 |
| السابق | \ | 4 | S | تي | يو | V | دبليو | X | Y | Z | 4 | 4 | 4 | 5 | 5 | |
| مؤثرات صوتية | 0 | 1 | 2 | 3 | 4 | 5 | 6 | 7 | 8 | 9 | شركة APC |
أوراكل يو تي إف إي
يُعدّ Oracle UTFE أحد أنواع ترميز UTF-8 لقواعد بيانات Oracle ، وهو متوافق مع Unicode 3.0 ، ويشبه ترميز CESU-8 من UTF-8، حيث تُرمّز الأحرف الإضافية كحرفين من 4 بايت بدلاً من حرف واحد من 4 أو 5 بايت. ويُستخدم هذا الترميز فقط على منصات EBCDIC. [ 2 ]
انظر أيضاً
مراجع
- ↑ "UTR #16: UTF-EBCDIC" . www.unicode.org . تم الاطلاع عليه بتاريخ 23 فبراير 2021.
يجب البحث في اتجاه عكسي بحد أقصى خمسة بايتات (سبعة بايتات إذا تم اعتبار النطاق الكامل المكون من 31 بت من معيار ISO/IEC 10646).
- ↑ بيرد، كاثي؛ تشيبا، دان؛ تشو، وينسون؛ فان، جيسيكا؛ هو، كلير؛ لو، سيمون؛ لي، جيف؛ لينسلي، بيتر؛ ماتسودا، كيني؛ أوسكروفت، تامزين؛ تاكيدا، شيغي؛ تاناكا، لينوس؛ توزوا، ماكوتو؛ تروت، باري؛ تسوجيموتو، مايومي؛ وو، يينغ؛ ياو، مايكل؛ يو، تيم؛ وانغ، تشاو؛ وونغ، سيمون؛ تشانغ، ويران؛ تشنغ، لي؛ تشو، يان؛ مور، فاليري (2002) [1996]. "الملحق أ: بيانات اللغة". دليل دعم تدويل قاعدة بيانات Oracle9i (ملف PDF) (الإصدار 2 (9.2) ). شركة أوراكل . Oracle A96529-01. مؤرشف (ملف PDF) من الأصل بتاريخ 14 فبراير 2017. تم الاسترجاع بتاريخ 14 فبراير 2017 .
روابط خارجية
- VS Umamaheswaran، التقرير الفني رقم 16 من Unicode: تعريف UTF-EBCDIC (2002-04-16)
- ترميز الأحرف
- تنسيقات تحويل يونيكود
