UTF-EBCDIC

يُعدّ UTF-EBCDIC ترميزًا للأحرف قادرًا على ترميز جميع نقاط ترميز الأحرف الصالحة البالغ عددها 1,112,064 في يونيكود باستخدام 1 إلى 5 بايتات (مقارنةً بـ 4 بايتات كحد أقصى في UTF-8 ). [ 1 ] وهو مصمم ليكون متوافقًا مع EBCDIC ، بحيث يمكن لتطبيقات EBCDIC القديمة على الحواسيب المركزية معالجة الأحرف بسهولة. وتتشابه مزاياه للأنظمة الحالية القائمة على EBCDIC مع مزايا UTF-8 للأنظمة الحالية القائمة على ASCII . تُفصّل المعلومات المتعلقة بـ UTF-EBCDIC في التقرير الفني رقم 16 من يونيكود.

لإنتاج نسخة مشفرة بنظام UTF-EBCDIC لسلسلة من نقاط ترميز Unicode، يُطبَّق أولًا ترميز قائم على UTF-8 (يُعرف في المواصفات باسم UTF-8-Mod) (مما يُنشئ ما يُسمى في المواصفات بتسلسل I8). يتمثل الاختلاف الرئيسي بين هذا الترميز وUTF-8 في أنه يسمح بتمثيل نقاط ترميز Unicode من U+0080 إلى U+009F ( رموز التحكم C1 ) كبايت واحد، وبالتالي ربطها لاحقًا برموز التحكم EBCDIC المقابلة. ولتحقيق ذلك، يستخدم UTF-8-Mod التنسيق 101xxxxx بدلًا من 10xxxxxx كبايتات لاحقة في تسلسل متعدد البايتات. ولأن هذا التنسيق لا يستوعب سوى 5 بتات بدلًا من 6، فإن ترميز UTF-8-Mod لنقاط الترميز التي تزيد عن U+03FF يكون أكبر من ترميز UTF-8.

يُبقي تحويل UTF-8-Mod البيانات بتنسيق ASCII (على سبيل المثال، لا يزال U+0041 "A" مُشفّرًا كـ 0x41 )، لذا يُمرّر كل بايت عبر جدول بحث عكسي (واحد لواحد) لإنتاج ترميز UTF-EBCDIC النهائي. على سبيل المثال، يُقابل 0x41 في هذا الجدول 0xC1 ؛ وبالتالي فإن ترميز UTF-EBCDIC لـ U+0041 (حرف "A" في Unicode) هو 0xC1 (حرف "A" في EBCDIC).

نادرًا ما يُستخدم ترميز UTF-EBCDIC، حتى على الحواسيب المركزية التي تعتمد على ترميز EBCDIC والتي صُمم من أجلها. عادةً ما تستخدم أنظمة تشغيل الحواسيب المركزية من IBM ، مثل z/OS ، ترميز UTF-16 لدعم كامل لترميز Unicode. على سبيل المثال، يدعم كل من IBM Db2 و COBOL و PL/I و Java ومجموعة أدوات IBM XML ترميز UTF-16 على الحواسيب المركزية من IBM.

تخطيط صفحة التعليمات البرمجية

يحتوي ترميز UTF-EBCDIC على 160 حرفًا بترميز أحادي البايت (مقارنةً بـ 128 حرفًا في UTF-8). وكما هو واضح، فإن الجزء أحادي البايت مشابه لترميز IBM-1047 وليس IBM-37 نظرًا لموقع الأقواس المربعة. يحتوي ترميز CCSID 37 على الأقواس المربعة [] في الموضعين BA وBB بالنظام الست عشري، بدلًا من الموضعين AD وBD على التوالي.

UTF-EBCDIC
0123456789أبجدهـF
0xنولSOHSTXETXشارعHTإدارة الضمان الاجتماعيدلوكالة حماية البيئةرود آيلاندSS2فيرمونتFFCRلذاSI
1xDLEDC1DC2دي سي 3OSCLFبكالوريوس العلوموكالة الفضاء الأوروبيةيستطيعEMPU2SS3FSجي إسآر إسنحن
2xوسادةهوبتضخم البروستاتا الحميدإن بي إتشالهندنيلETBخروجHTSHTJVTSPLDPLUENQإقراربل
3xDCSPU1سينSTSسي سي إتشMWمنتجع صحينهاية الوقتنداء استغاثةSGCIالعلومسي إس آيدي سي 4ناكمساءًفرعي
4x إس بي .<(+|
5xو!دولار*);^
6x-/،%_>؟
7x22222`:8@'="
8x2أبجدهـوزحأنا222222
9x2جكلمنoصqر222222
الفأس2~sتuvwxyz222[22
Bx2222222333333]33
Cx{أبجدهـFجيحأنا333333
التشخيص}جكلمشمالياPسؤالR334444
السابق\4SتييوVدبليوXYZ44455
مؤثرات صوتية0123456789شركة APC
  بايتات البداية لتسلسل من هذا العدد من البايتات. تعرض تلميحة الأداة أدنى نقطة ترميز مُشفّرة باستخدام بايت البداية هذا.
  بايت البداية حيث لا تكون جميع تركيبات بايتات الاستمرار صالحة، إما لأنه شكل طويل جدًا غير صالح (تظهر تلميحات الأدوات نقطة الترميز لأول تسلسل صالح)، أو لأنه يشفر نقطة ترميز أكبر من U+10FFFF.
  بايتات الاستمرار. تُظهر تلميحات الأدوات القيمة السداسية العشرية للبتات الخمسة التي يتم جمعها.
  غير مستخدمة، بما في ذلك البايتات الأولية التي لا يمكنها إلا بدء شكل طويل غير صالح. على سبيل المثال، 0x76، لأنه حتى 0x76 0x73 (الذي يُطابق تسلسل UTF-8-Mod 0xC2 0xBF) سيكون مجرد ترميز طويل لـ U+005F (المُرمّز بشكل صحيح كـ UTF-8-Mod 0x5F، UTF-EBCDIC 0x6D).

أوراكل يو تي إف إي

يُعدّ Oracle UTFE أحد أنواع ترميز UTF-8 لقواعد بيانات Oracle ، وهو متوافق مع Unicode 3.0 ، ويشبه ترميز CESU-8 من UTF-8، حيث تُرمّز الأحرف الإضافية كحرفين من 4 بايت بدلاً من حرف واحد من 4 أو 5 بايت. ويُستخدم هذا الترميز فقط على منصات EBCDIC. [ 2 ]

انظر أيضاً

مراجع

  1. "UTR #16: UTF-EBCDIC" . www.unicode.org . تم الاطلاع عليه بتاريخ 23 فبراير 2021. يجب البحث في اتجاه عكسي بحد أقصى خمسة بايتات (سبعة بايتات إذا تم اعتبار النطاق الكامل المكون من 31 بت من معيار ISO/IEC 10646).
  2. بيرد، كاثي؛ تشيبا، دان؛ تشو، وينسون؛ فان، جيسيكا؛ هو، كلير؛ لو، سيمون؛ لي، جيف؛ لينسلي، بيتر؛ ماتسودا، كيني؛ أوسكروفت، تامزين؛ تاكيدا، شيغي؛ تاناكا، لينوس؛ توزوا، ماكوتو؛ تروت، باري؛ تسوجيموتو، مايومي؛ وو، يينغ؛ ياو، مايكل؛ يو، تيم؛ وانغ، تشاو؛ وونغ، سيمون؛ تشانغ، ويران؛ تشنغ، لي؛ تشو، يان؛ مور، فاليري (2002) [1996]. "الملحق أ: بيانات اللغة". دليل دعم تدويل قاعدة بيانات Oracle9i (ملف PDF) (الإصدار 2 (9.2) ). شركة أوراكل . Oracle A96529-01. مؤرشف (ملف PDF) من الأصل بتاريخ 14 فبراير 2017. تم الاسترجاع بتاريخ 14 فبراير 2017 .