أحرف التوافق مع يونيكود

في نظام يونيكود ومجموعة الأحرف العالمية ، يُعرَّف حرف التوافق بأنه حرف مُشفَّر حصراً للحفاظ على إمكانية التحويل المتبادل مع معايير أخرى، غالباً ما تكون أقدم. [ 1 ] وفقاً لمسرد مصطلحات يونيكود:

حرف ما كان ليتم ترميزه لولا التوافق وإمكانية التحويل ذهابًا وإيابًا مع المعايير الأخرى. [ 2 ]

على الرغم من ظهور مصطلح التوافق في أسماء الأحرف، إلا أنه لا يُعرَّف كخاصية مستقلة للأحرف. في الواقع، التعريف أكثر تعقيدًا. إحدى الخصائص التي يُحددها اتحاد يونيكود للأحرف هي التفكيك ، بما في ذلك تفكيك التوافق . أكثر من خمسة آلاف حرف لها خريطة تفكيك توافق تربط حرف التوافق بحرف واحد أو أكثر من أحرف نظام يونيكود. من خلال تحديد تفكيك توافق لحرف ما، يُصنِّفه يونيكود فعليًا كحرف توافق.

تختلف أسباب تحديد حالة التوافق، وسنناقشها بمزيد من التفصيل لاحقًا. قد يكون مصطلح "التفكيك" مُربكًا، لأنه في بعض الحالات يتكون تفكيك الحرف من حرف واحد فقط. في هذه الحالات، يربط التفكيك حرفًا بآخر مكافئ له تقريبًا، ولكن ليس بالضرورة بشكل قاطع.

أنواع الأحرف والكلمات الرئيسية المتوافقة

تتضمن خاصية تحليل التوافق لأحرف التوافق الـ 5402 في يونيكود كلمة مفتاحية تُقسّم هذه الأحرف إلى 17 مجموعة منطقية. تُسمى الأحرف التي لها تحليل توافق ولكن بدون كلمة مفتاحية بالأحرف القابلة للتحليل بشكل أساسي، بينما لا تُعتبر أحرف توافق . تشمل الكلمات المفتاحية للأحرف القابلة للتحليل : و ...initialmedialfinalisolatedwidenarrowsmallsquareverticalcirclenoBreakfractionsubsupercompat

  1. الأحرف المقابلة لأشكال الرسوميات البديلة المتعددة وعلامات التشكيل المركبة مسبقًا لدعم تطبيقات البرامج والخطوط التي لا تتضمن إمكانيات تخطيط نص Unicode كاملة.
  2. الأحرف المضمنة من مجموعات أحرف أخرى أو المضافة بطريقة أخرى إلى نظام الأحرف الموحد (UCS) والتي تشكل نصًا منسقًا بدلاً من أهداف النص العادي لنظام Unicode.
  3. بعض الشخصيات الأخرى التي تختلف دلالياً، ولكنها متشابهة بصرياً .

نظرًا لأن هذه الأحرف المتميزة دلاليًا قد تُعرض برموز مشابهة لرموز أحرف أخرى، ينبغي لبرامج معالجة النصوص أن تسعى إلى معالجة أي لبس محتمل لصالح المستخدمين. عند مقارنة وترتيب (فرز) سلاسل النصوص، يجب ألا تؤثر الأشكال المختلفة وأنواع النصوص المنسقة للأحرف على نتائج معالجة النصوص. على سبيل المثال، قد يشعر مستخدمو البرامج بالحيرة عند البحث عن الحرف اللاتيني الكبير I في صفحة ما ، بينما يفشل تطبيقهم في العثور على الرقم الروماني المشابه له بصريًا .

أنواع خرائط التوافق

استبدال الرموز وتكوينها

بعض أحرف التوافق غير ضرورية تمامًا لبرامج معالجة النصوص وعرضها التي تتوافق مع معيار يونيكود. وتشمل هذه الأحرف ما يلي:

أربطة
كانت الأحرف المركبة، مثل حرف ffi في الأبجدية اللاتينية، تُشفّر غالبًا كحرف منفصل في مجموعات الأحرف القديمة. أما في يونيكود، فيتم التعامل مع الأحرف المركبة كنص منسق، وفي حال تفعيل هذه الخاصية، يتم التعامل معها من خلال استبدال الرسوم.
الأرقام الرومانية المركبة مسبقًا
على سبيل المثال، يمكن تحليل الرقم الروماني 12 (U+216B Ⅻ) إلى الرقم الروماني 10 ( U+2169 Ⅹ) ورقمين رومانيين 1 (U+2160 Ⅰ) . توجد الأحرف المركبة مسبقًا في قسم " أشكال الأرقام" .
الكسور المركبة مسبقًا
تحتوي هذه التفكيكات على الكلمة المفتاحية <fraction> . يجب على معالج النصوص المتوافق تمامًا [ 3 ] عرض U+00BC ¼ VULGAR FRACTION ONE QUARTER بشكل مطابق للكسر المركب 1⁄4 (الرقم 1 مع U+2044 FRACTION SLASH والرقم 4). توجد الأحرف المركبة مسبقًا في كتلة Number Forms .
الرموز أو الأشكال السياقية
تظهر هذه المشكلات بشكل أساسي في الكتابة العربية. باستخدام خطوط تدعم استبدال الرموز، مثل OpenType و TrueTypeGX ، يمكن للبرامج المتوافقة مع Unicode استبدال الرموز المناسبة للحرف نفسه، وذلك بحسب موقعه في الكلمة، سواءً في بدايتها أو نهايتها أو وسطها، أو عند ظهوره منفردًا. يُعدّ استبدال الرموز ضروريًا أيضًا لتنسيق النصوص الرأسي (من أعلى إلى أسفل) في بعض لغات شرق آسيا. في هذه الحالة، يجب استبدال الرموز أو توليدها بأشكال عريضة وضيقة وصغيرة ومربعة. أما البرامج غير المتوافقة، أو البرامج التي تستخدم مجموعات رموز أخرى، فتستخدم رموزًا منفصلة متعددة للحرف نفسه، بحسب موقعه، مما يزيد من تعقيد معالجة النصوص.

توفر خصائص أحرف يونيكود وخوارزمياتها، بالإضافة إلى نظام الإحداثيات الموحد (UCS)، كل ما يلزم لتطبيقات البرامج لعرض هذه الأحرف بشكل صحيح انطلاقًا من مكافئاتها المُجزأة. ولذلك، تصبح أحرف التوافق القابلة للتجزئة زائدة عن الحاجة. ويتطلب وجودها في مجموعة الأحرف معالجة نصية إضافية لضمان مقارنة النص وترتيبه بشكل صحيح (انظر توحيد يونيكود ). علاوة على ذلك، لا تُضيف أحرف التوافق هذه أي دلالات إضافية أو مميزة. كما أنها لا تُقدم أي عرض بصري مميز، شريطة أن يكون تخطيط النص والخطوط متوافقين مع يونيكود. كذلك، لا حاجة لأي من هذه الأحرف للتحويل ذهابًا وإيابًا إلى مجموعات أحرف أخرى، حيث يمكن للترجمة الصوتية بسهولة ربط الأحرف المُجزأة بنظائرها المُركبة مسبقًا في مجموعة أحرف أخرى. وبالمثل، يمكن ربط الأشكال السياقية، مثل الحرف العربي الأخير، بناءً على موقعه داخل الكلمة، بحرف الشكل المناسب في مجموعة الأحرف القديمة.

للاستغناء عن أحرف التوافق هذه، يجب أن يتوافق برنامج معالجة النصوص مع العديد من بروتوكولات يونيكود. يجب أن يكون البرنامج قادراً على:

  1. قم بتكوين وحدات كتابية مميزة بعلامات التشكيل من حروف الأبجدية وعلامة تشكيل واحدة أو أكثر منفصلة.
  2. استبدل (حسب تقدير المؤلف أو القارئ) الوصلات ومتغيرات الرسوم البيانية السياقية.
  3. قم بتنسيق نص CJKV عموديًا (حسب تقدير المؤلف أو القارئ)، مع استبدال الرموز الرسومية بأشكال مربعة صغيرة وعمودية وضيقة وعريضة، إما من بيانات الخط أو تم تركيبها حسب الحاجة.
  4. قم بدمج الكسور باستخدام U+2044 FRACTION SLASH وأي أحرف أخرى اختيارية.
  5. قم بدمج U+0338 ̸ COMBINING LONG SOLIDUS OVERLAY مع رموز أخرى: على سبيل المثال ∄ أو ∄ لـ U+2204 THERE DOES NOT EXIST .

إجمالاً، يبلغ عدد أحرف التوافق هذه، المُدرجة لتطبيقات يونيكود غير المكتملة، 3779 حرفًا من أصل 5402 حرف توافق مُحدد . وتشمل هذه الأحرف جميع أحرف التوافق المُميزة بالكلمات المفتاحية <initial> ، <medial> ، <final> ، <solidated> ، <fraction> ، <wide> ، <narrow> ، <small> ، <vertical> ، ​​<square> . كما تشمل جميع أحرف التوافق الأساسية تقريبًا، ومعظم أحرف التوافق التي تحمل الكلمة المفتاحية <compat> (باستثناء أحرف الكلمة المفتاحية <compat> الخاصة بالأحرف الأبجدية الرقمية المُحاطة، والرموز التصويرية المُحاطة، وتلك المذكورة في قسم " الأحرف المُميزة دلاليًا ").

أحرف توافق النصوص المنسقة

تُشكّل العديد من رموز التوافق الأخرى ما يعتبره يونيكود نصًا منسقًا، وبالتالي فهي خارج نطاق أهداف يونيكود ونظام UCS. وبمعنى ما، حتى رموز التوافق التي نوقشت في القسم السابق - تلك التي تُساعد البرامج القديمة في عرض الأحرف المتصلة والنصوص العمودية - تُعدّ نوعًا من النصوص المنسقة، لأن بروتوكولات النصوص المنسقة تُحدد كيفية عرض النص. مع ذلك، فإن اختيار عرض النص مع الأحرف المتصلة أو بدونها، أو عموديًا أو أفقيًا، ليسا نصًا منسقًا ذا دلالة، بل هما مجرد اختلافات في الأسلوب. وهذا على عكس أنواع النصوص المنسقة الأخرى، مثل الخط المائل، والأسطر المرتفعة والمنخفضة، أو علامات القوائم، حيث يُشير أسلوب النص المنسق إلى دلالات معينة.

لأغراض المقارنة والتصنيف والتعامل مع النصوص العادية وتخزينها، تُعدّ متغيرات النصوص المنسقة زائدة عن الحاجة من الناحية الدلالية. على سبيل المثال، من غير المرجح التمييز بين استخدام حرف مرتفع للرقم 4 واستخدام الحرف القياسي للرقم 4 ثم تطبيق بروتوكولات النصوص المنسقة لجعله مرتفعًا. ولذلك، تُسبب هذه الأحرف البديلة للنصوص المنسقة غموضًا لأنها تبدو متشابهة بصريًا مع نظيراتها في النصوص العادية بعد تطبيق تنسيق النصوص المنسقة. وتشمل أحرف توافق النصوص المنسقة ما يلي:

الرموز الرياضية الأبجدية الرقمية
هذه الرموز هي ببساطة نسخ من الأبجدية اللاتينية واليونانية والأرقام العشرية العربية، مُكررة في 15 نمطًا مختلفًا. وهي مُصممة لتكون بمثابة لوحة ألوان اعتباطية للرموز الرياضية. إلا أنها تُضعف التمييز بين ترميز الأحرف وترميز الرموز المرئية، كما تُخالف أهداف يونيكود المتمثلة في دعم أحرف النصوص العادية فقط. يُمكن إنشاء أنماط بديلة مماثلة للوحة الرموز الرياضية بسهولة من خلال بروتوكولات النصوص المنسقة.
أحرف وأرقام ورموز تصويرية مرفقة (علامات)
هذه أحرف مُدرجة أساسًا لعلامات القوائم، ولا تُعدّ أحرفًا نصية عادية. علاوة على ذلك، يُعدّ استخدام بروتوكولات النصوص المنسقة الأخرى أكثر ملاءمة، نظرًا لمحدودية مجموعة الأحرف والأرقام أو الرموز التصويرية المُضمّنة في نظام UCS.
حروف وأرقام ورموز تصويرية محاطة بدوائر
من المرجح أيضاً استخدام الأشكال المحاطة بدوائر كعلامات. ومرة ​​أخرى، يُعد استخدام الأحرف مع بروتوكولات النصوص المنسقة لتحديد سلاسل الأحرف أكثر مرونة.
مساحات ومساحات بدون فواصل بأطوال متفاوتة
هذه الأحرف هي ببساطة صيغ نصية منسقة لـ U+0020 مسافة و U+00A0 مسافة غير قابلة للكسر . ينبغي استخدام بروتوكولات نصية منسقة أخرى بدلاً من ذلك، مثل خصائص التتبع، والتباعد بين الأحرف، أو تباعد الكلمات.  
بعض الأحرف ذات الشكل السفلي والعلوي
العديد من الأحرف المرتفعة والمنخفضة هي في الواقع أحرف مختلفة دلاليًا عن الأبجدية الصوتية الدولية وأنظمة الكتابة الأخرى، ولا تندرج ضمن فئة النصوص المنسقة. مع ذلك، تمثل أحرف أخرى ببساطة أشكال عرض منسقة لأحرف يونانية ولاتينية ورقمية أخرى. لذا، تنتمي هذه الأحرف المرتفعة والمنخفضة إلى فئة أحرف التوافق مع النصوص المنسقة. معظم هذه الأحرف موجودة في قسمي "الأحرف المرتفعة والمنخفضة" أو "اللاتينية الأساسية".

بالنسبة لجميع أحرف التوافق مع النصوص المنسقة، يختلف عرض الرموز الرسومية عادةً عن أحرف التوافق (الأحرف ذات الصلة). ومع ذلك، تُعتبر هذه الأحرف أحرف توافق، ويُنصح بعدم استخدامها من قِبل اتحاد يونيكود لأنها ليست أحرف نص عادي، وهو ما يسعى يونيكود لدعمه من خلال نظام UCS والبروتوكولات المرتبطة به. ينبغي التعامل مع النصوص المنسقة من خلال بروتوكولات غير تابعة ليونيكود، مثل HTML وCSS وRTF وغيرها.

تتضمن أحرف التوافق مع النصوص المنسقة 1451 حرفًا من أصل 5402 حرفًا متوافقًا. وتشمل هذه الأحرف جميع الأحرف المتوافقة التي تحمل الكلمات المفتاحية <circle> و < font> (باستثناء ثلاثة أحرف مذكورة في قسم الأحرف المتميزة دلاليًا أدناه)؛ و11 نوعًا مختلفًا من المسافات من الأحرف المتوافقة والأحرف الأساسية؛ وبعض الأحرف المفتاحية <uprscript> و < subscript> من قسم "الأحرف المرتفعة والمنخفضة".

شخصيات متميزة دلاليًا

العديد من رموز التوافق هي رموز متميزة دلاليًا، على الرغم من أنها قد تشترك في رموز تمثيلية مع رموز أخرى. ربما أُدرجت بعض هذه الرموز لأن معظم مجموعات الأحرف الأخرى التي ركزت على نظام كتابة واحد أو خط واحد. على سبيل المثال، من المرجح أن مجموعة الأحرف اللاتينية ISO وغيرها من مجموعات الأحرف اللاتينية تضمنت رمزًا لـ π (باي)، لأنه عند التركيز بشكل أساسي على نظام كتابة واحد أو خط واحد، لم تكن تلك المجموعات لتتضمن رموزًا للرمز الرياضي الشائع π. مع ذلك، يتيح نظام يونيكود للرياضيين استخدام رموز من أي خط معروف في العالم لتمثيل مجموعة رياضية أو ثابت رياضي. حتى الآن، لم يُضف يونيكود سوى دعم دلالي محدد لعدد قليل من هذه الثوابت الرياضية (على سبيل المثال، U+210E ثابت بلانك ، و U+2107 ثابت أويلر ، وكلاهما يعتبره يونيكود رمز توافق). لذلك، يُصنف يونيكود العديد من الرموز الرياضية المستندة إلى أحرف من اليونانية والعبرية كرموز توافق. وتشمل هذه الرموز:

  • الرموز العبرية المبنية على الحروف (4): U+2135 ALEF SYMBOL , U+2136 BET SYMBOL , U+2137 GIMEL SYMBOL و U+2138 DALET SYMBOL
  • الرموز اليونانية المبنية على الحروف (7): U+03D0 ϐ GREEK BETA SYMBOL ، U+03D1 ϑ GREEK THETA SYMBOL ، U+03D5 ϕ GREEK PHI SYMBOL ، U+03D6 ϖ GREEK PI SYMBOL ، U+03F0 ϰ GREEK KAPPA SYMBOL ، U+03F1 ϱ رمز RHO اليوناني ، U+03F4 ϴ رمز ثيتا للعاصمة اليونانية

على الرغم من أن هذه الرموز التوافقية لا تُفرّق عن رموز تفكيكها التوافقية إلا بإضافة كلمة "رمز" إلى اسمها، إلا أنها تمثل معاني متميزة راسخة في الرياضيات المكتوبة. ومع ذلك، فهي عمليًا تشترك في نفس الدلالات مع نظيراتها من الحروف اليونانية أو العبرية. لذا، يمكن اعتبارها رموزًا ذات دلالات متقاربة، وبالتالي لا تُدرج ضمن المجموع الكلي.

على الرغم من أن يونيكود لا يهدف إلى ترميز وحدات القياس هذه، إلا أن مجموعته تتضمن ستة (6) رموز من هذا القبيل، والتي لا ينبغي للمؤلفين استخدامها: بل ينبغي استخدام مكونات الأحرف بدلاً من ذلك. [ 4 ] [ 5 ]

  • رموز الوحدات (6): U+212B Å (علامة أنغستروم : استخدم U+00C5 Å (حرف لاتيني كبير A مع حلقة فوقه ) أوم ( U+2126 Ω)(استخدم U+03A9 بدلاً من ذلك)، ( U+212A K علامة كلفن : استخدم U+004B بدلاً من ذلك)، ( U+2109 درجة فهرنهايت : استخدم U+00B0 وU+0046 بدلاً من ذلك)، ( U+2103 درجة مئوية : استخدم U+00B0 علامة درجة ° و U+0043 C الحرف اللاتيني الكبير C بدلاً من ذلك)، U+00B5 µ علامة صغيرة (استخدم U+03BC μ الحرف اليوناني الصغير MU بدلاً من ذلك)

يُحدد نظام يونيكود أيضاً 22 رمزاً آخر شبيهاً بالأحرف كأحرف توافق. [ 5 ]

  • رموز أخرى مبنية على الأحرف اليونانية (3): U+03F5 ϵ رمز إبسيلون الهلالي اليوناني ، U+03F2 ϲ رمز سيجما الهلالي اليوناني ، U+03F9 Ϲ رمز سيجما الهلالي الكبير اليوناني
  • الثوابت الرياضية (3): U+2107 ثابت أويلر ، U+210E ثابت بلانك ، U+210F ثابت بلانك مقلوب 2 باي
  • رموز العملات (2): U+20A8 علامة الروبية ، U+FDFC علامة الريال
  • علامات الترقيم (4): U+2024 نقطة واحدة ، U+00A0 مسافة غير قابلة للكسر ، U+2011 واصلة غير قابلة للكسر ، U+0F0C علامة تبتية TSHEG BSTAR 
  • رموز أخرى شبيهة بالحروف (10): U+2139 مصدر المعلومات ، U+2100 حساب ، U+2101 موجه إلى الموضوع ، U+2105 عناية ، U+2106 CADA UNA ، U+2116 علامة الرقم ، U+2121 علامة الهاتف ، U+213B علامة الفاكس ، U+2122 علامة العلامة التجارية ، U+2120 علامة الخدمة

بالإضافة إلى ذلك، تستخدم العديد من أنظمة الكتابة موضع الحروف، مثل الحروف المرتفعة والمنخفضة، للتمييز بين الدلالات. في هذه الحالات، لا تُعدّ الحروف المرتفعة والمنخفضة مجرد نص منسق، بل تُشكّل حرفًا مميزًا في نظام الكتابة (130 حرفًا إجمالًا).

وأخيرًا، يصنف نظام يونيكود الأرقام الرومانية على أنها مكافئة توافقية للأحرف اللاتينية التي تشترك في نفس الرموز.

  • الأرقام الرومانية الكبيرة (7): U+2160 الرقم الروماني واحد ، U+2164 الرقم الروماني خمسة ، U+2169 الرقم الروماني عشرة ، U+216C الرقم الروماني خمسون ، U+216D الرقم الروماني مئة ، U+216E الرقم الروماني خمسمئة ، U+216F الرقم الروماني ألف
  • والمتغيرات ذات الأحرف الصغيرة (7): U+2170 الرقم الروماني الصغير واحد ، U+2174 الرقم الروماني الصغير خمسة ، U+2179 الرقم الروماني الصغير عشرة ، U+217C الرقم الروماني الصغير خمسون ، U+217D الرقم الروماني الصغير مئة ، U+217E الرقم الروماني الصغير خمسمئة ، U+217F الرقم الروماني الصغير ألف
  • 18 رقمًا رومانيًا مُركبًا مسبقًا بأحرف كبيرة وصغيرة (2-4، 6-9 و11-12)

يحتوي الرقم الروماني ألف في الواقع على حرف ثالث يمثل شكلاً أو رمزاً ثالثاً لنفس الوحدة الدلالية: U+2180 الرقم الروماني ألف CD . من هذا الرمز، يمكن استنتاج أصل استخدام الحرف اللاتيني M. ومن الغريب أنه على الرغم من أن نظام يونيكود يوحد الأرقام الرومانية ذات القيمة الإشارية مع الأحرف اللاتينية المختلفة تماماً (وإن كانت متشابهة بصرياً)، فإن الأرقام العشرية العربية الهندية ذات القيمة المكانية (الموضعية) تتكرر 24 مرة (بإجمالي 240 نقطة ترميز لـ 10 أرقام) في جميع أنحاء نظام يونيكود دون أي ربط أو تحليل بينها.

إن وجود هذه الأحرف الـ 167 المتميزة دلاليًا، وإن كانت متشابهة بصريًا (بالإضافة إلى الرموز العبرية واليونانية الـ 11 التي تُعتبر على الحافة، ورموز وحدات القياس الـ 6) ضمن الأحرف القابلة للتحليل، يُعقّد موضوع أحرف التوافق. ويُثني معيار يونيكود مؤلفي المحتوى عن استخدام أحرف التوافق. مع ذلك، في بعض المجالات المتخصصة، تُعد هذه الأحرف مهمة، وهي تُشبه إلى حد كبير أحرفًا أخرى لم تُدرج ضمن أحرف التوافق. على سبيل المثال، في بعض الأوساط الأكاديمية، لا يختلف استخدام الأرقام الرومانية، تمييزًا لها عن الأحرف اللاتينية التي تشترك معها في نفس الرموز، عن استخدام الأرقام المسمارية أو الأرقام اليونانية القديمة. إن دمج الأرقام الرومانية مع الأحرف اللاتينية يُلغي التمييز الدلالي. وينطبق وضع مماثل على أحرف الأبجدية الصوتية التي تستخدم رموزًا سفلية أو علوية. في الأوساط المتخصصة التي تستخدم الأبجديات الصوتية، ينبغي أن يكون المؤلفون قادرين على استخدامها دون اللجوء إلى بروتوكولات النصوص المنسقة. كمثال آخر، تُستخدم أحرف التوافق الخاصة بالكلمة المفتاحية "دائرة" غالبًا لوصف لعبة غو . ومع ذلك، تُعدّ هذه الاستخدامات لأحرف التوافق استثناءات حيث يكون لدى المؤلف سبب خاص لاستخدام الأحرف التي يُنصح بتجنبها في الأحوال العادية.

كتل التوافق

تتضمن عدة مجموعات من أحرف يونيكود إما كليًا أو شبه كليًا جميع أحرف التوافق (من U+F900 إلى U+FFEF باستثناء الأحرف غير الحرفية). لا تحتوي مجموعات التوافق على أي من أحرف التوافق المتميزة دلاليًا باستثناء واحد فقط: رمز العملة U+FDFC RIAL SIGN، لذا فإن الأحرف القابلة للتحليل في مجموعات التوافق تندرج بشكل واضح ضمن مجموعة الأحرف غير المُستحبة. توصي يونيكود المؤلفين باستخدام مكافئات تحليل التوافق في النص العادي، واستكمال تلك الأحرف بعلامات تنسيق النص المنسق. هذا النهج أكثر مرونة وانفتاحًا من استخدام المجموعة المحدودة من الأحرف الأبجدية الرقمية المحاطة بدائرة أو بإطار، على سبيل المثال لا الحصر.

يوجد عدد قليل من الأحرف، حتى داخل كتل التوافق، لا تُعدّ أحرف توافق بحد ذاتها، مما قد يُربك المؤلفين. تحتوي كتلة "أحرف وأشهر CJK المرفقة" على حرف واحد غير متوافق: U+327F رمز اللغة الكورية القياسي . أُدرج هذا الرمز و12 حرفًا آخر في الكتل لأسباب غير معروفة. تحتوي كتلة "أحرف التوافق CJK" على هذه الأحرف الصينية الموحدة، التي تُسمى خطأً "أحرف التوافق الصينية الموحدة".

  1. U+FA0ECJK COMPATIBILITY IDEOGRAPH-FA0E
  2. U+FA0FCJK COMPATIBILITY IDEOGRAPH-FA0F
  3. U+FA11CJK COMPATIBITY IDEOGRAPH-FA11
  4. U+FA13CJK COMPATIBITY IDEOGRAPH-FA13
  5. U+FA14CJK COMPATIBITY IDEOGRAPH-FA14
  6. U+FA1FCJK COMPATIBITY IDEOGRAPH-FA1F
  7. U+FA21CJK COMPATIBITY IDEOGRAPH-FA21
  8. U+FA23CJK COMPATIBITY IDEOGRAPH-FA23
  9. U+FA24CJK COMPATIBITY IDEOGRAPH-FA24
  10. U+FA27CJK COMPATIBITY IDEOGRAPH-FA27
  11. U+FA28CJK COMPATIBITY IDEOGRAPH-FA28
  12. U+FA29CJK COMPATIBITY IDEOGRAPH-FA29

هذه الأحرف الثلاثة عشر ليست أحرف توافق، ولا يُمنع استخدامها بأي شكل من الأشكال. ومع ذلك، U+27EAF 𧺯، تمامًا مثل U+FA23، مُشفّرة خطأً في امتداد الرموز الصينية واليابانية والكورية الموحد B. [ 6 ] على أي حال، لا ينبغي أن يحتوي النص المُوحّد على كل من U+27EAF 𧺯و U+FA23تمثل نقاط الترميز هذه نفس الحرف، مشفرًا مرتين.

لا تحتوي العديد من الأحرف الأخرى في هذه الكتل على خريطة توافق، ولكن من الواضح أنها مخصصة لدعم الأنظمة القديمة:

أشكال العرض الأبجدية (1)

  1. U+FB1E HEBREW POINT JUDEO-SPANISH VARIKA . هذا شكل مختلف من U+05BF ֿ HEBREW POINT RAFE ، على الرغم من أن يونيكود لا يوفر أي خريطة توافق.

أشكال العرض باللغة العربية (4)

  1. U+FD3E قوس مزخرف . شكل مختلف من U+0028 ( قوس مزخرف)
  2. U+FD3F ﴿ قوس أيمن مزخرف . شكل مختلف من U+0029 ) قوس أيمن
  3. U+FDFD حرف عربي بسم الله الرحمن الرحيم حرف مركب لبه (U+0628)، سين (U+0633)، ميم (U+0645)، مسافة (U+0020)، ألف (U+0627)، لام (U+0644)، لام (U+0644)، هيه (U+0647)، مسافة (U+0020)، ألف (U+0627)، لام (U+0644)، ريه (U+0631)، هاه (U+062D)، ميم (U+0645)، ألف (U+0627)، نون (U+0646)، مسافة (U+0020)، ألف (U+0627)، لام (U+0644)، ريه (U+0631)، هاه (U+062D)، Yeh (U+064A), Meem (U+0645) أي بسم الله الرحمن الرحيم [ 7 ] (وبالمثل، رمز U+FDFA وU+FDFB لاثنين من الحروف المركبة العربية الأخرى، المكونة من 21 و9 أحرف على التوالي.)
  4. U+FE73 ARABIC TAIL FRAGMENT لدعم أنظمة النصوص التي لا تدعم معالجة الرموز السياقية

أشكال التوافق CJK (اثنان منها مرتبطان بالرمز الموحد CJK: U+4E36 丶)

  1. U+FE45 SESAME DOT
  2. U+FE46 نقطة سمسم بيضاء

الأحرف والأرقام المضمنة (21 نوعًا من النصوص المنسقة)

  1. 11 عددًا سالبًا محاطًا بدائرة (من 0 إلى 20) (من U+24FF و U+24EB إلى U+24F4): ⓿، ⓫ – ⓴
  2. 10 أرقام محاطة بدائرة مزدوجة (من 0 إلى 10) (من U+24F5 إلى U+24FE): ⓵ – ⓾

تطبيع

التطبيع هو العملية التي يقوم من خلالها البرنامج المتوافق مع Unicode أولاً بإجراء عملية التفكيك (أو التركيب) الكاملة للتوافق قبل إجراء المقارنات أو تجميع سلاسل النصوص.

انظر أيضاً

مراجع

  1. "الفصل 2.3: أحرف التوافق" (ملف PDF) . معيار يونيكود 6.0.0 .
  2. اتحاد يونيكود - مسرد مصطلحات يونيكود
  3. اتحاد يونيكود (2010). معيار يونيكود، الإصدار 6.0.0 (ملف PDF) . أديسون-ويسلي بروفيشنال. ص 212. ISBN  978-0321480910.
  4. أوميغا، ميو، أنغستروم، كلفن: اتحاد يونيكود (30-05-2017). "التقرير الفني رقم 25 عن يونيكود / دعم يونيكود للرياضيات" . ص 11. 
  5. يشير الرمز 1 2 ≈ إلى تفكيك التوافق وفقًا للرابط https://www.unicode.org/versions/Unicode15.0.0/ch24.pdf ، وهو موضح في جداول الترميز على الرابط https://www.unicode.org/charts/nameslist/n_2100.html
  6. IRGN 1218
  7. مخطط يونيكود FB50-FDFF (PDF) .