مجموعة الأحرف العالمية

يتعاون اتحاد Unicode و ISO/IEC JTC 1/SC 2 / WG 2 بشكل مشترك على قائمة الأحرف الموجودة في مجموعة الأحرف المشفرة العالمية . مجموعة الأحرف المشفرة العالمية، والتي يطلق عليها عادةً مجموعة الأحرف العالمية ( اختصارًا UCS، التسمية الرسمية: ISO / IEC 10646)، هي معيار دولي لتعيين الأحرف والرموز المنفصلة المستخدمة في اللغة الطبيعية والرياضيات والموسيقى وغيرها من المجالات، إلى قيم بيانات فريدة يمكن قراءتها بواسطة الآلة . من خلال إنشاء هذا التعيين، يمكّن UCS بائعي برامج الكمبيوتر من التشغيل المتبادل ونقل - تبادل - سلاسل النصوص المشفرة بواسطة UCS من واحد إلى آخر. نظرًا لأنها خريطة عالمية ، يمكن استخدامها لتمثيل لغات متعددة في نفس الوقت. يتجنب هذا الارتباك الناتج عن استخدام ترميزات أحرف قديمة متعددة ، مما قد يؤدي إلى نفس تسلسل الرموز التي لها تفسيرات متعددة اعتمادًا على ترميز الأحرف المستخدم، مما يؤدي إلى mojibake إذا تم اختيار الرمز الخطأ.

تبلغ سعة UCS المحتملة أكثر من مليون حرف. يتم تمثيل كل حرف UCS تجريديًا بنقطة رمز ، وهي عدد صحيح بين 0 و1,114,111 (1,114,112 = 2 20 + 2 16 أو 17 × 2 16 = 0x 110000 نقطة رمز )، تُستخدم لتمثيل كل حرف داخل المنطق الداخلي لبرامج معالجة النصوص . اعتبارًا من Unicode 16.0، الذي تم إصداره في سبتمبر 2024، تم تخصيص 299,056 (27%) من نقاط الرمز هذه، وتم تخصيص 155,063 (14%) حرفًا، وتم حجز 137,468 (12%) للاستخدام الخاص، وتم استخدام 2,048 لتمكين آلية البدائل، وتم تعيين 66 كأحرف غير شخصية، وترك 815,056 (73%) المتبقية غير مخصصة. يتكون عدد الأحرف المشفرة على النحو التالي:

  • 149,641 حرفًا رسوميًا (بعضها لا يحتوي على رمز مرئي ، ولكنها لا تزال تُحسب على أنها رسومية)
  • 237 حرفًا لأغراض خاصة للتحكم والتنسيق .

تحافظ ISO على التعيين الأساسي للأحرف من اسم الحرف إلى نقطة الرمز. غالبًا ما يتم استخدام مصطلحي الحرف ونقطة الرمز بالتبادل. ومع ذلك، عند التمييز بينهما، تشير نقطة الرمز إلى العدد الصحيح للحرف: ما قد يفكر فيه المرء على أنه عنوانه. وفي الوقت نفسه، يتضمن الحرف في ISO/IEC 10646 مزيجًا من نقطة الرمز واسمه، ويضيف Unicode العديد من الخصائص المفيدة الأخرى إلى مجموعة الأحرف، مثل الكتلة والفئة والنص والاتجاه .

بالإضافة إلى UCS، يوفر معيار Unicode التكميلي (ليس مشروعًا مشتركًا مع ISO، بل هو منشور من Unicode Consortium) تفاصيل تنفيذ أخرى مثل:

  1. التعيينات بين UCS ومجموعات الأحرف الأخرى
  2. ترتيبات مختلفة للأحرف وسلاسل الأحرف للغات مختلفة
  3. خوارزمية لعرض نص ثنائي الاتجاه (" خوارزمية BiDi ")، حيث يمكن للنص الموجود على نفس السطر أن يتحول بين اليسار إلى اليمين ("LTR") ومن اليمين إلى اليسار ("RTL")
  4. خوارزمية طي الحالات

يقوم مستخدمو برامج الكمبيوتر بإدخال هذه الأحرف في البرامج من خلال طرق إدخال مختلفة ، على سبيل المثال، لوحات المفاتيح المادية أو لوحات الأحرف الافتراضية .

يمكن تقسيم UCS بطرق مختلفة، مثل حسب المستوى ، أو الكتلة، أو فئة الشخصية، أو خاصية الشخصية . [1]

نظرة عامة على مرجع الشخصية

يشير مرجع الأحرف الرقمية في HTML أو XML إلى حرف من خلال مجموعة الأحرف العالمية /نقطة رمز Unicode الخاصة به، ويستخدم التنسيق

&#نن ...;

أو

&#xهههه;

حيث nnnn هي نقطة الرمز في الصيغة العشرية ، و hhhh هي نقطة الرمز في الصيغة السداسية عشر . يجب أن يكون الحرف x صغيرًا في مستندات XML. يمكن أن يكون nnnn أو hhhh أي عدد من الأرقام ويمكن أن يتضمن أصفارًا بادئة. يمكن أن يمزج hhhh بين الأحرف الكبيرة والصغيرة، على الرغم من أن الأحرف الكبيرة هي النمط المعتاد.

على النقيض من ذلك، يشير مرجع كيان الحرف إلى حرف باسم كيان يحتوي على الحرف المطلوب كنص بديل له . يجب أن يكون الكيان محددًا مسبقًا (مضمنًا في لغة الترميز) أو معلنًا صراحةً في تعريف نوع المستند (DTD). يكون التنسيق هو نفسه لأي مرجع كيان:

&اسم;

حيث أن name هو اسم الكيان الحساس لحالة الأحرف. الفاصلة المنقوطة مطلوبة.

طائرات

يقسم Unicode وISO مجموعة نقاط الترميز إلى 17 مستوى، كل منها قادر على احتواء 65536 حرفًا مميزًا أو 1,114,112 حرفًا إجماليًا. اعتبارًا من عام 2024 (Unicode 16.0)، قامت ISO وUnicode Consortium بتخصيص الأحرف والكتل في سبعة من المستويات السبعة عشر فقط. تظل المستويات الأخرى فارغة ومخصصة للاستخدام في المستقبل.

يتم تعيين معظم الأحرف حاليًا إلى المستوى الأول: المستوى متعدد اللغات الأساسي . وهذا للمساعدة في تسهيل عملية الانتقال إلى البرامج القديمة نظرًا لأن المستوى متعدد اللغات الأساسي يمكن التعامل معه باستخدام ثماني بتات فقط . عادةً ما يكون للأحرف خارج المستوى الأول استخدامات متخصصة للغاية أو نادرة.

يتوافق كل مستوى مع قيمة الرقم أو الرقمين السداسي عشر (0-9، A-F) السابقين للأرقام الأربعة الأخيرة: وبالتالي فإن U+24321 موجود في المستوى 2، وU+4321 موجود في المستوى 0 (يُقرأ ضمنيًا U+04321)، وU+10A200 موجود في المستوى 16 (السداسي عشري 10 = 16 عشري). ضمن مستوى واحد، يكون نطاق نقاط الترميز سداسي عشري 0000-FFFF، مما ينتج عنه حد أقصى يبلغ 65536 نقطة ترميز. تقيد المستويات نقاط الترميز بمجموعة فرعية من هذا النطاق.

كتل

يضيف Unicode خاصية كتلة إلى UCS والتي تقسم كل مستوى إلى كتل منفصلة. كل كتلة عبارة عن مجموعة من الأحرف حسب استخدامها مثل "المشغلات الرياضية" أو "أحرف النص العبري". عند تعيين الأحرف لنقاط رمز لم يتم تعيينها مسبقًا، يقوم الكونسورتيوم عادةً بتخصيص كتل كاملة من الأحرف المتشابهة: على سبيل المثال، يتم تعيين جميع الأحرف التي تنتمي إلى نفس النص أو جميع الرموز ذات الغرض المتشابه إلى كتلة واحدة. قد تحتفظ الكتل أيضًا بنقاط رمز غير مخصصة أو محجوزة عندما يتوقع الكونسورتيوم أن تتطلب الكتلة تعيينات إضافية.

تتوافق أول 256 نقطة رمز في UCS مع تلك الموجودة في ISO 8859-1 ، وهو ترميز الأحرف الأكثر شيوعًا المكون من 8 بتات في العالم الغربي . ونتيجة لذلك، فإن أول 128 حرفًا متطابقة أيضًا مع ASCII . وعلى الرغم من أن Unicode يشير إلى هذه على أنها كتلة نصية لاتينية، إلا أن هاتين الكتلتين تحتويان على العديد من الأحرف المفيدة بشكل عام خارج النص اللاتيني. بشكل عام، لا يلزم أن تكون جميع الأحرف في كتلة معينة من نفس النص، ويمكن أن يظهر نص معين في عدة كتل مختلفة.

فئات

يخصص Unicode لكل حرف UCS فئة عامة وفئة فرعية. والفئات العامة هي: الحرف، والعلامة، والرقم، وعلامة الترقيم، والرمز، أو عنصر التحكم (بعبارة أخرى، حرف تنسيق أو حرف غير رسومي).

تشمل الأنواع ما يلي:

  • النصوص الحديثة والتاريخية والقديمة . اعتبارًا من عام 2024 (Unicode 16.0)، حددت UCS 168 نصًا مستخدمًا أو تم استخدامه في جميع أنحاء العالم. وهناك العديد من النصوص الأخرى في مراحل الموافقة المختلفة لإدراجها في المستقبل في UCS. [2]
  • الأبجدية الصوتية الدولية . يخصص UCS عدة كتل (أكثر من 300 حرف) لأحرف الأبجدية الصوتية الدولية .
  • الجمع بين علامات التشكيل . كان أحد التطورات المهمة التي توصل إليها Unicode في تصميم UCS والخوارزميات ذات الصلة للتعامل مع النص هو تقديم الجمع بين علامات التشكيل. من خلال توفير علامات التشكيل التي يمكن دمجها مع أي حرف، يقلل Unicode وUCS بشكل كبير من عدد الأحرف المطلوبة. وبينما يتضمن UCS أيضًا أحرفًا مركبة مسبقًا، فقد تم تضمينها في المقام الأول لتسهيل الدعم داخل UCS لأنظمة معالجة النصوص غير Unicode.
  • علامات الترقيم . إلى جانب توحيد علامات التشكيل، سعى نظام UCS أيضًا إلى توحيد علامات الترقيم عبر النصوص. ومع ذلك، تحتوي العديد من النصوص أيضًا على علامات ترقيم، عندما لا تحتوي علامة الترقيم هذه على دلالات مماثلة في النصوص الأخرى.
  • الرموز . يتضمن نظام UCS العديد من الرموز الرياضية والتقنية والهندسية وغيرها. وهذا يوفر رموزًا مميزة بنقطة رمزية أو حرف خاص بها بدلاً من الاعتماد على تبديل الخطوط لتوفير رموز رمزية.
    • عملة .
    • تشبه الحروف . تظهر هذه الرموز كمجموعات من العديد من أحرف النصوص اللاتينية الشائعة مثل . يصنف يونيكود العديد من الرموز التي تشبه الحروف على أنها أحرف توافقية عادةً لأنها يمكن أن تكون في نص عادي عن طريق استبدال الحروف بتسلسل مركب من الحروف: على سبيل المثال استبدال الحرف بالتسلسل المركب من الحروف c/o .
    • تتكون أشكال الأرقام في المقام الأول من الكسور المركبة مسبقًا والأرقام الرومانية. ومثل المجالات الأخرى لتكوين تسلسلات الأحرف، يفضل نهج Unicode مرونة تكوين الكسور من خلال الجمع بين الأحرف معًا. في هذه الحالة لإنشاء الكسور، يتم الجمع بين الأرقام وحرف الكسر المائل (U+2044). وكمثال على المرونة التي يوفرها هذا النهج، هناك تسعة عشر حرفًا مكونًا مسبقًا للكسور مضمنًا في UCS. ومع ذلك، هناك عدد لا نهائي من الكسور المحتملة. باستخدام الأحرف المركبة، يتم التعامل مع ما لا نهاية للكسور من خلال 11 حرفًا (0-9 والكسر المائل). لا يمكن لأي مجموعة أحرف أن تتضمن نقاط رمز لكل كسر مركب مسبقًا. من الناحية المثالية، يجب أن يقدم نظام النص نفس الحروف الهيروغليفية للكسر سواء كان أحد الكسور المركبة مسبقًا (مثل ) أو تسلسل مكون من الأحرف (مثل 1⁄3 ). ومع ذلك، لا تكون متصفحات الويب عادةً متطورة في التعامل مع Unicode والنص. يؤدي القيام بذلك إلى ضمان ظهور الكسور المكونة مسبقًا وكسور التسلسل المجمعة متوافقة مع بعضها البعض.
    • السهام .
    • رياضيات .
    • الأشكال الهندسية .
    • الحوسبة التقليدية .
    • صور التحكم تمثيلات رسومية للعديد من أحرف التحكم.
    • رسم الصندوق .
    • عناصر الكتلة .
    • أنماط برايل .
    • التعرف الضوئي على الحروف .
    • اِصطِلاحِيّ .
    • دينغباتس .
    • رموز متنوعة .
    • الرموز التعبيرية .
    • الرموز والصور التوضيحية .
    • الرموز الخيميائية .
    • قطع اللعبة (الشطرنج، الداما، الغو، النرد، الدومينو، الماهجونغ، أوراق اللعب، وغيرها الكثير).
    • رموز الشطرنج
    • تاي شوان جينغ .
    • رموز سداسية ييجينغ .
  • CJK . مخصص للأيديوغرامات والحروف الأخرى لدعم اللغات في الصين واليابان وكوريا (CJK) وتايوان وفيتنام وتايلاند.
    • الجذور والسكتات الدماغية .
    • الرموز التعبيرية . إن الجزء الأكبر من نظام UCS مخصص للرموز التعبيرية المستخدمة في لغات شرق آسيا. وفي حين أن التمثيل الهيروغليفي لهذه الرموز التعبيرية قد تباعد في اللغات التي تستخدمها، فإن نظام UCS يوحد أحرف الهان هذه فيما يطلق عليه Unicode اسم Unihan (بالنسبة إلى الهان الموحد). مع Unihan، يجب أن يعمل برنامج تخطيط النص مع الخطوط المتاحة وأحرف Unicode هذه لإنتاج الرمز الهيروغليفي المناسب للغة المناسبة. وعلى الرغم من توحيد هذه الأحرف، فإن نظام UCS لا يزال يتضمن أكثر من 97000 رمز تعبيري من Unihan.
  • التدوين الموسيقي .
  • إختصارات دوبلويان .
  • سوتون لاينريتينغ .
  • الحروف المتوافقة . هناك العديد من الكتل في UCS مخصصة بالكامل تقريبًا للحروف المتوافقة. والحروف المتوافقة هي تلك التي تم تضمينها لدعم أنظمة معالجة النصوص القديمة التي لا تميز بين الحرف والرمز بالطريقة التي يفعلها Unicode. على سبيل المثال، يتم تمثيل العديد من الحروف العربية برمز مختلف عندما يظهر الحرف في نهاية الكلمة مقارنة بالحرف الذي يظهر في بداية الكلمة. ويفضل نهج Unicode تعيين هذه الحروف على نفس الحرف لسهولة معالجة النصوص وتخزينها داخليًا بواسطة الآلة. ولإكمال هذا النهج، يجب على برنامج النص تحديد متغيرات مختلفة للحروف لعرض الحرف بناءً على سياقه. وقد تم تضمين أكثر من 4000 حرف لأسباب تتعلق بالتوافق.
  • شخصيات التحكم .
  • البدائل . يتضمن UCS 2048 نقطة رمز في المستوى الأساسي متعدد اللغات (BMP) لأزواج نقاط الرمز البديلة. تسمح هذه البدائل معًا بمعالجة أي نقطة رمز في المستويات الستة عشر الأخرى باستخدام نقطتي رمز بديلتين. يوفر هذا طريقة مدمجة بسيطة لترميز UCS 20.1 بت ضمن ترميز 16 بت مثل UTF-16. بهذه الطريقة، يمكن لـ UTF-16 تمثيل أي حرف داخل BMP بكلمة واحدة مكونة من 16 بت. ثم يتم ترميز الأحرف خارج BMP باستخدام كلمتين مكونتين من 16 بت (4 أوكتيتات أو بايتات إجمالية) باستخدام أزواج البدائل.
  • الاستخدام الخاص . يوفر الكونسورتيوم العديد من الكتل والطائرات للاستخدام الخاص التي يمكن تخصيص أحرف لها داخل مجتمعات مختلفة، بالإضافة إلى بائعي أنظمة التشغيل والخطوط.
  • غير الحروف . يضمن الكونسورتيوم أن نقاط ترميز معينة لن يتم تعيين حرف لها مطلقًا ويسمي نقاط الترميز غير الحروفية هذه. تتضمن هذه النطاق U+FDD0..U+FDEF، ونقطتي الترميز الأخيرتين لكل مستوى (تنتهي بالأرقام السداسية عشرية FFFE وFFFF). [3]

شخصيات ذات أغراض خاصة

يقوم Unicode بترميز أكثر من مائة ألف حرف. تمثل معظم هذه الأحرف حروفًا لمعالجتها كنص خطي. ومع ذلك، فإن بعضها لا يمثل حروفًا، أو يتطلب معالجة استثنائية كحروف. [4] [5] وعلى عكس أحرف التحكم ASCII والأحرف الأخرى المضمنة لإمكانيات الرحلة ذهابًا وإيابًا القديمة، فإن هذه الأحرف الأخرى ذات الأغراض الخاصة تمنح النص العادي دلالات مهمة.

يمكن لبعض الأحرف الخاصة تغيير تخطيط النص، مثل حرف الربط ذي العرض الصفري وحرف الربط غير الضمّي ذي العرض الصفري، بينما لا تؤثر أحرف أخرى على تخطيط النص على الإطلاق، بل تؤثر بدلاً من ذلك على طريقة تجميع سلاسل النص أو مطابقتها أو معالجتها بطريقة أخرى. لا تؤثر الأحرف الأخرى ذات الأغراض الخاصة، مثل الأحرف غير المرئية الرياضية، بشكل عام على عرض النص، على الرغم من أن برامج تخطيط النص المتطورة قد تختار تعديل المسافات حولها بشكل طفيف.

لا يحدد يونيكود تقسيم العمل بين برامج تخطيط الخطوط والنصوص (أو "المحرك") عند عرض نص يونيكود. نظرًا لأن تنسيقات الخطوط الأكثر تعقيدًا، مثل OpenType أو Apple Advanced Typography ، توفر الاستبدال السياقي وتحديد موضع الحروف، فقد يعتمد محرك تخطيط النص البسيط بالكامل على الخط في جميع قرارات اختيار الحروف ووضعها. في نفس الموقف، قد يجمع محرك أكثر تعقيدًا بين المعلومات من الخط وقواعده الخاصة لتحقيق فكرته الخاصة عن أفضل عرض. لتنفيذ جميع توصيات مواصفات يونيكود، يجب أن يكون محرك النص مستعدًا للعمل مع الخطوط من أي مستوى من التعقيد، نظرًا لأن قواعد الاستبدال السياقي وتحديد الموضع غير موجودة في بعض تنسيقات الخطوط وهي اختيارية في الباقي. يعد الكسر المائل مثالاً على ذلك: قد توفر الخطوط المعقدة أو لا توفر قواعد تحديد الموضع في وجود حرف الكسر المائل لإنشاء كسر، بينما لا تستطيع الخطوط في التنسيقات البسيطة ذلك.

علامة ترتيب البايت

عند ظهور علامة ترتيب البايتات (BOM) U+FEFF في أعلى ملف نصي أو مجرى، فإنها تشير إلى شكل الترميز وترتيب البايتات الخاص به.

إذا كان البايت الأول في الدفق هو 0xFE والثاني 0xFF، فمن غير المرجح أن يتم ترميز نص الدفق بتنسيق UTF-8 ، لأن هذه البايتات غير صالحة بتنسيق UTF-8. ومن غير المرجح أيضًا أن يكون بتنسيق UTF-16 في ترتيب البايتات الصغير لأن 0xFE و0xFF عند قراءتهما ككلمة صغيرة بتنسيق 16 بت ستكون U+FFFE، وهو أمر لا معنى له. كما لا معنى للتسلسل في أي ترتيب من ترتيبات ترميز UTF-32 ، لذا، باختصار، فهو بمثابة مؤشر موثوق إلى حد ما على أن دفق النص مشفر بتنسيق UTF-16 في ترتيب البايتات الكبير . وعلى العكس من ذلك، إذا كان البايتان الأوليان هما 0xFF و0xFE، فيمكن افتراض ترميز دفق النص بتنسيق UTF-16LE لأنه عند قراءتهما كقيمة صغيرة بتنسيق 16 بت، فإن البايتات تعطي علامة ترتيب البايتات المتوقعة 0xFEFF. ومع ذلك، يصبح هذا الافتراض موضع شك إذا كان البايتان التاليان كلاهما 0x00؛ إما أن يبدأ النص بحرف فارغ (U+0000)، أو أن الترميز الصحيح هو في الواقع UTF-32LE، حيث يكون التسلسل الكامل المكون من 4 بايتات FF FE 00 00 عبارة عن حرف واحد، وهو BOM.

تسلسل UTF-8 المقابل لـ U+FEFF هو 0xEF، 0xBB، 0xBF. لا يوجد لهذا التسلسل أي معنى في أشكال ترميز Unicode الأخرى، لذا قد يكون بمثابة إشارة إلى أن هذا التدفق مُشفَّر بـ UTF-8.

لا تتطلب مواصفات Unicode استخدام علامات ترتيب البايتات في تدفقات النص. كما تنص على أنه لا ينبغي استخدامها في المواقف التي يتم فيها استخدام طريقة أخرى للإشارة إلى نموذج الترميز بالفعل.

الرياضيات غير المرئية

في المقام الأول بالنسبة للرياضيات، يوفر الفاصل غير المرئي (U+2063) فاصلًا بين الأحرف حيث يمكن حذف علامات الترقيم أو المسافة كما هو الحال في الفهرس ثنائي الأبعاد مثل i⁣j. الأوقات غير المرئية (U+2062) وتطبيق الدالة (U+2061) مفيدان في نصوص الرياضيات حيث يُستدل على ضرب المصطلحات أو تطبيق الدالة دون أي رمز يشير إلى العملية. يقدم Unicode 5.1 أيضًا حرف الجمع غير المرئي الرياضي (U+2064) والذي قد يشير إلى أن الرقم الصحيح الذي يتبعه كسر يجب أن يشير إلى مجموعهما، ولكن ليس حاصل ضربهما.

كسر مائل

مثال على استخدام الكسر المائل. يعرض هذا الخط ( Apple Chancery ) الكسر المشترك المركب على اليسار ورمز الكسر المركب مسبقًا على اليمين كتجسيد لسلسلة النص العادي "1 1⁄4 1¼". اعتمادًا على بيئة النص، قد تؤدي السلسلة الفردية "1 1⁄4" إلى أي نتيجة، تلك الموجودة على اليمين من خلال استبدال تسلسل الكسر برمز الكسر المركب مسبقًا.
مثال أكثر تفصيلاً لاستخدام الكسر المائل: نص عادي "4 221⁄225" مُقدم في Apple Chancery . يوفر هذا الخط لبرنامج تخطيط النص التعليمات اللازمة لتوليف الكسر وفقًا لقاعدة Unicode الموضحة في هذا القسم.

يتمتع حرف الكسر المائل (U+2044) بسلوك خاص في معيار Unicode: [6] (القسم 6.2، علامات الترقيم الأخرى)

الشكل القياسي للكسر المبني باستخدام الشرطة المائلة للكسر هو كما يلي: أي تسلسل من رقم عشري واحد أو أكثر (الفئة العامة = Nd)، متبوعًا بالشرطة المائلة للكسر، متبوعًا بأي تسلسل من رقم عشري واحد أو أكثر. يجب عرض مثل هذا الكسر كوحدة، مثل ¾ . إذا كان برنامج العرض غير قادر على تعيين الكسر إلى وحدة، فيمكن أيضًا عرضه كتسلسل خطي بسيط كبديل (على سبيل المثال، 3/4). إذا كان سيتم فصل الكسر عن رقم سابق، فيمكن استخدام مسافة، واختيار العرض المناسب (عادي، رفيع، عرض صفر، وما إلى ذلك). على سبيل المثال، يتم عرض 1 + مسافة عرض صفر + 3 + الشرطة المائلة للكسر + 4 على هيئة .

باتباع توصية يونيكود هذه، تنتج أنظمة معالجة النصوص رموزًا متطورة من نص عادي فقط. هنا، يؤدي وجود حرف الكسر المائل إلى إعطاء تعليمات لمحرك التخطيط بتوليف كسر من جميع الأرقام المتتالية التي تسبق وتلي الكسر المائل. في الممارسة العملية، تختلف النتائج بسبب التفاعل المعقد بين الخطوط ومحركات التخطيط. تميل محركات تخطيط النص البسيطة إلى عدم توليف الكسور على الإطلاق، وبدلاً من ذلك ترسم الحروف الهيروغليفية كتسلسل خطي كما هو موضح في مخطط يونيكود البديل.

تواجه محركات التخطيط الأكثر تطورًا خيارين عمليين: إما أن تتبع توصيات Unicode، أو تعتمد على تعليمات الخط نفسه لتوليف الكسور. وبتجاهل تعليمات الخط، يمكن لمحرك التخطيط ضمان السلوك الموصى به من Unicode. وباتباع تعليمات الخط، يمكن لمحرك التخطيط تحقيق طباعة أفضل لأن وضع وتشكيل الأرقام سيتم ضبطهما وفقًا لهذا الخط المحدد بهذا الحجم المحدد.

تكمن المشكلة في اتباع تعليمات الخط في أن تنسيقات الخطوط الأكثر بساطة لا تملك طريقة لتحديد سلوك توليف الكسور. وفي الوقت نفسه، لا تتطلب التنسيقات الأكثر تعقيدًا من الخط تحديد سلوك توليف الكسور، وبالتالي لا تتطلب العديد منها ذلك. يمكن لمعظم الخطوط ذات التنسيقات المعقدة أن تطلب من محرك التخطيط استبدال تسلسل نص عادي مثل 1⁄2 برمز ½ مسبق التركيب . ولكن نظرًا لأن العديد منها لن تصدر تعليمات لتوليف الكسور، فقد يتم عرض سلسلة نصية عادية مثل 221⁄225 على أنها 22½25 (حيث يكون ½ هو الكسر المسبق التركيب البديل، وليس المركب). في مواجهة مشاكل مثل هذه، يجب على أولئك الذين يرغبون في الاعتماد على سلوك Unicode الموصى به اختيار الخطوط المعروفة بتوليف الكسور أو برامج تخطيط النص المعروفة بإنتاج السلوك الموصى به من Unicode بغض النظر عن الخط.

تنسيق محايد ثنائي الاتجاه

اتجاه الكتابة هو الاتجاه الذي توضع فيه الحروف الرسومية على الصفحة فيما يتعلق بالتقدم للأمام للأحرف في سلسلة Unicode. اللغة الإنجليزية واللغات الأخرى التي تحتوي على نص لاتيني لها اتجاه كتابة من اليسار إلى اليمين. العديد من نصوص الكتابة الرئيسية، مثل العربية والعبرية ، لها اتجاه كتابة من اليمين إلى اليسار. تحدد مواصفات Unicode نوعًا اتجاهيًا لكل حرف لإعلام معالجات النصوص بكيفية ترتيب تسلسلات الأحرف على الصفحة.

في حين أن الأحرف المعجمية (أي الحروف) تكون عادةً خاصة بنص كتابة واحد، فإن بعض الرموز وعلامات الترقيم تُستخدم في العديد من نصوص الكتابة. كان بإمكان Unicode إنشاء رموز مكررة في ذخيرتها تختلف فقط حسب النوع الاتجاهي، لكنه اختار بدلاً من ذلك توحيدها وتعيين نوع اتجاهي محايد لها. تكتسب هذه الرموز الاتجاه في وقت العرض من الأحرف المجاورة. تحتوي بعض هذه الأحرف أيضًا على خاصية bidi-mirrored التي تشير إلى أنه يجب عرض الحرف في صورة معكوسة عند استخدامه في نص من اليمين إلى اليسار.

قد يظل نوع الاتجاه في وقت العرض لحرف محايد غامضًا عندما يتم وضع العلامة على الحد الفاصل بين التغييرات الاتجاهية. لمعالجة هذه المشكلة، يتضمن Unicode أحرفًا ذات اتجاه قوي، ولا يوجد بها أي رمز مرتبط بها، ويمكن تجاهلها بواسطة الأنظمة التي لا تعالج النص ثنائي الاتجاه:

  • علامة الحرف العربي (U+061C)
  • العلامة من اليسار إلى اليمين (U+200E)
  • علامة من اليمين إلى اليسار (U+200F)

إن إحاطة حرف محايد ثنائي الاتجاه بعلامة من اليسار إلى اليمين ستجبر الحرف على التصرف كحرف من اليسار إلى اليمين، بينما إحاطته بعلامة من اليمين إلى اليسار ستجبره على التصرف كحرف من اليمين إلى اليسار. تم تفصيل سلوك هذه الأحرف في خوارزمية ثنائية الاتجاه في Unicode.

التنسيق العام ثنائي الاتجاه

في حين تم تصميم Unicode للتعامل مع لغات متعددة وأنظمة كتابة متعددة وحتى نص يتدفق إما من اليسار إلى اليمين أو من اليمين إلى اليسار مع الحد الأدنى من تدخل المؤلف، فهناك ظروف خاصة حيث يمكن أن يصبح مزيج النص ثنائي الاتجاه معقدًا - مما يتطلب المزيد من التحكم من المؤلف. في هذه الظروف، يتضمن Unicode خمسة أحرف أخرى للتحكم في التضمين المعقد للنص من اليسار إلى اليمين داخل النص من اليمين إلى اليسار والعكس صحيح:

  • التضمين من اليسار إلى اليمين (U+202A)
  • التضمين من اليمين إلى اليسار (U+202B)
  • تنسيق اتجاهي منبثق (U+202C)
  • التجاوز من اليسار إلى اليمين (U+202D)
  • تجاوز من اليمين إلى اليسار (U+202E)
  • عزل من اليسار إلى اليمين (U+2066)
  • عزل من اليمين إلى اليسار (U+2067)
  • أول عزلة قوية (U+2068)
  • عزل اتجاهي للبوب (U+2069)

أحرف التعليق بين السطور

  • مرساة التعليق بين السطور (U+FFF9)
  • فاصل التعليقات التوضيحية بين السطور (U+FFFA)
  • مُنهي الشرح بين السطور (U+FFFB)

خاص بالنص

  • التحكم في التنسيق المسبق
    • علامة الرقم العربي (U+0600)
    • علامة عربية سنه (U+0601)
    • علامة الحاشية العربية (U+0602)
    • علامة عربية سفحة (U+0603)
    • علامة عربية سامفات (U+0604)
    • علامة الرقم العربي أعلاه (U+0605)
    • نهاية الآية (U+06DD)
    • علامة الاختصار السريانية (U+070F)
    • علامة الجنيه العربي أعلاه (U+0890)
    • علامة قرش عربية أعلاه (U+0891)
    • علامة رقم كايثي (U+110BD)
    • علامة رقم كايثى بالأعلى (U+110CD)
  • الهيروغليفية المصرية
    • وصلة عمودية للكتابة الهيروغليفية المصرية (U+13430)
    • وصلة أفقية للكتابة الهيروغليفية المصرية (U+13431)
    • إدراج الهيروغليفية المصرية في أعلى البداية (U+13432)
    • إدراج الهيروغليفية المصرية في أسفل البداية (U+13433)
    • إدراج الهيروغليفية المصرية في الطرف العلوي (U+13434)
    • إدخال الهيروغليفية المصرية في الطرف السفلي (U+13435)
    • طبقة الهيروغليفية المصرية الوسطى (U+13436)
    • الجزء الأول من الهيروغليفية المصرية (U+13437)
    • القطعة النهائية للكتابة الهيروغليفية المصرية (U+13438)
    • إدراج الهيروغليفية المصرية في المنتصف (U+13439)
    • إدراج الهيروغليفية المصرية في الأعلى (U+1343A)
    • كتابة هيروغليفية مصرية في الأسفل (U+1343B)
    • بداية السور الهيروغليفي المصري (U+1343C)
    • غلاف نهاية الهيروغليفية المصرية (U+1343D)
    • سور محاط بالهيروغليفية المصرية (U+1343E)
    • سور مغلق منقوش عليه كتابة هيروغليفية مصرية (U+1343F)
  • براهمي
    • رابط رقم براهمي (U+1107F)
  • تشكيل الحروف الميتة في النصوص المستمدة من البراهمي ( فيراما والأنماط الإملائية المشابهة)
    • علامة ديفاناغاري فيراما (U+094D)
    • علامة البنغالية فيراما (U+09CD)
    • علامة جورموكي فيراما (U+0A4D)
    • علامة غوجاراتية فيراما (U+0ACD)
    • علامة أوريا فيراما (U+0B4D)
    • علامة التاميل فيراما (U+0BCD)
    • علامة التيلجو فيراما (U+0C4D)
    • لغة كانادا فيراما (U+0CCD)
    • علامة المالايالامية شريط عمودي Virama (U+0D3B)
    • علامة مالايالامية دائرية فيراما (U+0D3C)
    • علامة المالايالامية فيراما (U+0D4D)
    • علامة اللاكونا السنهالية (U+0DCA)
    • الحرف التايلاندي فينثو (U+0E3A)
    • الحرف التايلاندي ياماكان (U+0E4E)
    • لغة لاوسية بالي فيراما (U+0EBA)
    • علامة ميانمار فيراما (U+1039)
    • علامة تاغالوغية فيراما (U+1714)
    • علامة تاغالوغية بامودبود (U+1715)
    • هانونو ساين بامودبود (U+1734)
    • علامة الخمير فيريام (U+17D1)
    • لغة السين الخميرية كوينج (U+17D2)
    • علامة تاي تام ساكوت (U+1A60)
    • تاي ثام ساين را هام (U+1A7A)
    • أديج أديج بالينيزي (U+1B44)
    • علامة سودانية بامايه (U+1BAA)
    • علامة سوندانيز فيراما (U+1BAB)
    • باتاك بانجولات (U+1BF2)
    • باتاك بانونجونان (U+1BF3)
    • سيلوتي ناجري ساين حسنتا (U+A806)
    • علامة سيلوتي ناغري الحسنة البديلة (U+A82C)
    • سوراشترا ساين فيراما (U+A8C4)
    • ريجانج فيراما (U+A953)
    • بانجكون الجاوية (U+A9C0)
    • ميتي مايك فيراما (U+AAF6)
    • خاروشتي فيراما (U+10A3F)
    • براهمي فيراما (U+11046)
    • علامة براهمي التاميلية القديمة فيراما (U+11070)
    • علامة كايثي فيراما (U+110B9)
    • تشاكما فيراما (U+11133)
    • علامة شارادا فيراما (U+111C0)
    • علامة خوجكي فيراما (U+11235)
    • خداوادي ساين فيراما (U+112EA)
    • علامة جرانثا فيراما (U+1134D)
    • علامة تولو-تيجالاري فيراما (U+113CE)
    • علامة Tulu-Tigalari Looped Virama (U+113CF)
    • وصلة تولو-تيغالاري (U+113D0)
    • نيوا ساين فيراما (U+11442)
    • علامة تيرهوتا فيراما (U+114C2)
    • سيدام ساين فيراما (U+115BF)
    • علامة مودي فيراما (U+1163F)
    • علامة تاكري فيراما (U+116B6)
    • قاتل علامة أهوم (U+1172B)
    • برج دوجرا فيراما (U+11839)
    • الغطس أكورو ساين هالانتا (U+1193D)
    • الغوص في أكورو فيراما (U+1193E)
    • نانديناجاري ساين فيراما (U+119E0)
    • لافتة ميدان زانبازار فيراما (U+11A34)
    • ساحة زانابازار الملحقة (U+11A47)
    • سويومبو المنضم (U+11A99)
    • بايكسوكي ساين فيراما (U+11C3F)
    • ماسارام ​​جوندي ساين هالانتا (U+11D44)
    • ماسارام ​​جوندي فيراما (U+11D45)
    • غونجالا جوندي فيراما (U+11D97)
    • قاتل علامة كاوي (U+11F41)
    • كاوي كونكوينر (U+11F42)
    • جورونج كيما ساين ثولهوما (U+1612F)
    • كيرات راي ساين فيراما (U+16D6B)
    • ساعة كيرات راي ساين (U+16D6C)
  • فيراما تاريخية مع وظائف أخرى
    • التبت مارك هالانتا (U+0F84)
    • ميانمار علامة Asat (U+103A)
    • علامة ليمبو Sa-I (U+193B)
    • ميتي مايك أبون إيك (U+ABED)
    • تشاكما مايا (U+11134)
  • محددات التنوع المنغولية
    • محدد التنوع الحر المنغولي رقم واحد (U+180B)
    • محدد التباين الحر المنغولي الثاني (U+180C)
    • محدد التباين الحر المنغولي الثالث (U+180D)
    • فاصل الحروف المتحركة المنغولية (U+180E)
  • محددات التباين العامة
    • محدد التباين من 1 إلى -16 (U+FE00–U+FE0F)
    • محدد التباين من 17 إلى -256 (U+E0100–U+E01EF)
  • أحرف العلامة (U+E0001 وU+E0020–U+E007F)
  • تيفيناغ
    • تيفيناغ النجار الساكن (U+2D7F)
  • أوغام
    • علامة أوغام الفضائية (U+1680)
  • أيديوغرافي
    • مؤشر التباين الأيديوغرافي (U+303E)
    • الوصف الإيديوغرافي (U+2FF0–U+2FFB)
  • التحكم في التنسيق الموسيقي
    • الرمز الموسيقي يبدأ الشعاع (U+1D173)
    • شعاع نهاية الرمز الموسيقي (U+1D174)
    • الرمز الموسيقي يبدأ بالتعادل (U+1D175)
    • رابط نهاية الرمز الموسيقي (U+1D176)
    • الرمز الموسيقي يبدأ بالترديد (U+1D177)
    • نهاية الرمز الموسيقي (U+1D178)
    • الرمز الموسيقي يبدأ العبارة (U+1D179)
    • الرمز الموسيقي في نهاية العبارة (U+1D17A)
  • التحكم في تنسيق الاختزال
    • تنسيق الاختزال لتداخل الحروف (U+1BCA0)
    • تنسيق الاختزال التداخل المستمر (U+1BCA1)
    • تنسيق الاختزال خطوة لأسفل (U+1BCA2)
    • تنسيق الاختزال خطوة تصاعدية (U+1BCA3)
  • التنسيق البديل المهجور
    • تثبيط التبادل المتماثل (U+206A)
    • تفعيل التبادل المتماثل (U+206B)
    • منع تشكيل الشكل العربي (U+206C)
    • تفعيل تشكيل النموذج العربي (U+206D)
    • الأشكال الرقمية الوطنية (U+206E)
    • أشكال الأرقام الإسمية (U+206F)

آحرون

  • حرف استبدال الكائن (U+FFFC)
  • الحرف البديل (U+FFFD)

الأحرف مقابل نقاط الكود

إن مصطلح "الحرف" غير محدد بشكل جيد، وما نشير إليه في أغلب الأحيان هو الحرف . يتم تمثيل الحرف بصريًا من خلال حرفه . يمكن للخط المستخدم (يُشار إليه غالبًا بالخطأ باسم الخط ) أن يصور الاختلافات البصرية لنفس الحرف. من الممكن أن يكون لحرفين مختلفين نفس الحرف تمامًا أو أن يكونا قريبين بصريًا لدرجة أن القارئ العادي لا يستطيع التمييز بينهما.

يتم تمثيل الحرف دائمًا تقريبًا بنقطة رمز واحدة، على سبيل المثال يتم تمثيل الحرف اللاتيني الكبير A بنقطة الرمز U+0041 فقط.

الحرف اللاتيني الكبير A مع علامة التشكيل Ä هو مثال حيث يمكن تمثيل الحرف بأكثر من نقطة رمز واحدة. يمكن أن يكون U+00C4، أو U+0041U+0308. U+0041 هو حرف A المألوف وU+0308 هو علامة التشكيل المركبة ̈ ، وهي علامة تشكيل مركبة .

عندما تكون علامة الجمع مجاورة لنقطة رمز علامة غير مجمعة، يجب على تطبيقات عرض النص أن تفرض علامة الجمع على الحرف الذي يمثله نقطة الرمز الأخرى لتشكيل رسم بياني وفقًا لمجموعة من القواعد. [7]

وبالتالي فإن كلمة BÄM تتكون من ثلاثة حروف. وقد تتكون من ثلاث نقاط رمزية أو أكثر اعتمادًا على كيفية تكوين الحروف فعليًا.

المسافات البيضاء، والوصلات، والفواصل

يوفر Unicode قائمة بالأحرف التي يعتبرها أحرف مسافة بيضاء لدعم التوافق. قد تستخدم تطبيقات البرامج والمعايير الأخرى المصطلح للإشارة إلى مجموعة مختلفة قليلاً من الأحرف. على سبيل المثال، لا تعتبر Java U+00A0 NO-BREAK SPACE أو U+0085 <control-0085>   (NEXT LINE) لتكون مسافات بيضاء، على الرغم من أن Unicode يفعل ذلك. أحرف المسافات البيضاء هي أحرف مخصصة عادةً لبيئات البرمجة. غالبًا ما لا يكون لها معنى نحوي في مثل هذه البيئات البرمجية ويتم تجاهلها بواسطة مفسرين الآلة. يعين Unicode أحرف التحكم القديمة U+0009 إلى U+000D وU+0085 كأحرف مسافات بيضاء، بالإضافة إلى جميع الأحرف التي تكون قيمة خاصية الفئة العامة الخاصة بها هي Separator. يوجد 25 حرف مسافة بيضاء إجماليًا اعتبارًا من Unicode 16.0.

الوصلات وغير الوصلات للجرافيم

يتحكم الموصل ذو العرض الصفري (U+200D) وغير الموصل ذو العرض الصفري (U+200C) في ضم الحروف الهيروغليفية وربطها. لا يتسبب الموصل في جعل الحروف التي لا يمكن ضمها أو ربطها تفعل ذلك، ولكن عند إقرانها مع غير الموصل يمكن استخدام هذه الحروف للتحكم في خصائص ضم وربط الحرفين المحيطين اللذين يمكن ضمهما أو ربطهما. يستخدم موصل الحروف المجمعة (U+034F) للتمييز بين حرفين أساسيين كأساس مشترك أو ثنائي الحروف، غالبًا لمعالجة النصوص الأساسية، وترتيب السلاسل، وطي الحالة وما إلى ذلك.

وصلات وفصل الكلمات

إن الفاصل بين الكلمات الأكثر شيوعًا هو المسافة (U+0020). ومع ذلك، هناك وصلات وفاصلات أخرى للكلمات تشير أيضًا إلى فاصل بين الكلمات وتشارك في خوارزميات كسر السطر. كما تنتج المسافة التي لا تنقطع (U+00A0) تقدمًا في خط الأساس بدون رمز ولكنها تمنع بدلاً من تمكين كسر السطر. تسمح المسافة ذات العرض الصفري (U+200B) بكسر السطر ولكنها لا توفر أي مساحة: بمعنى ما تربط بين كلمتين بدلاً من فصلهما. أخيرًا، تمنع وصلة الكلمات (U+2060) فواصل الأسطر ولا تتضمن أيضًا أيًا من المسافات البيضاء الناتجة عن تقدم خط الأساس.

تقدم خط الأساس لا يوجد تقدم أساسي
السماح بكسر السطر
(الفواصل)
الفضاء U+0020 مساحة عرض صفرية U+200B
منع كسر السطر
(الوصلات)
مساحة لا تنقطع U+00A0 برنامج دمج الكلمات U+2060

فواصل أخرى

  • فاصل السطور (U+2028)
  • فاصل الفقرات (U+2029)

توفر هذه الأحرف لـ Unicode فواصل فقرات وسطور أصلية مستقلة عن أحرف التحكم ASCII المشفرة القديمة مثل إرجاع العربة (U+000A) وتغذية السطر (U+000D) والسطر التالي (U+0085). لا يوفر Unicode أحرف تحكم تنسيق ASCII أخرى والتي من المفترض أنها ليست جزءًا من نموذج معالجة النص العادي Unicode. تتضمن أحرف التحكم في التنسيق القديمة هذه علامة التبويب (U+0009) وعلامة التبويب السطرية أو علامة التبويب الرأسية (U+000B) وعلامة التغذية النموذجية (U+000C) والتي تعتبر أيضًا بمثابة فاصل صفحة.

المساحات

تُستخدم مسافة الحرف (U+0020) التي يتم إدخالها عادةً بواسطة شريط المسافة على لوحة المفاتيح كفاصل للكلمات في العديد من اللغات. ولأسباب تتعلق بالإرث، يتضمن نظام UCS أيضًا مسافات بأحجام مختلفة تعادل التوافق مع مسافة الحرف. وفي حين أن هذه المسافات ذات العرض المتغير مهمة في الطباعة، فإن نموذج معالجة Unicode يتطلب التعامل مع مثل هذه التأثيرات المرئية من خلال النص الغني والترميز وغير ذلك من البروتوكولات. وهي مدرجة في مجموعة Unicode في المقام الأول للتعامل مع الترميز ذهابًا وإيابًا بدون فقدان من ترميزات مجموعات الأحرف الأخرى. تتضمن هذه المسافات:

  1. في رباعية الدفع (U+2000)
  2. في رباعية الدفع (U+2001)
  3. في الفضاء (U+2002)
  4. في الفضاء (U+2003)
  5. مساحة ثلاثية الأبعاد (U+2004)
  6. مساحة رباعية الأبعاد (U+2005)
  7. مساحة ستة لكل إم (U+2006)
  8. مساحة الشكل (U+2007)
  9. مساحة علامات الترقيم (U+2008)
  10. الفضاء الرقيق (U+2009)
  11. مساحة الشعر (U+200A)
  12. الفضاء الرياضي المتوسط ​​(U+205F)

بصرف النظر عن مساحة ASCII الأصلية، فإن المسافات الأخرى كلها أحرف توافقية. في هذا السياق، يعني هذا أنها لا تضيف فعليًا أي محتوى دلالي إلى النص، بل توفر بدلاً من ذلك التحكم في التصميم. داخل Unicode، غالبًا ما يُشار إلى عنصر التحكم في التصميم غير الدلالي هذا باسم النص الغني وهو خارج نطاق أهداف Unicode. بدلاً من استخدام مسافات مختلفة في سياقات مختلفة، يجب التعامل مع هذا التصميم من خلال برنامج تخطيط نص ذكي.

هناك ثلاثة فواصل أخرى للكلمات خاصة بنظام الكتابة وهي:

  • فاصل الحروف المتحركة المنغولية (U+180E)
  • المساحة الأيديوجرافية (U+3000): تعمل كفاصل أيديوجرافي وعادة ما يتم تقديمها كمساحة بيضاء بنفس عرض الرسم الأيديوجرافي.
  • علامة مساحة أوغام (U+1680): يتم عرض هذه العلامة في بعض الأحيان مع صورة رمزية وفي أحيان أخرى كمسافة بيضاء فقط.

أحرف التحكم في كسر السطر

تم تصميم العديد من الأحرف للمساعدة في التحكم في فواصل الأسطر إما عن طريق تثبيطها (أحرف عدم الفواصل) أو اقتراح فواصل الأسطر مثل الواصلة الناعمة (U+00AD) (والتي تسمى أحيانًا "الواصلة الخجولة"). على الرغم من أن مثل هذه الأحرف مصممة للتصميم، إلا أنها ربما لا غنى عنها للأنواع المعقدة من فواصل الأسطر التي تجعلها ممكنة.

مانع الكسر
  1. شرطة غير قابلة للكسر (U+2011)
  2. مساحة خالية من الاستراحة (U+00A0)
  3. محدد العلامة التبتية Tsheg Bstar (U+0F0C)
  4. مساحة ضيقة بدون استراحة (U+202F)

من المفترض أن تكون الأحرف التي تمنع الانقطاع مكافئة لتسلسل أحرف مضمن في Word Joiner U+2060. ومع ذلك، يمكن إضافة Word Joiner قبل أو بعد أي حرف يسمح بكسر السطر لمنع كسر السطر.

تمكين الاستراحة
  1. شرطة ناعمة (U+00AD)
  2. التبتية مارك بين المقاطع Tsheg (U+0F0B)
  3. مساحة ذات عرض صفري (U+200B)

تشارك كل من الأحرف التي تمنع الفاصل وتسمح بالفاصل مع علامات الترقيم الأخرى وأحرف المسافة البيضاء لتمكين أنظمة تصوير النص من تحديد فواصل الأسطر داخل خوارزمية كسر الأسطر في Unicode. [8]

أنواع نقاط الترميز

تعتبر جميع نقاط الترميز التي تم تحديد غرض أو استخدام لها نقاط ترميز معينة. ومن بين هذه النقاط، قد يتم تخصيصها لحرف مجرد، أو تخصيصها لغرض آخر.

الشخصيات المخصصة

تم تخصيص أغلب نقاط الترميز المستخدمة فعليًا لأحرف مجردة. ويشمل ذلك الأحرف المخصصة للاستخدام الخاص، والتي على الرغم من عدم تعيينها رسميًا بواسطة معيار Unicode لغرض معين، إلا أنها تتطلب من المرسل والمستقبل الاتفاق مسبقًا على كيفية تفسيرها حتى يتم تبادل المعلومات بشكل مفيد.

شخصيات للاستخدام الخاص

يتضمن UCS 137468 حرفًا للاستخدام الخاص، وهي نقاط رمز للاستخدام الخاص موزعة على ثلاث كتل مختلفة، تسمى كل منها منطقة استخدام خاص (PUA). يتعرف معيار Unicode على نقاط الرمز داخل PUAs كرموز أحرف Unicode شرعية، لكنه لا يعين لها أي حرف (مجرد). بدلاً من ذلك، يكون الأفراد والمنظمات وبائعي البرامج وبائعي أنظمة التشغيل وبائعي الخطوط ومجتمعات المستخدمين النهائيين أحرارًا في استخدامها كما يرون مناسبًا. داخل الأنظمة المغلقة، يمكن للأحرف في PUA العمل بشكل لا لبس فيه، مما يسمح لمثل هذه الأنظمة بتمثيل الأحرف أو الحروف غير المحددة في Unicode. [9] في الأنظمة العامة يكون استخدامها أكثر إشكالية، حيث لا يوجد سجل ولا توجد طريقة لمنع العديد من المنظمات من تبني نفس نقاط الرمز لأغراض مختلفة. أحد الأمثلة على مثل هذا الصراع هو استخدام Apple لـ U + F8FF لشعار Apple ، مقابل استخدام ConScript Unicode Registry لـ U + F8FF كرمز تحنيط كلينجون في نص كلينجون . [10]

تحتوي المستوى الأساسي متعدد اللغات (المستوى 0) على 6400 حرف مستخدم خاص في منطقة الاستخدام الخاص المسماة باسم PUA ، والتي تتراوح من U+E000 إلى U+F8FF. تحتوي كل من مستويات الاستخدام الخاص ، المستوى 15 والمستوى 16، على PUAs خاصة بها من 65534 حرفًا للاستخدام الخاص (مع كون نقطتي الرمز الأخيرتين لكل مستوى من غير الأحرف). هذه هي منطقة الاستخدام الخاص التكميلية-A ، والتي تتراوح من U+F0000 إلى U+FFFFD، ومنطقة الاستخدام الخاص التكميلية-B ، والتي تتراوح من U+100000 إلى U+10FFFD.

تُعَد PUA مفهومًا موروثًا من بعض أنظمة الترميز الآسيوية. كانت هذه الأنظمة تحتوي على مناطق استخدام خاصة لترميز ما يطلق عليه اليابانيون gaiji (أحرف نادرة لا توجد عادةً في الخطوط) بطرق خاصة بالتطبيق.

البدائل

يستخدم UCS بدائل لمعالجة الأحرف خارج المستوى الأساسي متعدد اللغات الأولي دون اللجوء إلى تمثيلات كلمات تزيد عن 16 بت. [11] يوجد 1024 بديل "عالي" (D800–DBFF) و1024 بديل "منخفض" (DC00–DFFF). من خلال الجمع بين زوج من البدائل، يمكن معالجة الأحرف المتبقية في جميع المستويات الأخرى (1024 × 1024 = 1048576 نقطة رمز في المستويات الستة عشر الأخرى). في UTF-16 ، يجب أن تظهر دائمًا في أزواج، كبديل عالي يتبعه بديل منخفض، وبالتالي استخدام 32 بت للإشارة إلى نقطة رمز واحدة.

يشير الزوج البديل إلى نقطة الرمز

10000 16 + ( ح - د800 16 ) × 400 16 + ( ل - DC00 16 )

حيث H و L هما القيم العددية للبدائل العالية والمنخفضة على التوالي. [12]

نظرًا لأن قيم البدائل العالية في النطاق DB80–DBFF تنتج دائمًا قيمًا في مستويات الاستخدام الخاص، فيمكن تقسيم نطاق البدائل العالية إلى بدائل عالية (عادية) (D800–DB7F) و"بدائل عالية للاستخدام الخاص" (DB80–DBFF).

لا يوجد تفسير عام لنقاط الكود البديلة المعزولة؛ وبالتالي، لا يتم توفير مخططات أكواد الأحرف أو قوائم الأسماء لهذا النطاق. في لغة برمجة بايثون ، تُستخدم أكواد بديلة فردية لتضمين بايتات غير قابلة للفك في سلاسل Unicode. [13]

غير الشخصيات

يشير المصطلح غير المتصل "غير حرفي" إلى 66 نقطة رمز (مُسماة <not a character>) محجوزة بشكل دائم للاستخدام الداخلي، وبالتالي مضمونة عدم تخصيصها أبدًا لحرف. [14] لكل من المستويات السبعة عشر نقطتي رمز نهائيتين مخصصتين كأحرف غير حرفية. لذا، فإن الأحرف غير الحرفية هي: U+FFFE وU+FFFF على BMP، وU+1FFFE وU+1FFFF على المستوى 1، وهكذا، حتى U+10FFFE وU+10FFFF على المستوى 16، بإجمالي 34 نقطة رمزية. بالإضافة إلى ذلك، يوجد نطاق متجاور لـ 32 نقطة رمزية غير حرفية أخرى في BMP: U+FDD0..U+FDEF. تتمتع تطبيقات البرامج بحرية استخدام نقاط الرمز هذه للاستخدام الداخلي. أحد الأمثلة المفيدة بشكل خاص على الأحرف غير الحرفية هو نقطة الرمز U+FFFE. تحتوي نقطة الرمز هذه على تسلسل بايتات UTF-16/UCS-2 العكسي لعلامة ترتيب البايتات (U+FEFF). إذا احتوى مجرى نص على هذا الحرف غير الحرفي، فهذا مؤشر جيد على أن النص قد تم تفسيره باستخدام ترتيب البايتات غير الصحيح .

زعمت إصدارات معيار Unicode من 3.1.0 إلى 6.3.0 أن الأحرف غير المميزة "لا ينبغي أبدًا أن يتم تبادلها". وذكر التصحيح رقم 9 للمعيار لاحقًا أن هذا يؤدي إلى "رفض مفرط غير مناسب"، موضحًا أن "[الأحرف غير المميزة] ليست غير قانونية في التبادل ولا تسبب نصًا غير صحيح في Unicode"، وإزالة الادعاء الأصلي.

نقاط الكود المحجوزة

يشار إلى جميع نقاط الترميز الأخرى، التي لم يتم تحديدها، بأنها محجوزة. وقد يتم تخصيص نقاط الترميز هذه لاستخدام معين في الإصدارات المستقبلية من معيار Unicode.

الأحرف ومجموعات الحروف والرموز

في حين أن العديد من مجموعات الأحرف الأخرى تعين حرفًا لكل تمثيل ممكن للحرف، فإن Unicode يسعى إلى التعامل مع الأحرف بشكل منفصل عن الحروف. هذا التمييز ليس واضحًا دائمًا؛ ومع ذلك، ستساعد بعض الأمثلة في توضيح التمييز. غالبًا ما يمكن دمج حرفين طباعيًا لتحسين قابلية قراءة النص. على سبيل المثال، يمكن التعامل مع تسلسل الأحرف الثلاثة "ffi" كحرف واحد. غالبًا ما تقوم مجموعات الأحرف الأخرى بتعيين نقطة رمز لهذا الحرف بالإضافة إلى الحروف الفردية: "f" و"i".

بالإضافة إلى ذلك، يتعامل Unicode مع الحروف المعدلة بالتشكيل كأحرف منفصلة، ​​وعند عرضها، تصبح رمزًا واحدًا. على سبيل المثال، حرف "o" مع التشكيل : " ö ". تقليديًا، كانت مجموعات الأحرف الأخرى تخصص نقطة رمز حرف فريدة لكل حرف معدّل بالتشكيل يستخدم في كل لغة. يسعى Unicode إلى إنشاء نهج أكثر مرونة من خلال السماح بدمج الحروف المعدلة بالتشكيل مع أي حرف. وهذا لديه القدرة على تقليل عدد نقاط الرمز النشطة المطلوبة لمجموعة الأحرف بشكل كبير. على سبيل المثال، ضع في اعتبارك لغة تستخدم النص اللاتيني وتجمع بين التشكيل والحروف الكبيرة والصغيرة "a" و"o" و"u". مع نهج Unicode، يلزم إضافة حرف التشكيل فقط إلى مجموعة الأحرف لاستخدامه مع الحروف اللاتينية: "a" و"A" و"o" و"O" و"u" و"U": سبعة أحرف في المجموع. تحتاج مجموعة الأحرف القديمة إلى إضافة ستة أحرف مركبة مسبقًا مع علامات ترقيم بالإضافة إلى نقاط الترميز الستة التي تستخدمها للأحرف بدون علامات ترقيم: ما مجموعه اثنتي عشرة نقطة ترميز حرف.

شخصيات متوافقة

يتضمن UCS آلاف الأحرف التي يعينها Unicode كأحرف متوافقة. وهي الأحرف التي تم تضمينها في UCS بهدف توفير نقاط رمز مميزة للأحرف التي تميزها مجموعات الأحرف الأخرى، ولكن لا يمكن تمييزها في نهج Unicode للأحرف.

كان السبب الرئيسي وراء هذا التمييز هو أن Unicode يميز بين الأحرف والرموز. على سبيل المثال، عند كتابة اللغة الإنجليزية بأسلوب الكتابة اليدوية ، قد يتخذ الحرف "i" أشكالًا مختلفة سواء ظهر في بداية الكلمة أو في نهايتها أو في منتصفها أو منفردًا. اللغات مثل اللغة العربية المكتوبة بخط عربي تكون دائمًا بخط يدوي. كل حرف له أشكال مختلفة عديدة. يتضمن UCS 730 حرفًا عربيًا تتحلل إلى 88 حرفًا عربيًا فريدًا فقط. ومع ذلك، يتم تضمين هذه الأحرف العربية الإضافية حتى تتمكن برامج معالجة النصوص من ترجمة النص من مجموعات أحرف أخرى إلى UCS والعكس مرة أخرى دون أي فقدان للمعلومات المهمة للبرامج غير Unicode.

ومع ذلك، بالنسبة لـ UCS وUnicode على وجه الخصوص، فإن النهج المفضل هو ترميز أو تعيين هذا الحرف دائمًا إلى نفس الحرف بغض النظر عن مكان ظهوره في الكلمة. ثم يتم تحديد الأشكال المميزة لكل حرف من خلال طرق برمجيات تخطيط الخط والنص. وبهذه الطريقة، تظل الذاكرة الداخلية للأحرف متطابقة بغض النظر عن مكان ظهور الحرف في الكلمة. وهذا يبسط إلى حد كبير عمليات البحث والفرز وغيرها من عمليات معالجة النصوص.

خصائص الشخصية

يتم تعريف كل حرف في Unicode بمجموعة كبيرة ومتنامية من الخصائص. معظم هذه الخصائص ليست جزءًا من مجموعة الأحرف العالمية. تسهل الخصائص معالجة النصوص بما في ذلك ترتيب النصوص أو فرزها، وتحديد الكلمات والجمل والرسومات، ورسم النصوص أو تصويرها وما إلى ذلك. فيما يلي قائمة ببعض الخصائص الأساسية. هناك العديد من الخصائص الأخرى الموثقة في قاعدة بيانات أحرف Unicode. [15]

ملكية مثال تفاصيل
اسم الحرف اللاتيني الكبير A هذا اسم دائم تم تعيينه من خلال التعاون المشترك بين Unicode وISO UCS. هناك عدد قليل من الأسماء المعروفة التي تم اختيارها بشكل سيئ والتي تم الاعتراف بها (على سبيل المثال U+FE18 PRESENTATION FOR VERTICAL RIGHT WHITE LENTICULAR BRAKCET، والتي تم كتابتها بشكل خاطئ - يجب أن تكون BRACKET) ولكن لن يتم تغييرها، من أجل ضمان استقرار المواصفات. [16]
نقطة الكود يو+0041 نقطة ترميز Unicode هي رقم يتم تعيينه بشكل دائم أيضًا مع خاصية "Name" ويتم تضمينه في UCS المرافق. والعرف المعتاد هو تمثيل نقطة الترميز كرقم سداسي عشري مع البادئة "U+" أمامه.
رمز تمثيلي [17] يتم توفير الحروف الرسومية التمثيلية في مخططات التعليمات البرمجية. [18]
الفئة العامة حرف كبير يتم التعبير عن الفئة العامة [19] على هيئة تسلسل مكون من حرفين مثل "Lu" للحرف الكبير أو "Nd" للرقم العشري.
دمج الطبقات لم يتم إعادة ترتيبه (0) نظرًا لأنه يمكن التعبير عن علامات التشكيل وعلامات الجمع الأخرى بأحرف متعددة في Unicode، فإن خاصية "فئة الجمع" تسمح بتمييز الأحرف حسب نوع حرف الجمع الذي تمثله. يمكن التعبير عن فئة الجمع كعدد صحيح بين 0 و255 أو كقيمة مسماة. تسمح القيم الصحيحة بإعادة ترتيب علامات الجمع إلى ترتيب أساسي لجعل مقارنة السلاسل المتطابقة ممكنة.
فئة ثنائية الاتجاه من اليسار إلى اليمين يشير إلى نوع الحرف لتطبيق خوارزمية Unicode ثنائية الاتجاه.
مرآة ثنائية الاتجاه لا يشير إلى ضرورة عكس أو عكس حرف الخط داخل الخوارزمية ثنائية الاتجاه. يمكن لصانعي الخطوط توفير الحروف المعكوسة، أو استخراجها من أحرف أخرى ذات صلة من خلال خاصية "حرف الخط المعكوس ثنائي الاتجاه" أو توليفها بواسطة نظام عرض النص.
رمز الانعكاس ثنائي الاتجاه غير متاح تشير هذه الخاصية إلى نقطة رمز حرف آخر يمكن أن يعمل حرفه كحرف معكوس للحرف الحالي عند النسخ داخل الخوارزمية ثنائية الاتجاه.
قيمة الرقم العشري نان بالنسبة للأرقام، تشير هذه الخاصية إلى القيمة الرقمية للحرف. الأرقام العشرية لها القيم الثلاث مضبوطة على نفس القيمة، والأحرف المتوافقة مع النص الغني للعرض والأرقام غير العشرية العربية الهندية الأخرى عادةً ما يكون لها الخاصيتان الأخيرتان فقط مضبوطتين على القيمة الرقمية للحرف بينما الأرقام غير المرتبطة بالأرقام العربية الهندية مثل الأرقام الرومانية أو أرقام هانزو/سوزو عادةً ما يكون لها فقط "القيمة الرقمية" المشار إليها.
قيمة الرقم نان
القيمة العددية نان
أيديوغرافي خطأ شنيع يشير إلى أن الحرف عبارة عن إيديوجراف CJK : لوجوجراف بخط الهان . [20]
افتراضيا قابل للتجاهل خطأ شنيع يشير إلى أن الحرف قابل للتجاهل بالنسبة للتنفيذات وأنه لا يلزم عرض أي رمز أو رمز الملاذ الأخير أو حرف بديل.
مُهمل خطأ شنيع لا يقوم Unicode بإزالة الأحرف من المجموعة أبدًا، ولكن في بعض الأحيان يقوم Unicode بإلغاء عدد صغير من الأحرف.

يوفر Unicode قاعدة بيانات عبر الإنترنت [21] للاستعلام بشكل تفاعلي عن مجموعة أحرف Unicode بالكامل من خلال الخصائص المختلفة.

انظر أيضا

مراجع

  1. ^ "معيار يونيكود". اتحاد يونيكود . تم استرجاعه في 2016-08-09 .
  2. ^ "خرائط الطريق إلى يونيكود". اتحاد يونيكود . تم الاسترجاع في 12 سبتمبر 2024 .
  3. ^ "الأسئلة الشائعة - الشخصيات ذات الاستخدام الخاص، وغير الشخصيات، والحراس". www.unicode.org . تم الاسترجاع في 2023-10-24 .
  4. ^ "القسم 2.13: الأحرف الخاصة". معيار يونيكود . اتحاد يونيكود. سبتمبر 2024.
  5. ^ "القسم 4.12: الأحرف ذات الخصائص غير العادية". معيار يونيكود . اتحاد يونيكود. سبتمبر 2024.
  6. ^ "القسم 6.2: علامات الترقيم العامة". معيار يونيكود . اتحاد يونيكود. سبتمبر 2024.
  7. ^ "UTN #2: طريقة عامة لتقديم العلامات المجمعة". www.unicode.org . تم الاسترجاع في 2020-12-16 .
  8. ^ "UAX #14: Unicode Line Breaking Algorithm". اتحاد Unicode. 2016-06-01 . تم الاسترجاع في 2016-08-09 .
  9. ^ "القسم 23.5: الأحرف المخصصة للاستخدام الخاص" (PDF) . معيار يونيكود . اتحاد يونيكود. سبتمبر 2022.
  10. ^ مايكل إيفرسون (2004-01-15). "الكلينجون: U+F8D0 - U+F8FF".
  11. ^ "القسم 23.6: منطقة البدائل" (PDF) . معيار يونيكود . اتحاد يونيكود. سبتمبر 2022.
  12. ^ كابلان، مايكل. "الدعم البديل في منتجات مايكروسوفت".
  13. ^ v. Löwis, Martin (2009-04-22). "البايتات غير القابلة للفك في واجهات أحرف النظام". مقترحات تحسين بايثون . PEP 383. تم الاسترجاع في 2016-08-09 .
  14. ^ "القسم 23.7: غير الحروف" (PDF) . معيار يونيكود . اتحاد يونيكود. سبتمبر 2022.
  15. ^ "قاعدة بيانات أحرف يونيكود". اتحاد يونيكود . تم الاسترجاع في 2016-08-09 .
  16. ^ Freytag, Asmus; McGowan, Rick; Whistler, Ken. "Unicode Technical Note #27 — Known Anomalies in Unicode Character Names". Unicode Consortium.
  17. ^ ليس الرمز التمثيلي الرسمي لليونيكود، بل مجرد رمز تمثيلي. لرؤية الرمز التمثيلي الرسمي لليونيكود، راجع مخططات الكود.
  18. ^ "مخططات رموز الأحرف". اتحاد يونيكود . تم الاسترجاع في 2016-08-09 .
  19. ^ "UAX #44: قاعدة بيانات أحرف Unicode". قيم الفئة العامة . اتحاد Unicode. 2014-06-05 . تم الاسترجاع في 2016-08-09 .
  20. ^ Davis, Mark; Iancu, Laurențiu; Whistler, Ken. "الجدول 9. جدول الخصائص § PropList.txt". الملحق رقم 44 لمعيار يونيكود — قاعدة بيانات أحرف يونيكود . اتحاد يونيكود.
  21. ^ "أدوات Unicode: فهرس خصائص الأحرف". اتحاد Unicode . تم الاسترجاع في 2015-06-09 .
  • اتحاد يونيكود
  • decodeunicode.org ويكي يونيكود مع جميع الأحرف الرسومية البالغ عددها 98884 من يونيكود 5.0 بصيغة صور متحركة، والبحث عن النص الكامل
  • أحرف Unicode حسب الخاصية
تم الاسترجاع من "https://en.wikipedia.org/w/index.php?title=مجموعة_الأحرف_العالمية_أحرف&oldid=1255067307"
Original text
Rate this translation
Your feedback will be used to help improve Google Translate