يونيكود

يونيكود (المعروف أيضًا باسم معيار يونيكود و TUS [ 1 ] [ 2 ] ) هو معيار لترميز الأحرف تديره منظمة يونيكود، وهو مصمم لدعم استخدام النصوص في جميع أنظمة الكتابة العالمية القابلة للرقمنة. يُعرّف الإصدار 17.0 [ A ] 159,801 حرفًا و172 نظام كتابة [ 3 ] تُستخدم في سياقات متنوعة، منها العادية والأدبية والأكاديمية والتقنية.

لقد حلّ نظام يونيكود إلى حد كبير محلّ بيئة مجموعات الأحرف المتعددة غير المتوافقة التي كانت تُستخدم في مختلف المناطق وعلى بنى حاسوبية مختلفة. تم دمج جميع هذه المجموعات، بالإضافة إلى العديد من الأحرف الإضافية، في مجموعة يونيكود واحدة. يُستخدم يونيكود لترميز الغالبية العظمى من النصوص على الإنترنت، بما في ذلك معظم صفحات الويب ، وأصبح دعم يونيكود من الاعتبارات الشائعة في تطوير البرمجيات المعاصرة. يستطيع يونيكود في نهاية المطاف ترميز أكثر من 1.1 مليون حرف.

تتزامن مجموعة أحرف يونيكود مع معيار ISO/IEC 10646 ، حيث يتطابق كل منهما تمامًا. ومع ذلك، فإن معيار يونيكود ليس مجرد مجموعة تُخصص لها الأحرف، بل يوفر أيضًا، لمساعدة المطورين والمصممين، جداول وبيانات مرجعية، بالإضافة إلى ملاحق تشرح المفاهيم المتعلقة بمختلف أنظمة الكتابة، وتقدم إرشادات لتطبيقها. تشمل المواضيع التي تغطيها هذه الملاحق توحيد الأحرف ، وتركيبها وتفكيكها ، وترتيبها ، واتجاهها . [ 4 ]

يُشفّر نظام يونيكود 3790 رمزًا تعبيريًا ، ويستمر تطويره من قِبل الاتحاد كجزء من المعيار. [ 5 ] وكان لانتشار استخدام يونيكود دور كبير في الانتشار الأولي للرموز التعبيرية خارج اليابان.

تُعالَج نصوص يونيكود وتُخزَّن كبيانات ثنائية باستخدام إحدى ترميزات متعددة ، تُحدِّد كيفية ترجمة رموز الأحرف المجردة في المعيار إلى سلاسل من البايتات. يُحدِّد معيار يونيكود نفسه ثلاث ترميزات: UTF-8 و UTF-16 و UTF -32 ، مع وجود ترميزات أخرى . يُعدّ UTF-8 الأكثر استخدامًا على نطاق واسع، ويعود ذلك جزئيًا إلى توافقه مع ترميز ASCII .

الأصل والتطور

صُمم نظام يونيكود في الأصل بهدف تجاوز القيود الموجودة في جميع ترميزات النصوص المصممة حتى ذلك الحين: حيث كان يُعتمد على كل ترميز لاستخدامه في سياقه الخاص، دون أي توقع محدد للتوافق مع أي ترميز آخر. في الواقع، غالبًا ما كان أي ترميزان يتم اختيارهما غير قابلين للاستخدام معًا، حيث يُفسر النص المُرمز بأحدهما على أنه أحرف غير مفهومة بواسطة الآخر. وقد صُممت معظم الترميزات لتسهيل التفاعل بين عدد محدود من اللغات - غالبًا بشكل أساسي بين لغة معينة والأحرف اللاتينية - وليس بين عدد كبير من اللغات، ولم يتم التعامل مع جميع اللغات المدعومة بطريقة متسقة.

تسعى فلسفة يونيكود إلى ترميز الأحرف الأساسية - أي الوحدات الكتابية وما يشبهها - بدلاً من التمييزات الرسومية التي تُعتبر مجرد أشكال مختلفة منها، والتي يُفضل معالجتها بواسطة نوع الخط ، أو باستخدام لغة الترميز ، أو بوسائل أخرى. في الحالات المعقدة بشكل خاص، مثل معالجة الاختلافات الإملائية في أحرف الهان ، يوجد خلاف كبير حول أي الاختلافات تبرر ترميزها الخاص، وأيها مجرد اختلافات رسومية لأحرف أخرى.

على المستوى الأكثر تجريدًا، يُخصص نظام يونيكود رقمًا فريدًا يُسمى نقطة الترميز لكل حرف. وتُترك العديد من مسائل التمثيل المرئي - بما في ذلك الحجم والشكل والنمط - لتقدير البرنامج الذي يعرض النص فعليًا، مثل متصفح الويب أو معالج النصوص . ومع ذلك، وجزئيًا بهدف تشجيع التبني السريع، أصبحت بساطة هذا النموذج الأصلي أكثر تعقيدًا بمرور الوقت، وقُدمت تنازلات عملية مختلفة خلال مراحل تطوير المعيار.

تُطابق أول 256 نقطة ترميز معيار ISO/IEC 8859-1 ، بهدف تبسيط تحويل النصوص المكتوبة مسبقًا بالخطوط الأوروبية الغربية. وللحفاظ على الفروقات بين مختلف الترميزات القديمة، وبالتالي السماح بالتحويل بينها وبين يونيكود دون فقدان أي معلومات، مُنحت العديد من الأحرف المتشابهة تقريبًا ، شكلاً ووظيفةً، نقاط ترميز مميزة. على سبيل المثال، تشمل كتلة "أحرف نصف العرض وأحرف العرض الكامل" نسخةً دلاليةً كاملةً من الأبجدية اللاتينية، لأن ترميزات CJK القديمة كانت تحتوي على أحرف "عرض كامل" (تُطابق عرض أحرف CJK) وأحرف "نصف عرض" (تُطابق عرض الأحرف اللاتينية العادية).

تاريخ

تعود أصول يونيكود إلى ثمانينيات القرن العشرين، إلى مجموعة من الأفراد ذوي الصلة بمعيار ترميز الأحرف لشركة زيروكس (XCCS). [ 6 ] في عام 1987، بدأ جو بيكر ، الموظف في زيروكس، بالتعاون مع لي كولينز ومارك ديفيس ، الموظفين في شركة آبل ، بدراسة الجوانب العملية لإنشاء مجموعة أحرف عالمية. [ 7 ] وبمساهمة إضافية من بيتر فينويك وديف أوبستاد ، [ 6 ] نشر بيكر مسودة اقتراح لنظام ترميز أحرف نصي دولي/متعدد اللغات في أغسطس 1988، والذي أُطلق عليه مبدئيًا اسم يونيكود. وأوضح أن "اسم يونيكود يهدف إلى الإيحاء بترميز فريد وموحد وعالمي". [ 6 ]

في هذه الوثيقة، بعنوان Unicode 88 ، حدد بيكر مخططًا باستخدام أحرف 16 بت : [ 6 ]

يهدف نظام يونيكود إلى تلبية الحاجة إلى ترميز نصي عالمي عملي وموثوق. ويمكن وصف يونيكود تقريبًا بأنه " ASCII عريض النطاق " تم توسيعه إلى 16  بت ليشمل أحرف جميع اللغات الحية في العالم. وفي تصميم هندسي سليم،  يُعدّ 16 بت لكل حرف أكثر من كافٍ لهذا الغرض.

تم اتخاذ قرار التصميم هذا بناءً على افتراض أن النصوص والأحرف المستخدمة "الحديثة" فقط هي التي تتطلب التشفير: [ 6 ]

يُولي نظام يونيكود أولويةً قصوى لضمان فائدة النظام في المستقبل على حساب الحفاظ على التراث القديم. ويهدف يونيكود في المقام الأول إلى الأحرف المنشورة في النصوص الحديثة (مثل تلك المستخدمة في جميع الصحف والمجلات المطبوعة في العالم عام ١٩٨٨)، والتي يقل عددها بلا شك عن ١٦٣٨٤ حرفًا (٢^ ١٤) . وبخلاف هذه الأحرف الحديثة، يمكن اعتبار جميع الأحرف الأخرى قديمة أو نادرة الاستخدام؛ وهي مرشحة أفضل للتسجيل للاستخدام الخاص بدلاً من إثقال قائمة يونيكود العامة ذات الفائدة العامة.

في أوائل عام 1989، توسع فريق عمل يونيكود ليشمل كين ويستلر ومايك كيرناغان من شركة ميتافور، وكارين سميث-يوشيمورا وجوان أليبراند من مجموعة مكتبات الأبحاث ، وجلين رايت من شركة صن مايكروسيستمز . وكانت لدى مجموعة مكتبات الأبحاث حلٌّ قائمٌ لمجموعات الأحرف الآسيوية الشرقية، والذي أصبح أحد مدخلات مجموعة أحرف يونيكود. [ 7 ] وفي عام 1990، انضم إلى الفريق أيضًا ميشيل سويجنارد وأسموس فريتاج من شركة مايكروسوفت ، وريك ماكجوان من شركة نيكست . وبحلول نهاية عام 1990، اكتمل معظم العمل المتعلق بإعادة رسم المعايير الحالية، وأصبحت مسودة المراجعة النهائية ليونيكود جاهزة.

تأسس اتحاد يونيكود في كاليفورنيا في 3 يناير 1991، [ 8 ] ونُشر المجلد الأول من معيار يونيكود في أكتوبر من ذلك العام. أما المجلد الثاني، الذي أضاف الأحرف الصينية (هان)، فقد نُشر في يونيو 1992.

في عام ١٩٩٦، طُبقت آلية الأحرف البديلة في يونيكود ٢.٠، مما مكّن يونيكود من تجاوز ١٦ بتًا. وقد أدى ذلك إلى زيادة مساحة ترميز يونيكود إلى أكثر من مليون نقطة ترميز، مما سمح بترميز العديد من الكتابات التاريخية، مثل الهيروغليفية المصرية ، وآلاف الأحرف النادرة الاستخدام أو القديمة التي لم يكن من المتوقع إدراجها في المعيار. ومن بين هذه الأحرف، توجد أحرف صينية يابانية كورية نادرة الاستخدام - يُستخدم الكثير منها بشكل أساسي في الأسماء العلمية، مما يجعلها أكثر ضرورة للترميز العالمي مما كان متوقعًا في بنية يونيكود الأصلية. [ ٩ ]

اتحاد يونيكود

اتحاد يونيكود هو منظمة غير ربحية تتولى تنسيق تطوير يونيكود. ويضم أعضاؤه الكاملون معظم شركات برامج وأجهزة الكمبيوتر الرئيسية (وعدد قليل من الشركات الأخرى) المهتمة بمعايير معالجة النصوص، بما في ذلك أدوبي ، وآبل ، وجوجل ، وآي بي إم ، وميتا (التي كانت تُعرف سابقًا باسم فيسبوك)، ومايكروسوفت ، ونتفليكس ، وساب . [ 10 ]

على مر السنين، انضمت عدة دول أو وكالات حكومية إلى اتحاد يونيكود. [ 10 ]

لدى الاتحاد هدف طموح يتمثل في استبدال أنظمة ترميز الأحرف الحالية بنظام Unicode وأنظمة تنسيق تحويل Unicode القياسية (UTF)، حيث أن العديد من الأنظمة الحالية محدودة في الحجم والنطاق وغير متوافقة مع البيئات متعددة اللغات .

تُمنح جائزة يونيكود بولدوج للأشخاص الذين يُعتبرون مؤثرين في تطوير يونيكود، ومن بين الحاصلين عليها تاتسو كوباياشي ، وتوماس ميلو، وروزبه بورنادر، وكين لوندي ، ومايكل إيفرسون . [ 11 ]

النصوص التي تم تغطيتها

تستطيع العديد من التطبيقات الحديثة عرض مجموعة فرعية كبيرة من النصوص العديدة في Unicode ، كما يتضح من لقطة الشاشة هذه من تطبيق OpenOffice.org .

اعتبارًا من سبتمبر 2025يضم نظام يونيكود 172 نظام كتابة ( أبجديات ، ورموز كتابية ، ومقاطع صوتية ) ، تغطي معظم أنظمة الكتابة الرئيسية المستخدمة اليوم. [ 13 ] [ 14 ] ولا تزال هناك أنظمة كتابة لم تُشفّر بعد، لا سيما تلك المستخدمة بشكل رئيسي في السياقات التاريخية والطقوسية والأكاديمية. كما تُضاف أحرف ورموز جديدة إلى أنظمة الكتابة المشفرة ، خاصة في الرياضيات والموسيقى .

مقترحات لإضافة البرامج النصية

تحتفظ لجنة خارطة طريق يونيكود ( مايكل إيفرسون ، وريك ماكجوان، وكين ويستلر، وفي إس أوماماهيسواران) [ 15 ] بقائمة النصوص المرشحة أو المحتملة للترميز، بالإضافة إلى تخصيصات كتل الرموز المبدئية لها، على صفحة خارطة طريق يونيكود [ 16 ] على موقع اتحاد يونيكود . بالنسبة لبعض النصوص المدرجة في خارطة الطريق، مثل نصوص جورشن وخيتان الكبيرة ، فقد قُدِّمت مقترحات للترميز، وهي قيد الدراسة حاليًا. أما بالنسبة لنصوص أخرى، مثل نوميديان ورونجورونجو ، فلم يُقدَّم أي اقتراح حتى الآن، وهي بانتظار موافقة مجتمعات المستخدمين المعنية على مجموعة الأحرف وغيرها من التفاصيل.

بعض النصوص الحديثة المبتكرة التي لم يتم تضمينها بعد في Unicode (مثل Tengwar ) أو التي لا تستوفي شروط الإدراج في Unicode بسبب عدم استخدامها في العالم الحقيقي (مثل Klingon ) مدرجة في سجل ConScript Unicode ، إلى جانب تعيينات رموز المناطق غير الرسمية ولكن المستخدمة على نطاق واسع للاستخدام الخاص .

توجد أيضاً مبادرة خطوط يونيكود الخاصة بالعصور الوسطى، والتي تركز على الأحرف اللاتينية الخاصة بتلك الحقبة. وقد أُدرج جزء من هذه المقترحات بالفعل في يونيكود.

مبادرة ترميز النصوص (SEI)، [ 17 ] وهو مشروع أنشأته ديبورا أندرسون في جامعة كاليفورنيا، بيركلي ، تأسس عام 2002 بهدف تمويل مقترحات النصوص التي لم تُرمّز بعد في المعيار. وتُديرها الآن أنوشاه حسين، وقد أصبحت SEI مصدرًا رئيسيًا للإضافات المقترحة إلى المعيار في السنوات الأخيرة. [ 18 ] وعلى الرغم من تعاون SEI مع اتحاد يونيكود وعملية وضع معايير ISO/IEC 10646، إلا أنها تعمل بشكل مستقل، وتدعم البحوث التقنية واللغوية والتاريخية اللازمة لإعداد المقترحات الرسمية. وتحتفظ SEI بقاعدة بيانات للنصوص التي لم تُرمّز بعد في معيار يونيكود على موقع المشروع الإلكتروني. [ 19 ]

الإصدارات

قام اتحاد يونيكود بالتعاون مع المنظمة الدولية للمقاييس (ISO) بتطوير مجموعة مشتركة من الأحرف والرموز بعد النشر الأولي لمعيار يونيكود : يستخدم كل من يونيكود ومجموعة الأحرف المشفرة العالمية (UCS) التابعة للمنظمة الدولية للمقاييس أسماء الأحرف ونقاط الترميز نفسها. ومع ذلك، تختلف إصدارات يونيكود عن نظيراتها في المنظمة الدولية للمقاييس في جانبين رئيسيين.

بينما يُعدّ نظام ترميز الأحرف الموحد (UCS) مجرد خريطة بسيطة للأحرف، يُحدد معيار يونيكود القواعد والخوارزميات والخصائص اللازمة لتحقيق التوافق بين مختلف المنصات واللغات. ولذلك، يتضمن معيار يونيكود معلوماتٍ أكثر تفصيلًا، تغطي مواضيع معمقة مثل ترميز البتات، والترتيب ، والعرض. كما يُوفر فهرسًا شاملًا لخصائص الأحرف، بما في ذلك تلك اللازمة لدعم النصوص ثنائية الاتجاه ، بالإضافة إلى مخططات بيانية ومجموعات بيانات مرجعية لمساعدة المطورين. سابقًا، كان معيار يونيكود يُباع كمجلد مطبوع يحتوي على المواصفات الأساسية الكاملة، والملاحق القياسية، [ ملاحظة 1 ] ومخططات الرموز. مع ذلك، كانت النسخة 5.0، التي نُشرت عام 2006، آخر نسخة تُطبع بهذه الطريقة. بدءًا من النسخة 5.2، يُمكن شراء المواصفات الأساسية فقط، المنشورة ككتاب ورقي عند الطلب. [ 20 ] أما النص الكامل، فهو منشور كملف PDF مجاني على موقع يونيكود الإلكتروني.

يُبرز أحد الأسباب العملية لطريقة النشر هذه الاختلاف الثاني المهم بين معيار يونيكود (UCS) ومعيار يونيكود، ألا وهو وتيرة إصدار النسخ المُحدّثة وإضافة الأحرف الجديدة. فقد دأب معيار يونيكود على إصدار نسخ سنوية موسّعة بانتظام، وأحيانًا أكثر من نسخة في السنة الواحدة، وفي حالات نادرة اضطرّ فيها إلى تأجيل الإصدار المُجدول. على سبيل المثال، في أبريل 2020، وبعد شهر من نشر النسخة 13.0، أعلن اتحاد يونيكود عن تغيير موعد إصدار النسخة 14.0، وتأجيلها ستة أشهر إلى سبتمبر 2021 بسبب جائحة كوفيد-19 .

حتى الآن، نُشرت الإصدارات التالية من معيار يونيكود . أما الإصدارات المُحدَّثة، التي لا تتضمن أي تغييرات في مجموعة الأحرف، فيُشار إليها بالرقم الثالث (مثلاً، "الإصدار 4.0.1")، وهي غير مُدرجة في الجدول أدناه. [ 21 ]

تاريخ إصدارات يونيكود والتغييرات الملحوظة في الأحرف والنصوص
الإصدار​تاريخالنشر (كتاب، نص)إصدار UCSالمجموعتفاصيل
النصوصالشخصيات [ ب ]
1.0.0 [ 22 ]أكتوبر 1991رقم الكتاب المعياري الدولي (ISBN) 0-201-56788-1(المجلد 1)غير متوفر247129اللغات التي تم تغطيتها مبدئيًا: العربية ، الأرمنية ، البنغالية ، بوبوموفو ، السيريلية ، ديفاناغاري ، الجورجية ، اليونانية والقبطية ، الغوجاراتية ، غورموخي ، هانغول ، العبرية ، هيراغانا ، الكانادا ، كاتاكانا ، اللاوية ، اللاتينية ، المالايالامية ، الأودية ، التاميلية ، التيلوجوية ، التايلاندية ، والتبتية
1.0.1 [ 23 ]يونيو 1992رقم الكتاب المعياري الدولي (ISBN) 0-201-60845-6(المجلد 2)2528 327+21 204-6أول 20902 رمزًا موحدًا للغة الصينية واليابانية والكورية
1.1 [ 24 ]يونيو 1993غير متوفرISO/IEC 10646 -1:1993

[ ج ]

2434 168+5963-9تمت إعادة تصنيف 33 حرفًا كأحرف تحكم. تم حذف 4306 مقطعًا صوتيًا من اللغة الهانغولية ، بالإضافة إلى المقاطع التبتية.
2.0 [ 25 ]يوليو 1996رقم الكتاب المعياري الدولي (ISBN) 0-201-48345-92538885+11 373-6656تمت إزالة مجموعة مقاطع الهانغول الأصلية، وإضافة مجموعة جديدة من 11172 مقطع هانغول في موقع جديد، وإضافة اللغة التبتية مرة أخرى في موقع جديد وبمجموعة أحرف مختلفة، وتحديد آلية الأحرف البديلة، وتخصيص منطقة استخدام خاصة للمستوى 15 والمستوى 16
2.1 [ 26 ]مايو 1998غير متوفر38887+2U+20AC رمز اليورو ، U+FFFC حرف استبدال الكائن [ 26 ]
3.0 [ 27 ]سبتمبر 1999رقم الكتاب المعياري الدولي (ISBN) 0-201-61633-5ISO/IEC 10646-1:20003849 194+10 307الشيروكي ، والجعزية ، والخميرية ، والمنغولية ، والبورمية ، والأوغام ، والرونية ، والسنهالية ، والسريانية ، والثانا ، والمقاطع الصوتية للسكان الأصليين الكنديين ، ومقاطع لغة يي ، وأنماط برايل
3.1 [ 28 ]مارس 2001غير متوفرISO/IEC 10646-1:2000 [ د ]
ISO/IEC 10646-2:2001
4194 140+44 946ديزيريت ، والقوطية ، والإيطالية القديمة ، ومجموعات من الرموز للموسيقى الغربية والبيزنطية ، و42711 رمزًا موحدًا إضافيًا للغة الصينية واليابانية والكورية.
3.2 [ 29 ]مارس 20024595 156+1016الخطوط الفلبينية ( بوهيد ، هانونو ، تاغالوغ ، تاجبانوا )، رموز رياضية
4.0 [ 30 ]أبريل 2003رقم الكتاب المعياري الدولي (ISBN) 0-321-18578-1ISO/IEC 10646:2003

[ هـ ]

5296 382+1226الأبجدية المقطعية القبرصية ، ليمبو ، الخطية ب ، عثمانية ، شاوية ، تاي لي ، وأوغاريتية ، رموز سداسية الشكل
4.1 [ 31 ]مارس 2005غير متوفر5997655+1273البوجينية ، والغلاجوليتية ، والخروشتية ، والتاي لو الجديدة ، والفارسية القديمة ، والسيلهيتية، والناغرية ، والتيفيناغية ، والقبطية المنفصلة عن اليونانية، والأرقام اليونانية القديمة والرموز الموسيقية ، وتم تقديم تسلسلات الأحرف المسماة لأول مرة. [ 32 ]
5.0 [ 33 ]يوليو 2006رقم الكتاب المعياري الدولي (ISBN) 0-321-48091-06499 024+1369البالية ، المسمارية ، نكو ، فاغس-با ، الفينيقية [ 34 ]
5.1 [ 35 ]أبريل 2008غير متوفر75100648+1624الكاريان ، والشام ، وكايا لي ، والليبتشا ، والليقية ، والليدية ، وأول تشيكي ، وريجانج ، وسوراشترا ، والسوندية ، والفاي ، ومجموعات من الرموز لقرص فايستوس ، وبلاطات ما جونغ ، وبلاطات الدومينو ، وإضافات إلى اللغة البورمية، واختصارات الكتابة ، وحرف لاتيني كبير مدبب S +1E9E
5.2 [ 36 ]أكتوبر 2009رقم الكتاب المعياري الدولي (ISBN) 978-1-936213-00-990107 296+6648الأفيستية ، باموم ، قائمة غاردينر للرموز الهيروغليفية المصرية ، الآرامية الإمبراطورية ، البهلوية النقوشية ، البارثية النقوشية ، الجاوية ، الكايثية ، ليسو ، ميتي مايك ، العربية الجنوبية القديمة ، التركية القديمة ، السامرية ، تاي ثام وتاي فيت ، رموز صينية يابانية كورية موحدة إضافية، جامو للهانغول القديمة، السنسكريتية الفيدية
6.0 [ 37 ]أكتوبر 2010رقم الكتاب المعياري الدولي (ISBN) 978-1-936213-01-6ISO/IEC 10646:2010

[ f ]

93109 384+2088باتاك ، براهمي ، ماندائي ، رموز أوراق اللعب ، رموز النقل والخرائط، رموز الخيمياء ، الرموز التعبيرية والرموز التعبيرية، [ 38 ] رموز صينية يابانية كورية موحدة إضافية
6.1 [ 39 ]يناير 2012رقم الكتاب المعياري الدولي (ISBN) 978-1-936213-02-3ISO/IEC 10646:2012

[ ز ]

100110 116+732الشكما ، والمتصلة المروية ، والهيروغليفية المروية ، ومياو ، وشارادا ، وسورا سومبنغ ، وتكري
6.2 [ 40 ]سبتمبر 2012رقم الكتاب المعياري الدولي (ISBN) 978-1-936213-07-8110 117+1U+20BA لافتة الليرة التركية
6.3 [ 41 ]سبتمبر 2013رقم الكتاب المعياري الدولي (ISBN) 978-1-936213-08-5110 122+55 أحرف تنسيق ثنائية الاتجاه
7.0 [ 42 ]يونيو 2014رقم الكتاب المعياري الدولي (ISBN) 978-1-936213-09-2123112956+2834باسا فاه ، الألباني القوقازي ، دوبلويان ، الباسان ، غرانثا ، خوجكي ، خوداوادي ، الخطي أ ، مهاجاني ، المانوية ، مندي كيكاكوي ، مودي ، مرو ، النبطية ، شمال الجزيرة العربية القديمة ، بيرميك القديم ، باهاوه همونغ ، تدمري ، باو سين هاو ، مزامير بهلوي , سيدهام , تيروتا , وارانج سيتي , ودينجباتس
8.0 [ 43 ]يونيو 2015رقم الكتاب المعياري الدولي (ISBN) 978-1-936213-10-8ISO/IEC 10646:2014

[ ح ]

129120 672+7716أهوم ، الهيروغليفية الأناضولية ، هاتران ، ملتاني ، المجرية القديمة ، كتابة اللافتات ، رموز صينية يابانية كورية إضافية موحدة، أحرف صغيرة للغة الشيروكي، 5 مُعدِّلات لألوان بشرة الرموز التعبيرية
9.0 [ 46 ]يونيو 2016رقم الكتاب المعياري الدولي (ISBN) 978-1-936213-13-9135128 172+7500أدلام , بهايكسوكي , مارشين , نيوا , أوسيدج , تانغوت , 72 رمز تعبيري [ 47 ]
10.0 [ 48 ]يونيو 2017رقم الكتاب المعياري الدولي (ISBN) 978-1-936213-16-0ISO/IEC 10646:2017

[ أنا ]

139136690+8518ساحة زانابازار ، سويومبو ، ماسارام ​​غوندي ، نوشو ، هينتايغانا ، 7494 رمزًا صينيًا يابانيًا كوريًا موحدًا، 56 رمزًا تعبيريًا، رمز بيتكوين ( U+20BF)
11.0 [ 49 ]يونيو 2018رقم الكتاب المعياري الدولي (ISBN) 978-1-936213-19-1146137 374+684دوغرا ، حروف متافرولي الجورجية الكبيرة، غونجالا غوندي ، حنفي روهينغيا ، أرقام سياق الهندية ، ماكاسار ، ميديفيدرين ، السغدية القديمة والسغدية ، أرقام المايا ، 5 رموز صينية يابانية كورية موحدة، رموز شيانغتشي وتقييمات النجوم ، 145 رمزًا تعبيريًا
12.0 [ 50 ]مارس 2019رقم الكتاب المعياري الدولي (ISBN) 978-1-936213-22-1150137928+554إليمايك ، نانديناغاري ، نياكينغ بواتشو همونغ ، وانشو ، كتابة مياو ، حروف هيراغانا وكاتاكانا صغيرة، كسور ورموز تاميل التاريخية، حروف لاو للغة بالي ، حروف لاتينية للترجمة الصوتية المصرية والأوغاريتية، عناصر تحكم تنسيق الهيروغليفية، 61 رمزًا تعبيريًا
12.1 [ 51 ]مايو 2019رقم الكتاب المعياري الدولي (ISBN) 978-1-936213-25-2137929+1U+32FF اسم العصر المربع ريوا
13.0 [ 52 ]مارس 2020رقم الكتاب المعياري الدولي (ISBN) 978-1-936213-26-9ISO/IEC 10646:2020

[ 53 ]

154143859+5930الخوارزمية ، ديفيس أكورو ، الخط الخيتاني الصغير ، اليزيدية ، 4969 رمزًا صينيًا يابانيًا يابانيًا، إضافات الخط العربي المستخدمة لكتابة الهوسا والولوف ولغات أفريقية أخرى، إضافات تُستخدم لكتابة الهندكو والبنجابية في باكستان، إضافات بوبوموفو المستخدمة للكانتونية ، رموز رخصة المشاع الإبداعي، أحرف رسومية للتوافق مع أنظمة التليتكست وأجهزة الكمبيوتر المنزلية، 55 رمزًا تعبيريًا (إيموجي )
14.0 [ 54 ]سبتمبر 2021رقم الكتاب المعياري الدولي (ISBN) 978-1-936213-29-0159144697+838Toto ، Cypro-Minoan ، Vithkuqi ، Old Uyghur ، Tangsa ، IPA الموسعة، إضافات النص العربي للاستخدام في اللغات عبر أفريقيا وفي إيران وباكستان وماليزيا وإندونيسيا وجاوا والبوسنة، إضافات للتكريم والاستخدام القرآني، إضافات لدعم اللغات في أمريكا الشمالية والفلبين والهند ومنغوليا، U+20C0 SOM SIGN ، تدوين Znamenny الموسيقي، 37 رمزًا تعبيريًا
15.0 [ 55 ]سبتمبر 2022رقم الكتاب المعياري الدولي (ISBN) 978-1-936213-32-0161149 186+4489كاوي ومونداري ، 20 رمزًا تعبيريًا ، 4192 رمزًا صينيًا يابانيًا كوريًا، أحرف تحكم للهيروغليفية المصرية
15.1 [ 56 ]سبتمبر 2023رقم الكتاب المعياري الدولي (ISBN) 978-1-936213-33-7149813+627رموز صينية يابانية يابانية إضافية
16.0 [ 57 ]سبتمبر 2024رقم الكتاب المعياري الدولي (ISBN) 978-1-936213-34-4168154998+5185جاراي ، جورونج خيما ، كيرات راي ، أول أونال ، سنوار ، تودري ، تولو تيجالاري ، 7 رموز تعبيرية، 3,995 حرفًا هيروغليفيًا مصريًا
17.0 [ 58 ]سبتمبر 2025رقم الكتاب المعياري الدولي (ISBN) 978-1-936213-35-1172159801+4803بيريا إيرفي ، تاي يو ، سيديتيك ، تولونج سيكي ، U+20C1 علامة الريال السعودي ، 7 رموز تعبيرية، 4,316 صورة إيديوغرافية موحدة لـ CJK
  1. يستخدم قدر كبير من الوثائق الخاصة بنظام التشغيل Windows مصطلح "Unicode" بشكل خاطئ ليعني فقط ترميز UTF-16.
  2. إجمالي عدد الأحرف الرسومية وأحرف التنسيق، باستثناء أحرف الاستخدام الخاص ، وأحرف التحكم ، والأحرف غير الحرفية ، ونقاط الترميز البديلة .
    • أضاف الإصدار 2.0 التعديلات 5 و6 و7
    • أضاف الإصدار 2.1 حرفين من التعديل رقم 18.
  3. تمت إضافة التعديل 1 في البند 3.2.
    • 4.1 تمت إضافة التعديل 1
    • أضاف الإصدار 5.0 التعديل الثاني بالإضافة إلى أربعة أحرف من التعديل الثالث
    • 5.1 تمت إضافة التعديل 4
    • 5.2 أضافت التعديلين 5 و 6
  4. بالإضافة إلى رمز الروبية الهندية
  5. بالإضافة إلى التعديل 1، وعلامة لاري ، وتسعة رموز صينية يابانية كورية موحدة، و41 رمزًا تعبيريًا؛ [ 44 ] أضاف الإصدار 9.0 التعديل 2، بالإضافة إلى أدلام، ونيوا، ورموز التلفزيون الياباني، و74 رمزًا تعبيريًا ورمزًا. [ 45 ]
    • بالإضافة إلى 56 رمزًا تعبيريًا، و285 حرفًا من حروف الهينتايغانا ، و3 أحرف من ساحة زانابازار
    • أضاف الإصدار 11.0 ستة وأربعين حرفًا كبيرًا من اللغة الجورجية (متافرولي)، وخمسة رموز تصويرية موحدة للغات الصينية واليابانية والكورية، وستة وستون رمزًا تعبيريًا (إيموجي).
    • أضاف الإصدار 12.0 62 حرفًا إضافيًا.

الهندسة المعمارية والمصطلحات

مساحة الكود ونقاط الكود

يُعرّف معيار يونيكود فضاء الترميز : [ 59 ] سلسلة من الأعداد الصحيحة تُسمى نقاط الترميز [ 60 ] في النطاق من 0 إلى1 114 111 ، مُدوّن وفقًا للمعيار كـ U+0000U+10FFFF . [ 61 ] مساحة الترميز هي تمثيل منهجي ومستقل عن البنية لمعيار يونيكود ؛ تتم معالجة النص الفعلي كبيانات ثنائية عبر أحد ترميزات يونيكود المتعددة، مثل UTF-8 .

في هذا الترميز المعياري، يسبق البادئة المكونة من حرفين U+دائمًا رمز النقطة المكتوبة، وتُكتب رموز النقاط نفسها كأرقام سداسية عشرية . [ ملاحظة 2 ] يُكتب دائمًا أربعة أرقام سداسية عشرية على الأقل، مع إضافة أصفار بادئة حسب الحاجة. على سبيل المثال، يُضاف صفران بادئان إلى رمز النقطة U+00F7 ÷ DIVISION SIGN ، بينما لا يُضاف صفران إلى U+13254 𓉔 EGYPTIAN HIEROGLYPH O004 ( ). [ 63 ]

يوجد إجمالي1,112,064 نقطة ترميز صالحة ضمن مساحة الترميز. [ 64 ] ينشأ هذا الرقم من قيود ترميز الأحرف UTF-16 ، الذي يمكنه ترميز 216 نقطة ترميز في النطاق من U+0000 إلى U+FFFF باستثناء 211 نقطة ترميز في النطاق من U+D800 إلى U+DFFF ، والتي تُستخدم كأزواج بديلة لترميز 220 نقطة ترميز في النطاق من U+10000 إلى U+10FFFF .

مستويات ووحدات البرمجة

ينقسم فضاء ترميز يونيكود إلى 17 مستوى ، مرقمة من 0 إلى 16. المستوى 0 هو المستوى الأساسي متعدد اللغات (BMP)، ويحتوي على الأحرف الأكثر استخدامًا. يتم الوصول إلى جميع نقاط الترميز في المستوى الأساسي متعدد اللغات كوحدة ترميز واحدة في ترميز UTF-16، ويمكن ترميزها في بايت واحد أو اثنين أو ثلاثة بايتات في ترميز UTF-8. أما نقاط الترميز في المستويات من 1 إلى 16 (المستويات التكميلية )، فيتم الوصول إليها كأزواج بديلة في ترميز UTF-16، ويتم ترميزها في أربعة بايتات في ترميز UTF-8 .

في كل مستوى، تُخصص الأحرف ضمن كتل مُسماة من الأحرف ذات الصلة. حجم الكتلة دائمًا من مضاعفات العدد 16، وغالبًا ما يكون من مضاعفات العدد 128، ولكنه في غير ذلك اختياري. قد تتوزع الأحرف المطلوبة لنص معين على عدة كتل مختلفة، وربما منفصلة، ​​ضمن مساحة الترميز.

عقارات الفئة العامة

يُخصَّص لكل رمز تصنيفٌ مُدرجٌ ضمن خاصية " الفئة العامة " الخاصة به . في المستوى الأعلى، تُصنَّف الرموز إلى أحد الفئات التالية: حرف، علامة، رقم، ترقيم، رمز، فاصل، أو غير ذلك. وتحت كل فئة، يُقسَّم كل رمز إلى فئات فرعية. في معظم الحالات، يجب استخدام خصائص أخرى لوصف جميع سمات أي رمز بشكلٍ وافٍ.

الفئة العامة ( خاصية حرف يونيكود ) [ أ ]
قيمةالتخصص الرئيسي، التخصص الفرعيالنوع الأساسي [ ب ]تم تعيين الحرف [ ب ]العدد [ ج ] (اعتبارًا من 17.0)ملاحظات
 
L ، حرف؛ LC ، حرف ذو حالة (Lu، Ll، وLt فقط) [ d ]
لوحرف، كبيررسم بيانيشخصية1886
Llحرف، صغيررسم بيانيشخصية2283
الملازمحرف، عنوانرسم بيانيشخصية31الحروف المركبة التي تتكون من حرف كبير متبوع بحرف صغير (مثل: Dž ، Lj ، Nj ، و Dz )
Lmحرف، مُعدِّلرسم بيانيشخصية410حرف مُعدِّل
لورسالة، أخرىرسم بيانيشخصية141,062رمز أو حرف في أبجدية أحادية الحالة
م ، مارك
المنغنيزمارك، بدون مسافاترسم بيانيشخصية2059
مكمارك، دمج المسافاترسم بيانيشخصية471
أنامارك، مرفقًارسم بيانيشخصية13
ن ، رقم
اختصار الثانيرقم، رقم عشريرسم بيانيشخصية770كل هذه، وهذه فقط، لها نوع رقمي = De [ e ]
هولندارقم، حرفرسم بيانيشخصية239الأرقام المكونة من حروف أو رموز تشبه الحروف (مثل الأرقام الرومانية )
لارقم، أخرىرسم بيانيشخصية915على سبيل المثال، الكسور الشائعة ، والأرقام المرتفعة والمنخفضة ، والأرقام العشرية.
P ، علامات الترقيم
جهاز كمبيوترعلامات الترقيم، أدوات الربطرسم بيانيشخصية10يشمل ذلك أحرف المسافة والشرطة السفلية مثل "_"، وأحرف الربط الأخرى . على عكس أحرف الترقيم الأخرى، قد تصنفها مكتبات التعبيرات النمطية على أنها أحرف "كلمات" . [ f ]
Pdعلامات الترقيم، الشرطةرسم بيانيشخصية27يتضمن العديد من الأحرف الموصولة بشرطات
ملاحظة:علامات الترقيم، مفتوحةرسم بيانيشخصية79أحرف القوس المفتوح
بيعلامات الترقيم، إغلاقرسم بيانيشخصية77أحرف الأقواس المغلقة
بايعلامات الترقيم، الاقتباس الأوليرسم بيانيشخصية12علامة اقتباس افتتاحية . لا تشمل علامة الاقتباس "المحايدة" في نظام ASCII. قد تتصرف مثل Ps أو Pe حسب الاستخدام.
Pfعلامات الترقيم، الاقتباس الأخيررسم بيانيشخصية10علامة اقتباس ختامية. قد تتصرف مثل Ps أو Pe حسب الاستخدام
بوعلامات الترقيم، وغيرهارسم بيانيشخصية641
S ، رمز
صغيرالرمز، الرياضياترسم بيانيشخصية960الرموز الرياضية (مثل + ، - ، = ، × ، ÷ ، ، ، ). لا تشمل الأقواس العادية والمعقوفة، والتي تندرج ضمن الفئتين Ps وPe. كما لا تشمل ! ، * ، - ، أو / ، والتي على الرغم من استخدامها المتكرر كعوامل رياضية، تُعتبر في المقام الأول "علامات ترقيم".
العلومالرمز، العملةرسم بيانيشخصية64رموز العملات
سكيالرمز، المُعدِّلرسم بيانيشخصية125
لذارمز، آخررسم بيانيشخصية7468
Z ، فاصل
Zsفاصل، مسافةرسم بيانيشخصية17يشمل ذلك المسافة، ولكن ليس TAB أو CR أو LF ، والتي هي Cc
زلفاصل، خطشكلشخصية1فاصل الخطوط U+2028 فقط (LSEP)
Zpفاصل، فقرةشكلشخصية1فاصل الفقرات U+2029 فقط (PSEP)
ج ، أخرى
نسخةأخرى، السيطرةيتحكمشخصية65 (لن يتغير أبداً) [ هـ ]بدون اسم، [ g ] <control>
انظرتنسيق آخرشكلشخصية170يتضمن ذلك الواصلة اللينة ، وأحرف التحكم في الربط ( ZWNJ و ZWJ )، وأحرف التحكم لدعم النص ثنائي الاتجاه ، وأحرف علامات اللغة
جأخرى، بديلةبديلغير مستخدم (يستخدم فقط في UTF-16 )2048 (لن يتغير أبدًا) [ هـ ]بدون اسم، [ g ] <بديل>
شركةاستخدامات أخرى خاصةللاستخدام الخاصالشخصية (ولكن لم يتم تحديد تفسير لها)137,468 إجمالي (لن يتغير أبدًا) [ هـ ] ( 6,400 في BMP ، 131,068 في الطائرات 15-16 )بدون اسم، [ g ] <للاستخدام الخاص>
سنأخرى، غير مُخصصةشخصية غير مميزةلا66 (لن يتغير إلا إذا تم توسيع نطاق نقاط رمز Unicode) [ هـ ]بدون اسم، [ g ] <حرف غير حرفي>
محجوزلا814,664بدون اسم، [ g ] <محجوز>
  1. "الجدول 4-4: الفئة العامة" . معيار يونيكود . اتحاد يونيكود. سبتمبر 2025.
  2. 1 2 "الجدول 2-3: أنواع نقاط الترميز" . معيار يونيكود . اتحاد يونيكود. سبتمبر 2025.
  3. "DerivedGeneralCategory.txt" . اتحاد يونيكود. 2025-07-24.
  4. "5.7.1 قيم الفئات العامة" . UTR #44: قاعدة بيانات أحرف يونيكود . اتحاد يونيكود. 27-08-2024.
  5. ١ ٢ ٣ ٤ ٥ سياسات استقرار ترميز أحرف يونيكود: استقرار قيمة الخاصية. سياسة الاستقرار: بعض مجموعات gc لن تتغير أبدًا. gc=Nd يتوافق مع النوع الرقمي = De (عشري).
  6. "الملحق ج: خصائص التوافق (كلمة §)" . تعابير يونيكود النمطية . الإصدار 23. اتحاد يونيكود . 2022-02-08. معيار يونيكود التقني رقم 18.
  7. 1 2 3 4 5 "الجدول 4-9: بناء تسميات نقاط الترميز" . معيار يونيكود . اتحاد يونيكود. سبتمبر 2025.يمكن استخدام تسمية نقطة الترميز لتحديد نقطة ترميز غير مُسماة. على سبيل المثال: <control- hhhh >، <control-0088>. يبقى حقل الاسم فارغًا، مما يمنع استبدال اسم التحكم برمز التحكم الحقيقي عن طريق الخطأ في الوثائق. كما يستخدم يونيكود الرمز <ليس حرفًا> للدلالة على <غير حرف>.

التُعرف النقاط 1024 في النطاق U+D800U+DBFF باسم نقاط الترميز البديلة العالية ، ونقاط الترميز في النطاق U+DC00U+DFFF (تُعرف الرموز التي تزيد قيمتها عن 1024 نقطة رمزية باسم الرموز البديلة المنخفضة . في ترميز UTF-16، يُشكّل رمز بديل مرتفع متبوع برمز بديل منخفض زوجًا بديلًا لتمثيل الرموز التي تزيد قيمتها عن U+FFFF . من حيث المبدأ، لا يمكن استخدام هذه الرموز البديلة، إلا أنه عمليًا غالبًا ما يتم تجاهل هذه القاعدة، خاصةً عند عدم استخدام ترميز UTF-16.

تضمن مجموعة صغيرة من رموز الترميز عدم تخصيصها للأحرف مطلقًا، مع إمكانية استخدامها بشكل مستقل من قِبل جهات خارجية وفقًا لتقديرها. يوجد 66 رمزًا من هذه الرموز غير الحرفية : من U+FDD0 إلى U+FDEF، بالإضافة إلى آخر رمزين في كل مستوى من المستويات السبعة عشر (مثل U+FFFE ، U+FFFF ، U+1FFFE ، U+1FFFF ، ...، U+10FFFE ، U+10FFFF ). مجموعة الرموز غير الحرفية ثابتة، ولن يتم تعريف أي رموز غير حرفية جديدة. [ 65 ] وكما هو الحال مع الرموز البديلة، غالبًا ما يتم تجاهل قاعدة عدم إمكانية استخدام هذه الرموز، على الرغم من أن عملية علامة ترتيب البايتات تفترض أن U+FFFE لن تكون أبدًا أول رمز في النص. يؤدي استبعاد الرموز البديلة والرموز غير الحرفية إلى1,111,998 نقطة رمزية متاحة للاستخدام.

تُعتبر رموز الاستخدام الخاص مُخصصة، ولكن لا يوجد تفسير محدد لها في معيار يونيكود [ 66 بحيث يتطلب أي تبادل لهذه الرموز اتفاقًا مستقلًا بين المُرسِل والمُستقبِل بشأن تفسيرها. يوجد ثلاثة مجالات للاستخدام الخاص في فضاء رموز يونيكود:

  • منطقة الاستخدام الخاص: U+E000U+F8FF ((6400 حرفًا)
  • منطقة الاستخدام الخاص التكميلية - أ: U+F0000U+FFFFD ((65534 حرفًا )
  • منطقة الاستخدام الخاص التكميلية - ب: U+100000U+10FFFD ((65534 حرفًا ).

الأحرف الرسومية هي تلك التي حددها معيار يونيكود لتكون لها دلالات معينة، إما أن يكون لها شكل رسومي مرئي أو أن تمثل مساحة مرئية. اعتبارًا من يونيكود 17.0، هناك159629 حرفًا رسوميًا.

أحرف التنسيق هي أحرف لا تظهر بشكل مرئي، ولكنها قد تؤثر على مظهر أو سلوك الأحرف المجاورة. على سبيل المثال، يمكن استخدام U+200C ZERO WIDTH NON-JOINER و U+200D ZERO WIDTH JOINER لتغيير سلوك التشكيل الافتراضي للأحرف المتجاورة (مثل منع الربط أو طلب تكوين الربط). يوجد 172 حرف تنسيق في يونيكود 17.0.

تم حجز 65 نقطة ترميز، وهي النطاقات U+0000U+001F و U+007FU+009F ، كرموز تحكم ، تُطابق رموز التحكم C0 و C1 كما هو مُحدد في معيار ISO/IEC 6429. وتُستخدم رموز U+0009 (علامة الجدولة) ، و U+000A (تغذية السطر) ، و U+000D (إرجاع المؤشر ) على نطاق واسع في النصوص التي تستخدم ترميز يونيكود. وفي ظاهرة تُعرف باسم "mojibake" ، يتم فك ترميز نقاط C1 بشكل غير صحيح وفقًا لصفحة ترميز Windows-1252 ، التي كانت شائعة الاستخدام سابقًا في سياقات أوروبا الغربية.

تُعرف الأحرف الرسومية، وأحرف التنسيق، وأحرف التحكم، وأحرف الاستخدام الخاص مجتمعةً بالأحرف المُخصصة . أما نقاط الترميز المحجوزة فهي تلك النقاط الصالحة والمتاحة للاستخدام، ولكن لم يتم تخصيصها بعد. اعتبارًا من يونيكود 17.0، هناك814664 نقطة رمزية محجوزة .

الأحرف المجردة

لا تتطابق مجموعة الأحرف الرسومية والتنسيقية التي يُحددها يونيكود مباشرةً مع مجموعة الأحرف المجردة التي يُمكن تمثيلها ضمن يونيكود. يُشفّر يونيكود الأحرف بربط كل حرف مجرد بنقطة ترميز مُحددة. [ 67 ] مع ذلك، لا تُشفّر جميع الأحرف المجردة كحرف يونيكود واحد، وقد تُمثّل بعضها في يونيكود بتسلسل من حرفين أو أكثر. على سبيل المثال، يُمثّل الحرف اللاتيني الصغير "i" مع علامة التشكيل (أوغونيك) ، ونقطة فوقه ، وعلامة نبرة حادة ، وهو مطلوب في اللغة الليتوانية ، بالتسلسل U+012F ؛ U+0307 ؛ U+0301 . يحتفظ يونيكود بقائمة من تسلسلات الأحرف ذات الأسماء الفريدة للأحرف المجردة التي لا تُشفّر مباشرةً في يونيكود. [ 68 ]

لكل حرف مُخصص اسم فريد وثابت يُستخدم لتعريفه. وقد ضُمنت هذه الثباتية منذ الإصدار 2.0 من معيار يونيكود من خلال سياسة استقرار الأسماء. [ 65 ] في حال كان الاسم معيبًا ومضللًا بشكلٍ خطير، أو يحتوي على خطأ مطبعي جسيم، يُمكن تعريف اسم بديل رسمي يُشجع التطبيقات على استخدامه بدلًا من اسم الحرف الرسمي. على سبيل المثال، الحرف U+A015 YI SYLLABLE WU له الاسم البديل الرسمي YI SYLLABLE ITERATION MARK ، والحرف U+FE18 PRESENTATION FORM FOR VERTICAL RIGHT WHITE LENTICULAR BRAKCET ( sic ) له الاسم البديل الرسمي PRESENTATION FORM FOR VERTICAL RIGHT WHITE LENTICULAR BRACK ET . [ 69 ]

تم تركيبها مسبقًا مقابل الشخصيات المركبة

يتضمن نظام يونيكود آلية لتعديل الأحرف تُوسّع بشكل كبير نطاق الرموز المدعومة. ويشمل ذلك استخدام علامات التشكيل المركبة التي يُمكن إضافتها بعد الحرف الأساسي من قِبل المستخدم. يُمكن تطبيق علامات تشكيل مركبة متعددة على الحرف نفسه في آنٍ واحد. كما يحتوي يونيكود على نسخ مُجهزة مُسبقًا لمعظم تركيبات الأحرف/علامات التشكيل الشائعة الاستخدام. تُسهّل هذه النسخ عملية التحويل من وإلى أنظمة الترميز القديمة، وتُمكّن التطبيقات من استخدام يونيكود كتنسيق نص داخلي دون الحاجة إلى تنفيذ أحرف مركبة. على سبيل المثال، éيُمكن تمثيل الحرف E في يونيكود على النحو التالي: U+0065 e (حرف لاتيني صغير E) متبوعًا بـ U+0301 ́ (علامة تشكيل حادة) ، أو بشكل مُكافئ على النحو التالي: U+00E9 é (حرف لاتيني صغير E مع علامة تشكيل حادة) . وبالتالي، غالبًا ما يمتلك المستخدمون طرقًا مُتعددة مُكافئة لترميز الحرف نفسه. تضمن آلية التكافؤ المتعارف عليه ضمن معيار يونيكود إمكانية التبادل العملي لهذه الترميزات المتكافئة.

ومن الأمثلة على ذلك الأبجدية الكورية هانغول : يوفر نظام يونيكود آلية لتكوين مقاطع هانغول من مكوناتها الفرعية الفردية المعروفة باسم هانغول جامو . ومع ذلك، فإنه يوفر أيضًا11172 تركيبة من المقاطع اللفظية المركبة مسبقًا والمكونة من أكثر أنواع الجامو شيوعًا .

لا تملك الأحرف الصينية واليابانية والكورية حاليًا رموزًا إلا للجذور غير القابلة للتركيب والأشكال المركبة مسبقًا. معظم الأحرف الصينية (هان) إما مُركبة عمدًا من عناصر كتابية أبسط تُسمى الجذور ، أو مُعاد بناؤها كتركيبات منها . لذا، من حيث المبدأ، كان بإمكان يونيكود تمكين تركيبها كما فعل مع الهانغول. مع أن هذا كان سيقلل بشكل كبير من عدد نقاط الترميز المطلوبة، فضلًا عن السماح بالتوليف الخوارزمي للعديد من الأحرف الجديدة، إلا أن تعقيدات أصول الأحرف وطبيعة أنظمة الجذور اللاحقة تُضيف تعقيدًا هائلًا إلى هذا المقترح. في الواقع، واجهت محاولات تصميم ترميزات للأحرف الصينية واليابانية والكورية على أساس تركيب الجذور صعوبات ناتجة عن حقيقة أن الأحرف الصينية لا تتحلل ببساطة أو بانتظام كما هو الحال مع الهانغول.

تُخصص كتلة مكمل جذور CJK للنطاق U+2E80U+2EFF ، وتُخصص جذور Kangxi للنطاق U+2F00U+2FDF . تغطي كتلة تسلسلات الوصف الإيديوغرافي النطاق U+2FF0U+2FFB ، لكن معيار Unicode يحذر من استخدام أحرفها كتمثيل بديل للأحرف المشفرة في أماكن أخرى.

تختلف هذه العملية عن التشفير الرسمي للرموز التصويرية. فلا يوجد وصف معياري للرموز التصويرية غير المشفرة، ولا توجد دلالة محددة للرموز التصويرية الموصوفة، ولا يوجد تعريف للمكافئ بينها. من الناحية المفاهيمية، تُشبه الأوصاف التصويرية العبارة الإنجليزية "حرف 'e' مع علامة تشكيل حادة" أكثر من تسلسل الأحرف < U+0065, U+0301 > .

أربطة

الـ Devanāgarī ddhrya -الضماد (म् + ध् + र् + य = ध्र्य) من JanaSanskritSans [ 70 ]
اللام العربي - حرفالألف ( ل ‎ +‎ ا‎ = ‎ لا )

تعتمد العديد من الخطوط، بما فيها العربية والديفاناغارية ، على قواعد إملائية خاصة تتطلب دمج تركيبات معينة من أشكال الحروف في أشكال وصل خاصة . وقد تكون قواعد تشكيل هذه الوصلات معقدة للغاية، مما يستلزم استخدام تقنيات خاصة لتشكيل الخطوط، مثل ACE (محرك الخط العربي من شركة DecoType في ثمانينيات القرن الماضي، والذي استُخدم لإنشاء جميع الأمثلة العربية في الطبعات المطبوعة من معيار يونيكود )، والذي شكّل نموذجًا أوليًا لتقنية OpenType (من Adobe وMicrosoft)، وتقنية Graphite (من SIL International )، وتقنية AAT (من Apple).

تتضمن الخطوط أيضًا تعليمات تُخبر نظام التشغيل بكيفية إخراج تسلسلات الأحرف المختلفة بشكل صحيح. يتمثل أحد الحلول البسيطة لوضع علامات الدمج أو التشكيل في تعيين عرض صفري لهذه العلامات ووضع الحرف نفسه على يسار أو يمين المسافة الجانبية اليسرى (بحسب اتجاه الكتابة المقصودة). ستظهر العلامة المُعالجة بهذه الطريقة فوق الحرف الذي يسبقها، لكنها لن تُعدّل موضعها بالنسبة لعرض أو ارتفاع الحرف الأساسي؛ وقد يكون ذلك غير مُريح بصريًا، وقد تتداخل مع بعض الأحرف. يُعدّ التراص الحقيقي مستحيلاً، لكن يُمكن تقريبه في حالات محدودة (على سبيل المثال، يُمكن أن تكون حروف العلة وعلامات النبر في اللغة التايلاندية على ارتفاعات مختلفة في البداية). عمومًا، لا يكون هذا الأسلوب فعالًا إلا في الخطوط أحادية المسافة، لكن يُمكن استخدامه كطريقة عرض احتياطية عند فشل الطرق الأكثر تعقيدًا.

مجموعات فرعية موحدة

تم توحيد عدة مجموعات فرعية من يونيكود: يدعم نظام التشغيل مايكروسوفت ويندوز، منذ إصدار ويندوز إن تي 4.0، مجموعة WGL-4 التي تضم 657 حرفًا، والتي تُعتبر كافية لدعم جميع اللغات الأوروبية المعاصرة التي تستخدم الأبجدية اللاتينية أو اليونانية أو السيريلية. تشمل المجموعات الفرعية الموحدة الأخرى من يونيكود المجموعات الفرعية الأوروبية متعددة اللغات: [ 71 ] MES-1 (للأحرف اللاتينية فقط؛ 335 حرفًا)، وMES-2 (للأحرف اللاتينية واليونانية والسيريلية؛ 1062 حرفًا) [ 72 ] ، وMES-3A وMES-3B (مجموعتان فرعيتان أكبر حجمًا، غير معروضتين هنا). تتضمن MES-2 جميع الأحرف الموجودة في MES-1 وWGL-4.

تحدد المواصفة القياسية DIN 91379 [ 73 ] مجموعة فرعية من أحرف يونيكود، والرموز الخاصة، وتسلسلات الأحرف وعلامات التشكيل، وذلك لضمان التمثيل الصحيح للأسماء وتبسيط تبادل البيانات في أوروبا. تدعم هذه المواصفة جميع اللغات الرسمية في دول الاتحاد الأوروبي، بالإضافة إلى لغات الأقليات الألمانية واللغات الرسمية في أيسلندا وليختنشتاين والنرويج وسويسرا. ولتمكين ترجمة الأسماء المكتوبة بأنظمة كتابة أخرى إلى الأبجدية اللاتينية وفقًا لمعايير ISO ذات الصلة، يتم توفير جميع التوليفات اللازمة من الأحرف الأساسية وعلامات التشكيل.

WGL-4 و MES-1 و MES-2
صفالخلاياالنطاق (النطاقات)
٠٠20–7Eاللاتينية الأساسية (00–7F)
A0–FFملحق لاتين-1 (80–FF)
0100–13، 14–15، 16–2ب، 2C–2D، 2E–4D، 4E–4F، 50–7E، 7Fاللاتينية الموسعة-أ (00–7F)
8F، 92، B7، DE-EF، FA–FFاللاتينية الموسعة-ب (80–FF ... )
0218-1ب، 1هـ-1واللاتينية الموسعة-ب ( ... 00–4F)
59، 7C، 92ملحقات IPA (50–AF)
BB–BD، C6، C7، C9، D6، D8–DB، DC، DD، DF، EEأحرف تعديل المسافات (B0–FF)
0374-75، 7A، 7E، 84-8A، 8C، 8E – A1، A3 – CE، D7، DA – E1اليونانية (70–FF)
0400–5F، 90–91، 92–C4، C7–C8، CB–CC، D0–EB، EE–F5، F8–F9السيريلية (00–FF)
1E02–03، 0A–0B، 1E–1F، 40–41، 56–57، 60–61، 6A–6B، 80–85، 9B، F2–F3اللاتينية الإضافية الموسعة (00–FF)
1F00–15، 18–1D، 20–45، 48–4D، 50–57، 59، 5B، 5D، 5F–7D، 80–B4، B6–C4، C6–D3، D6–DB، DD–EF، F2–F4، F6–FEاليونانية الموسعة (00–FF)
2013-14، 15، 17، 18-19، 1أ-1ب، 1ج -1د، 1 هـ، 20-22، 26، 30، 32-33، 39-3أ، 3ج، 3هـ، 44،علامات الترقيم العامة (00–6F)
7F ، 82الأرقام المرتفعة والمنخفضة (70–9F)
A3–A4، A7، AC، AFرموز العملات (A0–CF)
2105، 13، 16، 22، 26، 2Eالرموز الشبيهة بالحروف (00–4F)
5ب - 5هـأشكال الأعداد (50–8F)
90-93، 94-95، A8الأسهم (90–FF)
2200، 02، 03، 06، 08–09، 0F، 11–12، 15، 19–1A، 1E–1F، 27–28 ، 29 ، 2A، 2B، 48، 59، 60–61، 64–65، 82–83، 95، 97العوامل الرياضية (00–FF)
2302، 0A، 20-21، 29-2Aمتفرقات فنية (00–FF)
2500، 02، 0 درجة مئوية، 10، 14، 18، 1 درجة مئوية، 24، 2 درجة مئوية، 34، 3 درجات مئوية، 50-6 درجات مئويةرسم تخطيطي للصندوق (00–7F)
80، 84، 88، 8C، 90-93عناصر الكتلة (80–9F)
A0–A1، AA–AC، B2، BA، BC، C4، CA–CB، CF، D8–D9، E6الأشكال الهندسية (A0–FF)
263أ-3ج، 40، 42، 60، 63، 65-66، 6أ،رموز متنوعة (00–FF)
F0(01–02)منطقة الاستخدام الخاص (00–FF ...)
فيسبوك01–02نماذج العرض الأبجدية (00–4F)
FFإف ديعروض خاصة

غالبًا ما تعرض برامج العرض التي لا تستطيع معالجة حرف يونيكود بشكل صحيح هذا الحرف على شكل مستطيل مفتوح، أو كـ U+FFFD للإشارة إلى موضع الحرف غير المُتعرف عليه. وقد حاولت بعض الأنظمة توفير معلومات إضافية حول هذه الأحرف. على سبيل المثال، يعرض خط Last Resort من Apple رمزًا بديلًا يُشير إلى نطاق يونيكود الخاص بالحرف، بينما يعرض خط SIL International الاحتياطي مربعًا يُظهر القيمة العددية السداسية عشرية للحرف.

التخطيط والترميز

تم تحديد العديد من الآليات لتخزين سلسلة من نقاط الترميز كسلسلة من البايتات.

يُعرّف يونيكود طريقتين للربط: ترميز تنسيق تحويل يونيكود (UTF)، وترميز مجموعة الأحرف المشفرة العالمية (UCS). يربط الترميز بعضًا من نطاق نقاط ترميز يونيكود أو كلها بتسلسلات من القيم ضمن نطاق ثابت الحجم، تُسمى وحدات الترميز . تربط جميع ترميزات UTF نقاط الترميز بتسلسل فريد من البايتات. [ 74 ] تشير الأرقام في أسماء الترميزات إلى عدد البتات لكل وحدة ترميز (لترميزات UTF) أو عدد البايتات لكل وحدة ترميز (لترميزات UCS و UTF-1 ). يُعدّ UTF-8 وUTF-16 من أكثر الترميزات استخدامًا. UCS-2 هو مجموعة فرعية قديمة من UTF-16؛ أما UCS-4 وUTF-32 فهما متكافئان وظيفيًا.

تتضمن ترميزات UTF ما يلي:

يستخدم ترميز UTF-8 من وحدة إلى أربع وحدات بت ( بايتات ) لكل نقطة ترميز، وهو ترميز مضغوط مناسب للأحرف اللاتينية ومتوافق مع ASCII، مما يجعله الترميز القياسي الفعلي لتبادل نصوص Unicode. ويستخدمه نظام FreeBSD ومعظم توزيعات Linux الحديثة كبديل مباشر للترميزات القديمة في معالجة النصوص بشكل عام.

تُحدد ترميزات UCS-2 وUTF-16 علامة ترتيب البايتات (BOM) الخاصة بنظام Unicode لاستخدامها في بدايات ملفات النصوص، والتي يمكن استخدامها للكشف عن ترتيب البايتات (أو الكشف عن ترتيب البايتات ). تتميز علامة BOM، المُرمزة كـ U+FEFF مسافة غير قابلة للكسر بعرض صفري ، بخاصية مهمة وهي عدم وجود أي لبس عند إعادة ترتيب البايتات، بغض النظر عن ترميز Unicode المُستخدم؛ فالـ U+FFFE (نتيجة تبديل البايتات U+FEFF ) لا تُعادل حرفًا صحيحًا، و U+FEFF في غير بداية النص تُشير إلى مسافة غير قابلة للكسر بعرض صفري.

يُصبح الحرف نفسه، بعد تحويله إلى ترميز UTF-8، تسلسلًا من البايتات EF BB BF. يسمح معيار يونيكود بأن يكون BOM بمثابة توقيع للنصوص المُرمّزة بترميز UTF-8 عندما تكون مجموعة الأحرف غير مُعلّمة. [ 75 ] وقد اعتمد بعض مطوري البرامج هذا المعيار لترميزات أخرى، بما في ذلك UTF-8، في محاولة لتمييز UTF-8 عن صفحات الترميز المحلية ذات 8 بت . مع ذلك، توصي RFC 3629 ، معيار UTF-8، بمنع علامات ترتيب البايتات في البروتوكولات التي تستخدم UTF-8، لكنها تناقش الحالات التي قد لا يكون فيها ذلك ممكنًا. إضافةً إلى ذلك، فإن التقييد الكبير على الأنماط الممكنة في UTF-8 (على سبيل المثال، لا يمكن أن توجد أي بايتات منفردة مع تعيين البت الأعلى) يعني أنه من الممكن تمييز UTF-8 عن ترميزات الأحرف الأخرى دون الاعتماد على BOM. 

في ترميز UTF-32 وUCS-4، تمثل وحدة ترميز واحدة ذات 32 بت تمثيلاً مباشراً لنقطة ترميز أي حرف (مع أن ترتيب البايتات، الذي يختلف بين المنصات، يؤثر على كيفية ظهور وحدة الترميز كسلسلة بايتات). أما في الترميزات الأخرى، فيمكن تمثيل كل نقطة ترميز بعدد متغير من وحدات الترميز. يُستخدم UTF-32 على نطاق واسع كتمثيل داخلي للنصوص في البرامج (بدلاً من النصوص المخزنة أو المنقولة)، إذ أن جميع أنظمة تشغيل يونكس التي تستخدم مُجمِّعات GCC لإنشاء البرامج تعتمده كترميز قياسي للأحرف العريضة . كما يمكن تهيئة الإصدارات الحديثة من لغة برمجة بايثون (بدءًا من الإصدار 2.2) لاستخدام UTF-32 كتمثيل لسلاسل يونيكود، مما يُسهم في نشر هذا الترميز في البرامج عالية المستوى .

يُمكّن نظام Punycode ، وهو شكل آخر من أشكال التشفير، من ترميز سلاسل Unicode إلى مجموعة الأحرف المحدودة التي يدعمها نظام أسماء النطاقات (DNS) القائم على ASCII . يُستخدم هذا الترميز كجزء من IDNA ، وهو نظام يُتيح استخدام أسماء النطاقات الدولية في جميع النصوص التي يدعمها Unicode. ومن المقترحات السابقة، والتي أصبحت الآن من الماضي، UTF-5 و UTF-6 .

GB18030 هو شكل ترميز آخر لليونيكود، صادر عن إدارة التقييس الصينية . وهو مجموعة الأحرف الرسمية لجمهورية الصين الشعبية. أما BOCU-1 و SCSU فهما نظاما ضغط لليونيكود. وقد حددت وثيقة RFC الخاصة بيوم كذبة أبريل لعام 2005 ترميزين ساخرين لليونيكود، هما UTF-9 و UTF-18 .

التبني

يُعدّ ترميز يونيكود، بصيغة UTF-8 ، الترميز الأكثر شيوعًا لشبكة الإنترنت العالمية منذ عام 2008. [ 76 ] ويحظى باعتماد شبه عالمي، ويُوجد جزء كبير من المحتوى غير المُرمّز بـ UTF-8 بترميزات يونيكود أخرى، مثل UTF-16 . اعتبارًا من عام 2024يُمثّل ترميز UTF-8 ما نسبته 98.3% من صفحات الويب (و983 صفحة من بين أفضل 1000 صفحة ويب من حيث الترتيب). [ 77 ] على الرغم من أن العديد من الصفحات تستخدم أحرف ASCII فقط لعرض المحتوى، فقد صُمّم ترميز UTF-8 مع اعتبار ASCII ذي 8 بت مجموعة فرعية، ولا تكاد توجد مواقع ويب تُعلن الآن عن استخدام ASCII فقط بدلاً من UTF-8. [ 78 ] أكثر من ثلث اللغات التي تم تتبعها تستخدم ترميز UTF-8 بنسبة 100%.

جميع بروتوكولات الإنترنت التي تشرف عليها فرقة عمل هندسة الإنترنت (IETF )، مثل بروتوكول نقل الملفات (FTP) ، [ 79 ] تتطلب دعم ترميز UTF-8 منذ نشر RFC 2277 في عام 1998، والذي نص على أن جميع بروتوكولات IETF "يجب أن تكون قادرة على استخدام مجموعة أحرف UTF-8". [ 80 ] 

أنظمة التشغيل

أصبح نظام يونيكود النظامَ السائد لمعالجة النصوص وتخزينها داخليًا. ورغم أن جزءًا كبيرًا من النصوص لا يزال يُخزَّن بترميزات قديمة، إلا أن يونيكود يُستخدم حصريًا تقريبًا في بناء أنظمة معالجة المعلومات الجديدة. وقد مال المستخدمون الأوائل إلى استخدام UCS-2 (الترميز القديم ذو الطول الثابت المكون من بايتين، والذي سبق UTF-16)، ثم انتقلوا لاحقًا إلى UTF-16 (المعيار الحالي ذو الطول المتغير)، لأنه كان أقل الطرق تأثيرًا لإضافة دعم للأحرف غير BMP. وأشهر هذه الأنظمة هو ويندوز NT (وإصداراته اللاحقة: 2000 ، XP ، Vista ، 7 ، 8 ، 10 ، و 11 )، الذي يستخدم UTF-16 كترميز الأحرف الداخلي الوحيد. كما تستخدمه بيئات بايت كود جافا و .NET ، ونظام macOS ، و KDE للتمثيل الداخلي. ويمكن تثبيت دعم جزئي ليونيكود على أنظمة ويندوز 9x من خلال طبقة مايكروسوفت ليونيكود.

أصبح ترميز UTF-8 (الذي طُوّر في الأصل لنظام Plan 9 ) [ 81 ] الترميز الرئيسي للتخزين في معظم أنظمة التشغيل الشبيهة بنظام Unix (مع أن بعض المكتبات تستخدم ترميزات أخرى أيضًا)، وذلك لسهولة استخدامه كبديل لمجموعات أحرف ASCII الموسعة التقليدية . كما يُعد UTF-8 أكثر ترميزات Unicode شيوعًا في مستندات HTML على شبكة الإنترنت العالمية .

تتضمن محركات عرض النصوص متعددة اللغات التي تستخدم Unicode كلاً من Uniscribe و DirectWrite لنظام التشغيل Microsoft Windows، و ATSUI و Core Text لنظام التشغيل macOS، و Pango لـ GTK+ وسطح مكتب GNOME .

طرق الإدخال

نظراً لأن تخطيطات لوحة المفاتيح لا يمكن أن تحتوي على مجموعات مفاتيح بسيطة لجميع الأحرف، فإن العديد من أنظمة التشغيل توفر طرق إدخال بديلة تسمح بالوصول إلى المجموعة الكاملة.

تحدد المواصفة القياسية ISO/IEC 14755 ، [ 82 ] التي تُوحّد طرق إدخال أحرف يونيكود من نقاط ترميزها، عدة طرق. منها الطريقة الأساسية ، حيث يُتبع تسلسل البداية بالتمثيل الست عشري لنقطة الترميز ثم تسلسل النهاية . كما تُحدد طريقة إدخال اختيار الشاشة ، حيث تُدرج الأحرف في جدول على الشاشة، كما هو الحال في برامج خرائط الأحرف.

تتضمن الأدوات الإلكترونية للعثور على رمز الحرف المعروف أداة Unicode Lookup [ 83 ] لجوناثان هيدلي، وأداة Shapecatcher [ 84 ] لبنيامين ميلد. في Unicode Lookup، يُدخل المستخدم مفتاح بحث (مثل "fractions")، فتظهر قائمة بالأحرف المطابقة مع رموزها. أما في Shapecatcher، وبالاعتماد على سياق الشكل ، يُرسم الحرف داخل مربع، فتظهر قائمة بالأحرف التي تُقارب الرسم مع رموزها.

بريد إلكتروني

يُعرّف معيار MIME آليتين مختلفتين لترميز الأحرف غير ASCII في البريد الإلكتروني، وذلك بحسب وجود هذه الأحرف في ترويسة البريد الإلكتروني (مثل "الموضوع:") أو في نص الرسالة. في كلتا الحالتين، يتم تحديد مجموعة الأحرف الأصلية بالإضافة إلى ترميز النقل. عند إرسال رسائل بريد إلكتروني بتنسيق Unicode، يُوصى باستخدام مجموعة أحرف UTF-8 وترميز النقل Base64 أو Quoted-printable ، وذلك بحسب ما إذا كانت الرسالة تحتوي على عدد كبير من أحرف ASCII . تُحدد تفاصيل الآليتين في معايير MIME، وعادةً ما تكون مخفية عن مستخدمي برامج البريد الإلكتروني.

لقد حددت IETF [ 85 ] [ 86 ] إطار عمل للبريد الإلكتروني الدولي باستخدام UTF-8، وقامت بتحديث [ 87 ] [ 88 ] [ 89 ] [ 90 ] العديد من البروتوكولات وفقًا لهذا الإطار.

كان اعتماد نظام يونيكود في البريد الإلكتروني بطيئًا للغاية. لا تزال بعض النصوص الآسيوية الشرقية مُشفّرة بتشفيرات مثل ISO-2022 ، ولا تزال بعض الأجهزة، كالهواتف المحمولة، غير قادرة على التعامل مع بيانات يونيكود بشكل صحيح. مع ذلك، يشهد الدعم تحسنًا ملحوظًا، حيث يدعمه العديد من مزودي خدمة البريد الإلكتروني المجانية الرئيسيين مثل Yahoo! Mail و Gmail و Outlook.com .

الويب

تستخدم جميع توصيات اتحاد شبكة الويب العالمية (W3C) ترميز يونيكود كمجموعة أحرف للمستندات منذ إصدار HTML 4.0. وتدعم متصفحات الويب ترميز يونيكود، وخاصة UTF-8، منذ سنوات عديدة. كانت هناك سابقًا مشاكل في العرض ناتجة بشكل أساسي عن مشاكل متعلقة بالخطوط ؛ على سبيل المثال، لم يكن الإصدار 6 والإصدارات الأقدم من متصفح مايكروسوفت إنترنت إكسبلورر يعرض العديد من رموز الترميز إلا إذا تم تحديد خط يحتوي عليها صراحةً. [ 91 ]

على الرغم من أن قواعد بناء الجملة قد تؤثر على ترتيب ظهور الأحرف، فإن مستندات XML (بما في ذلك XHTML )، بحكم تعريفها، [ 92 ] تتضمن أحرفًا من معظم نقاط ترميز Unicode، باستثناء:

  • FFFE أو FFFF.
  • معظم رموز التحكم C0 ،
  • نقاط الترميز غير المخصصة بشكل دائم D800–DFFF،

تظهر أحرف HTML إما مباشرةً كبايتات وفقًا لترميز المستند، إذا كان الترميز يدعمها، أو يمكن للمستخدمين كتابتها كمراجع رقمية للأحرف بناءً على رمز Unicode الخاص بالحرف. على سبيل المثال، يجب أن تظهر المراجع &#916;Δ، Δ، Δ، Δ، Δ ، Δ، Δ ، Δ، Δ (أو نفس القيم الرقمية المعبر عنها بالنظام الست عشري، مع استخدام Δ كبادئة) في جميع المتصفحات على النحو التالي: Δ &#1049;، Δ &#1511;، Δ &#1605;، Δ، Δ، Δ، Δ، Δ، Δ، Δ، Δ، Δ ( أو القيم الرقمية نفسها معبرًا عنها بالنظام الست عشري، مع استخدام Δ كبادئة) على جميع المتصفحات على النحو التالي: Δ، ...&#3671;&#12354;&#21494;&#33865;&#47568;&#x

عند تحديد عناوين URI ، على سبيل المثال كعناوين URL في طلبات HTTP ، يجب ترميز الأحرف غير ASCII بنسبة مئوية .

الخطوط

لا يهتم نظام يونيكود من حيث المبدأ بالخطوط بحد ذاتها ، بل يعتبرها خيارات تنفيذية. [ 93 ] قد يحتوي أي حرف على العديد من الأشكال ، بدءًا من الأشكال الشائعة كالخط العريض والمائل والأساسي، وصولًا إلى الأنماط الزخرفية المعقدة. يُعتبر الخط "متوافقًا مع يونيكود" إذا أمكن الوصول إلى رموزه باستخدام نقاط الترميز المحددة في معيار يونيكود . [ 94 ] لا يحدد المعيار الحد الأدنى لعدد الأحرف التي يجب تضمينها في الخط؛ فبعض الخطوط تحتوي على مجموعة محدودة من الأحرف.

تتوفر الخطوط المجانية والتجارية المبنية على يونيكود على نطاق واسع، نظرًا لدعم كلٍ من TrueType و OpenType لـ يونيكود (ويعتمد تنسيق خطوط الويب المفتوح WOFF و WOFF2 عليهما). تربط هذه التنسيقات نقاط رموز يونيكود بالأحرف الرسومية، إلا أن ملفات خطوط OpenType وTrueType محدودة بـ 65,535 حرفًا رسوميًا. توفر ملفات المجموعات آلية "وضع الفجوة" لتجاوز هذا الحد في ملف خط واحد. (مع ذلك، يظل كل خط داخل المجموعة خاضعًا لحد 65,535 حرفًا رسوميًا). عادةً ما يكون امتداد ملف مجموعة TrueType هو ".ttc".

تتوفر آلاف الخطوط في السوق، لكن أقل من اثني عشر خطًا - تُوصف أحيانًا بأنها خطوط "شاملة لليونيكود" - تحاول دعم غالبية أحرف اليونيكود. بدلًا من ذلك، تركز الخطوط القائمة على اليونيكود عادةً على دعم ASCII الأساسي ونصوص أو مجموعات محددة من الأحرف أو الرموز. هناك عدة أسباب تبرر هذا النهج: نادرًا ما تحتاج التطبيقات والمستندات إلى عرض أحرف من أكثر من نظام كتابة واحد أو اثنين؛ تميل الخطوط إلى استهلاك موارد في بيئات الحوسبة؛ وتُظهر أنظمة التشغيل والتطبيقات ذكاءً متزايدًا فيما يتعلق بالحصول على معلومات الرسوم من ملفات الخطوط المنفصلة حسب الحاجة، أي استبدال الخطوط . علاوة على ذلك، يُعد تصميم مجموعة متسقة من تعليمات العرض لعشرات الآلاف من الرسوم مهمة ضخمة؛ مثل هذا المشروع يتجاوز نقطة تناقص العائدات لمعظم أنواع الخطوط.

أسطر جديدة

يُعالج نظام يونيكود جزئياً مشكلة الأسطر الجديدة التي تحدث عند محاولة قراءة ملف نصي على منصات مختلفة. يُعرّف يونيكود عدداً كبيراً من الأحرف التي ينبغي أن تتعرف عليها التطبيقات المتوافقة كفواصل أسطر.

فيما يتعلق بفواصل الأسطر، قدمت يونيكود فاصل الأسطر U+2028 وفاصل الفقرات U+2029 . كانت هذه محاولة لتوفير حل يونيكود لترميز الفقرات والأسطر دلاليًا، ما قد يحل محل جميع حلول المنصات المختلفة. وبذلك، توفر يونيكود طريقة لتجاوز الحلول التاريخية المعتمدة على المنصات. مع ذلك، لم تعتمد سوى قلة من حلول يونيكود، إن وجدت، فواصل الأسطر والفقرات هذه كأحرف إنهاء الأسطر الأساسية. ومع ذلك، يتمثل أحد الأساليب الشائعة لحل هذه المشكلة في توحيد فواصل الأسطر. ويتحقق ذلك من خلال نظام نص Cocoa في macOS ، وكذلك من خلال توصيات W3C XML وHTML. في هذا الأسلوب، يتم تحويل كل حرف سطر جديد ممكن داخليًا إلى سطر جديد مشترك (لا يهم أي حرف تحديدًا لأنه عملية داخلية خاصة بالعرض فقط). بعبارة أخرى، يمكن لنظام النص التعامل مع الحرف بشكل صحيح كسطر جديد، بغض النظر عن الترميز الفعلي للمدخلات.

مشاكل

توحيد الشخصية

توحيد الهان

تتولى مجموعة أبحاث الكتابة التصويرية (IRG) مهمة تقديم المشورة إلى الكونسورتيوم ومنظمة المعايير الدولية (ISO) بشأن توحيد الأحرف الصينية (هان)، أو ما يُعرف بـ"يونيهان"، ولا سيما إضافة المزيد من الأحرف الصينية واليابانية والكورية الموحدة والمتوافقة إلى مجموعة الأحرف الصينية. تتألف مجموعة أبحاث الكتابة التصويرية من خبراء من كل منطقة استخدمت الأحرف الصينية تاريخيًا . ومع ذلك ، وعلى الرغم من المداولات داخل اللجنة، ظل توحيد الأحرف الصينية أحد أكثر جوانب معيار يونيكود إثارةً للجدل منذ نشأة المشروع. [ 95 ]

حددت معايير مجموعات الأحرف الحالية، مثل معيار JIS X 0208 الياباني (المُشفّر بواسطة Shift JIS )، معايير التوحيد، أي قواعد تحديد متى يُعتبر اختلاف الحرف الصيني اختلافًا في الكتابة اليدوية/الخط (وبالتالي يُوحّد)، مقابل اختلاف في التهجئة (يُشفّر بشكل منفصل). استند نموذج أحرف يونيكود للأحرف الصينية واليابانية والكورية إلى معايير التوحيد المستخدمة في معيار JIS X 0208، بالإضافة إلى تلك التي طورتها جمعية رمز اللغة الصينية الموحد في الصين. [ 96 ]

بسبب مبدأ معيار يونيكود في ترميز المتغيرات الدلالية بدلاً من الأسلوبية، وُجّهت إليه انتقادات لعدم تخصيصه نقاط ترميز لبعض متغيرات الكانجي النادرة والقديمة ، مما قد يُعقّد معالجة الأسماء اليابانية القديمة وغير الشائعة. ولأنه يُركّز بشكل خاص على اشتراك الصينية واليابانية والكورية في العديد من الأحرف، يُنظر أحيانًا إلى توحيد الهان على أنه يُعامل اللغات الثلاث على أنها شيء واحد. [ 97 ] لا تقع الاختلافات الإقليمية في الأشكال المتوقعة للأحرف، من حيث الأعراف الطباعية ومناهج الكتابة اليدوية، دائمًا على حدود اللغة: فعلى الرغم من أن هونغ كونغ وتايوان تكتبان اللغة الصينية باستخدام الأحرف الصينية التقليدية ، إلا أن الأشكال المفضلة للأحرف تختلف بين هونغ كونغ وتايوان في بعض الحالات. [ 98 ]

توجد ترميزات بديلة أقل استخدامًا، غالبًا ما تسبق يونيكود، بنماذج أحرف تختلف عن هذا النموذج، وتهدف إلى الحفاظ على الاختلافات الأسلوبية المتنوعة بين أشكال الأحرف الإقليمية و/أو غير القياسية. ومن الأمثلة على ذلك ترميز TRON الذي يفضله بعض المستخدمين للتعامل مع النصوص اليابانية التاريخية، على الرغم من أنه لم ينتشر على نطاق واسع بين الجمهور الياباني. مثال آخر هو ترميز CCCII الذي اعتمدته أنظمة المكتبات في هونغ كونغ وتايوان والولايات المتحدة . لهذه الترميزات عيوبها الخاصة في الاستخدام العام، مما أدى إلى أن يصبح ترميز Big5 (الذي طُرح عام 1984، بعد أربع سنوات من CCCII) أكثر شيوعًا من CCCII خارج أنظمة المكتبات. [ 99 ] على الرغم من أن العمل الذي قامت به شركة Apple استنادًا إلى قاموس CJK Thesaurus التابع لمجموعة Research Libraries Group ، والذي استُخدم للحفاظ على متغير EACC من CCCII، كان أحد الأسلاف المباشرة لمجموعة Unihan الخاصة بيونيكود ، إلا أن يونيكود اعتمدت نموذج التوحيد على نمط JIS. [ 96 ]

كانت النسخة الأولى من يونيكود تضم أقل من 21,000 حرف صيني، مقتصرة إلى حد كبير على تلك الشائعة الاستخدام في العصر الحديث. أما في النسخة 17.0، فقد أصبح المعيار يضم أكثر من 101,000 حرف صيني، ويستمر العمل على إضافة آلاف أخرى، معظمها أحرف تاريخية ولهجات محلية مستخدمة في جميع أنحاء العالم الصيني .

تُتيح الخطوط الحديثة وسيلةً لمعالجة بعض المشكلات العملية في تمثيل الأحرف الصينية الموحدة برسومات إقليمية متنوعة. يسمح جدول OpenType المسمى "locl" للمُعرِض باختيار رمز مختلف لكل نقطة ترميز بناءً على لغة النص. [ 100 ] كما يُمكن لتسلسلات اختلافات Unicode توفير تعليقات توضيحية داخل النص لاختيار الرمز المطلوب؛ ويتطلب ذلك تسجيل المتغير المحدد في قاعدة بيانات الاختلافات الإيديوغرافية .

الأحرف المائلة أو المكتوبة بخط اليد في اللغة السيريلية

تظهر أحرف السيريلية المختلفة بأشكال بديلة مستقيمة ومائلة ومائلة

إذا اختلفت الرموز الرسومية المناسبة للأحرف في نفس النص فقط في الخط المائل، فقد وحّدها يونيكود عمومًا، كما يتضح من المقارنة بين مجموعة من سبعة رموز رسومية مائلة تظهر عادةً في النصوص الروسية والبلغارية التقليدية والمقدونية والصربية على اليمين، مما يعني أن الاختلافات تُعرض من خلال تقنية الخطوط الذكية أو تغيير الخطوط يدويًا. وتُستخدم نفس تقنية OpenType 'locl'. [ 101 ]

أزواج الحالات الموضعية

للاستخدام في الأبجدية التركية والأذرية ، يتضمن يونيكود حرف I صغيرًا منفصلاً بدون نقطة (ı) وحرف I كبيرًا منقطًا ( İ ). مع ذلك، تُستخدم أحرف ASCII المعتادة للحرفين الصغير المنقط (i) والكبير بدون نقطة ( İ ) ، بما يتوافق مع طريقة التعامل معهما في معيار ISO 8859-9 السابق . ونتيجةً لذلك، يجب أن تستخدم المقارنات غير الحساسة لحالة الأحرف في هاتين اللغتين قواعد مختلفة عن تلك المستخدمة في المقارنات غير الحساسة لحالة الأحرف في اللغات الأخرى التي تستخدم الأبجدية اللاتينية. [ 102 ] [ 103 ] قد يكون لهذا الأمر آثار أمنية، على سبيل المثال، إذا كان رمز التنظيف أو التحكم في الوصول يعتمد على المقارنة غير الحساسة لحالة الأحرف. [ 103 ]

على النقيض من ذلك، فإنّ الحرف الأيسلندي eth (ð) ، وحرف D المشطوب (đ) ، وحرف D المنعكس (ɖ) ، والتي عادةً ما تبدو متشابهة في الأحرف الكبيرة (Đ) [ ملاحظة 4 ] ، تُعامل بشكل معاكس، وتُشفّر بشكل منفصل في كلتا حالتي الأحرف (على عكس معيار ISO 6937 السابق ، الذي يوحّد أشكال الأحرف الكبيرة). ورغم أنّ هذا النهج يسمح بالمقارنة غير الحساسة لحالة الأحرف دون الحاجة إلى معرفة لغة النص، إلا أنّه ينطوي على بعض المشكلات، إذ يتطلب تدابير أمنية تتعلق بهجمات الأحرف المتشابهة . [ 104 ]

علامات التشكيل على حرف I الصغير

أشكال محلية للحرف í ( حرف I مع علامة النبرة الحادة )

يعتمد ما إذا كان من المتوقع أن يحتفظ الحرف الصغير I بلقبه عند تطبيق علامة التشكيل على الأعراف المحلية.

حماية

يحتوي نظام يونيكود على عدد كبير من الأحرف المتماثلة ، والتي يشبه الكثير منها أحرف ASCII أو يطابقها تمامًا. يمكن أن يؤدي استبدال هذه الأحرف إلى إنشاء مُعرّف أو عنوان URL يبدو صحيحًا، ولكنه يُوجّه إلى موقع مختلف عن المتوقع. [ 105 ] بالإضافة إلى ذلك، يمكن استخدام الأحرف المتماثلة لمعالجة مُخرجات أنظمة معالجة اللغة الطبيعية (NLP) . [ 106 ] يتطلب التخفيف من هذه المشكلة منع هذه الأحرف، أو عرضها بشكل مختلف، أو اشتراط أن تُشير إلى نفس المُعرّف؛ [ 107 ] كل هذا مُعقّد نظرًا لضخامة مجموعة الأحرف وتغيّرها المُستمر. [ 108 ] [ 109 ]

أصدر باحثان، أحدهما من جامعة كامبريدج والآخر من جامعة إدنبرة ، تحذيراً أمنياً في عام 2021، أكدا فيه إمكانية استخدام علامات BiDi لتغيير وظائف أجزاء كبيرة من التعليمات البرمجية بشكل جذري. وقد أُطلق على هذه المشكلة اسم " مصدر حصان طروادة ". [ 110 ] واستجابةً لذلك، بدأ محررو التعليمات البرمجية بتظليل هذه العلامات للإشارة إلى تغييرات اتجاه النص القسرية. [ 111 ]

لا تقبل ترميزات UTF -8 و UTF-16 جميع التسلسلات الممكنة لوحدات الترميز. وتختلف التطبيقات في كيفية تعاملها مع قراءة تسلسل غير صالح، مما أدى إلى ثغرات أمنية. [ 112 ] [ 113 ]

الربط بمجموعات الأحرف القديمة

صُمم نظام يونيكود لتوفير تحويل ثنائي الاتجاه، نقطة بنقطة، بين أي ترميز أحرف موجود مسبقًا وأي ترميز آخر، بحيث يمكن تحويل ملفات النصوص ذات مجموعات الأحرف القديمة إلى يونيكود ثم إعادتها إلى نفس الملف، دون الحاجة إلى تفسير يعتمد على السياق. ونتيجةً لذلك، توجد في يونيكود بنى قديمة غير متناسقة، مثل دمج علامات التشكيل والأحرف المركبة مسبقًا ، مما يوفر أكثر من طريقة لتمثيل نص معين. ويتجلى هذا بوضوح في أشكال الترميز الثلاثة المختلفة للغة الهانغول الكورية . ومنذ الإصدار 3.0، لم يعد بالإمكان إضافة أي أحرف مركبة مسبقًا يمكن تمثيلها بتسلسل مُركب من الأحرف الموجودة مسبقًا إلى المعيار، وذلك للحفاظ على التوافق بين البرامج التي تستخدم إصدارات مختلفة من يونيكود.

يجب توفير روابط مباشرة بين الأحرف في مجموعات الأحرف القديمة الحالية والأحرف في يونيكود لتسهيل التحويل إلى يونيكود والسماح بالتوافق مع البرامج القديمة. أدى عدم الاتساق في الروابط المختلفة بين ترميزات يابانية سابقة مثل Shift-JIS أو EUC-JP ويونيكود إلى عدم تطابق في تحويل التنسيق ذهابًا وإيابًا ، لا سيما رابط الحرف JIS X 0208 '~' (1-33، شرطة موجية)، المستخدم بكثرة في بيانات قواعد البيانات القديمة، إما إلى U+FF5E علامة مد عريضة (في مايكروسوفت ويندوز ) أو U+301C شرطة موجية (لدى موردين آخرين). [ 114 ]

اعترض بعض مبرمجي الحاسوب اليابانيين على نظام يونيكود لأنه يُلزمهم بفصل استخدام الرمز U+005C ( الشرطة المائلة العكسية) عن الرمز U+00A5 ( علامة الين) ، الذي كان يُقابل الرمز 0x5C في معيار JIS X 0201، ولا يزال الكثير من التعليمات البرمجية القديمة يستخدم هذا الرمز. [ 115 ] (يستبدل هذا الترميز أيضًا علامة المد '~' (0x7E) بعلامة المدّ '¯' (0xAF).) يوجد فصل هذه الأحرف في معيار ISO 8859-1 ، منذ فترة طويلة قبل اعتماد يونيكود.

الكتابات الهندية

تُخصص لكل من الكتابات الهندية، مثل التاميلية والديفاناغارية، 128 نقطة ترميز فقط، بما يتوافق مع معيار ISCII . يتطلب العرض الصحيح لنصوص يونيكود الهندية تحويل الأحرف ذات الترتيب المنطقي المخزن إلى ترتيب مرئي، وتكوين وصلات (تُعرف أيضًا بالوصلات) من مكوناتها. جادل بعض الباحثين المحليين لصالح تخصيص نقاط ترميز يونيكود لهذه الوصلات، مخالفين بذلك الممارسة المتبعة في أنظمة الكتابة الأخرى، على الرغم من أن يونيكود يحتوي على بعض الوصلات العربية وغيرها لأغراض التوافق مع الإصدارات السابقة فقط. [ 116 ] [ 117 ] [ 118 ] لن يتم ترميز أي وصلات جديدة في يونيكود، جزئيًا، لأن مجموعة الوصلات تعتمد على نوع الخط، بينما يونيكود ترميز مستقل عن اختلافات الخطوط. وظهرت مشكلة مماثلة فيما يتعلق بالكتابة التبتية في عام 2003 عندما اقترحت إدارة التقييس الصينية ترميز 956 مقطعًا تبتيًا مُركبًا مسبقًا، [ 119 ] ولكن تم رفض هذا الترميز من قبل لجنة ISO المختصة ( ISO/IEC JTC 1/SC 2 ). [ 120 ]

تعرض دعم الأبجدية التايلاندية لانتقادات بسبب ترتيب الأحرف التايلاندية. فالحروف المتحركة เ، แ، โ، ใ، ไ، المكتوبة على يسار الحرف الساكن السابق، تُكتب بترتيب بصري وليس صوتي، على عكس تمثيلات يونيكود للنصوص الهندية الأخرى. ويعود هذا التعقيد إلى اعتماد يونيكود على المعيار الصناعي التايلاندي 620 ، الذي كان يعمل بنفس الطريقة، وهو الأسلوب الذي لطالما كُتبت به اللغة التايلاندية على لوحات المفاتيح. تُعقّد مشكلة الترتيب هذه عملية تجميع يونيكود قليلاً، مما يستلزم الرجوع إلى جداول لإعادة ترتيب الأحرف التايلاندية لأغراض التجميع. [ 97 ] وحتى لو اعتمد يونيكود الترميز وفقًا للترتيب المنطوق، فسيظل تجميع الكلمات وفقًا لترتيب القاموس أمرًا صعبًا. على سبيل المثال، كلمة แสดง[ sa dɛːŋ ] "perform" تبدأ بمجموعة من الحروف الساكنة "สด" (مع حرف علة ضمني للحرف الساكن "ส")، وحرف العلة แ-، في الترتيب المنطوق سيأتي بعد ด، ولكن في القاموس، يتم تجميع الكلمة كما هي مكتوبة، مع حرف العلة الذي يلي ส.

دمج الشخصيات

يمكن تمثيل الأحرف التي تحمل علامات تشكيلية إما كحرف واحد مُركّب مسبقًا أو كسلسلة مُفكّكة من حرف أساسي متبوعًا بعلامة تشكيل واحدة أو أكثر. على سبيل المثال، يجب أن يُعرض الحرفان ḗ (حرف e مُركّب مسبقًا مع علامة مد وعلامة رفع في الأعلى) وē ́ (حرف e متبوعًا بعلامة مد وعلامة رفع في الأعلى) بشكل متطابق، حيث يظهر كلاهما كحرف e مع علامة مد (◌̄) وعلامة رفع (◌ ́ )، ولكن عمليًا، قد يختلف مظهرهما تبعًا لمحرك العرض والخطوط المستخدمة لعرض الأحرف. وبالمثل، غالبًا ما تُوضع النقاط السفلية ، كما هو مطلوب في كتابة اللغات الهندية بالحروف اللاتينية ، بشكل غير صحيح. يمكن استخدام أحرف Unicode التي يتم تعيينها إلى رموز مركبة مسبقًا في كثير من الحالات، وبالتالي تجنب المشكلة، ولكن عندما لا يتم ترميز أي حرف مركب مسبقًا، يمكن غالبًا حل المشكلة باستخدام خط Unicode متخصص مثل Charis SIL الذي يستخدم تقنيات Graphite أو OpenType ('gsub') أو AAT لميزات العرض المتقدمة.

الشذوذ

فرض معيار يونيكود قواعد تهدف إلى ضمان الاستقرار. [ 121 ] وبحسب مدى صرامة القاعدة، يُمكن حظر التغيير أو السماح به. على سبيل المثال، لا يُمكن تغيير "الاسم" المُعطى لنقطة رمزية، ولن يتغير. لكن خاصية "النص" أكثر مرونة، وفقًا لقواعد يونيكود نفسها. في الإصدار 2.0، غيّر يونيكود العديد من "أسماء" النقاط الرمزية مقارنةً بالإصدار 1. وفي الوقت نفسه، أعلن يونيكود أنه من الآن فصاعدًا، لن يتغير الاسم المُخصص لنقطة رمزية أبدًا. هذا يعني أنه عند نشر الأخطاء، لا يُمكن تصحيحها، حتى لو كانت بسيطة (كما حدث في حالة واحدة مع تهجئة BRAKCET بدلًا من BRACKET في اسم حرف). في عام 2006، نُشرت قائمة بالشذوذات في أسماء الأحرف لأول مرة، واعتبارًا من يونيو 2021، كان هناك 104 أحرف بها مشكلات مُحددة، [ 122 ] على سبيل المثال:

بينما يُعرّف يونيكود مُعرّف (اسم) الخط على أنه " Phags_Pa "، تُضاف شرطة (واصلة) إلى أسماء أحرف هذا الخط: U+A840 PHAGS-PA LETTER KA . [ 125 ] [ 126 ] مع ذلك، ليس هذا شذوذًا، بل هو القاعدة: تُستبدل الشرطات (الواصلات) بشرطات سفلية (_) في مُعرّفات الخطوط. [ 125 ]

انظر أيضاً

ملحوظات

  1. "يشكل ملحق معيار يونيكود (UAX) جزءًا لا يتجزأ من معيار يونيكود ، ولكنه يُنشر كوثيقة منفصلة."
  2. تم اختيار البادئة المكونة من حرفينU+كتقريب ASCII لـ U+228E MULTISET UNION . [ 62 ]
  3. نقطة الترميز هي تمثيل مجرد لحرف UCS بواسطة عدد صحيح بين 0 و 1,114,111 (1,114,112 = 2 20 + 2 16 أو 17 × 2 16 = 0x110000 نقطة ترميز)
  4. نادرًا ما يتم كتابة الحرف الأيسلندي الكبير eth بدلاً من ذلك بأسلوب جزيري (Ꝺ) مع وضع الخط الأفقي على الساق، خاصة إذا كان من الضروري تمييزه عن الحرف D الكبير المنعكس (انظر الأبجدية المرجعية الأفريقية ).

مراجع

  1. معيار يونيكود، الإصدار 17.0.0 . جنوب سان فرانسيسكو، كاليفورنيا: اتحاد يونيكود. 9 سبتمبر 2025. ISBN 978-1-936213-35-1.
  1. "التقرير الفني رقم 28 لليونيكود: يونيكود 3.2" . اتحاد يونيكود . 27-03-2002 . تاريخ الاطلاع: 23-06-2022 .
  2. جينكينز، جون هـ. (26-08-2021). "الملحق رقم 45 من معيار يونيكود: الرموز التصويرية المصدرية" . اتحاد يونيكود . §2.2 حقل المصدر . تم الاسترجاع في 23-06-2022 .
  3. "معيار يونيكود: مقدمة تقنية" . 2019-08-22 . تم الاطلاع عليه بتاريخ 2024-09-11 .
  4. "إحصاءات الرموز التعبيرية، الإصدار 16.0" . اتحاد يونيكود . تم الاطلاع عليه بتاريخ 10-09-2024 .
  5. 1 2 3 4 5 بيكر، جوزيف د. (10-09-1998) [29-08-1988]. "يونيكود 88" (ملف PDF) . اتحاد يونيكود . مؤرشف (ملف PDF) من الأصل بتاريخ 25-11-2016 . تم الاطلاع عليه بتاريخ 25-10-2016 . في عام 1978، قدم بوب بيلفيل في مركز أبحاث زيروكس بارك (Xerox PARC ) الاقتراح الأولي لمجموعة من "الرموز العالمية" . ساهم العديد من الأشخاص بأفكارهم في تطوير تصميم ترميز جديد. ابتداءً من عام 1980، تطورت هذه الجهود إلى معيار ترميز أحرف زيروكس (XCCS) من قِبل المؤلف الحالي، وهو ترميز متعدد اللغات حافظت عليه شركة زيروكس كمعيار داخلي للشركة منذ عام 1982، بفضل جهود إد سمورا ورون بيلار وآخرين. نشأ يونيكود نتيجة ثماني سنوات من الخبرة العملية مع معيار ترميز أحرف زيروكس (XCCS). تم اقتراح الاختلافات الجوهرية بين يونيكود وXCCS من قبل بيتر فينويك وديف أوبستاد (رموز 16 بت خالصة) ولي كولينز (توحيد الأحرف التصويرية). يحتفظ يونيكود بالعديد من ميزات XCCS التي أثبتت جدواها على مر السنين في سلسلة دولية من منتجات أنظمة الاتصالات متعددة اللغات.
  6. 1 2 "سرد موجز" . يونيكود . 31-08-2006 . تم الاسترجاع في 15-03-2010 .
  7. "تاريخ إصدار ونشر يونيكود" . يونيكود . تم الاطلاع عليه بتاريخ 2023-03-20 .
  8. سيرل، ستيفن ج. "إعادة النظر في يونيكود" . تم الاسترجاع في 18 يناير 2013 .
  9. 1 2 "أعضاء اتحاد يونيكود" . تم الاسترجاع في 12-02-2024 .
  10. جائزة "يونيكود بولدوغ" . يونيكود . مؤرشف من الأصل بتاريخ 11-11-2023.
  11. "النصوص المدعومة" . يونيكود . تم الاسترجاع في 2025-09-09 .
  12. أوتونغ، إيفيوك (28 يناير 2021). مبادئ هندسة الاتصالات . جون وايلي وأولاده. ص 12. ISBN  978-1-119-27407-0.
  13. "أسئلة وأجوبة حول يونيكود" . تم الاطلاع عليه بتاريخ 2020-04-02 .
  14. "خارطة طريق لأفضل الممارسات" . اتحاد يونيكود . تم الاطلاع عليه بتاريخ 30 يوليو 2018 .
  15. "خرائط طريق إلى يونيكود" . يونيكود . مؤرشف من الأصل بتاريخ 2023-12-08.
  16. "مبادرة ترميز النصوص" . مبادرة ترميز النصوص . مؤرشفة من الأصل بتاريخ 25-03-2023.
  17. "حول مبادرة ترميز النصوص" . اتحاد يونيكود . تم الاطلاع عليه بتاريخ 4 يونيو 2012 .
  18. "نصوص للترميز" .
  19. "النسخة الورقية من يونيكود 6.1 متوفرة" . announcements_at_unicode.org . تم الاطلاع بتاريخ 30-05-2012 .
  20. "الإصدارات المرقمة من معيار يونيكود" . تم الاطلاع عليه بتاريخ 12-09-2025 .
  21. 1 2
  22. "التسلسلات المسماة - 4.1.0" . يونيكود . 2005. تم الاسترجاع في 16-03-2010 .
  23. معيار يونيكود، الإصدار 5.0.0 . ماونتن فيو، كاليفورنيا: اتحاد يونيكود. 14 يوليو 2006. ISBN 0-321-48091-0.
  24. "بيانات يونيكود 5.0.0" . تم الاطلاع عليه بتاريخ 17-03-2010 .
  25. "قائمة رموز تعبيرية يونيكود 6.0" . emojipedia.org . تم الاطلاع عليه بتاريخ 21-09-2022 .
  26. معيار يونيكود، الإصدار 8.0.0 . ماونتن فيو، كاليفورنيا: اتحاد يونيكود. 17-06-2015. ISBN 978-1-936213-10-8.
  27. معيار يونيكود، الإصدار 9.0.0 . ماونتن فيو، كاليفورنيا: اتحاد يونيكود. 21-06-2016. ISBN 978-1-936213-13-9.
  28. لوباو، مارتيم (2016-06-07). "هذان هما الرمزان التعبيريان اللذان لم يُعتمدا في يونيكود 9، لكن جوجل أضافتهما إلى أندرويد على أي حال" . أندرويد بوليس . تم الاسترجاع في 2016-09-04 .
  29. معيار يونيكود، الإصدار 10.0.0 . ماونتن فيو، كاليفورنيا: اتحاد يونيكود. 2017-06-20. ISBN 978-1-936213-16-0.
  30. معيار يونيكود، الإصدار 11.0.0 . ماونتن فيو، كاليفورنيا: اتحاد يونيكود. 2018-06-05. ISBN 978-1-936213-19-1.
  31. معيار يونيكود، الإصدار 12.0.0 . ماونتن فيو، كاليفورنيا: اتحاد يونيكود. 5 مارس 2019. ISBN 978-1-936213-22-1.
  32. "إصدار يونيكود 12.1 لدعم عهد ريوا" . مدونة يونيكود . تم الاطلاع عليه بتاريخ 7 مايو 2019 .
  33. "معيار يونيكود، الإصدار 13.0 - الملحق ج للمواصفات الأساسية" (ملف PDF) . اتحاد يونيكود . تاريخ الاسترجاع: 11 مارس 2020 .
  34. معيار يونيكود، الإصدار 15.0.0 . ماونتن فيو، كاليفورنيا: اتحاد يونيكود. 13 سبتمبر 2022. ISBN 978-1-936213-32-0.
  35. معيار يونيكود، الإصدار 16.0.0 . جنوب سان فرانسيسكو، كاليفورنيا: اتحاد يونيكود. 10 سبتمبر 2024. ISBN 978-1-936213-34-4.
  36. معيار يونيكود، الإصدار 17.0.0 . جنوب سان فرانسيسكو، كاليفورنيا: اتحاد يونيكود. 9 سبتمبر 2025. ISBN 978-1-936213-35-1.
  37. "مسرد مصطلحات يونيكود" . تم الاطلاع عليه بتاريخ 16-03-2010 .
  38. "2.4 نقاط الترميز والأحرف". معيار يونيكود الإصدار 16.0 - المواصفات الأساسية . 2024.
  39. "3.4 الأحرف والترميز". معيار يونيكود، الإصدار 16.0 . 2024.
  40. "ردًا على: أصل تدوين U+nnnn" . أرشيف قائمة بريد يونيكود (قائمة بريدية). 2005-11-08.
  41. "الملحق أ: اصطلاحات الترميز" . معيار يونيكود . اتحاد يونيكود. سبتمبر 2024.
  42. "التوافق" . معيار يونيكود (الإصدار 6.0 ). ماونتن فيو، كاليفورنيا، الولايات المتحدة الأمريكية: اتحاد يونيكود . 3.9 أشكال ترميز يونيكود. ISBN  978-1-936213-01-6كل شكل من أشكال الترميز يربط نقاط رمز Unicode من U+0000 إلى U+D7FF ومن U+E000 إلى U+10FFFF
  43. 1 2 "سياسة استقرار ترميز الأحرف في يونيكود" . تم الاطلاع عليه بتاريخ 16-03-2010 .
  44. "الخصائص" . تم الاسترجاع بتاريخ 21-09-2025 .
  45. "نموذج ترميز الأحرف يونيكود" . تم الاطلاع عليه بتاريخ 12-09-2023 .
  46. "تسلسلات يونيكود المسماة" . تم الاسترجاع في 21-09-2025 .
  47. "أسماء مستعارة في يونيكود" . تم الاطلاع عليه بتاريخ 21-09-2025 .
  48. "JanaSanskritSans" . مؤرشف من الأصل بتاريخ 2011-07-16.
  49. CWA 13873:2000  – المجموعات الفرعية الأوروبية متعددة اللغات في ISO/IEC 10646-1 اتفاقية ورشة عمل CEN 13873
  50. كون، ماركوس (1998). "الأساس المنطقي لمجموعة الأحرف الأوروبية متعددة اللغات 2 (MES-2)" . جامعة كامبريدج . تم الاسترجاع في 20 مارس 2023 .
  51. "DIN 91379:2022-08: الأحرف وتسلسلات الأحرف المحددة في يونيكود للمعالجة الإلكترونية للأسماء وتبادل البيانات في أوروبا، مع قرص مضغوط" . دار نشر بيوث . تاريخ الاسترجاع: 21 أغسطس 2022 .
  52. "UTF-8، UTF-16، UTF-32 وBOM" . الأسئلة الشائعة على موقع Unicode.org . تم الاطلاع عليه بتاريخ 12-12-2016 .
  53. معيار يونيكود، الإصدار 6.2 . اتحاد يونيكود. 2013. ص 561. ISBN  978-1-936213-08-5.
  54. ديفيس، مارك (5 مايو 2008). "الانتقال إلى يونيكود 5.1" . مدونة جوجل الرسمية . مؤرشف من الأصل في 1 أبريل 2025. تم الاطلاع عليه في 12 أبريل 2025 .
  55. "دراسة استقصائية حول استخدام ترميزات الأحرف مصنفة حسب الترتيب" . W3Techs . تم الاطلاع عليها بتاريخ 12 أبريل 2025 .
  56. "إحصائيات استخدام ترميز ASCII الأمريكي للمواقع الإلكترونية" . W3Techs . تم الاطلاع عليه بتاريخ 1 نوفمبر 2020 .
  57. ب. كورتين (يوليو 1999). تدويل بروتوكول نقل الملفات . IETF . doi : 10.17487/RFC2640 . RFC 2640. تاريخ الاسترجاع : 12 أبريل 2025 .
  58. هـ. ألفستراند (يناير 1998). سياسة IETF بشأن مجموعات الأحرف واللغات . IETF . doi : 10.17487/RFC2277 . BCP 18. RFC 2277. مؤرشف من الأصل في 23 يناير 2023. تم الاطلاع عليه في 12 أبريل 2025 .
  59. بايك، روب (30-04-2003). "تاريخ UTF-8" .
  60. "ISO/IEC JTC1/SC 18/WG 9 N" (ملف PDF) . مؤرشف (ملف PDF) من الأصل بتاريخ 22 يناير 2025. تم الاطلاع عليه بتاريخ 12 أبريل 2025 .
  61. هيدلي، جوناثان (2009). "البحث في يونيكود" . مؤرشف من الأصل بتاريخ 30 مارس 2025. تم الاطلاع عليه بتاريخ 12 أبريل 2025 .
  62. ميلد، بنيامين (2025). "التعرف على الأحرف باستخدام يونيكود" . مؤرشف من الأصل بتاريخ 2025-04-02.
  63. ^ ج. كلينسين. واي كو (يوليو 2007). نظرة عامة وإطار عمل للبريد الإلكتروني الدولي . فريق عمل الإنترنت . دوى : 10.17487/RFC4952 . آر إف سي 4952 . تم الاسترجاع 2022-08-17 .
  64. ^ ج. كلينسين. واي كو (فبراير 2012). نظرة عامة وإطار عمل للبريد الإلكتروني الدولي . فريق عمل الإنترنت . دوى : 10.17487/RFC6530 . آر إف سي 6530 . تم الاسترجاع 2022-08-17 .
  65. ج. ياو؛ و. ماو (فبراير 2012). امتداد SMTP للبريد الإلكتروني الدولي . IETF . doi : 10.17487/RFC6531 . RFC 6531. تاريخ الاسترجاع: 17 أغسطس 2022 .
  66. أ. يانغ؛ س. ستيل؛ ن. فريد (فبراير 2012). رؤوس البريد الإلكتروني الدولية . IETF . doi : 10.17487/RFC6532 . RFC 6532. تاريخ الاسترجاع : 17 أغسطس 2022 .
  67. سي. نيومان؛ أ. غولبراندسن؛ أ. ميلنيكوف (يونيو 2008). تدويل بروتوكول الوصول إلى رسائل الإنترنت . IETF . doi : 10.17487/RFC5255 . RFC 5255. تاريخ الاسترجاع : 17 أغسطس 2022 .
  68. ر. جيلينز؛ س. نيومان (فبراير 2010). دعم بروتوكول POP3 لترميز UTF-8 . IETF . doi : 10.17487/RFC5721 . RFC 5721. تاريخ الاسترجاع: 17 أغسطس 2022 .
  69. وود، آلان (13 سبتمبر 2005). "إعداد متصفح إنترنت إكسبلورر 5 و5.5 و6 لنظام ويندوز لدعم اللغات المتعددة واليونيكود: خيارات تفعيل اليونيكود في إنترنت إكسبلورر 5 و5.5 و6: الخطوط (إنترنت إكسبلورر 5 و5.5 و6) " . آلان وود. مؤرشف من الأصل بتاريخ 20 يناير 2025. تم الاطلاع عليه بتاريخ 12 أبريل 2025 .
  70. "لغة الترميز القابلة للتوسيع (XML) 1.1 (الطبعة الثانية)" . اتحاد شبكة الويب العالمية . 29-09-2006. مؤرشف من الأصل في 05-04-2025 . تم الاطلاع عليه في 12-04-2025 .
  71. بيجلو، تشارلز؛ هولمز، كريس (سبتمبر 1993). "تصميم خط يونيكود" (ملف PDF) . النشر الإلكتروني . 6 (3): 292. ISSN 0894-3982 . مؤرشف (ملف PDF) من الأصل بتاريخ 16 فبراير 2025. تم الاطلاع عليه بتاريخ 12 أبريل 2025 . 
  72. "الأسئلة الشائعة: الخطوط ولوحات المفاتيح: الخطوط واليونيكود " . اتحاد اليونيكود . مؤرشف من الأصل بتاريخ 2025-03-06 . تم الاطلاع عليه بتاريخ 2025-04-12 .
  73. تاريخ موجز لرموز الأحرف ، ستيفن ج. سيرل، كُتب أصلاً عام 1999 ، وتم تحديثه آخر مرة عام 2004
  74. 1 2 "الملحق هـ: تاريخ توحيد الهان" . معيار يونيكود الإصدار 16.0 - المواصفات الأساسية . اتحاد يونيكود . 2024.
  75. توبينغ ، سوزان ( 25 يونيو 2013). "الحياة السرية لليونيكود" . آي بي إم . مؤرشف من الأصل في 25 يونيو 2013. تم الاطلاع عليه في 20 مارس 2023 .
  76. لو، تشين (2015-06-08). "مجموعة الأحرف المقترحة لهونغ كونغ" (ملف PDF) . ISO/IEC JTC1 / SC2 /WG2/ IRG N2074.
  77. ويترن، كريستيان (1995-05-01). "رموز الأحرف الصينية: تحديث" . المعهد الدولي لأبحاث البوذية الزن / جامعة هانازونو . مؤرشف من الأصل في 2004-10-12.
  78. "خطوط نوتو CJK" . خطوط نوتو. 2023-02-18. اختر تنسيق النشر هذا إذا كان نظامك يدعم الخطوط المتغيرة وتفضل استخدام لغة واحدة فقط، ولكنك تريد أيضًا تغطية كاملة للأحرف أو القدرة على وضع علامات اللغة على النص لاستخدام الرموز الرسومية المناسبة للغات الأخرى (يتطلب هذا تطبيقًا يدعم وضع علامات اللغة وميزة OpenType 'locl' GSUB).
  79. برويس، إنجو. "ميزة OpenType: locl - النماذج المترجمة" . preusstype.com .
  80. "خصائص طي الأحرف" . قاعدة بيانات أحرف يونيكود . اتحاد يونيكود . 30-07-2025.
  81. 1 2 "خيارات التعبير النمطي § المقارنة باستخدام الثقافة الثابتة" . وثائق أساسيات .NET . مايكروسوفت . 2023-05-12.
  82. "confusablesSummary.txt" . آليات أمان يونيكود لـ UTS #39 . اتحاد يونيكود . 11-08-2023.
  83. "UTR #36: اعتبارات أمان يونيكود" . يونيكود .
  84. بوشيه، نيكولاس؛ شومايلوف، إيليا؛ أندرسون، روس؛ بابرنوت، نيكولاس (2022). "الشخصيات السيئة: هجمات معالجة اللغة الطبيعية غير المحسوسة". ندوة IEEE للأمن والخصوصية لعام 2022 (SP) . سان فرانسيسكو، كاليفورنيا، الولايات المتحدة الأمريكية: IEEE. الصفحات 1987-2004 . arXiv : 2106.09898 . doi : 10.1109/SP46214.2022.9833641 . ISBN  978-1-66541-316-9. S2CID 235485405 . 
  85. قسم الهندسة، سبوتيفاي (18 يونيو 2013). "أسماء المستخدمين الإبداعية واختراق حسابات سبوتيفاي" . قسم الهندسة في سبوتيفاي . تاريخ الاسترجاع: 15 أبريل 2023 .
  86. ويلر، ديفيد أ. (2020). التحليل الأولي لشفرة المصدر الخادعة (تقرير فني). ص 4-1-4-10. JSTOR resrep25332.7 .  
  87. "UTR #36: اعتبارات أمنية خاصة بنظام يونيكود" . يونيكود . تم الاطلاع عليه بتاريخ 27-06-2022 .
  88. بوشيه، نيكولاس؛ أندرسون، روس. "مصدر حصان طروادة: نقاط ضعف خفية" (ملف PDF) . تم الاطلاع عليه بتاريخ 2021-11-02 .
  89. "Visual Studio Code أكتوبر 2021" . code.visualstudio.com . تم الاطلاع عليه بتاريخ 11 نوفمبر 2021 .
  90. ديتيرت، دومينيك (2024-09-06). "من يونيكود إلى الاستغلال: المخاطر الأمنية لترميزات UTF-8 الطويلة جدًا" . تم الاسترجاع في 2024-12-26 .
  91. بون، كيفن. "UTF-8 ومشكلة الأحرف الطويلة جدًا" . تم الاسترجاع في 26-12-2024 .
  92. مساهمة AFII حول WAVE DASH ، "جدول أحرف خاص بمورد Unicode للغة اليابانية" . 22-04-2011. مؤرشف من الأصل في 22-04-2011 . تم الاطلاع عليه في 20-05-2019 .
  93. مشكلة ISO 646-* مؤرشفة بتاريخ 23-04-2019 في Wayback Machine ، القسم 4.4.3.5 من مقدمة إلى I18n ، توموهيرو كوبوتا، 2001
  94. "نماذج العرض باللغة العربية - أ" (ملف PDF) . تم الاطلاع عليه بتاريخ 20-03-2010 .
  95. "نماذج العرض باللغة العربية - ب" (ملف PDF) . تم الاطلاع عليه بتاريخ 20-03-2010 .
  96. "أشكال العرض الأبجدي" (ملف PDF) . تم الاطلاع عليه بتاريخ 20-03-2010 .
  97. "اقتراح بشأن ترميز أحرف بردارتن التبتية لمعيار ISO/IEC 10646 في BMP" (PDF) . 2002-12-02.
  98. أوماماهيسواران، في إس (2003-11-07). "قرارات اجتماع الفريق العامل 2 رقم 44" (ملف PDF) . القرار M44.20.
  99. "استقرار ترميز الأحرف" . يونيكود . مؤرشف من الأصل بتاريخ 2024-01-01.
  100. 1 2 "ملاحظة فنية رقم 27 من يونيكود: حالات شاذة معروفة في أسماء أحرف يونيكود" . يونيكود . 2021-06-14.
  101. "مخطط يونيكود: "في الواقع، هذا الحرف له شكل حرف p صغير مكتوب بخط اليد، على الرغم من اسمه"( PDF) .
  102. "الخطأ الإملائي في كلمة BRACKET في اسم الشخصية هو عيب معروف" (PDF) .
  103. 1 2 "الملحق رقم 24 من معيار يونيكود: خصائص نص يونيكود" . اتحاد يونيكود. 2021. 2.2 العلاقة برموز ISO 15924. تم الاطلاع عليه بتاريخ 29-04-2022 .
  104. "Scripts.txt" . اتحاد يونيكود. 2025. تم الاسترجاع في 21-09-2025 .

للمزيد من القراءة

  • Julie D. Allen. The Unicode Standard, Version 6.0, The Unicode Consortium, Mountain View, 2011, ISBN 9781936213016, (Unicode 6.0.0).
  • The Complete Manual of Typography, James Felici, Adobe Press; 1st edition, 2002. ISBN 0-321-12730-7
  • The Unicode Standard, Version 3.0, The Unicode Consortium, Addison-Wesley Longman, Inc., April 2000. ISBN 0-201-61633-5
  • The Unicode Standard, Version 4.0, The Unicode Consortium, Addison-Wesley Professional, 27 August 2003. ISBN 0-321-18578-1
  • The Unicode Standard, Version 5.0, Fifth Edition, The Unicode Consortium, Addison-Wesley Professional, 27 October 2006. ISBN 0-321-48091-0
  • Unicode Demystified: A Practical Programmer's Guide to the Encoding Standard, Richard Gillam, Addison-Wesley Professional; 1st edition, 2002. ISBN 0-201-70052-2
  • Unicode Explained, Jukka K. Korpela, O'Reilly; 1st edition, 2006. ISBN 0-596-10121-X
  • Unicode: A Primer, Tony Graham, M&T books, 2000. ISBN 0-7645-4625-2.