CNS 11643

مجموعة الأحرف CNS 11643 (المعيار الوطني الصيني 11643)، والمعروفة رسميًا أيضًا باسم رمز التبادل القياسي الصيني أو CSIC [ 1 ] ( بالصينية :中文標準交換碼)، هي مجموعة الأحرف القياسية الرسمية لتايوان (جمهورية الصين). ولا تزال النسخ المنشورة والمسودات من CNS 11643 هي المعايير المرجعية لرموز Unicode المرجعية للأحرف الصينية واليابانية والكورية الموحدة المقدمة للاستخدام في تايوان، [ 2 ] ويستمر تحديث واستخدام مجموعة أحرف CNS 11643 للأغراض الإدارية في تايوان . [ 3 ]

يُعدّ EUC-TW تمثيلًا مُشفّرًا لـ CNS 11643 و ASCII في شكل رمز يونكس الموسّع (EUC). عمليًا، كانت متغيرات مجموعة الأحرف Big5 ، المرتبطة ارتباطًا وثيقًا بالمستويين الأولين من CNS 11643، بمثابة التشفير القياسي الفعلي للغة الصينية التقليدية قبل إدخال يونيكود. تشمل التشفيرات الأخرى القادرة على تمثيل مستويات معينة من CSIC كلاً من ISO-2022-CN (المستويين 1 و2) و ISO-2022-CN-EXT (المستويات من 1 إلى 7).

بناء

صُمم معيار CNS 11643 ليتوافق مع معيار ISO 2022 ، على الرغم من أن المستويات السبعة الأولى فقط (94×94 حرفًا) مسجلة وفقًا لمعيار ISO-IR . وقد تفاوت العدد الإجمالي للمستويات مع المراجعات المتتالية للمعيار؛ إذ تحتوي أحدث المسودات قيد المراجعة على 19 مستوى، [ 2 ] وبالتالي فإن الحد الأقصى لعدد الأحرف القابلة للترميز عبر جميع المستويات هو 19×94×94 = 167884. يُحدد المعيار المستويات من 1 إلى 7؛ ومنذ عام 2007، أُضيفت المستويات من 10 إلى 15 إلى المعيار أيضًا. [ 4 ] : ​​115-122. قبل ذلك، كانت المستويات من 12 إلى 15 (35344 نقطة ترميز) مخصصة تحديدًا للأحرف التي يُحددها المستخدم. وعلى عكس معيار CCCII ، فإن ترميز الأحرف المتغيرة في معيار CNS 11643 غير مرتبط بهذا المعيار.

تاريخ

نُشرت الطبعة الأولى من المعيار عام 1986، وتضمنت المستويين 1 و2، المشتقين من المستويين 1 و2 من نظام Big5 ، مع بعض إعادة الترتيب نتيجة لتصحيح عدد الضربات، وحذف حرفين مكررين، وإضافة 213 جذرًا كلاسيكيًا في المستوى 1 (من أصل 214 جذرًا من جذور كانغشي ، منها 210 تكرارات فعلية لأحرف Big5 الموجودة، والثلاثة المتبقية من أحرف HKSCS ؛ [ 5 ] انظر أيضًا جذور كانغشي (كتلة يونيكود) ). ونُشرت امتدادات للمعيار لاحقًا في عامي 1988 (6319 حرفًا، تشغل المستوى 14) و1990 (7169 حرفًا، تشغل المستوى 15). [ 4 ] : ​​115-122

على الرغم من أن يونيكود 1.0.0 لم يكن يتضمن الأحرف الصينية (هانزي) آنذاك ، إلا أنه تضمن أحرفًا للتوافق مع معيار CNS 11643: فقد كان قسم " أشكال التوافق CJK " يحمل عنوان "التوافق مع CNS 11643" في يونيكود 1.0.0. [ 6 ] وعندما كان يجري تجميع مجموعة الأحرف الصينية واليابانية والكورية الموحدة (CJK ) ليونيكود 1.0.1، قدمت الهيئات الوطنية مجموعات الأحرف إلى فريق البحث المشترك للغات الصينية واليابانية والكورية لإدراجها. تضمنت نسخة CNS 11643 المقدمة امتداد المستوى 14، بالإضافة إلى أحرف أخرى مرغوبة أُضيفت إلى المستوى 14 (بعد 68-21، وهي آخر نقطة ترميز مستخدمة في النسخة القياسية من الامتداد). [ 4 ] : ​​179-180

في الطبعة الثانية من المعيار، المنشورة عام ١٩٩٢، تم تعريف مجموعة أكبر بكثير من الأحرف الصينية (هانزي) عبر سبعة مستويات. تم اعتماد غالبية امتداد المستوى ١٤ لعام ١٩٨٨، والذي يشمل ٦١٤٨ رمزًا من ٠١-٠١ إلى ٦٦-٣٨، كمستوى ٣ (بينما تم توزيع الأحرف الـ ١٧١ المتبقية، من ٦٦-٣٩ إلى ٦٨-٢١، على المستوى ٤). لم يتم تضمين امتداد المستوى ١٥، على الرغم من أن ٣٣٨ من أحرفه تم تضمينها ضمن المستويات من ٤ إلى ٧. [ ٤ ] : ١١٥-١٢٢

أضافت الطبعة الثالثة من المعيار، الصادرة عام 2007، رمز اليورو ، والصفر التصويري، والكانا ، وامتدادات لدعم الأبجدية اللاتينية وأبجدية بوبوموفو الموجودة في المستوى 1. كما قدمت المستويات من 10 إلى 14، والتي تحتوي على أحرف هانزي إضافية، ودمجت امتداد المستوى 15 الموجود في المعيار نفسه (مع ترك فجوات حيث كانت الأحرف موجودة بالفعل في المستويات من 4 إلى 7). وأضافت أيضًا 128 حرف هانزي إضافيًا إلى المستوى 3، بدءًا من نقطة الترميز 68-40، [ 4 ] : ​​115-122 استنادًا إلى الإضافات التي أُدخلت على نسخة المستوى 14 لعام 1988 والتي قُدمت لإدراجها في يونيكود.

ترقيم الطائرات

ترقيم الطائرات CNS 11643 في مختلف الإصدارات والمسودات والتطبيقات
طائرةT1T2( رمز التصنيف العالمي )( آي بي إم )T3تي إفT4T5T6T7(بعد عام 1992)(بعد عام 2007)
ISO-IR171172--183 [ أ ]-184185186187--
طبعة عام 19861212-15---------
صفحة ترميز IBM رقم 964 [ 7 ]121213--------
تمديد عام 19881212-13-14 [ ب ]-------
تمديد عام 19901212-13-14 [ ب ]15------
نسخة CJK-JRG12--14 [ ج ]-------
طبعة عام 19921212-15-3 [ أ ]-4567--
وحدة العناية المركزة 2000 [ 8 ]12--3 [ د ]94567--
طبعة 200712--3 [ د ]1545678–14-
وحدة العناية المركزة 2014 [ 9 ]1212133 [ د ]154567--
ما بعد عام 2007 [ 2 ]12--3 [ هـ ]1545678–1416-19
  1. 1 201-0166-38نطاق فقط
  2. 1 201-0166-38و66-3968-21نطاقات
  3. 01-0166-38،66-3968-21و68-4071-10نطاقات
  4. 1 2 301-0166-38و68-4071-10نطاقات
  5. 01-0166-38و68-4071-10نطاقات، بالإضافة إلى إضافات [ 10 ]

الغرض الحالي وعلاقته بنظام يونيكود

تتضمن مجموعة رموز CNS 11643 الأحرف المستخدمة للأغراض الإدارية في تايوان، بما في ذلك تسجيل الأسر وبطاقات الهوية ، [ 3 ] بالإضافة إلى الأحرف المستخدمة في التعليم. [ 11 ] وعلى وجه الخصوص، تُستخدم الأحرف في المستويين 1 و2 في التعليم. [ 12 ] وتخضع الأحرف المستخدمة في التعليم فقط لتوحيد شكل الرموز في CNS 11643. [ 11 ] ولا يزال العمل جارياً على توسيعها، حيث تم إعداد مسودات لمستويات إضافية مرقمة حتى 19، ولكن لم يتم نشرها بعد كجزء من إصدار CNS 11643. [ 2 ] وقد أضاف تعديل عام 2022 على إصدار 2007 الرمز U+7934CJK UNIFIED IDEOGRAPH-7934 إلى نهاية المستوى 2، وصحح العديد من أشكال الرموز في المستويين 1 و2. [ 12 ]

على الرغم من أن طبعتي 1992 و2007 من CNS 11643، بالإضافة إلى مسودات العمل الأحدث، تُستخدم كمصادر Unihan للرموز المرجعية للأحرف الصينية واليابانية والكورية الموحدة المقدمة للاستخدام في تايوان، [ 2 ] إلا أنه لا يزال هناك، اعتبارًا من عام 2017، عدة آلاف من أحرف CNS 11643 التي ليس لها حرف Unicode مقابل، أو التي لا تمر عبر Unicode ذهابًا وإيابًا، في الغالب في المستويات من 10 إلى 14. يتم تعيين هذه إلى منطقة الاستخدام الخاص التكميلية لـ Unicode . [ 13 ]

في بعض الحالات، يتوافق حرفان أو أكثر من CNS 11643 مع رمز واحد من رموز Unicode CJK الموحدة . هذه الحالات (باستثناء ما يغطيه ملحق رموز التوافق CJK ) مُرتبطة حاليًا بنقاط رمز منطقة الاستخدام الخاص التكميلية في Unicode، [ 11 ] ولكن جمعية تايبيه للحاسوب، المشاركة في مجموعة أبحاث الرموز ، تُقيّم جدوى تسجيلها كمتواليات تنوع رموز في المستقبل. [ 11 ] [ 14 ]

العلاقة بعوامل النمو الخمسة الكبرى

يتوافق المستويان 1 و2 من ترميز Big5 في الغالب مع المستويين 1 و2 من ترميز CNS 11643 على التوالي، مع اختلافات طفيفة في الترتيب، ووجود حرفين هانزي مكررين في Big5 غير موجودين في CNS 11643. ويمكن ربطهما باستخدام قائمة نطاقات. [ 15 ] [ 16 ] ومع ذلك، فإن الجذور الكلاسيكية الـ213 في المستوى 1 من CNS 11643 تُضاف إلى الأحرف المتوفرة في Big5 (على الرغم من إمكانية ربطها بشكل غير دقيق بأحرف الهانزي المقابلة في Big5 أو HKSCS)، [ 5 ] كما أُضيفت أحرف إضافية إلى المستوى 1 من CNS 11643 في عام 2007. [ 4 ] : ​​115-122. ويُعرَّف متغير Big5-2003 من Big5 بأنه ترميز جزئي لـ CNS 11643.

ضمن مجموعة أحرف الهانزي الخمسة الكبرى، يتم تعيين حرف واحد فقط من المستوى 1 بشكل تقليدي إلى يونيكود بشكل مختلف عن الحرف المقابل له من أول مستويين من CNS 11643: إلى U+5F5D ()، بينما يتم تعيين نظيره في المستوى 1 من CNS إلى متغير ذي صلة عند U+5F5E ([ 17 ] يتم تضمين U+5F5D بشكل منفصل في المستوى 3 من CNS 11643. [ 5 ] ومع ذلك، تتضمن بعض تعيينات المتغيرات لـ Big5، مثل بعض التعيينات التي حددتها IBM ، U+5F5E بدلاً من U+5F5D. [ 18 ] وبالمثل، يتم تعيين حرف واحد من المستوى 2 من Big5 (بما في ذلك متغير IBM الخاص به) [ 19 ] إلى نقطة رمز Unicode مختلفة عن نظيره في المستوى 2 من CNS 11643: إلى U+5284 (劄)، بينما تقوم قاعدة بيانات Unihan حاليًا بتعيين حرف CNS 11643 إلى U+7B9A ()؛ يظهر U+5284 في المستوى 14 من CNS 11643. [ 5 ]

مراجع

  1. ECMA (21-01-1993). رمز التبادل القياسي الصيني (CSIC) - المجموعة 1 (PDF) . ITSCJ/ IPSJ . ISO-IR -171.
  2. 1 2 3 4 5 لوندي، كين ؛ كوك، ريتشارد (31-07-2024). "kIRG_TSource" . قاعدة بيانات يونيكود هان (Unihan) (ملحق معيار يونيكود). المراجعة 37. اتحاد يونيكود . UAX #38.
  3. 1 2 "مساهمة TCA لمجموعة عمل IRG لتوسيع نطاق CJK لعام 2021" (ملف PDF) . 2021-05-07. ISO/IEC JTC1 / SC2 /WG2/ IRG N2486.
  4. 1 2 3 4 5 6 لوندي، كين (2008). "3. معايير مجموعة الأحرف". معالجة معلومات اللغات الصينية واليابانية والكورية والفيتنامية ( الطبعة الثانية). دار نشر أورايلي ميديا . ISBN  9780596514471.
  5. 1 2 3 4 لوندي، كين (30-11-2022). "مقترح لتحسين خاصية kBigFive المؤقتة" (ملف PDF) . UTC L2/22-288.
  6. "3.8: مخططات الكتل" (ملف PDF) . معيار يونيكود . الإصدار 1.0. اتحاد يونيكود .
  7. "IBM-964_P110-1999" . مستودع بيانات وحدة العناية المركزة . IBM / اتحاد يونيكود . 2009 [1999].
  8. فيسوانادا، راغورام (2003) [2000-08-30]. "CNS-11643-1992" . المكونات الدولية لليونيكود . IBM / اتحاد اليونيكود .
  9. "EUC-TW-2014: تحديث EUC-TW استنادًا إلى IBM-964" . المكونات الدولية لليونيكود . IBM / اتحاد اليونيكود . 2014.
  10. مثال: "بيانات Unihan لـ U+2E83A" ، البحث في قاعدة بيانات Unihan ، اتحاد Unicodeيحتوي على مرجع المصدر T3-6734، أي نقطة رمز المستوى 3 71-20.
  11. ١ ٢ ٣ ٤ "٤. حول توحيد الرموز الرسومية" (ملف PDF) . رد على قضايا التوحيد والمعنى المتعلقة بأحرف TCA في WS2021 . ١٤ مارس ٢٠٢٢. الصفحات ٣-٥ . ISO/IEC JTC1 / SC2 /WG2/ IRG N2546. 
  12. 1 2 "تصحيح رموز T-Source والتمديد الأفقي" (ملف PDF) . 2022-10-18. ISO/IEC JTC1 / SC2 /WG2/ IRG N2580.
  13. "CNS 11643 في منطقة الاستخدام الخاص التكميلية في يونيكود" . [ماك الصيني] . مجلس دراسات شرق آسيا في جامعة ييل.
  14. جمعية تايبيه للحاسبات (10 سبتمبر 2021). "تقرير أنشطة جمعية تايبيه للحاسبات" (ملف PDF) . ISO/IEC JTC1 / SC2 /WG2/ IRG N2502.
  15. لوندي، كين (18-12-1995). "4.3: مشاكل توافق مجموعة الأحرف الصينية واليابانية والكورية - الصينية (تايوان)". CJK.INF الإصدار 1.9 .
  16. تشو، إتش إف؛ هو، دي واي؛ وانغ، زد جي؛ كاو، تي سي؛ تشانغ، دبليو سي إتش؛ كريسبين، إم. (1996). "RFC 1922: ترميز الأحرف الصينية لرسائل الإنترنت" . طلبات التعليقات . IETF .
  17. لوندي، كين (15 فبراير 2018). "استكشاف IICore - الجزء 4" . مدونة CJK Type . شركة أدوبي .
  18. "ibm-950_P110-1999 (البايت الرئيسي 0xC2)" . مستكشف محول المكونات الدولية لليونيكود . اتحاد اليونيكود . مؤرشف من الأصل بتاريخ 12 يوليو 2021.
  19. "ibm-950_P110-1999.ucm" . مستودع بيانات وحدة العناية المركزة . IBM / اتحاد يونيكود . 2007.<U5284> \xE3\x5A |0