علامة لغة IETF
علامة اللغة IETF BCP 47 هي رمز معياري يُستخدم لتحديد اللغات البشرية على الإنترنت. [ 1 ] وقد تم توحيد بنية العلامة من قِبل فريق عمل هندسة الإنترنت (IETF) [ 1 ] في أفضل الممارسات الحالية (BCP) 47 ؛ [ 1 ] ويتم الاحتفاظ بالعلامات الفرعية بواسطة سجل العلامات الفرعية للغات IANA . [ 2 ] [ 3 ] [ 4 ]
لتمييز اللهجات المختلفة للدول أو المناطق أو أنظمة الكتابة (الخطوط)، تجمع علامات اللغة الخاصة بفريق هندسة الإنترنت (IETF) علامات فرعية من معايير أخرى مثل ISO 639 وISO 15924 وISO 3166-1 و UN M.49 . على سبيل المثال، تشير العلامة enإلى اللغة الإنجليزية؛ es-419وإلى الإسبانية في أمريكا اللاتينية؛ rm-sursilvوإلى الرومانشية السرسيلفية؛ sr-Cyrlوإلى الصربية المكتوبة بالأبجدية السيريلية ؛ nan-Hant-TWوإلى الصينية المينانية باستخدام الأحرف الصينية التقليدية ، كما تُنطق في تايوان؛ yue-Hant-HKوإلى الكانتونية باستخدام الأحرف الصينية التقليدية ، كما تُنطق في هونغ كونغ ؛ وإلى gsw-u-sd-chzhالألمانية الزيوريخية .
يُستخدم هذا المعيار في معايير الحوسبة مثل HTTP، [ 5 ] : §8.5.1 HTML، [ 6 ] XML [ 7 ] وPNG. [ 8 ]
تاريخ
تم تعريف علامات لغة IETF لأول مرة في طلب التعليق 1766، الذي حرره هارالد تفيت ألفستراند ، ونُشر في مارس 1995. [ 9 ] استخدمت العلامات رموز اللغة المكونة من حرفين ISO 639 ورموز البلدان المكونة من حرفين ISO 3166، وسمحت بتسجيل العلامات الكاملة التي تضمنت علامات فرعية متغيرة أو علامات فرعية نصية من ثلاثة إلى ثمانية أحرف.
في يناير 2001، تم تحديث هذا بواسطة RFC 3066، [ 10 ] والذي أضاف استخدام رموز ISO 639-2 المكونة من ثلاثة أحرف، وسمح بالعلامات الفرعية التي تحتوي على أرقام، واعتمد مفهوم نطاقات اللغة من HTTP/1.1 للمساعدة في مطابقة علامات اللغة.
صدرت المراجعة التالية للمواصفات في سبتمبر 2006 مع نشر RFC 4646 - الجزء الرئيسي من المواصفات - الذي حرره أديسون فيليبس ومارك ديفيس ، [ 11 ] وRFC 4647 - الذي يتناول سلوك المطابقة. [ 12 ] قدم RFC 4646 تنسيقًا أكثر تنظيمًا لعلامات اللغة، وأضاف استخدام رموز ISO 15924 المكونة من أربعة أحرف ورموز المناطق الجغرافية UN M.49 المكونة من ثلاثة أرقام، واستبدل سجل العلامات القديم بسجل جديد للعلامات الفرعية. أُبقي على عدد قليل من العلامات المُعرَّفة سابقًا والتي لم تتوافق مع البنية الجديدة ، وذلك للحفاظ على التوافق مع RFC 3066.
تم نشر الإصدار الحالي من المواصفات، RFC 5646، في سبتمبر 2009. [ 13 ] كان الغرض الرئيسي من هذا التعديل هو دمج الرموز المكونة من ثلاثة أحرف من ISO 639-3 و639-5 في سجل علامات اللغة الفرعية، وذلك لزيادة قابلية التشغيل البيني بين ISO 639 وBCP 47. [ 14 ]
بناء جملة علامات اللغة
يتكون كل وسم لغة من وسم فرعي واحد أو أكثر مفصولة بشرطات (-). ويتكون كل وسم فرعي من أحرف لاتينية أساسية أو أرقام فقط.
باستثناء علامات اللغة الخاصة بالاستخدام والتي تبدأ بالبادئة x- وعلامات اللغة القديمة (بما في ذلك تلك التي تبدأ بالبادئة i- وتلك المسجلة سابقًا في سجل علامات اللغة القديم)، تظهر العلامات الفرعية بالترتيب التالي:
- علامة فرعية للغة الأساسية واحدة تستند إلى رمز لغة مكون من حرفين من ISO 639-1 (2002) أو رمز مكون من ثلاثة أحرف من ISO 639-2 (1998) أو ISO 639-3 (2007) أو ISO 639-5 (2008)، أو مسجلة من خلال عملية BCP 47 ومكونة من خمسة إلى ثمانية أحرف؛
- يمكن إضافة ما يصل إلى ثلاثة علامات فرعية اختيارية للغة الموسعة ، تتكون كل منها من ثلاثة أحرف مفصولة بشرطات؛ (لا توجد حاليًا أي علامة فرعية للغة الموسعة مسجلة في سجل العلامات الفرعية للغة بدون علامة فرعية مكافئة ومفضلة للغة الأساسية. تم الحفاظ على هذا المكون من علامات اللغة من أجل التوافق مع الإصدارات السابقة وللسماح بأجزاء مستقبلية من معيار ISO 639).
- علامة فرعية اختيارية للنص البرمجي ، تستند إلى رمز نص برمجي مكون من أربعة أحرف من ISO 15924 (عادة ما يكتب بأحرف كبيرة في بداية كل كلمة )؛
- علامة فرعية اختيارية للمنطقة تستند إلى رمز البلد المكون من حرفين من ISO 3166-1 alpha-2 (عادة ما يكتب بأحرف كبيرة)، أو رمز مكون من ثلاثة أرقام من UN M.49 للمناطق الجغرافية؛
- علامات فرعية اختيارية متغيرة ، مفصولة بشرطات، كل منها يتكون من خمسة إلى ثمانية أحرف، أو من أربعة أحرف تبدأ برقم؛ (العلامات الفرعية المتغيرة مسجلة لدى IANA وليست مرتبطة بأي معيار خارجي.)
- علامات فرعية اختيارية للامتداد ، مفصولة بشرطات، كل منها يتكون من حرف واحد، باستثناء الحرف x ، وشرطة متبوعة بعلامة فرعية واحدة أو أكثر تتكون من حرفين إلى ثمانية أحرف لكل منها، مفصولة بشرطات؛
- علامة فرعية اختيارية للاستخدام الخاص ، تتكون من الحرف x وواصلة متبوعة بعلامات فرعية من حرف واحد إلى ثمانية أحرف لكل منها، مفصولة بواصلات.
لا تُميّز العلامات الفرعية بين الأحرف الكبيرة والصغيرة ، ولكن توصي المواصفات باستخدام نفس حالة الأحرف المستخدمة في سجل العلامات الفرعية للغة، حيث تكون العلامات الفرعية للمنطقة بأحرف كبيرة ، والعلامات الفرعية للنصوص بأحرف كبيرة في بداية كل كلمة ، وجميع العلامات الفرعية الأخرى بأحرف صغيرة . ويتوافق هذا التنسيق مع توصيات معايير ISO الأساسية.
يُفضّل حذف الوسوم الفرعية الاختيارية للغة والمنطقة عندما لا تُضيف أي معلومات مميزة إلى وسم اللغة. على سبيل المثال، يُفضّل استخدام es بدلاً من es-Latn ، لأن اللغة الإسبانية تُكتب عادةً بالأبجدية اللاتينية؛ ويُفضّل استخدام ja بدلاً من ja-JP ، لأن اللغة اليابانية المستخدمة في اليابان لا تختلف اختلافًا كبيرًا عن اللغة اليابانية المستخدمة في أماكن أخرى.
لا يمكن تمثيل جميع المناطق اللغوية بعلامة فرعية صالحة: تُسجّل اللهجات الإقليمية دون الوطنية للغة الأساسية كعلامات فرعية متغيرة. على سبيل المثال، تُسجّل العلامة الفرعية المتغيرة "فالنسيا" للهجة الفالنسية من اللغة الكاتالونية في سجل العلامات الفرعية للغة بالبادئة "ca" . وبما أن هذه اللهجة تُستخدم بشكل شبه حصري في إسبانيا، فإنه يمكن عادةً حذف العلامة الفرعية "ES" .
علاوة على ذلك، هناك علامات نصية لا تشير إلى النصوص التقليدية مثل اللاتينية، أو حتى النصوص على الإطلاق، وعادة ما تبدأ هذه بالحرف Z. على سبيل المثال، يشير Zsye إلى الرموز التعبيرية ، وZmth إلى الترميز الرياضي ، و Zxxx إلى المستندات غير المكتوبة، و Zyyy إلى النصوص غير المحددة.
استُخدمت علامات اللغة الخاصة بفريق هندسة الإنترنت (IETF) كمعرّفات للمواقع في العديد من التطبيقات. وقد يكون من الضروري لهذه التطبيقات وضع استراتيجية خاصة بها لتحديد المواقع وتشفيرها ومطابقتها إذا لم تكن الاستراتيجية الموضحة في RFC 4647 كافية.
يُحدد استخدام وتفسير ومطابقة علامات لغة IETF حاليًا في RFC 5646 وRFC 4647. يُدرج سجل علامات اللغة الفرعية جميع العلامات الفرعية العامة السارية حاليًا. لا تُدرج العلامات الفرعية للاستخدام الخاص في السجل لأنها تعتمد على التنفيذ وتخضع لاتفاقيات خاصة بين الأطراف الثالثة التي تستخدمها. هذه الاتفاقيات الخاصة خارج نطاق BCP 47.
قائمة بالعلامات الفرعية الشائعة للغة الأساسية
فيما يلي قائمة ببعض العلامات الفرعية للغة الأساسية الأكثر استخدامًا. تمثل هذه القائمة جزءًا صغيرًا فقط (أقل من 2%) من العلامات الفرعية للغة الأساسية؛ وللحصول على معلومات كاملة، يُرجى الرجوع مباشرةً إلى سجل العلامات الفرعية للغة.
| الاسم الإنجليزي | الاسم الأصلي | الوسم الفرعي |
|---|---|---|
| الأفريكانية | الأفريكانية | أف |
| الأمهرية | አማርኛ | أكون |
| عربي | العربية | ar |
| مابودونجون | مابودونجون | arn |
| اللهجة المغربية | الدارجة المغربية | أري |
| اللغة الأسامية | أسيميا | مثل |
| الأذرية | أذربيجان | أريزونا |
| باشكير | باشورت | با |
| بيلاروسي | بيلاروسية | يكون |
| البلغارية | بلغاري | bg |
| البنغالية | البنغالية | بن |
| التبتية | شكرا | بو |
| بريتون | بريزهونج | br |
| البوسني | bosanski / босански | ب |
| الكاتالونية | كاتاليا | كاليفورنيا |
| وسط كردستان | كوریی ناوەندی | ckb |
| كورسيكي | كورسو | شركة |
| التشيك | التشيكية | سي إس |
| الويلزية | الويلزية | cy |
| دانماركي | دانسك | دا |
| الألمانية | الألمانية | دي |
| السوربيان السفلى | دولنوسيربشتشينا | dsb |
| ديفيهي | ދިވެހިބަސް | دي في |
| اليونانية | Ελληνικά | el |
| إنجليزي | إنجليزي | en |
| الأسبانية | الإسبانية | es |
| الإستونية | إستي | و |
| الباسكية | الباسكية | الاتحاد الأوروبي |
| الفارسية | فارسي | ذلك |
| الفنلندية | الفنلندي | fi |
| فلبيني | فلبيني | فيلم |
| جزر فارو | føroyskt | فو |
| فرنسي | الفرنسية | فرنسي |
| الفريزية | فريسك | fy |
| أيرلندي | اللغة الأيرلندية | جا |
| اللغة الغيلية الاسكتلندية | اللغة الغيلية | جيد |
| جيلبرتيز | تايتاي ني كيريباتي | جيل |
| الجاليكية | جاليجو | GL |
| الألمانية السويسرية | اللغة الألمانية السويسرية | gsw |
| الغوجاراتية | جوجاراتي | غو |
| الهوسا | الهوسا | ها |
| العبرية | العبرية | هو |
| الهندية | हिंदी | أهلاً |
| الكرواتية | hrvatski | ساعة |
| السوربيان العليا | hornjoserbšćina | hsb |
| المجرية | المجرية | هو |
| الأرمنية | Հայերեն | هي |
| إندونيسيا | اللغة الإندونيسية | بطاقة تعريف |
| إيغبو | إيغبو | ig |
| يي | ꆈꌠꁱꂷ | ii |
| أيسلندا | إيسلينسكا | يكون |
| إيطالي | إيطالي | هو - هي |
| الإنكتيتوت | إنكتيتوت / ᐃᓄᒃᑎᑐᑦ ( ᑲᓇᑕ ) | iu |
| اليابانية | 日本語 | ja |
| جورجي | ქართული | كا |
| الكازاخستاني | Қазақша | ك ك |
| غرينلاندي | kalaallisut | kl |
| الخمير | ខ្មែរ | كم |
| الكانادا | كاناد | كن |
| كوري | شكرا | كو |
| كونكاني | कोंकणी | كوك |
| كردي | كردي كوردي | كو |
| قيرغيزستان | Кыргыз | كي |
| لوكسمبورغي | ليتزيبورغيش | رطل |
| لاو | ລາວ | لو |
| الليتواني | ليتوانيا | lt |
| اللاتفية | لاتفيشو | lv |
| الماوري | لغة الماوري | مي |
| المقدوني | الماكدونسكي | mk |
| المالايالامية | مالايالام | مل |
| المنغولي | منغول هول / ᠮᠤᠨᠭᠭᠤᠯ ᠬᠡᠯᠡ | من |
| موهوك | كانينكيه | محمد |
| الماراثية | مارثي | السيد |
| الملايو | لغة البهاسا الماليزية | آنسة |
| مالطي | المالطية | جبل |
| البورميين | التخفيضات | لي |
| النرويجية (بوكمول) | النرويجية (بوكمول) | ملاحظة |
| النيبالية | نيبال (نيبال) | ني |
| هولندي | الهولندية | هولندا |
| النرويجية (نينورسك) | نورسك (نينورسك) | nn |
| النرويجية | النرويجية | لا |
| الأوكسيتانية | أوكسيتان | oc |
| الأوديا | ଓଡ଼ିଆ | أو |
| بابيامنتو | بابيامنتو | باب |
| البنجابية | ਪੰਜਾਬੀ بنجابی | با |
| بولندي | بولسكي | pl |
| داري | دني | prs |
| البشتو | پښستو | ملاحظة: |
| البرتغالية | البرتغالية | نقطة |
| كيشي | كيشي | quc |
| الكيتشوا | روناسيمي | qu |
| الرومانشية | رومانتش | rm |
| روماني | رومانا | رو |
| الروسية | русский | ru |
| الكينيارواندية | الكينيارواندية | rw |
| السنسكريتية | संस्कृत | سا |
| ياقوت | саха | ساه |
| السندية | سنجي | sd |
| سامي (شمالي) | davvisámegiella | انظر |
| السنهالية | සිංහල | نعم |
| سلوفاكيا | السلوفينية | sk |
| السلوفيني | سلوفينشتشينا | sl |
| سامي (جنوبي) | åarjelsaemiengiele | صغير |
| سامي (لولي) | julevusámegiella | smj |
| سامي (إيناري) | ساميكيلا | smn |
| سامي (سكولت) | sääʹmǩiõll | رسالة قصيرة |
| الألبانية | ship | مربع |
| الصربية | srpski / српски | كبير |
| سيسوتو | سيسوتو | شارع |
| السويدية | السويدية | sv |
| اللغة السواحيلية | اللغة السواحيلية | جنوب غرب |
| السريانية | ܣܘܪܝܝܐ | syc |
| التاميل | تاميل | تا |
| التيلجو | తెలుగు | تي |
| طاجيك | Тоҷикӣ | tg |
| تايلاندي | تايلاندي | ذ |
| التركمان | تركمانتشه | tk |
| التاغالوغية | التاغالوغية | tl |
| تسوانا | لغة سيتسوانا | tn |
| تركي | التركية | tr |
| التتار | تاتارشا | tt |
| الأمازيغية | الأمازيغية | tzm |
| الأويغور | ئۇحۇرچە | ug |
| الأوكرانية | أوكرانية | المملكة المتحدة |
| الأردية | ارشدو | ur |
| أوزبكي | الأوزبكي / Ўзбек | أوز |
| الفيتناميين | اللغة الفيتنامية | vi |
| وولوف | وولوف | وو |
| لغة الخوسا | لغة الإيزيكوسا | xh |
| اليديشية | اليديشية | يي |
| اليوروبا | اليوروبا | يا |
| الصينية | 中文 | zh |
| الزولو | لغة الزولو | زو |
العلاقة بالمعايير الأخرى
على الرغم من أن بعض أنواع الوسوم الفرعية مشتقة من المعايير الأساسية لمنظمة ISO أو الأمم المتحدة ، إلا أنها لا تلتزم بهذه المعايير التزامًا تامًا، إذ قد يؤدي ذلك إلى تغيير معنى الوسوم اللغوية بمرور الوقت. فعلى وجه الخصوص، يظل الوسم الفرعي المشتق من رمز مُحدد بواسطة ISO 639 أو ISO 15924 أو ISO 3166 أو UN M49 وسمًا فرعيًا صالحًا (وإن كان مُهملًا) حتى لو تم سحب الرمز من المعيار الأساسي المُقابل. وإذا ما خصص المعيار لاحقًا معنى جديدًا للرمز المسحوب، فسيظل الوسم الفرعي المُقابل محتفظًا بمعناه القديم.
تم إدخال هذا الاستقرار في RFC 4646.
ISO 639-3 و ISO 639-1
عرّفت RFC 4646 مفهوم "الوسم الفرعي للغة الموسعة" (يُشار إليه أحيانًا باسم extlang )، على الرغم من عدم تسجيل أي وسوم فرعية من هذا القبيل في ذلك الوقت. [ 16 ] [ 17 ]
أضافت RFC 5645 وRFC 5646 علامات فرعية للغة الأساسية تُطابق رموز ISO 639-3 لجميع اللغات التي لم تكن موجودة مسبقًا في السجل. بالإضافة إلى ذلك، سُجّلت رموز اللغات التي تشملها بعض اللغات الكلية كعلامات فرعية للغات الموسعة. كما سُجّلت لغات الإشارة كلغات موسعة، مع البادئة sgn . يمكن تمثيل هذه اللغات إما بالعلامة الفرعية للغة المشمولة فقط ( cmn للغة الماندرين) أو بمزيج من اللغة واللغة الموسعة ( zh-cmn ). يُفضّل الخيار الأول في معظم الحالات. أما الخيار الثاني، فيُسمى "صيغة اللغة الموسعة" وهو جديد في RFC 5646.
تُعتبر العلامات الكاملة التي سُجّلت قبل RFC 4646، والمصنفة الآن على أنها "مُعتمدة" أو "زائدة" (بحسب توافقها مع الصيغة الجديدة)، مُهملةً لصالح العلامة الفرعية اللغوية المقابلة المستندة إلى معيار ISO 639-3، إن وُجدت. على سبيل المثال، يُفضّل استخدام nan على zh-min-nan للغة الصينية مين نان ؛ ويُفضّل استخدام hak على i-hak و zh-hakka للغة الصينية هاكا ؛ ويُفضّل استخدام ase على sgn-US للغة الإشارة الأمريكية .
يدعم نظام التشغيل Windows Vista والإصدارات اللاحقة من Microsoft Windows معيار RFC 4646. [ 18 ]
ISO 639-5 و ISO 639-1/2
يُعرّف معيار ISO 639-5 مجموعات اللغات ذات الرموز الأبجدية الثلاثية بطريقة مختلفة عن طريقة ترميزها في معيار ISO 639-2 (بما في ذلك رمز موجود مسبقًا في معيار ISO 639-1، وهو رمز اللغة البيهارية الذي يُرمز له بـ bh في معيار ISO 639-1 و bih في معيار ISO 639-2). وبالتحديد، تُعرّف جميع مجموعات اللغات في معيار ISO 639-5 الآن على أنها شاملة، بدلًا من تعريف بعضها بشكل حصري. وهذا يعني أن نطاق مجموعات اللغات أصبح أوسع من ذي قبل، حيث يمكن أن تشمل في بعض الحالات لغات كانت مُرمّزة بشكل منفصل ضمن معيار ISO 639-2.
على سبيل المثال، كان رمز ISO 639-2 afa مرتبطًا سابقًا باسم "اللغات الأفروآسيوية (أخرى)"، باستثناء لغات مثل العربية التي كان لها رمزها الخاص. في معيار ISO 639-5، تُسمى هذه المجموعة "اللغات الأفروآسيوية" وتشمل جميع هذه اللغات. وقد غيّر معيار ISO 639-2 الأسماء الحصرية في عام 2009 لتتوافق مع أسماء معيار ISO 639-5 الشاملة. [ 19 ]
لتجنب كسر التطبيقات التي قد لا تزال تعتمد على التعريف الأقدم (الحصري) لهذه المجموعات، يحدد معيار ISO 639-5 سمة نوع التجميع لجميع المجموعات التي تم ترميزها بالفعل في معيار ISO 639-2 (لم يتم تعريف نوع التجميع هذا للمجموعات الجديدة المضافة فقط في معيار ISO 639-5).
يُعرّف معيار BCP 47 خاصية "النطاق" لتحديد العلامات الفرعية لمجموعات اللغات. مع ذلك، لا يُحدد هذا المعيار أي مجموعة على أنها شاملة أو حصرية، ولا يستخدم سمة نوع التجميع ISO 639-5، على الرغم من أن حقول الوصف في سجل العلامات الفرعية للغات لهذه العلامات الفرعية تُطابق أسماء ISO 639-5 (الشاملة). ونتيجةً لذلك، قد تكون علامات لغة BCP 47 التي تتضمن علامة فرعية للغة أساسية لمجموعة ما غامضة فيما إذا كانت المجموعة مُخصصة لتكون شاملة أم حصرية.
لا يُحدد معيار ISO 639-5 اللغات التي تنتمي إلى هذه المجموعات تحديدًا دقيقًا؛ بل يُحدد فقط التصنيف الهرمي للمجموعات، باستخدام التعريف الشامل لهذه المجموعات. ولهذا السبب، لا يُوصي معيار RFC 5646 باستخدام الوسوم الفرعية لمجموعات اللغات في معظم التطبيقات، على الرغم من أنها لا تزال مُفضلة على الوسوم الفرعية ذات المعنى الأقل تحديدًا، مثل "لغات متعددة" و"غير مُحدد".
وعلى النقيض من ذلك، فإن تصنيف اللغات الفردية داخل لغتها الكلية موحد، في كل من ISO 639-3 وسجل العلامات الفرعية للغة.
ISO 15924 و ISO/IEC 10646 و Unicode
أُضيفت علامات البرمجة النصية الفرعية لأول مرة إلى سجل علامات اللغة الفرعية عند نشر RFC 4646، من قائمة الرموز المحددة في ISO 15924. يتم ترميزها في علامة اللغة بعد علامات اللغة الأساسية والموسعة، ولكن قبل أنواع العلامات الفرعية الأخرى، بما في ذلك علامات المنطقة والعلامات الفرعية المتغيرة.
تُعرَّف بعض العلامات الفرعية للغات الأساسية بخاصية تُسمى "Suppress-Script" تُشير إلى الحالات التي يُفترض فيها عادةً استخدام نص واحد افتراضيًا للغة، حتى لو كان بالإمكان كتابتها بنص آخر. في هذه الحالة، يُفضَّل حذف علامة النص الفرعية لزيادة احتمالية المطابقة الناجحة. مع ذلك، يُمكن إضافة علامة نص فرعية مختلفة للتمييز عند الضرورة. على سبيل المثال، يُفضَّل استخدام yi على yi-Hebr في معظم السياقات، لأن علامة النص العبري تُفترض للغة اليديشية .
كمثال آخر، يمكن اعتبار zh-Hans-SG مكافئًا لـ zh-Hans ، لأن رمز المنطقة على الأرجح غير مهم؛ فالكتابة الصينية المستخدمة في سنغافورة تستخدم نفس الأحرف الصينية المبسطة المستخدمة في البلدان الأخرى التي تُكتب فيها الصينية. ومع ذلك، يتم الاحتفاظ بالعلامة الفرعية للنص لأنها مهمة.
يتضمن معيار ISO 15924 بعض الرموز الخاصة بمتغيرات الكتابة (مثل Hans و Hant للأشكال المبسطة والتقليدية للأحرف الصينية) الموحدة ضمن Unicode و ISO/IEC 10646. تُستخدم هذه المتغيرات غالبًا لأغراض ببليوغرافية، ولكنها ليست ذات أهمية لغوية دائمًا (على سبيل المثال، رموز Latf و Latg لمتغيري Fraktur وGaelic من الكتابة اللاتينية، واللذان يُستخدمان في الغالب مع الأحرف اللاتينية العادية في Unicode وISO/IEC 10646). قد تكون هذه الرموز مفيدة أحيانًا في علامات اللغة لإظهار الاختلافات الإملائية أو الدلالية، مع تحليل مختلف للأحرف وعلامات التشكيل والثنائيات/الثلاثيات كمجموعات رسومية افتراضية، أو اختلافات في قواعد حالة الأحرف.
ISO 3166-1 و UN M.49
تعتمد رموز المناطق الفرعية المكونة من حرفين على الرموز المخصصة، أو "المحفوظة استثنائياً"، في معيار ISO 3166-1 . إذا أعادت وكالة صيانة ISO 3166 تخصيص رمز سبق تخصيصه لدولة أخرى، فإن رمز BCP 47 الفرعي الحالي المقابل لهذا الرمز سيحتفظ بمعناه، وسيتم تسجيل رمز منطقة فرعي جديد للدولة الجديدة بناءً على معيار UN M.49005 . يُعد معيار UN M.49 أيضاً مصدراً لرموز المناطق الفرعية الرقمية للمناطق الجغرافية، مثل أمريكا الجنوبية. أما رموز UN M.49 للمناطق الاقتصادية فهي غير مسموح بها.
تُستخدم العلامات الفرعية للمنطقة لتحديد لهجة اللغة "كما تُستخدم" في منطقة معينة. وهي مناسبة عندما تكون اللهجة ذات طبيعة إقليمية، ويمكن تحديدها بدقة من خلال تحديد البلدان المعنية، كما هو الحال عند التمييز بين الإنجليزية البريطانية ( en-GB ) والإنجليزية الأمريكية ( en-US ). أما عندما يكون الاختلاف متعلقًا بالخط أو تنوعه، كما هو الحال بين الأحرف الصينية المبسطة والتقليدية ، فينبغي التعبير عنه باستخدام علامة فرعية للخط بدلًا من علامة فرعية للمنطقة؛ في هذا المثال، يجب استخدام zh-Hans و zh-Hant بدلًا من zh-CN/zh-SG/zh-MY و zh-TW/zh-HK/zh-MO .
عندما توجد علامة فرعية خاصة باللغة تُعتبر لهجة إقليمية، يُفضّل غالبًا استخدام العلامة الفرعية الأكثر تحديدًا بدلًا من استخدام مزيج اللغة والمنطقة. على سبيل المثال، قد يكون من الأنسب التعبير عن اللغة العربية المستخدمة في الجزائر ( ar-DZ ) بـ arq، أي اللغة العربية الجزائرية المنطوقة .
الالتزام بالمعايير الأساسية
قد تمتد الخلافات حول تحديد اللغة إلى معيار BCP 47 والمعايير الأساسية التي يستند إليها. على سبيل المثال، يعتقد بعض متحدثي البنجابية أن التمييز الوارد في معيار ISO 639-3 بين "البنجابية" و"البنجابية الغربية" غير دقيق (أي أنهم يرون أنهما لغة واحدة )؛ وأن اللهجات الفرعية للخط العربي يجب ترميزها بشكل منفصل في معيار ISO 15924 (كما هو الحال، على سبيل المثال، مع نمطي فراكتورا والغيلية للخط اللاتيني)؛ وأن معيار BCP 47 يجب أن يعكس هذه الآراء أو أن يلغي المعايير الأساسية فيما يتعلق بها.
يُفوّض BCP 47 هذا النوع من الأحكام إلى المعايير الأساسية، ولا يحاول تجاوزها أو إلغائها. يجوز تسجيل العلامات الفرعية المتغيرة والعلامات الفرعية للغة الأساسية (نظريًا) بشكل فردي، ولكن ليس بطريقة تتعارض مع المعايير الأساسية. [ 20 ]
الإضافات
تسمح علامات الامتداد الفرعية (لا ينبغي الخلط بينها وبين علامات اللغة الفرعية الموسعة ) بإضافة معلومات إضافية إلى علامة اللغة، والتي لا تُستخدم بالضرورة لتحديد اللغة. ومن استخدامات هذه الامتدادات ترميز معلومات الموقع، مثل التقويم والعملة.
تتألف العلامات الفرعية للامتدادات من سلاسل نصية متعددة مفصولة بواصلات، تبدأ بحرف واحد (باستثناء x )، يُسمى حرفًا منفردًا . يُوصف كل امتداد في وثيقة IETF RFC خاصة به ، والتي تُحدد جهة تسجيل لإدارة بيانات ذلك الامتداد. وتتولى هيئة IANA مسؤولية تخصيص الأحرف المنفردة.
تم منح تمديدين اعتبارًا من يناير 2014.
الامتداد T (المحتوى المُحوَّل)
يُتيح الامتداد T لعلامة اللغة تضمين معلومات حول كيفية ترجمة البيانات المُوسومة، أو نسخها، أو تحويلها بأي شكل آخر. على سبيل المثال، يمكن استخدام العلامة en-t-jp للمحتوى الإنجليزي المُترجم من النص الياباني الأصلي. ويمكن أن تُشير سلاسل فرعية إضافية إلى أن الترجمة تمت آليًا، أو وفقًا لمعيار مُعتمد.
تم وصف الامتداد T في RFC 6497 المعلوماتي، الذي نُشر في فبراير 2012. هيئة التسجيل هي اتحاد يونيكود . [ 21 ]
الامتداد U (لغة يونيكود)
تتيح الإضافة U إمكانية تضمين مجموعة واسعة من سمات اللغة الموجودة في مستودع بيانات اللغة المشتركة (CLDR) في علامات اللغة. تستخدم هذه السمات كلمات مفتاحية تتكون من مفتاح إلزامي مكون من حرفين ، وتشمل تقسيمات البلدان ( sd، rg )، وبيانات التقويم ( ca، fw، hc ) والمنطقة الزمنية ( tz )، وترتيب التجميع ( co )، ونوع العملة ( cu ) وتنسيقها ( cf )، والقياس ( ms، mu ) ونظام الأرقام ( nu )، وكسر الأسطر ( lb، lw، ss، dx )، وعرض الرموز التعبيرية ( em )، ويمكن أن يتبعها اختيارياً أنواع مفصولة بشرطة .
ومن الأمثلة على ذلك:
- يمثل gsw-u-sd-chzh اللغة الألمانية السويسرية كما هي مستخدمة في كانتون زيورخ .
- يمثل ar-u-nu-latn المحتوى باللغة العربية باستخدام الأرقام اللاتينية الأساسية (من 0 إلى 9) بدلاً من الأرقام المكتوبة بالخط العربي (من 0 إلى 9).
- يمثل he-IL-u-ca-hebrew-tz-jeruslm اللغة العبرية كما يتم التحدث بها في إسرائيل، باستخدام التقويم العبري التقليدي ، وفي المنطقة الزمنية "آسيا/القدس" كما هو محدد في قاعدة بيانات tz .
تم وصف الامتداد U في وثيقة RFC 6067 المعلوماتية، المنشورة في ديسمبر 2010. هيئة التسجيل هي اتحاد يونيكود . وتُعدّ مواصفات LDML الخاصة به ، المنشورة تحت اسم UTS 35، بمثابة توثيق للسمات والكلمات الرئيسية المسجلة. [ 22 ]
See also
References
- 123Phillips, Addison; Davis, Mark (September 2009). "Information on BCP 47 » RFC Editor".
- ↑"Language Subtag Registry". iana.org. Internet Assigned Numbers Authority. Retrieved 5 December 2018.
- ↑"Language Tag Extensions Registry". iana.org. Internet Assigned Numbers Authority. Retrieved 6 December 2018.
- ↑"IANA — Protocol Registries". iana.org. Retrieved 28 July 2015.
- ↑R. Fielding; M. Nottingham; J. Reschke, eds. (June 2022). HTTP Semantics. Internet Engineering Task Force. doi:10.17487/RFC9110. ISSN 2070-1721. STD 97.RFC9110.Internet Standard 97. Obsoletes RFC 2818, 7230, 7231, 7232, 7233, 7235, 7538, 7615 and 7694. Updates RFC 3864.
- ↑"Language information and text direction". w3.org. Retrieved 28 July 2015.
- ↑"Extensible Markup Language (XML) 1.0 (Fifth Edition)". w3.org. Retrieved 28 July 2015.
- ↑"Portable Network Graphics (PNG) Specification (Second Edition)". w3.org. Retrieved 28 July 2015.
- ↑H. Alvestrand (March 1995). Tags for the Identification of Languages. Network Working Group. doi:10.17487/RFC1766. RFC1766.Obsolete. Obsoleted by RFC 3066 and 3282.
- ↑H. Alvestrand (January 2001). Tags for the Identification of Languages. Network Working Group. doi:10.17487/RFC3066. BCP 47.RFC3066.Obsolete, was BCP 47. Obsoleted by RFC 4646 and 4647.
- ↑A. Phillips; M. Davis, eds. (September 2006). Tags for Identifying Languages. Network Working Group. doi:10.17487/RFC4646. BCP 47.RFC4646.Obsolete, was BCP 47. Obsoleted by RFC 5646. Obsoletes RFC 3066.
- ↑A. Phillips; M. Davis, eds. (September 2006). Matching of Language Tags. Network Working Group. doi:10.17487/RFC4647. BCP 47.RFC4647.Best Current Practice 47. Obsoletes RFC 3066.
- ↑Phillips, A.; Davis, M., eds. (September 2009). Tags for Identifying Languages. IETF Network Working Group. doi:10.17487/RFC5646. BCP 47.RFC5646.Best Current Practice 47. Obsoletes RFC 4646.
- ↑Language Tag Registry Update Working Group. "Language Tag Registry Update (ltru)". IETF Datatracker. Internet Engineering Task Force. Retrieved 18 March 2026.
- ↑"Letter Codes of Cultures –List". Archived from the original on 7 August 2022. Retrieved 8 January 2022.
- ↑Addison Phillips, Mark Davis (2008). "Tags for Identifying Languages (old draft for the revision of RFC 4646, now obsolete and may disappear soon)". IETF WG LTRU. Retrieved 23 June 2008.
- ↑Doug Ewell (2008). "Update to the Language Subtag Registry (old draft for the revision of RFC 4645, now obsolete and may disappear soon)"(1MB). IETF WG LTRU. Retrieved 23 June 2008.
- ↑"GetGeoInfoA function (winnls.h) –Win32 apps".
- ↑"ISO 639-2 Language Code List –Codes for the representation of names of languages (Library of Congress)". loc.gov. Retrieved 28 July 2015.
- ↑Ewell, Doug (12 August 2022). "Re: [Ietf-languages] Punjabi language code fix recommendations". Retrieved 12 August 2022.
- ↑ "امتداد Unicode BCP 47 T" . المعيار الفني لليونيكود رقم 35 (UTS35): لغة ترميز بيانات اللغة المحلية لليونيكود (LDML) . اتحاد اليونيكود.
- ↑ "امتداد Unicode BCP 47 U" . المعيار الفني لليونيكود رقم 35 (UTS35): لغة ترميز بيانات اللغة المحلية لليونيكود (LDML) . اتحاد اليونيكود.
روابط خارجية
- BCP 47 علامات اللغة – المواصفات الحالية
- يحتوي على وثيقتين RFC تم نشرهما بشكل منفصل في تواريخ مختلفة، ولكنهما مدمجتان في وثيقة واحدة:
- كما يشير إلى RFC 5645 المعلوماتي ذي الصلة، والذي يكمل RFC 4645 المعلوماتي السابق، بالإضافة إلى نماذج التسجيل الفردية الأخرى التي نشرها آخرون بشكل منفصل لكل لغة تمت إضافتها أو تعديلها في السجل بين مراجعات BCP 47 هذه.
- RFC 4645 – " سجل العلامات الفرعية للغة الأولية، " معلوماتي.
- RFC 5645 – " تحديث سجل العلامات الفرعية للغة، " إعلامي.
- RFC 6067 – " BCP 47 Extension U, " معلوماتي.
- RFC 6497 – " BCP 47 Extension T - Transformed Content, " معلوماتي.
- سجل العلامات الفرعية للغة - يتم صيانته بواسطة IANA
- البحث في سجل العلامات الفرعية للغة – ابحث عن العلامات الفرعية واطلع على الإدخالات في السجل
- " علامات اللغة في HTML وXML " - من W3C
- " علامات اللغة " – من فريق عمل تحديث سجل علامات اللغة التابع لـ IETF
- مواقع الإنترنت التي تأسست عام 1995
- حوكمة الإنترنت
- طلب تعليقات
- معايير ISO
- معرّفات اللغة
- المعرفات الفريدة
- التدويل والتوطين
