موجيباكي


موجيباكي ( باليابانية :文字化け؛ IPA: [ mod͡ʑibake ] ، وتعني "تحويل الأحرف") هو نص مشوّه أو غير مفهوم ينتج عن فك تشفير نص باستخدام ترميز أحرف غير مقصود . [ 1 ] والنتيجة هي استبدال منهجي للرموز برموز أخرى لا علاقة لها بها، وغالبًا ما تكون من نظام كتابة مختلف .
قد يتضمن هذا العرض رمز الاستبدال العام ⟨ � ⟩ في المواضع التي يُعتبر فيها التمثيل الثنائي غير صالح. كما يمكن أن يشمل الاستبدال رموزًا متتالية متعددة، كما هو الحال في ترميز واحد، عندما يُمثل نفس الرمز الثنائي رمزًا واحدًا في الترميز الآخر. ويرجع ذلك إما إلى اختلاف ترميز الطول الثابت (كما هو الحال في ترميزات 16 بت الآسيوية مقابل ترميزات 8 بت الأوروبية)، أو استخدام ترميزات الطول المتغير (لا سيما UTF-8 و UTF-16 ).
يُعدّ فشل عرض الرموز الرسومية، سواءً بسبب نقص الخطوط أو نقص الرموز الرسومية في الخط، مشكلةً مختلفةً لا ينبغي الخلط بينها وبين مشكلة "mojibake". تشمل أعراض هذا الفشل ظهور كتلٍ تحتوي على رمز النقطة معروضًا بنظام العد الست عشري أو باستخدام رمز الاستبدال العام. والجدير بالذكر أن هذه الاستبدالات صحيحة ، وهي ناتجة عن معالجة البرنامج للأخطاء بشكلٍ سليم.
الأسباب

لإعادة إنتاج النص الأصلي المشفر بدقة، يجب الحفاظ على التطابق بين البيانات المشفرة ومفهوم تشفيرها (أي يجب أن تكون معايير التشفير المصدر والهدف متطابقة). وبما أن "mojibake" هو مثال على عدم التوافق بين هذين المعيارين، فيمكن تحقيقه من خلال التلاعب بالبيانات نفسها، أو ببساطة إعادة تسميتها.
يُلاحظ استخدام تقنية Mojibake غالبًا مع البيانات النصية التي تم ترميزها بشكل خاطئ؛ بل قد لا يتم ترميزها أصلًا، وإنما يتم نقلها بين أجهزة كمبيوتر ذات ترميزات افتراضية مختلفة. ومن أهم أسباب هذه المشكلة بروتوكولات الاتصال التي تعتمد على إعدادات كل جهاز كمبيوتر بدلًا من إرسال أو تخزين البيانات الوصفية مع البيانات.
يعود اختلاف الإعدادات الافتراضية بين أجهزة الكمبيوتر جزئيًا إلى اختلاف استخدامات يونيكود بين أنظمة التشغيل ، وجزئيًا إلى تخصصات الترميزات القديمة لأنظمة الكتابة المختلفة للغات البشرية. فبينما تحولت معظم توزيعات لينكس إلى UTF-8 في عام 2004، [ 2 ] يستخدم نظام مايكروسوفت ويندوز عمومًا UTF-16، ويستخدم أحيانًا صفحات ترميز 8 بت لملفات النصوص بلغات مختلفة.
في بعض أنظمة الكتابة ، كاللغة اليابانية ، استُخدمت ترميزات متعددة تاريخيًا، مما يُسبب ظهور أخطاء في الترميز (mojibake) بشكل متكرر. على سبيل المثال، قد تُعرض كلمة mojibake نفسها ( 文字化け) المخزنة بترميز EUC-JP بشكل خاطئ على أنها ( MS-932 )، أو إذا فُسّرت على أنها Shift-JIS، أو كما في البرامج التي تفترض أن النص مكتوب بترميز Windows-1252 أو ISO 8859-1 ، والتي تُسمى عادةً بالترميز الغربي أو الأوروبي الغربي . ويزداد الأمر سوءًا عند استخدام لغات أخرى: فالنص نفسه المخزن بترميز UTF-8 قد يظهر كما لو فُسّر على أنه Shift-JIS، أو كما لو فُسّر على أنه غربي، أو (على سبيل المثال) كما لو فُسّر على أنه مكتوب بلغة GBK (الصين القارية).ハクサ�ス、アハクサ嵂ス、アハクサ郾ス、アʸ»ú²½¤± 譁�蟄怜喧縺�æ–‡å—化ã‘鏂囧瓧鍖栥亼
| النص الأصلي | 文 | 字 | 化 | け | ||||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| بايتات خام من ترميز EUC-JP | كاليفورنيا | B8 | بي بي | الاتحاد الإنجليزي لكرة القدم | B2 | BD | A4 | ب1 | ||||||||||||||||
| تم تفسير بايتات EUC-JP على أنها Shift-JIS | ハ | ク | サ | 郾 | ス | 、 | ア | |||||||||||||||||
| تم تفسير بايتات EUC-JP على أنها GBK | 矢 | 机 | 步 | け | ||||||||||||||||||||
| تم تفسير بايتات EUC-JP على أنها Windows-1252 | Ê | ¸ | » | ú | ² | نصف | ¤ | ± | ||||||||||||||||
| بايتات خام من ترميز UTF-8 | E6 | 96 | 87 | E5 | إعلان | 97 | E5 | 8C | 96 | E3 | 81 | 91 | ||||||||||||
| يتم تفسير بايتات UTF-8 على أنها Shift-JIS | نعم | � | 蟄 | 怜 | 喧 | 縺 | � | |||||||||||||||||
| يتم تفسير بايتات UTF-8 على أنها GBK | 鏂 | 囧 | 瓧 | 鍖 | 栥 | 亼 | ||||||||||||||||||
| تم تفسير بايتات UTF-8 على أنها Windows-1252 | æ | – | ‡ | å | خجول | — | å | Œ | – | ã | هوب | ' | ||||||||||||
نقص في المواصفات
إذا لم يتم تحديد الترميز، فسيعتمد الأمر على البرنامج لتحديده بوسائل أخرى. وبحسب نوع البرنامج، يكون الحل المعتاد إما التكوين أو طرق الكشف عن مجموعة الأحرف ، وكلاهما عرضة للخطأ في التنبؤ.
يتأثر ترميز ملفات النصوص بإعدادات اللغة ، والتي تعتمد على لغة المستخدم ونوع نظام التشغيل ، بالإضافة إلى عوامل أخرى. لذلك، يكون الترميز المفترض خاطئًا بشكل منهجي للملفات الواردة من جهاز كمبيوتر بإعدادات مختلفة، أو حتى من برنامج مُترجم بشكل مختلف ضمن النظام نفسه. بالنسبة لترميز يونيكود، يتمثل أحد الحلول في استخدام علامة ترتيب البايتات ، لكن العديد من المحللات لا تقبل ذلك مع شفرة المصدر أو النصوص الأخرى القابلة للقراءة آليًا. حل آخر هو تخزين الترميز كبيانات وصفية في نظام الملفات؛ حيث يمكن لأنظمة الملفات التي تدعم سمات الملفات الموسعة تخزينها على هذا النحو user.charset. [ 3 ] يتطلب هذا أيضًا دعمًا في البرامج التي ترغب في الاستفادة منه، دون التأثير على البرامج الأخرى.
بينما يسهل اكتشاف بعض الترميزات، مثل UTF-8، إلا أن هناك العديد من الترميزات التي يصعب تمييزها (انظر اكتشاف مجموعة الأحرف ). على سبيل المثال، قد لا يتمكن متصفح الويب من التمييز بين صفحة مُرمّزة بـ EUC-JP وأخرى بـ Shift-JIS إذا لم يتم تحديد الترميز صراحةً باستخدام رؤوس HTTP المُرسلة مع المستندات، أو باستخدام علامات التعريف الوصفية للمستند التي تُستخدم كبديل لرؤوس HTTP المفقودة إذا تعذر تهيئة الخادم لإرسال رؤوس HTTP الصحيحة؛ انظر ترميزات الأحرف في HTML .
المواصفات الخاطئة
يحدث خطأ "Mojibake" أيضًا عند تحديد الترميز بشكل غير صحيح. ويحدث هذا غالبًا بين الترميزات المتشابهة. على سبيل المثال، كان من المعروف أن برنامج البريد الإلكتروني Eudora لنظام التشغيل Windows يرسل رسائل بريد إلكتروني مصنفة على أنها ISO 8859-1 بينما كانت في الواقع Windows-1252 . [ 4 ] يحتوي Windows-1252 على أحرف إضافية قابلة للطباعة في نطاق C1 (أكثرها شيوعًا علامات الاقتباس المنحنية والشرطات الإضافية )، والتي لم تكن تُعرض بشكل صحيح في البرامج المتوافقة مع معيار ISO؛ وقد أثر هذا بشكل خاص على البرامج التي تعمل تحت أنظمة تشغيل أخرى مثل Unix .
إشراف المستخدمين
من بين أنظمة الترميز الشائعة الاستخدام، نشأ العديد منها من دمج ترميز ASCII مع ترميز ASCII؛ ونتيجةً لذلك، فإن هذه الأنظمة متوافقة جزئيًا مع بعضها البعض. ومن أمثلة ذلك Windows-1252 وISO 8859-1. لذا، قد يخلط المستخدمون بين نظام الترميز الموسع الذي يستخدمونه وترميز ASCII العادي.
الإفراط في التحديد
عند وجود طبقات من البروتوكولات، تحاول كل منها تحديد الترميز بناءً على معلومات مختلفة، قد تكون المعلومات الأقل دقة مضللة للمستلم. على سبيل المثال، يمكن لخادم ويب يقدم ملف HTML ثابت عبر HTTP أن يبلغ العميل بمجموعة الأحرف بثلاث طرق:
- في رأس HTTP. يمكن أن تستند هذه المعلومات إلى تكوين الخادم (على سبيل المثال، عند تقديم ملف من القرص) أو يتم التحكم فيها بواسطة التطبيق الذي يعمل على الخادم (للمواقع الإلكترونية الديناميكية).
- في الملف، كعلامة تعريف HTML (
http-equivأوcharset) أوencodingكخاصية لتصريح XML . هذا هو الترميز الذي قصد المؤلف حفظ الملف المحدد به. - في الملف، كعلامة ترتيب البايتات . هذا هو الترميز الذي حفظه محرر المؤلف فعليًا. ما لم يحدث تحويل ترميز غير مقصود (عن طريق فتحه بترميز معين وحفظه بترميز آخر)، فسيكون هذا صحيحًا. مع ذلك، فهو متاح فقط في ترميزات يونيكود مثل UTF-8 أو UTF-16.
نقص في دعم الأجهزة أو البرامج
عادةً ما تُصمَّم الأجهزة القديمة لدعم مجموعة أحرف واحدة فقط، ولا يمكن تغيير هذه المجموعة. يتم تخصيص جدول الأحرف الموجود في برنامج تشغيل الشاشة ليحتوي على أحرف البلد الذي يُباع فيه الجهاز، ويختلف هذا الجدول عادةً من بلد لآخر. لذلك، قد تعرض هذه الأنظمة رموزًا غير مفهومة عند تحميل نص مُنشأ على نظام من بلد آخر. وبالمثل، لا تدعم العديد من أنظمة التشغيل القديمة تنسيقات ترميز متعددة، وبالتالي ستعرض رموزًا غير مفهومة إذا تم ضبطها لعرض نص غير قياسي . على سبيل المثال، تُخصَّص الإصدارات القديمة من مايكروسوفت ويندوز وبالم أو إس لكل بلد على حدة، وتدعم فقط معايير الترميز الخاصة بالبلد الذي يُباع فيه الإصدار المُخصَّص، وبالتالي ستعرض رموزًا غير مفهومة إذا تم فتح ملف يحتوي على نص بتنسيق ترميز مختلف عن التنسيق الذي صُمِّم نظام التشغيل لدعمه.
القرارات
قد تحقق التطبيقات التي تستخدم ترميز UTF-8 كترميز افتراضي درجة أعلى من التوافقية نظرًا لانتشاره الواسع وتوافقه مع الإصدارات السابقة من ASCII . كما يتميز UTF-8 بإمكانية التعرف عليه مباشرةً بواسطة خوارزمية بسيطة، مما يُمكّن البرامج المصممة جيدًا من تجنب الخلط بينه وبين الترميزات الأخرى.
تختلف صعوبة حل مشكلة "تشويه الأحرف" (mojibake) باختلاف التطبيق الذي تحدث فيه وأسبابها. من أكثر التطبيقات شيوعًا التي قد يحدث فيها هذا التشويه متصفحات الويب وبرامج معالجة النصوص . تدعم المتصفحات الحديثة وبرامج معالجة النصوص عادةً مجموعة واسعة من ترميزات الأحرف. غالبًا ما تسمح المتصفحات للمستخدم بتغيير إعدادات ترميز محرك العرض أثناء التشغيل، بينما تسمح برامج معالجة النصوص للمستخدم باختيار الترميز المناسب عند فتح ملف. قد يحتاج المستخدمون إلى بعض التجربة والخطأ للعثور على الترميز الصحيح.
تزداد المشكلة تعقيدًا عند حدوثها في تطبيق لا يدعم عادةً نطاقًا واسعًا من ترميز الأحرف، كما هو الحال في ألعاب الكمبيوتر غير المتوافقة مع ترميز Unicode. في هذه الحالة، يجب على المستخدم تغيير إعدادات ترميز نظام التشغيل لتتوافق مع ترميز اللعبة. مع ذلك، قد يؤدي تغيير إعدادات الترميز على مستوى النظام إلى ظهور تشوهات في ترميز الأحرف في التطبيقات الموجودة مسبقًا. في نظام التشغيل Windows XP والإصدارات الأحدث، يتوفر للمستخدم خيار استخدام Microsoft AppLocale ، وهو تطبيق يسمح بتغيير إعدادات اللغة لكل تطبيق على حدة. ومع ذلك، لا يمكن تغيير إعدادات ترميز نظام التشغيل في أنظمة التشغيل الأقدم مثل Windows 98 ؛ لحل هذه المشكلة في أنظمة التشغيل الأقدم، سيتعين على المستخدم استخدام تطبيقات خارجية لعرض الخطوط.
مشاكل في أنظمة الكتابة المختلفة
إنجليزي
يحدث التشويه في النصوص الإنجليزية عادةً في علامات الترقيم، مثل الشرطات الطويلة ( — ) والشرطات المتوسطة ( – ) وعلامات الاقتباس المائلة (“, ”, ', ')، ولكنه نادرًا ما يحدث في النصوص النصية، لأن معظم أنظمة الترميز تتفق مع ASCII في ترميز الأبجدية الإنجليزية . على سبيل المثال، سيظهر رمز الجنيه الإسترليني كما لو كان مُرمّزًا من قِبل المُرسِل بنظام UTF-8، ولكن سيفسره المُستقبِل على أنه أحد أنظمة الترميز الأوروبية الغربية ( CP1252 أو ISO 8859-1 ). إذا تم تكرار ذلك باستخدام CP1252، فقد يؤدي إلى ظهور علامات مثل , , , , وهكذا.£Â£ £Â£Ã‚£Ã‚£
وبالمثل، فإن علامة الاقتباس المفردة اليمنى (')، عند ترميزها في UTF-8 وفك ترميزها باستخدام Windows-1252، تصبح ’، ’، ’وهكذا.
في العصور القديمة، كانت بعض الحواسيب تستخدم ترميزات خاصة بكل مُصنِّع، مما تسبب في عدم تطابق حتى مع النصوص الإنجليزية. استخدمت حواسيب كومودور ذات 8 بت ترميز PETSCII ، الذي اشتهر بعكس الأحرف الكبيرة والصغيرة مقارنةً بترميز ASCII القياسي . عملت طابعات PETSCII بشكل جيد على حواسيب أخرى في تلك الحقبة، لكنها عكست حالة جميع الأحرف. أما حواسيب IBM المركزية، فكانت تستخدم ترميز EBCDIC الذي لا يتطابق مع ASCII إطلاقًا.
لغات أخرى في أوروبا الغربية
تُعدّ أبجديات اللغات الجرمانية الشمالية ، والكتالونية ، والرومانية ، والفنلندية ، والفرنسية ، والألمانية ، والإيطالية ، والبرتغالية ، والإسبانية ، امتدادًا للأبجدية اللاتينية . وعادةً ما تكون الأحرف الإضافية هي التي تتعرض للتشويه، مما يجعل النصوص غير قابلة للقراءة بشكل طفيف فقط عند استخدام تقنية "mojibake".
- å و ä و ö في اللغتين الفنلندية والسويدية (يوجد š و ž في بعض الكلمات الفنلندية الدخيلة ، و é بشكل هامشي في اللغة السويدية، وبشكل رئيسي أيضًا في الكلمات الدخيلة).
- à, ç, è, é, ï, í, ò, ó, ú, ü في الكاتالونية
- æ و ø و å في اللغتين النرويجية والدنماركية ، بالإضافة إلى علامات التشكيل الحادة الاختيارية على é و ǿ وما إلى ذلك للتوضيح.
- á، é، ó، ij ، è، ë، ï باللغة الهولندية
- ä، ö، ü ، و ß في اللغة الألمانية
- á، ð ، í ، ó ، ú ، ý ، æ، ø في جزر فارو
- á, ð, é , í, ó, ú, ý, þ , æ, ö في الآيسلندية
- à, â, ç, è, é, ë, ê, ï, î, ô, ù, û, ü, ÿ, æ, œ في الفرنسية
- à، è، é، ì، ò، ù باللغة الإيطالية
- á, é, í, ñ , ú, ú, ü, ¡, ¿ في الإسبانية
- à، á، â، の، ç، é، ê، í، ó، ô، õ، ú بالبرتغالية ( ü لم تعد مستخدمة)
- á, é, í, ó, ú في اللغة الأيرلندية
- à، è، ì، ò، ù في الغيلية الاسكتلندية
- ă، â، î، ă، ti باللغة الرومانية
- £ في اللغة الإنجليزية البريطانية (نادراً ما يتم استخدام æ و œ، كما هو الحال مع é و ê في بعض الكلمات الدخيلة)
...ونظيراتها المكتوبة بأحرف كبيرة، إن وجدت.
هذه لغاتٌ استُخدمت فيها مجموعة الأحرف ISO 8859-1 (المعروفة أيضًا باسم Latin 1 أو Western ). مع ذلك، فقد أُلغيت ISO 8859-1 لصالح معيارين منافسين، هما Windows-1252 المتوافق مع الإصدارات السابقة، و ISO 8859-15 المُعدَّل قليلاً . يُضيف كلا المعيارين رمز اليورو € والحرف الفرنسي œ، ولكن بخلاف ذلك، لا يُؤدي أي لبس بين مجموعات الأحرف الثلاث هذه إلى ظهور رموز غير مفهومة في هذه اللغات. علاوة على ذلك، من الآمن دائمًا تفسير ISO 8859-1 على أنه Windows-1252، ومن الآمن إلى حدٍّ ما تفسيره على أنه ISO 8859-15، لا سيما فيما يتعلق برمز اليورو الذي يحل محل رمز العملة النادر الاستخدام (¤). مع ذلك، ومع ظهور UTF-8 ، أصبح استخدام الرموز غير المفهومة أكثر شيوعًا في بعض الحالات، مثل تبادل الملفات النصية بين أجهزة كمبيوتر UNIX و Windows ، نظرًا لعدم توافق UTF-8 مع Latin-1 وWindows-1252. لكن يمكن التعرف على ترميز UTF-8 مباشرةً بواسطة خوارزمية بسيطة، لذا ينبغي أن تتمكن البرامج المصممة جيدًا من تجنب الخلط بين UTF-8 والترميزات الأخرى، ولذلك كان هذا شائعًا عندما كانت العديد من البرامج لا تدعم UTF-8. كانت معظم هذه اللغات مدعومة بواسطة ترميز CP437 الافتراضي لنظام MS-DOS وترميزات افتراضية أخرى، باستثناء ASCII، لذا كانت المشاكل عند شراء إصدار نظام التشغيل أقل شيوعًا. مع ذلك، فإن نظامي Windows وMS-DOS غير متوافقين.
في اللغات السويدية والنرويجية والدنماركية والألمانية، نادرًا ما تتكرر حروف العلة، وعادةً ما يكون من الواضح عند تحريف أحد الأحرف، مثل الحرف الثاني في الكلمة السويدية (love) عند ترميزها بنظام UTF-8 وفك ترميزها بنظام Western، فينتج 0 ، أو في الألمانية، الذي يصبح 0. وبهذه الطريقة، حتى وإن اضطر القارئ إلى تخمين الحرف الأصلي، تظل معظم النصوص مقروءة. أما اللغة الفنلندية، فتستخدم حروف العلة المتكررة بكثرة في كلمات مثل hääyö (ليلة الزفاف)، مما قد يجعل النص المحرف صعب القراءة للغاية (مثلًا، يظهر كـ 0 ). تحتوي اللغة الأيسلندية على عشرة أحرف قد تكون مربكة، والفاروية على ثمانية، مما يجعل العديد من الكلمات غير مفهومة تمامًا عند تحريفها (مثلًا، الكلمة الأيسلندية التي تعني "الضيافة المتميزة" تظهر كـ 0).kärlekkärlekfürfürhääyöhääyöþjóðlöðþjóðlöð
في اللغة الألمانية، Buchstabensalat ("سلطة الحروف") هو مصطلح شائع لهذه الظاهرة، وفي اللغة الإسبانية، يتم استخدام deformación (حرفيًا "تشويه")، وفي اللغة البرتغالية، يتم استخدام desformatação (حرفيًا "إزالة التشويه").
يلجأ بعض المستخدمين إلى نقل كتاباتهم حرفيًا عند استخدام الحاسوب، إما بحذف علامات التشكيل التي تُسبب مشاكل، أو باستخدام بدائل الحروف المركبة ( å → aa ، ä/æ → ae ، ö/ø → oe ، ü → ue ، إلخ). فعلى سبيل المثال، قد يكتب الكاتب "ueber" بدلًا من "über"، وهو أمر شائع في الألمانية عند عدم توفر علامات التشكيل . ويبدو أن هذه الممارسة الأخيرة مقبولة بشكل أكبر في ألمانيا مقارنةً بدول الشمال الأوروبي . فعلى سبيل المثال، في النرويجية، ترتبط الحروف المركبة باللغة الدنماركية القديمة، وقد تُستخدم على سبيل المزاح. ومع ذلك، تُعد الحروف المركبة مفيدة في التواصل مع مختلف أنحاء العالم. فعلى سبيل المثال، كان اسم عائلة لاعب كرة القدم النرويجي أولي غونار سولسكاير مكتوبًا "SOLSKJAER" على قميصه عندما كان يلعب لنادي مانشستر يونايتد .
تم رصد أثر خاطئ لترميز UTF-8 تم تفسيره على أنه ISO 8859-1 ، وتم عرضه على شكل ، في عام 2014 في عملية احتيال عبر الرسائل النصية القصيرة استهدفت النرويج. [ 5 ]Ring meg nåRing meg nÃ¥
| مثال سويدي | ترميز المصدر | ترميز الهدف | النتيجة (الأحرف باللون الأحمر غير صحيحة.) |
|---|---|---|---|
| سمورغاس ( ساندويتش مفتوح ) | MS-DOS 437 | ISO 8859-1 | Sm ” rg † s |
| UTF-8 | ISO 8859-1 | Sm ö rg å s | |
| UTF-8 | IBM/CP037 (EBCDIC) | ë_C¶ÊÅCvË | |
| UTF-8 | ماك رومان | Sm √∂ rg √• s | |
| ISO 8859-1 | ماك رومان | Sm ˆ rg  s |
وتحدث المشكلة نفسها أيضاً في اللغة الرومانية، انظر هذه الأمثلة:
| مثال روماني | ترميز المصدر | ترميز الهدف | النتيجة (الأحرف باللون الأحمر غير صحيحة.) |
|---|---|---|---|
| سينوشا ( رماد ) | UTF-8 | ASCII | Cenu șă |
| ISO 8859-2 | Cenu Č™Äƒ | ||
| OEM 737 | سينو ╚β─Δ | ||
| Shift-JIS | سينوネ卞 | ||
| TIS-620 | Cenu ศ™ฤƒ | ||
| IBM/CP037 (EBCDIC) | äÁ>ÍHrDc |
أوروبا الوسطى والشرقية
قد يتأثر مستخدمو لغات أوروبا الوسطى والشرقية أيضاً. ولأن معظم أجهزة الكمبيوتر لم تكن متصلة بأي شبكة خلال منتصف إلى أواخر ثمانينيات القرن الماضي، فقد كانت هناك ترميزات أحرف مختلفة لكل لغة تحتوي على أحرف تشكيلية (انظر ISO/IEC 8859 و KOI-8 )، وغالباً ما كانت تختلف أيضاً باختلاف نظام التشغيل.
المجرية
في اللغة الهنغارية ، تُعرف هذه الظاهرة باسم "betűszemét "، أي "أحرف غير مفهومة". وقد كانت الهنغارية عرضةً لهذه الظاهرة بشكل خاص لاحتوائها على الأحرف المُشكّلة á، é، í، ó، ú، ö، ü (جميعها موجودة في مجموعة أحرف Latin-1)، بالإضافة إلى الحرفين ő و ű غير الموجودين في Latin-1. يمكن ترميز هذين الحرفين بشكل صحيح في Latin-2 وWindows-1250 وUnicode. مع ذلك، قبل شيوع Unicode في برامج البريد الإلكتروني، كانت رسائل البريد الإلكتروني التي تحتوي على نصوص هنغارية غالبًا ما تحتوي على الحرفين ő وű مشوّهين، لدرجة يصعب معها تمييزهما أحيانًا. ومن الشائع الرد على رسالة بريد إلكتروني مشوّهة بعبارة غير مفهومة "Árvíztűrő tükörfúrógép" (وتعني حرفيًا "آلة حفر مرايا مقاومة للفيضانات")، والتي تحتوي على جميع الأحرف المُشكّلة المستخدمة في اللغة الهنغارية.
أمثلة
| مثال مجري | ترميز المصدر | ترميز الهدف | نتيجة | حدوث |
|---|---|---|---|---|
| ÁRVÍZTŰRŐ TÜKÖRFÚRÓGÉP árvíztűrő tükörfúrógép | UTF-8 Quoted-printable | ASCII ذو 7 بت | =C3=81 RV =C3=8D ZT =C5=B0 R =C5=90 T =C3=9C K =C3=96 RF =C3=9A R =C3=93 G =C3=89 P =C3=A1 rv =C3=AD zt =C5=B1 r =C5=91 t =C3=BC k =C3=B6 rf =C3=BA r =C3=B3 g =C3=A9 p | يحدث ذلك بشكل رئيسي بسبب خوادم البريد الإلكتروني غير المهيأة بشكل صحيح، ولكنه قد يحدث أيضًا في رسائل SMS على بعض الهواتف المحمولة. |
| ISO 8859-2 اقتباس قابل للطباعة | ASCII ذو 7 بت | =C1 RV =CD ZT =DB R =D5 T =DC K =D6 RF =DA R =D3 G =C9 P =E1 rv =ED zt =FB r =F5 t =FC k =F6 rf =FA r =F3 g =E9 p | ||
| CWI-2 | CP 437 | Å RV ì ZT ÿ R ° TÜKÖRF ù R ò GÉP árvízt û rô tükörfúrógép | صُممت ترميز CWI -2 بحيث يظل النص المجري قابلاً للقراءة بشكل جيد حتى لو كان الجهاز المُستقبِل يستخدم ترميزًا أوروبيًا غربيًا ( CP 437 أو CP 850 ). وقد استُخدم هذا الترميز بكثرة بين أوائل الثمانينيات وأوائل التسعينيات، ولكنه أصبح الآن مُهملًا تمامًا. | |
| CP 852 | CP 437 | ╡ RV ╓ ZT δ R è TÜKÖRF Θ R α GÉP árvízt √ r ï tükörfúrógép | كان هذا شائعًا جدًا في أيام نظام التشغيل MS-DOS ، حيث كان النص يُشفّر غالبًا باستخدام صفحة الترميز 852 ("أوروبا الوسطى")، لكن البرامج المُستقبِلة (في دول أوروبا الغربية) لم تكن تدعم صفحة الترميز 852 في كثير من الأحيان، وكانت تحاول عرض النص باستخدام صفحة الترميز 437 أو 850. الأحرف الصغيرة صحيحة في الغالب، باستثناء الحرفين ű وő. الحرفان Ü/ü وÖ/ö صحيحان لأن صفحتي الترميز 437 و850 كانتا متوافقتين مع اللغة الألمانية. مع أن هذا نادر الحدوث اليوم، إلا أنه لا يزال يُلاحظ في بعض المواضع، مثل الوصفات الطبية والشيكات المطبوعة. | |
| CP 852 | CP 850 | ÁRVÍZT Ù R è TÜKÖRFÚRÓGÉP árvízt ¹ r ï tükörfúrógép | ||
| CP 852 | ويندوز-1250 | μ RV Ö ZT ë R Š T š K ™ RF é R ŕ GP rv ˇ ztűr ‹ tk " rf Ł r ˘ g ‚ p | كلا الترميزين من أوروبا الوسطى، لكن النص مُرمّز باستخدام صفحة ترميز MS-DOS ومُفكّك باستخدام صفحة ترميز Windows. استخدام الحرف ű صحيح. | |
| CP 852 | ماك رومان | μ RV ÷ ZT Î R ن T ö K ô RF È R ‡ Gê P † rv ° zt˚ r M t Åkî rf £ r ¢ g ç p | كان هذا شائعًا أيضًا في أيام نظام التشغيل MS-DOS، ويمكن ملاحظة ذلك عندما حاولت أجهزة كمبيوتر Apple عرض نص مجري تم إرساله باستخدام أجهزة DOS أو Windows، حيث كانت غالبًا ما تستخدم ترميز Apple الخاص بشكل افتراضي. | |
| ويندوز-1250 | ماك رومان | ¡ RV Õ ZT € R ' T ‹ K ÷ RF ⁄ R ” G … P · rv Ì zt ˚ r ı t ¸ k ˆ rf ˙ r Û g È p | ||
| ويندوز-1250 | CP 852 | ┴ RV lag ZT █ RŇ T ▄ KÍ RF ┌ RË G ╔ Pß rv Ý ztűr § t Ř k ÷ rf˙ rˇ gÚ p | كلا الترميزين من أوروبا الوسطى، لكن النص مُرمّز باستخدام صفحة ترميز ويندوز ومفكك باستخدام صفحة ترميز دوس. استخدام الحرف ű صحيح. | |
| ويندوز-1250 | ويندوز-1252 | ÁRVÍZT Û R Õ TÜKÖRFÚRÓGÉP árvízt û r õ tükörfúrógép | يُستخدم ترميز ويندوز الافتراضي لأوروبا الغربية بدلاً من ترميز أوروبا الوسطى. الحرفان ő-Ő (õ-Õ) وű-Ű (û-Û) فقط هما الخاطئان، والنص قابل للقراءة تمامًا. قبل أن يصبح ترميز UTF-8 الأكثر شيوعًا، كان هذا يحدث غالبًا على صفحات الويب وحتى في الوسائط المطبوعة. | |
| UTF-8 | ويندوز-1252 | Í RV È ZT Ű R Å T œ K – RF Ú R È G É P á rv à zt ± r Å ' t ú k ¶ rf ú r ó g é p | يحدث هذا الخطأ غالبًا بسبب خدمات الويب أو برامج البريد الإلكتروني التي تم تكوينها بشكل غير صحيح أو لم يتم اختبارها للاستخدام الدولي (إذ يبقى الخطأ خفيًا بالنسبة للنصوص الإنجليزية). في هذه الحالة، يكون المحتوى الفعلي (الذي غالبًا ما يتم إنشاؤه) بتنسيق UTF-8 ، ولكن قد تستخدم بعض البرامج القديمة ترميزات محلية افتراضيًا إذا لم يتم تحديد UTF-8 صراحةً في رؤوس HTML. يُعدّ تفسير UTF-8 بشكل خاطئ على أنه Windows-1252 الخطأ الأكثر شيوعًا في الوقت الحالي، حيث تستخدم العديد من التطبيقات افتراضيًا ISO 8859-1 أو Windows-1252. | |
| UTF-8 | ماك رومان | √Å RV √ç ZT ≈∞ R ≈ê T √ú K √ñ RF √ö R √ì G √â P √° rv √≠ zt ≈± r ≈ë t √º k √∂ rf √∫ r √≥ g √© p |
بولندي
قبل وضع معيار ISO 8859-2 عام 1987، كان مستخدمو منصات الحوسبة المختلفة يستخدمون ترميزات أحرف خاصة بهم، مثل AmigaPL على Amiga، وAtari Club على Atari ST، وMasovia، وIBM CP852 ، و Masovia، و Windows CP1250 على أجهزة IBM الشخصية. ابتكرت الشركات البولندية التي كانت تبيع أجهزة الكمبيوتر التي تعمل بنظام DOS في بداياتها طرقًا غير متوافقة لترميز الأحرف البولندية، واكتفت بإعادة برمجة ذاكرة EPROM الخاصة ببطاقات الفيديو (عادةً CGA أو EGA أو Hercules ) لتوفير صفحات ترميز الأجهزة التي تحتوي على الرموز المطلوبة للغة البولندية ، والتي كانت توضع بشكل عشوائي دون أي إشارة إلى أماكن وضعها لدى بائعي أجهزة الكمبيوتر الآخرين.
بدأ الوضع يتحسن عندما نجح معيار ISO 8859-2 ، بعد ضغوط من الأوساط الأكاديمية والمستخدمين، في أن يصبح "معيار الإنترنت" بدعم محدود من برامج الشركات الرائدة (التي حلت محلها اليوم يونيكود إلى حد كبير). ونظرًا للمشاكل العديدة الناجمة عن تنوع الترميزات، لا يزال بعض المستخدمين حتى اليوم يميلون إلى الإشارة إلى الأحرف البولندية المُشكِّلة باسم krzaczki ( [ˈkʂät͜ʂ.ki] ، وتعني حرفيًا "الشجيرات الصغيرة").
اللغة الروسية وغيرها من الأبجديات القائمة على اللغة السيريلية
يُطلق على لغة موجيباكي اسم "كراكوزيابري" ( кракозя́бры [ krɐkɐˈzʲæbrɪ̈ ] ) في اللغة الروسية ، وقد كانت ولا تزال معقدة بسبب وجود عدة أنظمة لترميز الأبجدية السيريلية . [ 6 ] طوّر الاتحاد السوفيتي والاتحاد الروسي في بداياتهما ترميز KOI ( Kod Obmena Informatsiey ، Код Обмена Информацией ، والذي يُترجم إلى "رمز تبادل المعلومات"). بدأ هذا الترميز بترميز KOI7 ذي 7 بتات ، والذي كان مخصصًا للأبجدية السيريلية فقط، ويعتمد على نظام ASCII مع استبدال الأحرف اللاتينية وبعض الأحرف الأخرى بأحرف سيريلية. ثم ظهر ترميز KOI8 ذو 8 بتات ، وهو امتداد لنظام ASCII ، حيث يُرمّز الأحرف السيريلية فقط باستخدام مجموعات ثمانية بتات عالية، تُقابل رموز KOI7 ذات 7 بتات. لهذا السبب، يظل نص KOI8، حتى الروسي منه، قابلاً للقراءة جزئيًا بعد حذف البت الثامن، وهو ما كان يُعتبر ميزةً كبيرةً في عصر أنظمة البريد الإلكتروني التي لم تكن تدعم 8BITMIME . على سبيل المثال، الكلمات ( shkola russkogo yazyka )، عند ترميزها باستخدام KOI8 ومعالجتها بعملية حذف البت الأعلى، تُعرض بالشكل التالي : . في النهاية، اكتسب KOI8 إصدارات مختلفة للغات الروسية والبلغارية ( KOI8-R )، والأوكرانية ( KOI8-U )، والبيلاروسية (KOI8-RU)، وحتى الطاجيكية (KOI8-T).Школа русского языка[KOLA RUSSKOGO qZYKA
في غضون ذلك، في الغرب، دعمت صفحة الترميز 866 اللغات الأوكرانية والبيلاروسية ، بالإضافة إلى الروسية والبلغارية في نظام MS-DOS . أما بالنسبة لنظام مايكروسوفت ويندوز ، فقد أضافت صفحة الترميز 1251 دعمًا للغة الصربية وغيرها من اللهجات السلافية للأبجدية السيريلية .
في الآونة الأخيرة، يتضمن ترميز Unicode نقاط رمزية لجميع الأحرف تقريبًا في جميع اللغات، بما في ذلك جميع الأحرف السيريلية.
قبل اعتماد يونيكود، كان من الضروري مطابقة ترميز النص مع الخط الذي يستخدم نظام الترميز نفسه؛ وإلا سينتج عنه نص غير مفهوم وغير قابل للقراءة، يختلف مظهره باختلاف تركيبة ترميز النص والخط. على سبيل المثال، عند محاولة عرض نص سيريلّي غير متوافق مع يونيكود باستخدام خط يقتصر على الأبجدية اللاتينية، أو باستخدام الترميز الافتراضي ("الغربي")، ينتج عادةً نص يتكون بالكامل تقريبًا من حروف علة كبيرة مع علامات تشكيل (مثلًا، KOI8 ( biblioteka ، مكتبة) يصبح ، بينما ( shkola russkogo yazyka ، مدرسة اللغة الروسية) يصبح ) . استخدام صفحة الترميز 1251 لعرض نص في KOI8، أو العكس، ينتج عنه نص مشوّه يتكون في معظمه من أحرف كبيرة (يشترك كل من KOI8 وصفحة الترميز 1251 في نفس منطقة ASCII، لكن KOI8 يحتوي على أحرف كبيرة في المنطقة التي تحتوي فيها صفحة الترميز 1251 على أحرف صغيرة، والعكس صحيح).БиблиотекаâÉÂÌÉÏÔÅËÁШкола русского языкаûËÏÌÁ ÒÕÓÓËÏÇÏ ÑÚÙËÁ
خلال السنوات الأولى للقطاع الروسي من شبكة الإنترنت العالمية، كان كل من KOI8 وصفحة الترميز 1251 شائعين. تستخدم جميع مواقع الويب تقريبًا الآن ترميز يونيكود، ولكن اعتبارًا من نوفمبر 2023 ،تشير التقديرات إلى أن 0.35% من جميع صفحات الويب حول العالم - بجميع اللغات - لا تزال مشفرة باستخدام ترميز الصفحة 1251، بينما لا تزال أقل من 0.003% من المواقع مشفرة باستخدام ترميز KOI8-R. [ 7 ] [ 8 ] على الرغم من أن معيار HTML يتضمن إمكانية تحديد الترميز لأي صفحة ويب معينة في مصدرها، [ 9 ] إلا أن هذا الأمر يُهمل أحيانًا، مما يُجبر المستخدم على تغيير الترميز يدويًا في المتصفح.
في اللغة البلغارية، يُطلق على الأحرف غير المفهومة اسم majmunica ( مايمونيتسا )، أي "أبجدية القرد". أما في اللغة الصربية ، فتُسمى đubre ( يوبره )، أي " قمامة ". على عكس الاتحاد السوفيتي السابق، لم يستخدم السلاف الجنوبيون ترميزًا مثل KOI8، وكانت صفحة الترميز 1251 هي الترميز السيريلي السائد قبل يونيكود؛ لذا، واجهت هذه اللغات مشاكل أقل في عدم توافق الترميز مقارنةً بالروسية. في ثمانينيات القرن العشرين، استخدمت الحواسيب البلغارية ترميز MIK الخاص بها ، والذي يُشبه ظاهريًا ترميز CP866، ولكنه غير متوافق معه.
| النص الأصلي | ترميز المصدر | ترميز الهدف | نتيجة |
|---|---|---|---|
| Кракозябры | ويندوز-1251 | KOI8-R | йПЮЙНГЪАПШ |
| KOI8-R | ويندوز-1251 | лТБЛПЪСВТЩ | |
| ويندوز-1252 | ëÒÁËÏÚÑÂÒÙ | ||
| MS-DOS 855 | ويندوز-1252 | Çá ÆÖóÞ¢áñ | |
| ويندوز-1251 | ويندوز-1252 | Êðàêîçÿáðû | |
| UTF-8 | ويندوز-1252 | КраÐÐ¾Ð·Ñ Ð±Ñ€Ñ‹ | |
| KOI8-R | п я─п╟п╨п╬п╥я▐п╠я─я▀ (الحرف الثاني هو مسافة غير قابلة للكسر ) | ||
| MS-DOS 855 | лџЛђл░л║лЙлиЛЈл▒ЛђЛІ | ||
| ويندوز-1251 | Кракозябры | ||
| ماك رومان | –ö—Ä–∞–∫–و–∑—ه–±—Ä—م | ||
| ماك سيريلية | –Ъ—А–∞–Ї–Њ–Ј—P–±—А—Л |
اللغات اليوغوسلافية
تُضيف اللغات الكرواتية والبوسنية والصربية (وهي لهجات منفصلة عن اللغة الصربية الكرواتية ) والسلوفينية إلى الأبجدية اللاتينية الأساسية الأحرف š وđ وč وć وž ، ونظائرها الكبيرة Š وĐ وČ وĆ وŽ (يُستخدم رسميًا في اللغة السلوفينية الأحرف č/Č وš/Š وž/Ž فقط، مع استخدام أحرف أخرى عند الحاجة، لا سيما في الأسماء الأجنبية). جميع هذه الأحرف مُعرّفة في Latin-2 و Windows-1250 ، بينما توجد بعضها فقط (š وŠ وž وŽ وĐ) في نظام التشغيل Windows-1252 الافتراضي ، وذلك بسبب وجودها في بعض اللغات الأخرى.
على الرغم من إمكانية حدوث تشويه في الأحرف (Mojibake) مع أي من هذه الأحرف، إلا أن الأحرف غير المدرجة في ترميز Windows-1252 أكثر عرضة للأخطاء. لذا، حتى في الوقت الحاضر، قد يؤدي محاولة عرضها على الأنظمة القديمة إلى ظهور خطأ ، على الرغم من أن الأحرف ð وÈ وÆ غير مستخدمة في اللغات السلافية.ŠĐČĆŽ šđč枊ÐÈÆŽ šðèæž
عند الاقتصار على رموز ASCII الأساسية (معظم أسماء المستخدمين، على سبيل المثال)، تكون الاستبدالات الشائعة هي: š→s، đ→dj، č→c، ć→c، ž→z (وكذلك الحال مع الأحرف الكبيرة، حيث Đ→Dj أو Đ→DJ حسب حالة الأحرف). تُدخل جميع هذه الاستبدالات غموضًا، لذا عادةً ما تتم إعادة بناء النص الأصلي من هذا الشكل يدويًا عند الحاجة.
يُعدّ ترميز Windows -1252 مهمًا لأنّ النسخ الإنجليزية من نظام تشغيل Windows هي الأكثر انتشارًا، وليست النسخ المُترجمة. وتشمل أسباب ذلك صغر حجم السوق وتجزئته نسبيًا، مما يزيد من تكلفة الترجمة عالية الجودة، وارتفاع نسبة قرصنة البرامج (الناتجة بدورها عن ارتفاع سعر البرامج مقارنةً بالدخل)، الأمر الذي يُثبّط جهود الترجمة، بالإضافة إلى تفضيل المستخدمين للنسخ الإنجليزية من Windows وغيرها من البرامج.
إنّ السعي لتمييز الكرواتية عن الصربية، والبوسنية عن الكرواتية والصربية، وحتى المونتينيغرية عن اللغات الثلاث الأخرى، يُثير العديد من المشاكل. فهناك العديد من النسخ المحلية المختلفة، التي تستخدم معايير متباينة وتتفاوت في جودتها. ولا توجد ترجمات موحدة للمصطلحات الحاسوبية الكثيرة ذات الأصل الإنجليزي. في النهاية، يلجأ الكثيرون إلى استخدام الكلمات الإنجليزية المُقترضة ("kompjuter" بدلاً من "computer"، و"kompajlirati" بدلاً من "compile"، إلخ)، وإذا لم يكونوا معتادين على المصطلحات المُترجمة، فقد لا يفهمون وظيفة خيارٍ ما في القائمة بناءً على العبارة المُترجمة. لذلك، يختار الأشخاص الذين يفهمون الإنجليزية، وكذلك أولئك المُعتادين على المصطلحات الإنجليزية (وهم الأغلبية، لأنّ المصطلحات الإنجليزية تُدرّس في المدارس في الغالب بسبب هذه المشاكل)، النسخ الإنجليزية الأصلية للبرامج غير المتخصصة.
عند استخدام الأبجدية السيريلية ( للمقدونية وجزئياً الصربية )، تكون المشكلة مشابهة للنصوص الأخرى القائمة على الأبجدية السيريلية .
تتيح الإصدارات الأحدث من نظام التشغيل ويندوز باللغة الإنجليزية تغيير صفحة الترميز (بينما تتطلب الإصدارات الأقدم إصدارات إنجليزية خاصة تدعم هذه الميزة)، ولكن قد يتم ضبط هذا الإعداد بشكل خاطئ، وكثيراً ما كان يحدث ذلك. على سبيل المثال، يمكن ضبط ويندوز 98 وويندوز Me على معظم صفحات الترميز أحادية البايت التي لا تُكتب من اليمين إلى اليسار ، بما في ذلك 1250، ولكن فقط أثناء التثبيت.
الترميزات الآسيوية
يحدث نوع آخر من تشويه الأحرف عندما يُحلل نص مُشفّر بتشفير أحادي البايت بشكل خاطئ باستخدام تشفير متعدد البايت، مثل أحد تشفيرات لغات شرق آسيا . في هذا النوع من التشويه، يتلف أكثر من حرف (عادةً حرفان) في آنٍ واحد. على سبيل المثال، إذا كانت الكلمة السويدية kärlek مُشفّرة بنظام Windows-1252 ولكن تم فك تشفيرها باستخدام GBK، فستظهر كـ "k鋜lek"، حيث يُحلل " är " كـ "鋜". بالمقارنة مع التشويه السابق، يصعب قراءة هذا النوع، نظرًا لغياب الأحرف غير المرتبطة بالأحرف المُسببة للمشكلة å أو ä أو ö، ويُصبح الأمر أكثر صعوبةً مع الكلمات القصيرة التي تبدأ بهذه الأحرف (مثل "än" التي تُصبح "鋘"). ولأن حرفين مُدمجان، يبدو التشويه أكثر عشوائية (أكثر من 50 شكلاً مُختلفًا مُقارنةً بالثلاثة أشكال المُعتادة، دون احتساب الأحرف الكبيرة النادرة). في بعض الحالات النادرة، قد يتم تفسير سلسلة نصية كاملة تتضمن نمطًا من أطوال كلمات معينة، مثل جملة " أخفى بوش الحقائق ".
الفيتناميين
في اللغة الفيتنامية ، تُسمى هذه الظاهرة "تشو ما" ( باللغة الفيتنامية : 𡨸魔، حيث يُترجم الرمز vie إلى الرمز vi ، أي "أحرف شبحية") أو "لوان ما" (من الصينية: 乱码، luànmǎ ). تحدث هذه الظاهرة عندما يحاول الحاسوب فك تشفير نص مُشفّر بنظام UTF-8 على أنه Windows-1258 أو TCVN3 أو VNI. في فيتنام، كانت ظاهرة "تشو ما" شائعة في الحواسيب التي تعمل بإصدارات ويندوز السابقة لإصدار Vista أو في الهواتف المحمولة الرخيصة.
| مثال | ترميز المصدر | ترميز الهدف | نتيجة |
|---|---|---|---|
| اسم المستخدم في người ta 𤾓𢆥𥪞𡎝𠊛些( Truyện Kiều , Nguyễn Du ) | UTF-8 | ويندوز-1258 | Tr ă m n ă m trong c õ i ng Æ °á» i ta đ¤¾«đ†¥đ¥ªžđ¡Ž đ Š›ä› |
| TCVN3 | Tr ¨ mn ¨ m trong c â i ng ê i ta ¤¾�� �� ¥¥ª ¡ �� ¾ä�� | ||
| VNI (ويندوز) | Tr aê m n aê m trong c oõ i ng öôø i ta | ||
| ماك رومان | Tr ƒÉ m n ƒÉ m trong c √μ i ng ∆∞·ªù i ta §æìÜ••™û°éù†äõ‰∫õ |
اليابانية
في اليابان ، تُعدّ مشكلة "موجيباكي" (mojibake) إشكاليةً خاصةً نظرًا لتعدد ترميزات النصوص اليابانية. فإلى جانب ترميزات يونيكود (UTF-8 وUTF-16)، توجد ترميزات قياسية أخرى، مثل Shift-JIS (لأجهزة ويندوز) و EUC-JP (لأنظمة يونكس). وحتى يومنا هذا، لا يزال اليابانيون وغير اليابانيين يواجهون مشكلة "موجيباكي" عند محاولة تشغيل برامج مصممة للسوق اليابانية.
| النص الأصلي | ترميز المصدر | ترميز الهدف | نتيجة |
|---|---|---|---|
| هذا هو الحال. | UTF-8 | UTF-7 | ���̃���(�q���Y�_�C�G�b�g) |
| UTF-8 | EUC-JP | ������������������������������������������������������ | |
| UTF-8 | Shift-JIS | """""""""""""""""""""""""""" | |
| UTF-8 | ماك رومان | ‹‹‹آآآ°›ـÉ´‹أطاؤككـ أ∏ـآه°‹É‹ايهـا∏أكـأونكا | |
| UTF-8 | ISO 8859-6 | ك "ك"ك"ك"ك"ك"ك"ك" ؛ك"ك"ك"ك" | |
| UTF-8 | ويندوز-1252 | “きメヾル ¯çš†§˜へき メッカー ジ § ™も | |
| EUC-JP | ويندوز-1252 | ¤¤Î¥á¡¼¥ë¤Ï³§ÍͤؤΥL¥ä¡¼¥¤¤¤¡ £ | |
| Shift-JIS | ويندوز-1252 | ‚±‚̃ [ƒ‹‚ÍŠF—l‚ւ̃ ƒbƒZ [ƒW‚Å‚· B |
الصينية
في اللغة الصينية ، تُسمى هذه الظاهرة "Luàn mǎ" ( بينيين ، بالصينية المبسطة乱码، بالصينية التقليدية亂碼، وتعني "الرمز الفوضوي")، وتحدث عندما يُشفّر نصٌّ حاسوبيٌّ باستخدام ترميزٍ معينٍ للأحرف الصينية، ولكنه يُعرض باستخدام ترميزٍ خاطئ. عند حدوث ذلك، غالبًا ما يكون من الممكن حل المشكلة بتغيير ترميز الأحرف دون فقدان البيانات. يزداد الوضع تعقيدًا نظرًا لوجود أنظمة ترميزٍ متعددةٍ للأحرف الصينية قيد الاستخدام، وأكثرها شيوعًا: Unicode و Big5 و Guobiao (مع وجود إصداراتٍ عديدةٍ متوافقةٍ مع الإصدارات السابقة)، واحتمالية تشفير الأحرف الصينية باستخدام الترميز الياباني.
من السهل نسبياً تحديد الترميز الأصلي عندما يظهر الرمز luànmǎ في ترميزات Guobiao:
| النص الأصلي | ترميز المصدر | ترميز الهدف | نتيجة | ملحوظة |
|---|---|---|---|---|
| أفضل ما في الأمر | الخمسة الكبار | بريطانيا العظمى | تي | أحرف مشوّهة تكاد تخلو من أي دلالة على معناها الأصلي. الحرف الأحمر ليس رمزًا صالحًا في GB 2312 . |
| 文字化けテスト | Shift-JIS | 暥帤壔偗僥僗僩 | تُعرض حروف الكانا بأحرف تحتوي على الجذر亻( بالصينية :單人旁؛ بالبينيين : dānrénpáng )، بينما تُعرض حروف الكانجي بأحرف أخرى. العديد من الأحرف البديلة نادرة الاستخدام في اللغة الصينية الحديثة. يسهل التعرف عليها نوعًا ما لوجود عدة أحرف 亻 متتالية. | |
| 디제이맥스 테크니카 | EUC-KR | أفضل الأسعار في العالم | أحرف مبسطة عشوائية لا معنى لها في معظم الحالات. ربما يكون من الأسهل التعرف عليها بسبب وجود مسافات بين كل بضعة أحرف. |
تظهر مشكلة إضافية في اللغة الصينية عندما لا توجد بعض الأحرف النادرة أو القديمة، والتي لا يزال العديد منها مستخدمًا في أسماء الأشخاص أو الأماكن، في بعض أنظمة الترميز. ومن أمثلة ذلك:
- افتقار ترميز Big5 إلى "煊" ( xuān ) باسم السياسي التايواني Wang Chien-shien ( الصينية :王建煊؛ بينيين : Wáng Jiànxuān )، "堃" ( kūn ) باسم Yu Shyi-kun ( الصينية المبسطة :游锡堃؛ الصينية التقليدية :游錫堃؛ بينيين : Yóu Xíkūn )، و"喆" ( zhé ) باسم المغني ديفيد تاو ( الصينية :陶喆; بينيين : Táo Zhé )،
- GB 2312 يفتقر إلى "镕" ( róng ) في رئيس وزراء جمهورية الصين الشعبية السابق Zhu Rongji ( الصينية :朱镕基؛ pinyin : Zhū Róngjī )، و
- عدم وجود رمز حقوق النشر "©" في GBK . [ 10 ]
لقد تعاملت الصحف مع الأحرف المفقودة بطرق مختلفة، بما في ذلك استخدام برامج تحرير الصور لتوليفها من خلال دمج حروف وأحرف أخرى؛ أو استخدام صورة للشخصيات (في حالة أسماء الأشخاص)، أو ببساطة استبدال الكلمات المتجانسة على أمل أن يتمكن القراء من استخلاص الاستنتاج الصحيح.
نص هندي
قد يحدث تأثير مماثل في الكتابات البراهمية أو الهندية في جنوب آسيا ، المستخدمة في لغات هندية آرية أو هندية مثل الهندوستانية (الهندية الأردية)، والبنغالية ، والبنجابية ، والماراثية ، وغيرها، حتى لو كان التطبيق يتعرف على مجموعة الأحرف المستخدمة بشكل صحيح. ويعود ذلك إلى أنه في العديد من الكتابات الهندية، قد لا يفهم الحاسوب الذي يفتقر إلى البرنامج المناسب قواعد دمج رموز الأحرف الفردية لتكوين رموز المقاطع بشكل صحيح، حتى لو كانت رموز الأحرف الفردية متوفرة.
أحد الأمثلة على ذلك هو شعار ويكيبيديا القديم ، الذي كان يحاول إظهار حرف مشابه لـ "wi" (المقطع الأول من كلمة "Wikipedia") على كل قطعة من قطع الأحجية. كانت قطعة الأحجية المخصصة لعرض حرف "wi" بالخط الديفاناغاري تُستخدم بدلاً من ذلك لعرض حرف "wa" متبوعًا بحرف علة "i" منفرد ، وهو ما يُعرف بسهولة بأنه تشويه برمجي ناتج عن جهاز كمبيوتر غير مُهيأ لعرض النصوص الهندية. [ 11 ] هذا هو الشعار بعد إعادة تصميمه في مايو 2010. تم إصلاح هذه الأخطاء.
تتطلب فكرة النص العادي من نظام التشغيل توفير خط لعرض رموز يونيكود. يختلف هذا الخط من نظام تشغيل لآخر في اللغة السنهالية، ويؤدي إلى ظهور رموز إملائية غير صحيحة لبعض الأحرف (المقاطع) في جميع أنظمة التشغيل. على سبيل المثال، علامة التشكيل "reph"، وهي اختصار لحرف "r"، توضع عادةً فوق الحرف العادي. مع ذلك، من الخطأ وضعها فوق بعض الأحرف مثل "ya" أو "la" في سياقات محددة. بالنسبة للكلمات أو الأسماء السنسكريتية الموروثة من اللغات الحديثة، مثل कार्य ( Kārya ) أو आर्या ( āryā) ، فمن المناسب وضعها فوق هذه الأحرف. على النقيض من ذلك، بالنسبة للأصوات المتشابهة في اللغات الحديثة الناتجة عن قواعدها الخاصة، لا يُوضع الحرف في الأعلى، مثل كلمة करणाऱ्या، IAST: karaṇāryā ، وهي جذر الكلمة الشائعة करणारा/री، IAST: karaṇārā/rī ، في اللغة الماراثية . [ 12 ] لكن هذا يحدث في معظم أنظمة التشغيل. ويبدو أن هذا خطأ في البرمجة الداخلية للخطوط. ففي نظامي التشغيل Mac OS وiOS، ينتج عن دمج حرفي اللام الداكنة (muurdhaja l) وحرف u، بالإضافة إلى شكلهما الطويل، أشكالًا خاطئة.
لم تكن بعض النصوص الهندية والمشتقة منها، ولا سيما اللاوية ، مدعومة رسميًا من قبل نظام التشغيل ويندوز إكس بي حتى إصدار نظام التشغيل فيستا . [ 13 ] ومع ذلك، فقد وفرت مواقع مختلفة خطوطًا مجانية للتنزيل.
البورميين
بسبب العقوبات الغربية [ 14 ] وتأخر دعم اللغة البورمية في أجهزة الحاسوب [ 15 ] [ 16 ]، كان جزء كبير من التعريب المبكر للغة البورمية محليًا دون تعاون دولي. وكانت الوسيلة السائدة لدعم اللغة البورمية هي خط Zawgyi ، وهو خط صُمم في الأصل ليكون متوافقًا مع معيار Unicode ، ولكنه في الواقع لم يكن متوافقًا معه إلا جزئيًا [ 16 ] . في خط Zawgyi، تم تطبيق بعض رموز الكتابة البورمية وفقًا لمعيار Unicode ، بينما لم يتم تطبيق رموز أخرى [ 17 ] . ويشير اتحاد Unicode إلى هذا النوع من الترميز باسم "ترميز الخطوط المخصص" [ 18 ] . ومع ظهور الهواتف المحمولة، استبدلت شركات تصنيع الهواتف المحمولة، مثل سامسونج وهواوي، خطوط النظام المتوافقة مع Unicode بنسخ Zawgyi [ 15 ] .
بسبب هذه الترميزات المؤقتة ، كانت الاتصالات بين مستخدمي زاوجي ويونيكود تُعرض كنصوص مشوّهة. ولتجاوز هذه المشكلة، كان منتجو المحتوى ينشرون منشوراتهم بكلتا اللغتين. [ 19 ] وقد أعلنت حكومة ميانمار الأول من أكتوبر/تشرين الأول 2019 "يوم يونيكود" للتحول الرسمي إلى يونيكود. [ 14 ] وقُدّر أن عملية الانتقال الكاملة ستستغرق عامين. [ 20 ]
اللغات الأفريقية
في بعض أنظمة الكتابة الأفريقية ، يكون النص غير المشفر غير قابل للقراءة. تشمل النصوص التي قد تُنتج حروفًا مشوهة (موجيباك) تلك الموجودة في القرن الأفريقي، مثل الكتابة الجعزية في إثيوبيا وإريتريا ، المستخدمة في كتابة الأمهرية والتغرية ولغات أخرى ، واللغة الصومالية التي تستخدم الأبجدية العثمانية . في جنوب أفريقيا ، تُستخدم أبجدية موانغويغو لكتابة لغات ملاوي ، بينما صُممت أبجدية ماندومبي لجمهورية الكونغو الديمقراطية ، إلا أنها غير مدعومة بشكل عام. تُعاني أنظمة كتابة أخرى مختلفة، موطنها غرب أفريقيا، من مشاكل مماثلة، مثل أبجدية نكو المستخدمة في لغات ماندينغ في غينيا ، ونظام فاي المقطعي المستخدم في ليبيريا .
عربي
ومن اللغات الأخرى المتأثرة اللغة العربية (انظر أدناه )، حيث يصبح النص غير قابل للقراءة تمامًا عندما لا تتطابق الترميزات.
أمثلة
| مثال عربي | عرض المتصفح | ترميز المصدر | ترميز الهدف | نتيجة |
|---|---|---|---|---|
| الإعلان العالمي لحقوق الإنسان | UTF-8 | KOI8-R | ь╖ы└ь╔ь╧ы└ь╖ы├ ь╖ы└ь╧ь╖ы└ы┘ы┴ ы└ь╜ы┌ы┬ы┌ ь╖ы└ь╔ы├ьЁь╖ы├ | |
| ويندوز-1250 | آإعٓان آعآ…ى ى ŮˆŮ ‚ انسان | |||
| ويندوز-1251 | Ш§Щ“Ш͐Ш№Щ“Ш§Щ† Ш§Щ“Ш№Ш§Щ“Щ…Щ‰ ЩШ ЩЩ €Щ‚ Ш§Щ“Ш§Щ†ШiШ§Щ† | |||
| ويندوز-1252 | اÙ"إعÙ"ان اÙ"عاÙ"Ù...Ù‰ Ù"Ø ÙÙˆÙ , اÙ"إنسان | |||
| ويندوز-1256 | ط§ظ‹ط¥ط¹ظ‹ط§ظ† ط§ظ‹ط¹ط§ظ‹ظ…ظ‰ ظ‹ط ظ‚ظˆظ ‚ ط§ظ‹ط¥ظ†ط³ط§ظ† | |||
| ISO 8859-5 | иЇй�иЅиЙй�иЇй� иЇй�иЙиЇй�й�й� й�ий�й�й� иЇй�иЅй�иГиЇй� | |||
| ISO 8859-6 | ظظىظظظظظع† ظظظظظظعع† ظظظظظعع† | |||
| CP 852 | ěž┘äěąě╣┘äěž┘ć ěž┘äě╣ěž┘ä┘ů┘ë ┘äěş┘é┘ł┘é ěž┘äěą┘ćě│ěž┘ć | |||
| CP 866 | ╪з┘Д╪е╪╣┘Д╪з┘Ж ╪з┘Д╪╣╪з┘Д┘Е┘Й ┘Д╪н┘В┘И┘В ╪з┘Д╪е┘Ж╪│╪з┘Ж | |||
| ماك عربي | ظعظ٪ظ٩عرعععظععععععععععععععععععععععععععععععععععععععععععععععععععععععععععععععععععععععععععععععععععععععع | |||
| ماك رومان | كسكرÿ•ÿπŸÑÿKŸÜ كشرÑÿÿÿÿÿŸẫ ŸÑÿ≠ŸŸàŸ كشرÿ•صــÿ≥ÿKŸÜ | |||
| ماك عربي | ماك رومان | «‰≈Ÿ‰«Ê†«‰Ÿ«‰ÂȆ‰Õ‚Ë‚†«‰≈Ê»«Ê | ||
| ويندوز-1256 | ماك رومان | «·≈⁄·«‰ «·⁄«·«Ï ·ÕfiÊfi «·≈‰»«‰» | ||
| ويندوز-1252 | الأولان العالم لصور الأنسان |
لا تحتوي الأمثلة الواردة في هذه المقالة على UTF-8 كإعداد للمتصفح، لأن UTF-8 سهل التعرف عليه، لذلك إذا كان المتصفح يدعم UTF-8، فيجب أن يتعرف عليه تلقائيًا، ولا يحاول تفسير أي شيء آخر على أنه UTF-8.
انظر أيضاً
- نقطة الترميز
- حرف الاستبدال
- الشخصية البديلة
- سطر جديد – تختلف اصطلاحات تمثيل فاصل الأسطر بين أنظمة ويندوز ويونكس. مع أن معظم البرامج تدعم كلا الاصطلاحين (وهو أمر بديهي)، إلا أن البرامج التي يجب أن تحافظ على هذا الاختلاف أو تعرضه (مثل أنظمة التحكم في الإصدارات وأدوات مقارنة البيانات ) قد تصبح أكثر صعوبة في الاستخدام إذا لم تلتزم بأحد الاصطلاحين.
- علامة ترتيب البايت – الطريقة الأمثل لتخزين الترميز مع البيانات – تُضاف هذه العلامة في بداية النص . وهي غير مرئية عمدًا للمستخدمين الذين يستخدمون برامج متوافقة، ولكنها ستُعتبر، بحسب التصميم، "أحرفًا غير مفهومة" بالنسبة للبرامج غير المتوافقة (بما في ذلك العديد من المفسرات ).
- كيانات HTML – هي ترميز للأحرف الخاصة في لغة HTML، وهي اختيارية في الغالب، ولكنها ضرورية لبعض الأحرف لتجنب تفسيرها كعلامات ترميز. يُعدّ عدم تطبيق هذا التحويل ثغرة أمنية (انظر البرمجة النصية عبر المواقع
")، ولكن تطبيقه بشكل متكرر يؤدي إلى تشويه هذه الأحرف. على سبيل المثال، تصبح علامة الاقتباس",",",", وهكذا. - أخفى بوش الحقائق
مراجع
- ↑ كينغ، ريتشي (2012). "هل سيصبح يونيكود قريبًا الشفرة العالمية؟ [ البيانات ] ". مجلة IEEE Spectrum . 49 (7): 60. doi : 10.1109/MSPEC.2012.6221090 .
- ↑ وينديشمان، ستيفان (31 مارس 2004). "curl -v linux.ars (تدويل)" . آرس تكنيكا . تم الاطلاع عليه في 5 أكتوبر 2018 .
- ↑ "إرشادات السمات الموسعة" . 17-05-2013 . تم الاطلاع عليه بتاريخ 15-02-2015 .
- ↑ "قائمة بريدية يونيكود على برنامج البريد الإلكتروني يودورا" . 13 مايو 2001. تم الاطلاع عليه في 1 نوفمبر 2014 .
- ↑ "عملية احتيال عبر الرسائل النصية" (باللغة النرويجية). ١٨ يونيو ٢٠١٤. تم الاطلاع عليه بتاريخ ١٩ يونيو ٢٠١٤ .
- ↑ ص 141، Control + Alt + Delete: قاموس لغة الإنترنت العامية ، جوناثان كيتس، غلوب بيكوت، 2007، ISBN 1-59921-039-8.
- ↑ "إحصائيات استخدام Windows-1251 للمواقع الإلكترونية" . w3techs.com .
- ↑ "إحصائيات استخدام KOI8-R للمواقع الإلكترونية" . w3techs.com .
- ↑ "الإعلان عن ترميزات الأحرف في لغة HTML" .
- ↑ "PRC GBK (XGB)" . مايكروسوفت . مؤرشف من الأصل بتاريخ 2002-10-01.خريطة تحويل بين صفحة الترميز 936 واليونيكود. يلزم تحديد GB 18030 أو GBK يدويًا في المتصفح لعرضها بشكل صحيح.
- ↑ كوهين، نعوم (25 يونيو 2007). "بعض الأخطاء عصية على التصحيح: خطأ مطبعي في شعار ويكيبيديا يُشوّه اللغة السنسكريتية" . صحيفة نيويورك تايمز . تاريخ الاسترجاع: 17 يوليو 2009 .
- ↑ "الكتابة باللغة الماراثية | من الإنجليزية إلى الماراثية | الكتابة الماراثية عبر الإنترنت" . marathi.indiatyping.com . تم الاطلاع عليه بتاريخ 2022-08-02 .
- ↑ "تم نقل المحتوى (ويندوز)" . Msdn.microsoft.com . تم الاطلاع عليه بتاريخ 2014-02-05 .
- ١ ٢ "يونيكود يدخل، زاوجي يخرج: الحداثة تلحق أخيرًا بعالم ميانمار الرقمي" . صحيفة جابان تايمز . ٢٧ سبتمبر ٢٠١٩. مؤرشف من الأصل في ٣٠ سبتمبر ٢٠١٩. تم الاطلاع عليه في ٢٤ ديسمبر ٢٠١٩.
الأول من أكتوبر هو "يوم يونيكود"، حيث ستعتمد ميانمار رسميًا النظام الجديد... ساعدت مايكروسوفت وآبل دولًا أخرى على توحيد المعايير منذ سنوات، لكن العقوبات الغربية حرمت ميانمار من ذلك.
- ١ ٢ هوتشكيس، غريفين (٢٣ مارس ٢٠١٦). " معركة الخطوط" . فرونتير ميانمار . تم الاطلاع عليه في ٢٤ ديسمبر ٢٠١٩.
مع إصدار حزمة الخدمة الثانية لنظام التشغيل ويندوز إكس بي، تم دعم النصوص المعقدة، مما مكّن ويندوز من عرض خط بورمي متوافق مع يونيكود مثل Myanmar1 (الذي صدر عام ٢٠٠٥). ... قامت خطوط ميازيدي، وBIT، ولاحقًا Zawgyi، بتضييق نطاق مشكلة العرض عن طريق إضافة نقاط ترميز إضافية مخصصة للغات العرقية في ميانمار. لا تمنع إعادة التعيين دعم اللغات العرقية في المستقبل فحسب، بل تؤدي أيضًا إلى نظام كتابة قد يكون مربكًا وغير فعال، حتى بالنسبة للمستخدمين ذوي الخبرة. ... لا يحفز هواوي وسامسونج، وهما أشهر علامتين تجاريتين للهواتف الذكية في ميانمار، سوى الاستحواذ على أكبر حصة سوقية، مما يعني أنهما تدعمان Zawgyi بشكل افتراضي.
- سين ، ثانت (7 سبتمبر 2019). "توحيد نظام الخطوط في ميانمار مع استعدادها للانتقال من خط زاوجي إلى يونيكود" . رايزينغ فويسز . تاريخ الاسترجاع: 24 ديسمبر 2019.
لم تُعمم خطوط يونيكود القياسية في ميانمار على نطاق واسع، على عكس خط زاوجي الخاص والمتوافق جزئيًا مع يونيكود. ... سيُحسّن يونيكود معالجة اللغة الطبيعية.
- ↑ "لماذا نحتاج إلى يونيكود؟" . مشروع جوجل كود: زاوجي . تم الاطلاع عليه بتاريخ 31 أكتوبر 2013 .
- ↑ "نصوص ولغات ميانمار" . الأسئلة الشائعة . اتحاد يونيكود . تم الاطلاع عليه بتاريخ 24 ديسمبر 2019 .
من الناحية الفنية، لا ينطبق ترميز "UTF-8" على ترميزات الخطوط المخصصة مثل Zawgyi.
- ↑ لاغرو، نيك؛ بروزان، ميري (26 سبتمبر 2019). "دمج التحويل التلقائي: مسار فيسبوك من زاوجي إلى يونيكود - هندسة فيسبوك" . هندسة فيسبوك . فيسبوك . تم الاطلاع عليه في 25 ديسمبر 2019.
يُصعّب هذا الأمر التواصل على المنصات الرقمية، حيث يظهر المحتوى المكتوب بنظام يونيكود مشوّهًا لمستخدمي زاوجي والعكس صحيح. ... من أجل الوصول إلى جمهورهم بشكل أفضل، غالبًا ما ينشر منتجو المحتوى في ميانمار منشورًا واحدًا بكلٍ من زاوجي ويونيكود، فضلًا عن اللغة الإنجليزية أو لغات أخرى.
- ↑ ساو يي ناندا (21 نوفمبر 2019). "مطور تطبيقات: انتقال ميانمار إلى يونيكود سيستغرق عامين" . صحيفة ميانمار تايمز . مؤرشف من الأصل في 24 ديسمبر 2019. تم الاطلاع عليه في 24 ديسمبر 2019 .
روابط خارجية
تعريف كلمة "mojibake" في قاموس ويكشنري
الوسائط المتعلقة بـ Mojibake على ويكيميديا كومنز
- ترميز الأحرف
- أخطاء الحاسوب
- هراء
