تحديد اللغة

في معالجة اللغة الطبيعية ، يعد تحديد اللغة أو تخمين اللغة مشكلة تحديد اللغة الطبيعية التي ينتمي إليها محتوى معين. وتعتبر الأساليب الحسابية لهذه المشكلة حالة خاصة من تصنيف النصوص ، ويتم حلها باستخدام أساليب إحصائية متنوعة .

ملخص

النهج المنطقي

يتمثل أحد الأساليب الحدسية الشائعة غير الإحصائية (وإن كانت غير مؤكدة إلى حد كبير) في البحث عن تركيبات حروف مشتركة، أو علامات تشكيل أو ترقيم مميزة. [ 1 ] [ 2 ]

النهج الإحصائي

توجد عدة مناهج إحصائية لتحديد اللغة.

اعتمدت إحدى الطرق الإحصائية القديمة التي وضعها غريفنستيت [ 3 ] على تكرار الجمل القصيرة (n-grams)، والتي غالبًا ما تكون مورفيمات وظيفية . على سبيل المثال، يُعدّ المقطع "ing" أكثر شيوعًا في الإنجليزية منه في الفرنسية، بينما يُعدّ المقطع "que" أكثر شيوعًا في الفرنسية. عند العثور على صفحة جديدة على الإنترنت، يتم حساب عدد مرات ظهور كل مقطع قصير من هذه المقاطع، ثم اختيار اللغة التي يتطابق جدول تكرارها معها بشكل أكبر.

تتمثل إحدى التقنيات في مقارنة قابلية ضغط النص بقابلية ضغط النصوص في مجموعة من اللغات المعروفة. يُعرف هذا النهج بمقياس المسافة القائم على المعلومات المتبادلة. ويمكن استخدام التقنية نفسها لبناء أشجار عائلية للغات تجريبيًا، بحيث تتطابق هذه الأشجار بشكل كبير مع الأشجار المبنية باستخدام الأساليب التاريخية. [ 4 ] يُعد مقياس المسافة القائم على المعلومات المتبادلة مكافئًا في جوهره للأساليب التقليدية القائمة على النماذج، ولا يُعتبر عمومًا جديدًا أو أفضل من التقنيات الأبسط.

تتمثل إحدى التقنيات الأخرى، كما وصفها كافنار وترينكل (1994) ودونينغ (1994)، في إنشاء نموذج لغوي من نوع n-gram انطلاقًا من "نص تدريبي" لكل لغة. يمكن أن تستند هذه النماذج إلى الأحرف (كافنار وترينكل) أو البايتات المشفرة (دونينغ)؛ وفي الحالة الأخيرة، يتم دمج تحديد اللغة والكشف عن ترميز الأحرف . بعد ذلك، لأي نص يحتاج إلى تحديد هويته، يتم إنشاء نموذج مشابه، ثم تتم مقارنة هذا النموذج بكل نموذج لغوي مخزن. اللغة الأكثر احتمالًا هي تلك التي يكون نموذجها الأكثر تشابهًا مع نموذج النص المراد تحديد هويته. قد يمثل هذا النهج مشكلة عندما يكون النص المدخل بلغة لا يوجد لها نموذج. في هذه الحالة، قد تُرجع الطريقة لغة أخرى "أكثر تشابهًا" كنتيجة. كما يمثل النص المدخل المكون من عدة لغات مشكلة لأي نهج، كما هو شائع على الإنترنت.

اعتبارًا من عام 2025إحدى الطرق الأساسية الشائعة الاستخدام هي استخدام مكتبة fastText ، والتي تتمتع بدقة تصنيف مماثلة لتقنيات التعلم العميق، ولكنها أسرع بكثير. [ 5 ]

تحديد اللغات المتشابهة

تُعدّ صعوبة التمييز بين اللغات المتقاربة إحدى أكبر العقبات التي تواجه أنظمة تحديد اللغات. فاللغات المتشابهة، كاللغة البلغارية والمقدونية أو الإندونيسية والماليزية، تُظهر تداخلاً معجمياً وبنيوياً كبيراً ، مما يجعل التمييز بينها أمراً بالغ الصعوبة بالنسبة لهذه الأنظمة.

في عام ٢٠١٤، نُظِّمت مهمة DSL المشتركة [ ٦ والتي وفرت مجموعة بيانات (تان وآخرون، ٢٠١٤) تضم ١٣ لغة مختلفة (وأنواعها) ضمن ست مجموعات لغوية: المجموعة أ (البوسنية، الكرواتية، الصربية)، المجموعة ب (الإندونيسية، الماليزية)، المجموعة ج (التشيكية، السلوفاكية)، المجموعة د (البرتغالية البرازيلية، البرتغالية الأوروبية)، المجموعة هـ (الإسبانية الإسبانية، الإسبانية الأرجنتينية)، المجموعة و (الإنجليزية الأمريكية، الإنجليزية البريطانية). حقق أفضل نظام أداءً بنسبة تزيد عن ٩٥٪ من النتائج (غوت وآخرون، ٢٠١٤). ويمكن الاطلاع على نتائج مهمة DSL المشتركة في زامبيري وآخرون، ٢٠١٤.

برمجة

انظر أيضاً

مراجع

  • بينيديتو، د.، إي. كاليوتي، و ف. لوريتو. أشجار اللغة والربط . رسائل المراجعة الفيزيائية ، 88:4 (2002)، نظرية التعقيد .
  • كافنار، ويليام ب. وجون م. ترينكل. "تصنيف النصوص القائم على N-Gram". وقائع SDAIR-94، الندوة السنوية الثالثة حول تحليل الوثائق واسترجاع المعلومات (1994).
  • سيليبراسي، رودي وبول إم بي فيتاني. " التجميع عن طريق الضغط ". معاملات IEEE في نظرية المعلومات 51(4)، أبريل 2005، 1523-1545.
  • دانينغ، تي. (1994) "التحديد الإحصائي للغة". التقرير الفني MCCS 94-273، جامعة ولاية نيو مكسيكو، 1994.
  • جودمان، جوشوا. (2002) تعليق موسع على "أشجار اللغة والضغط" . أبحاث مايكروسوفت، 21 فبراير 2002. (هذا نقد لضغط البيانات لصالح طريقة بايز البسيطة).
  • غوت، سي.؛ ليجيه، إس.؛ كاربوات، إم. (2014) نظام NRC للتمييز بين اللغات المتشابهة . وقائع ورشة عمل كولينج 2014 بعنوان "تطبيق أدوات معالجة اللغة الطبيعية على اللغات والأنواع واللهجات المتشابهة".
  • غريفنستيت، غريغوري. (1995) مقارنة نظامين لتحديد اللغة. وقائع المؤتمر الدولي الثالث حول التحليل الإحصائي للبيانات النصية (JADT 1995).
  • بوتسما، أرجين. (2001) تطبيق تقنيات مونت كارلو على تحديد اللغة. سمارت هيفن، أمستردام. عُرض في مؤتمر CLIN 2001. مؤرشف بتاريخ 7 يناير 2015 في أرشيف الإنترنت .
  • تان، ل.؛ زامبيري، م.؛ ليوبيسيتش، ن.؛ تيدمان، ج. (2014). دمج مصادر البيانات القابلة للمقارنة لتمييز اللغات المتشابهة: مجموعة مدونات لغة المجال المحدد . وقائع ورشة العمل السابعة حول بناء واستخدام المدونات القابلة للمقارنة (BUCC). ريكيافيك، أيسلندا. ص  6-10
  • مجلة الإيكونوميست. (2002) " عناصر الأسلوب: تحليل البيانات المضغوطة يؤدي إلى نتائج مبهرة في علم اللغة "
  • راديم ريهوريك وميلان كولكوس. (2009) " تحديد اللغة على الويب: توسيع طريقة القاموس " اللغويات الحاسوبية ومعالجة النصوص الذكية .
  • زامبيري، م.؛ تان، ل.؛ ليوبيسيتش، ن.؛ تيدمان، ج. (2014) تقرير عن مهمة DSL المشتركة لعام 2014. وقائع ورشة العمل الأولى حول تطبيق أدوات معالجة اللغة الطبيعية على اللغات والأنواع واللهجات المتشابهة (VarDial). دبلن، أيرلندا. ص  58-67.

مراجع

  1. ^ ستوك، وولفغانغ جي. ستوك ميشتيلد (2013/07/31). دليل علم المعلومات . والتر دي جرويتر. ص 180 – 181. ISBN  978-3-11-023500-5.
  2. هاجيوارا، ماساتو (14 ديسمبر 2021). معالجة اللغة الطبيعية في العالم الحقيقي: تطبيقات عملية مع التعلم العميق . سايمون وشوستر. الصفحات 105-106 . ISBN  978-1-61729-642-0.
  3. غريفنستيت، غريغوري (ديسمبر 1995). "مقارنة نظامين لتحديد اللغة" (ملف PDF) . وقائع المؤتمر الدولي الثالث حول التحليل الإحصائي للبيانات النصية (JADT'95) . روما. الصفحات 263-268 . 
  4. بينيديتو، داريو؛ كاليوتي، إيمانويل؛ لوريتو، فيتوريو (يناير 2002). "أشجار اللغة والربط" . رسائل المراجعة الفيزيائية . 88 (4) 048702. arXiv : cond-mat/0108530 . Bibcode : 2002PhRvL..88d8702B . doi : 10.1103/PhysRevLett.88.048702 . ISSN 0031-9007 . PMID 11801178 .  
  5. جولين، أرماند؛ غريف، إدوارد؛ بوجانوفسكي، بيوتر؛ ميكولوف، توماس (أبريل 2017). لاباتا، ميريلا؛ بلونسوم، فيل؛ كولر، ألكسندر (محررون). "مجموعة من الحيل لتصنيف النصوص بكفاءة" . وقائع المؤتمر الخامس عشر للفرع الأوروبي لرابطة اللغويات الحاسوبية: المجلد 2، أوراق بحثية قصيرة . فالنسيا، إسبانيا: رابطة اللغويات الحاسوبية: 427-431 .
  6. "ورشة عمل VarDial @ COLING 2014" .