محاذاة الكلمات في النص الثنائي

تحديد الكلمات المتطابقة في نصين يحدد الكلمات المتطابقة في نصين.

محاذاة الكلمات في النصوص الثنائية ، أو ببساطة محاذاة الكلمات، هي مهمة معالجة اللغة الطبيعية التي تهدف إلى تحديد علاقات الترجمة بين الكلمات (أو في حالات نادرة، وحدات الكلمات المتعددة) في نص ثنائي ، مما ينتج عنه رسم بياني ثنائي الأجزاء بين جانبي النص الثنائي، مع وجود قوس بين كلمتين إذا وفقط إذا كانتا ترجمتين لبعضهما البعض. عادةً ما تتم محاذاة الكلمات بعد أن تحدد محاذاة الجمل أزواج الجمل التي تُعد ترجمات لبعضها البعض.

يُعدّ محاذاة الكلمات في النصوص الثنائية مهمةً داعمةً أساسيةً لمعظم أساليب الترجمة الآلية الإحصائية . تُقدّر معلمات نماذج الترجمة الآلية الإحصائية عادةً من خلال ملاحظة النصوص الثنائية المحاذية للكلمات، [ 1 ] وبالمقابل، تتم محاذاة الكلمات تلقائيًا عادةً باختيار المحاذاة التي تُناسب نموذج الترجمة الآلية الإحصائية على أفضل وجه. ويؤدي تطبيق هاتين الفكرتين بشكل دائري إلى مثالٍ على خوارزمية التوقع والتعظيم . [ 2 ]

يُعدّ هذا النهج في التدريب مثالًا على التعلّم غير الموجّه ، حيث لا يُزوّد ​​النظام بأمثلةٍ لنوع المخرجات المطلوبة، بل يسعى إلى إيجاد قيمٍ للنموذج غير المرصود والمحاذاة التي تُفسّر النص الثنائي المرصود على أفضل وجه. وقد بدأت الدراسات الحديثة باستكشاف أساليب التعلّم الموجّه التي تعتمد على تزويد النظام بعددٍ (صغيرٍ عادةً) من الجمل المُحاذية يدويًا. [ 3 ] إضافةً إلى فائدة المعلومات الإضافية التي يُوفّرها الإشراف، تتميّز هذه النماذج عادةً بقدرتها على الاستفادة بسهولةٍ أكبر من دمج العديد من خصائص البيانات، مثل السياق، والبنية النحوية ، وأجزاء الكلام ، أو معلومات معجم الترجمة ، والتي يصعب دمجها في النماذج الإحصائية التوليدية المُستخدمة تقليديًا.

إلى جانب تدريب أنظمة الترجمة الآلية، تشمل التطبيقات الأخرى لمحاذاة الكلمات استقراء معجم الترجمة ، واكتشاف معاني الكلمات ، وإزالة الغموض عن معاني الكلمات ، والإسقاط عبر اللغات للمعلومات اللغوية.

تمرين

نماذج IBM

تُستخدم نماذج IBM [ 4 ] في الترجمة الآلية الإحصائية لتدريب نموذج ترجمة ونموذج محاذاة. وهي مثال على خوارزمية التوقع والتعظيم : في خطوة التوقع، تُحسب احتمالات الترجمة داخل كل جملة، وفي خطوة التعظيم، تُجمع هذه الاحتمالات لتكوين احتمالات الترجمة الإجمالية. الميزات:

  • نموذج IBM 1: احتمالات المحاذاة المعجمية
  • نموذج IBM 2: المواضع المطلقة
  • جهاز IBM موديل 3: الخصوبة (يدعم عمليات الإدخال)
  • نموذج IBM 4: المواضع النسبية
  • طراز IBM 5: يعالج أوجه القصور (يضمن عدم إمكانية محاذاة كلمتين في نفس الموضع)

همم

قام فوغل وآخرون [ 5 ] بتطوير منهجية تعتمد على احتمالات الترجمة المعجمية والمحاذاة النسبية من خلال ربط المشكلة بنموذج ماركوف المخفي . تمثل الحالات والملاحظات الكلمات المصدر والهدف على التوالي. تمثل احتمالات الانتقال احتمالات المحاذاة. في التدريب، يمكن الحصول على احتمالات الترجمة والمحاذاة منγت(أنا){\displaystyle \gamma _{t}(i)}وξت(أنا،ج){\displaystyle \xi _{t}(i,j)}في خوارزمية التقديم والتأخير .

برمجة

  • GIZA++ (برنامج مجاني بموجب رخصة GPL)
    • مجموعة أدوات المحاذاة الأكثر استخدامًا، والتي تطبق نماذج IBM الشهيرة مع مجموعة متنوعة من التحسينات.
  • برنامج Berkeley Word Aligner (برنامج مجاني بموجب رخصة GPL)
    • برنامج آخر شائع الاستخدام لمحاذاة الأسنان يعتمد على المحاذاة بالاتفاق، ونماذج تمييزية للمحاذاة.
  • نايل (برنامج مجاني بموجب رخصة جنو العمومية)
    • أداة محاذاة كلمات خاضعة للإشراف قادرة على استخدام المعلومات النحوية في كل من اللغة المصدر واللغة الهدف
  • برنامج pialign (برنامج مجاني بموجب رخصة Common Public License)
    • أداة محاذاة تقوم بمحاذاة الكلمات والعبارات باستخدام التعلم البايزي وقواعد التحويل العكسي.
  • أدوات محاذاة ناتورا (NATools، برنامج مجاني بموجب رخصة جنو العمومية)
  • برنامج UNL aligner (برنامج مجاني بموجب ترخيص Creative Commons Attribution 3.0 Unported License)
  • برنامج رسم الخرائط الهندسية والمحاذاة (GMA) (برنامج مجاني بموجب رخصة جنو العمومية)
  • HunAlign (برنامج مجاني بموجب ترخيص LGPL-2.1)
  • برنامج Anymalign (برنامج مجاني بموجب رخصة GPL)

مراجع

  1. PF Brown et al. 1993. The Mathematics of Statistical Machine Translation: Parameter Estimation Archived April 24, 2009, at the Wayback Machine . Computational Linguistics, 19(2):263–311.
  2. أوش، إف جيه وتيلمان، سي وني، إتش وآخرون، 1999، نماذج محاذاة محسّنة للترجمة الآلية الإحصائية ، وقائع المؤتمر المشترك لجمعية SIGDAT حول الأساليب التجريبية في معالجة اللغات الطبيعية والمجموعات اللغوية الضخمة جدًا
  3. مؤتمر ACL 2005: بناء واستخدام النصوص المتوازية للغات ذات الموارد الشحيحة. مؤرشف في 9 مايو 2009 على موقع Wayback Machine.
  4. فيليب كوهن (2009). الترجمة الآلية الإحصائية . مطبعة جامعة كامبريدج. ص  86 وما بعدها. ISBN 978-0521874151تم الاطلاع عليه بتاريخ 21 أكتوبر 2015 .
  5. إس. فوغل، إتش. ناي، وسي. تيلمان. 1996. محاذاة الكلمات القائمة على نموذج ماركوف المخفي في الترجمة الإحصائية . مؤرشف بتاريخ 2018-03-02 في أرشيف الإنترنت . في مؤتمر COLING '96: المؤتمر الدولي السادس عشر للغويات الحاسوبية، الصفحات 836-841، كوبنهاغن، الدنمارك.