ليبور

LEPOR ( عقوبة الطول، الدقة ، عقوبة اختلاف موضع n -gram والاستدعاء ) هو مقياس تقييم الترجمة الآلية التلقائية المستقلة عن اللغة مع معلمات قابلة للتعديل وعوامل معززة.

خلفية

منذ أن اقترحت شركة IBM نظام BLEU [ 1 ] وطبقته كمقياس آلي لتقييم الترجمة الآلية [2]، تم اقتراح العديد من الطرق الأخرى لتنقيحه أو تحسينه، مثل TER و METEOR [ 3 ] وغيرها. ومع ذلك، توجد بعض المشكلات في مقاييس التقييم الآلي التقليدية . فبعض المقاييس تُحقق أداءً جيدًا على لغات معينة، بينما يكون أداؤها ضعيفًا على لغات أخرى، وهو ما يُعرف عادةً بمشكلة التحيز اللغوي. كما أن بعض المقاييس تعتمد على الكثير من خصائص اللغة أو المعلومات اللغوية، مما يُصعّب على الباحثين الآخرين تكرار التجارب. يُعدّ LEPOR مقياس تقييم آليًا يسعى إلى معالجة بعض المشكلات القائمة [ 4 ] . صُمم LEPOR بعوامل مُعززة ومعاملات قابلة للتعديل لمعالجة مشكلة التحيز اللغوي. علاوة على ذلك، في النسخة المُحسّنة من LEPOR، أي hLEPOR [ 5 يتم استخدام الخصائص اللغوية المُحسّنة المُستخرجة من قواعد بيانات الأشجار . يُعدّ مقياس nLEPOR نسخةً متطورةً أخرى من مقياس LEPOR، [ 6 ] حيث يُضيف خصائص n-gram إلى العوامل السابقة. وقد تم تطوير مقياس LEPOR حتى الآن إلى سلسلة LEPOR. [ 7 ] [ 8 ]

لقد خضعت مقاييس LEPOR للدراسة والتحليل من قبل العديد من الباحثين في مختلف المجالات، مثل الترجمة الآلية [ 9 ] ، وتوليد اللغة الطبيعية [ 10 ] ، والبحث [ 11 ] ، وغيرها. وتحظى مقاييس LEPOR باهتمام متزايد من الباحثين العلميين في مجال معالجة اللغة الطبيعية .

تصميم

صُمم نظام LEPOR [ 4 ] بعوامل تشمل عقوبة الطول المُحسّنة، والدقة ، وعقوبة ترتيب الكلمات في النماذج اللغوية (n-gram)، والاستدعاء . تضمن عقوبة الطول المُحسّنة معاقبة الترجمة الافتراضية، التي تُترجم عادةً بواسطة أنظمة الترجمة الآلية، إذا كانت أطول أو أقصر من الترجمة المرجعية. تعكس درجة الدقة مدى دقة الترجمة الافتراضية. وتعكس درجة الاستدعاء مدى التزام الترجمة الافتراضية بالترجمة المرجعية أو لغة المصدر. صُمم عامل عقوبة ترتيب الكلمات في النماذج اللغوية (n-gram) لمراعاة اختلاف ترتيب المواضع بين الترجمة الافتراضية والترجمة المرجعية. وقد أثبت العديد من الباحثين، مثل وونغ وكيت (2008)، فائدة عامل عقوبة ترتيب الكلمات. [ 12 ]

نظراً لانتقادات مقاييس مطابقة السلاسل النصية السطحية بسبب افتقارها إلى الوعي النحوي والدلالي، فإن مقياس LEPOR المُطوَّر (hLEPOR) يبحث في دمج السمات اللغوية، مثل أجزاء الكلام (POS). [ 5 ] [ 8 ] يُعرَّف جزء الكلام بأنه وظيفة معينة من الناحيتين النحوية والدلالية، فعلى سبيل المثال، إذا كانت إحدى كلمات الجملة الناتجة فعلاً بينما يُتوقع أن تكون اسماً، فسيتم خصم نقاط؛ كذلك، إذا كان جزء الكلام متطابقاً ولكن الكلمة نفسها مختلفة، مثلاً good و nice، فسيتم منح هذا المرشح نقاطاً إضافية. تُحسب النتيجة الإجمالية لـ hLEPOR بدمج نتيجة مستوى الكلمة ونتيجة مستوى جزء الكلام مع مجموعة أوزان. كما يتم استكشاف معرفة n-gram المستوحاة من نمذجة اللغة بشكل موسع في nLEPOR. [ 6 ] [ 8 ] بالإضافة إلى معرفة النماذج النحوية (n-gram) لحساب عقوبة اختلاف موضع النماذج النحوية، تُطبَّق النماذج النحوية أيضًا على دقة النماذج النحوية واستدعائها في nLEPOR، والمعامل n هو عامل قابل للتعديل. وبالإضافة إلى معرفة أجزاء الكلام في hLEPOR، تُضمَّن بنية العبارة من معلومات التحليل في متغير جديد HPPR. [ 13 ] في نمذجة تقييم HPPR، تُؤخذ مجموعة بنية العبارة، مثل العبارة الاسمية ، والعبارة الفعلية ، والعبارة الجرية، والعبارة الظرفية، في الاعتبار أثناء المطابقة من النص المرشح إلى النص المرجعي.

تنفيذ البرمجيات

تم تنفيذ مقاييس LEPOR في الأصل بلغة برمجة Perl، [ 14 ] ومؤخراً أصبح إصدار Python [ 15 ] متاحًا من قبل باحثين ومهندسين آخرين، [ 16 ] مع بيان صحفي [ 17 ] من شركة Logrus Global Language Service.

أداء

أظهرت سلسلة LEPOR أداءً متميزًا في ورشة العمل الدولية السنوية للترجمة الآلية الإحصائية التابعة للجمعية الدولية للغويات الحاسوبية ( ACL-WMT، مؤرشفة في 26 أبريل 2021 على موقع Wayback Machine ). تُعقد ورشة ACL-WMT من قِبل مجموعة الاهتمام الخاصة بالترجمة الآلية (SIGMT) التابعة للجمعية الدولية للغويات الحاسوبية (ACL). في ورشة ACL-WMT 2013، [ 18 ] ، يوجد مساران للترجمة والتقييم: من الإنجليزية إلى لغات أخرى، ومن لغات أخرى إلى الإنجليزية. تشمل اللغات "الأخرى" الإسبانية والفرنسية والألمانية والتشيكية والروسية . في اتجاه الترجمة من الإنجليزية إلى لغات أخرى، حقق مقياس nLEPOR أعلى درجة ارتباط على مستوى النظام مع الأحكام البشرية باستخدام معامل ارتباط بيرسون، وثاني أعلى درجة ارتباط على مستوى النظام مع الأحكام البشرية باستخدام معامل ارتباط رتبة سبيرمان . في اتجاه اللغة الإنجليزية، يؤدي nLEPOR أداءً متوسطًا ويحقق METEOR أعلى درجة ارتباط مع الأحكام البشرية، ويعود ذلك إلى حقيقة أن nLEPOR يستخدم فقط الميزة اللغوية الموجزة، ومعلومات أجزاء الكلام، باستثناء بيانات التدريب المقدمة رسميًا؛ ومع ذلك، فقد استخدم METEOR العديد من الموارد الخارجية الأخرى، مثل قواميس المرادفات ، وإعادة الصياغة ، والتجذير ، وما إلى ذلك .

تم وصف عمل موسع ومقدمة حول أداء LEPOR في ظل ظروف مختلفة بما في ذلك شكل سطح الكلمة البحت، وميزات أجزاء الكلام ، وميزات علامات العبارات، في أطروحة من جامعة ماكاو . [ 8 ]

يوجد تحليل إحصائي معمق لأداء مقياسي hLEPOR و nLEPOR في WMT13، والذي يُظهر أنهما كانا من أفضل المقاييس "في كلٍ من تقييم أزواج اللغات الفردية من الإسبانية إلى الإنجليزية، ومجموعة أزواج اللغات التسعة المُجمّعة"، انظر الورقة البحثية (التقييم الدقيق لمقاييس الترجمة الآلية على مستوى المقاطع) " https://www.aclweb.org/anthology/N15-1124 " غراهام وآخرون، 2015، NAACL ( https://github.com/ygraham/segment-mteval )

في عرض تقديمي لمسار مستخدمي الترجمة الآلية في قمة الترجمة الآلية 2021، أظهر باحثون من https://www.welocalize.com/ أن مقياس hLEPOR له علاقة بالأداء البشري على أزواج لغات متعددة تم اختبارها بما في ذلك الألمانية والهندية (لا يوجد نموذج لـ Prism) والإيطالية والروسية والصينية المبسطة (الصفحة 459 https://aclanthology.org/attachments/2021.mtsummit-up.29.Presentation.pdf ).

التطبيقات

تم تطبيق سلسلة مقاييس LEPOR الآلية واستخدامها من قبل العديد من الباحثين في مختلف مجالات معالجة اللغات الطبيعية . على سبيل المثال، في الترجمة الآلية القياسية والترجمة الآلية العصبية. [ 19 ] كما تم تطبيق LEPOR خارج نطاق مجتمع الترجمة الآلية، على سبيل المثال، [ 11 ] في تقييم البحث؛ [ 20 ] أشارت إلى تطبيق LEPOR في تقييم توليد الشفرة (لغة البرمجة)؛ [ 10 ] بحثت في التقييم الآلي لتوليد اللغة الطبيعية [ 21 ] باستخدام مقاييس تتضمن LEPOR، وأكدت أن المقاييس الآلية يمكن أن تساعد في تقييمات مستوى النظام؛ كما تم تطبيق LEPOR في تقييم وصف الصور. [ 22 ]

انظر أيضاً

ملحوظات

  1. بابينيني وآخرون (2002)
  2. هان (2016)
  3. بانيرجي ولافي (2005)
  4. 1 2 هان وآخرون (2012)
  5. 1 2 هان وآخرون (2013 أ)
  6. 1 2 هان وآخرون (2013ب)
  7. هان وآخرون (2014)
  8. 1 2 3 4 هان (2014)
  9. غراهام وآخرون (2015)
  10. 1 2 نوفيكوفا وآخرون (2017)
  11. 1 2 ليو وآخرون (2021)
  12. وونغ وكيت (2008)
  13. هان وآخرون (2013ج)
  14. ^ "GitHub – aaronlifenghan/Aaron-project-lepor: LEPOR: مقياس تقييم قوي للترجمة الآلية مع العوامل المعززة" . جيثب . 8 يناير 2022.
  15. ^ "HLepor: هذا هو منفذ Python للخوارزمية الأصلية بواسطة Aaron Li-Feng Han" .
  16. ^ "جيثب – lHan87/LEPOR" . جيثب . 5 مايو 2021.
  17. غلوبال، لوغروس (30 أبريل 2021). "غلوبال تُضيف تطبيق بايثون لمقياس تقييم جودة الترجمة hLEPOR على PyPi.org" . سلاتور (بيان صحفي) . تم الاطلاع عليه في 2 نوفمبر 2022 .
  18. ACL-WMT (2013)
  19. ^ مرزوق وهانسن شيرا (2019)
  20. ليغوري وآخرون (2021)
  21. سيليكيلماز وآخرون. (2020)
  22. كيو وآخرون (2020)

مراجع

  • بابينيني، ك.، روكوس، س.، وارد، ت.، وزو، و.ج. (2002). "BLEU: طريقة للتقييم الآلي للترجمة الآلية" في ACL-2002: الاجتماع السنوي الأربعون لجمعية اللغويات الحاسوبية ، الصفحات  311-318
  • هان، أ. ل. ف.، وونغ، د. ف.، وتشاو، ل. س. (2012) "ليبور: مقياس تقييم قوي للترجمة الآلية مع عوامل مُعززة" في وقائع المؤتمر الدولي الرابع والعشرين للغويات الحاسوبية (كولينغ 2012): ملصقات، ص  441-450. مومباي، الهند. ورقة بحثية منشورة إلكترونيًا . أداة مفتوحة المصدر.
  • هان، أ. ل. ف.، وونغ، د. ف.، تشاو، ل. س.، هي، ل.، لو، ي.، شينغ، ج.، وزينغ، ش. (2013أ) "نموذج مستقل عن اللغة لتقييم الترجمة الآلية مع عوامل معززة" في وقائع قمة الترجمة الآلية الرابعة عشرة (MT SUMMIT 2013)، الصفحات 215-222. نيس، فرنسا. الناشر: الرابطة الدولية للترجمة الآلية. ورقة بحثية منشورة إلكترونيًا، مؤرشفة في 16 يناير 2019 على موقع Wayback Machine. أداة مفتوحة المصدر
  • هان، أ. ل. ف.، وونغ، د. ف.، تشاو، ل. س.، لو، ي.، هي، ل.، وانغ، ي.، وتشو، ج. (2013ب) "وصف لأنظمة تقييم الترجمة الآلية القابلة للضبط في مهمة مقاييس WMT13" في وقائع ورشة العمل الثامنة حول الترجمة الآلية الإحصائية، ACL-WMT13، صوفيا، بلغاريا. رابطة اللغويات الحاسوبية. ورقة بحثية منشورة على الإنترنت ، الصفحات  414-421 .
  • هان، آرون ل. ف.؛ وونغ، ديريك ف.؛ تشاو، ليديا س.؛ هي، ليانغيه؛ لو، يي (2014). "نموذج تقدير الجودة غير الخاضع للإشراف للترجمة من الإنجليزية إلى الألمانية وتطبيقه في التقييم الخاضع للإشراف على نطاق واسع" . مجلة العالم العلمي . 2014 : 1-12 . doi : 10.1155/2014/760301 . PMC 4032676. PMID 24892086 .  
  • ACL-WMT. (2013) " مهمة مقاييس ACL-WMT13 "
  • وونغ، ب. تي إم، وكيت، سي. (2008). "اختيار الكلمات وموقع الكلمات للتقييم الآلي للترجمة الآلية" في ورشة عمل: MetricsMATR التابعة لجمعية الترجمة الآلية في الأمريكتين (AMTA) ، ورقة قصيرة، وايكيكي، الولايات المتحدة.
  • بانيرجي، إس. ولافي، أ. (2005) "METEOR: مقياس آلي لتقييم الترجمة الآلية مع تحسين الارتباط بالأحكام البشرية" في وقائع ورشة العمل حول مقاييس التقييم الداخلية والخارجية للترجمة الآلية و/أو التلخيص في الاجتماع السنوي الثالث والأربعين لجمعية اللغويات الحاسوبية (ACL-2005)، آن أربور، ميشيغان، يونيو 2005
  • هان، ليفينغ. (2014) "ليبور: مقياس مُعزز لتقييم الترجمة الآلية". رسالة ماجستير في هندسة البرمجيات. جامعة ماكاو، ماكاو.عرض تقديمي باوربوينت
  • إيفيت غراهام، وتيموثي بالدوين، ونيتيكا ماثور. (2015) التقييم الدقيق لمقاييس الترجمة الآلية على مستوى المقاطع. في مؤتمر NAACL HLT 2015، مؤتمر عام 2015 لفرع أمريكا الشمالية لجمعية اللغويات الحاسوبية: تقنيات اللغة البشرية، دنفر، كولورادو، الولايات المتحدة الأمريكية، 31 مايو - 5 يونيو 2015، الصفحات 1183-1191.
  • هان، ليفينغ (2016). "موارد وأساليب تقييم الترجمة الآلية: دراسة استقصائية". arXiv : 1605.04515 [ cs.CL ].
  • جيكاترينا نوفيكوفا، أوندري دوسيك، أماندا سيركاس كاري، وفيرينا ريزر. (2017). لماذا نحتاج إلى مقاييس تقييم جديدة لتوليد اللغة الطبيعية؟ في وقائع مؤتمر 2017 حول الأساليب التجريبية في معالجة اللغة الطبيعية، الصفحات 2241-2252، كوبنهاغن، الدنمارك. رابطة اللغويات الحاسوبية.
  • ليو، زيانغ؛ تشو، كي؛ ويلسون، ماكس ل. (2021). "التقييم الشامل لمقاييس تقييم البحث الحواري". مجلة ACM للمعاملات في نظم المعلومات . 39 (4): 1-42 . arXiv : 2104.13453 . doi : 10.1145/3445029 . S2CID 233423567 . 
  • ليغوري، بيترو؛ الحسامي، عرفان؛ كوترونيو، دومينيكو؛ ناتيلا، روبرتو؛ كوكيتش، بويان؛ شيخ، سميرة (2021). "Shellcode_IA32: مجموعة بيانات لتوليد شيفرة Shellcode تلقائيًا". وقائع ورشة العمل الأولى حول معالجة اللغة الطبيعية للبرمجة (NLP4Prog 2021) . الصفحات 58-64 . arXiv : 2104.13100 . doi : 10.18653/v1/2021.nlp4prog-1.7 . S2CID 233407761 .  
  • Çelikyılmaz, Aslı ; Clark, Elizabeth; Gao, Jianfeng (2020). "تقييم توليد النصوص: دراسة استقصائية". arXiv : 2006.14799 [ cs.CL ].
  • دي كيو، بي روثروك، تي إسلام، إيه كيه ديدييه، في زد صن... (2020) SCOTI: التعليق العلمي على صور التضاريس لتحديد أولويات البيانات والبحث المحلي عن الصور. الكواكب والفضاء. إلسيفير
  • مرزوق، شيماء؛ هانسن-شيرا، سيلفيا (2019). "تقييم أثر اللغة المُتحكَّم بها على الترجمة الآلية العصبية مقارنةً ببنى الترجمة الآلية الأخرى". الترجمة الآلية . 33 ( 1-2 ): 179-203 . doi : 10.1007/s10590-019-09233-w . S2CID 171094946 . 
  • هان، آرون لي-فينغ؛ وونغ، ديريك ف.؛ تشاو، ليديا س.؛ هي، ليانغيه؛ لي، شو؛ تشو، لينغ (2013). "رسم خرائط مجموعات علامات العبارات لقواعد بيانات الأشجار الفرنسية والإنجليزية وتطبيقها في تقييم الترجمة الآلية". معالجة اللغة والمعرفة على الويب . سلسلة محاضرات في علوم الحاسوب. المجلد  8105. الصفحات 119-131 . doi : 10.1007/978-3-642-40722-2_13 . ISBN  978-3-642-40721-5.