إطار عمل الترميز المعجمي
إدارة موارد اللغة - إطار الترميز المعجمي ( LMF ؛ ISO 24613 )، الذي أنتجته اللجنة الفنية 37 التابعة للمنظمة الدولية للمعايير (ISO/TC 37 )، هو معيار المنظمة الدولية للمعايير لمعالجة اللغة الطبيعية (NLP) ومعاجم القواميس المقروءة آليًا (MRD) . [ 1 ] ويشمل نطاقه توحيد المبادئ والأساليب المتعلقة بموارد اللغة في سياقات التواصل متعدد اللغات.
أهداف
تتمثل أهداف LMF في توفير نموذج مشترك لإنشاء واستخدام الموارد المعجمية ، وإدارة تبادل البيانات بين هذه الموارد وفيما بينها، وتمكين دمج عدد كبير من الموارد الإلكترونية الفردية لتشكيل موارد إلكترونية عالمية واسعة النطاق.
تشمل أنواع التطبيقات الفردية لـ LMF موارد معجمية أحادية اللغة، وثنائية اللغة، ومتعددة اللغات. وتُستخدم المواصفات نفسها للمعاجم الصغيرة والكبيرة، والبسيطة والمعقدة، وللتمثيلات المعجمية المكتوبة والمنطوقة. وتتراوح الأوصاف من علم الصرف ، والنحو ، والدلالات الحاسوبية ، إلى الترجمة بمساعدة الحاسوب . ولا تقتصر اللغات المشمولة على اللغات الأوروبية ، بل تشمل جميع اللغات الطبيعية . كما أن نطاق تطبيقات معالجة اللغة الطبيعية المستهدفة غير محدود. ويستطيع LMF تمثيل معظم المعاجم، بما في ذلك معاجم WordNet وEDR وPAROLE.
تاريخ
في الماضي، دُرست عملية توحيد المعاجم وطُورت من خلال سلسلة من المشاريع مثل GENELEX وEDR وEAGLES وMULTEXT وPAROLE وSIMPLE وISLE. بعد ذلك، قررت الوفود الوطنية التابعة للجنة الفنية 37 في المنظمة الدولية للمقاييس (ISO/TC 37) وضع معايير مخصصة لمعالجة اللغات الطبيعية وتمثيل المعاجم. بدأ العمل على إطار عمل المعاجم (LMF) في صيف عام 2003 باقتراح بند عمل جديد قدمه الوفد الأمريكي. وفي خريف عام 2003، قدم الوفد الفرنسي مقترحًا تقنيًا لنموذج بيانات مخصص لمعاجم معالجة اللغات الطبيعية. في أوائل عام 2004، قررت لجنة ISO/TC 37 تشكيل مشروع مشترك للمنظمة الدولية للمقاييس (ISO ) برئاسة نيكوليتا كالزولاري ( المجلس الوطني للبحوث - معهد اللغات التطبيقية، إيطاليا) وتحرير جيل فرانكوبولو (تاغماتيكا، فرنسا) ومونت جورج ( المعهد الوطني الأمريكي للمعايير ، الولايات المتحدة). تمثلت الخطوة الأولى في تطوير إطار عمل المعاجم (LMF) في تصميم إطار عمل شامل يستند إلى السمات العامة للمعاجم الموجودة، ووضع مصطلحات متسقة لوصف مكونات تلك المعاجم. تمثلت الخطوة التالية في التصميم الفعلي لنموذج شامل يُمثل جميع المعاجم بتفصيل دقيق. وقد ساهمت لجنة كبيرة تضم 60 خبيرًا بمجموعة واسعة من المتطلبات الخاصة بنموذج LMF، والتي غطت أنواعًا عديدة من معاجم معالجة اللغات الطبيعية. عمل محررو LMF بشكل وثيق مع لجنة الخبراء لتحديد أفضل الحلول والتوصل إلى توافق في الآراء بشأن تصميم LMF. وقد أُولي اهتمام خاص لبنية اللغة لتوفير آليات فعّالة لمعالجة المشكلات في العديد من اللغات المعروفة بصعوبتها. كُتبت 13 نسخة، وأُرسلت (إلى الخبراء الوطنيين المُعينين)، وخضعت للتعليق والمناقشة خلال اجتماعات فنية مختلفة لمنظمة ISO. بعد خمس سنوات من العمل، تضمنت العديد من الاجتماعات المباشرة وتبادل الرسائل الإلكترونية، توصل المحررون إلى نموذج UML متماسك. في الختام، يُمكن اعتبار LMF بمثابة خلاصة لأحدث ما توصل إليه العلم في مجال معاجم معالجة اللغات الطبيعية.
المرحلة الحالية
رقم ISO هو 24613. تم نشر مواصفات LMF رسميًا كمعيار دولي في 17 نوفمبر 2008.
بصفتها واحدة من أعضاء عائلة معايير ISO/TC 37
تُصاغ معايير اللجنة الفنية 37 التابعة للمنظمة الدولية للمعايير (ISO/TC 37) حاليًا كمواصفات عالية المستوى ، وتتناول تجزئة الكلمات (ISO 24614)، والتعليقات التوضيحية (ISO 24611 المعروفة أيضًا باسم MAF، وISO 24612 المعروفة أيضًا باسم LAF، وISO 24615 المعروفة أيضًا باسم SynAF، وISO 24617-1 المعروفة أيضًا باسم SemAF/Time)، وهياكل الميزات (ISO 24610)، وحاويات الوسائط المتعددة (ISO 24616 المعروفة أيضًا باسم MLIF)، والمعاجم (ISO 24613). وتستند هذه المعايير إلى مواصفات منخفضة المستوى مخصصة للثوابت، وهي فئات البيانات (مراجعة ISO 12620)، ورموز اللغات ( ISO 639 )، ورموز النصوص ( ISO 15924 )، ورموز البلدان ( ISO 3166 )، و Unicode ( ISO 10646 ).
يشكل التنظيم ذو المستويين مجموعة متماسكة من المعايير ذات القواعد المشتركة والبسيطة التالية:
- توفر المواصفات عالية المستوى عناصر هيكلية مزينة بالثوابت المعيارية؛
- توفر المواصفات منخفضة المستوى ثوابت موحدة كبيانات وصفية.
المعايير الأساسية
إن الثوابت اللغوية مثل /مؤنث/ أو /متعدي/ غير مُعرَّفة ضمن إطار LMF، ولكنها مُسجَّلة في سجل فئات البيانات (DCR) الذي تحتفظ به ISO/TC 37 كمورد عالمي وفقًا لمعيار ISO/IEC 11179-3:2003. [ 2 ] وتُستخدم هذه الثوابت لتزيين العناصر الهيكلية عالية المستوى.
تتوافق مواصفات LMF مع مبادئ نمذجة لغة النمذجة الموحدة (UML) كما حددتها مجموعة إدارة الكائنات (OMG). ويتم تحديد البنية باستخدام مخططات فئات UML ، بينما تُعرض الأمثلة باستخدام مخططات مثيلات (أو كائنات) UML.
تم تقديم تعريف نوع المستند XML في ملحق وثيقة LMF.
بنية النموذج
يتكون LMF من المكونات التالية:
- الحزمة الأساسية التي تمثل الهيكل الهيكلي الذي يصف التسلسل الهرمي الأساسي للمعلومات في المدخل المعجمي.
- امتدادات الحزمة الأساسية التي يتم التعبير عنها في إطار عمل يصف إعادة استخدام المكونات الأساسية بالاقتران مع المكونات الإضافية المطلوبة لمورد معجمي محدد.
تم تخصيص هذه الإضافات على وجه التحديد لعلم الصرف ، وMRD ، وبنية اللغة الطبيعية ، ودلالات اللغة الطبيعية ، ورموز اللغة الطبيعية متعددة اللغات ، وأنماط الصرف في اللغة الطبيعية ، وأنماط التعبير متعددة الكلمات ، وأنماط التعبير المقيدة .
مثال
في المثال التالي، يرتبط المدخل المعجمي بالكلمة الأساسية clergyman وصيغتين تصريفيتين هما clergyman و clergymen . تم تحديد ترميز اللغة للمورد المعجمي بأكمله. كما تم تحديد قيمة اللغة للمعجم بأكمله كما هو موضح في مخطط UML التالي .
![]()
تُحدد العناصر Lexical Resource و Global Information و Lexicon و Lexical Entry و Lemma و Word Form بنية المعجم، وهي مُحددة ضمن وثيقة LMF. في المقابل، تُمثل languageCoding و language و partOfSpeech و commonNoun و writtenForm و grammaticalNumber و singular و plural فئات بيانات مُستقاة من سجل فئات البيانات، وتُزين هذه العلامات البنية. أما القيم ISO 639-3 و clergyman و clergymen فهي سلاسل نصية عادية، بينما تُستقى القيمة eng من قائمة اللغات المُحددة في معيار ISO 639-3 .
بإضافة بعض المعلومات الإضافية مثل dtdVersion و feat ، يمكن التعبير عن نفس البيانات بواسطة جزء XML التالي :
<LexicalResource dtdVersion= "15" > <GlobalInformation> <feat att= "languageCoding" val= "ISO 639-3" /> </GlobalInformation> <Lexicon> <feat att= "language" val= "eng" /> <LexicalEntry> <feat att= "partOfSpeech" val= "commonNoun" /> <Lemma> <feat att= "writerForm" val= "رجل دين" /> </Lemma> <WordForm> <feat att= "writerForm" val= "رجال دين" /> <feat att= "grammaticalNumber" val= "singular" /> </WordForm> <WordForm> <feat att= "writerForm" val= "رجال الدين" /> <feat att= "grammaticalNumber" val= "plural" /> </WordForm> </LexicalEntry> </Lexicon> </LexicalResource>هذا المثال بسيط إلى حد ما، بينما يمكن لـ LMF تمثيل أوصاف لغوية أكثر تعقيدًا، فإن وضع علامات XML معقد بالمثل.
منشورات مختارة حول LMF
أول منشور حول مواصفات LMF بعد تصديقها من قبل ISO (أصبحت هذه الورقة (في عام 2015) تاسع أكثر الأوراق استشهادًا بها في مؤتمرات موارد اللغة وتقييمها من أوراق LREC):
- الموارد اللغوية والتقييم LREC-2006/جنوة: جيل فرانكوبولو، مونتي جورج، نيكوليتا كالزولاري، مونيكا موناتشيني، نوريا بيل، ماندي بيت، كلوديا سوريا: إطار التوصيف المعجمي (LMF) [ 3 ]
حول التمثيل الدلالي:
- الشركة المصنعة للبيانات اللغوية GLDV-2007/توبنغن: جيل فرانكوبولو، نوريا بيل، مونتي جورج نيكوليتا كالزولاري، مونيكا موناتشيني، ماندي بيت، كلوديا سوريا: إطار التوصيف المعجمي معيار ISO للمعلومات الدلالية في معاجم البرمجة اللغوية العصبية [ 4 ]
حول اللغات الأفريقية:
- Traitement Automatique des langues Naturelles، مرسيليا، 2014: محمدو خولي، محمد نديانخو ثيام، الحاج مامادو نغير: نحو إنشاء معجم لغة الولوف يعتمد على LMF (Vers la mise en place d'un lexique basé sur LMF pour la langue wolof) [بالفرنسية] [ 5 ]
حول اللغات الآسيوية:
- علم المعاجم، مجلة الجمعية الآسيوية لعلم المعاجم واللغات (ASIALEX)، سبرينغر 2014: إطار ترميز المعجم: جيل فرانكوبولو، تشو-رين هوانغ: معيار ISO للمعاجم الإلكترونية وآثاره على اللغات الآسيوية DOI 10.1007/s40607-014-0006-z
حول اللغات الأوروبية:
- COLING 2010: Verena Henrich, Erhard Hinrichs: توحيد Wordnets في معيار ISO LMF: Wordnet-LMF لـ GermaNet [ 6 ]
- EACL 2012: جوديث إيكل-كولر، إيرينا جوريفيتش: Subcat-LMF: تطوير تنسيق موحد لقابلية التشغيل البيني لإطار التصنيف الفرعي [ 7 ]
- EACL 2012: إيرينا غوريفيتش، جوديث إيكل-كولر، سيلفانا هارتمان، مايكل ماتوشيك، كريستيان إم ماير، كريستيان ويرث: UBY - مورد معجمي-دلالي موحد واسع النطاق قائم على LMF. [ 8 ]
حول اللغات السامية:
- مجلة هندسة اللغة الطبيعية ، مطبعة جامعة كامبريدج (سيصدر في ربيع 2015): عايدة خماخم، بلال قرقوري، عبد المجيد بن حمادو، جيل فرانكوبولو: نمذجة معيار ISO لقاموس عربي كبير.
- وقائع المؤتمر العالمي السابع لشبكة الكلمات 2014: نادية ب.م. كرماني، حسن سوسو، عادل م. عليمي: بناء شبكة كلمات موحدة في إطار ISO LMF للغة aeb. [ 9 ]
- وقائع ورشة العمل: HLT & NLP في العالم العربي، LREC 2008: نور الدين لوكيل، قيس حدار، عبد المجيد بن حمادو: نحو معجم نحوي للأفعال العربية. [ 10 ]
- Traitement Automatique des Langues Naturelles, Toulouse (بالفرنسية) 2007: خيماخم أ، قرجوري ب، عبد الواحد أ، فرانكوبولو ج: تعديل نماذج انثناء الأفعال العربية حسب المعيار LMF-ISO 24613. [ 11 ]
حول الأسماء العلمية:
- موارد اللغة وتقييمها LREC-2008/مراكش: دينيس موريل: بروليكس بيس. قاعدة بيانات معجمية علائقية متعددة اللغات للأسماء العلمية. [ 12 ] هذا المورد متاح على موقع أورتولانغ الإلكتروني. [ 13 ]
كتاب مخصص
صدر كتاب عام 2013 بعنوان " إطار عمل ترميز المعجم LMF " [ 14 ] ، وهو مخصص بالكامل لهذا الإطار. يتناول الفصل الأول تاريخ نماذج المعجم، بينما يقدم الفصل الثاني عرضًا رسميًا لنموذج البيانات، ويتناول الفصل الثالث العلاقة مع فئات بيانات ISO-DCR. أما الفصول الأربعة عشر المتبقية، فتتناول معجمًا أو نظامًا، سواء في المجال المدني أو العسكري، أو في مختبرات البحث العلمي، أو في التطبيقات الصناعية. ومن هذه الأنظمة: Wordnet-LMF، وProlmf، وDUELME، و UBY-LMF ، وLG-LMF، وRELISH، وGlobalAtlas (أو Global Atlas)، وWordscape.
الاتصالات العلمية ذات الصلة
- موارد اللغة وتقييمها LREC-2006/جنوة: أهمية المعايير للبنى التحتية البحثية [ 2 ]
انظر أيضاً
- علم المعاجم الحاسوبي
- الدلالات المعجمية
- علم الصرف (علم اللغة) لشرح المفاهيم المتعلقة بالنماذج والصرف النحوي
- الترجمة الآلية لعرض الأنواع المختلفة من التدوينات متعددة اللغات (انظر قسم المناهج )
- نمط مورفولوجي للفرق بين نموذج ونمط نموذج
- WordNet لعرض أشهر معجم دلالي للغة الإنجليزية
- نظام تبادل المصطلحات العالمي (UTX) هو صيغة بديلة موجهة للمستخدم للقواميس القابلة للقراءة آلياً.
- لغة الشبكات العالمية
- UBY-LMF لتطبيق LMF
- OntoLex-Lemon هو نموذج قائم على LMF لنشر القواميس كرسوم بيانية معرفية ، بتنسيق RDF و/أو كبيانات لغوية مفتوحة مرتبطة.
مراجع
- ↑ "ISO 24613-1:2024 – إدارة موارد اللغة – إطار الترميز المعجمي (LMF) – الجزء 1: النموذج الأساسي" . ISO . تم الاطلاع عليه بتاريخ 31 يناير 2024 .
- 1 2 "أهمية المعايير للبنى التحتية البحثية" (ملف PDF) . Hal.inria.fr . تاريخ الاسترجاع: 24 يناير 2016 .
- ↑ "إطار عمل الترميز المعجمي (LMF)" (ملف PDF) . Hal.inria.fr . تم الاطلاع عليه بتاريخ 24-01-2016 .
- ↑ "إطار عمل الترميز المعجمي (LMF) لموارد معالجة اللغة الطبيعية متعددة اللغات" (ملف PDF) . Hal.inria.fr . تاريخ الاسترجاع: 24 يناير 2016 .
- ↑ "Vers la mise en place d'un lexique basé sur LMF pour la langue Wolof" (PDF) . أكلويب.org . تم الاسترجاع 2016/01/24 .
- ↑ "توحيد معايير Wordnets في معيار ISO LMF: Wordnet-LMF لـ GermaNet" (ملف PDF) . Aclweb.org . تاريخ الاسترجاع: 24 يناير 2016 .
- ↑ "Subcat-LMF: تطوير صيغة موحدة لتوافق إطار التصنيف الفرعي" (ملف PDF) . Aclweb.org : 550-560 . أبريل 2012. تاريخ الاسترجاع : 24 يناير 2016 .
- ↑ "UBY - مورد معجمي-دلالي موحد واسع النطاق قائم على LMF" (ملف PDF) . Aclweb.org . تاريخ الاسترجاع: 24 يناير 2016 .
- ↑ "بناء شبكة كلمات موحدة في إطار ISO LMF للغة aeb" (ملف PDF) . Aclweb.org . تاريخ الاسترجاع: 24 يناير 2016 .
- ↑ "وقائع مؤتمر LREC 2008" . Lrec-conf.org . تم الاطلاع عليه بتاريخ 24 يناير 2016 .
- ↑ "نموذج نماذج انثناء الأفعال العربية selon la norme LMF - ISO 24613" (PDF) . أكلويب.org . مؤرشف من الأصل (PDF) بتاريخ 26-09-2015 . تم الاسترجاع 2016/01/24 .
- ↑ "Prolexbase. قاعدة بيانات معجمية علائقية متعددة اللغات للأسماء العلمية" (ملف PDF) . تم الاطلاع عليه بتاريخ 7 ديسمبر 2024 .
- ↑ "برولكس" . تم الاطلاع عليه بتاريخ 2024-12-07 .
- ↑ جيل فرانكوبولو (محرر) إطار عمل الترميز المعجمي LMF، ISTE / Wiley 2013 ( ISBN 978-1-84821-430-9)
روابط خارجية
- اللغويات الحاسوبية
- التعرف على الكلام
- معالجة اللغة الطبيعية
- معايير ISO
