قاموس مورفولوجي

في مجالي اللغويات الحاسوبية واللغويات التطبيقية ، يُعدّ القاموس الصرفي موردًا لغويًا يحتوي على علاقات بين الشكل الظاهري والشكل المعجمي للكلمات. الأشكال الظاهرية للكلمات هي تلك الموجودة في نصوص اللغة الطبيعية. أما الشكل المعجمي المقابل للشكل الظاهري فهو الجذر متبوعًا بمعلومات نحوية (مثل نوع الكلمة ، والجنس ، والعدد ). في اللغة الإنجليزية ، تُعدّ الكلمات give و gives و giving و gave و given أشكالًا ظاهرية للفعل give . أما الشكل المعجمي فهو الفعل "give". يوجد نوعان من القواميس الصرفية: القواميس المُحاذية للمورفيمات والقواميس غير المُحاذية للصيغة الكاملة.

أمثلة بارزة وصيغ رسمية

الأشكال المورفولوجية العالمية

استلهاماً من نجاح التبعيات العالمية في التوصيف اللغوي المقارن للتبعيات النحوية، ظهرت جهود مماثلة في مجال الصرف، مثل UniMorph [ 1 ] وUDer [ 2 ] . وتتميز هذه الصيغ بتنسيقات جدولية بسيطة ( مفصولة بعلامات جدولة ) مع شكل واحد في كل صف، واشتقاقه (UDer)، ومعلومات تصريفه (UniMorph) على التوالي.

آلين آليند V.PTCP;PRS

آلين آلين V;IND;PRS;1;PL

آلين آلين V;IND;PRS;3;PL

آلين آلين الخامس؛ فنسن

(UniMorph، ألماني. الأعمدة هي: LEMMA، FORM، FEATURES)

في UDer، يتم ترميز المعلومات الإضافية (جزء الكلام) داخل الأعمدة:

abändern_V Abänderung_Nf dVN07>

Abarbeiten_Nn abarbeiten_V dNV09>

abartig_A Abartigkeit_Nf dAN03>

Abart_Nf abartig_A dNA05>

abbaggern_V Abbaggern_Nn dVN09>

(UDer، German DErivBase 0.5. الأعمدة هي BASE، DERIVED، RULE)

حتى وقت كتابة هذا التقرير (2021)، جميع هذه القواميس عبارة عن قواميس صرفية غير مُحاذية (انظر أدناه). يُعدّ تنسيقها البسيط مناسبًا بشكل خاص لتطبيق تقنيات التعلّم الآلي، وقد خضع قاموس UniMorph على وجه الخصوص للعديد من المهام المشتركة.

محولات الحالة المحدودة

تُعدّ مُحوّلات الحالة المحدودة (FSTs) تقنية شائعة لمعالجة الصرف، وخاصةً الصرف الاشتقاقي. في مُحلِّلات الصرف القائمة على القواعد، يُصاغ كلٌّ من المعجم والقواعد عادةً كآلات حالة محدودة، ثم يُدمجان. ولذلك، فهي تتطلب قواميس صرفية ذات تعليمات معالجة مُحدَّدة (والتي غالبًا ما يكون لها تفسير لغوي، ولكنها تُعامل تقنيًا كرموز نصية عشوائية). [ 3 ] تسمح حزم FST الشائعة، مثل SFST [ 4 ] (المتوفرة من حزمة fst في دبيان وأوبونتو)، بتحديد تنسيقات ملفات خاصة بالتطبيقات للمعاجم الصرفية، والتي تُجمِّع أجزاءً مختلفة من المعلومات الصرفية مع كل مورفيم على حدة. وبالتالي، تُعدّ هذه قواميس صرفية مُحاذية، ولكنها غنية جدًا (وخاصة) في بنيتها.

بيانات نموذجية من SMOR [ 5 ] (قواعد اللغة الألمانية SFST):

<Base_Stems>آخن<NN><base><nativ><Name-Neut_s>

<Base_Stems>آل<NN><base><nativ><NMasc_es_e>

<Base_Stems>Aarau<NN><base><nativ><Name-Neut_s>

<Suff_Stems><suffderiv><gebunden><kompos><NN>nom<>:e<>:n<NN><SUFF><kompos><frei>

<Suff_Stems><suffderiv><gebunden><kompos><NN>nom<NN><SUFF><base><frei><NMasc_en_en>

<Suff_Stems><suffderiv><gebunden><kompos><NN>اسم<NN><SUFF><deriv><frei>

محررات النصوص المترجمة والمُعلّقة

يُعدّ النص المُعلّق بين السطور (IGT) أسلوبًا شائعًا في توثيق اللغات ، والتصنيف اللغوي، وفروع أخرى من اللغويات وفقه اللغة. ورغم إمكانية إنشاء IGT دون الحاجة إلى برامج متخصصة (باستخدام محرر نصوص تقليدي فقط)، فقد طُوّرت برامج متخصصة، ومن أبرزها Toolbox [ 6 وFieldWorks Language Explorer (FLEx) [ 7 ] ، وبدائل مفتوحة المصدر مثل Xigt [ 8 ] . يدعم كل من Toolbox وFLEx التعليق شبه الآلي باستخدام قاموس صرفي داخلي. فعند مصادفة مقطع صرفي مُعلّق عليه في القاموس، يُطبّق هذا التعليق. وعند إضافة تعليق جديد إلى مقطع صرفي، يُخزّن التعليق في القاموس. يوفر كل من FLEx و Toolbox وظائف تحرير مختلفة لشرح النصوص وتحرير القواميس، بحيث يمكن إضافة معلومات إضافية تتجاوز تلك الموجودة في التعليقات التوضيحية، ولكن في جوهرها، توفر تنسيقاتها قواميس صرفية متوافقة.

يعتمد كل من FLEx وXigt على تنسيقات XML، بينما يستخدم Toolbox تنسيق نص عادي مع "علامات" خاصة. لا يتوافق FLEx وToolbox بشكل مباشر، ولكن يوجد محول شبه آلي من Toolbox إلى FLEx. يأتي Xigt مزودًا بأدوات استيراد لـ FLEx وToolbox، ولكنه أقل استخدامًا من FLEx وToolbox. تنسيقات FLEx وToolbox غير مصممة للاستخدام البشري، كما أنها لا تحظى بدعم كافٍ من أي برامج معالجة أخرى غير أدواتها الأصلية.

OntoLex-Morph: معيار مجتمعي للقواميس الصرفية

OntoLex هو معيار مجتمعي للقواميس المقروءة آليًا على الويب. في عام 2019، تم اقتراح وحدة OntoLex-Morph لتسهيل نمذجة بيانات الصرف في علم المعاجم ، بالإضافة إلى توفير نموذج بيانات للقواميس الصرفية لمعالجة اللغة الطبيعية . [ 9 ] يدعم OntoLex-Morph القواميس الصرفية المتوافقة وغير المتوافقة. يتمثل أحد الأهداف الرئيسية في تحقيق التوافق بين قواميس IGT، ومعاجم FST، والقواميس الصرفية المستخدمة في التعلم الآلي.

أنواع وبنية القواميس الصرفية

القواميس الصرفية المتوافقة

في القاموس الصرفي المتوافق، تتم محاذاة التطابق بين الشكل السطحي والشكل المعجمي للكلمة على مستوى الأحرف، على سبيل المثال:

(h,h) (o,o) (u,u) (s,s) (e,e) (s, n ), (θ, pl )

حيث θ هو الرمز الفارغ و n تعني "اسم"، و pl تعني "جمع".

في المثال، يُمثل الجانب الأيسر الشكل السطحي (المدخل)، بينما يُمثل الجانب الأيمن الشكل المعجمي (المخرج). يُستخدم هذا الترتيب في التحليل الصرفي حيث يُستخلص الشكل المعجمي من الشكل السطحي. أما في التوليد الصرفي، فيُعكس هذا الترتيب.

بصورة رسمية، إذا كانت Σ هي أبجدية رموز الإدخال، وΓ{\displaystyle \Gamma }هي أبجدية رموز الإخراج، والقاموس المورفولوجي المتراصف هو مجموعة فرعيةأ2(L*){\displaystyle A\subset 2^{(L^{*})}}، أين:

L=((Σθ)×Γ)(Σ×(Γθ)){\displaystyle L=((\Sigma \cup {\theta })\times \Gamma )\cup (\Sigma \times (\Gamma \cup {\theta }))}

هي أبجدية جميع المحاذاة الممكنة بما في ذلك الرمز الفارغ. أي أن القاموس المورفولوجي المحاذي هو مجموعة من السلاسل فيL*{\displaystyle L^{*}}.

القواميس الصرفية غير المتوافقة (قواميس الأشكال الكاملة)

القاموس المورفولوجي غير المتوافق (أو قاموس الأشكال الكاملة) هو ببساطة مجموعةيو2(Γ*×Σ*){\displaystyle U\subset 2^{(\Gamma ^{*}\times \Sigma ^{*})}}من أزواج من سلاسل الإدخال والإخراج. يمثل قاموس الصرف غير المتوافق المثال السابق على النحو التالي:

(منازل، منزل اسم جمع )

من الممكن تحويل قاموس غير محاذٍ إلى قاموس محاذٍ. فإلى جانب المحاذاة البسيطة إلى اليسار أو اليمين، توجد أيضاً محاذاة ذات دوافع لغوية تربط الأحرف بالمورفيمات المقابلة لها.

الغموض المعجمي

في كثير من الأحيان، توجد أكثر من صيغة معجمية مرتبطة بالصيغة الظاهرية للكلمة. على سبيل المثال، قد تكون كلمة "house" اسمًا في صيغة المفرد، /haʊs/ ، أو قد تكون فعلًا في صيغة المضارع، /haʊz/ . ونتيجةً لذلك، من الضروري وجود دالة تربط سلاسل الإدخال بسلاسل الإخراج المقابلة لها.

إذا قمنا بتعريف المجموعةهـΣ*{\displaystyle E\subset \Sigma ^{*}}من الكلمات المدخلة بحيثهـ=w:(w،w)يو{\displaystyle E={w:(w,w')\in U}}، ستكون دالة المطابقة هيτ:هـ2Γ*{\displaystyle \tau :E\rightarrow 2^{\Gamma ^{*}}}يُعرَّف بأنهτ(w)=w:(w،w)يو{\displaystyle \tau (w)=w':(w,w')\in U}.

مراجع

  1. كيروف، كريستو، ريان كوتيريل، جون سيلاك-غلاسمان، جيرالدين والثر، إيكاترينا فيلوموفا، باتريك شيا، منال فاروقي وآخرون. "UniMorph 2.0: علم التشكل العالمي." في LREC (2018).
  2. كيانيك، ل.، زابوكرتسكي، ز.، سيفشيكوفا، م.، وفيدرا، ج. (سبتمبر 2019). انطلاق الاشتقاقات العالمية: مجموعة من موارد الاشتقاق المنسقة لإحدى عشرة لغة. في وقائع ورشة العمل الدولية الثانية حول الموارد والأدوات الخاصة بعلم الصرف الاشتقاقي (ص 101-110).
  3. "تاريخ موجز لعلم الصرف ثنائي المستوى" . www.ling.helsinki.fi . تاريخ الاسترجاع: 30 نوفمبر 2021 .
  4. شميد، هيلموت. "لغة برمجة للمحولات ذات الحالة المحدودة." في FSMNLP ، المجلد 4002، الصفحات 308-309. 2005.
  5. شميد، هيلموت، آرني فيتشن، وأولريش هايد. "SMOR: علم الصرف الحاسوبي الألماني الذي يغطي الاشتقاق والتركيب والتصريف." في LREC ، الصفحات 1-263. 2004.
  6. "مجموعة أدوات اللغوي الميداني" . software.sil.org . 10 مايو 2017. تم الاطلاع عليه بتاريخ 27 نوفمبر 2021 .
  7. "FieldWorks" . software.sil.org . 9 ديسمبر 2014. تم الاطلاع عليه بتاريخ 27 نوفمبر 2021 .
  8. "XIGT" . XIGT . تم الاسترجاع في 27-11-2021 .
  9. كليمك، ب.، مكراي، ج.ب.، بوسك-جيل، ج.، إيونوف، م.، تاوبر، ج.ك.، وشياركوس، س. (2019). تحديات تمثيل علم الصرف في معاجم الأنطولوجيا. وقائع مؤتمر eLex .