المخالب (علم اللغة)
نظام CLAWS (نظام الوسم التلقائي للكلمات بناءً على احتمالية المكونات) هو برنامج يُستخدم لتصنيف أجزاء الكلام . طُوّر هذا النظام في ثمانينيات القرن الماضي في جامعة لانكستر بواسطة مركز أبحاث اللغة الحاسوبي التابع للجامعة. [ 1 ] ويبلغ معدل دقته الإجمالية 96-97%، حيث صنّفت أحدث نسخة منه (CLAWS4) حوالي 100 مليون كلمة من المدونة الوطنية البريطانية . [ 1 ]
تاريخ
مُصنِّف أجزاء الكلام (POS Tagger) هو برنامج يقرأ النصوص بلغة ما ويُحدد أجزاء الكلام لكل كلمة (وغيرها من الرموز)، مثل الاسم والفعل والصفة، إلخ. مع ذلك، تستخدم التطبيقات الحاسوبية عادةً تصنيفات أجزاء كلام أكثر دقة مثل "جمع الأسماء". [ 2 ] طُوِّر برنامج CLAWS في أوائل ثمانينيات القرن العشرين، [ 1 ] [ 3 ] لسد الفجوة المتزايدة باستمرار نتيجةً لتغير متطلبات تصنيف أجزاء الكلام. أُنشئ البرنامج في الأصل لإضافة تصنيفات أجزاء الكلام إلى مجموعة بيانات LOB للغة الإنجليزية البريطانية ، ثم جرى تعديل مجموعة تصنيفات CLAWS لتشمل لغات أخرى، منها الأردية والعربية. [ 4 ]
منذ إطلاقه، حظي نظام CLAWS بإشادة واسعة لكفاءته وقابليته للتكيف. مع ذلك، لا يخلو من العيوب، ورغم أن معدل الخطأ فيه لا يتجاوز 1.5% عند تقييمه في الفئات الرئيسية، إلا أنه لا يزال يعاني من حوالي 3.3% من حالات الغموض غير المحسومة. يظهر الغموض في حالات مثل كلمة "flies"، وتحديد ما إذا كان ينبغي تصنيفها كاسم أم فعل. [ 5 ] هذه الحالات من الغموض هي التي ستتطلب التحديثات ومجموعات الوسوم المختلفة التي سيخضع لها نظام CLAWS.
القواعد والإجراءات
يستخدم برنامج CLAWS نموذج ماركوف المخفي لتحديد احتمالية تسلسل الكلمات في توقع كل تصنيف من تصنيفات أجزاء الكلام.
مخرجات نموذجية
| C5 | -----_PUN "_PUQ Welcome_VVB to_PRP my_DPS house_NN1 !_SENT -----_PUN Enter_VVB freedom_AV0 and_CJC of_PRF your_DPS own_DT0 will_NN1 !_PUN "_SENT -----_PUN He_PNP made_VVD no_AT0 motion_NN1 of_PRF stepping_VVG to_TO0 meet_VVI me_PNP ,_PUN but_CJC standing_VVD like_PRP a_AT0 Statue_NN1 ,_PUN as_CJS though_CJS his_DPS gesture_NN1 of_PRF welcome_NN1 had_VHD fixed_VVN him_PNP into_PRP stone_SENT ._PUN |
|---|---|
| C7 | مرحباً بكم في منزلي NN1 !_! ادخل_VV0 بحرية_RR و_CC من_IO تطبيقك_APPGE الخاص_DA سوف_NN1 !_! "_" لم يقم_PPHS1_VVD بأي_AT حركة_NN1 من_IO بالخطو_VVG لمقابلة_VVI أنا_PPIO1، _، لكن_CCB وقف_VVD مثل_II تمثال_AT1_NN1، _، كما_CS21 على الرغم من_CS22 أن إيماءة_APPGE_NN1 من_IO ترحيب_NN1 قد ثبتت_VHD_VVN له_PPHO1 في_II حجر_NN1 ._. |
تمت إضافة علامات إلى هذا المقتطف من رواية دراكولا لبرام ستوكر (1897) باستخدام مجموعتي علامات CLAWS C5 وC7. هذا هو الشكل الذي سيبدو عليه ناتج CLAWS بشكل عام، مع وضع علامة الجزء الكلامي الأكثر احتمالاً بعد كل كلمة.
مجموعات العلامات
مجموعة علامات CLAWS1
تحتوي أول مجموعة علامات تم تطويرها في CLAWS ، وهي مجموعة علامات CLAWS1، على 132 علامة كلمة. من حيث الشكل والتطبيق، تُشابه مجموعة علامات C1 علامات مدونة براون . [ 6 ] انظر جدول العلامات في مجموعة علامات C1 هنا . [ 7 ]
مجموعة علامات CLAWS2
بين عامي 1983 و1986، كانت الإصدارات المُحدَّثة التي أدت إلى CLAWS2 جزءًا من محاولة أوسع نطاقًا لمعالجة جوانب مثل التعرّف على فواصل الجمل، وذلك لتجنُّب الحاجة إلى المعالجة اليدوية المسبقة للنص قبل تطبيق الوسوم، والانتقال بدلًا من ذلك إلى التحرير اليدوي اللاحق الاختياري لتعديل مخرجات التعليق التلقائي، عند الحاجة. [ 8 ] تحتوي مجموعة وسوم CLAWS2 على 166 وسمًا للكلمات. [ 6 ] [ 9 ] انظر جدول الوسوم في مجموعة وسوم C2 هنا . [ 10 ]
مجموعة علامات CLAWS4
استُخدم برنامج CLAWS4 في مشروع المدونة الوطنية البريطانية (BNC) الذي يضم 100 مليون كلمة . وهو برنامج تصنيف نحوي عام، يُعدّ خليفةً لبرنامج CLAWS1. [ 11 ] وخلال عملية تصنيف المدونة الوطنية البريطانية، ركّزت مراحل العمل العديدة التي بُذلت في تطوير CLAWS4 على جعل البرنامج مستقلاً عن مجموعات التصنيف. فعلى سبيل المثال، استخدم مشروع المدونة الوطنية البريطانية نسختين من مجموعات التصنيف: "مجموعة تصنيف رئيسية (C5) تضم 62 تصنيفًا، تم تصنيف المدونة بأكملها بها، ومجموعة تصنيف أكبر (C7) تضم 152 تصنيفًا، استُخدمت لإنشاء عينة مختارة من المدونة الأساسية تضم مليوني كلمة." [ 12 ] ويُقدّم أحدث إصدار من CLAWS4 من قِبل مركز أبحاث UCREL التابع لجامعة لانكستر . [ 6 ] [ 13 ]
مجموعة علامات CLAWS5
تحتوي مجموعة علامات CLAWS5، المستخدمة في BNC ، على أكثر من 60 علامة. [ 6 ] انظر جدول العلامات في مجموعة علامات C5 هنا . [ 14 ]
مجموعة علامات CLAWS6
استُخدمت مجموعة علامات CLAWS6 لمجموعة بيانات BNC و COLT . تحتوي هذه المجموعة على أكثر من 160 علامة، بما في ذلك 13 نوعًا فرعيًا من المحددات . [ 6 ] انظر جدول العلامات في مجموعة علامات C6 هنا . [ 15 ]
مجموعة علامات CLAWS7
تُستخدم حاليًا مجموعة علامات CLAWS7 القياسية. وهي تختلف فقط في علامات الترقيم مقارنةً بمجموعة علامات CLAWS6. [ 6 ] انظر جدول العلامات في مجموعة علامات C7 هنا . [ 16 ]
مجموعة علامات CLAWS8
تم توسيع مجموعة علامات CLAWS8 من مجموعة علامات C7 بإضافة تمييزات أخرى في فئتي أدوات التعريف والضمائر، بالإضافة إلى 37 علامة مساعدة جديدة لأشكال الأفعال be وdo و have . [ 6 ] انظر جدول العلامات في مجموعة علامات C8 هنا
انظر أيضاً
مراجع
- 1 2 3 "CLAWS part-of-speech tagger" . ucrel.lancs.ac.uk . تم الاطلاع عليه بتاريخ 1 أبريل 2020 .
- ↑ "مصنف أجزاء الكلام اللوغاريتمي الخطي من جامعة ستانفورد" . مجموعة معالجة اللغات الطبيعية بجامعة ستانفورد . مؤرشف من الأصل بتاريخ 25-10-2004.
- ↑ غارسيد، روجر. 1987. نظام CLAWS لتصنيف الكلمات. في: ر. غارسيد، ج. ليتش، وج. سامبسون (محررون)، التحليل الحاسوبي للغة الإنجليزية: منهج قائم على المدونات اللغوية. لونغمان.
- ↑ أتويل، إي إس 2008. تطوير مجموعات العلامات لتصنيف أجزاء الكلام. في: لوديلينج، أ. وكيتو، م. (محرران). علم اللغة الحاسوبي: دليل دولي، المجلد 1. والتر دي جرويتر، 501-526. ISBN 978-3-11-021142-9
- ↑ مكوي، كاثي. "تحديد أجزاء الكلام (الفصل 5)" (ملف PDF) . مؤرشف (ملف PDF) من الأصل بتاريخ 17-04-2018.
- 1 2 3 4 5 6 7 "CLAWS part-of-speech tagger" . ucrel.lancs.ac.uk . تم الاطلاع عليه بتاريخ 12 أبريل 2020 .
- ↑ "مجموعة علامات UCREL CLAWS1 (LOB)" . ucrel.lancs.ac.uk . تم الاطلاع عليه بتاريخ 12 أبريل 2020 .
- ↑ غارسيد، روجر. 1996. الوسم القوي للنصوص غير المقيدة: تجربة المركز الوطني البريطاني للنصوص. في ج. توماس وم. شورت (محرران). استخدام المدونات اللغوية في البحث اللغوي: دراسات تكريمًا لجيفري ليتش. (ص 167-180). لندن: لونغمان.
- ↑ بوث، باربرا. 1985. مراجعة CLAWS. مجلة ICAME 9:29–35.
- ↑ "مجموعة علامات UCREL CLAWS2" . ucrel.lancs.ac.uk . تم الاطلاع عليه بتاريخ 12 أبريل 2020 .
- ↑ "CLAWS4: THE TAGGING OF THE BRITISH NATIONAL CORPUS" . ucrel.lancs.ac.uk . تاريخ الاسترجاع: 12 أبريل 2020 .
- ↑Garside, Roger. 1996. The robust tagging of unrestricted text: the BNC experience. In J. Thomas & M. short (Eds.) Using Corpora for language research: Studies in the honour of Geoffrey Leech. (pp. 167–180). London. Longman. p. 169.
- ↑"UCREL home page, Lancaster UK". ucrel.lancs.ac.uk. Retrieved 2020-04-12.
- ↑"UCREL CLAWS5 Tagset". ucrel.lancs.ac.uk. Retrieved 2020-04-20.
- ↑"UCREL CLAWS6 Tagset". ucrel.lancs.ac.uk. Retrieved 2020-04-12.
- ↑"UCREL CLAWS7 Tagset". ucrel.lancs.ac.uk. Retrieved 2020-04-12.
External links
- Natural language processing
- Corpus linguistics
- Tasks of natural language processing
- Markov models
- Word-sense disambiguation
