نموذج كاتز للتراجع

نموذج كاتز للتراجع هو نموذج لغوي توليدي يعتمد على نماذج n -gram ، ويُقدّر الاحتمالية الشرطية لكلمة ما بناءً على تاريخها في n -gram. ويُنجز هذا التقدير بالتراجع تدريجيًا عبر نماذج تاريخية أقصر في ظل شروط معينة. [ 1 ] وبذلك، يُستخدم النموذج الذي يحتوي على المعلومات الأكثر موثوقية حول تاريخ مُحدد، مما يُؤدي إلى نتائج أفضل.

تم تقديم هذا النموذج في عام 1987 بواسطة سلافا م. كاتز. قبل ذلك، تم بناء نماذج اللغة n-gram عن طريق تدريب نماذج فردية لترتيبات n-gram المختلفة باستخدام تقدير الاحتمال الأقصى ثم استيفائها معًا.

طريقة

معادلة نموذج كاتز للتراجع هي: [ 2 ]

Pبo(wأنا|wأنا-ن+1wأنا-1)={دwأنا-ن+1wأناج(wأنا-ن+1wأنا-1wأنا)ج(wأنا-ن+1wأنا-1)لو ج(wأنا-ن+1wأنا)>كαwأنا-ن+1wأنا-1Pبo(wأنا|wأنا-ن+2wأنا-1)خلاف ذلك{\displaystyle {\begin{aligned}&P_{bo}(w_{i}\mid w_{i-n+1}\cdots w_{i-1})\\[4pt]={}&{\begin{cases}d_{w_{i-n+1}\cdots w_{i}}{\dfrac {C(w_{i-n+1}\cdots w_{i-1}w_{i})}{C(w_{i-n+1}\cdots w_{i-1})}}&{\text{if }}C(w_{i-n+1}\cdots w_{i})>k\\[10pt]\alpha _{w_{i-n+1}\cdots w_{i-1}}P_{bo}(w_{i}\mid w_{i-n+2}\cdots w_{i-1})&{\text{otherwise}}\end{cases}}\end{aligned}}}

أين

C ( x ) = عدد مرات ظهور x في التدريب
w i = الكلمة رقم i في السياق المحدد

باختصار، هذا يعني أنه إذا ظهرت مجموعة الكلمات (n -gram) أكثر من k مرة في التدريب، فإن الاحتمال الشرطي لكلمة ما، بالنظر إلى تاريخ ظهورها، يتناسب مع تقدير الاحتمال الأقصى لتلك المجموعة . وإلا، فإن الاحتمال الشرطي يساوي الاحتمال الشرطي للتراجع لمجموعة الكلمات ( n - 1).  

الجزء الأكثر صعوبة هو تحديد قيم k و d و α . 

ك{\displaystyle k}يُعدّ هذا المعامل الأقل أهمية، وعادةً ما يُختار بقيمة صفر. مع ذلك، قد تُظهر الاختبارات التجريبية قيماً أفضل لـ k.

د{\displaystyle d}عادةً ما تكون قيمة الخصم هي القيمة التي يتم الحصول عليها من خلال تقدير جود-تورينج . بعبارة أخرى، إذا كانت تقديرات جود-تورينجج{\displaystyle C}مثلج*{\displaystyle C^{*}}، ثمد=ج*ج{\displaystyle d={\frac {C^{*}}{C}}}

لحسابα{\displaystyle \alpha }، من المفيد أولاً تعريف الكمية β، وهي كتلة الاحتمال المتبقية للغرام ( n 1):  

βwأنا-ن+1wأنا-1=1-{wأنا:ج(wأنا-ن+1wأنا)>ك}دwأنا-ن+1wأناج(wأنا-ن+1wأنا-1wأنا)ج(wأنا-ن+1wأنا-1){\displaystyle \beta _{w_{i-n+1}\cdots w_{i-1}}=1-\sum _{\{w_{i}:C(w_{i-n+1}\cdots w_{i})>k\}}d_{w_{i-n+1}\cdots w_{i}}{\frac {C(w_{i-n+1}\cdots w_{i-1}w_{i})}{C(w_{i-n+1}\cdots w_{i-1})}}}

ثم يتم حساب وزن التراجع، α، على النحو التالي:

αwأنا-ن+1wأنا-1=βwأنا-ن+1wأنا-1{wأنا:ج(wأنا-ن+1wأنا)ك}Pبo(wأنا|wأنا-ن+2wأنا-1){\displaystyle \alpha _{w_{i-n+1}\cdots w_{i-1}}={\frac {\beta _{w_{i-n+1}\cdots w_{i-1}}}{\sum _{\{w_{i}:C(w_{i-n+1}\cdots w_{i})\leq k\}}P_{bo}(w_{i}\mid w_{i-n+2}\cdots w_{i-1})}}}

لا تنطبق الصيغة المذكورة أعلاه إلا إذا توفرت بيانات لـ "( n - 1)-gram". وإلا، فإن الخوارزمية تتخطى n-1 بالكامل وتستخدم تقدير كاتز لـ n-2. (وهكذا حتى يتم العثور على n-gram مع بيانات).  

مناقشة

يعمل هذا النموذج بشكل عام جيدًا في التطبيق العملي، ولكنه يفشل في بعض الحالات. على سبيل المثال، لنفترض أن الثنائي "أ ب" والحرف "ج" شائعان جدًا، بينما الثلاثي "أب ج" غير موجود أبدًا. نظرًا لشيوع "أ ب" و"ج"، فقد يكون عدم ظهور "أب ج" أمرًا ذا دلالة (أي ليس محض صدفة). ربما لا تسمح قواعد اللغة بذلك. بدلًا من إسناد قيمة صفرية أكثر ملاءمة، ستعود الطريقة إلى الثنائي وتقدر احتمال ( ج  | ب )، والذي قد يكون مرتفعًا جدًا. [ 3 ] 

مراجع

  1. "نماذج N-gram" (ملف PDF) . جامعة كورنيل.
  2. كاتز، إس إم (1987). تقدير الاحتمالات من البيانات المتفرقة لمكون نموذج اللغة في نظام التعرف على الكلام. معاملات IEEE في الصوتيات والكلام ومعالجة الإشارات، 35(3)، 400-401.
  3. مانينغ وشوتز، أسس المعالجة الإحصائية للغة الطبيعية، مطبعة معهد ماساتشوستس للتكنولوجيا (1999)، رقم ISBN 978-0-262-13360-9.