توزيع ديريشليه متعدد الحدود
في نظرية الاحتمالات والإحصاء ، يُعد توزيع ديريشليه متعدد الحدود عائلة من التوزيعات الاحتمالية المنفصلة متعددة المتغيرات على نطاق محدود من الأعداد الصحيحة غير السالبة. ويُسمى أيضًا توزيع ديريشليه المركب متعدد الحدود ( DCM ) أو توزيع بوليا متعدد المتغيرات (نسبةً إلى جورج بوليا ). وهو توزيع احتمالي مركب ، حيث يُستخلص متجه الاحتمال p من توزيع ديريشليه ذي متجه المعاملات.وملاحظة مُستقاة من توزيع متعدد الحدود ذي متجه احتمالي p وعدد تجارب n . يُجسد متجه معلمات ديريشليه الاعتقاد المسبق حول الموقف، ويمكن اعتباره بمثابة عدد افتراضي: ملاحظات لكل نتيجة تحدث قبل جمع البيانات الفعلية. يتوافق التراكم مع مخطط جرة بوليا . ويُصادف هذا المخطط بكثرة في الإحصاء البايزي ، والتعلم الآلي ، وطرق بايز التجريبية ، والإحصاء الكلاسيكي كتوزيع متعدد الحدود ذي تشتت زائد .
يُختزل هذا التوزيع إلى التوزيع الفئوي كحالة خاصة عندما n = 1. كما أنه يُقارب التوزيع متعدد الحدود بدقة عالية جدًا لقيم α الكبيرة . يُعد توزيع ديريشليه متعدد الحدود امتدادًا متعدد المتغيرات لتوزيع بيتا ثنائي الحدين ، حيث أن توزيعي متعدد الحدود وديريشليه هما نسخ متعددة المتغيرات من توزيعي ثنائي الحدين وبيتا ، على التوالي.
مواصفة
توزيع ديريشليه متعدد الحدود كتوزيع مركب
يُعد توزيع ديريشليه توزيعًا مترافقًا مع التوزيع متعدد الحدود. وتؤدي هذه الحقيقة إلى توزيع مركب قابل للمعالجة التحليلية . بالنسبة لمتجه عشوائي من عدد الفئات، موزعة وفقًا لتوزيع متعدد الحدود ، يتم الحصول على التوزيع الهامشي عن طريق التكامل على التوزيع لـ p والذي يمكن اعتباره متجهًا عشوائيًا يتبع توزيع ديريشليه:
مما ينتج عنه الصيغة الصريحة التالية:
أينيُعرَّف بأنه المجموع. هناك شكل آخر لهذا التوزيع المركب نفسه، مكتوب بشكل أكثر إيجازًا بدلالة دالة بيتا ، B ، وهو كما يلي:
يؤكد الشكل الأخير على حقيقة أنه يمكن تجاهل فئات العد الصفري في الحساب - وهي حقيقة مفيدة عندما يكون عدد الفئات كبيرًا جدًا ومتفرقًا (على سبيل المثال، عدد الكلمات في المستندات).
لاحظ أن دالة كثافة الاحتمال هي توزيع بيتا-ذو الحدين عندماويمكن أيضاً إثبات أنها تقترب من التوزيع متعدد الحدود عندمايقترب من اللانهاية. المعلمةيتحكم في درجة التشتت الزائد أو التذبذب بالنسبة للتوزيع متعدد الحدود. خيارات بديلة للدلالة علىتم العثور في الأدبيات على S و A.
نموذج ديريشليه متعدد الحدود كنموذج جرة
يمكن أيضًا تبرير توزيع ديريشليه متعدد الحدود من خلال نموذج الجرة للقيم الصحيحة الموجبة للمتجه، والمعروفة باسم نموذج جرة بوليا . على وجه التحديد، تخيل جرة تحتوي على كرات منترقيم الألوانبالنسبة للون رقم i، حيث يتم إجراء سحوبات عشوائية. عند سحب كرة عشوائيًا وملاحظتها، تُعاد كرتان من نفس اللون إلى الوعاء. إذا تم تنفيذ هذا مرات، ثم احتمال ملاحظة المتجه العشوائيعدد الألوان هو متعدد الحدود ديريشليه ذو معلماتوإذا كانت عمليات السحب العشوائية تتم مع الإرجاع البسيط (لا تتم إضافة أي كرات فوق الكرة الملاحظة إلى الجرة)، فإن التوزيع يتبع توزيعًا متعدد الحدود، وإذا تم إجراء عمليات السحب العشوائية بدون إرجاع، فإن التوزيع يتبع توزيعًا هندسيًا فائقًا متعدد المتغيرات .
ملكيات
لحظات
مرة أخرى، دعناودعإذاً، فإن العدد المتوقع لمرات ملاحظة النتيجة i خلال n من التجارب هو
مصفوفة التغاير هي كما يلي. كل عنصر قطري هو تباين متغير عشوائي موزع توزيعًا بيتا-ثنائي الحد، وبالتالي فهو
العناصر غير القطرية هي التغايرات :
لكل i و j مختلفين.
جميع التغايرات سالبة لأنه بالنسبة لـ n ثابتة ، فإن الزيادة في أحد مكونات متجه ديريشلي متعدد الحدود تتطلب انخفاضًا في مكون آخر.
هذه مصفوفة شبه موجبة من الرتبة K − 1، أبعادها K × K.
عناصر مصفوفة الارتباط المقابلة هي
يتم حذف حجم العينة من هذه الصيغة.
لكل مكون من المكونات k على حدة توزيع بيتا-ذو الحدين.
مجموعة دعم توزيع ديريشليه متعدد الحدود هي
عدد عناصره هو
تدوين المصفوفات
في تدوين المصفوفات،
و
حيث p T = منقول متجه الصف لمتجه العمود p . بفرض
- يمكننا أن نكتب بدلاً من ذلك
المعلمةيُعرف هذا بالارتباط "داخل الفئة" أو "داخل المجموعة". هذا الارتباط الإيجابي هو الذي يُسبب التشتت الزائد مقارنةً بالتوزيع متعدد الحدود.
تجميع
لو
ثم، إذا تم حذف المتغيرات العشوائية ذات الرموز السفلية i و j من المتجه واستبدالها بمجموعها ،
يمكن استخدام خاصية التجميع هذه لاستخلاص التوزيع الهامشي لـ.
دالة الاحتمال
من الناحية النظرية، نقوم بإجراء N عملية سحب مستقلة من توزيع فئوي يحتوي على K فئة. لنُمثل عمليات السحب المستقلة كمتغيرات فئوية عشوائية.للنرمز إلى عدد مرات ظهور فئة معينةشوهد (لـ) من بين جميع المتغيرات الفئوية كـ، وثم لدينا وجهتا نظر منفصلتان حول هذه المشكلة:
- مجموعة من المتغيرات الفئوية.
- متغير واحد ذو قيمة متجهة، موزعة وفقًا لتوزيع متعدد الحدود .
الحالة الأولى هي مجموعة من المتغيرات العشوائية التي تحدد كل نتيجة على حدة ، بينما الحالة الثانية هي متغير يحدد عدد النتائج لكل فئة من الفئات K. هذا التمييز مهم، لأن الحالتين لهما توزيعات احتمالية مختلفة تبعًا لذلك.
معلمة التوزيع الفئوي هيأينهل احتمال سحب قيمة ؛ وهو كذلك معلمة التوزيع متعدد الحدودبدلاً من التحديد مباشرةً، نعطيه توزيعًا مسبقًا مترافقًا ، وبالتالي يتم سحبه من توزيع ديريشليه ذي متجه المعلمات.
من خلال التكامل الخارجينحصل بذلك على توزيع مركب. ومع ذلك، يختلف شكل التوزيع باختلاف وجهة النظر التي نتبناها.
بالنسبة لمجموعة من النتائج الفردية
توزيع مشترك
بالنسبة للمتغيرات الفئويةيتم الحصول على التوزيع المشترك الهامشي عن طريق التكامل:
مما ينتج عنه الصيغة الصريحة التالية:
أيندالة غاما ، مع
لاحظ غياب المعامل متعدد الحدود بسبب أن الصيغة تتعلق باحتمالية تسلسل المتغيرات الفئوية بدلاً من احتمالية التكرارات داخل كل فئة.
على الرغم من المتغيراتلا تظهر هذه العناصر صراحةً في الصيغة أعلاه، بل تدخل من خلالقيم.
التوزيع الشرطي
ثمة صيغة أخرى مفيدة، خاصة في سياق أخذ عينات جيبس ، تسأل عن الكثافة الشرطية لمتغير معينأي، بشرط جميع المتغيرات الأخرى (والتي سنرمز لها بـ). اتضح أن لها شكلاً بسيطاً للغاية:
أينيحدد عدد مرات ظهور الفئةيظهر في جميع المتغيرات باستثناء.
قد يكون من المفيد توضيح كيفية اشتقاق هذه الصيغة. بشكل عام، تتناسب التوزيعات الشرطية مع التوزيعات المشتركة المقابلة لها ، لذا نبدأ ببساطة بالصيغة المذكورة أعلاه للتوزيع المشترك لجميعالقيم ثم استبعاد أي عوامل لا تعتمد على المحددفي هذا الشأن. وللقيام بذلك، نستخدم الترميزكما هو موضح أعلاه، و
نستفيد أيضاً من حقيقة أن
ثم:
بشكل عام، ليس من الضروري القلق بشأن ثابت التوحيد عند اشتقاق معادلات التوزيعات الشرطية. سيتم تحديد ثابت التوحيد كجزء من خوارزمية أخذ العينات من التوزيع (انظر التوزيع الفئوي#أخذ العينات ). مع ذلك، عندما يُكتب التوزيع الشرطي بالشكل البسيط المذكور أعلاه، يتضح أن ثابت التوحيد يأخذ شكلاً بسيطاً:
لذلك
ترتبط هذه الصيغة ارتباطًا وثيقًا بعملية المطعم الصيني ، والتي تنتج عن أخذ الحد كـ.
في شبكة بايزية
في شبكة بايزية أكبر، حيث تظهر التوزيعات الفئوية (أو ما يُسمى بالتوزيعات "متعددة الحدود") مع توزيعات ديريشليه المسبقة كجزء من شبكة أكبر، يمكن دمج جميع توزيعات ديريشليه المسبقة شريطة أن تكون العقد الوحيدة التي تعتمد عليها هي التوزيعات الفئوية. يحدث الدمج لكل عقدة توزيع ديريشليه على حدة، بغض النظر عن أي عقد أخرى قد تعتمد على التوزيعات الفئوية. كما يحدث بغض النظر عما إذا كانت التوزيعات الفئوية تعتمد على عقد إضافية غير توزيعات ديريشليه المسبقة (مع العلم أنه في هذه الحالة، يجب أن تبقى تلك العقد الأخرى كعوامل شرطية إضافية). في الأساس، تتصل جميع التوزيعات الفئوية التي تعتمد على عقدة توزيع ديريشليه معينة في توزيع مشترك واحد متعدد الحدود ديريشليه مُعرَّف بالصيغة المذكورة أعلاه. يعتمد التوزيع المشترك، كما هو مُعرَّف بهذه الطريقة، على العقدة (العقد) الأصلية لعقد توزيع ديريشليه المسبق المُدمجة، بالإضافة إلى أي عقدة (عقد) أصلية للعقد الفئوية بخلاف عقد توزيع ديريشليه المسبق نفسها.
في الأقسام التالية، نناقش التكوينات المختلفة الشائعة في الشبكات البايزية. نكرر دالة كثافة الاحتمال المذكورة أعلاه، ونعرّفها باستخدام الرمز:
توزيعات احتمالية متعددة من نوع ديريشليه لها نفس التوزيع الاحتمالي الفائق
تخيل أن لدينا نموذجًا هرميًا على النحو التالي:
في مثل هذه الحالات، لدينا عدة توزيعات احتمالية مسبقة من نوع ديريشليه، يُولّد كل منها عددًا من المشاهدات الفئوية (ربما عددًا مختلفًا لكل توزيع). ولا يُحدث فرقًا كونها جميعًا تعتمد على نفس التوزيع الاحتمالي الفائق المسبق، حتى لو كان متغيرًا عشوائيًا كما ذُكر سابقًا. إن تأثير دمج التوزيع الاحتمالي المسبق من نوع ديريشليه يربط المتغيرات الفئوية المرتبطة بهذا التوزيع، والتي يرث توزيعها المشترك ببساطة أي عوامل شرطية من التوزيع الاحتمالي المسبق من نوع ديريشليه. ولا يُحدث فرقًا كون عدة توزيعات احتمالية مسبقة تشترك في توزيع احتمالي فائق مسبق.
أينهي ببساطة مجموعة من المتغيرات الفئوية التي تعتمد على d المسبق .
وبناءً على ذلك، يمكن كتابة توزيع الاحتمال الشرطي على النحو التالي:
أينويعني ذلك تحديداً عدد المتغيرات ضمن المجموعة، باستثناءنفسها، التي لها القيمة.
يجب حساب المتغيرات التي تحمل القيمة k فقط ، والتي ترتبط بالمتغير قيد الدراسة من خلال امتلاكها نفس التوزيع الاحتمالي المسبق. لا نريد حساب أي متغيرات أخرى تحمل القيمة k أيضاً .
توزيعات احتمالية متعددة من نوع ديريشليه لها نفس التوزيع الاحتمالي الفائق، مع أطفال تابعين
والآن تخيل نموذجًا هرميًا أكثر تعقيدًا بعض الشيء على النحو التالي:
هذا النموذج مماثل للنموذج السابق، ولكن بالإضافة إلى ذلك، يحتوي كل متغير من المتغيرات الفئوية على متغير فرعي يعتمد عليه. وهذا أمر شائع في نماذج الخليط .
مرة أخرى، في التوزيع المشترك، يتم ربط المتغيرات الفئوية التي تعتمد على نفس التوزيع المسبق فقط في توزيع ديريشلي متعدد الحدود واحد:
في الحالة الأبسط، يكون التوزيع الشرطي للمتغيرات الفئوية التي تعتمد فقط على آبائها وأسلافها مطابقًا للشكل المذكور أعلاه. مع ذلك، في أخذ عينات جيبس، من الضروري تحديد التوزيع الشرطي لعقدة معينة.لا يعتمد فقط علىوالأسلاف مثللكن على جميع المعايير الأخرى.
تم اشتقاق الصيغة المبسطة للتوزيع الشرطي أعلاه ببساطة عن طريق إعادة كتابة صيغة الاحتمال المشترك وحذف العوامل الثابتة. وبالتالي، ينطبق التبسيط نفسه على صيغة احتمال مشترك أكبر، مثل تلك الموجودة في هذا النموذج، والتي تتكون من كثافات ديريشليه متعددة الحدود بالإضافة إلى عوامل للعديد من المتغيرات العشوائية الأخرى التي تعتمد على قيم المتغيرات الفئوية.
وهذا ينتج عنه ما يلي:
هنا دالة كثافة الاحتمال لـيظهر مباشرة. لإجراء أخذ عينات عشوائية على، سنقوم بحساب الاحتمالات غير المعيارية لجميع الاحتمالات K لـباستخدام الصيغة المذكورة أعلاه، قم بتطبيعها واستمر كالمعتاد باستخدام الخوارزمية الموضحة في مقالة التوزيع الفئوي .
بصورة أدق، فإن العامل الإضافي الذي يظهر في التوزيع الشرطي لا يُستمد من مواصفات النموذج، بل مباشرةً من التوزيع المشترك. هذا التمييز مهم عند النظر في النماذج التي يكون فيها لعقدة معينة ذات أصل ديريشليهي مسبق عدة أبناء تابعين، لا سيما عندما يكون هؤلاء الأبناء تابعين لبعضهم البعض (مثلاً إذا كانوا يشتركون في أصل مُدمج). سيتم تناول هذا بمزيد من التفصيل لاحقاً.
احتمالات ديريشليه متعددة ذات عضوية مسبقة متغيرة
والآن تخيل أن لدينا نموذجًا هرميًا على النحو التالي:
هنا نواجه حالة معقدة حيث لدينا عدة توزيعات احتمالية مسبقة من نوع ديريشليه كما في السابق، ومجموعة من المتغيرات الفئوية التابعة، لكن العلاقة بين التوزيعات الاحتمالية المسبقة والمتغيرات التابعة ليست ثابتة، على عكس السابق. بدلاً من ذلك، يعتمد اختيار التوزيع الاحتمالي المسبق المستخدم على متغير فئوي عشوائي آخر. يحدث هذا، على سبيل المثال، في نماذج المواضيع، وبالفعل فإن أسماء المتغيرات المذكورة أعلاه تهدف إلى التوافق مع تلك الموجودة في تخصيص ديريشليه الكامن . في هذه الحالة، المجموعةهي مجموعة من الكلمات، كل منها مأخوذة من أحدالمواضيع المحتملة، حيث يمثل كل موضوع احتمالًا مسبقًا من نوع ديريشليه على مفردات منالكلمات المحتملة، التي تحدد تكرار الكلمات المختلفة في الموضوع. ومع ذلك، فإن انتماء كلمة معينة إلى الموضوع ليس ثابتًا؛ بل يتم تحديده من خلال مجموعة من المتغيرات الكامنة.يوجد متغير كامن واحد لكل كلمة، وهو أمتغير فئوي ذو أبعاد يحدد الموضوع الذي تنتمي إليه الكلمة.
في هذه الحالة، ترتبط جميع المتغيرات التي تعتمد على توزيع احتمالي مسبق معين (أي تكون مترابطة ) في مجموعة واحدة، كما في السابق - وتحديدًا، ترتبط جميع الكلمات التي تنتمي إلى موضوع معين. مع ذلك، في هذه الحالة، يتغير انتماء المجموعة، حيث لا تكون الكلمات ثابتة في موضوع معين، بل يعتمد الموضوع على قيمة متغير كامن مرتبط بالكلمة. ومع ذلك، فإن تعريف كثافة ديريشليه متعددة الحدود لا يعتمد في الواقع على عدد المتغيرات الفئوية في المجموعة (أي عدد الكلمات في المستند الناتج عن موضوع معين)، بل يعتمد فقط على عدد المتغيرات في المجموعة التي لها قيمة معينة (أي من بين جميع رموز الكلمات الناتجة عن موضوع معين، كم منها يمثل كلمة معينة). وبالتالي، لا يزال بإمكاننا كتابة صيغة صريحة للتوزيع المشترك.
هنا نستخدم الترميزللدلالة على عدد رموز الكلمات التي قيمتها هي رمز الكلمة v والتي تنتمي إلى الموضوع k .
لا يزال التوزيع الشرطي بنفس الشكل:
هنا أيضًا، يتم ربط المتغيرات التصنيفية للكلمات التي تنتمي إلى موضوع معين فقط (على الرغم من أن هذا الربط سيعتمد على تعيينات المتغيرات الكامنة)، وبالتالي يجب أن يقتصر عدد الكلمات على الكلمات التي ينتجها موضوع معين. ومن هنا جاء الرمز، وهو عدد رموز الكلمات التي تحتوي على رمز الكلمة v ، ولكن فقط من بين تلك التي تم إنشاؤها بواسطة الموضوع k ، واستبعاد الكلمة نفسها التي يتم وصف توزيعها.
(يكمن السبب في ضرورة استبعاد الكلمة نفسها، وفي منطقية ذلك أصلاً، في أنه في سياق أخذ عينات جيبس ، نعيد أخذ عينات متكررة من قيم كل متغير عشوائي، بعد أن نكون قد مررنا على جميع المتغيرات السابقة وأخذنا عينات منها. وبالتالي، سيكون للمتغير قيمة بالفعل، ونحتاج إلى استبعاد هذه القيمة الموجودة من مختلف الإحصاءات التي نستخدمها.)
مثال مُدمج: نماذج موضوعات LDA
سنوضح الآن كيفية الجمع بين بعض السيناريوهات المذكورة أعلاه لتوضيح كيفية أخذ عينة جيبس من نموذج واقعي، وتحديداً نموذج موضوع تخصيص ديريشليت الكامن المنعم (LDA) .
النموذج كالتالي:
باختصار، نجمع السيناريوهات الثلاثة السابقة: لدينا متغيرات فئوية تعتمد على عدة توزيعات احتمالية مسبقة تشترك في توزيع احتمالي مسبق فائق؛ ولدينا متغيرات فئوية ذات متغيرات تابعة ( هويات موضوع المتغير الكامن )؛ ولدينا متغيرات فئوية ذات عضوية متغيرة في عدة توزيعات احتمالية مسبقة تشترك في توزيع احتمالي مسبق فائق. في نموذج LDA القياسي، تُلاحظ الكلمات بالكامل، وبالتالي لا نحتاج أبدًا إلى إعادة أخذ عينات منها. (مع ذلك، يُمكن استخدام أخذ عينات جيبس بنفس القدر إذا لوحظت بعض الكلمات فقط أو لم تُلاحظ أي منها. في هذه الحالة، نرغب في تهيئة التوزيع على الكلمات بطريقة منطقية - على سبيل المثال من مخرجات عملية ما تُولّد جملًا، مثل نموذج الترجمة الآلية - حتى تكون توزيعات المتغيرات الكامنة اللاحقة الناتجة منطقية).
باستخدام الصيغ المذكورة أعلاه، يمكننا كتابة الاحتمالات الشرطية مباشرة:
لقد قمنا هنا بتحديد الإحصاءات بشكل أكثر وضوحاً لفصل إحصاءات الكلمات وإحصاءات المواضيع بشكل واضح:
كما هو الحال في السيناريو المذكور أعلاه مع المتغيرات الفئوية ذات الأبناء التابعين، يظهر الاحتمال الشرطي لهؤلاء الأبناء التابعين في تعريف الاحتمال الشرطي للوالد. في هذه الحالة، يحتوي كل متغير كامن على كلمة واحدة فقط للأبناء التابعين، لذا يظهر مصطلح واحد فقط. (في حال وجود عدة أبناء تابعين، يجب أن يظهروا جميعًا في الاحتمال الشرطي للوالد، بغض النظر عما إذا كان هناك تداخل بين آباء مختلفين ونفس الأبناء، أي بغض النظر عما إذا كان للأبناء التابعين لوالد معين آباء آخرون أيضًا. في حالة وجود عدة آباء للطفل، يظهر الاحتمال الشرطي لهذا الطفل في تعريف الاحتمال الشرطي لكل من والديه).
يُحدد التعريف أعلاه الاحتمال الشرطي غير المُعَيَّر للكلمات فقط، بينما يتطلب الاحتمال الشرطي للموضوع الاحتمال الفعلي (أي المُعَيَّر). لذا، علينا تطبيع الاحتمال بجمع جميع رموز الكلمات.
أين
يجدر أيضًا توضيح نقطة أخرى بالتفصيل، تتعلق بالعامل الثاني المذكور أعلاه في الاحتمال الشرطي. تذكر أن التوزيع الشرطي يُشتق عمومًا من التوزيع المشترك، ويُبسط بحذف الحدود غير المعتمدة على مجال التوزيع الشرطي (الجزء الموجود على يسار الخط العمودي). عندما تكون العقدةإذا كان لديه أطفال مُعالين، فسيكون هناك عامل واحد أو أكثرفي التوزيع المشترك الذي يعتمد علىعادةً ما يكون هناك عامل واحد لكل عقدة تابعة، وله نفس دالة الكثافة الاحتمالية للتوزيع الذي يظهر في التعريف الرياضي. مع ذلك ، إذا كان للعقدة التابعة عقدة أصلية أخرى (عقدة أصلية مشتركة)، وتم دمج هذه العقدة الأصلية المشتركة، فإن العقدة ستصبح تابعة لجميع العقد الأخرى التي تشترك في هذه العقدة الأصلية المشتركة، وبدلاً من وجود حدود متعددة لكل عقدة من هذا النوع، سيحتوي التوزيع المشترك على حد مشترك واحد فقط. وهذا هو الوضع الذي نواجهه هنا. على الرغم منلديه طفل واحد فقط، لذلك الطفل أب مشترك من نوع ديريشليه قمنا بدمجه، مما يؤدي إلى توليد متعدد الحدود من نوع ديريشليه على المجموعة الكاملة من العقد..
يحدث في هذه الحالة أن هذه المسألة لا تسبب مشاكل كبيرة، وذلك تحديداً بسبب العلاقة المباشرة بينويمكننا إعادة كتابة التوزيع المشترك على النحو التالي:
أين في المجموعة(أي مجموعة العقد)باستثناءلا تحتوي أي من العقد علىكوالد. وبالتالي يمكن استبعاده كعامل مشروط (السطر 2)، مما يعني أنه يمكن استبعاد العامل بأكمله من التوزيع الشرطي (السطر 3).
مثال ثانٍ: تجميع المستندات باستخدام خوارزمية بايز البسيطة
إليكم نموذجًا آخر، بمجموعة مختلفة من المشكلات. هذا تطبيق لنموذج بايز الساذج غير الخاضع للإشراف لتجميع المستندات. أي أننا نرغب في تصنيف المستندات إلى فئات متعددة (مثل " بريد مزعج " أو "غير مزعج"، أو "مقالة في مجلة علمية"، أو "مقالة صحفية عن التمويل"، أو "مقالة صحفية عن السياسة"، أو "رسالة غرامية") بناءً على محتواها النصي. مع ذلك، لا نعرف مسبقًا الفئة الصحيحة لأي من المستندات؛ بل نريد تجميعها بناءً على أوجه التشابه بينها. (على سبيل المثال، تميل مجموعة من المقالات العلمية إلى التشابه في استخدام الكلمات، لكنها تختلف اختلافًا كبيرًا عن مجموعة من الرسائل الغرامية). هذا نوع من أنواع التعلم غير الخاضع للإشراف . (يمكن استخدام التقنية نفسها للتعلم شبه الخاضع للإشراف ، أي عندما نعرف الفئة الصحيحة لجزء من المستندات، ونرغب في استخدام هذه المعرفة للمساعدة في تجميع المستندات المتبقية).
النموذج كالتالي:
يتشابه هذا النموذج، من نواحٍ عديدة، مع نموذج موضوعات LDA المذكور أعلاه، ولكنه يفترض وجود موضوع واحد لكل مستند بدلاً من موضوع واحد لكل كلمة، حيث يتكون المستند من مزيج من المواضيع. ويتضح هذا جلياً في النموذج المذكور أعلاه، والذي يُطابق نموذج LDA تماماً باستثناء وجود متغير كامن واحد فقط لكل مستند بدلاً من متغير كامن واحد لكل كلمة. ومرة أخرى، نفترض أننا نُدمج جميع التوزيعات الاحتمالية المسبقة لـ Dirichlet.
إن الاحتمال الشرطي لكلمة معينة يكاد يكون مطابقًا لحالة LDA. ومرة أخرى، جميع الكلمات المولدة بواسطة نفس التوزيع الاحتمالي المسبق لـ Dirichlet مترابطة. في هذه الحالة، يعني هذا أن كلمات جميع المستندات التي تحمل تصنيفًا معينًا مترابطة - مرة أخرى، يمكن أن يختلف هذا اعتمادًا على تصنيفات الكلمات، ولكن كل ما يهمنا هو العدد الإجمالي. ومن ثم:
أين
مع ذلك، ثمة فرق جوهري في التوزيع الشرطي للمتغيرات الكامنة لتعيينات التصنيفات، وهو أن متغير التصنيف الواحد له عدة عقد فرعية بدلاً من عقدة واحدة فقط، وتحديداً العقد الخاصة بجميع الكلمات في مستند التصنيف. ويرتبط هذا ارتباطاً وثيقاً بالمناقشة السابقة حول العامل.ينشأ ذلك من التوزيع المشترك. في هذه الحالة، يجب تطبيق التوزيع المشترك على جميع الكلمات في جميع المستندات التي تحتوي على تعيين تسمية يساوي قيمةوله قيمة توزيع ديريشليه متعدد الحدود. علاوة على ذلك، لا يمكننا اختزال هذا التوزيع المشترك إلى توزيع شرطي على كلمة واحدة. بل يمكننا اختزاله فقط إلى توزيع شرطي مشترك أصغر على الكلمات في المستند للعلامة المعنية، وبالتالي لا يمكننا تبسيطه باستخدام الحيلة المذكورة أعلاه التي تُنتج مجموعًا بسيطًا للعدد المتوقع والاحتمال المسبق. مع أنه من الممكن إعادة كتابته كحاصل ضرب هذه المجاميع الفردية، إلا أن عدد العوامل كبير جدًا، وليس من الواضح أنه أكثر كفاءة من حساب احتمال توزيع ديريشليه متعدد الحدود مباشرةً.
التوزيعات ذات الصلة
يُعرف الإصدار أحادي البعد من توزيع ديريشلي متعدد الحدود باسم توزيع بيتا ذي الحدين .
يرتبط توزيع ديريشليه متعدد الحدود بتوزيع ذي الحدين السالب بشكل مشابه لعلاقة توزيع متعدد الحدود بتوزيع بواسون . [ 2 ]
الاستخدامات
يُستخدم توزيع ديريشليت متعدد الحدود في التصنيف الآلي للوثائق وتجميعها، وعلم الوراثة ، والاقتصاد ، ونمذجة القتال، والتسويق الكمي.
انظر أيضاً
مراجع
الاقتباسات
- 1 2 3 4 غلوسنكامب، ت. (2018). "المعالجة الاحتمالية لعدم اليقين الناتج عن الحجم المحدود لبيانات مونت كارلو الموزونة". EPJ Plus . 133 (6): 218. arXiv : 1712.01293 . Bibcode : 2018EPJP..133..218G . doi : 10.1140/epjp/i2018-12042-x . S2CID 125665629 .
- ↑ النظرية 1 من Zhou, M. (2018). "تحليل العوامل الثنائية السالبة البايزية غير البارامترية" . التحليل البايزي . 13 (4): 1065–1093 . arXiv : 1604.07464 . doi : 10.1214/17-BA1070 .
مصادر
- إلكان، سي. (2006) تجميع المستندات باستخدام تقريب من عائلة الأسية لتوزيع ديريشليه متعدد الحدود المركب . ICML، 289-296.
- جونسون، إن إل، كوتز، إس. وبالاكريشنان، إن. (1997) التوزيعات المتعددة المتغيرات المنفصلة (المجلد 165). نيويورك: وايلي.
- كفام، ب. وداي، د. (2001) توزيع بوليا متعدد المتغيرات في نمذجة القتال. بحوث اللوجستيات البحرية، 48، 1-17.
- مادسن، ر. إي، كوتشاك، د. وإلكان، س. (2005) نمذجة انفجار الكلمات باستخدام توزيع ديريشليت . ICML، 545-552.
- مينكا، ت. (2003) تقدير توزيع ديريشليه . تقرير فني من مايكروسوفت للأبحاث. يتضمن كود ماتلاب لمطابقة التوزيعات مع البيانات.
- موسيمان، جيه إي (1962) حول التوزيع متعدد الحدود المركب، والتوزيع بيتا متعدد المتغيرات، والارتباطات بين النسب . بيومتريكا، 49 (1-2)، 65-82.
- واغنر، يو. وتاوديس، أ. (1986) نموذج بوليا متعدد المتغيرات لاختيار العلامة التجارية وحدوث الشراء. علوم التسويق، 5(3)، 219-244.
- التوزيعات المنفصلة متعددة المتغيرات
- التوزيعات المنفصلة
- توزيعات الاحتمالية المركبة
