توزيع ديريشليه متعدد الحدود

في نظرية الاحتمالات والإحصاء ، يُعد توزيع ديريشليه متعدد الحدود عائلة من التوزيعات الاحتمالية المنفصلة متعددة المتغيرات على نطاق محدود من الأعداد الصحيحة غير السالبة. ويُسمى أيضًا توزيع ديريشليه المركب متعدد الحدود ( DCM ) أو توزيع بوليا متعدد المتغيرات (نسبةً إلى جورج بوليا ). وهو توزيع احتمالي مركب ، حيث يُستخلص متجه الاحتمال p من توزيع ديريشليه ذي متجه المعاملات.α{\displaystyle {\boldsymbol {\alpha }}}وملاحظة مُستقاة من توزيع متعدد الحدود ذي متجه احتمالي p وعدد تجارب n . يُجسد متجه معلمات ديريشليه الاعتقاد المسبق حول الموقف، ويمكن اعتباره بمثابة عدد افتراضي: ملاحظات لكل نتيجة تحدث قبل جمع البيانات الفعلية. يتوافق التراكم مع مخطط جرة بوليا . ويُصادف هذا المخطط بكثرة في الإحصاء البايزي ، والتعلم الآلي ، وطرق بايز التجريبية ، والإحصاء الكلاسيكي كتوزيع متعدد الحدود ذي تشتت زائد .

يُختزل هذا التوزيع إلى التوزيع الفئوي كحالة خاصة عندما n  =  1. كما أنه يُقارب التوزيع متعدد الحدود بدقة عالية جدًا لقيم α الكبيرة . يُعد توزيع ديريشليه متعدد الحدود امتدادًا متعدد المتغيرات لتوزيع بيتا ثنائي الحدين ، حيث أن توزيعي متعدد الحدود وديريشليه هما نسخ متعددة المتغيرات من توزيعي ثنائي الحدين وبيتا ، على التوالي.

مواصفة

توزيع ديريشليه متعدد الحدود كتوزيع مركب

يُعد توزيع ديريشليه توزيعًا مترافقًا مع التوزيع متعدد الحدود. وتؤدي هذه الحقيقة إلى توزيع مركب قابل للمعالجة التحليلية . بالنسبة لمتجه عشوائي من عدد الفئاتx=(x1،...،xك){\displaystyle \mathbf {x} =(x_{1},\dots ,x_{K})}، موزعة وفقًا لتوزيع متعدد الحدود ، يتم الحصول على التوزيع الهامشي عن طريق التكامل على التوزيع لـ p والذي يمكن اعتباره متجهًا عشوائيًا يتبع توزيع ديريشليه:

برو(x|ن،α)=صمuلت(x|ن،ص)دأنار(ص|α)دص{\displaystyle \Pr(\mathbf {x} \mid n,{\boldsymbol {\alpha }})=\int _{\mathbf {p} }\mathrm {Mult} (\mathbf {x} \mid n,\mathbf {p} )\mathrm {Dir} (\mathbf {p} \mid {\boldsymbol {\alpha }}){\textrm {d}}\mathbf {p} }

مما ينتج عنه الصيغة الصريحة التالية:

برو(x|ن،α)=Γ(α0)Γ(ن+1)Γ(ن+α0)ك=1كΓ(xك+αك)Γ(αك)Γ(xك+1){\displaystyle \Pr(\mathbf {x} \mid n,{\boldsymbol {\alpha }})={\frac {\Gamma \left(\alpha _{0}\right)\Gamma \left(n+1\right)}{\Gamma \left(n+\alpha _{0}\right)}}\prod _{k=1}^{K}{\frac {\Gamma (x_{k}+\alpha _{k})}{\Gamma (\alpha _{k})\Gamma \left(x_{k}+1\right)}}}

أينα0{\displaystyle \alpha _{0}}يُعرَّف بأنه المجموعα0=αك{\displaystyle \alpha _{0}=\sum \alpha _{k}}. هناك شكل آخر لهذا التوزيع المركب نفسه، مكتوب بشكل أكثر إيجازًا بدلالة دالة بيتا ، B ، وهو كما يلي:

برو(x|ن،α)=نب(α0،ن)ك:xك>0xكب(αك،xك).{\displaystyle \Pr(\mathbf {x} \mid n,{\boldsymbol {\alpha }})={\frac {nB\left(\alpha _{0},n\right)}{\prod _{k:x_{k}>0}x_{k}B\left(\alpha _{k},x_{k}\right)}}.}

يؤكد الشكل الأخير على حقيقة أنه يمكن تجاهل فئات العد الصفري في الحساب - وهي حقيقة مفيدة عندما يكون عدد الفئات كبيرًا جدًا ومتفرقًا (على سبيل المثال، عدد الكلمات في المستندات).

لاحظ أن دالة كثافة الاحتمال هي توزيع بيتا-ذو الحدين عندماك=2{\displaystyle K=2}ويمكن أيضاً إثبات أنها تقترب من التوزيع متعدد الحدود عندماα0{\displaystyle \alpha _{0}}يقترب من اللانهاية. المعلمةα0{\displaystyle \alpha _{0}}يتحكم في درجة التشتت الزائد أو التذبذب بالنسبة للتوزيع متعدد الحدود. خيارات بديلة للدلالة علىα0{\displaystyle \alpha _{0}}تم العثور في الأدبيات على S و A.

نموذج ديريشليه متعدد الحدود كنموذج جرة

يمكن أيضًا تبرير توزيع ديريشليه متعدد الحدود من خلال نموذج الجرة للقيم الصحيحة الموجبة للمتجهα{\displaystyle {\boldsymbol {\alpha }}}، والمعروفة باسم نموذج جرة بوليا . على وجه التحديد، تخيل جرة تحتوي على كرات منك{\displaystyle K}ترقيم الألوانαأنا{\displaystyle \alpha _{i}}بالنسبة للون رقم i، حيث يتم إجراء سحوبات عشوائية. عند سحب كرة عشوائيًا وملاحظتها، تُعاد كرتان من نفس اللون إلى الوعاء. إذا تم تنفيذ هذان{\displaystyle n} مرات، ثم احتمال ملاحظة المتجه العشوائيx{\displaystyle x}عدد الألوان هو متعدد الحدود ديريشليه ذو معلماتن{\displaystyle n}وα{\displaystyle {\boldsymbol {\alpha }}}إذا كانت عمليات السحب العشوائية تتم مع الإرجاع البسيط (لا تتم إضافة أي كرات فوق الكرة الملاحظة إلى الجرة)، فإن التوزيع يتبع توزيعًا متعدد الحدود، وإذا تم إجراء عمليات السحب العشوائية بدون إرجاع، فإن التوزيع يتبع توزيعًا هندسيًا فائقًا متعدد المتغيرات .

ملكيات

لحظات

مرة أخرى، دعناα0=αك{\displaystyle \alpha _{0}=\sum \alpha _{k}}ودعصأنا=αأناαك=αأناα0{\displaystyle p_{i}={\frac {\alpha _{i}}{\sum \alpha _{k}}}={\frac {\alpha _{i}}{\alpha _{0}}}}إذاً، فإن العدد المتوقع لمرات ملاحظة النتيجة i خلال n من التجارب هو

هـ(Xأنا)=نصأنا=نαأناα0.{\displaystyle \operatorname {E} (X_{i})=np_{i}=n{\frac {\alpha _{i}}{\alpha _{0}}}.\,}

مصفوفة التغاير هي كما يلي. كل عنصر قطري هو تباين متغير عشوائي موزع توزيعًا بيتا-ثنائي الحد، وبالتالي فهو

متغير(Xأنا)=نصأنا(1-صأنا)(ن+αك1+αك)=نαأناα0(1-αأناα0)(ن+α01+α0).{\displaystyle \operatorname {var} (X_{i})=np_{i}(1-p_{i})\left({\frac {n+\sum \alpha _{k}}{1+\sum \alpha _{k}}}\right)=n{\frac {\alpha _{i}}{\alpha _{0}}}\left(1-{\frac {\alpha _{i}}{\alpha _{0}}}\right)\left({\frac {n+\alpha _{0}}{1+\alpha _{0}}}\right).\,}

العناصر غير القطرية هي التغايرات :

كوف(Xأنا،Xج)=-نصأناصج(ن+αك1+αك)=-نαأناαجα02(ن+α01+α0){\displaystyle \operatorname {cov} (X_{i},X_{j})=-np_{i}p_{j}\left({\frac {n+\sum \alpha _{k}}{1+\sum \alpha _{k}}}\right)=-n{\frac {\alpha _{i}\alpha _{j}}{\alpha _{0}^{2}}}\left({\frac {n+\alpha _{0}}{1+\alpha _{0}}}\right)\,}

لكل i و j مختلفين.

جميع التغايرات سالبة لأنه بالنسبة لـ n ثابتة ، فإن الزيادة في أحد مكونات متجه ديريشلي متعدد الحدود تتطلب انخفاضًا في مكون آخر.

هذه مصفوفة شبه موجبة من الرتبة K 1، أبعادها K × K.  

عناصر مصفوفة الارتباط المقابلة هي

ρ(Xأنا،Xأنا)=1.{\displaystyle \rho (X_{i},X_{i})=1.}
ρ(Xأنا،Xج)=كوف(Xأنا،Xج)متغير(Xأنا)متغير(Xج)=-صأناصج(ن+α01+α0)صأنا(1-صأنا)(ن+α01+α0)صج(1-صج)(ن+α01+α0)=-αأناαج(α0-αأنا)(α0-αج).{\displaystyle \rho (X_{i},X_{j})={\frac {\operatorname {cov} (X_{i},X_{j})}{\sqrt {\operatorname {var} (X_{i})\operatorname {var} (X_{j})}}}={\frac {-p_{i}p_{j}({\frac {n+\alpha _{0}}{1+\alpha _{0}}})}{\sqrt {p_{i}(1-p_{i})({\frac {n+\alpha _{0}}{1+\alpha _{0}}})p_{j}(1-p_{j})({\frac {n+\alpha _{0}}{1+\alpha _{0}}})}}}=-{\sqrt {\frac {\alpha _{i}\alpha _{j}}{(\alpha _{0}-\alpha _{i})(\alpha _{0}-\alpha _{j})}}}.}

يتم حذف حجم العينة من هذه الصيغة.

لكل مكون من المكونات k على حدة توزيع بيتا-ذو الحدين.

مجموعة دعم توزيع ديريشليه متعدد الحدود هي

{(ن1،...،نك)شمالك|ن1++نك=ن}.{\displaystyle \{(n_{1},\dots ,n_{k})\in \mathbb {N} ^{k}|n_{1}+\cdots +n_{k}=n\}.\,}

عدد عناصره هو

(ن+ك-1ك-1).{\displaystyle {n+k-1 \choose k-1}.}

تدوين المصفوفات

في تدوين المصفوفات،

هـ(X)=نص،{\displaystyle \operatorname {E} (\mathbf {X} )=n\mathbf {p} ,\,}

و

متغير(X)=ن{التشخيص(ص)-صصتي}(ن+α01+α0)،{\displaystyle \operatorname {var} (\mathbf {X} )=n\lbrace \operatorname {diag} (\mathbf {p} )-\mathbf {p} \mathbf {p} ^{\rm {T}}\rbrace \left({\frac {n+\alpha _{0}}{1+\alpha _{0}}}\right),\,}

حيث p T = منقول متجه الصف لمتجه العمود p . بفرض

α0=1-ρ2ρ2{\displaystyle \alpha _{0}={\frac {1-\rho ^{2}}{\rho ^{2}}}\,}يمكننا أن نكتب بدلاً من ذلك
متغير(X)=ن{التشخيص(ص)-صصتي}(1+ρ2(ن-1))،{\displaystyle \operatorname {var} (\mathbf {X} )=n\lbrace \operatorname {diag} (\mathbf {p} )-\mathbf {p} \mathbf {p} ^{\rm {T}}\rbrace (1+\rho ^{2}(n-1)),\,}

المعلمةρ{\displaystyle \rho \!}يُعرف هذا بالارتباط "داخل الفئة" أو "داخل المجموعة". هذا الارتباط الإيجابي هو الذي يُسبب التشتت الزائد مقارنةً بالتوزيع متعدد الحدود.

تجميع

لو

X=(X1،...،Xك)رسالة خاصة(α1،،αك){\displaystyle X=(X_{1},\ldots ,X_{K})\sim \operatorname {DM} (\alpha _{1},\cdots ,\alpha _{K})}

ثم، إذا تم حذف المتغيرات العشوائية ذات الرموز السفلية i و j من المتجه واستبدالها بمجموعها ،

X=(X1،...،Xأنا+Xج،...،Xك)رسالة خاصة(α1،،αأنا+αج،،αك).{\displaystyle X'=(X_{1},\ldots ,X_{i}+X_{j},\ldots ,X_{K})\sim \operatorname {DM} \left(\alpha _{1},\cdots ,\alpha _{i}+\alpha _{j},\cdots ,\alpha _{K}\right).}

يمكن استخدام خاصية التجميع هذه لاستخلاص التوزيع الهامشي لـXأنا{\displaystyle X_{i}}.

دالة الاحتمال

من الناحية النظرية، نقوم بإجراء N عملية سحب مستقلة من توزيع فئوي يحتوي على K فئة. لنُمثل عمليات السحب المستقلة كمتغيرات فئوية عشوائية.zن{\displaystyle z_{n}}لن=1...شمال{\displaystyle n=1\dots N}لنرمز إلى عدد مرات ظهور فئة معينةك{\displaystyle k}شوهد (لـك=1...ك{\displaystyle k=1\dots K}) من بين جميع المتغيرات الفئوية كـنك{\displaystyle n_{k}}، وكنك=شمال{\displaystyle \sum _{k}n_{k}=N}ثم لدينا وجهتا نظر منفصلتان حول هذه المشكلة:

  1. مجموعة منشمال{\displaystyle N} المتغيرات الفئويةz1،...،zشمال{\displaystyle z_{1},\dots ,z_{N}}.
  2. متغير واحد ذو قيمة متجهةx=(ن1،...،نك){\displaystyle \mathbf {x} =(n_{1},\dots ,n_{K})}، موزعة وفقًا لتوزيع متعدد الحدود .

الحالة الأولى هي مجموعة من المتغيرات العشوائية التي تحدد كل نتيجة على حدة ، بينما الحالة الثانية هي متغير يحدد عدد النتائج لكل فئة من الفئات K. هذا التمييز مهم، لأن الحالتين لهما توزيعات احتمالية مختلفة تبعًا لذلك.

معلمة التوزيع الفئوي هيص=(ص1،ص2،...،صك)،{\displaystyle \mathbf {p} =(p_{1},p_{2},\dots ,p_{K}),}أينصك{\displaystyle p_{k}}هل احتمال سحب قيمة ك{\displaystyle k}؛ ص{\displaystyle \mathbf {p} } وهو كذلك معلمة التوزيع متعدد الحدودP(x|ص){\displaystyle P(\mathbf {x} |\mathbf {p} )}بدلاً من التحديد ص{\displaystyle \mathbf {p} }مباشرةً، نعطيه توزيعًا مسبقًا مترافقًا ، وبالتالي يتم سحبه من توزيع ديريشليه ذي متجه المعلماتα=(α1،α2،...،αك){\displaystyle {\boldsymbol {\alpha }}=(\alpha _{1},\alpha _{2},\ldots ,\alpha _{K})}.

من خلال التكامل الخارجيص{\displaystyle \mathbf {p} }نحصل بذلك على توزيع مركب. ومع ذلك، يختلف شكل التوزيع باختلاف وجهة النظر التي نتبناها.

بالنسبة لمجموعة من النتائج الفردية

توزيع مشترك

بالنسبة للمتغيرات الفئويةZ=z1،...،zشمال{\displaystyle \mathbb {Z} =z_{1},\dots ,z_{N}}يتم الحصول على التوزيع المشترك الهامشي عن طريق التكاملص{\displaystyle \mathbf {p} }:

برو(Z|α)=صبرو(Z|ص)برو(ص|α)دص{\displaystyle \Pr(\mathbb {Z} \mid {\boldsymbol {\alpha }})=\int _{\mathbf {p} }\Pr(\mathbb {Z} \mid \mathbf {p} )\Pr(\mathbf {p} \mid {\boldsymbol {\alpha }}){\textrm {d}}\mathbf {p} }

مما ينتج عنه الصيغة الصريحة التالية:

برو(Z|α)=Γ(α0)Γ(شمال+α0)ك=1كΓ(نك+αك)Γ(αك){\displaystyle \Pr(\mathbb {Z} \mid {\boldsymbol {\alpha }})={\frac {\Gamma \left(\alpha _{0}\right)}{\Gamma \left(N+\alpha _{0}\right)}}\prod _{k=1}^{K}{\frac {\Gamma (n_{k}+\alpha _{k})}{\Gamma (\alpha _{k})}}}

أينΓ{\displaystyle \Gamma }دالة غاما ، مع

α0=كαك و شمال=كنكوحيث نك=عدد zن's ذات القيمة ك.{\displaystyle \alpha _{0}=\sum _{k}\alpha _{k}{\text{ and }}N=\sum _{k}n_{k}{\text{, and where }}n_{k}={\text{number of }}z_{n}{\text{'s with the value }}k.}

لاحظ غياب المعامل متعدد الحدود بسبب أن الصيغة تتعلق باحتمالية تسلسل المتغيرات الفئوية بدلاً من احتمالية التكرارات داخل كل فئة.

على الرغم من المتغيراتz1،...،zشمال{\displaystyle z_{1},\dots ,z_{N}}لا تظهر هذه العناصر صراحةً في الصيغة أعلاه، بل تدخل من خلالنك{\displaystyle n_{k}}قيم.

التوزيع الشرطي

ثمة صيغة أخرى مفيدة، خاصة في سياق أخذ عينات جيبس ، تسأل عن الكثافة الشرطية لمتغير معينzن{\displaystyle z_{n}}أي، بشرط جميع المتغيرات الأخرى (والتي سنرمز لها بـZ(-ن){\displaystyle \mathbb {Z} ^{(-n)}}). اتضح أن لها شكلاً بسيطاً للغاية:

برو(zن=ك|Z(-ن)،α)نك(-ن)+αك{\displaystyle \Pr(z_{n}=k\mid \mathbb {Z} ^{(-n)},{\boldsymbol {\alpha }})\propto n_{k}^{(-n)}+\alpha _{k}}

أيننك(-ن){\displaystyle n_{k}^{(-n)}}يحدد عدد مرات ظهور الفئةك{\displaystyle k}يظهر في جميع المتغيرات باستثناءzن{\displaystyle z_{n}}.

قد يكون من المفيد توضيح كيفية اشتقاق هذه الصيغة. بشكل عام، تتناسب التوزيعات الشرطية مع التوزيعات المشتركة المقابلة لها ، لذا نبدأ ببساطة بالصيغة المذكورة أعلاه للتوزيع المشترك لجميعz1،...،zشمال{\displaystyle z_{1},\dots ,z_{N}}القيم ثم استبعاد أي عوامل لا تعتمد على المحددzن{\displaystyle z_{n}}في هذا الشأن. وللقيام بذلك، نستخدم الترميزنك(-ن){\displaystyle n_{k}^{(-n)}}كما هو موضح أعلاه، و

نج={نج(-ن)،لو جكنج(-ن)+1،لو ج=ك{\displaystyle n_{j}={\begin{cases}n_{j}^{(-n)},&{\text{if }}j\not =k\\n_{j}^{(-n)}+1,&{\text{if }}j=k\end{cases}}}

نستفيد أيضاً من حقيقة أن

Γ(ن+1)=نΓ(ن){\displaystyle \Gamma (n+1)=n\Gamma (n)}

ثم:

برو(zن=ك|Z(-ن)،α) برو(zن=ك،Z(-ن)|α)=  Γ(α0)Γ(شمال+α0)ج=1كΓ(نج+αج)Γ(αج) ج=1كΓ(نج+αج)= Γ(نك+αك)جكΓ(نج+αج)= Γ(نك(-ن)+1+αك)جكΓ(نج(-ن)+αج)= (نك(-ن)+αك)Γ(نك(-ن)+αك)جكΓ(نج(-ن)+αج)= (نك(-ن)+αك)جΓ(نج(-ن)+αج) نك(-ن)+αك{\displaystyle {\begin{aligned}&\Pr(z_{n}=k\mid \mathbb {Z} ^{(-n)},{\boldsymbol {\alpha }})\\\propto \ &\Pr(z_{n}=k,\mathbb {Z} ^{(-n)}\mid {\boldsymbol {\alpha }})\\=\ &\ {\frac {\Gamma \left(\alpha _{0}\right)}{\Gamma \left(N+\alpha _{0}\right)}}\prod _{j=1}^{K}{\frac {\Gamma (n_{j}+\alpha _{j})}{\Gamma (\alpha _{j})}}\\\propto \ &\prod _{j=1}^{K}\Gamma (n_{j}+\alpha _{j})\\=\ &\Gamma (n_{k}+\alpha _{k})\prod _{j\not =k}\Gamma (n_{j}+\alpha _{j})\\=\ &\Gamma (n_{k}^{(-n)}+1+\alpha _{k})\prod _{j\not =k}\Gamma (n_{j}^{(-n)}+\alpha _{j})\\=\ &(n_{k}^{(-n)}+\alpha _{k})\Gamma (n_{k}^{(-n)}+\alpha _{k})\prod _{j\not =k}\Gamma (n_{j}^{(-n)}+\alpha _{j})\\=\ &(n_{k}^{(-n)}+\alpha _{k})\prod _{j}\Gamma (n_{j}^{(-n)}+\alpha _{j})\\\propto \ &n_{k}^{(-n)}+\alpha _{k}\\\end{aligned}}}

بشكل عام، ليس من الضروري القلق بشأن ثابت التوحيد عند اشتقاق معادلات التوزيعات الشرطية. سيتم تحديد ثابت التوحيد كجزء من خوارزمية أخذ العينات من التوزيع (انظر التوزيع الفئوي#أخذ العينات ). مع ذلك، عندما يُكتب التوزيع الشرطي بالشكل البسيط المذكور أعلاه، يتضح أن ثابت التوحيد يأخذ شكلاً بسيطاً:

ك(نك(-ن)+αك)=α0+كنك(-ن)=α0+شمال-1{\displaystyle \sum _{k}\left(n_{k}^{(-n)}+\alpha _{k}\right)=\alpha _{0}+\sum _{k}n_{k}^{(-n)}=\alpha _{0}+N-1}

لذلك

برو(zن=ك|Z(-ن)،α)=نك(-ن)+αكα0+شمال-1{\displaystyle \Pr(z_{n}=k\mid \mathbb {Z} ^{(-n)},{\boldsymbol {\alpha }})={\frac {n_{k}^{(-n)}+\alpha _{k}}{\alpha _{0}+N-1}}}

ترتبط هذه الصيغة ارتباطًا وثيقًا بعملية المطعم الصيني ، والتي تنتج عن أخذ الحد كـك{\displaystyle K\to \infty }.

في شبكة بايزية

في شبكة بايزية أكبر، حيث تظهر التوزيعات الفئوية (أو ما يُسمى بالتوزيعات "متعددة الحدود") مع توزيعات ديريشليه المسبقة كجزء من شبكة أكبر، يمكن دمج جميع توزيعات ديريشليه المسبقة شريطة أن تكون العقد الوحيدة التي تعتمد عليها هي التوزيعات الفئوية. يحدث الدمج لكل عقدة توزيع ديريشليه على حدة، بغض النظر عن أي عقد أخرى قد تعتمد على التوزيعات الفئوية. كما يحدث بغض النظر عما إذا كانت التوزيعات الفئوية تعتمد على عقد إضافية غير توزيعات ديريشليه المسبقة (مع العلم أنه في هذه الحالة، يجب أن تبقى تلك العقد الأخرى كعوامل شرطية إضافية). في الأساس، تتصل جميع التوزيعات الفئوية التي تعتمد على عقدة توزيع ديريشليه معينة في توزيع مشترك واحد متعدد الحدود ديريشليه مُعرَّف بالصيغة المذكورة أعلاه. يعتمد التوزيع المشترك، كما هو مُعرَّف بهذه الطريقة، على العقدة (العقد) الأصلية لعقد توزيع ديريشليه المسبق المُدمجة، بالإضافة إلى أي عقدة (عقد) أصلية للعقد الفئوية بخلاف عقد توزيع ديريشليه المسبق نفسها.

في الأقسام التالية، نناقش التكوينات المختلفة الشائعة في الشبكات البايزية. نكرر دالة كثافة الاحتمال المذكورة أعلاه، ونعرّفها باستخدام الرمزDirMult(Z|α){\displaystyle \operatorname {DirMult} (\mathbb {Z} \mid {\boldsymbol {\alpha }})}:

برو(Z|α)=DirMult(Z|α)=Γ(كαك)Γ(كنك+αك)ك=1كΓ(نك+αك)Γ(αك){\displaystyle \Pr(\mathbb {Z} \mid {\boldsymbol {\alpha }})=\operatorname {DirMult} (\mathbb {Z} \mid {\boldsymbol {\alpha }})={\frac {\Gamma \left(\sum _{k}\alpha _{k}\right)}{\Gamma \left(\sum _{k}n_{k}+\alpha _{k}\right)}}\prod _{k=1}^{K}{\frac {\Gamma (n_{k}+\alpha _{k})}{\Gamma (\alpha _{k})}}}
توزيعات احتمالية متعددة من نوع ديريشليه لها نفس التوزيع الاحتمالي الفائق

تخيل أن لدينا نموذجًا هرميًا على النحو التالي:

αبعض التوزيعθد=1...مديريشليهك(α)zد=1...م،ن=1...شمالدفئويك(θد){\displaystyle {\begin{array}{lcl}{\boldsymbol {\alpha }}&\sim &{\text{some distribution}}\\{\boldsymbol {\theta }}_{d=1\dots M}&\sim &\operatorname {Dirichlet} _{K}({\boldsymbol {\alpha }})\\z_{d=1\dots M,n=1\dots N_{d}}&\sim &\operatorname {Categorical} _{K}({\boldsymbol {\theta }}_{d})\end{array}}}

في مثل هذه الحالات، لدينا عدة توزيعات احتمالية مسبقة من نوع ديريشليه، يُولّد كل منها عددًا من المشاهدات الفئوية (ربما عددًا مختلفًا لكل توزيع). ولا يُحدث فرقًا كونها جميعًا تعتمد على نفس التوزيع الاحتمالي الفائق المسبق، حتى لو كان متغيرًا عشوائيًا كما ذُكر سابقًا. إن تأثير دمج التوزيع الاحتمالي المسبق من نوع ديريشليه يربط المتغيرات الفئوية المرتبطة بهذا التوزيع، والتي يرث توزيعها المشترك ببساطة أي عوامل شرطية من التوزيع الاحتمالي المسبق من نوع ديريشليه. ولا يُحدث فرقًا كون عدة توزيعات احتمالية مسبقة تشترك في توزيع احتمالي فائق مسبق.

برو(Z|α)=دDirMult(Zد|α){\displaystyle \Pr(\mathbb {Z} \mid {\boldsymbol {\alpha }})=\prod _{d}\operatorname {DirMult} (\mathbb {Z} _{d}\mid {\boldsymbol {\alpha }})}

أينZد{\displaystyle \mathbb {Z} _{d}}هي ببساطة مجموعة من المتغيرات الفئوية التي تعتمد على d المسبق .

وبناءً على ذلك، يمكن كتابة توزيع الاحتمال الشرطي على النحو التالي:

برو(zدن=ك|Z(-دن)،α)  نك،د(-ن)+αك{\displaystyle \Pr(z_{dn}=k\mid \mathbb {Z} ^{(-dn)},{\boldsymbol {\alpha }})\ \propto \ n_{k,d}^{(-n)}+\alpha _{k}}

أيننك،د(-ن){\displaystyle n_{k,d}^{(-n)}}ويعني ذلك تحديداً عدد المتغيرات ضمن المجموعةZد{\displaystyle \mathbb {Z} _{d}}، باستثناءzدن{\displaystyle z_{dn}}نفسها، التي لها القيمةك{\displaystyle k}.

يجب حساب المتغيرات التي تحمل القيمة k فقط ، والتي ترتبط بالمتغير قيد الدراسة من خلال امتلاكها نفس التوزيع الاحتمالي المسبق. لا نريد حساب أي متغيرات أخرى تحمل القيمة k أيضاً .

توزيعات احتمالية متعددة من نوع ديريشليه لها نفس التوزيع الاحتمالي الفائق، مع أطفال تابعين

والآن تخيل نموذجًا هرميًا أكثر تعقيدًا بعض الشيء على النحو التالي:

αبعض التوزيعθد=1...مديريشليهك(α)zد=1...م،ن=1...شمالدفئويك(θد)ϕتوزيع آخرwد=1...م،ن=1...شمالدF(wدن|zدن،ϕ){\displaystyle {\begin{array}{lcl}{\boldsymbol {\alpha }}&\sim &{\text{some distribution}}\\{\boldsymbol {\theta }}_{d=1\dots M}&\sim &\operatorname {Dirichlet} _{K}({\boldsymbol {\alpha }})\\z_{d=1\dots M,n=1\dots N_{d}}&\sim &\operatorname {Categorical} _{K}({\boldsymbol {\theta }}_{d})\\{\boldsymbol {\phi }}&\sim &{\text{some other distribution}}\\w_{d=1\dots M,n=1\dots N_{d}}&\sim &\operatorname {F} (w_{dn}\mid z_{dn},{\boldsymbol {\phi }})\end{array}}}

هذا النموذج مماثل للنموذج السابق، ولكن بالإضافة إلى ذلك، يحتوي كل متغير من المتغيرات الفئوية على متغير فرعي يعتمد عليه. وهذا أمر شائع في نماذج الخليط .

مرة أخرى، في التوزيع المشترك، يتم ربط المتغيرات الفئوية التي تعتمد على نفس التوزيع المسبق فقط في توزيع ديريشلي متعدد الحدود واحد:

برو(Z،دبليو|α،ϕ)=دDirMult(Zد|α)د=1من=1شمالدF(wدن|zدن،ϕ){\displaystyle \Pr(\mathbb {Z} ,\mathbb {W} \mid {\boldsymbol {\alpha }},{\boldsymbol {\phi }})=\prod _{d}\operatorname {DirMult} (\mathbb {Z} _{d}\mid {\boldsymbol {\alpha }})\prod _{d=1}^{M}\prod _{n=1}^{N_{d}}\operatorname {F} (w_{dn}\mid z_{dn},{\boldsymbol {\phi }})}

في الحالة الأبسط، يكون التوزيع الشرطي للمتغيرات الفئوية التي تعتمد فقط على آبائها وأسلافها مطابقًا للشكل المذكور أعلاه. مع ذلك، في أخذ عينات جيبس، من الضروري تحديد التوزيع الشرطي لعقدة معينة.zدن{\displaystyle z_{dn}}لا يعتمد فقط علىZ(-دن){\displaystyle \mathbb {Z} ^{(-dn)}}والأسلاف مثلα{\displaystyle \alpha }لكن على جميع المعايير الأخرى.

تم اشتقاق الصيغة المبسطة للتوزيع الشرطي أعلاه ببساطة عن طريق إعادة كتابة صيغة الاحتمال المشترك وحذف العوامل الثابتة. وبالتالي، ينطبق التبسيط نفسه على صيغة احتمال مشترك أكبر، مثل تلك الموجودة في هذا النموذج، والتي تتكون من كثافات ديريشليه متعددة الحدود بالإضافة إلى عوامل للعديد من المتغيرات العشوائية الأخرى التي تعتمد على قيم المتغيرات الفئوية.

وهذا ينتج عنه ما يلي:

برو(zدن=ك|Z(-دن)،دبليو،α،ϕ)  (نك،د(-ن)+αك)F(wدن|zدن،ϕ){\displaystyle \Pr(z_{dn}=k\mid \mathbb {Z} ^{(-dn)},\mathbb {W} ,{\boldsymbol {\alpha }},{\boldsymbol {\phi }})\ \propto \ (n_{k,d}^{(-n)}+\alpha _{k})\operatorname {F} (w_{dn}\mid z_{dn},{\boldsymbol {\phi }})}

هنا دالة كثافة الاحتمال لـF{\displaystyle \operatorname {F} }يظهر مباشرة. لإجراء أخذ عينات عشوائية علىzدن{\displaystyle z_{dn}}، سنقوم بحساب الاحتمالات غير المعيارية لجميع الاحتمالات K لـzدن{\displaystyle z_{dn}}باستخدام الصيغة المذكورة أعلاه، قم بتطبيعها واستمر كالمعتاد باستخدام الخوارزمية الموضحة في مقالة التوزيع الفئوي .

بصورة أدق، فإن العامل الإضافي الذي يظهر في التوزيع الشرطي لا يُستمد من مواصفات النموذج، بل مباشرةً من التوزيع المشترك. هذا التمييز مهم عند النظر في النماذج التي يكون فيها لعقدة معينة ذات أصل ديريشليهي مسبق عدة أبناء تابعين، لا سيما عندما يكون هؤلاء الأبناء تابعين لبعضهم البعض (مثلاً إذا كانوا يشتركون في أصل مُدمج). سيتم تناول هذا بمزيد من التفصيل لاحقاً.

احتمالات ديريشليه متعددة ذات عضوية مسبقة متغيرة

والآن تخيل أن لدينا نموذجًا هرميًا على النحو التالي:

θبعض التوزيعzن=1...شمالفئويك(θ)αبعض التوزيعϕك=1...كديريشليهV(α)wن=1...شمالفئويV(ϕzن){\displaystyle {\begin{array}{lcl}{\boldsymbol {\theta }}&\sim &{\text{some distribution}}\\z_{n=1\dots N}&\sim &\operatorname {Categorical} _{K}({\boldsymbol {\theta }})\\{\boldsymbol {\alpha }}&\sim &{\text{some distribution}}\\{\boldsymbol {\phi }}_{k=1\dots K}&\sim &\operatorname {Dirichlet} _{V}({\boldsymbol {\alpha }})\\w_{n=1\dots N}&\sim &\operatorname {Categorical} _{V}({\boldsymbol {\phi }}_{z_{n}})\\\end{array}}}

هنا نواجه حالة معقدة حيث لدينا عدة توزيعات احتمالية مسبقة من نوع ديريشليه كما في السابق، ومجموعة من المتغيرات الفئوية التابعة، لكن العلاقة بين التوزيعات الاحتمالية المسبقة والمتغيرات التابعة ليست ثابتة، على عكس السابق. بدلاً من ذلك، يعتمد اختيار التوزيع الاحتمالي المسبق المستخدم على متغير فئوي عشوائي آخر. يحدث هذا، على سبيل المثال، في نماذج المواضيع، وبالفعل فإن أسماء المتغيرات المذكورة أعلاه تهدف إلى التوافق مع تلك الموجودة في تخصيص ديريشليه الكامن . في هذه الحالة، المجموعةدبليو{\displaystyle \mathbb {W} }هي مجموعة من الكلمات، كل منها مأخوذة من أحدك{\displaystyle K}المواضيع المحتملة، حيث يمثل كل موضوع احتمالًا مسبقًا من نوع ديريشليه على مفردات منV{\displaystyle V}الكلمات المحتملة، التي تحدد تكرار الكلمات المختلفة في الموضوع. ومع ذلك، فإن انتماء كلمة معينة إلى الموضوع ليس ثابتًا؛ بل يتم تحديده من خلال مجموعة من المتغيرات الكامنة.Z{\displaystyle \mathbb {Z} }يوجد متغير كامن واحد لكل كلمة، وهو أك{\displaystyle K}متغير فئوي ذو أبعاد يحدد الموضوع الذي تنتمي إليه الكلمة.

في هذه الحالة، ترتبط جميع المتغيرات التي تعتمد على توزيع احتمالي مسبق معين (أي تكون مترابطة ) في مجموعة واحدة، كما في السابق - وتحديدًا، ترتبط جميع الكلمات التي تنتمي إلى موضوع معين. مع ذلك، في هذه الحالة، يتغير انتماء المجموعة، حيث لا تكون الكلمات ثابتة في موضوع معين، بل يعتمد الموضوع على قيمة متغير كامن مرتبط بالكلمة. ومع ذلك، فإن تعريف كثافة ديريشليه متعددة الحدود لا يعتمد في الواقع على عدد المتغيرات الفئوية في المجموعة (أي عدد الكلمات في المستند الناتج عن موضوع معين)، بل يعتمد فقط على عدد المتغيرات في المجموعة التي لها قيمة معينة (أي من بين جميع رموز الكلمات الناتجة عن موضوع معين، كم منها يمثل كلمة معينة). وبالتالي، لا يزال بإمكاننا كتابة صيغة صريحة للتوزيع المشترك.

برو(دبليو|α،Z)=ك=1كDirMult(دبليوك|Z،α)=ك=1ك[Γ(vαv)Γ(vنvك+αv)v=1VΓ(نvك+αv)Γ(αv)]{\displaystyle \Pr(\mathbb {W} \mid {\boldsymbol {\alpha }},\mathbb {Z} )=\prod _{k=1}^{K}\operatorname {DirMult} (\mathbb {W} _{k}\mid \mathbb {Z} ,{\boldsymbol {\alpha }})=\prod _{k=1}^{K}\left[{\frac {\Gamma \left(\sum _{v}\alpha _{v}\right)}{\Gamma \left(\sum _{v}n_{v}^{k}+\alpha _{v}\right)}}\prod _{v=1}^{V}{\frac {\Gamma (n_{v}^{k}+\alpha _{v})}{\Gamma (\alpha _{v})}}\right]}

هنا نستخدم الترميزنvك{\displaystyle n_{v}^{k}}للدلالة على عدد رموز الكلمات التي قيمتها هي رمز الكلمة v والتي تنتمي إلى الموضوع k .

لا يزال التوزيع الشرطي بنفس الشكل:

برو(wن=v|دبليو(-ن)،Z،α)  نvك،(-ن)+αv{\displaystyle \Pr(w_{n}=v\mid \mathbb {W} ^{(-n)},\mathbb {Z} ,{\boldsymbol {\alpha }})\ \propto \ n_{v}^{k,(-n)}+\alpha _{v}}

هنا أيضًا، يتم ربط المتغيرات التصنيفية للكلمات التي تنتمي إلى موضوع معين فقط (على الرغم من أن هذا الربط سيعتمد على تعيينات المتغيرات الكامنة)، وبالتالي يجب أن يقتصر عدد الكلمات على الكلمات التي ينتجها موضوع معين. ومن هنا جاء الرمزنvك،(-ن){\displaystyle n_{v}^{k,(-n)}}، وهو عدد رموز الكلمات التي تحتوي على رمز الكلمة v ، ولكن فقط من بين تلك التي تم إنشاؤها بواسطة الموضوع k ، واستبعاد الكلمة نفسها التي يتم وصف توزيعها.

(يكمن السبب في ضرورة استبعاد الكلمة نفسها، وفي منطقية ذلك أصلاً، في أنه في سياق أخذ عينات جيبس ، نعيد أخذ عينات متكررة من قيم كل متغير عشوائي، بعد أن نكون قد مررنا على جميع المتغيرات السابقة وأخذنا عينات منها. وبالتالي، سيكون للمتغير قيمة بالفعل، ونحتاج إلى استبعاد هذه القيمة الموجودة من مختلف الإحصاءات التي نستخدمها.)

مثال مُدمج: نماذج موضوعات LDA

سنوضح الآن كيفية الجمع بين بعض السيناريوهات المذكورة أعلاه لتوضيح كيفية أخذ عينة جيبس ​​من نموذج واقعي، وتحديداً نموذج موضوع تخصيص ديريشليت الكامن المنعم (LDA) .

النموذج كالتالي:

αالتوزيع المسبق الفائق لـ Dirichlet، إما ثابت أو متغير عشوائيβالتوزيع المسبق الفائق لـ Dirichlet، إما ثابت أو متغير عشوائيθد=1...مديريشليهك(α)ϕك=1...كديريشليهV(β)zد=1...م،ن=1...شمالدفئويك(θد)wد=1...م،ن=1...شمالدفئويV(ϕzدن){\displaystyle {\begin{array}{lcl}{\boldsymbol {\alpha }}&\sim &{\text{A Dirichlet hyperprior, either a constant or a random variable}}\\{\boldsymbol {\beta }}&\sim &{\text{A Dirichlet hyperprior, either a constant or a random variable}}\\{\boldsymbol {\theta }}_{d=1\dots M}&\sim &\operatorname {Dirichlet} _{K}({\boldsymbol {\alpha }})\\{\boldsymbol {\phi }}_{k=1\dots K}&\sim &\operatorname {Dirichlet} _{V}({\boldsymbol {\beta }})\\z_{d=1\dots M,n=1\dots N_{d}}&\sim &\operatorname {Categorical} _{K}({\boldsymbol {\theta }}_{d})\\w_{d=1\dots M,n=1\dots N_{d}}&\sim &\operatorname {Categorical} _{V}({\boldsymbol {\phi }}_{z_{dn}})\\\end{array}}}

باختصار، نجمع السيناريوهات الثلاثة السابقة: لدينا متغيرات فئوية تعتمد على عدة توزيعات احتمالية مسبقة تشترك في توزيع احتمالي مسبق فائق؛ ولدينا متغيرات فئوية ذات متغيرات تابعة ( هويات موضوع المتغير الكامن )؛ ولدينا متغيرات فئوية ذات عضوية متغيرة في عدة توزيعات احتمالية مسبقة تشترك في توزيع احتمالي مسبق فائق. في نموذج LDA القياسي، تُلاحظ الكلمات بالكامل، وبالتالي لا نحتاج أبدًا إلى إعادة أخذ عينات منها. (مع ذلك، يُمكن استخدام أخذ عينات جيبس ​​بنفس القدر إذا لوحظت بعض الكلمات فقط أو لم تُلاحظ أي منها. في هذه الحالة، نرغب في تهيئة التوزيع على الكلمات بطريقة منطقية - على سبيل المثال من مخرجات عملية ما تُولّد جملًا، مثل نموذج الترجمة الآلية - حتى تكون توزيعات المتغيرات الكامنة اللاحقة الناتجة منطقية).

باستخدام الصيغ المذكورة أعلاه، يمكننا كتابة الاحتمالات الشرطية مباشرة:

برو(wدن=v|دبليو(-دن)،Z،β)  8دبليوvك،(-دن)+βvبرو(zدن=ك|Z(-دن)،wدن=v،دبليو(-دن)،α)  (8Zكد،(-دن)+αك)برو(wدن=v|دبليو(-دن)،Z،β){\displaystyle {\begin{array}{lcl}\Pr(w_{dn}=v\mid \mathbb {W} ^{(-dn)},\mathbb {Z} ,{\boldsymbol {\beta }})\ &\propto \ &\#\mathbb {W} _{v}^{k,(-dn)}+\beta _{v}\\\Pr(z_{dn}=k\mid \mathbb {Z} ^{(-dn)},w_{dn}=v,\mathbb {W} ^{(-dn)},{\boldsymbol {\alpha }})\ &\propto \ &(\#\mathbb {Z} _{k}^{d,(-dn)}+\alpha _{k})\Pr(w_{dn}=v\mid \mathbb {W} ^{(-dn)},\mathbb {Z} ,{\boldsymbol {\beta }})\\\end{array}}}

لقد قمنا هنا بتحديد الإحصاءات بشكل أكثر وضوحاً لفصل إحصاءات الكلمات وإحصاءات المواضيع بشكل واضح:

8دبليوvك،(-دن)=عدد الكلمات ذات القيمة v من بين المواضيع ك باستثناء wدن8Zكد،(-دن)=عدد المواضيع ذات القيمة ك من بين الوثائق د باستثناء zدن{\displaystyle {\begin{array}{lcl}\#\mathbb {W} _{v}^{k,(-dn)}&=&{\text{number of words having value }}v{\text{ among topic }}k{\text{ excluding }}w_{dn}\\\#\mathbb {Z} _{k}^{d,(-dn)}&=&{\text{number of topics having value }}k{\text{ among document }}d{\text{ excluding }}z_{dn}\\\end{array}}}

كما هو الحال في السيناريو المذكور أعلاه مع المتغيرات الفئوية ذات الأبناء التابعين، يظهر الاحتمال الشرطي لهؤلاء الأبناء التابعين في تعريف الاحتمال الشرطي للوالد. في هذه الحالة، يحتوي كل متغير كامن على كلمة واحدة فقط للأبناء التابعين، لذا يظهر مصطلح واحد فقط. (في حال وجود عدة أبناء تابعين، يجب أن يظهروا جميعًا في الاحتمال الشرطي للوالد، بغض النظر عما إذا كان هناك تداخل بين آباء مختلفين ونفس الأبناء، أي بغض النظر عما إذا كان للأبناء التابعين لوالد معين آباء آخرون أيضًا. في حالة وجود عدة آباء للطفل، يظهر الاحتمال الشرطي لهذا الطفل في تعريف الاحتمال الشرطي لكل من والديه).

يُحدد التعريف أعلاه الاحتمال الشرطي غير المُعَيَّر للكلمات فقط، بينما يتطلب الاحتمال الشرطي للموضوع الاحتمال الفعلي (أي المُعَيَّر). لذا، علينا تطبيع الاحتمال بجمع جميع رموز الكلمات.

برو(zدن=ك|Z(-دن)،wدن=v،دبليو(-دن)،α)  (8Zكد،(-دن)+αك)8دبليوvك،(-دن)+βvv=1V(8دبليوvك،(-دن)+βv)=(8Zكد،(-دن)+αك)8دبليوvك،(-دن)+βv8دبليوك+ب-1{\displaystyle {\begin{array}{rcl}\Pr(z_{dn}=k\mid \mathbb {Z} ^{(-dn)},w_{dn}=v,\mathbb {W} ^{(-dn)},{\boldsymbol {\alpha }})\ &\propto \ &{\bigl (}\#\mathbb {Z} _{k}^{d,(-dn)}+\alpha _{k}{\bigr )}{\dfrac {\#\mathbb {W} _{v}^{k,(-dn)}+\beta _{v}}{\sum _{v'=1}^{V}(\#\mathbb {W} _{v'}^{k,(-dn)}+\beta _{v'})}}\\&&\\&=&{\bigl (}\#\mathbb {Z} _{k}^{d,(-dn)}+\alpha _{k}{\bigr )}{\dfrac {\#\mathbb {W} _{v}^{k,(-dn)}+\beta _{v}}{\#\mathbb {W} ^{k}+B-1}}\end{array}}}

أين

8دبليوك=عدد الكلمات التي تم توليدها حسب الموضوع كب=v=1Vβv{\displaystyle {\begin{array}{lcl}\#\mathbb {W} ^{k}&=&{\text{number of words generated by topic }}k\\B&=&\sum _{v=1}^{V}\beta _{v}\\\end{array}}}

يجدر أيضًا توضيح نقطة أخرى بالتفصيل، تتعلق بالعامل الثاني المذكور أعلاه في الاحتمال الشرطي. تذكر أن التوزيع الشرطي يُشتق عمومًا من التوزيع المشترك، ويُبسط بحذف الحدود غير المعتمدة على مجال التوزيع الشرطي (الجزء الموجود على يسار الخط العمودي). عندما تكون العقدةz{\displaystyle z}إذا كان لديه أطفال مُعالين، فسيكون هناك عامل واحد أو أكثرF(|z){\displaystyle \operatorname {F} (\dots \mid z)}في التوزيع المشترك الذي يعتمد علىz{\displaystyle z}عادةً ما يكون هناك عامل واحد لكل عقدة تابعة، وله نفس دالة الكثافة الاحتمالية للتوزيع الذي يظهر في التعريف الرياضي. مع ذلك ، إذا كان للعقدة التابعة عقدة أصلية أخرى (عقدة أصلية مشتركة)، وتم دمج هذه العقدة الأصلية المشتركة، فإن العقدة ستصبح تابعة لجميع العقد الأخرى التي تشترك في هذه العقدة الأصلية المشتركة، وبدلاً من وجود حدود متعددة لكل عقدة من هذا النوع، سيحتوي التوزيع المشترك على حد مشترك واحد فقط. وهذا هو الوضع الذي نواجهه هنا. على الرغم منzدن{\displaystyle z_{dn}}لديه طفل واحد فقطwدن{\displaystyle w_{dn}}، لذلك الطفل أب مشترك من نوع ديريشليه قمنا بدمجه، مما يؤدي إلى توليد متعدد الحدود من نوع ديريشليه على المجموعة الكاملة من العقد.دبليوك{\displaystyle \mathbb {W} ^{k}}.

يحدث في هذه الحالة أن هذه المسألة لا تسبب مشاكل كبيرة، وذلك تحديداً بسبب العلاقة المباشرة بينzدن{\displaystyle z_{dn}}وwدن{\displaystyle w_{dn}}يمكننا إعادة كتابة التوزيع المشترك على النحو التالي:

ص(دبليوك|zدن)=ص(wدن|دبليوك،(-دن)،zدن)ص(دبليوك،(-دن)|zدن)=ص(wدن|دبليوك،(-دن)،zدن)ص(دبليوك،(-دن))ص(wدن|دبليوك،(-دن)،zدن){\displaystyle {\begin{array}{lcl}p(\mathbb {W} ^{k}\mid z_{dn})&=&p(w_{dn}\mid \mathbb {W} ^{k,(-dn)},z_{dn})\,p(\mathbb {W} ^{k,(-dn)}\mid z_{dn})\\&=&p(w_{dn}\mid \mathbb {W} ^{k,(-dn)},z_{dn})\,p(\mathbb {W} ^{k,(-dn)})\\&\sim &p(w_{dn}\mid \mathbb {W} ^{k,(-dn)},z_{dn})\end{array}}}

أين في المجموعةدبليوك،(-دن){\displaystyle \mathbb {W} ^{k,(-dn)}}(أي مجموعة العقد)دبليوك{\displaystyle \mathbb {W} ^{k}}باستثناءwدن{\displaystyle w_{dn}}لا تحتوي أي من العقد علىzدن{\displaystyle z_{dn}}كوالد. وبالتالي يمكن استبعاده كعامل مشروط (السطر 2)، مما يعني أنه يمكن استبعاد العامل بأكمله من التوزيع الشرطي (السطر 3).

مثال ثانٍ: تجميع المستندات باستخدام خوارزمية بايز البسيطة

إليكم نموذجًا آخر، بمجموعة مختلفة من المشكلات. هذا تطبيق لنموذج بايز الساذج غير الخاضع للإشراف لتجميع المستندات. أي أننا نرغب في تصنيف المستندات إلى فئات متعددة (مثل " بريد مزعج " أو "غير مزعج"، أو "مقالة في مجلة علمية"، أو "مقالة صحفية عن التمويل"، أو "مقالة صحفية عن السياسة"، أو "رسالة غرامية") بناءً على محتواها النصي. مع ذلك، لا نعرف مسبقًا الفئة الصحيحة لأي من المستندات؛ بل نريد تجميعها بناءً على أوجه التشابه بينها. (على سبيل المثال، تميل مجموعة من المقالات العلمية إلى التشابه في استخدام الكلمات، لكنها تختلف اختلافًا كبيرًا عن مجموعة من الرسائل الغرامية). هذا نوع من أنواع التعلم غير الخاضع للإشراف . (يمكن استخدام التقنية نفسها للتعلم شبه الخاضع للإشراف ، أي عندما نعرف الفئة الصحيحة لجزء من المستندات، ونرغب في استخدام هذه المعرفة للمساعدة في تجميع المستندات المتبقية).

النموذج كالتالي:

αالتوزيع المسبق الفائق لـ Dirichlet، إما ثابت أو متغير عشوائيβالتوزيع المسبق الفائق لـ Dirichlet، إما ثابت أو متغير عشوائيθد=1...مديريشليهك(α)ϕك=1...كديريشليهV(β)zد=1...مفئويك(θد)wد=1...م،ن=1...شمالدفئويV(ϕzد){\displaystyle {\begin{array}{lcl}{\boldsymbol {\alpha }}&\sim &{\text{A Dirichlet hyperprior, either a constant or a random variable}}\\{\boldsymbol {\beta }}&\sim &{\text{A Dirichlet hyperprior, either a constant or a random variable}}\\{\boldsymbol {\theta }}_{d=1\dots M}&\sim &\operatorname {Dirichlet} _{K}({\boldsymbol {\alpha }})\\{\boldsymbol {\phi }}_{k=1\dots K}&\sim &\operatorname {Dirichlet} _{V}({\boldsymbol {\beta }})\\z_{d=1\dots M}&\sim &\operatorname {Categorical} _{K}({\boldsymbol {\theta }}_{d})\\w_{d=1\dots M,n=1\dots N_{d}}&\sim &\operatorname {Categorical} _{V}({\boldsymbol {\phi }}_{z_{d}})\\\end{array}}}

يتشابه هذا النموذج، من نواحٍ عديدة، مع نموذج موضوعات LDA المذكور أعلاه، ولكنه يفترض وجود موضوع واحد لكل مستند بدلاً من موضوع واحد لكل كلمة، حيث يتكون المستند من مزيج من المواضيع. ويتضح هذا جلياً في النموذج المذكور أعلاه، والذي يُطابق نموذج LDA تماماً باستثناء وجود متغير كامن واحد فقط لكل مستند بدلاً من متغير كامن واحد لكل كلمة. ومرة ​​أخرى، نفترض أننا نُدمج جميع التوزيعات الاحتمالية المسبقة لـ Dirichlet.

إن الاحتمال الشرطي لكلمة معينة يكاد يكون مطابقًا لحالة LDA. ومرة ​​أخرى، جميع الكلمات المولدة بواسطة نفس التوزيع الاحتمالي المسبق لـ Dirichlet مترابطة. في هذه الحالة، يعني هذا أن كلمات جميع المستندات التي تحمل تصنيفًا معينًا مترابطة - مرة أخرى، يمكن أن يختلف هذا اعتمادًا على تصنيفات الكلمات، ولكن كل ما يهمنا هو العدد الإجمالي. ومن ثم:

برو(wدن=v|دبليو(-دن)،Z،β)  8دبليوvك،(-دن)+βv{\displaystyle {\begin{array}{lcl}\Pr(w_{dn}=v\mid \mathbb {W} ^{(-dn)},\mathbb {Z} ,{\boldsymbol {\beta }})\ &\propto \ &\#\mathbb {W} _{v}^{k,(-dn)}+\beta _{v}\\\end{array}}}

أين

8دبليوvك،(-دن)=عدد الكلمات ذات القيمة v من بين الوثائق التي تحمل علامة ك باستثناء wدن{\displaystyle {\begin{array}{lcl}\#\mathbb {W} _{v}^{k,(-dn)}&=&{\text{number of words having value }}v{\text{ among documents with label }}k{\text{ excluding }}w_{dn}\\\end{array}}}

مع ذلك، ثمة فرق جوهري في التوزيع الشرطي للمتغيرات الكامنة لتعيينات التصنيفات، وهو أن متغير التصنيف الواحد له عدة عقد فرعية بدلاً من عقدة واحدة فقط، وتحديداً العقد الخاصة بجميع الكلمات في مستند التصنيف. ويرتبط هذا ارتباطاً وثيقاً بالمناقشة السابقة حول العامل.F(|zد){\displaystyle \operatorname {F} (\dots \mid z_{d})}ينشأ ذلك من التوزيع المشترك. في هذه الحالة، يجب تطبيق التوزيع المشترك على جميع الكلمات في جميع المستندات التي تحتوي على تعيين تسمية يساوي قيمةzد{\displaystyle z_{d}}وله قيمة توزيع ديريشليه متعدد الحدود. علاوة على ذلك، لا يمكننا اختزال هذا التوزيع المشترك إلى توزيع شرطي على كلمة واحدة. بل يمكننا اختزاله فقط إلى توزيع شرطي مشترك أصغر على الكلمات في المستند للعلامة المعنية، وبالتالي لا يمكننا تبسيطه باستخدام الحيلة المذكورة أعلاه التي تُنتج مجموعًا بسيطًا للعدد المتوقع والاحتمال المسبق. مع أنه من الممكن إعادة كتابته كحاصل ضرب هذه المجاميع الفردية، إلا أن عدد العوامل كبير جدًا، وليس من الواضح أنه أكثر كفاءة من حساب احتمال توزيع ديريشليه متعدد الحدود مباشرةً.

يُعرف الإصدار أحادي البعد من توزيع ديريشلي متعدد الحدود باسم توزيع بيتا ذي الحدين .

يرتبط توزيع ديريشليه متعدد الحدود بتوزيع ذي الحدين السالب بشكل مشابه لعلاقة توزيع متعدد الحدود بتوزيع بواسون . [ 2 ]

الاستخدامات

يُستخدم توزيع ديريشليت متعدد الحدود في التصنيف الآلي للوثائق وتجميعها، وعلم الوراثة ، والاقتصاد ، ونمذجة القتال، والتسويق الكمي.

انظر أيضاً

مراجع

الاقتباسات

  1. 1 2 3 4 غلوسنكامب، ت. (2018). "المعالجة الاحتمالية لعدم اليقين الناتج عن الحجم المحدود لبيانات مونت كارلو الموزونة". EPJ Plus . 133 (6): 218. arXiv : 1712.01293 . Bibcode : 2018EPJP..133..218G . doi : 10.1140/epjp/i2018-12042-x . S2CID 125665629 . 
  2. النظرية 1 من Zhou, M. (2018). "تحليل العوامل الثنائية السالبة البايزية غير البارامترية" . التحليل البايزي . 13 (4): 1065–1093 . arXiv : 1604.07464 . doi : 10.1214/17-BA1070 .

مصادر