أساليب بايزية متغيرة

تُعدّ طرق بايز التباينية مجموعة من التقنيات لتقريب التكاملات المعقدة التي تظهر في الاستدلال البايزي والتعلم الآلي . تُستخدم هذه الطرق عادةً في النماذج الإحصائية المعقدة التي تتكون من متغيرات مُلاحظة (تُسمى عادةً "البيانات") بالإضافة إلى معلمات غير معروفة ومتغيرات كامنة ، مع وجود أنواع مختلفة من العلاقات بين هذه الأنواع الثلاثة من المتغيرات العشوائية ، كما يمكن وصفها بنموذج بياني . وكما هو معتاد في الاستدلال البايزي، تُجمع المعلمات والمتغيرات الكامنة معًا تحت مسمى "المتغيرات غير المُلاحظة". تُستخدم طرق بايز التباينية بشكل أساسي لغرضين:

  1. لتوفير تقريب تحليلي للاحتمالية اللاحقة للمتغيرات غير المرصودة، من أجل إجراء الاستدلال الإحصائي على هذه المتغيرات.
  2. يُستخدم هذا الأسلوب لاستخلاص حد أدنى للاحتمالية الحدية (أو ما يُسمى أحيانًا بالدليل ) للبيانات المرصودة (أي الاحتمالية الحدية للبيانات بالنظر إلى النموذج، مع تطبيق التهميش على المتغيرات غير المرصودة). ويُستخدم هذا الأسلوب عادةً لاختيار النموذج الأمثل ، حيث تقوم الفكرة العامة على أن ارتفاع الاحتمالية الحدية لنموذج معين يُشير إلى ملاءمة أفضل للبيانات من قِبل هذا النموذج، وبالتالي احتمالية أكبر أن يكون هذا النموذج هو الذي ولّد البيانات. (انظر أيضًا مقال عامل بايز ).

في الغرض الأول (وهو تقريب الاحتمال اللاحق)، يُعدّ بايز التبايني بديلاً لأساليب أخذ العينات مونت كارلو ، ولا سيما أساليب مونت كارلو لسلاسل ماركوف مثل أخذ عينات جيبس ، وذلك لاتباع نهج بايزي كامل للاستدلال الإحصائي على التوزيعات المعقدة التي يصعب تقييمها أو أخذ عينات منها مباشرةً . فعلى وجه الخصوص، بينما توفر تقنيات مونت كارلو تقريبًا عدديًا للاحتمال اللاحق الدقيق باستخدام مجموعة من العينات، يوفر بايز التبايني حلاً تحليليًا دقيقًا وأمثل محليًا لتقريب الاحتمال اللاحق.

يمكن اعتبار بايز التبايني امتدادًا لخوارزمية التوقع والتعظيم (EM)، بدءًا من تقدير الاحتمال الأقصى (ML) أو الاحتمال اللاحق الأقصى (MAP) لأكثر قيمة احتمالية لكل مُعامل، وصولًا إلى التقدير البايزي الكامل الذي يحسب (تقريبًا) التوزيع اللاحق الكامل للمعلمات والمتغيرات الكامنة. وكما هو الحال في خوارزمية التوقع والتعظيم، يجد بايز التبايني مجموعة من القيم المثلى للمعلمات، وله نفس البنية التناوبية لخوارزمية التوقع والتعظيم، استنادًا إلى مجموعة من المعادلات المترابطة (المعتمدة على بعضها البعض) التي لا يمكن حلها تحليليًا.

في العديد من التطبيقات، يُنتج بايز التبايني حلولًا بدقة مماثلة لأخذ عينات جيبس، ولكن بسرعة أكبر. مع ذلك، غالبًا ما يتطلب اشتقاق مجموعة المعادلات المستخدمة لتحديث المعلمات بشكل تكراري جهدًا كبيرًا مقارنةً باشتقاق معادلات أخذ عينات جيبس ​​المماثلة. وينطبق هذا حتى على العديد من النماذج البسيطة من حيث المفهوم، كما يتضح أدناه في حالة نموذج أساسي غير هرمي بمعلمتين فقط وبدون متغيرات كامنة.

الاشتقاق الرياضي

مشكلة

في الاستدلال التبايني ، التوزيع الاحتمالي اللاحق لمجموعة من المتغيرات غير المرصودةZ={Z1...Zن}{\displaystyle \mathbf {Z} =\{Z_{1}\dots Z_{n}\}}بالنظر إلى بعض البياناتX{\displaystyle \mathbf {X} }يتم تقريبها بما يسمى بالتوزيع التبايني ،سؤال(Z):{\displaystyle Q(\mathbf {Z} ):}

P(Z|X)سؤال(Z).{\displaystyle P(\mathbf {Z} \mid \mathbf {X} )\approx Q(\mathbf {Z} ).}

التوزيعسؤال(Z){\displaystyle Q(\mathbf {Z} )}يقتصر على الانتماء إلى عائلة من التوزيعات ذات شكل أبسط منP(Z|X){\displaystyle P(\mathbf {Z} \mid \mathbf {X} )}(على سبيل المثال، عائلة من التوزيعات الغاوسية)، تم اختيارها بقصد جعلسؤال(Z){\displaystyle Q(\mathbf {Z} )}على غرار الوضع الخلفي الحقيقي،P(Z|X){\displaystyle P(\mathbf {Z} \mid \mathbf {X} )}.

يتم قياس التشابه (أو الاختلاف) من خلال دالة الاختلافد(سؤال؛P){\displaystyle d(Q;P)}وبالتالي يتم إجراء الاستدلال عن طريق اختيار التوزيعسؤال(Z){\displaystyle Q(\mathbf {Z} )}ذلك يقللد(سؤال؛P){\displaystyle d(Q;P)}.

تباعد KL

يستخدم النوع الأكثر شيوعًا من بايز التبايني تباعد كولباك-لايبير (تباعد KL) للمجموعة Q عن المجموعة P كدالة عدم تشابه. هذا الاختيار يجعل عملية التصغير قابلة للتطبيق. يُعرَّف تباعد KL على النحو التالي:

دكل(سؤالP)Zسؤال(Z)سجلسؤال(Z)P(Z|X).{\displaystyle D_{\mathrm {KL}}(Q\parallel P)\triangleq \sum _{\mathbf {Z} }Q(\mathbf {Z} )\log {\frac {Q(\mathbf {Z} )}{P(\mathbf {Z} \mid \mathbf {X} )}}.}

لاحظ أن قيمتي Q و P معكوسة عما هو متوقع. هذا الاستخدام لتباعد كولباك-لايبير المعكوس مشابه من حيث المفهوم لخوارزمية التوقع والتعظيم . (استخدام تباعد كولباك-لايبير بالطريقة الأخرى ينتج عنه خوارزمية نشر التوقع ).

صعوبة الحل

تُستخدم تقنيات حساب التفاضل والتكامل عادةً لتكوين تقريب لـ:

P(Z|X)=P(X|Z)P(Z)P(X)=P(X|Z)P(Z)ZP(X،Z)دZ{\displaystyle P(\mathbf {Z} \mid \mathbf {X} )={\frac {P(\mathbf {X} \mid \mathbf {Z} )P(\mathbf {Z} )}{P(\mathbf {X} )}}={\frac {P(\mathbf {X} \mid \mathbf {Z} )P(\mathbf {Z} )}{\int _{\mathbf {Z} }P(\mathbf {X} ,\mathbf {Z} ')\,d\mathbf {Z} '}}}

التهميش علىZ{\displaystyle \mathbf {Z} }لحسابP(X){\displaystyle P(\mathbf {X} )}عادةً ما يكون حساب المقام أمرًا صعبًا، لأن مساحة البحث لـZ{\displaystyle \mathbf {Z} }إنها كبيرة من الناحية التوافقية. لذلك، نسعى إلى إيجاد تقريب، باستخدامسؤال(Z)P(Z|X){\displaystyle Q(\mathbf {Z} )\approx P(\mathbf {Z} \mid \mathbf {X} )}.

الحد الأدنى للأدلة

بشرطP(Z|X)=P(X،Z)P(X){\displaystyle P(\mathbf {Z} \mid \mathbf {X} )={\frac {P(\mathbf {X} ,\mathbf {Z} )}{P(\mathbf {X} )}}}ويمكن كتابة تباعد كولباك-لايبير المذكور أعلاه أيضًا على النحو التالي:

دكل(سؤالP)=Zسؤال(Z)[سجلسؤال(Z)P(Z،X)+سجلP(X)]=Zسؤال(Z)[سجلسؤال(Z)-سجلP(Z،X)]+Zسؤال(Z)[سجلP(X)]{\displaystyle {\begin{array}{rl}D_{\mathrm {KL} }(Q\parallel P)&=\sum _{\mathbf {Z} }Q(\mathbf {Z} )\left[\log {\frac {Q(\mathbf {Z} )}{P(\mathbf {Z} ,\mathbf {X} )}}+\log P(\mathbf {X} )\right]\\&=\sum _{\mathbf {Z} }Q(\mathbf {Z} )\left[\log Q(\mathbf {Z} )-\log P(\mathbf {Z} ,\mathbf {X} )\right]+\sum _{\mathbf {Z} }Q(\mathbf {Z} )\left[\log P(\mathbf {X} )\right]\end{array}}}

لأنP(X){\displaystyle P(\mathbf {X} )}ثابت بالنسبة إلىZ{\displaystyle \mathbf {Z} }وZسؤال(Z)=1{\displaystyle \sum _{\mathbf {Z} }Q(\mathbf {Z} )=1}لأنسؤال(Z){\displaystyle Q(\mathbf {Z} )}لدينا توزيع

دكل(سؤالP)=Zسؤال(Z)[سجلسؤال(Z)-سجلP(Z،X)]+سجلP(X){\displaystyle D_{\mathrm {KL} }(Q\parallel P)=\sum _{\mathbf {Z} }Q(\mathbf {Z} )\left[\log Q(\mathbf {Z} )-\log P(\mathbf {Z} ,\mathbf {X} )\right]+\log P(\mathbf {X} )}

والذي، وفقًا لتعريف القيمة المتوقعة ( لمتغير عشوائي منفصل )، يمكن كتابته على النحو التالي

دكل(سؤالP)=هـسؤال[سجلسؤال(Z)-سجلP(Z،X)]+سجلP(X){\displaystyle D_{\mathrm {KL} }(Q\parallel P)=\mathbb {E} _{\mathbf {Q} }\left[\log Q(\mathbf {Z} )-\log P(\mathbf {Z} ,\mathbf {X} )\right]+\log P(\mathbf {X} )}

والتي يمكن إعادة ترتيبها لتصبح

سجلP(X)=دكل(سؤالP)-هـسؤال[سجلسؤال(Z)-سجلP(Z،X)]=دكل(سؤالP)+ل(سؤال){\displaystyle {\begin{array}{rl}\log P(\mathbf {X} )&=D_{\mathrm {KL} }(Q\parallel P)-\mathbb {E} _{\mathbf {Q} }\left[\log Q(\mathbf {Z} )-\log P(\mathbf {Z} ,\mathbf {X} )\right]\\&=D_{\mathrm {KL} }(Q\parallel P)+{\mathcal {L}}(Q)\end{array}}}

كما هو الحال في الأدلة السجليةسجلP(X){\displaystyle \log P(\mathbf {X} )}ثابت بالنسبة إلىسؤال{\displaystyle Q}، مما يؤدي إلى تعظيم الحد النهائيل(سؤال){\displaystyle {\mathcal {L}}(Q)}يقلل من تباعد كولباك-لايبير لـسؤال{\displaystyle Q}منP{\displaystyle P}عن طريق الاختيار المناسب لـسؤال{\displaystyle Q}،ل(سؤال){\displaystyle {\mathcal {L}}(Q)}يصبح من السهل حسابه وتعظيمه. وبالتالي، لدينا تقريب تحليلي.سؤال{\displaystyle Q}للخلفP(Z|X){\displaystyle P(\mathbf {Z} \mid \mathbf {X} )}وحد أدنىل(سؤال){\displaystyle {\mathcal {L}}(Q)}للحصول على دليل السجلسجلP(X){\displaystyle \log P(\mathbf {X} )}(بما أن تباعد KL غير سالب).

الحد الأدنىل(سؤال){\displaystyle {\mathcal {L}}(Q)}تُعرف باسم الطاقة الحرة التباينية (السالبة) قياسًا على الطاقة الحرة الديناميكية الحرارية، لأنه يمكن التعبير عنها أيضًا كطاقة سالبة.هـسؤال[سجلP(Z،X)]{\displaystyle \operatorname {E} _{Q}[\log P(\mathbf {Z} ,\mathbf {X} )]}بالإضافة إلى إنتروبياسؤال{\displaystyle Q}. على المدىل(سؤال){\displaystyle {\mathcal {L}}(Q)}يُعرف أيضًا باسم الحد الأدنى للأدلة ، ويختصر بـ ELBO ، للتأكيد على أنه حد أدنى (أسوأ حالة) على الدليل اللوغاريتمي للبيانات.

البراهين

باستخدام نظرية فيثاغورس المعممة لتباعد بريغمان ، والتي يعتبر تباعد KL حالة خاصة منها، يمكن إثبات ما يلي: [ 1 ] [ 2 ]

نظرية فيثاغورس المعممة لتباعد بريغمان [ 2 ]
دكل(سؤالP)دكل(سؤالسؤال*)+دكل(سؤال*P)،سؤال*ج{\displaystyle D_{\mathrm {KL} }(Q\parallel P)\geq D_{\mathrm {KL} }(Q\parallel Q^{*})+D_{\mathrm {KL} }(Q^{*}\parallel P),\forall Q^{*}\in {\mathcal {C}}}

أين ج{\displaystyle {\mathcal {C}}}هي مجموعة محدبة ، وتتحقق المساواة إذا:

سؤال=سؤال*argمينسؤالجدكل(سؤالP).{\displaystyle Q=Q^{*}\triangleq \arg \min _{Q\in {\mathcal {C}}}D_{\mathrm {KL} }(Q\parallel P).}

في هذه الحالة، المُصغِّر العالميسؤال*(Z)=q*(Z1|Z2)q*(Z2)=q*(Z2|Z1)q*(Z1)،{\displaystyle Q^{*}(\mathbf {Z} )=q^{*}(\mathbf {Z} _{1}\mid \mathbf {Z} _{2})q^{*}(\mathbf {Z} _{2})=q^{*}(\mathbf {Z} _{2}\mid \mathbf {Z} _{1})q^{*}(\mathbf {Z} _{1}),}معZ={Z1،Z2}،{\displaystyle \mathbf {Z} =\{\mathbf {Z_{1}} ,\mathbf {Z_{2}} \},}يمكن العثور عليها على النحو التالي: [ 1 ]

q*(Z2)=P(X)ζ(X)P(Z2|X)خبرة(دكل(q*(Z1|Z2)P(Z1|Z2،X)))=1ζ(X)خبرةهـq*(Z1|Z2)(سجلP(Z،X)q*(Z1|Z2))،{\displaystyle {\begin{array}{rl}q^{*}(\mathbf {Z} _{2})&={\frac {P(\mathbf {X} )}{\zeta (\mathbf {X} )}}{\frac {P(\mathbf {Z} _{2}\mid \mathbf {X} )}{\exp(D_{\mathrm {KL} }(q^{*}(\mathbf {Z} _{1}\mid \mathbf {Z} _{2})\parallel P(\mathbf {Z} _{1}\mid \mathbf {Z} _{2},\mathbf {X} )))}}\\&={\frac {1}{\zeta (\mathbf {X} )}}\exp \mathbb {E} _{q^{*}(\mathbf {Z} _{1}\mid \mathbf {Z} _{2})}\left(\log {\frac {P(\mathbf {Z} ,\mathbf {X} )}{q^{*}(\mathbf {Z} _{1}\mid \mathbf {Z} _{2})}}\right),\end{array}}}

حيث يكون ثابت التطبيع هو:

ζ(X)=P(X)Z2P(Z2|X)خبرة(دكل(q*(Z1|Z2)P(Z1|Z2،X)))=Z2خبرةهـq*(Z1|Z2)(سجلP(Z،X)q*(Z1|Z2)).{\displaystyle {\begin{array}{rl}\zeta (\mathbf {X} )&=P(\mathbf {X} )\int _{\mathbf {Z} _{2}}{\frac {P(\mathbf {Z} _{2}\mid \mathbf {X} )}{\exp(D_{\mathrm {KL} }(q^{*}(\mathbf {Z} _{1}\mid \mathbf {Z} _{2})\parallel P(\mathbf {Z} _{1}\mid \mathbf {Z} _{2},\mathbf {X} )))}}\\&=\int _{\mathbf {Z} _{2}}\exp \mathbb {E} _{q^{*}(\mathbf {Z} _{1}\mid \mathbf {Z} _{2})}\left(\log {\frac {P(\mathbf {Z} ,\mathbf {X} )}{q^{*}(\mathbf {Z} _{1}\mid \mathbf {Z} _{2})}}\right).\end{array}}}

على المدىζ(X){\displaystyle \zeta (\mathbf {X} )}يُطلق عليه غالبًا اسم الحد الأدنى للأدلة ( ELBO ) في الممارسة العملية، لأنP(X)ζ(X)=خبرة(ل(سؤال*)){\displaystyle P(\mathbf {X} )\geq \zeta (\mathbf {X} )=\exp({\mathcal {L}}(Q^{*}))}، [ 1 ] كما هو موضح أعلاه.

عن طريق تبادل الأدوارZ1{\displaystyle \mathbf {Z} _{1}}وZ2،{\displaystyle \mathbf {Z} _{2},}يمكننا حساب القيمة التقريبية بشكل متكررq*(Z1){\displaystyle q^{*}(\mathbf {Z} _{1})}وq*(Z2){\displaystyle q^{*}(\mathbf {Z} _{2})}من الهوامش الحقيقية للنموذجP(Z1|X){\displaystyle P(\mathbf {Z} _{1}\mid \mathbf {X} )}وP(Z2|X)،{\displaystyle P(\mathbf {Z} _{2}\mid \mathbf {X} ),}على التوالي. على الرغم من أن هذه الطريقة التكرارية مضمونة التقارب بشكل رتيب، [ 1 ] فإن التقاربسؤال*{\displaystyle Q^{*}}هو مجرد مُصغِّر محلي لـدكل(سؤالP){\displaystyle D_{\mathrm {KL} }(Q\parallel P)}.

إذا كانت المساحة المقيدةج{\displaystyle {\mathcal {C}}}محصور داخل حيز مستقل، أيq*(Z1|Z2)=q*(Z1)،{\displaystyle q^{*}(\mathbf {Z} _{1}\mid \mathbf {Z} _{2})=q^{*}(\mathbf {Z_{1}} ),}سيصبح المخطط التكراري المذكور أعلاه ما يسمى بتقريب المجال المتوسط.سؤال*(Z)=q*(Z1)q*(Z2)،{\displaystyle Q^{*}(\mathbf {Z} )=q^{*}(\mathbf {Z} _{1})q^{*}(\mathbf {Z} _{2}),}كما هو موضح أدناه.

تقريب المجال المتوسط

التوزيع التباينيسؤال(Z){\displaystyle Q(\mathbf {Z} )}يُفترض عادةً أن المصفوفة قابلة للتحليل إلى عوامل على جزء معين من المتغيرات الكامنة، أي بالنسبة لجزء معين من المتغيرات الكامنة.Z{\displaystyle \mathbf {Z} }داخلZ1...Zم{\displaystyle \mathbf {Z} _{1}\dots \mathbf {Z} _{M}}،

سؤال(Z)=أنا=1مqأنا(Zأنا|X){\displaystyle Q(\mathbf {Z} )=\prod _{i=1}^{M}q_{i}(\mathbf {Z} _{i}\mid \mathbf {X} )}

يمكن إثبات ذلك باستخدام حساب التفاضل والتكامل (ومن هنا جاء اسم "بايز التبايني") أن التوزيع "الأفضل"qج*{\displaystyle q_{j}^{*}}لكل عامل من العواملqج{\displaystyle q_{j}}(من حيث التوزيع الذي يقلل من تباعد كولباك-لايبير، كما هو موضح أعلاه) يحقق: [ 3 ]

qج*(Zج|X)=هـهـq-ج*[lnص(Z،X)]هـهـq-ج*[lnص(Z،X)]دZج{\displaystyle q_{j}^{*}(\mathbf {Z} _{j}\mid \mathbf {X} )={\frac {e^{\operatorname {E} _{q_{-j}^{*}}[\ln p(\mathbf {Z} ,\mathbf {X} )]}}{\int e^{\operatorname {E} _{q_{-j}^{*}}[\ln p(\mathbf {Z} ,\mathbf {X} )]}\,d\mathbf {Z} _{j}}}}

أينهـq-ج*[lnص(Z،X)]{\displaystyle \operatorname {E} _{q_{-j}^{*}}[\ln p(\mathbf {Z} ,\mathbf {X} )]}هو القيمة المتوقعة للوغاريتم الاحتمال المشترك للبيانات والمتغيرات الكامنة، مأخوذة بالنسبة إلىq*{\displaystyle q^{*}}بالنسبة لجميع المتغيرات غير الموجودة في التقسيم: راجع اللمة 4.1 من [ 4 ] لاشتقاق التوزيعqج*(Zج|X){\displaystyle q_{j}^{*}(\mathbf {Z} _{j}\mid \mathbf {X} )}.

في الواقع العملي، عادةً ما نعمل باستخدام اللوغاريتمات، أي:

lnqج*(Zج|X)=هـq-ج*[lnص(Z،X)]+ثابت{\displaystyle \ln q_{j}^{*}(\mathbf {Z} _{j}\mid \mathbf {X} )=\operatorname {E} _{q_{-j}^{*}}[\ln p(\mathbf {Z} ,\mathbf {X} )]+{\text{constant}}}

الثابت في التعبير أعلاه مرتبط بثابت التوحيد (المقام في التعبير أعلاه لـqج*{\displaystyle q_{j}^{*}}) وعادة ما يتم إعادة تثبيتها عن طريق الفحص، حيث يمكن عادةً التعرف على بقية التعبير على أنه نوع معروف من التوزيع (مثل التوزيع الغاوسي ، والتوزيع الغاما ، وما إلى ذلك).

باستخدام خصائص التوقعات، فإن التعبيرهـq-ج*[lnص(Z،X)]{\displaystyle \operatorname {E} _{q_{-j}^{*}}[\ln p(\mathbf {Z} ,\mathbf {X} )]}يمكن عادةً تبسيطها إلى دالة للمعاملات الفائقة الثابتة للتوزيعات المسبقة على المتغيرات الكامنة، وتوقعات (وأحيانًا لحظات أعلى مثل التباين ) المتغيرات الكامنة غير الموجودة في التقسيم الحالي (أي المتغيرات الكامنة غير المدرجة فيZج{\displaystyle \mathbf {Z} _{j}}يُنشئ هذا تبعيات دائرية بين معلمات التوزيعات على المتغيرات في قسم واحد وتوقعات المتغيرات في الأقسام الأخرى. وهذا يُشير بطبيعة الحال إلى خوارزمية تكرارية ، تُشبه إلى حد كبير خوارزمية التوقع والتعظيم (EM )، حيث تُهيأ توقعات (وربما العزوم العليا) المتغيرات الكامنة بطريقة ما (ربما عشوائيًا)، ثم تُحسب معلمات كل توزيع بدوره باستخدام القيم الحالية للتوقعات، وبعد ذلك تُضبط توقعات التوزيع المحسوب حديثًا بشكل مناسب وفقًا للمعلمات المحسوبة. ومن المؤكد أن خوارزمية من هذا النوع ستتقارب . [ 5 ]

بمعنى آخر، لكل تقسيم من تقسيمات المتغيرات، من خلال تبسيط صيغة التوزيع على متغيرات التقسيم ودراسة التبعية الوظيفية للتوزيع على المتغيرات المعنية، يمكن عادةً تحديد عائلة التوزيع (والتي بدورها تحدد قيمة الثابت). تُعبَّر صيغة معلمات التوزيع بدلالة المعلمات الفائقة للتوزيعات السابقة (وهي ثوابت معروفة)، وكذلك بدلالة توقعات دوال المتغيرات في التقسيمات الأخرى. عادةً ما يمكن تبسيط هذه التوقعات إلى دوال لتوقعات المتغيرات نفسها (أي المتوسطات ) ؛ وأحيانًا تظهر توقعات مربعات المتغيرات (والتي يمكن ربطها بتباين المتغيرات )، أو توقعات قوى أعلى (أي العزوم الأعلى ). في معظم الحالات، تكون توزيعات المتغيرات الأخرى من عائلات معروفة، ويمكن البحث عن صيغ التوقعات ذات الصلة. ومع ذلك، تعتمد هذه الصيغ على معلمات تلك التوزيعات، والتي بدورها تعتمد على التوقعات المتعلقة بالمتغيرات الأخرى. والنتيجة هي أن صيغ معلمات توزيعات كل متغير يمكن التعبير عنها كسلسلة من المعادلات ذات علاقات غير خطية متبادلة بين المتغيرات. عادةً، لا يمكن حل نظام المعادلات هذا مباشرةً. مع ذلك، وكما ذُكر سابقًا، تشير هذه العلاقات إلى خوارزمية تكرارية بسيطة، مضمونة التقارب في معظم الحالات. وسيوضح مثالٌ هذه العملية بشكلٍ أفضل.

صيغة الازدواجية للاستدلال التبايني

رسم توضيحي لخوارزمية الاستدلال التبايني للصعود الإحداثي بواسطة صيغة الازدواجية [ 4 ]

تُعرف النظرية التالية بصيغة الازدواجية للاستدلال التبايني. [ 4 ] وهي تشرح بعض الخصائص المهمة للتوزيعات التباينية المستخدمة في طرق بايز التباينية.

نظرية: لنفترض وجود فضاءين احتماليين(Θ،F،P){\displaystyle (\Theta ,{\mathcal {F}},P)}و(Θ،F،سؤال){\displaystyle (\Theta ,{\mathcal {F}},Q)}معسؤالP{\displaystyle Q\ll P}افترض وجود مقياس احتمالي مهيمن مشتركλ{\displaystyle \lambda }بحيثPλ{\displaystyle P\ll \lambda }وسؤالλ{\displaystyle Q\ll \lambda }. يتركح{\displaystyle h}يرمز إلى أي متغير عشوائي ذي قيمة حقيقية على(Θ،F،P){\displaystyle (\Theta ,{\mathcal {F}},P)}ذلك يرضيخبرةحل1(P){\displaystyle \exp h\in L_{1}(P)}ثم تتحقق المساواة التالية

سجلهـP[خبرةح]=رشفةسؤالP{هـسؤال[ح]-دكوالالمبور(سؤالP)}.{\displaystyle \log E_{P}[\exp h]={\text{sup}}_{Q\ll P}\{E_{Q}[h]-D_{\text{KL}}(Q\parallel P)\}.}

علاوة على ذلك، يتم الوصول إلى القيمة العليا على الجانب الأيمن إذا وفقط إذا كانت صحيحة

q(θ)ص(θ)=خبرةح(θ)هـP[خبرةح]،{\displaystyle {\frac {q(\theta )}{p(\theta )}}={\frac {\exp h(\theta )}{E_{P}[\exp h]}},}

شبه مؤكد فيما يتعلق بمقياس الاحتماليةسؤال{\displaystyle Q}، أينص(θ)=دP/دλ{\displaystyle p(\theta )=dP/d\lambda }وq(θ)=دسؤال/دλ{\displaystyle q(\theta )=dQ/d\lambda }تشير إلى مشتقات رادون-نيكوديم لمقاييس الاحتمالP{\displaystyle P}وسؤال{\displaystyle Q}بالنسبة إلىλ{\displaystyle \lambda }، على التوالى.

مثال أساسي

لنفترض نموذجًا بايزيًا بسيطًا غير هرمي يتكون من مجموعة من المشاهدات المستقلة والمتطابقة التوزيع من توزيع غاوسي ، بمتوسط ​​وتباين غير معروفين . [ 6 ] فيما يلي، سنتناول هذا النموذج بالتفصيل لتوضيح آلية عمل طريقة بايز التباينية.

لتبسيط الحسابات الرياضية، سنستخدم في المثال التالي مفهوم الدقة - أي مقلوب التباين (أو في التوزيع الغاوسي متعدد المتغيرات، معكوس مصفوفة التغاير ) - بدلاً من التباين نفسه. (من الناحية النظرية، الدقة والتباين متكافئان لوجود علاقة تناظرية بينهما).

النموذج الرياضي

نضع توزيعات احتمالية مسبقة مترافقة على المتوسط ​​المجهولμ{\displaystyle \mu }والدقةτ{\displaystyle \tau }أي أن المتوسط ​​يتبع التوزيع الطبيعي (غاوسي) بينما تتبع الدقة التوزيع الطبيعي (غاما) . بعبارة أخرى:

τجاما(أ0،ب0)μ|τشمال(μ0،(λ0τ)-1){x1،...،xشمال}شمال(μ،τ-1)شمال=عدد نقاط البيانات{\displaystyle {\begin{aligned}\tau &\sim \operatorname {Gamma} (a_{0},b_{0})\\\mu |\tau &\sim {\mathcal {N}}(\mu _{0},(\lambda _{0}\tau )^{-1})\\\{x_{1},\dots ,x_{N}\}&\sim {\mathcal {N}}(\mu ,\tau ^{-1})\\N&={\text{number of data points}}\end{aligned}}}

المعلمات الفائقةμ0،λ0،أ0{\displaystyle \mu _{0},\lambda _{0},a_{0}}وب0{\displaystyle b_{0}}في التوزيعات الاحتمالية المسبقة، تكون القيم ثابتة ومُعطاة. ويمكن ضبطها على أعداد موجبة صغيرة لإعطاء توزيعات احتمالية مسبقة واسعة النطاق تشير إلى عدم معرفة التوزيعات الاحتمالية المسبقة لـμ{\displaystyle \mu }وτ{\displaystyle \tau }.

لقد أُعطيناشمال{\displaystyle N}نقاط البياناتX={x1،...،xشمال}{\displaystyle \mathbf {X} =\{x_{1},\ldots ,x_{N}\}}وهدفنا هو استنتاج التوزيع الاحتمالي اللاحقq(μ،τ)=ص(μ،τ|x1،...،xشمال){\displaystyle q(\mu ,\tau )=p(\mu ,\tau \mid x_{1},\ldots ,x_{N})}من المعاييرμ{\displaystyle \mu }وτ.{\displaystyle \tau .}

الاحتمال المشترك

يمكن إعادة كتابة الاحتمال المشترك لجميع المتغيرات على النحو التالي:

ص(X،μ،τ)=ص(X|μ،τ)ص(μ|τ)ص(τ){\displaystyle p(\mathbf {X} ,\mu ,\tau )=p(\mathbf {X} \mid \mu ,\tau )p(\mu \mid \tau )p(\tau )}

حيث تكون العوامل الفردية

ص(X|μ،τ)=ن=1شمالشمال(xن|μ،τ-1)ص(μ|τ)=شمال(μ|μ0،(λ0τ)-1)ص(τ)=جاما(τ|أ0،ب0){\displaystyle {\begin{aligned}p(\mathbf {X} \mid \mu ,\tau )&=\prod _{n=1}^{N}{\mathcal {N}}(x_{n}\mid \mu ,\tau ^{-1})\\p(\mu \mid \tau )&={\mathcal {N}}\left(\mu \mid \mu _{0},(\lambda _{0}\tau )^{-1}\right)\\p(\tau )&=\operatorname {Gamma} (\tau \mid a_{0},b_{0})\end{aligned}}}

أين

شمال(x|μ،σ2)=12πσ2هـ-(x-μ)22σ2جاما(τ|أ،ب)=1Γ(أ)بأτأ-1هـ-بτ{\displaystyle {\begin{aligned}{\mathcal {N}}(x\mid \mu ,\sigma ^{2})&={\frac {1}{\sqrt {2\pi \sigma ^{2}}}}e^{\frac {-(x-\mu )^{2}}{2\sigma ^{2}}}\\\operatorname {Gamma} (\tau \mid a,b)&={\frac {1}{\Gamma (a)}}b^{a}\tau ^{a-1}e^{-b\tau }\end{aligned}}}

التقريب المُحلل

افترض أنq(μ،τ)=q(μ)q(τ){\displaystyle q(\mu ,\tau )=q(\mu )q(\tau )}أي أن التوزيع الاحتمالي اللاحق يتحلل إلى عوامل مستقلة لـμ{\displaystyle \mu }وτ{\displaystyle \tau }هذا النوع من الافتراضات هو أساس طريقة بايز التباينية. في الواقع، لا يتصرف التوزيع الاحتمالي الخلفي الحقيقي بهذه الطريقة (في الواقع، في هذه الحالة البسيطة، من المعروف أنه توزيع غاوسي-غاما )، وبالتالي ستكون النتيجة التي نحصل عليها تقريبية.

اشتقاق q ( μ )

ثم

lnqμ*(μ)=هـτ[lnص(X|μ،τ)+lnص(μ|τ)+lnص(τ)]+ج=هـτ[lnص(X|μ،τ)]+هـτ[lnص(μ|τ)]+هـτ[lnص(τ)]+ج=هـτ[lnن=1شمالشمال(xن|μ،τ-1)]+هـτ[lnشمال(μ|μ0،(λ0τ)-1)]+ج2=هـτ[lnن=1شمالτ2πهـ-(xن-μ)2τ2]+هـτ[lnλ0τ2πهـ-(μ-μ0)2λ0τ2]+ج2=هـτ[ن=1شمال(12(lnτ-ln2π)-(xن-μ)2τ2)]+هـτ[12(lnλ0+lnτ-ln2π)-(μ-μ0)2λ0τ2]+ج2=هـτ[ن=1شمال-(xن-μ)2τ2]+هـτ[-(μ-μ0)2λ0τ2]+هـτ[ن=1شمال12(lnτ-ln2π)]+هـτ[12(lnλ0+lnτ-ln2π)]+ج2=هـτ[ن=1شمال-(xن-μ)2τ2]+هـτ[-(μ-μ0)2λ0τ2]+ج3=-هـτ[τ]2{ن=1شمال(xن-μ)2+λ0(μ-μ0)2}+ج3{\displaystyle {\begin{aligned}\ln q_{\mu }^{*}(\mu )&=\operatorname {E} _{\tau }\left[\ln p(\mathbf {X} \mid \mu ,\tau )+\ln p(\mu \mid \tau )+\ln p(\tau )\right]+C\\&=\operatorname {E} _{\tau }\left[\ln p(\mathbf {X} \mid \mu ,\tau )\right]+\operatorname {E} _{\tau }\left[\ln p(\mu \mid \tau )\right]+\operatorname {E} _{\tau }\left[\ln p(\tau )\right]+C\\&=\operatorname {E} _{\tau }\left[\ln \prod _{n=1}^{N}{\mathcal {N}}\left(x_{n}\mid \mu ,\tau ^{-1}\right)\right]+\operatorname {E} _{\tau }\left[\ln {\mathcal {N}}\left(\mu \mid \mu _{0},(\lambda _{0}\tau )^{-1}\right)\right]+C_{2}\\&=\operatorname {E} _{\tau }\left[\ln \prod _{n=1}^{N}{\sqrt {\frac {\tau }{2\pi }}}e^{-{\frac {(x_{n}-\mu )^{2}\tau }{2}}}\right]+\operatorname {E} _{\tau }\left[\ln {\sqrt {\frac {\lambda _{0}\tau }{2\pi }}}e^{-{\frac {(\mu -\mu _{0})^{2}\lambda _{0}\tau }{2}}}\right]+C_{2}\\&=\operatorname {E} _{\tau }\left[\sum _{n=1}^{N}\left({\frac {1}{2}}(\ln \tau -\ln 2\pi )-{\frac {(x_{n}-\mu )^{2}\tau }{2}}\right)\right]+\operatorname {E} _{\tau }\left[{\frac {1}{2}}(\ln \lambda _{0}+\ln \tau -\ln 2\pi )-{\frac {(\mu -\mu _{0})^{2}\lambda _{0}\tau }{2}}\right]+C_{2}\\&=\operatorname {E} _{\tau }\left[\sum _{n=1}^{N}-{\frac {(x_{n}-\mu )^{2}\tau }{2}}\right]+\operatorname {E} _{\tau }\left[-{\frac {(\mu -\mu _{0})^{2}\lambda _{0}\tau }{2}}\right]+\operatorname {E} _{\tau }\left[\sum _{n=1}^{N}{\frac {1}{2}}(\ln \tau -\ln 2\pi )\right]+\operatorname {E} _{\tau }\left[{\frac {1}{2}}(\ln \lambda _{0}+\ln \tau -\ln 2\pi )\right]+C_{2}\\&=\operatorname {E} _{\tau }\left[\sum _{n=1}^{N}-{\frac {(x_{n}-\mu )^{2}\tau }{2}}\right]+\operatorname {E} _{\tau }\left[-{\frac {(\mu -\mu _{0})^{2}\lambda _{0}\tau }{2}}\right]+C_{3}\\&=-{\frac {\operatorname {E} _{\tau }[\tau ]}{2}}\left\{\sum _{n=1}^{N}(x_{n}-\mu )^{2}+\lambda _{0}(\mu -\mu _{0})^{2}\right\}+C_{3}\end{aligned}}}

في الاشتقاق أعلاه،ج{\displaystyle C}،ج2{\displaystyle C_{2}}وج3{\displaystyle C_{3}}تشير إلى القيم الثابتة بالنسبة إلىμ{\displaystyle \mu }لاحظ أن المصطلحهـτ[lnص(τ)]{\displaystyle \operatorname {E} _{\tau }[\ln p(\tau )]}ليس وظيفة منμ{\displaystyle \mu }وستكون لها نفس القيمة بغض النظر عن قيمةμ{\displaystyle \mu }لذا، في السطر 3، يمكننا دمجها في الحد الثابت في النهاية. ونفعل الشيء نفسه في السطر 7.

السطر الأخير هو ببساطة متعدد حدود من الدرجة الثانية فيμ{\displaystyle \mu }بما أن هذا هو لوغاريتمqμ*(μ){\displaystyle q_{\mu }^{*}(\mu )}، يمكننا أن نرى ذلكqμ*(μ){\displaystyle q_{\mu }^{*}(\mu )}هو نفسه توزيع غاوسي .

مع قدر معين من العمليات الحسابية المملة (توسيع المربعات داخل الأقواس، وفصل وتجميع الحدود التي تتضمنμ{\displaystyle \mu }وμ2{\displaystyle \mu ^{2}}واستكمال المربع فوقμ{\displaystyle \mu })، يمكننا استنتاج معلمات التوزيع الغاوسي:

lnqμ*(μ)=-هـτ[τ]2{ن=1شمال(xن-μ)2+λ0(μ-μ0)2}+ج3=-هـτ[τ]2{ن=1شمال(xن2-2xنμ+μ2)+λ0(μ2-2μ0μ+μ02)}+ج3=-هـτ[τ]2{(ن=1شمالxن2)-2(ن=1شمالxن)μ+(ن=1شمالμ2)+λ0μ2-2λ0μ0μ+λ0μ02}+ج3=-هـτ[τ]2{(λ0+شمال)μ2-2(λ0μ0+ن=1شمالxن)μ+(ن=1شمالxن2)+λ0μ02}+ج3=-هـτ[τ]2{(λ0+شمال)μ2-2(λ0μ0+ن=1شمالxن)μ}+ج4=-هـτ[τ]2{(λ0+شمال)μ2-2(λ0μ0+ن=1شمالxنλ0+شمال)(λ0+شمال)μ}+ج4=-هـτ[τ]2{(λ0+شمال)(μ2-2(λ0μ0+ن=1شمالxنλ0+شمال)μ)}+ج4=-هـτ[τ]2{(λ0+شمال)(μ2-2(λ0μ0+ن=1شمالxنλ0+شمال)μ+(λ0μ0+ن=1شمالxنλ0+شمال)2-(λ0μ0+ن=1شمالxنλ0+شمال)2)}+ج4=-هـτ[τ]2{(λ0+شمال)(μ2-2(λ0μ0+ن=1شمالxنλ0+شمال)μ+(λ0μ0+ن=1شمالxنλ0+شمال)2)}+ج5=-هـτ[τ]2{(λ0+شمال)(μ-λ0μ0+ن=1شمالxنλ0+شمال)2}+ج5=-12(λ0+شمال)هـτ[τ](μ-λ0μ0+ن=1شمالxنλ0+شمال)2+ج5{\displaystyle {\begin{aligned}\ln q_{\mu }^{*}(\mu )&=-{\frac {\operatorname {E} _{\tau }[\tau ]}{2}}\left\{\sum _{n=1}^{N}(x_{n}-\mu )^{2}+\lambda _{0}(\mu -\mu _{0})^{2}\right\}+C_{3}\\&=-{\frac {\operatorname {E} _{\tau }[\tau ]}{2}}\left\{\sum _{n=1}^{N}(x_{n}^{2}-2x_{n}\mu +\mu ^{2})+\lambda _{0}(\mu ^{2}-2\mu _{0}\mu +\mu _{0}^{2})\right\}+C_{3}\\&=-{\frac {\operatorname {E} _{\tau }[\tau ]}{2}}\left\{\left(\sum _{n=1}^{N}x_{n}^{2}\right)-2\left(\sum _{n=1}^{N}x_{n}\right)\mu +\left(\sum _{n=1}^{N}\mu ^{2}\right)+\lambda _{0}\mu ^{2}-2\lambda _{0}\mu _{0}\mu +\lambda _{0}\mu _{0}^{2}\right\}+C_{3}\\&=-{\frac {\operatorname {E} _{\tau }[\tau ]}{2}}\left\{(\lambda _{0}+N)\mu ^{2}-2\left(\lambda _{0}\mu _{0}+\sum _{n=1}^{N}x_{n}\right)\mu +\left(\sum _{n=1}^{N}x_{n}^{2}\right)+\lambda _{0}\mu _{0}^{2}\right\}+C_{3}\\&=-{\frac {\operatorname {E} _{\tau }[\tau ]}{2}}\left\{(\lambda _{0}+N)\mu ^{2}-2\left(\lambda _{0}\mu _{0}+\sum _{n=1}^{N}x_{n}\right)\mu \right\}+C_{4}\\&=-{\frac {\operatorname {E} _{\tau }[\tau ]}{2}}\left\{(\lambda _{0}+N)\mu ^{2}-2\left({\frac {\lambda _{0}\mu _{0}+\sum _{n=1}^{N}x_{n}}{\lambda _{0}+N}}\right)(\lambda _{0}+N)\mu \right\}+C_{4}\\&=-{\frac {\operatorname {E} _{\tau }[\tau ]}{2}}\left\{(\lambda _{0}+N)\left(\mu ^{2}-2\left({\frac {\lambda _{0}\mu _{0}+\sum _{n=1}^{N}x_{n}}{\lambda _{0}+N}}\right)\mu \right)\right\}+C_{4}\\&=-{\frac {\operatorname {E} _{\tau }[\tau ]}{2}}\left\{(\lambda _{0}+N)\left(\mu ^{2}-2\left({\frac {\lambda _{0}\mu _{0}+\sum _{n=1}^{N}x_{n}}{\lambda _{0}+N}}\right)\mu +\left({\frac {\lambda _{0}\mu _{0}+\sum _{n=1}^{N}x_{n}}{\lambda _{0}+N}}\right)^{2}-\left({\frac {\lambda _{0}\mu _{0}+\sum _{n=1}^{N}x_{n}}{\lambda _{0}+N}}\right)^{2}\right)\right\}+C_{4}\\&=-{\frac {\operatorname {E} _{\tau }[\tau ]}{2}}\left\{(\lambda _{0}+N)\left(\mu ^{2}-2\left({\frac {\lambda _{0}\mu _{0}+\sum _{n=1}^{N}x_{n}}{\lambda _{0}+N}}\right)\mu +\left({\frac {\lambda _{0}\mu _{0}+\sum _{n=1}^{N}x_{n}}{\lambda _{0}+N}}\right)^{2}\right)\right\}+C_{5}\\&=-{\frac {\operatorname {E} _{\tau }[\tau ]}{2}}\left\{(\lambda _{0}+N)\left(\mu -{\frac {\lambda _{0}\mu _{0}+\sum _{n=1}^{N}x_{n}}{\lambda _{0}+N}}\right)^{2}\right\}+C_{5}\\&=-{\frac {1}{2}}(\lambda _{0}+N)\operatorname {E} _{\tau }[\tau ]\left(\mu -{\frac {\lambda _{0}\mu _{0}+\sum _{n=1}^{N}x_{n}}{\lambda _{0}+N}}\right)^{2}+C_{5}\end{aligned}}}

لاحظ أنه يمكن اختصار جميع الخطوات المذكورة أعلاه باستخدام صيغة مجموع معادلتين تربيعيتين .

بعبارة أخرى:

qμ*(μ)شمال(μ|μشمال،λشمال-1)μشمال=λ0μ0+شمالx¯λ0+شمالλشمال=(λ0+شمال)هـτ[τ]x¯=1شمالن=1شمالxن{\displaystyle {\begin{aligned}q_{\mu }^{*}(\mu )&\sim {\mathcal {N}}(\mu \mid \mu _{N},\lambda _{N}^{-1})\\\mu _{N}&={\frac {\lambda _{0}\mu _{0}+N{\bar {x}}}{\lambda _{0}+N}}\\\lambda _{N}&=(\lambda _{0}+N)\operatorname {E} _{\tau }[\tau ]\\{\bar {x}}&={\frac {1}{N}}\sum _{n=1}^{N}x_{n}\end{aligned}}}

اشتقاق q( τ )

اشتقاقqτ*(τ){\displaystyle q_{\tau }^{*}(\tau )}يشبه ما سبق، على الرغم من أننا حذفنا بعض التفاصيل من أجل الإيجاز.

lnqτ*(τ)=هـμ[lnص(X|μ،τ)+lnص(μ|τ)]+lnص(τ)+ثابت=(أ0-1)lnτ-ب0τ+12lnτ+شمال2lnτ-τ2هـμ[ن=1شمال(xن-μ)2+λ0(μ-μ0)2]+ثابت{\displaystyle {\begin{aligned}\ln q_{\tau }^{*}(\tau )&=\operatorname {E} _{\mu }[\ln p(\mathbf {X} \mid \mu ,\tau )+\ln p(\mu \mid \tau )]+\ln p(\tau )+{\text{constant}}\\&=(a_{0}-1)\ln \tau -b_{0}\tau +{\frac {1}{2}}\ln \tau +{\frac {N}{2}}\ln \tau -{\frac {\tau }{2}}\operatorname {E} _{\mu }\left[\sum _{n=1}^{N}(x_{n}-\mu )^{2}+\lambda _{0}(\mu -\mu _{0})^{2}\right]+{\text{constant}}\end{aligned}}}

برفع كلا الطرفين إلى الأس، يمكننا أن نرى أنqτ*(τ){\displaystyle q_{\tau }^{*}(\tau )}هو توزيع غاما . تحديداً:

qτ*(τ)جاما(τ|أشمال،بشمال)أشمال=أ0+شمال+12بشمال=ب0+12هـμ[ن=1شمال(xن-μ)2+λ0(μ-μ0)2]{\displaystyle {\begin{aligned}q_{\tau }^{*}(\tau )&\sim \operatorname {Gamma} (\tau \mid a_{N},b_{N})\\a_{N}&=a_{0}+{\frac {N+1}{2}}\\b_{N}&=b_{0}+{\frac {1}{2}}\operatorname {E} _{\mu }\left[\sum _{n=1}^{N}(x_{n}-\mu )^{2}+\lambda _{0}(\mu -\mu _{0})^{2}\right]\end{aligned}}}

خوارزمية لحساب المعاملات

دعونا نلخص الاستنتاجات الواردة في الأقسام السابقة:

qμ*(μ)شمال(μ|μشمال،λشمال-1)μشمال=λ0μ0+شمالx¯λ0+شمالλشمال=(λ0+شمال)هـτ[τ]x¯=1شمالن=1شمالxن{\displaystyle {\begin{aligned}q_{\mu }^{*}(\mu )&\sim {\mathcal {N}}(\mu \mid \mu _{N},\lambda _{N}^{-1})\\\mu _{N}&={\frac {\lambda _{0}\mu _{0}+N{\bar {x}}}{\lambda _{0}+N}}\\\lambda _{N}&=(\lambda _{0}+N)\operatorname {E} _{\tau }[\tau ]\\{\bar {x}}&={\frac {1}{N}}\sum _{n=1}^{N}x_{n}\end{aligned}}}

و

qτ*(τ)جاما(τ|أشمال،بشمال)أشمال=أ0+شمال+12بشمال=ب0+12هـμ[ن=1شمال(xن-μ)2+λ0(μ-μ0)2]{\displaystyle {\begin{aligned}q_{\tau }^{*}(\tau )&\sim \operatorname {Gamma} (\tau \mid a_{N},b_{N})\\a_{N}&=a_{0}+{\frac {N+1}{2}}\\b_{N}&=b_{0}+{\frac {1}{2}}\operatorname {E} _{\mu }\left[\sum _{n=1}^{N}(x_{n}-\mu )^{2}+\lambda _{0}(\mu -\mu _{0})^{2}\right]\end{aligned}}}

في كل حالة، تعتمد معلمات التوزيع على أحد المتغيرات على التوقعات المحسوبة بالنسبة للمتغير الآخر. ويمكننا توسيع نطاق هذه التوقعات باستخدام الصيغ القياسية لتوقعات عزمات التوزيعين الغاوسي والغاما.

هـ[τ|أشمال،بشمال]=أشمالبشمالهـ[μ|μشمال،λشمال-1]=μشمالهـ[X2]=متغير(X)+(هـ[X])2هـ[μ2|μشمال،λشمال-1]=λشمال-1+μشمال2{\displaystyle {\begin{aligned}\operatorname {E} [\tau \mid a_{N},b_{N}]&={\frac {a_{N}}{b_{N}}}\\\operatorname {E} \left[\mu \mid \mu _{N},\lambda _{N}^{-1}\right]&=\mu _{N}\\\operatorname {E} \left[X^{2}\right]&=\operatorname {Var} (X)+(\operatorname {E} [X])^{2}\\\operatorname {E} \left[\mu ^{2}\mid \mu _{N},\lambda _{N}^{-1}\right]&=\lambda _{N}^{-1}+\mu _{N}^{2}\end{aligned}}}

يُعد تطبيق هذه الصيغ على المعادلات المذكورة أعلاه أمرًا بسيطًا في معظم الحالات، ولكن معادلةبشمال{\displaystyle b_{N}}يتطلب الأمر المزيد من العمل:

بشمال=ب0+12هـμ[ن=1شمال(xن-μ)2+λ0(μ-μ0)2]=ب0+12هـμ[(λ0+شمال)μ2-2(λ0μ0+ن=1شمالxن)μ+(ن=1شمالxن2)+λ0μ02]=ب0+12[(λ0+شمال)هـμ[μ2]-2(λ0μ0+ن=1شمالxن)هـμ[μ]+(ن=1شمالxن2)+λ0μ02]=ب0+12[(λ0+شمال)(λشمال-1+μشمال2)-2(λ0μ0+ن=1شمالxن)μشمال+(ن=1شمالxن2)+λ0μ02]{\displaystyle {\begin{aligned}b_{N}&=b_{0}+{\frac {1}{2}}\operatorname {E} _{\mu }\left[\sum _{n=1}^{N}(x_{n}-\mu )^{2}+\lambda _{0}(\mu -\mu _{0})^{2}\right]\\&=b_{0}+{\frac {1}{2}}\operatorname {E} _{\mu }\left[(\lambda _{0}+N)\mu ^{2}-2\left(\lambda _{0}\mu _{0}+\sum _{n=1}^{N}x_{n}\right)\mu +\left(\sum _{n=1}^{N}x_{n}^{2}\right)+\lambda _{0}\mu _{0}^{2}\right]\\&=b_{0}+{\frac {1}{2}}\left[(\lambda _{0}+N)\operatorname {E} _{\mu }[\mu ^{2}]-2\left(\lambda _{0}\mu _{0}+\sum _{n=1}^{N}x_{n}\right)\operatorname {E} _{\mu }[\mu ]+\left(\sum _{n=1}^{N}x_{n}^{2}\right)+\lambda _{0}\mu _{0}^{2}\right]\\&=b_{0}+{\frac {1}{2}}\left[(\lambda _{0}+N)\left(\lambda _{N}^{-1}+\mu _{N}^{2}\right)-2\left(\lambda _{0}\mu _{0}+\sum _{n=1}^{N}x_{n}\right)\mu _{N}+\left(\sum _{n=1}^{N}x_{n}^{2}\right)+\lambda _{0}\mu _{0}^{2}\right]\\\end{aligned}}}

يمكننا بعد ذلك كتابة معادلات المعاملات على النحو التالي، دون أي توقعات:

μشمال=λ0μ0+شمالx¯λ0+شمالλشمال=(λ0+شمال)أشمالبشمالx¯=1شمالن=1شمالxنأشمال=أ0+شمال+12بشمال=ب0+12[(λ0+شمال)(λشمال-1+μشمال2)-2(λ0μ0+ن=1شمالxن)μشمال+(ن=1شمالxن2)+λ0μ02]{\displaystyle {\begin{aligned}\mu _{N}&={\frac {\lambda _{0}\mu _{0}+N{\bar {x}}}{\lambda _{0}+N}}\\\lambda _{N}&=(\lambda _{0}+N){\frac {a_{N}}{b_{N}}}\\{\bar {x}}&={\frac {1}{N}}\sum _{n=1}^{N}x_{n}\\a_{N}&=a_{0}+{\frac {N+1}{2}}\\b_{N}&=b_{0}+{\frac {1}{2}}\left[(\lambda _{0}+N)\left(\lambda _{N}^{-1}+\mu _{N}^{2}\right)-2\left(\lambda _{0}\mu _{0}+\sum _{n=1}^{N}x_{n}\right)\mu _{N}+\left(\sum _{n=1}^{N}x_{n}^{2}\right)+\lambda _{0}\mu _{0}^{2}\right]\end{aligned}}}

لاحظ وجود علاقات دائرية بين الصيغ الخاصة بـλشمال{\displaystyle \lambda _{N}}وبشمال{\displaystyle b_{N}}وهذا يشير بطبيعة الحال إلى خوارزمية شبيهة بخوارزمية EM :

  1. الحوسبةن=1شمالxن{\displaystyle \sum _{n=1}^{N}x_{n}}ون=1شمالxن2.{\displaystyle \sum _{n=1}^{N}x_{n}^{2}.}استخدم هذه القيم للحسابμشمال{\displaystyle \mu _{N}}وأشمال.{\displaystyle a_{N}.}
  2. تهيئةλشمال{\displaystyle \lambda _{N}}إلى قيمة عشوائية ما.
  3. استخدم القيمة الحالية لـλشمال،{\displaystyle \lambda _{N},}بالإضافة إلى القيم المعروفة للمعاملات الأخرى، لحساببشمال{\displaystyle b_{N}}.
  4. استخدم القيمة الحالية لـبشمال،{\displaystyle b_{N},}بالإضافة إلى القيم المعروفة للمعاملات الأخرى، لحسابλشمال{\displaystyle \lambda _{N}}.
  5. كرر الخطوتين الأخيرتين حتى الوصول إلى التقارب (أي حتى لا تتغير أي من القيمتين بأكثر من مقدار صغير).

ثم لدينا قيم للمعلمات الفائقة للتوزيعات التقريبية للمعلمات الخلفية، والتي يمكننا استخدامها لحساب أي خصائص نريدها للخلفية - على سبيل المثال متوسطها وتباينها، ومنطقة الكثافة الأعلى بنسبة 95٪ (أصغر فاصل زمني يشمل 95٪ من الاحتمال الكلي)، وما إلى ذلك.

يمكن إثبات أن هذه الخوارزمية مضمونة التقارب إلى قيمة عظمى محلية.

لاحظ أيضًا أن التوزيعات الاحتمالية اللاحقة لها نفس شكل التوزيعات الاحتمالية السابقة المقابلة. لم نفترض ذلك؛ بل كان افتراضنا الوحيد هو أن التوزيعات قابلة للتحليل إلى عوامل، وقد ترتب شكل التوزيعات بشكل طبيعي. اتضح (انظر أدناه) أن تطابق شكل التوزيعات الاحتمالية اللاحقة مع التوزيعات الاحتمالية السابقة ليس مصادفة، بل هو نتيجة عامة عندما تكون التوزيعات الاحتمالية السابقة من عائلة التوزيعات الأسية ، وهو الحال بالنسبة لمعظم التوزيعات القياسية.

مزيد من النقاش

وصفة خطوة بخطوة

يوضح المثال أعلاه الطريقة التي يتم من خلالها اشتقاق التقريب البايزي التبايني لكثافة الاحتمال الخلفي في شبكة بايزية معينة :

  1. صف الشبكة باستخدام نموذج بياني ، مع تحديد المتغيرات المرصودة (البيانات).X{\displaystyle \mathbf {X} }والمتغيرات غير المرصودة ( المعلمات)Θ{\displaystyle {\boldsymbol {\Theta }}}والمتغيرات الكامنةZ{\displaystyle \mathbf {Z} }) وتوزيعات احتمالاتها الشرطية . ثم يقوم بايز التبايني بإنشاء تقريب للاحتمال اللاحقص(Z،Θ|X){\displaystyle p(\mathbf {Z} ,{\boldsymbol {\Theta }}\mid \mathbf {X} )}. يتميز التقريب بالخاصية الأساسية المتمثلة في أنه توزيع مُحلل، أي ناتج عن توزيعين مستقلين أو أكثر على مجموعات فرعية منفصلة من المتغيرات غير المرصودة.
  2. قسّم المتغيرات غير المرصودة إلى مجموعتين فرعيتين أو أكثر، تُستخلص منها العوامل المستقلة. لا توجد طريقة موحدة للقيام بذلك؛ فإنشاء عدد كبير جدًا من المجموعات الفرعية يُنتج تقريبًا ضعيفًا، بينما إنشاء عدد قليل جدًا منها يجعل إجراء بايز التبايني بأكمله غير قابل للتطبيق. عادةً، يكون التقسيم الأول هو فصل المعلمات عن المتغيرات الكامنة؛ وغالبًا ما يكون هذا كافيًا بحد ذاته لإنتاج نتيجة قابلة للتطبيق. افترض أن هذه التقسيمات تُسمىZ1،...،Zم{\displaystyle \mathbf {Z} _{1},\ldots ,\mathbf {Z} _{M}}.
  3. لتقسيم معينZج{\displaystyle \mathbf {Z} _{j}}اكتب صيغة أفضل توزيع تقريبيqج*(Zج|X){\displaystyle q_{j}^{*}(\mathbf {Z} _{j}\mid \mathbf {X} )}باستخدام المعادلة الأساسيةlnqج*(Zج|X)=هـأناج[lnص(Z،X)]+ثابت{\displaystyle \ln q_{j}^{*}(\mathbf {Z} _{j}\mid \mathbf {X} )=\operatorname {E} _{i\neq j}[\ln p(\mathbf {Z} ,\mathbf {X} )]+{\text{constant}}}.
  4. املأ صيغة التوزيع الاحتمالي المشترك باستخدام النموذج البياني. أي توزيعات شرطية مكونة لا تتضمن أيًا من المتغيرات فيZج{\displaystyle \mathbf {Z} _{j}}يمكن تجاهلها؛ سيتم دمجها في الحد الثابت.
  5. بسّط الصيغة وطبّق عامل التوقع، باتباع المثال أعلاه. من الناحية المثالية، ينبغي أن يتبسط هذا إلى توقعات الدوال الأساسية للمتغيرات غير الموجودة فيZج{\displaystyle \mathbf {Z} _{j}}(مثل العزوم الخام الأولى أو الثانية ، وتوقع اللوغاريتم، إلخ). لكي تعمل طريقة بايز التباينية بكفاءة، ينبغي عمومًا أن تكون هذه التوقعات قابلة للتعبير التحليلي كدوال لمعاملات و/أو المعاملات الفائقة لتوزيعات هذه المتغيرات. في جميع الحالات، تكون حدود التوقع هذه ثوابت بالنسبة للمتغيرات في التقسيم الحالي.
  6. يُشير الشكل الوظيفي للصيغة بالنسبة للمتغيرات في التقسيم الحالي إلى نوع التوزيع. وعلى وجه الخصوص، يُولّد رفع الصيغة إلى الأس دالة كثافة الاحتمال (PDF) للتوزيع (أو على الأقل، دالة متناسبة معها، مع ثابت تطبيع غير معروف ). ولكي تكون الطريقة قابلة للتطبيق، ينبغي أن يكون من الممكن تحديد الشكل الوظيفي على أنه ينتمي إلى توزيع معروف. وقد يتطلب الأمر معالجة رياضية كبيرة لتحويل الصيغة إلى شكل يُطابق دالة كثافة الاحتمال لتوزيع معروف. وعندما يُمكن تحقيق ذلك، يُمكن إعادة تعريف ثابت التطبيع، ويمكن اشتقاق معادلات معلمات التوزيع المعروف باستخراج الأجزاء المناسبة من الصيغة.
  7. عندما يمكن استبدال جميع التوقعات تحليليًا بدوال للمتغيرات غير الموجودة في القسم الحالي، ووضع دالة كثافة الاحتمال في شكل يسمح بالتعرف عليها مع توزيع معروف، فإن النتيجة هي مجموعة من المعادلات التي تعبر عن قيم المعلمات المثلى كدوال لمعلمات المتغيرات في الأقسام الأخرى.
  8. عندما يمكن تطبيق هذا الإجراء على جميع الأقسام، تكون النتيجة مجموعة من المعادلات المرتبطة ببعضها البعض والتي تحدد القيم المثلى لجميع المعلمات.
  9. ثم يتم تطبيق إجراء من نوع التوقع والتعظيم (EM)، حيث يتم اختيار قيمة ابتدائية لكل مُعامل، ثم يتم التكرار عبر سلسلة من الخطوات، وفي كل خطوة يتم المرور على المعادلات، وتحديث كل مُعامل بدوره. وهذا يضمن التقارب.

أهم النقاط

بسبب كثرة العمليات الحسابية المعقدة، من السهل أن يغيب عنك التركيز على الصورة الكلية. الأمور المهمة هي:

  1. تعتمد فكرة بايز التبايني على بناء تقريب تحليلي للاحتمالية اللاحقة لمجموعة المتغيرات غير المرصودة (المعلمات والمتغيرات الكامنة)، بالنظر إلى البيانات. وهذا يعني أن شكل الحل مشابه لطرق الاستدلال البايزي الأخرى ، مثل أخذ عينات جيبس ، أي توزيع يسعى إلى وصف كل ما هو معروف عن المتغيرات. وكما هو الحال في الطرق البايزية الأخرى - ولكن على عكس طرق مثل التوقع والتعظيم (EM) أو طرق الاحتمال الأقصى الأخرى - يُعامل كلا نوعي المتغيرات غير المرصودة (أي المعلمات والمتغيرات الكامنة) بنفس الطريقة، أي كمتغيرات عشوائية . ويمكن بعد ذلك اشتقاق تقديرات المتغيرات بالطرق البايزية القياسية، مثل حساب متوسط ​​التوزيع للحصول على تقدير نقطي واحد أو اشتقاق فترة موثوقية ، أو منطقة أعلى كثافة، وما إلى ذلك.
  2. يعني "التقريب التحليلي" إمكانية كتابة صيغة للتوزيع الاحتمالي اللاحق. تتكون هذه الصيغة عادةً من حاصل ضرب توزيعات احتمالية معروفة، كل منها قابل للتحليل إلى عوامل على مجموعة من المتغيرات غير المرصودة (أي أنه مستقل شرطيًا عن المتغيرات الأخرى، بالنظر إلى البيانات المرصودة). هذه الصيغة ليست التوزيع الاحتمالي اللاحق الحقيقي، بل هي تقريب له؛ وعلى وجه الخصوص، فإنها تتفق معه بشكل عام في أدنى العزوم للمتغيرات غير المرصودة، مثل المتوسط ​​والتباين .
  3. تُسفر جميع العمليات الرياضية عن (1) تحديد هوية التوزيعات الاحتمالية التي تُشكل العوامل، و(2) صيغ مترابطة لمعاملات هذه التوزيعات. تُحسب القيم الفعلية لهذه المعاملات عدديًا، من خلال إجراء تكراري متناوب يُشبه إلى حد كبير خوارزمية EM.

بالمقارنة مع خوارزمية التوقع والتعظيم (EM)

كثيراً ما تُقارن طريقة بايز التباينية (VB) بطريقة التوقع والتعظيم (EM). وتتشابه الإجراءات العددية الفعلية إلى حد كبير، فكلتاهما عبارة عن إجراءات تكرارية متناوبة تتقارب تباعاً نحو القيم المثلى للمعاملات. كما تتشابه الخطوات الأولية لاستنباط كلتا الطريقتين، إذ تبدأ كلتاهما بصيغ كثافات الاحتمال، وتتضمنان قدراً كبيراً من العمليات الرياضية.

ومع ذلك، هناك عدد من الاختلافات. والأهم هو ما يتم حسابه.

  • تحسب خوارزمية EM تقديرات نقطية للتوزيع الاحتمالي اللاحق للمتغيرات العشوائية التي يمكن تصنيفها على أنها "معاملات"، ولكنها لا تحسب سوى تقديرات للتوزيعات الاحتمالية اللاحقة الفعلية للمتغيرات الكامنة (على الأقل في "خوارزمية EM المرنة"، وغالبًا فقط عندما تكون المتغيرات الكامنة منفصلة). وتُمثل التقديرات النقطية المحسوبة منوال هذه المعاملات؛ ولا تتوفر أي معلومات أخرى.
  • من ناحية أخرى، تحسب طريقة بايز التباينية (VB) تقديرات للتوزيع الاحتمالي اللاحق الفعلي لجميع المتغيرات، سواءً كانت معلمات أو متغيرات كامنة. عند الحاجة إلى اشتقاق تقديرات نقطية، يُستخدم المتوسط ​​عادةً بدلاً من المنوال، كما هو الحال في الاستدلال البايزي. وبناءً على ذلك، فإن المعلمات المحسوبة في VB لا تحمل نفس أهمية تلك المحسوبة في طريقة التوقع والتعظيم (EM). تحسب EM القيم المثلى لمعلمات شبكة بايز نفسها، بينما تحسب VB القيم المثلى لمعلمات التوزيعات المستخدمة لتقريب معلمات ومتغيرات شبكة بايز الكامنة. على سبيل المثال، يحتوي نموذج خليط غاوسي نموذجي على معلمات للمتوسط ​​والتباين لكل مكون من مكونات الخليط. تُقدّر EM القيم المثلى لهذه المعلمات مباشرةً. أما VB، فتقوم أولاً بملاءمة توزيع لهذه المعلمات - عادةً في شكل توزيع مسبق ، مثل توزيع غاما معكوس مُقاس طبيعياً - ثم تحسب قيم معلمات هذا التوزيع المسبق، أي المعلمات الفائقة . في هذه الحالة، ستقوم VB بحساب التقديرات المثلى للمعلمات الأربعة لتوزيع جاما العكسي ذي المقياس الطبيعي الذي يصف التوزيع المشترك للمتوسط ​​والتباين للمكون.

مثال أكثر تعقيدا

نموذج خليط غاوسي بايزي باستخدام ترميز اللوحة . تشير المربعات الصغيرة إلى معلمات ثابتة، بينما تشير الدوائر الكبيرة إلى متغيرات عشوائية. تشير الأشكال المظللة إلى قيم معروفة. يشير الرمز [K] إلى متجه بحجم K ، ويشير الرمز [ D , D ] إلى مصفوفة بحجم D × D ، ويشير K وحده إلى متغير فئوي له K نتيجة. يشير الخط المتعرج الممتد من z وينتهي بخط أفقي إلى مفتاح تبديل ، حيث تحدد قيمة هذا المتغير، بالنسبة للمتغيرات الواردة الأخرى، القيمة التي سيتم استخدامها من بين مصفوفة القيم الممكنة بحجم K.

تخيل نموذج خليط غاوسي بايزي موصوف على النحو التالي: [ 3 ]

πسيمدير(ك،α0)Λأنا=1...كدبليو(دبليو0،ν0)μأنا=1...كشمال(μ0،(β0Λأنا)-1)z[أنا=1...شمال]متعدد(1،π)xأنا=1...شمالشمال(μzأنا،Λzأنا-1)ك=عدد مكونات الخلطشمال=عدد نقاط البيانات{\displaystyle {\begin{aligned}\mathbf {\pi } &\sim \operatorname {SymDir} (K,\alpha _{0})\\\mathbf {\Lambda } _{i=1\dots K}&\sim {\mathcal {W}}(\mathbf {W} _{0},\nu _{0})\\\mathbf {\mu } _{i=1\dots K}&\sim {\mathcal {N}}(\mathbf {\mu } _{0},(\beta _{0}\mathbf {\Lambda } _{i})^{-1})\\\mathbf {z} [i=1\dots N]&\sim \operatorname {Mult} (1,\mathbf {\pi } )\\\mathbf {x} _{i=1\dots N}&\sim {\mathcal {N}}(\mathbf {\mu } _{z_{i}},{\mathbf {\Lambda } _{z_{i}}}^{-1})\\K&={\text{number of mixing components}}\\N&={\text{number of data points}}\end{aligned}}}

ملحوظة:

تفسير المتغيرات المذكورة أعلاه هو كما يلي:

  • X={x1،...،xشمال}{\displaystyle \mathbf {X} =\{\mathbf {x} _{1},\dots ,\mathbf {x} _{N}\}}هي مجموعةشمال{\displaystyle N}نقاط البيانات، كل منها عبارة عند{\displaystyle D}متجه ذو أبعاد موزع وفقًا لتوزيع غاوسي متعدد المتغيرات .
  • Z={z1،...،zشمال}{\displaystyle \mathbf {Z} =\{\mathbf {z} _{1},\dots ,\mathbf {z} _{N}\}}هي مجموعة من المتغيرات الكامنة، متغير واحد لكل نقطة بيانات، تحدد مكون الخليط الذي تنتمي إليه نقطة البيانات المقابلة، باستخدام تمثيل متجه "واحد من K" مع مكوناتzنك{\displaystyle z_{nk}}لك=1...ك{\displaystyle k=1\dots K}كما هو موضح أعلاه.
  • π{\displaystyle \mathbf {\pi } }هي نسب الخلط لـك{\displaystyle K}مكونات الخليط.
  • μأنا=1...ك{\displaystyle \mathbf {\mu } _{i=1\dots K}}وΛأنا=1...ك{\displaystyle \mathbf {\Lambda } _{i=1\dots K}}حدد المعلمات ( المتوسط ​​والدقة ) المرتبطة بكل مكون من مكونات الخليط .

يمكن إعادة كتابة الاحتمال المشترك لجميع المتغيرات على النحو التالي:

ص(X،Z،π،μ،Λ)=ص(X|Z،μ،Λ)ص(Z|π)ص(π)ص(μ|Λ)ص(Λ){\displaystyle p(\mathbf {X} ,\mathbf {Z} ,\mathbf {\pi } ,\mathbf {\mu } ,\mathbf {\Lambda } )=p(\mathbf {X} \mid \mathbf {Z} ,\mathbf {\mu } ,\mathbf {\Lambda } )p(\mathbf {Z} \mid \mathbf {\pi } )p(\mathbf {\pi } )p(\mathbf {\mu } \mid \mathbf {\Lambda } )p(\mathbf {\Lambda } )}

حيث تكون العوامل الفردية

ص(X|Z،μ،Λ)=ن=1شمالك=1كشمال(xن|μك،Λك-1)zنكص(Z|π)=ن=1شمالك=1كπكzنكص(π)=Γ(كα0)Γ(α0)كك=1كπكα0-1ص(μ|Λ)=ك=1كشمال(μك|μ0،(β0Λك)-1)ص(Λ)=ك=1كدبليو(Λك|دبليو0،ν0){\displaystyle {\begin{aligned}p(\mathbf {X} \mid \mathbf {Z} ,\mathbf {\mu } ,\mathbf {\Lambda } )&=\prod _{n=1}^{N}\prod _{k=1}^{K}{\mathcal {N}}(\mathbf {x} _{n}\mid \mathbf {\mu } _{k},\mathbf {\Lambda } _{k}^{-1})^{z_{nk}}\\p(\mathbf {Z} \mid \mathbf {\pi } )&=\prod _{n=1}^{N}\prod _{k=1}^{K}\pi _{k}^{z_{nk}}\\p(\mathbf {\pi } )&={\frac {\Gamma (K\alpha _{0})}{\Gamma (\alpha _{0})^{K}}}\prod _{k=1}^{K}\pi _{k}^{\alpha _{0}-1}\\p(\mathbf {\mu } \mid \mathbf {\Lambda } )&=\prod _{k=1}^{K}{\mathcal {N}}(\mathbf {\mu } _{k}\mid \mathbf {\mu } _{0},(\beta _{0}\mathbf {\Lambda } _{k})^{-1})\\p(\mathbf {\Lambda } )&=\prod _{k=1}^{K}{\mathcal {W}}(\mathbf {\Lambda } _{k}\mid \mathbf {W} _{0},\nu _{0})\end{aligned}}}

أين

شمال(x|μ،Σ)=1(2π)د/21|Σ|1/2خبرة{-12(x-μ)تيΣ-1(x-μ)}دبليو(Λ|دبليو،ν)=ب(دبليو،ν)|Λ|(ν-د-1)/2خبرة(-12Tr(دبليو-1Λ))ب(دبليو،ν)=|دبليو|-ν/2{2νد/2πد(د-1)/4أنا=1دΓ(ν+1-أنا2)}-1د=أبعاد كل نقطة بيانات{\displaystyle {\begin{aligned}{\mathcal {N}}(\mathbf {x} \mid \mathbf {\mu } ,\mathbf {\Sigma } )&={\frac {1}{(2\pi )^{D/2}}}{\frac {1}{|\mathbf {\Sigma } |^{1/2}}}\exp \left\{-{\frac {1}{2}}(\mathbf {x} -\mathbf {\mu } )^{\rm {T}}\mathbf {\Sigma } ^{-1}(\mathbf {x} -\mathbf {\mu } )\right\}\\{\mathcal {W}}(\mathbf {\Lambda } \mid \mathbf {W} ,\nu )&=B(\mathbf {W} ,\nu )|\mathbf {\Lambda } |^{(\nu -D-1)/2}\exp \left(-{\frac {1}{2}}\operatorname {Tr} (\mathbf {W} ^{-1}\mathbf {\Lambda } )\right)\\B(\mathbf {W} ,\nu )&=|\mathbf {W} |^{-\nu /2}\left\{2^{\nu D/2}\pi ^{D(D-1)/4}\prod _{i=1}^{D}\Gamma \left({\frac {\nu +1-i}{2}}\right)\right\}^{-1}\\D&={\text{dimensionality of each data point}}\end{aligned}}}

افترض أنq(Z،π،μ،Λ)=q(Z)q(π،μ،Λ){\displaystyle q(\mathbf {Z} ,\mathbf {\pi } ,\mathbf {\mu } ,\mathbf {\Lambda } )=q(\mathbf {Z} )q(\mathbf {\pi } ,\mathbf {\mu } ,\mathbf {\Lambda } )}.

ثم [ 3 ]

lnq*(Z)=هـπ،μ،Λ[lnص(X،Z،π،μ،Λ)]+ثابت=هـπ[lnص(Z|π)]+هـμ،Λ[lnص(X|Z،μ،Λ)]+ثابت=ن=1شمالك=1كzنكlnρنك+ثابت{\displaystyle {\begin{aligned}\ln q^{*}(\mathbf {Z} )&=\operatorname {E} _{\mathbf {\pi } ,\mathbf {\mu } ,\mathbf {\Lambda } }[\ln p(\mathbf {X} ,\mathbf {Z} ,\mathbf {\pi } ,\mathbf {\mu } ,\mathbf {\Lambda } )]+{\text{constant}}\\&=\operatorname {E} _{\mathbf {\pi } }[\ln p(\mathbf {Z} \mid \mathbf {\pi } )]+\operatorname {E} _{\mathbf {\mu } ,\mathbf {\Lambda } }[\ln p(\mathbf {X} \mid \mathbf {Z} ,\mathbf {\mu } ,\mathbf {\Lambda } )]+{\text{constant}}\\&=\sum _{n=1}^{N}\sum _{k=1}^{K}z_{nk}\ln \rho _{nk}+{\text{constant}}\end{aligned}}}

حيث حددنا

lnρنك=هـ[lnπك]+12هـ[ln|Λك|]-د2ln(2π)-12هـμك،Λك[(xن-μك)تيΛك(xن-μك)]{\displaystyle \ln \rho _{nk}=\operatorname {E} [\ln \pi _{k}]+{\frac {1}{2}}\operatorname {E} [\ln |\mathbf {\Lambda } _{k}|]-{\frac {D}{2}}\ln(2\pi )-{\frac {1}{2}}\operatorname {E} _{\mathbf {\mu } _{k},\mathbf {\Lambda } _{k}}[(\mathbf {x} _{n}-\mathbf {\mu } _{k})^{\rm {T}}\mathbf {\Lambda } _{k}(\mathbf {x} _{n}-\mathbf {\mu } _{k})]}

برفع طرفي المعادلة إلى الأس لـlnq*(Z){\displaystyle \ln q^{*}(\mathbf {Z} )}العائد

q*(Z)ن=1شمالك=1كρنكzنك{\displaystyle q^{*}(\mathbf {Z} )\propto \prod _{n=1}^{N}\prod _{k=1}^{K}\rho _{nk}^{z_{nk}}}

إن اشتراط توحيد هذا الأمر ينتهي باشتراط أنρنك{\displaystyle \rho _{nk}}مجموعها يساوي 1 على جميع قيمك{\displaystyle k}، مما يؤدي إلى

q*(Z)=ن=1شمالك=1كرنكzنك{\displaystyle q^{*}(\mathbf {Z} )=\prod _{n=1}^{N}\prod _{k=1}^{K}r_{nk}^{z_{nk}}}

أين

رنك=ρنكج=1كρنج{\displaystyle r_{nk}={\frac {\rho _{nk}}{\sum _{j=1}^{K}\rho _{nj}}}}

بعبارة أخرى،q*(Z){\displaystyle q^{*}(\mathbf {Z} )}هو نتاج توزيعات متعددة الحدود ذات ملاحظة واحدة ، وعوامل على كل فردzن{\displaystyle \mathbf {z} _{n}}، والذي يتم توزيعه كتوزيع متعدد الحدود ذي ملاحظة واحدة بمعاملاترنك{\displaystyle r_{nk}}لك=1...ك{\displaystyle k=1\dots K}.

علاوة على ذلك، نلاحظ أن

هـ[zنك]=رنك{\displaystyle \operatorname {E} [z_{nk}]=r_{nk}\,}

وهي نتيجة قياسية للتوزيعات الفئوية.

والآن، بالنظر إلى العاملq(π،μ،Λ){\displaystyle q(\mathbf {\pi } ,\mathbf {\mu } ,\mathbf {\Lambda } )}لاحظ أنه يدخل تلقائيًا فيq(π)ك=1كq(μك،Λك){\displaystyle q(\mathbf {\pi } )\prod _{k=1}^{K}q(\mathbf {\mu } _{k},\mathbf {\Lambda } _{k})}وذلك بسبب بنية النموذج الرسومي الذي يحدد نموذج الخليط الغاوسي الخاص بنا، والذي تم تحديده أعلاه.

ثم،

lnq*(π)=lnص(π)+هـZ[lnص(Z|π)]+ثابت=(α0-1)ك=1كlnπك+ن=1شمالك=1كرنكlnπك+ثابت{\displaystyle {\begin{aligned}\ln q^{*}(\mathbf {\pi } )&=\ln p(\mathbf {\pi } )+\operatorname {E} _{\mathbf {Z} }[\ln p(\mathbf {Z} \mid \mathbf {\pi } )]+{\text{constant}}\\&=(\alpha _{0}-1)\sum _{k=1}^{K}\ln \pi _{k}+\sum _{n=1}^{N}\sum _{k=1}^{K}r_{nk}\ln \pi _{k}+{\text{constant}}\end{aligned}}}

بأخذ الأسّية لكلا الطرفين، ندركq*(π){\displaystyle q^{*}(\mathbf {\pi } )}كتوزيع ديريشليه

q*(π)مدير(α){\displaystyle q^{*}(\mathbf {\pi } )\sim \operatorname {Dir} (\mathbf {\alpha } )\,}

أين

αك=α0+شمالك{\displaystyle \alpha _{k}=\alpha _{0}+N_{k}\,}

أين

شمالك=ن=1شمالرنك{\displaystyle N_{k}=\sum _{n=1}^{N}r_{nk}\,}

أخيراً

lnq*(μك،Λك)=lnص(μك،Λك)+ن=1شمالهـ[zنك]lnشمال(xن|μك،Λك-1)+ثابت{\displaystyle \ln q^{*}(\mathbf {\mu } _{k},\mathbf {\Lambda } _{k})=\ln p(\mathbf {\mu } _{k},\mathbf {\Lambda } _{k})+\sum _{n=1}^{N}\operatorname {E} [z_{nk}]\ln {\mathcal {N}}(\mathbf {x} _{n}\mid \mathbf {\mu } _{k},\mathbf {\Lambda } _{k}^{-1})+{\text{constant}}}

تجميع وقراءة المصطلحات التي تتضمنμك{\displaystyle \mathbf {\mu } _{k}}وΛك{\displaystyle \mathbf {\Lambda } _{k}}والنتيجة هي توزيع غاوسي-ويشارت معطى بواسطة

q*(μك،Λك)=شمال(μك|مك،(βكΛك)-1)دبليو(Λك|دبليوك،νك){\displaystyle q^{*}(\mathbf {\mu } _{k},\mathbf {\Lambda } _{k})={\mathcal {N}}(\mathbf {\mu } _{k}\mid \mathbf {m} _{k},(\beta _{k}\mathbf {\Lambda } _{k})^{-1}){\mathcal {W}}(\mathbf {\Lambda } _{k}\mid \mathbf {W} _{k},\nu _{k})}

بالنظر إلى التعريفات

βك=β0+شمالكمك=1βك(β0μ0+شمالكx¯ك)دبليوك-1=دبليو0-1+شمالكSك+β0شمالكβ0+شمالك(x¯ك-μ0)(x¯ك-μ0)تيνك=ν0+شمالكشمالك=ن=1شمالرنكx¯ك=1شمالكن=1شمالرنكxنSك=1شمالكن=1شمالرنك(xن-x¯ك)(xن-x¯ك)تي{\displaystyle {\begin{aligned}\beta _{k}&=\beta _{0}+N_{k}\\\mathbf {m} _{k}&={\frac {1}{\beta _{k}}}(\beta _{0}\mathbf {\mu } _{0}+N_{k}{\bar {\mathbf {x} }}_{k})\\\mathbf {W} _{k}^{-1}&=\mathbf {W} _{0}^{-1}+N_{k}\mathbf {S} _{k}+{\frac {\beta _{0}N_{k}}{\beta _{0}+N_{k}}}({\bar {\mathbf {x} }}_{k}-\mathbf {\mu } _{0})({\bar {\mathbf {x} }}_{k}-\mathbf {\mu } _{0})^{\rm {T}}\\\nu _{k}&=\nu _{0}+N_{k}\\N_{k}&=\sum _{n=1}^{N}r_{nk}\\{\bar {\mathbf {x} }}_{k}&={\frac {1}{N_{k}}}\sum _{n=1}^{N}r_{nk}\mathbf {x} _{n}\\\mathbf {S} _{k}&={\frac {1}{N_{k}}}\sum _{n=1}^{N}r_{nk}(\mathbf {x} _{n}-{\bar {\mathbf {x} }}_{k})(\mathbf {x} _{n}-{\bar {\mathbf {x} }}_{k})^{\rm {T}}\end{aligned}}}

وأخيرًا، لاحظ أن هذه الدوال تتطلب قيمًا لـرنك{\displaystyle r_{nk}}والتي تستخدمρنك{\displaystyle \rho _{nk}}والذي يتم تحديده بدوره بناءً علىهـ[lnπك]{\displaystyle \operatorname {E} [\ln \pi _{k}]}،هـ[ln|Λك|]{\displaystyle \operatorname {E} [\ln |\mathbf {\Lambda } _{k}|]}، وهـμك،Λك[(xن-μك)تيΛك(xن-μك)]{\displaystyle \operatorname {E} _{\mathbf {\mu } _{k},\mathbf {\Lambda } _{k}}[(\mathbf {x} _{n}-\mathbf {\mu } _{k})^{\rm {T}}\mathbf {\Lambda } _{k}(\mathbf {x} _{n}-\mathbf {\mu } _{k})]}الآن وقد حددنا التوزيعات التي تُؤخذ هذه التوقعات على أساسها، يمكننا اشتقاق صيغ لها:

هـμك،Λك[(xن-μك)تيΛك(xن-μك)]=دβك-1+νك(xن-مك)تيدبليوك(xن-مك)lnΛ~كهـ[ln|Λك|]=أنا=1دψ(νك+1-أنا2)+دln2+ln|دبليوك|lnπ~كهـ[ln|πك|]=ψ(αك)-ψ(أنا=1كαأنا){\displaystyle {\begin{aligned}\operatorname {E} _{\mathbf {\mu } _{k},\mathbf {\Lambda } _{k}}[(\mathbf {x} _{n}-\mathbf {\mu } _{k})^{\rm {T}}\mathbf {\Lambda } _{k}(\mathbf {x} _{n}-\mathbf {\mu } _{k})]&=D\beta _{k}^{-1}+\nu _{k}(\mathbf {x} _{n}-\mathbf {m} _{k})^{\rm {T}}\mathbf {W} _{k}(\mathbf {x} _{n}-\mathbf {m} _{k})\\\ln {\widetilde {\Lambda }}_{k}&\equiv \operatorname {E} [\ln |\mathbf {\Lambda } _{k}|]=\sum _{i=1}^{D}\psi \left({\frac {\nu _{k}+1-i}{2}}\right)+D\ln 2+\ln |\mathbf {W} _{k}|\\\ln {\widetilde {\pi }}_{k}&\equiv \operatorname {E} \left[\ln |\pi _{k}|\right]=\psi (\alpha _{k})-\psi \left(\sum _{i=1}^{K}\alpha _{i}\right)\end{aligned}}}

تؤدي هذه النتائج إلى

رنكπ~كΛ~ك1/2خبرة{-د2βك-νك2(xن-مك)تيدبليوك(xن-مك)}{\displaystyle r_{nk}\propto {\widetilde {\pi }}_{k}{\widetilde {\Lambda }}_{k}^{1/2}\exp \left\{-{\frac {D}{2\beta _{k}}}-{\frac {\nu _{k}}{2}}(\mathbf {x} _{n}-\mathbf {m} _{k})^{\rm {T}}\mathbf {W} _{k}(\mathbf {x} _{n}-\mathbf {m} _{k})\right\}}

يمكن تحويل هذه القيم من قيم نسبية إلى قيم مطلقة عن طريق التطبيع.ك{\displaystyle k}بحيث يكون مجموع القيم المتناظرة مساوياً لـ 1.

لاحظ أن:

  1. معادلات التحديث للمعاملاتβك{\displaystyle \beta _{k}}،مك{\displaystyle \mathbf {m} _{k}}،دبليوك{\displaystyle \mathbf {W} _{k}}وνك{\displaystyle \nu _{k}}من المتغيراتμك{\displaystyle \mathbf {\mu } _{k}}وΛك{\displaystyle \mathbf {\Lambda } _{k}}يعتمد ذلك على الإحصائياتشمالك{\displaystyle N_{k}}،x¯ك{\displaystyle {\bar {\mathbf {x} }}_{k}}، وSك{\displaystyle \mathbf {S} _{k}}وتعتمد هذه الإحصائيات بدورها علىرنك{\displaystyle r_{nk}}.
  2. معادلات التحديث للمعاملاتα1...ك{\displaystyle \alpha _{1\dots K}}من المتغيرπ{\displaystyle \mathbf {\pi } }يعتمد ذلك على الإحصائيةشمالك{\displaystyle N_{k}}والذي يعتمد بدوره علىرنك{\displaystyle r_{nk}}.
  3. معادلة التحديث لـرنك{\displaystyle r_{nk}}له اعتماد دائري مباشر علىβك{\displaystyle \beta _{k}}،مك{\displaystyle \mathbf {m} _{k}}،دبليوك{\displaystyle \mathbf {W} _{k}}وνك{\displaystyle \nu _{k}}بالإضافة إلى اعتماد دائري غير مباشر علىدبليوك{\displaystyle \mathbf {W} _{k}}،νك{\displaystyle \nu _{k}}وα1...ك{\displaystyle \alpha _{1\dots K}}خلالπ~ك{\displaystyle {\widetilde {\pi }}_{k}}وΛ~ك{\displaystyle {\widetilde {\Lambda }}_{k}}.

يشير هذا إلى إجراء تكراري يتناوب بين خطوتين:

  1. خطوة E التي تحسب قيمةرنك{\displaystyle r_{nk}}باستخدام القيم الحالية لجميع المعلمات الأخرى.
  2. خطوة M تستخدم القيمة الجديدة لـرنك{\displaystyle r_{nk}}لحساب القيم الجديدة لجميع المعلمات الأخرى.

لاحظ أن هذه الخطوات تتوافق بشكل وثيق مع خوارزمية EM القياسية لاستخلاص حل الاحتمال الأقصى أو حل الاحتمال اللاحق الأقصى (MAP) لمعلمات نموذج خليط غاوسي . المسؤولياترنك{\displaystyle r_{nk}}في خطوة E، تتوافق هذه القيم بشكل وثيق مع الاحتمالات اللاحقة للمتغيرات الكامنة بالنظر إلى البيانات، أيص(Z|X){\displaystyle p(\mathbf {Z} \mid \mathbf {X} )}؛ حساب الإحصائياتشمالك{\displaystyle N_{k}}،x¯ك{\displaystyle {\bar {\mathbf {x} }}_{k}}، وSك{\displaystyle \mathbf {S} _{k}}يتوافق بشكل وثيق مع حساب إحصائيات "العد الناعم" المقابلة على البيانات؛ ويتوافق استخدام تلك الإحصائيات لحساب قيم جديدة للمعلمات بشكل وثيق مع استخدام العد الناعم لحساب قيم المعلمات الجديدة في EM العادي على نموذج خليط غاوسي.

توزيعات العائلة الأسية

لاحظ أنه في المثال السابق، بمجرد افتراض أن التوزيع على المتغيرات غير المرصودة ينقسم إلى توزيعات على "المعلمات" وتوزيعات على "البيانات الكامنة"، فإن التوزيع "الأمثل" المُستنتج لكل متغير كان من نفس عائلة التوزيع المسبق المقابل له على هذا المتغير. هذه نتيجة عامة تنطبق على جميع التوزيعات المسبقة المُستنتجة من العائلة الأسية .

انظر أيضاً

مراجع

  1. 1 2 3 4 تران، فييت هونغ (2018). "استدلال بايز التبايني للكوبولا عبر هندسة المعلومات". arXiv : 1803.10998 [ cs.IT ].
  2. 1 2 آدمتشيك، مارتن (2014). "الهندسة المعلوماتية لتفرعات بريغمان وبعض التطبيقات في الاستدلال متعدد الخبراء" . إنتروبي . 16 (12): 6338-6381 . Bibcode : 2014Entrp..16.6338A . doi : 10.3390/e16126338 .
  3. 1 2 3 نغوين، دوي (15 أغسطس 2023). "مقدمة معمقة في نظرية بايز التباينية" . doi : 10.2139/ssrn.4541076 . SSRN 4541076. تاريخ الاسترجاع: 15 أغسطس 2023 . 
  4. 1 2 3 لي، سي يون (2021). "أخذ عينات جيبس ​​والاستدلال التبايني باستخدام صعود الإحداثيات: مراجعة نظرية المجموعات". الاتصالات في الإحصاء - النظرية والأساليب . 51 (6): 1-21 . arXiv : 2008.01006 . doi : 10.1080/03610926.2021.1921214 . S2CID 220935477 . 
  5. بويد، ستيفن ب.؛ فاندنبيرغ، ليفين (2004). التحسين المحدب (ملف PDF) . مطبعة جامعة كامبريدج. ISBN 978-0-521-83378-3تم الاطلاع عليه بتاريخ 15 أكتوبر 2011 .
  6. بيشوب، كريستوفر م. (2006). "الفصل 10". التعرف على الأنماط والتعلم الآلي . سبرينغر. ISBN 978-0-387-31073-2.
  7. سوتيريوس ب. تشاتزيس، " آلات التمييز ذات الإنتروبيا القصوى ذات التبديل الماركوفي اللانهائي "، وقائع المؤتمر الدولي الثلاثين للتعلم الآلي (ICML). مجلة أبحاث التعلم الآلي: وقائع ورش العمل والمؤتمرات، المجلد 28، العدد 3، الصفحات 729-737، يونيو 2013.