عملية ديريشليه الهرمية

في الإحصاء والتعلم الآلي ، تُعدّ عملية ديريشليه الهرمية ( HDP ) منهجًا بايزيًا غير بارامتري لتجميع البيانات المصنفة . [ 1 ] [ 2 ] تستخدم هذه العملية عملية ديريشليه لكل مجموعة بيانات، حيث تشترك عمليات ديريشليه لجميع المجموعات في توزيع أساسي مُستمد بدوره من عملية ديريشليه. تسمح هذه الطريقة للمجموعات بمشاركة القوة الإحصائية من خلال مشاركة المجموعات الفرعية. يُعدّ استخلاص التوزيع الأساسي من عملية ديريشليه أمرًا بالغ الأهمية، لأنّ عمليات الاستخلاص من عملية ديريشليه تُمثّل مقاييس احتمالية ذرية، وستظهر الذرات في جميع عمليات ديريشليه على مستوى المجموعة. وبما أنّ كل ذرة تُقابل مجموعة فرعية، فإنّ المجموعات الفرعية مشتركة بين جميع المجموعات. طُوّرت هذه العملية بواسطة يي واي تيه ، ومايكل آي. جوردان ، وماثيو جيه. بيل، وديفيد بلي ، ونُشرت في مجلة الجمعية الإحصائية الأمريكية عام 2006، [ 1 ] كصياغة رسمية وتعميم لنموذج ماركوف المخفي اللانهائي الذي نُشر عام 2002. [ 3 ]

نموذج

هذا الوصف للنموذج مأخوذ من [ 1 ] . يُعدّ نموذج البيانات المُجمّعة (HDP) نموذجًا للبيانات المُجمّعة. وهذا يعني أن عناصر البيانات تأتي في مجموعات مُتعددة ومُتميزة. على سبيل المثال، في نموذج الموضوع، تُنظّم الكلمات في مستندات، ويتكون كل مستند من مجموعة من الكلمات (عناصر البيانات). يتم فهرسة المجموعات حسبج=1،...ج{\displaystyle j=1,...J}لنفترض أن كل مجموعة تتكون من عناصر بياناتxج1،...xجن{\displaystyle x_{j1},...x_{jn}}.

يتم تحديد معلمات HDP بواسطة توزيع أساسيح{\displaystyle H}التي تحدد التوزيع المسبق لعناصر البيانات، وعدد من معلمات التركيز التي تحدد العدد المسبق للمجموعات ومقدار المشاركة بين المجموعات.ج{\displaystyle j}ترتبط المجموعة بمقياس احتمالية عشوائيجيج{\displaystyle G_{j}}والتي لها توزيع معطى بواسطة عملية ديريشليه:

جيج|جي0DP(αج،جي0){\displaystyle {\begin{aligned}G_{j}|G_{0}&\sim \operatorname {DP} (\alpha _{j},G_{0})\end{aligned}}}

أينαج{\displaystyle \alpha _{j}}يمثل معامل التركيز المرتبط بالمجموعة، وجي0{\displaystyle G_{0}}التوزيع الأساسي مشترك بين جميع المجموعات. بدوره، فإن التوزيع الأساسي المشترك يتبع عملية ديريشليه:

جي0DP(α0،ح){\displaystyle {\begin{aligned}G_{0}&\sim \operatorname {DP} (\alpha _{0},H)\end{aligned}}}

مع معامل التركيزα0{\displaystyle \alpha _{0}}وتوزيع القاعدةح{\displaystyle H}وأخيرًا، لربط عمليات ديريشليه بالبيانات المرصودة، كل عنصر من عناصر البياناتxجأنا{\displaystyle x_{ji}}يرتبط بمعامل كامنθجأنا{\displaystyle \theta _{ji}}:

θجأنا|جيججيجxجأنا|θجأناF(θجأنا){\displaystyle {\begin{align}\theta _{ji}|G_{j}&\sim G_{j}\\x_{ji}|\theta _{ji}&\sim F(\theta _{ji})\end{محاذاة}}}

ينص السطر الأول على أن لكل معلمة توزيعًا مسبقًا معطى بواسطةجيج{\displaystyle G_{j}}بينما ينص السطر الثاني على أن لكل عنصر من عناصر البيانات توزيعًاF(θجأنا){\displaystyle F(\theta _{ji})}يتم تحديد المعلمة بواسطة المعلمة المرتبطة بها. يُطلق على النموذج الناتج أعلاه اسم نموذج خليط HDP، حيث يشير HDP إلى مجموعة عمليات ديريشليه المرتبطة هرميًا، ويشير نموذج الخليط إلى الطريقة التي ترتبط بها عمليات ديريشليه بعناصر البيانات.

لفهم كيفية تطبيق نموذج التجميع في عملية ديريشليه، وكيفية مشاركة المجموعات العنقودية بين المجموعات، تذكر أن عمليات السحب من عملية ديريشليه هي مقاييس احتمالية ذرية باحتمال واحد. هذا يعني أن التوزيع الأساسي المشتركجي0{\displaystyle G_{0}}له شكل يمكن كتابته على النحو التالي:

جي0=ك=1π0كدلتاθك*{\displaystyle {\begin{aligned}G_{0}&=\sum _{k=1}^{\infty }\pi _{0k}\delta _{\theta _{k}^{*}}\end{aligned}}}

حيث يوجد عدد لا نهائي من الذرات،θك*،ك=1،2،...{\displaystyle \theta _{k}^{*},k=1,2,...}، بافتراض أن التوزيع الأساسي الإجماليح{\displaystyle H}له دعم لا نهائي. كل ذرة مرتبطة بكتلةπ0ك{\displaystyle \pi _{0k}}يجب أن يكون مجموع الكتلتين واحدًا لأنجي0{\displaystyle G_{0}}هو مقياس احتمالي. بما أنجي0{\displaystyle G_{0}}وهي نفسها التوزيع الأساسي لعمليات ديريشليه الخاصة بالمجموعة، كل منهاجيج{\displaystyle G_{j}}سيكون لها ذرات معطاة بواسطة ذراتجي0{\displaystyle G_{0}}ويمكن كتابتها بنفسها على النحو التالي:

جيج=ك=1πجكدلتاθك*{\displaystyle {\begin{aligned}G_{j}&=\sum _{k=1}^{\infty }\pi _{jk}\delta _{\theta _{k}^{*}}\end{aligned}}}

وبالتالي، فإن مجموعة الذرات مشتركة بين جميع المجموعات، ولكل مجموعة كتل ذرية خاصة بها. وبربط هذا التمثيل بالبيانات المرصودة، نرى أن كل عنصر من عناصر البيانات يُوصف بنموذج خليط.

xجأنا|جيجك=1πجكF(θك*){\displaystyle {\begin{aligned}x_{ji}|G_{j}&\sim \sum _{k=1}^{\infty }\pi _{jk}F(\theta _{k}^{*})\end{aligned}}}

حيث الذراتθك*{\displaystyle \theta _{k}^{*}}تلعب دور معلمات مكونات الخليط، بينما الكتلπجك{\displaystyle \pi _{jk}}تلعب هذه العناصر دور نسب المزج. في الختام، يتم نمذجة كل مجموعة بيانات باستخدام نموذج مزيج، حيث تشترك جميع المجموعات في مكونات المزيج، بينما تكون نسب المزج خاصة بكل مجموعة. من منظور التجميع، يمكننا تفسير كل مكون من مكونات المزيج على أنه يمثل مجموعة من عناصر البيانات، حيث تشترك جميع المجموعات في مجموعات فرعية، ولكل مجموعة نسب مزج خاصة بها، تتكون من تركيبات مختلفة من هذه المجموعات الفرعية.

التطبيقات

يُعدّ نموذج خليط HDP تعميمًا طبيعيًا غير بارامتري لتخصيص ديريشلي الكامن ، حيث يمكن أن يكون عدد المواضيع غير محدود ويتم تعلمه من البيانات. [ 1 ] هنا، كل مجموعة عبارة عن مستند يتكون من مجموعة من الكلمات، وكل عنقود عبارة عن موضوع، وكل مستند عبارة عن مزيج من المواضيع. كما يُعدّ HDP مكونًا أساسيًا لنموذج ماركوف المخفي اللانهائي ، [ 3 ] وهو تعميم غير بارامتري لنموذج ماركوف المخفي يسمح بأن يكون عدد الحالات غير محدود ويتم تعلمه من البيانات. [ 1 ] [ 4 ]

التعميمات

يمكن تعميم عملية HDP في عدة اتجاهات. إذ يمكن استبدال عمليات ديريشليه بعمليات بيتمان-يور وعمليات جاما ، مما ينتج عنه عملية بيتمان-يور الهرمية وعملية جاما الهرمية. ويمكن أن يكون التسلسل الهرمي أعمق، مع مستويات متعددة من المجموعات مرتبة في تسلسل هرمي. وقد استُغل هذا الترتيب في مُخزن التسلسل ، وهو نموذج بايزي غير بارامتري للتسلسلات، يتميز بتسلسل هرمي متعدد المستويات من عمليات بيتمان-يور. بالإضافة إلى ذلك، يستخلص نموذج التعلم متعدد المجالات البايزي (BMDL) تمثيلات كامنة تعتمد على المجال لبيانات العد ذات التشتت الزائد ، استنادًا إلى تحليل ذي الحدين السالب الهرمي، وذلك لتصنيف أنواع السرطان الفرعية بدقة، حتى لو كان عدد العينات لنوع سرطان معين صغيرًا. [ 5 ]

انظر أيضاً

مراجع

  1. 1 2 3 4 5 تيه، واي دبليو؛ جوردان، إم آي؛ بيل، إم جيه؛ بلي، دي إم (2006). "عمليات ديريشليه الهرمية" (ملف PDF) . مجلة الجمعية الإحصائية الأمريكية . 101 (476): ص 1566-1581. CiteSeerX 10.1.1.5.9094 . doi : 10.1198/016214506000000302 . S2CID 7934949 .  
  2. تيه، واي دبليو؛ جوردان، إم آي (2010). نماذج بايزية غير بارامترية هرمية مع تطبيقات (ملف PDF) . مطبعة جامعة كامبريدج . الصفحات 158-207 . CiteSeerX 10.1.1.157.9451 . doi : 10.1017/CBO9780511802478.006 . ISBN   9780511802478.{{cite book}}تم |journal=تجاهله ( مساعدة )
  3. 1 2 بيال، إم جيه، غهراماني، زد، ورسموسن، سي إي (2002). "نموذج ماركوف المخفي اللانهائي" (ملف PDF). التقدم في أنظمة معالجة المعلومات العصبية 14: 577-585. كامبريدج، ماساتشوستس: مطبعة معهد ماساتشوستس للتكنولوجيا.
  4. فوكس، إميلي ب. ، وآخرون. "نموذج HDP-HMM لاصق مع تطبيق لتحديد هوية المتحدث." حوليات الإحصاء التطبيقي (2011): 1020-1056.
  5. حاجيراميزانالي، إي. ودادانه، إس زد وكربالايغاره، أ. وتشو، زد. وكيان، إكس. "التعلم متعدد المجالات باستخدام نظرية بايز لاكتشاف الأنواع الفرعية للسرطان من بيانات تعداد التسلسل من الجيل التالي" (ملف PDF). المؤتمر الثاني والثلاثون لأنظمة معالجة المعلومات العصبية (NIPS 2018)، مونتريال، كندا.