الانتروبيا المتقاطعة

في نظرية المعلومات ، الإنتروبيا المتقاطعة بين توزيعين احتماليينص{\displaystyle p}وq{\displaystyle q}يقيس هذا المقياس، على نفس مجموعة الأحداث الأساسية، متوسط ​​عدد البتات اللازمة لتحديد حدث مُختار من المجموعة عندما يتم تحسين نظام الترميز المستخدم للمجموعة وفقًا لتوزيع احتمالي مُقدَّر.q{\displaystyle q}، بدلاً من التوزيع الحقيقيص{\displaystyle p}.

تعريف

الإنتروبيا المتقاطعة للتوزيعq{\displaystyle q} بالنسبة للتوزيعص{\displaystyle p}يتم تعريف المجموعة المعطاة على النحو التالي:

ح(ص،q)=-هـص[سجلq]،{\displaystyle H(p,q)=-\operatorname {E} _{p}[\log q],}

أينهـص[]{\displaystyle \operatorname {E} _{p}[\cdot ]}هو عامل القيمة المتوقعة بالنسبة للتوزيعص{\displaystyle p}.

يمكن صياغة التعريف باستخدام تباعد كولباك-لايبيردكل(صq){\displaystyle D_{\mathrm {KL} }(p\parallel q)}تباينص{\displaystyle p}منq{\displaystyle q}(المعروف أيضًا باسم الإنتروبيا النسبية لـص{\displaystyle p}بالنسبة إلىq{\displaystyle q}).

ح(ص،q)=ح(ص)+دكل(صq)،{\displaystyle H(p,q)=H(p)+D_{\mathrm {KL} }(p\parallel q),}

أينح(ص){\displaystyle H(p)}هي إنتروبياص{\displaystyle p}.

بالنسبة لتوزيعات الاحتمالات المنفصلةص{\displaystyle p}وq{\displaystyle q}بنفس الدعمX{\displaystyle {\mathcal {X}}}، هذا يعنى

ح(ص،q)=-xXص(x)سجلq(x).{\displaystyle H(p,q)=-\sum _{x\in {\mathcal {X}}}p(x)\,\log q(x).}   ( المعادلة 1 )

وينطبق الأمر نفسه على التوزيعات المستمرة . علينا أن نفترض أنص{\displaystyle p}وq{\displaystyle q}متصلة بشكل مطلق بالنسبة إلى مقياس مرجعي مار{\displaystyle r}(عادةر{\displaystyle r}(هو مقياس ليبيغ على جبر بوريل سيغما ). ليكنP{\displaystyle P}وسؤال{\displaystyle Q}لتكن دوال كثافة الاحتمال لـص{\displaystyle p}وq{\displaystyle q}بالنسبة إلىر{\displaystyle r}. ثم

-XP(x)سجلسؤال(x)دx=هـص[-سجلسؤال]،{\displaystyle -\int _{\mathcal {X}}P(x)\,\log Q(x)\,\mathrm {d} x=\operatorname {E} _{p}[-\log Q],}

وبالتالي

ح(ص،q)=-XP(x)سجلسؤال(x)دx.{\displaystyle H(p,q)=-\int _{\mathcal {X}}P(x)\,\log Q(x)\,\mathrm {d} x.}   ( المعادلة 2 )

ملاحظة: الترميزح(ص،q){\displaystyle H(p,q)}يُستخدم أيضًا لمفهوم مختلف، وهو الإنتروبيا المشتركة لـص{\displaystyle p}وq{\displaystyle q}.

تحفيز

في نظرية المعلومات ، تنص نظرية كرافت - ماكميلان على أن أي نظام ترميز قابل للفك المباشر لترميز رسالة لتحديد قيمة واحدةxأنا{\displaystyle x_{i}}من بين مجموعة من الاحتمالات{x1،...،xن}{\displaystyle \{x_{1},\ldots ,x_{n}\}}يمكن اعتبارها بمثابة تمثيل لتوزيع احتمالي ضمنيq(xأنا)=(12)أنا{\displaystyle q(x_{i})=\left({\frac {1}{2}}\right)^{\ell _{i}}}زيادة{x1،...،xن}{\displaystyle \{x_{1},\ldots ,x_{n}\}}، أينأنا{\displaystyle \ell _{i}}يمثل طول الكود لـxأنا{\displaystyle x_{i}}بالبتات. لذلك، يمكن تفسير الانتروبيا المتقاطعة على أنها طول الرسالة المتوقع لكل معلومة عند وجود توزيع خاطئ.q{\displaystyle q}يُفترض ذلك بينما تتبع البيانات في الواقع توزيعًاص{\displaystyle p}ولهذا السبب يتم حساب القيمة المتوقعة بناءً على التوزيع الاحتمالي الحقيقيص{\displaystyle p}وليسq.{\displaystyle q.}في الواقع، طول الرسالة المتوقع في ظل التوزيع الحقيقيص{\displaystyle p}يكون

هـص[]=-هـص[lnq(x)ln(2)]=-هـص[سجل2q(x)]=-xأناص(xأنا)سجل2q(xأنا)=-xص(x)سجل2q(x)=ح(ص،q).{\displaystyle {\begin{aligned}\operatorname {E} _{p}[\ell ]&=-\operatorname {E} _{p}\left[{\frac {\ln {q(x)}}{\ln(2)}}\right]\\[1ex]&=-\operatorname {E} _{p}\left[\log _{2}{q(x)}\right]\\[1ex]&=-\sum _{x_{i}}p(x_{i})\,\log _{2}q(x_{i})\\[1ex]&=-\sum _{x}p(x)\,\log _{2}q(x)=H(p,q).\end{aligned}}}

تقدير

توجد العديد من الحالات التي تتطلب قياس الانتروبيا المتقاطعة، ولكن توزيعهاص{\displaystyle p}غير معروف. ومن الأمثلة على ذلك نمذجة اللغة ، حيث يتم إنشاء نموذج بناءً على مجموعة تدريب.تي{\displaystyle T}ثم يتم قياس الانتروبيا المتقاطعة على مجموعة اختبار لتقييم مدى دقة النموذج في التنبؤ ببيانات الاختبار. في هذا المثال،ص{\displaystyle p}يمثل التوزيع الحقيقي للكلمات في أي مجموعة بيانات، وq{\displaystyle q}يمثل هذا التوزيع توزيع الكلمات كما تنبأ به النموذج. ولأن التوزيع الحقيقي غير معروف، لا يمكن حساب الإنتروبيا المتقاطعة مباشرةً. في هذه الحالات، يتم حساب تقدير للإنتروبيا المتقاطعة باستخدام الصيغة التالية:

ح(تي،q)=-أنا=1شمال1شمالسجل2q(xأنا){\displaystyle H(T,q)=-\sum _{i=1}^{N}{\frac {1}{N}}\log _{2}q(x_{i})}

أينشمال{\displaystyle N}حجم مجموعة الاختبار، وq(x){\displaystyle q(x)}احتمال وقوع الحدثx{\displaystyle x}تم تقدير ذلك من مجموعة التدريب. بعبارة أخرى،q(xأنا){\displaystyle q(x_{i})}يمثل تقدير الاحتمالية للنموذج أن الكلمة رقم i في النص هيxأنا{\displaystyle x_{i}}يتم حساب المتوسط ​​للمجموع على مدىشمال{\displaystyle N}كلمات الاختبار. هذا تقدير مونت كارلو للإنتروبيا التقاطعية الحقيقية، حيث تُعامل مجموعة الاختبار كعينات منص(x){\displaystyle p(x)}.

العلاقة بأقصى احتمال

ينشأ الانتروبيا المتقاطع في مشاكل التصنيف عند إدخال اللوغاريتم في صورة دالة الاحتمال اللوغاريتمي .

يتناول هذا القسم تقدير احتمالات النتائج المنفصلة المختلفة. ولتحقيق هذه الغاية، نرمز إلى عائلة التوزيعات المُعَلمة بـqθ{\displaystyle q_{\theta }}، معθ{\displaystyle \theta }رهناً بجهود التحسين. لنفترض وجود سلسلة محدودة معينة منشمال{\displaystyle N}قيمxأنا{\displaystyle x_{i}}من مجموعة تدريبية، تم الحصول عليها من خلال أخذ عينات مستقلة شرطيًا . الاحتمالية المخصصة لأي معلمة معتبرةθ{\displaystyle \theta }ثم يتم تحديد النموذج من خلال حاصل ضرب جميع الاحتمالاتqθ(X=xأنا){\displaystyle q_{\theta }(X=x_{i})}من الممكن حدوث تكرارات، مما يؤدي إلى عوامل متساوية في الناتج. إذا كان عدد مرات ظهور القيمة مساويًا لـx{\displaystyle x}يُرمز إليه بـ8x{\displaystyle \#x}ثم يكون تكرار تلك القيمة مساوياً8x/شمال{\displaystyle \#x/N}. لوص(X=x){\displaystyle p(X=x)}يمثل التوزيع الاحتمالي الأساسي، بالنسبة للقيم الكبيرة شمال{\displaystyle N}نتوقعص(X=x)8x/شمال{\displaystyle p(X=x)\approx \#x/N}، بحسب قانون الأعداد الكبيرة .

كتابة دالة الاحتمالية لدينا كحاصل ضرب المشاهدات من التوزيعqθ{\displaystyle q_{\theta }}: ل(θ؛x)=أناqθ(X=xأنا)=xqθ(X=x)8xxqθ(X=x)شمالص(X=x)=خبرةسجل[xqθ(X=x)شمالص(X=x)]=خبرة(xشمالص(X=x)سجلqθ(X=x))،{\displaystyle {\begin{aligned}{\mathcal {L}}(\theta ;{\mathbf {x} })&=\prod _{i}q_{\theta }(X=x_{i})=\prod _{x}q_{\theta }(X=x)^{\#x}\\&\approx \prod _{x}q_{\theta }(X=x)^{N\cdot p(X=x)}=\exp \log \left[\prod _{x}q_{\theta }(X=x)^{N\cdot p(X=x)}\right]\\&=\exp \left(\sum _{x}N\cdot p(X=x)\log q_{\theta }(X=x)^{}\right),\end{aligned}}} حيث استخدمنا قواعد حساب اللوغاريتم في السطر الأخير. لاحظ كيف يحتوي الأس على-ح(ص،qθ){\displaystyle -H(p,q_{\theta })}بأخذ اللوغاريتم للطرفين نحصل على: سجلل(θ؛x)=-شمالح(ص،qθ).{\displaystyle \log {\mathcal {L}}(\theta {\mathbf {x} })=-N\cdot H(p,q_{\theta }).} بما أن اللوغاريتم دالة متزايدة بشكل رتيب ، فإن القيمة القصوى لـ θ{\displaystyle \theta }لا تتأثر بهذه الخطوة الأخيرة. وبالمثل، فإن القيمة القصوى لـ θ{\displaystyle \theta }لا يتأثر بعاملشمال{\displaystyle N}لذا نلاحظ أن تعظيم الاحتمالية يرقى إلى تقليل الإنتروبيا المتقاطعة.

تقليل الإنتروبيا المتقاطعة

يُستخدم تقليل الإنتروبيا المتقاطعة بشكل متكرر في التحسين وتقدير احتمالية الأحداث النادرة. عند مقارنة توزيع ماq{\displaystyle q}مقابل توزيع مرجعي ثابتص{\displaystyle p}تتطابق قيم الإنتروبيا المتقاطعة وتباعد كولباك-لايبير حتى ثابت إضافي (لأنص{\displaystyle p}(ثابت): وفقًا لمتباينة جيبس ، يأخذ كلاهما قيمهما الدنيا عندماص=q{\displaystyle p=q}، وهو0{\displaystyle 0}بالنسبة لتباعد كولباك-لايبير، وح(ص){\displaystyle \mathrm {H} (p)}بالنسبة للإنتروبيا المتقاطعة. في الأدبيات الهندسية، يُطلق على مبدأ تقليل تباعد كولباك-لايبير ( مبدأ كولباك "الحد الأدنى من معلومات التمييز ") غالبًا اسم مبدأ الحد الأدنى من الإنتروبيا المتقاطعة (MCE)، أو Minxent .

ومع ذلك، وكما نوقش في مقال تباعد كولباك-لايبير ، فإن التوزيع في بعض الأحيانq{\displaystyle q}هو التوزيع المرجعي المسبق الثابت، والتوزيعص{\displaystyle p}تم تحسينه ليكون أقرب ما يمكن إلىq{\displaystyle q}قدر الإمكان، مع مراعاة بعض القيود. في هذه الحالة، لا يكون التصغيران متكافئين. وقد أدى ذلك إلى بعض الغموض في الأدبيات، حيث حاول بعض المؤلفين حل هذا التناقض بإعادة صياغة مفهوم الإنتروبيا المتقاطعة على النحو التالي:دكل(صq){\displaystyle D_{\mathrm {KL} }(p\parallel q)}بدلاً منح(ص،q){\displaystyle H(p,q)}في الواقع، الإنتروبيا المتقاطعة هي اسم آخر للإنتروبيا النسبية ؛ انظر كوفر وتوماس [ 1 ] وجود [ 2 ] . من ناحية أخرى،ح(ص،q){\displaystyle H(p,q)}لا يتفق مع الأدبيات وقد يكون مضللاً.

دالة خسارة الإنتروبيا المتقاطعة والانحدار اللوجستي

يمكن استخدام الانتروبيا المتقاطعة لتعريف دالة الخسارة في التعلم الآلي والتحسين . يقدم ماو، وموهري، وتشونغ (2023) تحليلًا شاملًا لخصائص عائلة دوال خسارة الانتروبيا المتقاطعة في التعلم الآلي، بما في ذلك ضمانات التعلم النظرية وامتداداتها إلى التعلم التنافسي . [ 3 ] الاحتمال الحقيقيصأنا{\displaystyle p_{i}}هو التصنيف الحقيقي، والتوزيع المعطىqأنا{\displaystyle q_{i}}تمثل القيمة المتوقعة للنموذج الحالي. وتُعرف هذه القيمة أيضًا باسم خسارة اللوغاريتم (أو الخسارة اللوغاريتمية [ 4 ] أو الخسارة اللوجستية[ 5 ] ويُستخدم مصطلحا "خسارة اللوغاريتم" و"خسارة الإنتروبيا المتقاطعة" بشكل متبادل. [ 6 ]

وبشكل أكثر تحديدًا، ضع في اعتبارك نموذج الانحدار الثنائي الذي يمكن استخدامه لتصنيف الملاحظات إلى فئتين محتملتين (غالبًا ما يتم تسميتهما ببساطة بـ0{\displaystyle 0}و1{\displaystyle 1}). مخرجات النموذج لملاحظة معينة، بالنظر إلى متجه من خصائص الإدخالx{\displaystyle x}يمكن تفسيرها على أنها احتمال، والذي يُستخدم كأساس لتصنيف المشاهدة. في الانحدار اللوجستي ، يتم نمذجة الاحتمال باستخدام الدالة اللوجستية .ز(z)=1/(1+هـ-z){\displaystyle g(z)=1/(1+e^{-z})}أينz{\displaystyle z}هي دالة ما لمتجه الإدخالx{\displaystyle x}وهي عادةً دالة خطية. احتمالية الناتجy=1{\displaystyle y=1}يُعطى بواسطة qy=1=y^ز(wx)=11+هـ-wx،{\displaystyle q_{y=1}={\hat {y}}\equiv g(\mathbf {w} \cdot \mathbf {x} )={\frac {1}{1+e^{-\mathbf {w} \cdot \mathbf {x} }}},} حيث متجه الأوزانw{\displaystyle \mathbf {w} }يتم تحسينها من خلال خوارزمية مناسبة مثل خوارزمية التدرج الهبوطي . وبالمثل، فإن الاحتمالية التكميلية لإيجاد المخرجاتy=0{\displaystyle y=0}يُعطى ببساطة بواسطة qy=0=1-y^.{\displaystyle q_{y=0}=1-{\hat {y}}.}

بعد إعداد نظام التدوين الخاص بنا،ص{y،1-y}{\displaystyle p\in \{y,1-y\}}وq{y^،1-y^}{\displaystyle q\in \{{\hat {y}},1-{\hat {y}}\}}يمكننا استخدام الانتروبيا المتقاطعة للحصول على مقياس للاختلاف بينص{\displaystyle p}وq{\displaystyle q}: ح(ص،q)=-مصمسجلqم=-yسجلy^-(1-y)سجل(1-y^).{\displaystyle {\begin{aligned}H(p,q)&=-\sum _{m}p_{m}\log q_{m}=-y\log {\hat {y}}-(1-y)\log(1-{\hat {y}}).\end{aligned}}}

يوضح الرسم البياني دوال الخسارة المختلفة التي يمكن استخدامها لتدريب مصنف ثنائي. ويُعرض فقط الحالة التي يكون فيها الناتج المستهدف 1. ويُلاحظ أن الخسارة تساوي صفرًا عندما يكون الناتج المستهدف مساويًا للناتج، وتزداد كلما ازداد خطأ الناتج.

عادةً ما يُحسّن الانحدار اللوجستي دالة الخسارة اللوغاريتمية لجميع المشاهدات التي يُدرّب عليها، وهو ما يُعادل تحسين متوسط ​​الإنتروبيا المتقاطعة في العينة. ويمكن أيضًا استخدام دوال خسارة أخرى تُعاقب الأخطاء بشكل مختلف للتدريب، مما ينتج عنه نماذج ذات دقة اختبار نهائية مختلفة. [ 7 ] على سبيل المثال، لنفترض أن لديناشمال{\displaystyle N}عينات مع فهرسة كل عينة بواسطةن=1،...،شمال{\displaystyle n=1,\dots ,N}يُعطى متوسط ​​دالة الخسارة بالصيغة التالية :

ج(w)=1شمالأنا=1شمالح(صأنا،qأنا)=-1شمالأنا=1شمال [yأناسجلy^أنا+(1-yأنا)سجل(1-y^أنا)]،{\displaystyle {\begin{aligned}J(\mathbf {w} )&={\frac {1}{N}}\sum _{i=1}^{N}H(p_{i},q_{i})\\&=-{\frac {1}{N}}\sum _{i=1}^{N}\ \left[y_{i}\log {\hat {y}}_{i}+(1-y_{i})\log(1-{\hat {y}}_{i})\right],\end{aligned}}}

أينy^أناز(wxأنا)=1/(1+هـ-wxأنا){\displaystyle {\hat {y}}_{i}\equiv g(\mathbf {w} \cdot \mathbf {x} _{i})=1/(1+e^{-\mathbf {w} \cdot \mathbf {x} _{i}})}، معز(z){\displaystyle g(z)}كما هو الحال مع الدالة اللوجستية كما في السابق.

العلاقة بالانحدار الخطي

إن تدرج دالة خسارة الإنتروبيا المتقاطعة للانحدار اللوجستي يساوي تدرج دالة خسارة مربع الخطأ للانحدار الخطي (حتى عامل ثابت). ولتوضيح ذلك، عرّف

X(1x11...x1ص1x21x2ص1xشمال1xشمالص)Rشمال×(ص+1)،{\displaystyle X\equiv {\begin{pmatrix}1&x_{11}&\dots &x_{1p}\\1&x_{21}&\cdots &x_{2p}\\\vdots &\vdots &&\vdots \\1&x_{N1}&\cdots &x_{Np}\\\end{pmatrix}}\in \mathbb {R} ^{N\times (p+1)},}yأنا^=ز(wXأنا)=11+خبرة(-w0-w1xأنا1--wصxأناص)،{\displaystyle {\hat {y_{i}}}=g(\mathbf {w} \cdot X^{i})={\frac {1}{1+\exp(-w_{0}-w_{1}x_{i1}-\dots -w_{p}x_{ip})}},}ل(w)-أنا=1شمال[yأناlny^أنا+(1-yأنا)ln(1-y^أنا)].{\displaystyle L(\mathbf {w} )\equiv -\sum _{i=1}^{N}\left[y_{i}\ln {\hat {y}}_{i}+(1-y_{i})\ln(1-{\hat {y}}_{i})\right].}

ثم نحصل على النتيجة

wل(w)=Xتي(y^-y).{\displaystyle \nabla _{\mathbf {w} }L(\mathbf {w} )=X^{\mathsf {T}}({\hat {\mathbf {y} }}-\mathbf {y} ).}

الدليل: لأيy^أنا{\displaystyle {\hat {y}}_{i}}لدينا

w0lny^أنا=w0ln11+هـ-w0+ك0=هـ-w0+ك01+هـ-w0+ك0=1-y^أنا،{\displaystyle {\frac {\partial }{\partial w_{0}}}\ln {\hat {y}}_{i}={\frac {\partial }{\partial w_{0}}}\ln {\frac {1}{1+e^{-w_{0}+k_{0}}}}={\frac {e^{-w_{0}+k_{0}}}{1+e^{-w_{0}+k_{0}}}}=1-{\hat {y}}_{i},}w0ln(1-y^أنا)=w0ln(1-11+هـ-w0+ك0)=-11+هـ-w0+ك0=-y^أنا{\displaystyle {\frac {\partial }{\partial w_{0}}}\ln(1-{\hat {y}}_{i})={\frac {\partial }{\partial w_{0}}}\ln \left(1-{\frac {1}{1+e^{-w_{0}+k_{0}}}}\right)={\frac {-1}{1+e^{-w_{0}+k_{0}}}}=-{\hat {y}}_{i}} وبالتالي لw0=-أنا=1شمال[yأنا(1-y^أنا)-(1-yأنا)y^أنا]=-أنا=1شمال[yأنا-y^أنا]=أنا=1شمالXأنا0(y^أنا-yأنا).{\displaystyle {\begin{aligned}{\frac {\partial L}{\partial w_{0}}}&=-\sum _{i=1}^{N}[y_{i}(1-{\hat {y}}_{i})-(1-y_{i}){\hat {y}}_{i}]=-\sum _{i=1}^{N}[y_{i}-{\hat {y}}_{i}]=\sum _{i=1}^{N}X_{i0}({\hat {y}}_{i}-y_{i}).\end{aligned}}}

وبالمثل، بالنسبة لأيy^أنا{\displaystyle {\hat {y}}_{i}}وج=1،...،ص{\displaystyle j=1,\dots ,p}لدينا wجlny^أنا=wجln11+هـ-wجxأناج+كج=xأناجهـ-wجxأناج+كج1+هـ-wجxأناج+كج=xأناج(1-y^أنا)،{\displaystyle {\frac {\partial }{\partial w_{j}}}\ln {\hat {y}}_{i}={\frac {\partial }{\partial w_{j}}}\ln {\frac {1}{1+e^{-w_{j}x_{ij}+k_{j}}}}={\frac {x_{ij}e^{-w_{j}x_{ij}+k_{j}}}{1+e^{-w_{j}x_{ij}+k_{j}}}}=x_{ij}(1-{\hat {y}}_{i}),}wجln(1-y^أنا)=wجln[1-11+هـ-wجxأناج+كج]=-xأناج1+هـ-wجxأناج+كج=-xأناجy^أنا{\displaystyle {\frac {\partial }{\partial w_{j}}}\ln(1-{\hat {y}}_{i})={\frac {\partial }{\partial w_{j}}}\ln \left[1-{\frac {1}{1+e^{-w_{j}x_{ij}+k_{j}}}}\right]={\frac {-x_{ij}}{1+e^{-w_{j}x_{ij}+k_{j}}}}=-x_{ij}{\hat {y}}_{i}} وبالتالي لwج=-أنا=1شمالxأناج[yأنا(1-y^أنا)-(1-yأنا)y^أنا]=أنا=1شمالXأناج(y^أنا-yأنا).{\displaystyle {\begin{aligned}{\frac {\partial L}{\partial w_{j}}}&=-\sum _{i=1}^{N}x_{ij}[y_{i}(1-{\hat {y}}_{i})-(1-y_{i}){\hat {y}}_{i}]=\sum _{i=1}^{N}X_{ij}({\hat {y}}_{i}-y_{i}).\end{aligned}}}

بجمع هذه النتائج، نحصل على النتيجة المرجوة. لاحظ أننا استخدمنا هنا اللوغاريتم الطبيعي.لن{\displaystyle ln}بدلاً منلoز{\displaystyle log}(قانوني)لoز2{\displaystyle log_{2}}) في دالة الخسارةل{\displaystyle L}هذا ببساطة يغير النتيجة بمعامللoز(هـ){\displaystyle log(e)}مع ذلك. علاوة على ذلك، بالنسبة للجميعأنا{\displaystyle i}أُعيد استخدامهاك0:=-ل=1صwلxأنال{\displaystyle k_{0}:=-\sum _{l=1}^{p}w_{l}x_{il}}وكج:=-w0-لجwلxأنال{\displaystyle k_{j}:=-w_{0}-\sum _{l\neq j}w_{l}x_{il}}كثوابت بالنسبة لكلwج{\displaystyle w_{j}}.

الانتروبيا المتقاطعة المعدلة

قد يكون من المفيد تدريب مجموعة من النماذج المتنوعة، بحيث يؤدي دمجها إلى زيادة دقة التنبؤ. [ 8 ] [ 9 ] بافتراض مجموعة بسيطة منك{\displaystyle K}يتم تجميع المصنفات عن طريق حساب متوسط ​​المخرجات، ثم يتم حساب الإنتروبيا المتقاطعة المعدلة بواسطة هـك=ح(ص،qك)-λكجكح(qج،qك){\displaystyle e^{k}=H(p,q^{k})-{\frac {\lambda }{K}}\sum _{j\neq k}H(q^{j},q^{k})} أينهـك{\displaystyle e^{k}}هي دالة التكلفة لـكتح{\displaystyle k^{th}}المصنف،qك{\displaystyle q^{k}}هي احتمالية الناتج لـكتح{\displaystyle k^{th}}المصنف،ص{\displaystyle p}الاحتمال الحقيقي المراد تقديره، وλ{\displaystyle \lambda }هو مُعامل بين 0 و1 يُحدد "التنوع" الذي نرغب في تحقيقه بين المجموعة. عندماλ=0{\displaystyle \lambda =0}نريد أن يؤدي كل مصنف أفضل ما لديه بغض النظر عن المجموعة ومتىλ=1{\displaystyle \lambda =1}نريد أن يكون المصنف متنوعًا قدر الإمكان.

انظر أيضاً

مراجع

  1. توماس إم. كوفر، جوي أ. توماس، عناصر نظرية المعلومات، الطبعة الثانية، وايلي، ص 80
  2. آي جيه جود، أقصى إنتروبيا لصياغة الفرضيات، وخاصة لجداول التوافق متعددة الأبعاد، حوليات الإحصاء الرياضي، 1963
  3. أنكي ماو، مهريار مهري، يوتاو تشونغ. دوال خسارة الإنتروبيا المتقاطعة: التحليل النظري والتطبيقات. المؤتمر الدولي للتعلم الآلي 2023. https://arxiv.org/pdf/2304.07288.pdf
  4. رياضيات ترميز المعلومات واستخراجها وتوزيعها ، بقلم جورج سيبينكو، وديان ب. أوليري، وجورما ريسانين، 1999، ص 82
  5. الاحتمالات في التعلم الآلي: اكتشف كيفية تسخير عدم اليقين باستخدام بايثون ، جيسون براونلي، 2019، ص 220: "يشير مصطلح الخسارة اللوجستية إلى دالة الخسارة المستخدمة عادةً لتحسين نموذج الانحدار اللوجستي. وقد يُشار إليها أيضًا باسم الخسارة اللوغاريتمية (وهو مصطلح مُربك) أو ببساطة الخسارة اللوغاريتمية."
  6. "sklearn.metrics.log_loss" . مرجع واجهة برمجة التطبيقات وثائق scikit-learn 1.7.1 .
  7. نويل، ماثيو؛ بانيرجي، أريندام؛ د، جيرالدين بيسي أمالي؛ موثيا-ناكاراجان، فينكاتارامان (17 مارس 2023). "يمكن لدوال الخسارة البديلة للتصنيف والانحدار القوي تحسين دقة الشبكات العصبية الاصطناعية". arXiv : 2303.09935 [ cs.NE ].
  8. شوهام، رون؛ بيرموتر، حاييم ح. (2019). "تكلفة الإنتروبيا المتقاطعة المعدلة: منهج لتشجيع التنوع في مجموعات التصنيف (إعلان موجز)". في: دوليف، شلومي؛ هندلر، داني؛ لودها، ساشين؛ يونغ، موتي (محررون). الأمن السيبراني والتشفير والتعلم الآلي - الندوة الدولية الثالثة، CSCML 2019، بئر السبع، إسرائيل، 27-28 يونيو 2019، وقائع المؤتمر . سلسلة محاضرات في علوم الحاسوب. المجلد 11527. سبرينغر. الصفحات 202-207 . doi : 10.1007/978-3-030-20951-3_18 . ISBN   978-3-030-20950-6.
  9. شوهام، رون؛ بيرموتير، حاييم (2020). "تكلفة الإنتروبيا المتقاطعة المعدلة: إطار عمل لتشجيع التنوع الصريح". arXiv : 2007.08140 [ cs.LG ].

للمزيد من القراءة