التوزيع متعدد الحدود

في نظرية الاحتمالات ، يُعد التوزيع متعدد الحدود تعميمًا للتوزيع ذي الحدين . على سبيل المثال، يُمثل هذا التوزيع احتمالية عدد مرات ظهور كل وجه من أوجه نرد ذي k وجهًا عند رميه n مرة. في n تجربة مستقلة ، تؤدي كل منها إلى نجاح واحد فقط من بين k فئة، ولكل فئة احتمال نجاح ثابت، يُعطي التوزيع متعدد الحدود احتمالية أي توليفة معينة من عدد مرات النجاح للفئات المختلفة.

عندما تكون قيمة k تساوي 2 وقيمة n تساوي 1، يكون التوزيع متعدد الحدود هو توزيع برنولي . وعندما تكون قيمة k تساوي 2 وقيمة n أكبر من 1، يكون التوزيع ثنائي الحدين . وعندما تكون قيمة k أكبر من 2 وقيمة n تساوي 1، يكون التوزيع فئويًا . يُستخدم مصطلح "متعدد الحدود" أحيانًا للإشارة إلى التوزيع الفئوي للتأكيد على هذه العلاقة الرباعية (حيث تحدد n اللاحقة، و k البادئة).

يمثل توزيع برنولي نتيجة تجربة برنولي واحدة . بعبارة أخرى، يحدد ما إذا كان رمي قطعة نقدية (قد تكون متحيزة ) مرة واحدة سيؤدي إلى نجاح (ظهور صورة) أو فشل (ظهور كتابة). يعمم التوزيع ذو الحدين هذا ليشمل عدد مرات ظهور الصورة عند إجراء n رمية مستقلة (تجارب برنولي) لنفس القطعة النقدية. أما التوزيع متعدد الحدود فيمثل نتيجة n تجربة، حيث يكون لنتيجة كل تجربة توزيع فئوي ، مثل رمي نرد ذي k وجه (قد يكون متحيزًا ) n مرة.

ليكن k عددًا ثابتًا محدودًا. رياضيًا، لدينا k نتيجة محتملة متنافية، باحتمالات مقابلة p₁ , ..., pₖ ، و n تجربة مستقلة. بما أن النتائج k متنافية ولا بد من وقوع إحداها، فإن pᵢ   0  لـ i  =  1,  ..., k و أنا=1كصأنا=1{\textstyle \sum _{i=1}^{k}p_{i}=1}إذا كانت المتغيرات العشوائية Xᵢ تشير إلى عدد مرات ظهور النتيجة رقم i خلال n من المحاولات، فإن المتجه X = ( X₁ , ..., Xₖ ) يتبع توزيعًا متعدد الحدود بمعاملات n و p ، حيث p = ( p₁ , ..., pₖ ) . وبينما تكون المحاولات مستقلة، فإن نتائجها Xᵢ تكون مترابطة لأن مجموعها يساوي n.        

التعريفات

دالة الكتلة الاحتمالية

لنفترض أننا نجري تجربة لسحب n كرة من k لون مختلف من كيس، مع إعادة الكرات المسحوبة بعد كل سحبة. الكرات من نفس اللون متكافئة. لنرمز إلى عدد الكرات المسحوبة من اللون i (حيث i = 1، ...، k ) بالرمز Xᵢ ، ولنرمز إلى احتمال أن تكون الكرة المسحوبة من اللون i بالرمز pᵢ . دالة الكتلة الاحتمالية لهذا التوزيع متعدد الحدود هي:

و(x1،...،xك؛ن،ص1،...،صك)=برو(X1=x1 و ... و Xك=xك)={ن!x1!xك!ص1x1××صكxك،متى أنا=1كxأنا=ن0خلاف ذلك،{\displaystyle {\begin{aligned}f(x_{1},\ldots ,x_{k};n,p_{1},\ldots ,p_{k})&{}=\Pr(X_{1}=x_{1}{\text{ و }}\dots {\text{ و }}X_{k}=x_{k})\\[1ex]&{}={\begin{cases}{\displaystyle {n! \over x_{1}!\cdots x_{k}!}p_{1}^{x_{1}}\times \cdots \times p_{k}^{x_{k}}},\quad &{\text{عندما }}\sum _{i=1}^{k}x_{i}=n\\\\0&{\text{فيما عدا ذلك،}}\end{cases}}\end{aligned}}}

بالنسبة للأعداد الصحيحة غير السالبة x 1 ، ... ، x k .

يمكن التعبير عن دالة الكتلة الاحتمالية باستخدام دالة جاما كما يلي:

و(x1،...،xك؛ص1،...،صك)=Γ(أناxأنا+1)أناΓ(xأنا+1)أنا=1كصأناxأنا.{\displaystyle f(x_{1},\dots ,x_{k};p_{1},\ldots ,p_{k})={\frac {\Gamma (\sum _{i}x_{i}+1)}{\prod _{i}\Gamma (x_{i}+1)}}\prod _{i=1}^{k}p_{i}^{x_{i}}.}

يُظهر هذا الشكل تشابهه مع توزيع ديريشليه ، وهو التوزيع المسبق المترافق له .

مثال

لنفترض أنه في انتخابات ثلاثية في دولة كبيرة، حصل المرشح (أ) على 20% من الأصوات، وحصل المرشح (ب) على 30% من الأصوات، وحصل المرشح (ج) على 50% من الأصوات. إذا تم اختيار ستة ناخبين عشوائياً، فما احتمال أن يكون في العينة مؤيد واحد فقط للمرشح (أ)، ومؤيدان للمرشح (ب)، وثلاثة مؤيدين للمرشح (ج)؟

ملاحظة: بما أننا نفترض أن عدد الناخبين كبير، فمن المعقول والمقبول اعتبار الاحتمالات ثابتة بمجرد اختيار ناخب للعينة. من الناحية الفنية، هذه عملية أخذ عينات بدون إرجاع، لذا فإن التوزيع الصحيح هو التوزيع الهندسي الفائق متعدد المتغيرات ، ولكن التوزيعات تتقارب مع ازدياد حجم السكان مقارنةً بحجم عينة ثابت . [ 1 ]

برو(أ=1،ب=2،ج=3)=6!1!2!3!(0.21)(0.32)(0.53)=0.135{\displaystyle \Pr(A{=}1,B{=}2,C{=}3)={\frac {6!}{1!2!3!}}\left(0.2^{1}\right)\left(0.3^{2}\right)\left(0.5^{3}\right)=0.135}

ملكيات

تطبيع

يتم تطبيع التوزيع متعدد الحدود وفقًا لما يلي:

ج=1كxج=نو(x1،...،xك؛ن،ص1،...،صك)=1{\displaystyle \sum _{\sum _{j=1}^{k}x_{j}=n}f(x_{1},\dots ,x_{k};n,p_{1},\dots ,p_{k})=1}

حيث يكون المجموع على جميع تباديلxج{\displaystyle x_{j}}بحيثج=1كxج=ن{\textstyle \sum _{j=1}^{k}x_{j}=n}.

القيمة المتوقعة والتباين

عدد المرات المتوقعة التي لوحظت فيها النتيجة i خلال n من التجارب هو

هـ(Xأنا)=نصأنا.{\displaystyle \operatorname {E} (X_{i})=np_{i}.\,}

مصفوفة التغاير هي كما يلي. كل عنصر قطري هو تباين متغير عشوائي ذي توزيع ثنائي، وبالتالي فهو

متغير(Xأنا)=نصأنا(1-صأنا).{\displaystyle \operatorname {Var} (X_{i})=np_{i}(1-p_{i}).\,}

العناصر غير القطرية هي التغايرات :

كوف(Xأنا،Xج)=-نصأناصج{\displaystyle \operatorname {Cov} (X_{i},X_{j})=-np_{i}p_{j}\,}

لكل i و j مختلفين.

جميع التغايرات سالبة لأنه بالنسبة لقيمة n ثابتة ، فإن الزيادة في أحد مكونات متجه متعدد الحدود تتطلب انخفاضًا في مكون آخر.

عند دمج هذه التعبيرات في مصفوفة تحتوي على العنصرين i و jكوف(Xأنا،Xج)،{\displaystyle \operatorname {cov} (X_{i},X_{j}),}والنتيجة هي مصفوفة تباين شبه موجبة من الرتبة k 1 من الرتبة k × k. في الحالة الخاصة حيث k = n وحيث تكون جميع قيم p i متساوية، فإن مصفوفة التباين هي مصفوفة التمركز .    

عناصر مصفوفة الارتباط المقابلة هي

ρ(Xأنا،Xأنا)=1ρ(Xأنا،Xج)=كوف(Xأنا،Xج)متغير(Xأنا)متغير(Xج)=-صأناصجصأنا(1-صأنا)صج(1-صج)=-صأناصج(1-صأنا)(1-صج).\begin{aligned}\rho(X_{i},X_{i})&=1\\[1ex]\rho(X_{i},X_{j})&={\frac{\operatorname{Cov}(X_{i},X_{j})}{\sqrt{\operatorname{Var}(X_{i})\operatorname{Var}(X_{j})}}}\\&={\frac{-p_{i}p_{j}}{\sqrt{p_{i}(1-p_{i})p_{j}(1-p_{j})}}}\\&=-{\sqrt{\frac{p_{i}p_{j}}{(1-p_{i})(1-p_{j})}}}.\end{aligned}}}

لاحظ أن عدد التجارب n يختفي من هذا التعبير.

لكل مكون من المكونات k على حدة توزيع ذو الحدين مع المعلمات n و p i ، للقيمة المناسبة للرمز السفلي i .

مجموعة دعم التوزيع متعدد الحدود هي

{(ن1،...،نك)شمالك|ن1++نك=ن}.{\displaystyle \left\{(n_{1},\dots ,n_{k})\in \mathbb {N} ^{k}\mid n_{1}+\cdots +n_{k}=n\right\}.}

عدد عناصره هو

(ن+ك-1ك-1).{\displaystyle {\binom {n+k-1}{k-1}}.}

تدوين المصفوفات

في تدوين المصفوفات، هـ(X)=نص،{\displaystyle \operatorname {E} (\mathbf {X} )=n\mathbf {p} ,\,}

و متغير(X)=ن{التشخيص(ص)-صصتي}،{\displaystyle \operatorname {Var} (\mathbf {X} )=n\lbrace \operatorname {diag} (\mathbf {p} )-\mathbf {p} \mathbf {p} ^{\rm {T}}\rbrace ,\,}

حيث p T = منقول متجه الصف لمتجه العمود p .

التصور

كشرائح من مثلث باسكال المعمم

كما يمكن تفسير التوزيع ذي الحدين على أنه شرائح أحادية البعد (مُعَيَّرة) لمثلث باسكال ، كذلك يمكن تفسير التوزيع متعدد الحدود على أنه شرائح ثنائية البعد (مثلثية) لهرم باسكال ، أو شرائح ثلاثية/رباعية الأبعاد (على شكل هرم) لنظائر ذات أبعاد أعلى لمثلث باسكال. يكشف هذا عن تفسير لنطاق التوزيع : "أهرامات" متساوية الأضلاع مُجزَّأة في أي بُعد - أي مُجَسَّم بسيط ذو شبكة.

كمعاملات متعددة الحدود

وبالمثل، يمكن تفسير التوزيع ذي الحدين على أنه معاملات متعددة الحدود لـ(ص+q)ن{\displaystyle (p+q)^{n}}عند توسيعها، يمكن تفسير التوزيع متعدد الحدود على أنه معاملات(ص1+ص2+ص3++صك)ن{\displaystyle (p_{1}+p_{2}+p_{3}+\cdots +p_{k})^{n}}عند توسيعها، مع ملاحظة أن مجموع المعاملات فقط يجب أن يساوي 1.

نظرية الانحراف الكبير

التقارب

بحسب صيغة ستيرلينغ ، عند حدن،x1،...،xك{\displaystyle n,x_{1},\dots ,x_{k}\to \infty }لديناln(نx1،...،xك)+أنا=1كxأناlnصأنا=-ندكوالالمبور(ص^ص)-ك-12ln(2πن)-12أنا=1كln(ص^أنا)+o(1){\displaystyle \ln {\binom {n}{x_{1},\dots ,x_{k}}}+\sum _{i=1}^{k}x_{i}\ln p_{i}=-nD_{\text{KL}}({\hat {p}}\|p)-{\frac {k-1}{2}}\ln(2\pi n)-{\frac {1}{2}}\sum _{i=1}^{k}\ln({\hat {p}}_{i})+o(1)}حيث الترددات النسبيةص^أنا=xأنا/ن{\displaystyle {\hat {p}}_{i}=x_{i}/n}يمكن تفسير البيانات على أنها احتمالات من التوزيع التجريبيص^{\displaystyle {\hat {p}}}، ودكوالالمبور{\displaystyle D_{\text{KL}}}هو تباعد كولباك-لايبير .

يمكن تفسير هذه الصيغة على النحو التالي.

يعتبرΔك{\displaystyle \Delta _{k}}، فضاء جميع التوزيعات الممكنة على الفئات{1،2،...،ك}{\displaystyle \{1,2,\dots ,k\}}إنه مجسم بسيط . بعدن{\displaystyle n}عينات مستقلة من التوزيع الفئويص{\displaystyle p}(وهي الطريقة التي نبني بها التوزيع متعدد الحدود)، نحصل على توزيع تجريبيص^{\displaystyle {\hat {p}}}.

بحسب الصيغة التقاربية، فإن احتمال التوزيع التجريبيص^{\displaystyle {\hat {p}}}ينحرف عن التوزيع الفعليص{\displaystyle p}يتناقص بشكل أُسّي مع زيادة عدد البيانات التي نجمعها، بمعدلدكوالالمبور(ص^ص){\displaystyle D_{\text{KL}}({\hat {p}}\|p)}كلما زادت التجارب، زادت الاختلافاتص^{\displaystyle {\hat {p}}}منص{\displaystyle p}كلما قل احتمال رؤية مثل هذا التوزيع التجريبي، قل احتمال حدوث ذلك.

لوأ{\displaystyle A}هي مجموعة فرعية مغلقة منΔك{\displaystyle \Delta _{k}}ثم عن طريق التقسيمأ{\displaystyle A}إلى أجزاء، والتفكير في معدل نموPر(ص^أϵ){\displaystyle Pr({\hat {p}}\in A_{\epsilon })}على كل قطعةأϵ{\displaystyle A_{\epsilon }}وبذلك نحصل على نظرية سانوف ، التي تنص على أن ليمن1نlnبرو(ص^أ)=-معلوماتص^أدكوالالمبور(ص^ص){\displaystyle \lim _{n\to \infty }{\frac {1}{n}}\ln \Pr({\hat {p}}\in A)=-\inf _{{\hat {p}}\in A}D_{\text{KL}}({\hat {p}}\|p)}

التركيز عند قيم n الكبيرة

بسبب التضاؤل ​​الأسي ، عند القيم الكبيرةن{\displaystyle n}تتركز معظم كتلة الاحتمالية في جوار صغير منص{\displaystyle p}في هذا الحيز الصغير، يمكننا أن نأخذ الحد الأول غير الصفري في متسلسلة تايلور لـدكل{\displaystyle D_{KL}}للحصول علىln(نx1،،xك)ص1x1صكxك-ن2أنا=1ك(ص^أنا-صأنا)2صأنا=-12أنا=1ك(xأنا-نصأنا)2نصأنا{\displaystyle {\begin{aligned}\ln {\binom {n}{x_{1},\cdots ,x_{k}}}p_{1}^{x_{1}}\cdots p_{k}^{x_{k}}&\approx -{\frac {n}{2}}\sum _{i=1}^{k}{\frac {({\hat {p}}_{i}-p_{i})^{2}}{p_{i}}}\\&=-{\frac {1}{2}}\sum _{i=1}^{k}{\frac {(x_{i}-np_{i})^{2}}{np_{i}}}\end{aligned}}} يشبه هذا التوزيع التوزيع الغاوسي، مما يشير إلى النظرية التالية:

نظرية. فين{\displaystyle n\to \infty }حد،نأنا=1ك(ص^أنا-صأنا)2صأنا=أنا=1ك(xأنا-نصأنا)2نصأنا{\displaystyle n\sum _{i=1}^{k}{\frac {({\hat {p}}_{i}-p_{i})^{2}}{p_{i}}}=\sum _{i=1}^{k}{\frac {(x_{i}-np_{i})^{2}}{np_{i}}}}يتقارب التوزيع مع توزيع كاي تربيعχ2(ك-1){\displaystyle \chi ^{2}(k-1)}.

إذا أخذنا عينة من التوزيع متعدد الحدودمuلتأنانoمأناأل(ن؛0.2،0.3،0.5){\displaystyle \mathrm {Multinomial} (n;0.2,0.3,0.5)}وعند رسم خريطة حرارية للعينات داخل المجسم ثنائي الأبعاد (الموضح هنا كمثلث أسود)، نلاحظ أنه عندمان{\displaystyle n\to \infty }، يتقارب التوزيع إلى توزيع غاوسي حول النقطة(0.2،0.3،0.5){\displaystyle (0.2,0.3,0.5)}، حيث تتقارب الخطوط الخارجية في الشكل لتشكل أشكالًا بيضاوية، وتتقارب أنصاف الأقطار كما1/ن{\displaystyle 1/{\sqrt {n}}}في الوقت نفسه، يتقارب التباعد بين النقاط المنفصلة عندما1/ن{\displaystyle 1/n}وبالتالي فإن التوزيع متعدد الحدود المنفصل يتقارب إلى توزيع غاوسي مستمر.
[دليل]

فضاء جميع التوزيعات على الفئات{1،2،...،ك}{\displaystyle \{1,2,\ldots ,k\}}هو مُعقّد :Δك={(y1،...،yك):y1،...،yك0،أناyأنا=1}{\displaystyle \Delta _{k}=\left\{(y_{1},\ldots ,y_{k})\colon y_{1},\ldots ,y_{k}\geq 0,\sum _{i}y_{i}=1\right\}}ومجموعة جميع التوزيعات التجريبية الممكنة بعدن{\displaystyle n}التجارب هي مجموعة فرعية من المعقد البسيط:Δك،ن={(x1/ن،...،xك/ن):x1،...،xكشمال،أناxأنا=ن}{\displaystyle \Delta _{k,n}=\left\{(x_{1}/n,\ldots ,x_{k}/n)\colon x_{1},\ldots ,x_{k}\in \mathbb {N} ,\sum _{i}x_{i}=n\right\}}أي أنها نقطة التقاطع بينΔك{\displaystyle \Delta _{k}}والشبكة(Zك)/ن{\displaystyle (\mathbb {Z} ^{k})/n}.

مثلن{\displaystyle n}مع ازديادها، تتركز معظم كتلة الاحتمالية في مجموعة فرعية منΔك،ن{\displaystyle \Delta _{k,n}}قريبص{\displaystyle p}، وتوزيع الاحتمالية بالقرب منص{\displaystyle p}يمكن تقريبها بشكل جيد بواسطة(نx1،،xك)ص1x1صكxكهـ-ن2أنا(ص^أنا-صأنا)2صأنا{\displaystyle {\binom {n}{x_{1},\cdots ,x_{k}}}p_{1}^{x_{1}}\cdots p_{k}^{x_{k}}\approx e^{-{\frac {n}{2}}\sum _{i}{\frac {\left({\hat {p}}_{i}-p_{i}\right)^{2}}{p_{i}}}}}ومن هذا، نرى أن المجموعة الجزئية التي تتركز عليها الكتلة لها نصف قطر من رتبة1/ن{\displaystyle 1/{\sqrt {n}}}لكن النقاط في المجموعة الفرعية مفصولة بمسافة من رتبة1/ن{\displaystyle 1/n}لذا على نطاق واسعن{\displaystyle n}تندمج النقاط لتشكل سلسلة متصلة. لتحويل هذا من توزيع احتمالي منفصل إلى كثافة احتمالية متصلة، نحتاج إلى الضرب في الحجم الذي تشغله كل نقطة منΔك،ن{\displaystyle \Delta _{k,n}}فيΔك{\displaystyle \Delta _{k}}ومع ذلك، وبسبب التناظر، تشغل كل نقطة نفس الحجم تمامًا (باستثناء مجموعة مهملة على الحدود)، لذلك نحصل على كثافة احتماليةρ(ص^)=جهـ-ن2أنا(ص^أنا-صأنا)2صأنا{\displaystyle \rho ({\hat {p}})=Ce^{-{\frac {n}{2}}\sum _{i}{\frac {\left({\hat {p}}_{i}-p_{i}\right)^{2}}{p_{i}}}}}، أينج{\displaystyle C}ثابت.

وأخيرًا، بما أن المعقد البسيطΔك{\displaystyle \Delta _{k}}ليس كل شيءRك{\displaystyle \mathbb {R} ^{k}}ولكن فقط ضمن(ك-1){\displaystyle (k-1)}في المستوى ذي الأبعاد n، نحصل على النتيجة المرجوة.

التركيز المشروط عند قيم n الكبيرة

يمكن تعميم ظاهرة التركيز المذكورة أعلاه بسهولة لتشمل الحالة التي نشترط فيها قيودًا مستقلة. وهذا هو التبرير النظري لاختبار مربع كاي لبيرسون .

نظرية.

  • الدوال المعطاةو1،...،و{\displaystyle f_{1},\dots ,f_{\ell }}بحيث تكون قابلة للتفاضل باستمرار في جوار منص{\displaystyle p}والمتجهات(1،1،...،1)،و1(ص)،...،و(ص){\displaystyle (1,1,\dots ,1),\nabla f_{1}(p),\dots ,\nabla f_{\ell }(p)}مستقلة خطيًا؛
  • متتابعات معطاةϵ1(ن)،...،ϵ(ن){\displaystyle \epsilon _{1}(n),\dots ,\epsilon _{\ell }(n)}بحيث يكون ذلك تقاربياً1نϵأنا(ن)1ن{\displaystyle {\frac {1}{n}}\ll \epsilon _{i}(n)\ll {\frac {1}{\sqrt {n}}}}لكلأنا{1،...،}{\displaystyle i\in \{1,\dots ,\ell \}}؛
  • ثم بالنسبة للتوزيع متعدد الحدود المشروط بالقيودو1(ص^)[و1(ص)-ϵ1(ن)،و1(ص)+ϵ1(ن)]،...،و(ص^)[و(ص)-ϵ(ن)،و(ص)+ϵ(ن)]{\displaystyle f_{1}({\hat {p}})\in [f_{1}(p)-\epsilon _{1}(n),f_{1}(p)+\epsilon _{1}(n)],\dots ,f_{\ell }({\hat {p}})\in [f_{\ell }(p)-\epsilon _{\ell }(n),f_{\ell }(p)+\epsilon _{\ell }(n)]}لدينا الكميةنأنا(ص^أنا-صأنا)2صأنا=أنا(xأنا-نصأنا)2نصأنا{\displaystyle n\sum _{i}{\frac {({\hat {p}}_{i}-p_{i})^{2}}{p_{i}}}=\sum _{i}{\frac {(x_{i}-np_{i})^{2}}{np_{i}}}}يتقارب التوزيع إلىχ2(ك-1-){\displaystyle \chi ^{2}(k-1-\ell )}فين{\displaystyle n\to \infty }حد.

في حالة أن كلص^أنا{\displaystyle {\hat {p}}_{i}}إذا كانت متساوية، فإن هذا يختزل إلى تركيز الإنتروبيا حول الإنتروبيا القصوى . [ 2 ] [ 3 ]

يمكن إثبات هذه النظرية بالبدء بالحالة السابقة، ثم أخذ الشرط على القيود.

في بعض المجالات، مثل معالجة اللغات الطبيعية ، تُستخدم التوزيعات الفئوية والمتعددة الحدود بشكل مترادف، ومن الشائع استخدام مصطلح التوزيع متعدد الحدود عندما يُقصد التوزيع الفئوي . ويعود ذلك إلى أنه من الملائم أحيانًا التعبير عن نتيجة التوزيع الفئوي كمتجه "واحد من k" (متجه يحتوي على عنصر واحد بقيمة 1 وجميع العناصر الأخرى بقيمة 0) بدلاً من التعبير عنها كعدد صحيح في النطاق1...ك{\displaystyle 1\dots k}في هذا الشكل، يكون التوزيع الفئوي مكافئًا للتوزيع متعدد الحدود على تجربة واحدة.

الاستدلال الإحصائي

اختبارات التكافؤ للتوزيعات متعددة الحدود

يهدف اختبار التكافؤ إلى إثبات مدى التوافق بين التوزيع متعدد الحدود النظري وتكرارات العد المرصودة. قد يكون التوزيع النظري توزيعًا متعدد الحدود محددًا بالكامل أو عائلة بارامترية من التوزيعات متعددة الحدود.

يتركq{\displaystyle q}لنرمز إلى توزيع متعدد الحدود نظري ولندعص{\displaystyle p}أن يكون توزيعًا أساسيًا حقيقيًا. التوزيعاتص{\displaystyle p}وq{\displaystyle q}تُعتبر متكافئة إذاد(ص،q)<ε{\displaystyle d(p,q)<\varepsilon }على مسافةد{\displaystyle d}ومعامل التسامحε>0{\displaystyle \varepsilon >0}مشكلة اختبار التكافؤ هيح0={د(ص،q)ε}{\displaystyle H_{0}=\{d(p,q)\geq \varepsilon \}}عكسح1={د(ص،q)<ε}{\displaystyle H_{1}=\{d(p,q)<\varepsilon \}}التوزيع الأساسي الحقيقيص{\displaystyle p}غير معروف. بدلاً من ذلك، ترددات العدصن{\displaystyle p_{n}}يتم رصدها، حيثن{\displaystyle n}حجم العينة. يستخدم اختبار التكافؤصن{\displaystyle p_{n}}رفضح0{\displaystyle H_{0}}. لوح0{\displaystyle H_{0}}يمكن رفض ذلك، وبالتالي فإن التكافؤ بينص{\displaystyle p}وq{\displaystyle q}يُعرض عند مستوى دلالة مُحدد. يمكن الاطلاع على اختبار التكافؤ للمسافة الإقليدية في كتاب ويلك (2010). [ 4 ] طُوّر اختبار التكافؤ لمسافة التباين الكلي في أوستروفسكي (2017). [ 5 ] اقتُرح اختبار التكافؤ الدقيق للمسافة التراكمية المحددة في فراي (2009). [ 6 ]

المسافة بين التوزيع الأساسي الحقيقيص{\displaystyle p}وعائلة من التوزيعات متعددة الحدودم{\displaystyle {\mathcal {M}}}يتم تعريفها بواسطةد(ص،م)=مينحمد(ص،ح){\displaystyle d(p,{\mathcal {M}})=\min _{h\in {\mathcal {M}}}d(p,h)}ثم تُعطى مسألة اختبار التكافؤ على النحو التاليح0={د(ص،م)ε}{\displaystyle H_{0}=\{d(p,{\mathcal {M}})\geq \varepsilon \}}وح1={د(ص،م)<ε}{\displaystyle H_{1}=\{d(p,{\mathcal {M}})<\varepsilon \}}المسافةد(ص،م){\displaystyle d(p,{\mathcal {M}})}يتم حسابها عادةً باستخدام التحسين العددي. وقد طُوّرت الاختبارات الخاصة بهذه الحالة مؤخرًا في أوستروفسكي (2018). [ 7 ]

فترات الثقة لفرق نسبتين

في سياق التوزيع متعدد الحدود، يتم إنشاء فترات ثقة للفرق بين نسب المشاهدات من حدثين،صأنا-صج{\displaystyle p_{i}-p_{j}}يتطلب ذلك تضمين التباين المشترك السلبي بين مقدرات العينةص^أنا=Xأنان{\displaystyle {\hat {p}}_{i}={\frac {X_{i}}{n}}}وص^ج=Xجن{\displaystyle {\hat {p}}_{j}={\frac {X_{j}}{n}}}.

ركزت بعض الدراسات المنشورة حول هذا الموضوع على حالة استخدام البيانات الثنائية للأزواج المتطابقة، الأمر الذي يتطلب عناية فائقة عند ترجمة الصيغ إلى الحالة العامة لـصأنا-صج{\displaystyle p_{i}-p_{j}}لأي توزيع متعدد الحدود. سيتم تعميم الصيغ في هذا القسم، بينما ستركز الصيغ في القسم التالي على حالة استخدام البيانات الثنائية للأزواج المتطابقة.

يمكن تقدير الخطأ المعياري لوالد (SE) لفرق النسبة باستخدام: [ 8 ] : 378 [ 9 ]

جنوب شرق^(ص^أنا-ص^ج)=(ص^أنا+ص^ج)-(ص^أنا-ص^ج)2ن{\displaystyle {\widehat {\operatorname {SE} }}({\hat {p}}_{i}-{\hat {p}}_{j})={\sqrt {\frac {\left({\hat {p}}_{i}+{\hat {p}}_{j}\right)-\left({\hat {p}}_{i}-{\hat {p}}_{j}\right)^{2}}{n}}}}

لـ100(1-α)%{\displaystyle 100(1-\alpha )\%}فترة الثقة التقريبية ، قد يتضمن هامش الخطأ الكمية المناسبة من التوزيع الطبيعي القياسي ، كما يلي:

(ص^أنا-ص^ج)±zα/2جنوب شرق^(ص^أنا-ص^ج){\displaystyle ({\hat {p}}_{i}-{\hat {p}}_{j})\pm z_{\alpha /2}\cdot {\widehat {\operatorname {SE} }}({\hat {p}}_{i}-{\hat {p}}_{j})}

[دليل]

حجم العينة (ن{\displaystyle n}مع ازدياد ، ستتبع نسب العينة تقريبًا توزيعًا طبيعيًا متعدد المتغيرات ، وذلك بفضل نظرية النهاية المركزية متعددة الأبعاد (ويمكن إثبات ذلك أيضًا باستخدام نظرية كرامر-وولد ). وبالتالي، سيكون الفرق بينهما طبيعيًا تقريبًا أيضًا. كما أن هذه المقدرات متسقة بشكل ضعيف ، وإدخالها في مقدر الخطأ المعياري يجعله متسقًا بشكل ضعيف أيضًا. ومن ثم، بفضل نظرية سلوتسكي ، فإن الكمية المحورية(ص^أنا-ص^ج)-(صأنا-صج)جنوب شرق(ص^أنا-ص^ج)^{\displaystyle {\frac {({\hat {p}}_{i}-{\hat {p}}_{j})-(p_{i}-p_{j})}{\widehat {\operatorname {SE} ({\hat {p}}_{i}-{\hat {p}}_{j})}}}} يتبع التوزيع تقريبًا التوزيع الطبيعي القياسي . ومن ذلك، يتم اشتقاق فترة الثقة التقريبية المذكورة أعلاه مباشرة.

يمكن إنشاء الخطأ المعياري باستخدام حساب تباين الفرق بين متغيرين عشوائيين : جنوب شرق^(ص^أنا-ص^ج)=ص^أنا(1-ص^أنا)ن+ص^ج(1-ص^ج)ن-2(-ص^أناص^جن)=1ن(ص^أنا+ص^ج-ص^أنا2-ص^ج2+2ص^أناص^ج)=(ص^أنا+ص^ج)-(ص^أنا-ص^ج)2ن{\displaystyle {\begin{aligned}{\widehat {\operatorname {SE} }}({\hat {p}}_{i}-{\hat {p}}_{j})&={\sqrt {{\frac {{\hat {p}}_{i}(1-{\hat {p}}_{i})}{n}}+{\frac {{\hat {p}}_{j}(1-{\hat {p}}_{j})}{n}}-2\left(-{\frac {{\hat {p}}_{i}{\hat {p}}_{j}}{n}}\right)}}\\&={\sqrt {{\frac {1}{n}}\left({\hat {p}}_{i}+{\hat {p}}_{j}-{\hat {p}}_{i}^{2}-{\hat {p}}_{j}^{2}+2{\hat {p}}_{i}{\hat {p}}_{j}\right)}}\\&={\sqrt {\frac {({\hat {p}}_{i}+{\hat {p}}_{j})-({\hat {p}}_{i}-{\hat {p}}_{j})^{2}}{n}}}\end{aligned}}}

يُضيف التعديل الذي يتضمن تصحيح الاستمرارية1ن{\displaystyle {\frac {1}{n}}}بهامش الخطأ كما يلي: [ 10 ] : 102-103

(ص^أنا-ص^ج)±(zα/2جنوب شرق^(ص^أنا-ص^ج)+1ن){\displaystyle ({\hat {p}}_{i}-{\hat {p}}_{j})\pm \left(z_{\alpha /2}\cdot {\widehat {\operatorname {SE} }}({\hat {p}}_{i}-{\hat {p}}_{j})+{\frac {1}{n}}\right)}

ثمة بديل آخر يتمثل في الاعتماد على مُقدِّر بايزي باستخدام توزيع جيفريز المسبق ، مما يؤدي إلى استخدام توزيع ديريشليه ، حيث تكون جميع المعلمات مساوية لـ 0.5، كتوزيع مسبق. سيكون التوزيع اللاحق هو الحسابات المذكورة أعلاه، ولكن بعد إضافة 1/2 إلى كل عنصر من العناصر k ، مما يؤدي إلى زيادة إجمالية في حجم العينة بمقدارك2{\displaystyle {\frac {k}{2}}}تم تطوير هذه الطريقة في الأصل لتوزيع متعدد الحدود بأربعة أحداث، وتُعرف باسم wald+2 ، لتحليل بيانات الأزواج المتطابقة (انظر القسم التالي لمزيد من التفاصيل). [ 11 ]

وهذا يؤدي إلى النتيجة التالية:

جنوب شرق^(ص^أنا-ص^ج)wألد+ك2=(ص^أنا+ص^ج+1ن)نن+ك2-(ص^أنا-ص^ج)2(نن+ك2)2ن+ك2{\displaystyle {\widehat {\operatorname {SE} }}{({\hat {p}}_{i}-{\hat {p}}_{j})}_{wald+{\frac {k}{2}}}={\sqrt {\frac {\left({\hat {p}}_{i}+{\hat {p}}_{j}+{\frac {1}{n}}\right){\frac {n}{n+{\frac {k}{2}}}}-\left({\hat {p}}_{i}-{\hat {p}}_{j}\right)^{2}\left({\frac {n}{n+{\frac {k}{2}}}}\right)^{2}}{n+{\frac {k}{2}}}}}}

[دليل]

جنوب شرق^(ص^أنا-ص^ج)wألد+ك2=(xأنا+1/2ن+ك2+xج+1/2ن+ك2)-(xأنا+1/2ن+ك2-xج+1/2ن+ك2)2ن+ك2=(xأنان+xجن+1ن)نن+ك2-(xأنان-xجن)2(نن+ك2)2ن+ك2=(ص^أنا+ص^ج+1ن)نن+ك2-(ص^أنا-ص^ج)2(نن+ك2)2ن+ك2{\displaystyle {\begin{aligned}{\widehat {\operatorname {SE} }}{({\hat {p}}_{i}-{\hat {p}}_{j})}_{wald+{\frac {k}{2}}}&={\sqrt {\frac {\left({\frac {x_{i}+1/2}{n+{\frac {k}{2}}}}+{\frac {x_{j}+1/2}{n+{\frac {k}{2}}}}\right)-\left({\frac {x_{i}+1/2}{n+{\frac {k}{2}}}}-{\frac {x_{j}+1/2}{n+{\frac {k}{2}}}}\right)^{2}}{n+{\frac {k}{2}}}}}\\&={\sqrt {\frac {\left({\frac {x_{i}}{n}}+{\frac {x_{j}}{n}}+{\frac {1}{n}}\right){\frac {n}{n+{\frac {k}{2}}}}-\left({\frac {x_{i}}{n}}-{\frac {x_{j}}{n}}\right)^{2}\left({\frac {n}{n+{\frac {k}{2}}}}\right)^{2}}{n+{\frac {k}{2}}}}}\\&={\sqrt {\frac {\left({\hat {p}}_{i}+{\hat {p}}_{j}+{\frac {1}{n}}\right){\frac {n}{n+{\frac {k}{2}}}}-\left({\hat {p}}_{i}-{\hat {p}}_{j}\right)^{2}\left({\frac {n}{n+{\frac {k}{2}}}}\right)^{2}}{n+{\frac {k}{2}}}}}\end{aligned}}}

والتي يمكن إدخالها ببساطة في صيغة والد الأصلية على النحو التالي:

(صأنا-صج)نن+ك2±zα/2جنوب شرق^(ص^أنا-ص^ج)wألد+ك2{\displaystyle \left(p_{i}-p_{j}\right){\frac {n}{n+{\frac {k}{2}}}}\pm z_{\alpha /2}\cdot {\widehat {\operatorname {SE} }}{({\hat {p}}_{i}-{\hat {p}}_{j})}_{wald+{\frac {k}{2}}}}

التواجد والتطبيقات

فترات الثقة للفرق في البيانات الثنائية للأزواج المتطابقة (باستخدام التوزيع متعدد الحدود مع k=4 )

في حالة البيانات الثنائية ذات الأزواج المتطابقة، تتمثل إحدى المهام الشائعة في بناء فاصل الثقة لفرق نسبة الأحداث المتطابقة. على سبيل المثال، قد يكون لدينا اختبار لمرض ما، وقد نرغب في التحقق من نتائجه لمجموعة سكانية معينة في وقتين (1 و2)، للتحقق مما إذا كان هناك تغيير في نسبة الحالات الإيجابية للمرض خلال تلك الفترة.

يمكن تمثيل هذه السيناريوهات باستخدام جدول توافق ثنائي الأبعاد (2×2) يوضح عدد العناصر التي شهدت كل مجموعة من الأحداث. ويمكننا استخدام قيم صغيرة لـ f لتمثيل ترددات أخذ العينات.و11،و10،و01،و٠٠{\displaystyle f_{11},f_{10},f_{01},f_{00}}، وحرف F كبير للدلالة على ترددات السكان:F11،F10،F01،F٠٠{\displaystyle F_{11},F_{10},F_{01},F_{00}}يمكن نمذجة هذه التوليفات الأربع على أنها ناتجة عن توزيع متعدد الحدود (بأربع نتائج محتملة). يمكن أن يكون حجم العينة n وحجم المجتمع N. وفي هذه الحالة، ثمة اهتمام ببناء فاصل ثقة لفرق النسب عن القيم الهامشية لجدول التوافق التالي (المأخوذ من العينة):

الاختبار الثاني إيجابيالاختبار الثاني سلبيإجمالي الصف
الاختبار 1 إيجابيو11{\displaystyle f_{11}}و10{\displaystyle f_{10}}و1*=و11+و10{\displaystyle f_{1*}=f_{11}+f_{10}}
الاختبار 1 سلبيو01{\displaystyle f_{01}}و٠٠{\displaystyle f_{00}}و0*=و01+و٠٠{\displaystyle f_{0*}=f_{01}+f_{00}}
إجمالي العمودو*1=و11+و01{\displaystyle f_{*1}=f_{11}+f_{01}}و*0=و10+و٠٠{\displaystyle f_{*0}=f_{10}+f_{00}}ن{\displaystyle n}

في هذه الحالة، يعني التحقق من الفرق في النسب الحدية أننا مهتمون باستخدام التعريفات التالية:ص1*=F1*شمال=F11+F10شمال{\displaystyle p_{1*}={\frac {F_{1*}}{N}}={\frac {F_{11}+F_{10}}{N}}}،ص*1=F*1شمال=F11+F01شمال{\displaystyle p_{*1}={\frac {F_{*1}}{N}}={\frac {F_{11}+F_{01}}{N}}}والفرق الذي نريد بناء فترات ثقة له هو:

ص*1-ص1*=F11+F01شمال-F11+F10شمال=F01شمال-F10شمال=ص01-ص10{\displaystyle p_{*1}-p_{1*}={\frac {F_{11}+F_{01}}{N}}-{\frac {F_{11}+F_{10}}{N}}={\frac {F_{01}}{N}}-{\frac {F_{10}}{N}}=p_{01}-p_{10}}

وبالتالي، فإن فترات الثقة للنسب الإيجابية الهامشية (ص*1-ص1*{\displaystyle p_{*1}-p_{1*}}) هو نفسه بناء فاصل ثقة لفرق النسب من القطر الثانوي لجدول التوافق ثنائي الأبعاد (ص01-ص10{\displaystyle p_{01}-p_{10}}).

يُعرف حساب قيمة الاحتمال (p-value) لمثل هذا الفرق باختبار ماكنيمار . ويمكن بناء فترة ثقة حوله باستخدام الطرق المذكورة أعلاه في قسم فترات الثقة لفرق نسبتين .

يمكن تطبيق فترات ثقة والد من القسم السابق على هذا السياق، وتظهر في المراجع باستخدام رموز بديلة. تحديدًا، يعتمد الخطأ المعياري المُقدَّم غالبًا على ترددات جدول التوافق بدلًا من نسب العينة. على سبيل المثال، يمكن كتابة فترات ثقة والد المذكورة أعلاه على النحو التالي: [ 10 ] : 102-103

جنوب شرق^(ص*1-ص1*)=جنوب شرق^(ص01-ص10)=ن(و10+و01)-(و10-و01)2نن{\displaystyle {\begin{aligned}{\widehat {\operatorname {SE} }}(p_{*1}-p_{1*})&={\widehat {\operatorname {SE} }}(p_{01}-p_{10})\\[1ex]&={\frac {\sqrt {n\left(f_{10}+f_{01}\right)-\left(f_{10}-f_{01}\right)^{2}}}{n{\sqrt {n}}}}\end{aligned}}}

وقد حددت أبحاث أخرى في الأدبيات العديد من أوجه القصور في كل من طريقتي والد ووالد مع تصحيح الاستمرارية، واقتُرحت طرق أخرى للتطبيق العملي. [ 10 ]

يتضمن أحد هذه التعديلات Wald+2 لأغريستي ومين (على غرار بعض أعمالهما الأخرى [ 12 ] ) حيث كان لكل تردد خلية تردد إضافي12{\displaystyle {\frac {1}{2}}}[ 11 ] يؤدي هذا إلى فترات ثقة Wald+2 . في التفسير البايزي، يشبه هذا بناء المقدرات بافتراض توزيع ديريشليه كتوزيع مسبق ، حيث تكون جميع المعلمات مساوية لـ 0.5 (وهو في الواقع التوزيع المسبق لجيفريز ). يمكن الآن اعتبار +2 في اسم Wald+2 أنه في سياق جدول توافق ثنائي الأبعاد، وهو توزيع متعدد الحدود بأربعة أحداث محتملة، وبما أننا نضيف نصف قيمة إلى كل منها، فإن هذا يُترجم إلى إضافة إجمالية قدرها قيمتان (بسبب التوزيع المسبق).

يؤدي هذا إلى تعديل الخطأ المعياري التالي في حالة بيانات الأزواج المتطابقة:

جنوب شرق^(ص*1-ص1*)=(ن+2)(و10+و01+1)-(و10-و01)2(ن+2)ن+2{\displaystyle {\widehat {\operatorname {SE} }}(p_{*1}-p_{1*})={\frac {\sqrt {\left(n+2\right)\left(f_{10}+f_{01}+1\right)-\left(f_{10}-f_{01}\right)^{2}}}{\left(n+2\right){\sqrt {n+2}}}}}

والتي يمكن إدخالها ببساطة في صيغة والد الأصلية على النحو التالي:

(ص*1-ص1*)نن+2±zα/2جنوب شرق^(ص^أنا-ص^ج)wألد+2{\displaystyle \left(p_{*1}-p_{1*}\right){\frac {n}{n+2}}\pm z_{\alpha /2}\cdot {\widehat {\operatorname {SE} }}({\hat {p}}_{i}-{\hat {p}}_{j})_{wald+2}}

وتشمل التعديلات الأخرى تعديلات Bonett و Price's Adjusted Wald و Newcombe's Score .

الأساليب الحسابية

توليد المتغيرات العشوائية

أولاً، أعد ترتيب المعلماتص1،...،صك{\displaystyle p_{1},\ldots ,p_{k}}بحيث يتم ترتيبها تنازليًا (هذا فقط لتسريع الحساب وليس ضروريًا تمامًا). الآن، لكل تجربة، اسحب متغيرًا مساعدًا X من توزيع منتظم (0،  1). النتيجة الناتجة هي المكون

ج=مين{ج{1،...،ك}:(أنا=1جصأنا)-X0}.{\displaystyle j=\min \left\{j'\in \{1,\dots ,k\}\colon \left(\sum _{i=1}^{j'}p_{i}\right)-X\geq 0\right\}.}

{ X j = 1, X k = 0 لـ k j } هي إحدى المشاهدات من التوزيع متعدد الحدود مع ص1،...،صك{\displaystyle p_{1},\ldots ,p_{k}}و n  =  1. مجموع التكرارات المستقلة لهذه التجربة هو ملاحظة من توزيع متعدد الحدود حيث n يساوي عدد هذه التكرارات.

أخذ العينات باستخدام عينات ذات توزيع ثنائي شرطي متكرر

بالنظر إلى المعاييرص1،ص2،...،صك{\displaystyle p_{1},p_{2},\ldots ,p_{k}}ومجموع العينةن{\displaystyle n}بحيثأنا=1كXأنا=ن{\textstyle \sum _{i=1}^{k}X_{i}=n}من الممكن أخذ عينات متسلسلة للعدد في حالة عشوائيةXأنا{\displaystyle X_{i}}، وذلك بتقسيم فضاء الحالة إلىأنا{\displaystyle i}وليس-أنا{\displaystyle i}، بشرط الاعتماد على أي عينات سابقة تم أخذها بالفعل، بشكل متكرر.

الخوارزمية: أخذ عينات ثنائية شرطية متسلسلة

S = n ρ = 1 for i in [ 1 , k-1 ] : if ρ ! = 0 : X [ i ] ~ Binom ( S, p [ i ]) else X [ i ] = 0 S = S - X [ i ] ρ = ρ - p [ i ] X [ k ] = S 

من الناحية الاستدلالية، يقلل كل تطبيق لعينة ذات الحدين من العدد المتاح للعينة، ويتم تحديث الاحتمالات الشرطية بالمثل لضمان الاتساق المنطقي. [ 13 ]

تطبيقات البرمجيات

  • تتيح حزمة MultinomialCI R حساب فترات الثقة المتزامنة لاحتمالات التوزيع متعدد الحدود بالنظر إلى مجموعة من الملاحظات. [ 14 ]

انظر أيضاً

مراجع

  1. "أخذ العينات باستخدام التوزيع الاحتمالي متعدد الحدود" . تم التحقق من صحتها . تم الاطلاع عليها بتاريخ 28-07-2022 .
  2. لوكاس، أوريستيس؛ تشونغ، هو ريون (أبريل 2022). "التوزيعات الفئوية للإنتروبيا القصوى في ظل القيود الهامشية". arXiv : 2204.03406 [ hep-th ].
  3. لوكاس، أوريستيس؛ تشونغ، هو ريون (يونيو 2022). "التوصيف القائم على الإنتروبيا لقيود النمذجة". arXiv : 2206.14105 [ stat.ME ].
  4. ويلك، ستيفان (2010). اختبار الفرضيات الإحصائية للتكافؤ وعدم الدونية . تشابمان آند هول/سي آر سي. رقم ISBN 978-1439808184.
  5. أوستروفسكي، فلاديمير (مايو 2017). "اختبار تكافؤ التوزيعات متعددة الحدود". رسائل الإحصاء والاحتمالات . 124 : 77-82 . doi : 10.1016/j.spl.2017.01.004 . S2CID 126293429 . الرابط الرسمي للموقع (يتطلب اشتراكاً) . رابط بديل مجاني للموقع .
  6. فراي، جيسي (مارس 2009). "اختبار متعدد الحدود دقيق للتكافؤ". المجلة الكندية للإحصاء . 37 : 47-59 . doi : 10.1002/cjs.10000 . S2CID 122486567 . الرابط الرسمي للموقع الإلكتروني (يتطلب اشتراكاً) .
  7. أوستروفسكي، فلاديمير (مارس 2018). "اختبار التكافؤ مع عائلات التوزيعات متعددة الحدود مع تطبيق على نموذج الاستقلال". رسائل الإحصاء والاحتمالات . 139 : 61-66 . doi : 10.1016/j.spl.2018.03.014 . S2CID 126261081 . الرابط الرسمي للموقع (يتطلب اشتراكاً) . رابط بديل مجاني للموقع .
  8. فليس، جوزيف ل.؛ ليفين، بروس؛ بايك، ميونغ هي تشو (2003). الأساليب الإحصائية للنسب والمعدلات (الطبعة الثالثة ). هوبوكين، نيوجيرسي: جون وايلي. ص 760. ISBN   9780471526292.
  9. نيوكومب، آر جي (1998). "تقدير الفترة للفرق بين النسب المستقلة: مقارنة بين إحدى عشرة طريقة". الإحصاء في الطب . 17 (8): 873-890 . doi : 10.1002/(SICI)1097-0258(19980430)17:8 < 873::AID-SIM779 > 3.0.CO ; 2-I . PMID 9595617 . 
  10. 1 2 3 "فترات الثقة للفرق بين نسبتين مترابطتين" (ملف PDF) . المركز الوطني لإحصاءات العلوم . تم الاطلاع عليه بتاريخ 22-03-2022 .
  11. 1 2 أغريستي، آلان؛ مين، يونغي (2005). "فترات ثقة محسّنة بسيطة لمقارنة النسب المتطابقة" (ملف PDF) . الإحصاء في الطب . 24 (5): 729-740 . doi : 10.1002/sim.1781 . PMID 15696504 . 
  12. أغريستي، أ.؛ كافو، ب. (2000). "فترات ثقة بسيطة وفعالة للنسب وفرق النسب ناتجة عن جمع نجاحين وفشلين". الإحصائي الأمريكي . 54 (4): 280-288 . doi : 10.1080/00031305.2000.10474560 .
  13. "11.5: التوزيع متعدد الحدود" . إحصاءات ليبر تيكستس . 2020-05-05 . تم الاطلاع عليه بتاريخ 2023-09-13 .
  14. "MultinomialCI - فترات الثقة للنسب متعددة الحدود" . CRAN. 11 مايو 2021. تم الاسترجاع في 23 مارس 2024 .

للمزيد من القراءة