توزيع هوتلينغ T -squared

في الإحصاء ، وخاصةً في اختبار الفرضيات ، يُعد توزيع هوتلينغ التربيعي ( )، الذي اقترحه هارولد هوتلينغ ، [ 1 ] توزيعًا احتماليًا متعدد المتغيرات يرتبط ارتباطًا وثيقًا بتوزيع F ، ويُعرف بكونه توزيعًا لمجموعة من إحصاءات العينة التي تُعد تعميمات طبيعية للإحصاءات التي يقوم عليها توزيع t للطالب . وتُعد إحصائية هوتلينغ التربيعية () تعميمًا لإحصائية t للطالب ، وتُستخدم في اختبار الفرضيات متعدد المتغيرات . [ 2 ]

تحفيز

يظهر هذا التوزيع في الإحصاءات متعددة المتغيرات عند إجراء اختبارات الفروق بين المتوسطات (متعددة المتغيرات) لمجموعات سكانية مختلفة، بينما تستخدم اختبارات المسائل أحادية المتغير اختبار t . سُمي هذا التوزيع نسبةً إلى هارولد هوتلينج ، الذي طوره كتعميم لتوزيع t للطالب . [ 1 ]

تعريف

إذا كان المتجه د{\displaystyle d} هي توزيع غاوسي متعدد المتغيرات بمتوسط ​​صفر ومصفوفة تباين مشتركة تساوي واحدًاشمال(0ص،أناص،ص){\displaystyle N(\mathbf {0} _{p},\mathbf {I} _{p,p})}وم{\displaystyle M}هوص×ص{\displaystyle p\times p}مصفوفة عشوائية ذات توزيع ويشارتدبليو(أناص،ص،م){\displaystyle W(\mathbf {I} _{p,p},m)}إذا كانت لدينا مصفوفة ذات مقياس وحدة و m درجة حرية ، وكان كل من d و M مستقلين عن بعضهما البعض، فإن الشكل التربيعيX{\displaystyle X}له توزيع هوتلينغ (مع معلماتص{\displaystyle p}وم{\displaystyle m}): [ 3 ]X=مدتيم-1دتي2(ص،م).{\displaystyle X=md^{T}M^{-1}d\sim T^{2}(p,m).}

يمكن إثبات أنه إذا كان للمتغير العشوائي X توزيع هوتلينغ T -squared،Xتيص،م2{\displaystyle X\sim T_{p,m}^{2}}ثم: [ 1 ]م-ص+1صمXFص،م-ص+1{\displaystyle {\frac {m-p+1}{pm}}X\sim F_{p,m-p+1}} أينFص،م-ص+1{\displaystyle F_{p,m-p+1}}هو توزيع F ذو المعاملات p و m p + 1.    

إحصائية هوتلينغ تي تربيع

يتركΣ^{\displaystyle {\hat {\mathbf {\Sigma } }}}ليكن التباين المشترك للعينة :

Σ^=1ن-1أنا=1ن(xأنا-x¯)(xأنا-x¯){\displaystyle {\hat {\mathbf {\Sigma } }}={\frac {1}{n-1}}\sum _{i=1}^{n}\left(\mathbf {x} _{i}-{\overline {\mathbf {x} }}\right)\left(\mathbf {x} _{i}-{\overline {\mathbf {x} }}\right)'}

حيث نرمز إلى عملية النقل بعلامة اقتباس مفردة . ويمكن إثبات ذلك.Σ^{\displaystyle {\hat {\mathbf {\Sigma } }}}هي مصفوفة موجبة (شبه) محددة و(ن-1)Σ^{\displaystyle (n-1){\hat {\mathbf {\Sigma } }}}يتبع توزيع ويشارت متعدد المتغيرات ذي p درجة حرية n − 1. [ 4 ] مصفوفة التباين المشترك للعينة للمتوسط ​​هي  Σ^x¯=Σ^/ن{\displaystyle {\hat {\mathbf {\Sigma } }}_{\overline {\mathbf {x} }}={\hat {\mathbf {\Sigma } }}/n}[ 5 ]

يتم تعريف إحصائية هوتلينغ t-squared على النحو التالي : [ 6 ]

ت2=(x¯-μ)Σ^x¯-1(x¯-μ)=ن(x¯-μ)Σ^-1(x¯-μ)،{\displaystyle t^{2}=({\overline {\mathbf {x} }}-{\boldsymbol {\mu }})'{\hat {\mathbf {\Sigma } }}_{\overline {\mathbf {x} }}^{-1}({\overline {\mathbf {x} }}-{\boldsymbol {\mathbf {\mu } }})=n({\overline {\mathbf {x} }}-{\boldsymbol {\mu }})'{\hat {\mathbf {\Sigma } }}^{-1}({\overline {\mathbf {x} }}-{\boldsymbol {\mathbf {\mu } }}),}

وهو ما يتناسب مع مسافة ماهالانوبيس بين متوسط ​​العينة وμ{\displaystyle {\boldsymbol {\mu }}}ولهذا السبب، ينبغي توقع أن تأخذ الإحصائية قيمًا منخفضة إذاx¯μ{\displaystyle {\overline {\mathbf {x} }}\approx {\boldsymbol {\mu }}}وقيم عالية إذا كانت مختلفة.

من التوزيع ،

ت2تيص،ن-12=ص(ن-1)ن-صFص،ن-ص،{\displaystyle t^{2}\sim T_{p,n-1}^{2}={\frac {p(n-1)}{np}}F_{p,np},}

أينFص،ن-ص{\displaystyle F_{p,np}}هو توزيع F ذو المعاملات p و n p . 

لحساب قيمة p (غير المرتبطة بمتغير p هنا)، لاحظ أن توزيعت2{\displaystyle t^{2}}وهذا يعني بالمثل أن

ن-صص(ن-1)ت2Fص،ن-ص.{\displaystyle {\frac {np}{p(n-1)}}t^{2}\sim F_{p,np}.}

ثم استخدم القيمة الموجودة على الجانب الأيسر لتقييم قيمة الاحتمال (p -value) المقابلة للعينة، والتي تُستمد من توزيع F. ويمكن أيضاً تحديد منطقة الثقة باستخدام منطق مماثل.

تحفيز

يتركشمالص(μ،Σ){\displaystyle {\mathcal {N}}_{p}({\boldsymbol {\mu }},{\mathbf {\Sigma } })}يرمز إلى توزيع طبيعي متعدد المتغيرات ذي موقعμ{\displaystyle {\boldsymbol {\mu }}}والتباين المعروفΣ{\displaystyle {\mathbf {\Sigma } }}. يترك

x1،...،xنشمالص(μ،Σ){\displaystyle {\mathbf {x} }_{1},\dots ,{\mathbf {x} }_{n}\sim {\mathcal {N}}_{p}({\boldsymbol {\mu }},{\mathbf {\Sigma } })}

لنفترض أن لدينا n متغيرات عشوائية مستقلة ومتطابقة التوزيع (iid) ، والتي يمكن تمثيلها على النحو التالي:ص×1{\displaystyle p\times 1}متجهات عمودية من الأعداد الحقيقية. عرّف

x¯=x1++xنن{\displaystyle {\overline {\mathbf {x} }}={\frac {\mathbf {x} _{1}+\cdots +\mathbf {x} _{n}}{n}}}

ليكون متوسط ​​العينة مع التباينΣx¯=Σ/ن{\displaystyle {\mathbf {\Sigma } }_{\overline {\mathbf {x} }}={\mathbf {\Sigma } }/n}يمكن إثبات ذلك

(x¯-μ)Σx¯-1(x¯-μ)χص2،{\displaystyle ({\overline {\mathbf {x} }}-{\boldsymbol {\mu }})'{\mathbf {\Sigma } }_{\overline {\mathbf {x} }}^{-1}({\overline {\mathbf {x} }}-{\boldsymbol {\mathbf {\mu } }})\sim \chi _{p}^{2},}

أينχص2{\displaystyle \chi _{p}^{2}}هو توزيع كاي تربيع بدرجات حرية p . [ 7 ]

أو بدلاً من ذلك، يمكن للمرء أن يجادل باستخدام دوال الكثافة والدوال المميزة، على النحو التالي.

إحصائية عينتين

لوx1،...،xنxشمالص(μ،Σ){\displaystyle {\mathbf {x} }_{1},\dots ,{\mathbf {x} }_{n_{x}}\sim N_{p}({\boldsymbol {\mu }},{\mathbf {\Sigma } })}وy1،...،yنyشمالص(μ،Σ){\displaystyle {\mathbf {y} }_{1},\dots ,{\mathbf {y} }_{n_{y}}\sim N_{p}({\boldsymbol {\mu }},{\mathbf {\Sigma } })}، مع سحب العينات بشكل مستقل من توزيعين طبيعيين متعدد المتغيرات مستقلين لهما نفس المتوسط ​​والتباين، ونُعرّف

x¯=1نxأنا=1نxxأناy¯=1نyأنا=1نyyأنا{\displaystyle {\overline {\mathbf {x} }}={\frac {1}{n_{x}}}\sum _{i=1}^{n_{x}}\mathbf {x} _{i}\qquad {\overline {\mathbf {y} }}={\frac {1}{n_{y}}}\sum _{i=1}^{n_{y}}\mathbf {y} _{i}}

كمتوسطات للعينات، و

Σ^x=1نx-1أنا=1نx(xأنا-x¯)(xأنا-x¯)Σ^y=1نy-1أنا=1نy(yأنا-y¯)(yأنا-y¯){\displaystyle {\begin{aligned}{\hat {\mathbf {\Sigma } }}_{\mathbf {x} }&={\frac {1}{n_{x}-1}}\sum _{i=1}^{n_{x}}\left(\mathbf {x} _{i}-{\overline {\mathbf {x} }}\right)\left(\mathbf {x} _{i}-{\overline {\mathbf {x} }}\right)'\\{\hat {\mathbf {\Sigma } }}_{\mathbf {y} }&={\frac {1}{n_{y}-1}}\sum _{i=1}^{n_{y}}\left(\mathbf {y} _{i}-{\overline {\mathbf {y} }}\right)\left(\mathbf {y} _{i}-{\overline {\mathbf {y} }}\right)'\end{aligned}}}

باعتبارها مصفوفات التغاير العيني الخاصة بكل منها. ثم

Σ^=(نx-1)Σ^x+(نy-1)Σ^yنx+نy-2{\displaystyle {\hat {\mathbf {\Sigma } }}={\frac {(n_{x}-1){\hat {\mathbf {\Sigma } }}_{\mathbf {x} }+(n_{y}-1){\hat {\mathbf {\Sigma } }}_{\mathbf {y} }}{n_{x}+n_{y}-2}}}

هو تقدير مصفوفة التغاير المجمعة غير المتحيزة (امتداد للتباين المجمع ).

وأخيرًا، إحصائية هوتلينغ لاختبار مربع تي لعينتين هي

ت2=نxنyنx+نy(x¯-y¯)Σ^-1(x¯-y¯)تي2(ص،نx+نy-2){\displaystyle t^{2}={\frac {n_{x}n_{y}}{n_{x}+n_{y}}}({\overline {\mathbf {x} }}-{\overline {\mathbf {y} }})'{\hat {\mathbf {\Sigma } }}^{-1}({\overline {\mathbf {x} }}-{\overline {\mathbf {y} }})\sim T^{2}(p,n_{x}+n_{y}-2)}

ويمكن ربطها بتوزيع F من خلال [ 4 ]

نx+نy-ص-1(نx+نy-2)صت2F(ص،نx+نy-1-ص).{\displaystyle {\frac {n_{x}+n_{y}-p-1}{(n_{x}+n_{y}-2)p}}t^{2}\sim F(p,n_{x}+n_{y}-1-p).}

التوزيع غير الصفري لهذه الإحصائية هو توزيع F غير المركزي (نسبة متغير عشوائي مربع كاي غير مركزي ومتغير عشوائي مربع كاي مركزي مستقل ).نx+نy-ص-1(نx+نy-2)صت2F(ص،نx+نy-1-ص؛دلتا)،{\displaystyle {\frac {n_{x}+n_{y}-p-1}{(n_{x}+n_{y}-2)p}}t^{2}\sim F(p,n_{x}+n_{y}-1-p;\delta ),} مع دلتا=نxنyنx+نyدΣ-1د،{\displaystyle \delta ={\frac {n_{x}n_{y}}{n_{x}+n_{y}}}{\boldsymbol {d}}'\mathbf {\Sigma } ^{-1}{\boldsymbol {d}},} أيند=x¯-y¯{\displaystyle {\boldsymbol {d}}=\mathbf {{\overline {x}}-{\overline {y}}} }يمثل متجه الفرق بين متوسطات السكان.

في حالة المتغيرين، تتبسط الصيغة بشكل جيد مما يسمح بفهم كيفية ارتباط المتغيرات.ρ{\displaystyle \rho }، بين المتغيرات تؤثرت2{\displaystyle t^{2}}إذا عرّفنا د1=x¯1-y¯1،د2=x¯2-y¯2{\displaystyle d_{1}={\overline {x}}_{1}-{\overline {y}}_{1},\qquad d_{2}={\overline {x}}_{2}-{\overline {y}}_{2}} و s1=Σ11s2=Σ22ρ=Σ12/(s1s2)=Σ21/(s1s2){\displaystyle s_{1}={\sqrt {\Sigma _{11}}}\qquad s_{2}={\sqrt {\Sigma _{22}}}\qquad \rho =\Sigma _{12}/(s_{1}s_{2})=\Sigma _{21}/(s_{1}s_{2})} ثم ت2=نxنy(نx+نy)(1-ρ2)[(د1s1)2+(د2s2)2-2ρ(د1s1)(د2s2)]{\displaystyle t^{2}={\frac {n_{x}n_{y}}{(n_{x}+n_{y})(1-\rho ^{2})}}\left[\left({\frac {d_{1}}{s_{1}}}\right)^{2}+\left({\frac {d_{2}}{s_{2}}}\right)^{2}-2\rho \left({\frac {d_{1}}{s_{1}}}\right)\left({\frac {d_{2}}{s_{2}}}\right)\right]} وبالتالي، إذا كانت الاختلافات في صفي المتجهد=x¯-y¯{\displaystyle \mathbf {d} ={\overline {\mathbf {x} }}-{\overline {\mathbf {y} }}}بشكل عام، يكونون من نفس الإشارة.ت2{\displaystyle t^{2}}يصبح أصغر كلماρ{\displaystyle \rho }يصبح أكثر إيجابية. إذا كانت الفروق ذات إشارات متعاكسةت2{\displaystyle t^{2}}يصبح أكبر معρ{\displaystyle \rho }يصبح أكثر إيجابية.

يمكن إيجاد حالة خاصة أحادية المتغير في اختبار ويلش t .

لقد تم اقتراح اختبارات أكثر قوة وفعالية من اختبار هوتلينغ لعينتين في الأدبيات، انظر على سبيل المثال الاختبارات القائمة على المسافة بين النقاط والتي يمكن تطبيقها حتى عندما يكون عدد المتغيرات مماثلاً لعدد الأفراد أو حتى أكبر منه. [ 9 ] [ 10 ]

انظر أيضاً

مراجع

  1. 1 2 3 هوتلينج، هـ. (1931). "تعميم نسبة الطالب" . حوليات الإحصاء الرياضي . 2 (3): 360-378 . doi : 10.1214/aoms/1177732979 .
  2. جونسون، آر إيه؛ ويشرن، دي دبليو (2002). التحليل الإحصائي متعدد المتغيرات التطبيقي . المجلد 5. برنتيس هول. 
  3. إريك دبليو. وايسشتاين، ماث وورلد
  4. 1 2 مارديا، ك. ف.؛ كينت، ج. ت.؛ بيبي، ج. م. (1979). التحليل متعدد المتغيرات . دار النشر الأكاديمية. ISBN 978-0-12-471250-8.
  5. ^ فوجلمارك، كارل. لومهولت، مايكل. إيرباك، أندرس. أمبيورنسون، توبياس (3 مايو 2018). "ملاءمة دالة مع البيانات المتوسطة للمجموعة المعتمدة على الوقت" . التقارير العلمية . 8 (1): 6984. أرخايف : 1805.03057 . بيب كود : 2018NatSR...8.6984F . دوى : 10.1038/s41598-018-24983-y . بمك 5934400 . بميد 29725108 .  
  6. ↑ "6.5.4.3. مربع هوتلينغ T " .
  7. نهاية الفصل 4.2 من كتاب جونسون، آر إيه وويشرن ، دي دبليو (2002)
  8. بيلينغسلي، ب. (1995). "26. الدوال المميزة". الاحتمالات والقياس ( الطبعة الثالثة). وايلي. ISBN  978-0-471-00710-4.
  9. ماروزي، م. (2016). "اختبارات متعددة المتغيرات قائمة على المسافات بين النقاط مع تطبيق على التصوير بالرنين المغناطيسي". الأساليب الإحصائية في البحوث الطبية . 25 (6): 2593-2610 . doi : 10.1177/0962280214529104 . PMID 24740998 . 
  10. ماروزي، م. (2015). "اختبارات المسافة المتعددة المتغيرات لدراسات الحالات والشواهد ذات الأبعاد العالية وحجم العينة المنخفض". الإحصاء في الطب . 34 (9): 1511-1526 . doi : 10.1002/sim.6418 . PMID 25630579 .