معامل ارتباط رتبة كيندال

في الإحصاء ، يُستخدم معامل ارتباط رتب كندال ، المعروف أيضًا بمعامل كندال τ (نسبةً إلى الحرف اليوناني τ ، تاو)، لقياس العلاقة الترتيبية بين كميتين مُقاسة. يُعد اختبار τ اختبارًا لا معلميًا للفرضيات الإحصائية، ويعتمد على معامل τ. وهو مقياس لارتباط الرتب : أي مدى تشابه ترتيب البيانات عند تصنيفها وفقًا لكل كمية. سُمي هذا المعامل نسبةً إلى موريس كندال ، الذي طوره عام 1938، [ 1 ] مع العلم أن غوستاف فيشنر كان قد اقترح مقياسًا مشابهًا في سياق السلاسل الزمنية عام 1897. [ 2 ]

بشكل بديهي، سيكون معامل ارتباط كيندال بين متغيرين مرتفعًا عندما يكون للملاحظات رتبة مماثلة أو متطابقة (أي تسمية الموقع النسبي للملاحظات داخل المتغير: الأول، الثاني، الثالث، إلخ) بين المتغيرين، ومنخفضًا عندما يكون للملاحظات رتبة مختلفة أو معكوسة تمامًا بين المتغيرين.

كلا من كيندالτ{\displaystyle \tau }وسبيرمانρ{\displaystyle \rho }يمكن صياغتها كحالات خاصة من معامل ارتباط أكثر عمومية . كما تظهر مفاهيمها المتعلقة بالتوافق وعدم التوافق في مجالات أخرى من الإحصاء، مثل مؤشر راند في تحليل التجميع .

تعريف

جميع النقاط في المنطقة الرمادية متوافقة، وجميع النقاط في المنطقة البيضاء غير متوافقة بالنسبة للنقطة(X1،Y1){\displaystyle (X_{1},Y_{1})}. معن=30{\displaystyle n=30}يبلغ إجمالي النقاط(302)=435{\displaystyle {\binom {30}{2}}=435}أزواج النقاط الممكنة. في هذا المثال، يوجد 395 زوجًا من النقاط المتوافقة و40 زوجًا من النقاط غير المتوافقة، مما يؤدي إلى معامل ارتباط رتبة كندال قدره 0.816.

يترك (x1،y1)،...،(xن،yن){\displaystyle (x_{1},y_{1}),...,(x_{n},y_{n})}لتكن مجموعة من المشاهدات للمتغيرات العشوائية المشتركة X و Y ، بحيث تكون جميع قيم (xأنا{\displaystyle x_{i}}) و (yأنا{\displaystyle y_{i}}) فريدة. (انظر قسم "معالجة القيم المتساوية" لمعرفة طرق التعامل مع القيم غير الفريدة). أي زوج من الملاحظات(xأنا،yأنا){\displaystyle (x_{i},y_{i})}و(xج،yج){\displaystyle (x_{j},y_{j})}، أينأنا<ج{\displaystyle i<j}يُقال إنها متوافقة إذا كان ترتيب الفرز لـ(xأنا،xج){\displaystyle (x_{i},x_{j})}و(yأنا،yج){\displaystyle (y_{i},y_{j})}يتفقان: أي إذا كان أحدهما أو كلاهماxأنا>xج{\displaystyle x_{i}>x_{j}}وyأنا>yج{\displaystyle y_{i}>y_{j}}يمسك أو كليهماxأنا<xج{\displaystyle x_{i}<x_{j}}وyأنا<yج{\displaystyle y_{i}<y_{j}}وإلا يقال إنها متنافرة .

في حالة عدم وجود روابط، يتم تعريف معامل كندال τ على النحو التالي:

τ=(عدد الأزواج المتوافقة)-(عدد الأزواج غير المتوافقة)(عدد الأزواج)=1-2(عدد الأزواج غير المتوافقة)(ن2).{\displaystyle \tau ={\frac {({\text{عدد الأزواج المتوافقة}})-({\text{عدد الأزواج غير المتوافقة}})}{({\text{عدد الأزواج}})}}=1-{\frac {2({\text{عدد الأزواج غير المتوافقة}})}{n \choose 2}}.}[ 3 ]

لأنا<ج<ن{\displaystyle i<j<n}أين(ن2)=ن(ن-1)2{\displaystyle {n \choose 2}={n(n-1) \over 2}}يمثل معامل ذي الحدين عدد طرق اختيار عنصرين من بين n عنصرًا.

عدد الأزواج غير المتوافقة يساوي عدد الانعكاس الذي يبدل تسلسل y إلى نفس ترتيب تسلسل x.

ملكيات

المقام هو العدد الإجمالي لمجموعات الأزواج، لذلك يجب أن يكون المعامل في النطاق −1  τ ≤ 1.   

  • إذا كان الاتفاق بين التصنيفين تامًا (أي أن التصنيفين متطابقان) فإن قيمة المعامل تساوي 1.
  • إذا كان الاختلاف بين التصنيفين تامًا (أي أن أحد التصنيفين هو عكس الآخر) فإن قيمة المعامل هي -1.
  • إذا كان X و Y متغيرين عشوائيين مستقلين وليسا ثابتين، فإن القيمة المتوقعة للمعامل تساوي صفرًا.
  • الصيغة الصريحة لمعامل رتبة كيندال هيτ=2ن(ن-1)أنا<جعلامة(xأنا-xج)علامة(yأنا-yج)\displaystyle \tau =\frac {2}{n(n-1)}}\sum _{i<j}\operatorname {sgn}(x_{i}-x_{j})\operatorname {sgn}(y_{i}-y_{j})}.

اختبار الفرضية

يُستخدم معامل رتبة كندال غالبًا كإحصائية اختبار في اختبار الفرضيات الإحصائية لتحديد ما إذا كان يمكن اعتبار متغيرين مرتبطين إحصائيًا. هذا الاختبار غير معلمي ، لأنه لا يعتمد على أي افتراضات حول توزيعات X أو Y أو توزيع ( X ، Y ).

بافتراض فرضية العدم لاستقلال X و Y ، فإن التوزيع الاحتمالي لـ τ له قيمة متوقعة تساوي صفرًا. لا يمكن تحديد التوزيع بدقة باستخدام التوزيعات الشائعة، ولكن يمكن حسابه بدقة للعينات الصغيرة؛ أما بالنسبة للعينات الأكبر حجمًا، فمن الشائع استخدام تقريب للتوزيع الطبيعي ، بمتوسط ​​صفر وتباين σ².2(2ن+5)/9ن(ن-1){\textstyle 2(2n+5)/9n(n-1)}[ 4 ]

نظرية. إذا كانت العينات مستقلة، فإن تباينτأ{\textstyle \tau _{A}}يُعطى بواسطةVأر[τأ]=2(2ن+5)/9ن(ن-1){\textstyle Var[\tau _{A}]=2(2n+5)/9n(n-1)}.

دليل
برهان فالز وماكلويد (1990؛ [ 5 ] 1995 [ 6 ] )

بدون فقدان للذاكرة، نعيد ترتيب أزواج البيانات، بحيثx1<x2<<xن{\textstyle x_{1}<x_{2}<\cdots <x_{n}}وبافتراض الاستقلال، فإن ترتيبy1،...،yن{\textstyle y_{1},...,y_{n}}هي تبديل تم اختياره عشوائياً وبشكل منتظم منSن{\textstyle S_{n}}، مجموعة التبديل على1:ن{\textstyle 1:n}.

لكل تبديل، له شكله الفريدل{\textstyle l}رمز الانعكاس هول0ل1لن-1{\textstyle l_{0}l_{1}\cdots l_{n-1}}بحيث يكون كللأنا{\textstyle l_{i}}يقع ضمن النطاق0:أنا{\textstyle 0:i}إن أخذ عينة من التبديل بشكل منتظم يكافئ أخذ عينة منل{\textstyle l}- رمز الانعكاس بشكل موحد، وهو ما يعادل أخذ عينة من كللأنا{\textstyle l_{i}}بشكل موحد ومستقل.

ثم لديناهـ[τأ2]=هـ[(1-4أنالأنان(ن-1))2]=1-8ن(ن-1)أناهـ[لأنا]+16ن2(ن-1)2أناجهـ[لأنالج]=1-8ن(ن-1)أناهـ[لأنا]+16ن2(ن-1)2(أناجهـ[لأنا]هـ[لج]+أناV[لأنا])=1-8ن(ن-1)أناهـ[لأنا]+16ن2(ن-1)2أناجهـ[لأنا]هـ[لج]+16ن2(ن-1)2(أناV[لأنا])=(1-4أناهـ[لأنا]ن(ن-1))2+16ن2(ن-1)2(أناV[لأنا])\begin{aligned}E[\tau _{A}^{2}]&=E\left[\left(1-{\frac {4\sum _{i}l_{i}}{n(n-1)}}\right)^{2}\right]\\&=1-{\frac {8}{n(n-1)}}\sum _{i}E[l_{i}]+{\frac {16}{n^{2}(n-1)^{2}}}\sum _{ij}E[l_{i}l_{j}]\\&=1-{\frac {8}{n(n-1)}}\sum _{i}E[l_{i}]+{\frac {16}{n^{2}(n-1)^{2}}}\left(\sum _{ij}E[l_{i}]E[l_{j}]+\sum \begin{aligned} ...

الفصل الدراسي الأول هو فقطهـ[τأ]2=0{\textstyle E[\tau _{A}]^{2}=0}ويمكن حساب الحد الثاني بملاحظة أنلأنا{\textstyle l_{i}}متغير عشوائي منتظم على0:أنا{\textstyle 0:i}، لذاهـ[لأنا]=أنا2{\textstyle E[l_{i}]={\frac {i}{2}}}وهـ[لأنا2]=02++أنا2أنا+1=أنا(2أنا+1)6{\textstyle E[l_{i}^{2}]={\frac {0^{2}+\cdots +i^{2}}{i+1}}={\frac {i(2i+1)}{6}}}ثم باستخدام صيغة مجموع المربعات مرة أخرى.

التقارب الطبيعي عندن{\textstyle n\to \infty }حد،zأ=τأVأر[τأ]=نج-ندن(ن-1)(2ن+5)/18{\textstyle z_{A}={\frac {\tau _{A}}{\sqrt {Var[\tau _{A}]}}}={n_{C}-n_{D} \over {\sqrt {n(n-1)(2n+5)/18}}}}يتقارب في التوزيع مع التوزيع الطبيعي القياسي.

دليل

استخدم نتيجة من فئة الإحصاءات ذات التوزيع الطبيعي التقاربي لهوفدينغ (1948). [ 7 ]

حالة التوزيعات الطبيعية القياسية

لو(x1،y1)،(x2،y2)،...،(xن،yن){\textstyle (x_{1},y_{1}),(x_{2},y_{2}),...,(x_{n},y_{n})}هي عينات مستقلة ومتطابقة التوزيع من نفس التوزيع الطبيعي المشترك بمعامل ارتباط بيرسون معروفر{\textstyle r}إذاً، فإن القيمة المتوقعة لمعامل ارتباط رتبة كندال لها صيغة مغلقة. [ 8 ]

مساواة غرينر إذاX،Y{\textstyle X,Y}وهي طبيعية مشتركة، مع وجود ارتباطر{\textstyle r}، ثمر=الخطيئة(π2هـ[τأ]){\displaystyle r=\sin {\left({\frac {\pi }{2}}E[\tau _{A}]\right)}}

يُنسب الاسم إلى ريتشارد غرينر (1909) [ 9 ] بواسطة باب موران . [ 10 ]

دليل
البرهان [ 11 ]

عرّف الكميات التالية.

  • أ+:={(Δx،Δy):ΔxΔy>0}{\textstyle A^{+}:=\{(\Delta x,\Delta y):\Delta x\Delta y>0\}}
  • Δأنا،ج:=(xأنا-xج،yأنا-yج){\textstyle \Delta _{i,j}:=(x_{i}-x_{j},y_{i}-y_{j})}هي نقطة فيR2{\textstyle \mathbb {R} ^{2}}.

في الترميز، نرى أن عدد الأزواج المتوافقة،نج{\textstyle n_{C}}، يساوي عددΔأنا،ج{\textstyle \Delta _{i,j}}تلك التي تقع في المجموعة الفرعيةأ+{\textstyle A^{+}}. إنه،نج=1أنا<جن1Δأنا،جأ+{\textstyle n_{C}=\sum _{1\leq i<j\leq n}1_{\Delta _{i,j}\in A^{+}}}.

هكذا،هـ[τأ]=4ن(ن-1)هـ[نج]-1=4ن(ن-1)1أنا<جنPر(Δأنا،جأ+)-1{\displaystyle E[\tau _{A}]={\frac {4}{n(n-1)}}E[n_{C}]-1={\frac {4}{n(n-1)}}\sum _{1\leq i<j\leq n}Pr(\Delta _{i,j}\in A^{+})-1}

بما أن كل(xأنا،yأنا){\textstyle (x_{i},y_{i})}إذا كانت عينة مستقلة وموزعة توزيعًا متطابقًا من التوزيع الطبيعي المشترك، فإن الاقتران لا يهم، لذا فإن كل حد في المجموع يكون متطابقًا تمامًا، وبالتاليهـ[τأ]=2Pر(Δ1،2أ+)-1{\displaystyle E[\tau _{A}]=2Pr(\Delta _{1,2}\in A^{+})-1}ويبقى حساب الاحتمالية. نقوم بذلك عن طريق التحويلات الخطية المتكررة.

أولاً، قم بالتطبيعX،Y{\textstyle X,Y}عن طريق طرح المتوسط ​​وقسمة الانحراف المعياري. وهذا لا يغير شيئًا.τأ{\textstyle \tau _{A}}وهذا يعطينا[xy]=[1رر1]1/2[zw]{\displaystyle {\begin{bmatrix}x\\y\end{bmatrix}}={\begin{bmatrix}1&r\\r&1\end{bmatrix}}^{1/2}{\begin{bmatrix}z\\w\end{bmatrix}}}أين(Z،دبليو){\textstyle (Z,W)}يتم أخذ العينات من التوزيع الطبيعي القياسي علىR2{\textstyle \mathbb {R} ^{2}}.

هكذا،Δ1،2=2[1رر1]1/2[(z1-z2)/2(w1-w2)/2]{\displaystyle \Delta _{1,2}={\sqrt {2}}{\begin{bmatrix}1&r\\r&1\end{bmatrix}}^{1/2}{\begin{bmatrix}(z_{1}-z_{2})/{\sqrt {2}}\\(w_{1}-w_{2})/{\sqrt {2}}\end{bmatrix}}}حيث المتجه[(z1-z2)/2(w1-w2)/2]{\textstyle {\begin{bmatrix}(z_{1}-z_{2})/{\sqrt {2}}\\(w_{1}-w_{2})/{\sqrt {2}}\end{bmatrix}}}لا يزال التوزيع يتبع التوزيع الطبيعي القياسي علىR2{\textstyle \mathbb {R} ^{2}}. يبقى إجراء بعض عمليات الأسس المصفوفية المملة وغير المفيدة وعلم المثلثات، والتي يمكن تخطيها.

هكذا،Δ1،2أ+{\textstyle \Delta _{1,2}\in A^{+}}إذا[(z1-z2)/2(w1-w2)/2]12[1رر1]-1/2أ+=122[11+ر+11-ر11+ر-11-ر11+ر-11-ر11+ر+11-ر]أ+{\displaystyle {\begin{bmatrix}(z_{1}-z_{2})/{\sqrt {2}}\\(w_{1}-w_{2})/{\sqrt {2}}\end{bmatrix}}\in {\frac {1}{\sqrt {2}}}{\begin{bmatrix}1&r\\r&1\end{bmatrix}}^{-1/2}A^{+}={\frac {1}{2{\sqrt {2}}}}{\begin{bmatrix}{\frac {1}{\sqrt {1+r}}}+{\frac {1}{\sqrt {1-r}}}&{\frac {1}{\sqrt {1+r}}}-{\frac {1}{\sqrt {1-r}}}\\{\frac {1}{\sqrt {1+r}}}-{\frac {1}{\sqrt {1-r}}}&{\frac {1}{\sqrt {1+r}}}+{\frac {1}{\sqrt {1-r}}}\end{bmatrix}}A^{+}}حيث تمثل المجموعة الفرعية على اليمين نسخة "مضغوطة" من ربعين. وبما أن التوزيع الطبيعي القياسي متناظر دورانيًا، فإننا نحتاج فقط إلى حساب الزاوية التي يغطيها كل ربع مضغوط.

الربع الأول هو القطاع المحصور بين الشعاعين(1،0)،(0،1){\textstyle (1,0),(0,1)}يتحول إلى القطاع المحصور بين الشعاعين(11+ر+11-ر،11+ر-11-ر){\textstyle ({\frac {1}{\sqrt {1+r}}}+{\frac {1}{\sqrt {1-r}}},{\frac {1}{\sqrt {1+r}}}-{\frac {1}{\sqrt {1-r}}})}و(11+ر-11-ر،11+ر+11-ر){\textstyle ({\frac {1}{\sqrt {1+r}}}-{\frac {1}{\sqrt {1-r}}},{\frac {1}{\sqrt {1+r}}}+{\frac {1}{\sqrt {1-r}}})}يشكلان زاوية على التواليθ{\textstyle \theta }مع المحورين الأفقي والرأسي، حيثθ=دالة الظل العكسي11+ر-11-ر11+ر+11-ر{\displaystyle \theta =\arctan {\frac {{\frac {1}{\sqrt {1+r}}}-{\frac {1}{\sqrt {1-r}}}}{{\frac {1}{\sqrt {1+r}}}+{\frac {1}{\sqrt {1-r}}}}}}

يشكل الربعان المحولان معًا زاوية قدرهاπ+4θ{\textstyle \pi +4\theta }، لذاPر(Δ1،2أ+)=π+4θ2π{\displaystyle Pr(\Delta _{1,2}\in A^{+})={\frac {\pi +4\theta }{2\pi }}}وبالتالي الخطيئة(π2هـ[τأ])=الخطيئة(2θ)=ر{\displaystyle \sin {\left({\frac {\pi }{2}}E[\tau _{A}]\right)}=\sin(2\theta )=r}

مراعاة حالات التعادل

زوج{(xأنا،yأنا)،(xج،yج)}{\displaystyle \{(x_{i},y_{i}),(x_{j},y_{j})\}}يقال إن العلاقة متعادلة إذا وفقط إذاxأنا=xج{\displaystyle x_{i}=x_{j}}أوyأنا=yج{\displaystyle y_{i}=y_{j}}الزوج المتساوي ليس متوافقًا ولا غير متوافق. عند ظهور أزواج متساوية في البيانات، يمكن تعديل المعامل بعدة طرق لإبقائه ضمن النطاق [-1،  1]:

تاو-أ

تم تغيير اسم إحصائية تاو، التي وضعها كيندال عام 1938 [ 1 ] ، لاحقًا إلى تاو-أ. وهي تمثل قوة الارتباط الإيجابي أو السلبي بين متغيرين كميين أو ترتيبيين دون أي تعديل للقيم المتساوية. وتُعرَّف على النحو التالي:

τأ=نج-ندن0{\displaystyle \tau _{A}={\frac {n_{c}-n_{d}}{n_{0}}}}

حيث يتم تعريف n c و n d و n 0 كما هو موضح في القسم التالي.

عند وجود تعادلات،نج+ند<ن0{\displaystyle n_{c}+n_{d}<n_{0}}ولا يمكن أن يساوي المعامل +1 أو -1. حتى التساوي التام بين المتغيرين (X=Y) يؤدي إلى Tau-a < 1.

تاو-ب

يُجري إحصاء تاو-ب، على عكس تاو-أ، تعديلاتٍ لمعالجة حالات التعادل. وقد وصف كيندال هذا الإحصاء لأول مرة عام ١٩٤٥ تحت اسم تاو-و [ ١٢ ] كامتداد لإحصاء تاو الأصلي الذي يدعم حالات التعادل. تتراوح قيم تاو-ب من -١ (ارتباط سلبي بنسبة ١٠٠٪، أو عدم توافق تام) إلى +١ (ارتباط إيجابي بنسبة ١٠٠٪، أو توافق تام). وفي حالة انعدام الارتباط، يكون تاو-ب مساويًا للصفر.

يُعرَّف معامل كيندال تاو-ب على النحو التالي  :

τب=نج-ند(ن0-ن1)(ن0-ن2){\displaystyle \tau _{B}={\frac {n_{c}-n_{d}}{\sqrt {(n_{0}-n_{1})(n_{0}-n_{2})}}}}

أين

ن0=ن(ن-1)/2ن1=أناتأنا(تأنا-1)/2ن2=جuج(uج-1)/2نج=عدد الأزواج المتوافقة، أي الأزواج التي تحتوي على 0<أنا<ج<ن أين xأنا<xج و yأنا<yج أو xأنا>xج و yأنا>yجند=عدد الأزواج غير المتوافقة، أي الأزواج التي 0<أنا<ج<ن أين xأنا<xج و yأنا>yج أو xأنا>xج و yأنا<yجتأنا=عدد القيم المتساوية في أناذ مجموعة من الروابط للتوزيع التجريبي لـ Xuج=عدد القيم المتساوية في جذ مجموعة من الروابط للتوزيع التجريبي لـ Y{\displaystyle {\begin{aligned}n_{0}&=n(n-1)/2\\n_{1}&=\sum _{i}t_{i}(t_{i}-1)/2\\n_{2}&=\sum _{j}u_{j}(u_{j}-1)/2\\n_{c}&={\text{Number of concordant pairs, i.e. pairs with }}0<i<j<n{\text{ where }}x_{i}<x_{j}{\text{ and }}y_{i}<y_{j}{\text{ or }}x_{i}>x_{j}{\text{ and }}y_{i}>y_{j}\\n_{d}&={\text{Number of discordant pairs, i.e. pairs where }}0<i<j<n{\text{ where }}x_{i}<x_{j}{\text{ and }}y_{i}>y_{j}{\text{ or }}x_{i}>x_{j}{\text{ and }}y_{i}<y_{j}\\t_{i}&={\text{Number of tied values in the }}i^{\text{th}}{\text{ group of ties for the empirical distribution of X}}\\u_{j}&={\text{Number of tied values in the }}j^{\text{th}}{\text{ group of ties for the empirical distribution of Y}}\end{aligned}}}

تقوم خوارزمية بسيطة تم تطويرها بلغة BASIC بحساب معامل Tau-b باستخدام صيغة بديلة. [ 13 ]

يجب الانتباه إلى أن بعض الحزم الإحصائية، مثل SPSS، تستخدم صيغًا بديلة لتحسين الكفاءة الحسابية، مع ضعف العدد "المعتاد" للأزواج المتوافقة وغير المتوافقة. [ 14 ]

تاو-سي

تم تعريف تاو-سي (المعروف أيضًا باسم تاو-سي ستيوارت-كيندال) [ 15 ] لأول مرة من قبل ستيوارت عام 1953. [ 16 ] على عكس تاو-بي، يمكن أن تكون قيمة تاو-سي مساوية لـ +1 أو -1 في جداول التوافق غير المربعة (أي المستطيلة) ، [ 15 ] [ 16 ] أي عندما يكون للمقياسين الأساسيين للمتغيرين عدد مختلف من القيم الممكنة. على سبيل المثال، إذا كان المتغير X له توزيع منتظم مستمر بين 0 و100، وكان Y متغيرًا ثنائي القيمة يساوي 1 إذا كان X ≥ 50 و0 إذا كان X < 50، فإن إحصائية تاو-سي لـ X وY تساوي 1، بينما تاو-بي تساوي 0.707. يمكن تفسير قيمة Tau-c التي تساوي 1 على أنها أفضل ارتباط إيجابي ممكن مشروط بالتوزيعات الهامشية، بينما يمكن تفسير قيمة Tau-b التي تساوي 1 على أنها ارتباط رتيب إيجابي مثالي حيث يكون لتوزيع X المشروط بـ Y تباين صفري، ويكون لتوزيع Y المشروط بـ X تباين صفري، بحيث توجد دالة تقابلية f مع f(X)=Y.

يُعرَّف معامل ستيوارت-كيندال تاو-سي على النحو التالي: [ 16 ]

τج=2(نج-ند)ن2(م-1)م=τأن-1نمم-1{\displaystyle \tau _{C}={\frac {2(n_{c}-n_{d})}{n^{2}{\frac {(m-1)}{m}}}}=\tau _{A}{\frac {n-1}{n}}{\frac {m}{m-1}}}

أين

نج=عدد الأزواج المتوافقةند=عدد الأزواج غير المتوافقةر=عدد صفوف جدول التوافق (أي عدد الصفوف المتميزة) xأنا)ج=عدد أعمدة جدول التوافق (أي عدد الأعمدة المميزة) yأنا)م=مين(ر،ج){\displaystyle {\begin{aligned}n_{c}&={\text{Number of concordant pairs}}\\n_{d}&={\text{Number of discordant pairs}}\\r&={\text{Number of rows of the contingency table (i.e. number of distinct }}x_{i}{\text{)}}\\c&={\text{Number of columns of the contingency table (i.e. number of distinct }}y_{i}{\text{)}}\\m&=\min(r,c)\end{aligned}}}

اختبارات الدلالة الإحصائية

عندما تكون كميتان مرتبطتين إحصائياً، فإن توزيعτ{\displaystyle \tau }لا يمكن وصفها بسهولة من حيث التوزيعات المعروفة. ومع ذلك، بالنسبة لـτأ{\displaystyle \tau _{A}}الإحصائية التالية،zأ{\displaystyle z_{A}}، يتم توزيعها تقريبًا كتوزيع طبيعي معياري عندما تكون المتغيرات مستقلة إحصائيًا:

zأ=نج-ند118v0{\displaystyle z_{A}={n_{c}-n_{d} \over {\sqrt {{\frac {1}{18}}v_{0}}}}}

أينv0=ن(ن-1)(2ن+5){\displaystyle v_{0}=n(n-1)(2n+5)}.

وبالتالي، لاختبار ما إذا كان متغيران مرتبطين إحصائيًا، يتم حسابzأ{\displaystyle z_{A}}، ويجد الاحتمال التراكمي للتوزيع الطبيعي القياسي عند-|zأ|{\displaystyle -|z_{A}|}في اختبار ذي طرفين، اضرب هذا الرقم في اثنين للحصول على قيمة الاحتمال (p -value). إذا كانت قيمة الاحتمال أقل من مستوى الدلالة المحدد، يتم رفض الفرضية الصفرية (عند مستوى الدلالة هذا) التي تنص على أن الكميات مستقلة إحصائيًا.

ينبغي إضافة العديد من التعديلات إلىzأ{\displaystyle z_{A}}عند احتساب حالات التعادل. الإحصائية التالية،zب{\displaystyle z_{B}}، له نفس التوزيع مثلτب{\displaystyle \tau _{B}}التوزيع، ويكون مساوياً تقريباً للتوزيع الطبيعي القياسي عندما تكون الكميات مستقلة إحصائياً:

zب=نج-ندv{\displaystyle z_{B}={n_{c}-n_{d} \over {\sqrt {v}}}}

أين

v=118v0-(vت+vu)/18+(v1+v2)v0=ن(ن-1)(2ن+5)vت=أناتأنا(تأنا-1)(2تأنا+5)vu=جuج(uج-1)(2uج+5)v1=أناتأنا(تأنا-1)جuج(uج-1)/(2ن(ن-1))v2=أناتأنا(تأنا-1)(تأنا-2)جuج(uج-1)(uج-2)/(9ن(ن-1)(ن-2)){\displaystyle {\begin{array}{ccl}v&=&{\frac {1}{18}}v_{0}-(v_{t}+v_{u})/18+(v_{1}+v_{2})\\v_{0}&=&n(n-1)(2n+5)\\v_{t}&=&\sum _{i}t_{i}(t_{i}-1)(2t_{i}+5)\\v_{u}&=&\sum _{j}u_{j}(u_{j}-1)(2u_{j}+5)\\v_{1}&=&\sum _{i}t_{i}(t_{i}-1)\sum _{j}u_{j}(u_{j}-1)/(2n(n-1))\\v_{2}&=&\sum _{i}t_{i}(t_{i}-1)(t_{i}-2)\sum _{j}u_{j}(u_{j}-1)(u_{j}-2)/(9n(n-1)(n-2))\end{array}}}

يُشار إلى هذا أحيانًا باسم اختبار مان-كيندال. [ 17 ]

الخوارزميات

الحساب المباشر للبسطنج-ند{\displaystyle n_{c}-n_{d}}، يتضمن ذلك تكرارين متداخلين، كما هو موضح في الشفرة الزائفة التالية:

numer := 0 for i := 2..N do for j := 1..(i − 1) do numer := numer + sign(x[i] − x[j]) × sign(y[i] − y[j]) إرجاع الرقم

على الرغم من سهولة تطبيق هذه الخوارزمية، إلا أنهايا(ن2){\displaystyle O(n^{2})}تزداد تعقيدًا وتصبح بطيئة جدًا مع العينات الكبيرة. يمكن استخدام خوارزمية أكثر تطورًا [ 18 ] مبنية على خوارزمية فرز الدمج لحساب البسط فييا(نسجلن){\displaystyle O(n\cdot \log {n})}وقت.

ابدأ بترتيب نقاط البيانات الخاصة بك حسب الكمية الأولى،x{\displaystyle x}وثانياً (بين الروابط فيx{\displaystyle x}) بالكمية الثانية،y{\displaystyle y}مع هذا الطلب الأولي،y{\displaystyle y}غير مرتبة، ويتمثل جوهر الخوارزمية في حساب عدد الخطوات التي ستتخذها خوارزمية فرز الفقاعات لفرز هذه البيانات الأولية.y{\displaystyle y}خوارزمية فرز الدمج المحسّنة ، معيا(نسجلن){\displaystyle O(n\log n)}يمكن تطبيق التعقيد لحساب عدد عمليات التبديل.S(y){\displaystyle S(y)}، وهو ما يتطلبه فرز الفقاعات للفرزyأنا{\displaystyle y_{i}}ثم البسط لـτ{\displaystyle \tau }يتم حسابها على النحو التالي:

نج-ند=ن0-ن1-ن2+ن3-2S(y)،{\displaystyle n_{c}-n_{d}=n_{0}-n_{1}-n_{2}+n_{3}-2S(y),}

أينن3{\displaystyle n_{3}}يتم حسابها مثلن1{\displaystyle n_{1}}ون2{\displaystyle n_{2}}لكن فيما يتعلق بالروابط المشتركة فيx{\displaystyle x}وy{\displaystyle y}.

تقوم خوارزمية فرز الدمج بتقسيم البيانات المراد فرزها،y{\displaystyle y}إلى نصفين متساويين تقريبًا،yلهـوت{\displaystyle y_{\mathrm {left} }}وyرأنازحت{\displaystyle y_{\mathrm {right} }}ثم يقوم بفرز كل نصف بشكل متكرر، ثم يدمج النصفين المفرزين في متجه مرتب بالكامل. عدد عمليات تبديل فرز الفقاعات يساوي:

S(y)=S(yلهـوت)+S(yرأنازحت)+م(Yلهـوت،Yرأنازحت){\displaystyle S(y)=S(y_{\mathrm {left} })+S(y_{\mathrm {right} })+M(Y_{\mathrm {left} },Y_{\mathrm {right} })}

أينYلهـوت{\displaystyle Y_{\mathrm {left} }}وYرأنازحت{\displaystyle Y_{\mathrm {right} }}هي النسخ المصنفة منyلهـوت{\displaystyle y_{\mathrm {left} }}وyرأنازحت{\displaystyle y_{\mathrm {right} }}، وم(،){\displaystyle M(\cdot ,\cdot )}يصف هذا الوصف عملية الدمج المكافئة لعملية التبديل في خوارزمية فرز الفقاعات .م(،){\displaystyle M(\cdot ,\cdot )}يتم حسابها كما هو موضح في الشفرة الزائفة التالية:

الدالة M(L[1..n], R[1..m]) هي i := 1 j := 1 عدد عمليات التبديل := 0 طالما أن i ≤ n و j ≤ m، إذا كان R[j] < L[i]، فقم بما يلي: nSwaps := nSwaps + n − i + 1 j := j + 1 آخر i := i + 1 إرجاع عدد عمليات التبديل

من الآثار الجانبية للخطوات المذكورة أعلاه أنك ستحصل في النهاية على نسخة مرتبة منx{\displaystyle x}ونسخة مُرتبة منy{\displaystyle y}مع هذه العواملتأنا{\displaystyle t_{i}}وuج{\displaystyle u_{j}}يستخدم لحسابτب{\displaystyle \tau _{B}}يمكن الحصول عليها بسهولة في عملية مرور واحدة خطية عبر المصفوفات المصنفة.

تقريب معامل ارتباط رتبة كيندال من تدفق البيانات

توجد خوارزميات فعالة لحساب معامل ارتباط رتبة كندال وفقًا للمُقدِّر القياسييا(نسجلن){\displaystyle O(n\cdot \log {n})}تعقيد الوقت. مع ذلك، تتطلب هذه الخوارزميات توفر جميع البيانات لتحديد رتب الملاحظات، مما يشكل تحديًا في بيئات البيانات المتسلسلة حيث تُكشف الملاحظات تدريجيًا. لحسن الحظ، توجد خوارزميات لتقدير معامل ارتباط رتب كندال في البيئات المتسلسلة. [ 19 ] [ 20 ] تتميز هذه الخوارزميات بـيا(1){\displaystyle O(1)}تحديث تعقيد الوقت والمساحة، والتوسع بكفاءة مع عدد الملاحظات. وبالتالي، عند معالجة مجموعة منن{\displaystyle n}تصبح الملاحظات، مع تعقيد الوقتيا(ن){\displaystyle O(n)}بينما يظل تعقيد المساحة ثابتًايا(1){\displaystyle O(1)}.

تُقدّم الخوارزمية الأولى من نوعها [ 19 ] تقريبًا لمعامل ارتباط رتبة كندال، وذلك بالاعتماد على تقريب التوزيع المشترك للمتغيرات العشوائية. وتُعالج البيانات غير المستقرة باستخدام أسلوب النافذة المتحركة. تتميز هذه الخوارزمية [ 19 ] ببساطتها وقدرتها على التعامل مع المتغيرات العشوائية المتقطعة والمتصلة على حد سواء دون الحاجة إلى تعديل.

تعتمد الخوارزمية الثانية [ 20 ] على مُقدِّرات متسلسلة هيرميت، وتستخدم مُقدِّرًا بديلًا لمعامل ارتباط رتبة كندال الدقيق، أي احتمال التوافق مطروحًا منه احتمال عدم التوافق بين أزواج الملاحظات ثنائية المتغيرات. كما يُعد هذا المُقدِّر البديل تقريبًا للمُقدِّر القياسي. هذه الخوارزمية [ 20 ] قابلة للتطبيق فقط على المتغيرات العشوائية المستمرة، ولكنها أظهرت دقةً فائقة وسرعةً مُحتملة مُقارنةً بالخوارزمية الأولى الموصوفة [ 19 ] ، بالإضافة إلى قدرتها على التعامل مع البيانات غير المستقرة دون الاعتماد على النوافذ المنزلقة. يتوفر تطبيق فعّال لنهج متسلسلة هيرميت في حزمة R المسماة hermiter [ 20 ] .

تطبيقات البرمجيات

  • ينفذ R الاختبار لـτب{\displaystyle \tau _{B}}cor.test(x, y, method = "kendall")في حزمة "stats" الخاصة بها ( cor(x, y, method = "kendall")ستعمل أيضًا، لكن الأخيرة لا تُرجع قيمة p). جميع الإصدارات الثلاثة للمعامل متوفرة في حزمة "DescTools" مع فترات الثقة: KendallTauA(x,y,conf.level=0.95)لـτأ{\displaystyle \tau _{A}}، KendallTauB(x,y,conf.level=0.95)لτب{\displaystyle \tau _{B}}، StuartTauC(x,y,conf.level=0.95)لτج{\displaystyle \tau _{C}}يتم توفير تقديرات سريعة لمعامل ارتباط رتبة كندال بالإضافة إلى التقديرات المتسلسلة في حزمة hermiter . [ 20 ]
  • بالنسبة للغة بايثون ، تقوم مكتبة SciPy بتنفيذ عملية الحساب لـτب{\displaystyle \tau _{B}}فيscipy.stats.kendalltau
  • يتم تنفيذ ذلك في برنامج Stata على النحو التالي :ktau varlist

انظر أيضاً

مراجع

  1. 1 2 كيندال، إم جي (1938). "مقياس جديد لارتباط الرتب". بيومتريكا . 30 ( 1-2 ): 81-89 . doi : 10.1093/biomet/30.1-2.81 . JSTOR 2332226 . 
  2. كروسكال، دبليو إتش (1958). " مقاييس الارتباط الترتيبية". مجلة الجمعية الإحصائية الأمريكية . 53 (284): 814-861 . doi : 10.2307/2281954 . JSTOR 2281954. MR 0100941 .  
  3. نيلسن، آر بي (2001) [1994]، "مقياس تاو لكيندال" ، موسوعة الرياضيات ، دار نشر إي إم إس
  4. بروخوروف، أ. ف. (2001) [1994]، "معامل ارتباط الرتب لكيندال" ، موسوعة الرياضيات ، دار نشر EMS
  5. فالز، بول د.؛ ماكلويد، أ. إيان (فبراير 1990). "اشتقاق مبسط لتباين معامل ارتباط رتب كندال" . الإحصائي الأمريكي . 44 (1): 39-40 . doi : 10.1080/00031305.1990.10475691 . ISSN 0003-1305 . 
  6. فالز، بول د.؛ ماكلويد، أ. إيان؛ طومسون، ماري إي. (فبراير 1995). "دالة توليد العزوم التراكمية وتقريبات احتمال الذيل لدرجة كندال مع الرتب المتساوية" . حوليات الإحصاء . 23 (1): 144-160 . doi : 10.1214/aos/1176324460 . ISSN 0090-5364 . 
  7. هوفدينغ، فاسيلي (1992)، "فئة من الإحصاءات ذات التوزيع الطبيعي التقاربي" ، في كوتز، صموئيل؛ جونسون، نورمان ل. (محرران)، اختراقات في الإحصاء: الأسس والنظرية الأساسية ، سلسلة سبرينغر في الإحصاء، نيويورك، نيويورك: سبرينغر، ص 308-334 ، doi : 10.1007/978-1-4612-0919-5_20 ، ISBN  978-1-4612-0919-5تم الاطلاع عليه بتاريخ 19 يناير 2024
  8. كيندال، إم جي (1949). "الارتباط بين الرتب ومعامل ارتباط بيرسون" . بيومتريكا . 36 (1/2): 177-193 . doi : 10.2307/2332540 . ISSN 0006-3444 . JSTOR 2332540. PMID 18132091 .   
  9. ^ ريتشارد غرينر، (1909)، Ueber das Fehlersystem der Kollektiv-maßlehre ، Zeitschrift für Mathematik und Physik، Band 57، BG Teubner، Leipzig، الصفحات 121-158، 225-260، 337-373.
  10. موران، ب. أ. ب. (1948). " ارتباط الرتب وارتباط عزم المنتج" . بيومتريكا . 35 (1/2): 203-206 . doi : 10.2307/2332641 . ISSN 0006-3444 . JSTOR 2332641. PMID 18867425 .   
  11. بيرغر، دانيال (2016). "برهان على مساواة غرينر" . المجلة الإلكترونية لشبكة أبحاث العلوم الاجتماعية . doi : 10.2139/ssrn.2830471 . ISSN 1556-5068 . 
  12. كيندال، إم جي (1945). "معالجة حالات التعادل في مسائل الترتيب 1" . مجلة Biometrika . 33 (3): 239-251 . doi : 10.2307/2332303 . JSTOR 2332303. PMID 21006841. تاريخ الاسترجاع: 12 نوفمبر 2024 .  
  13. ألفريد بروفي (1986). "خوارزمية وبرنامج لحساب معامل ارتباط رتبة كندال" (ملف PDF) . أساليب البحث السلوكي، والأدوات، والحواسيب . 18 : 45-46 . doi : 10.3758/BF03200993 . S2CID 62601552 . 
  14. آي بي إم (2016). خوارزميات برنامج IBM SPSS Statistics 24. آي بي إم. ص 168. تم الاطلاع عليه بتاريخ 31 أغسطس 2017 . 
  15. 1 2 بيري، كيه جيه؛ جونستون، جيه إي؛ زهران، إس؛ ميلكي، بي دبليو (2009). "مقياس تاو ستيوارت لحجم التأثير للمتغيرات الترتيبية: بعض الاعتبارات المنهجية" . أساليب البحث السلوكي . 41 (4): 1144-1148 . doi : 10.3758/brm.41.4.1144 . PMID 19897822 . 
  16. 1 2 3 ستيوارت، أ. (1953). "تقدير ومقارنة قوة الارتباط في جداول التوافق". Biometrika . 40 ( 1-2 ): 105-110 . doi : 10.2307/2333101 . JSTOR 2333101 . 
  17. فالز، بول د.؛ ماكلويد، أ. إيان؛ طومسون، ماري إي. (فبراير 1995). "دالة توليد العزوم التراكمية وتقريبات احتمال الذيل لدرجة كندال مع الرتب المتساوية" . حوليات الإحصاء . 23 (1): 144-160 . doi : 10.1214/aos/1176324460 . ISSN 0090-5364 . 
  18. نايت، و. (1966). "طريقة حاسوبية لحساب معامل تاو لكيندال مع البيانات غير المصنفة". مجلة الجمعية الإحصائية الأمريكية . 61 (314): 436-439 . doi : 10.2307/2282833 . JSTOR 2282833 . 
  19. 1 2 3 4 شياو، و. (2019). "خوارزميات جديدة عبر الإنترنت للارتباطات غير البارامترية مع تطبيق لتحليل بيانات المستشعرات". المؤتمر الدولي لهندسة الكهرباء والإلكترونيات (IEEE) لعام 2019 حول البيانات الضخمة (البيانات الضخمة) . الصفحات 404-412 . doi : 10.1109/BigData47090.2019.9006483 . ISBN  978-1-7281-0858-2. S2CID 211298570 . 
  20. 1 2 3 4 5 ستيفانو، م. وفاروغيز، م. (2023). "Hermiter: حزمة R للتقدير غير البارامتري المتسلسل". الإحصاءات الحاسوبية . arXiv : 2111.14091 . doi : 10.1007/s00180-023-01382-0 . S2CID 244715035 . {{cite journal}}: صيانة CS1: أسماء متعددة: قائمة المؤلفين ( رابط )

للمزيد من القراءة