عرض الأحرف المضغوطة

يُعدّ عرض الأحرف المُختصر ( CLD ) أسلوبًا إحصائيًا لتوضيح نتائج اختبار الفرضيات المتعددة عند استخدام تحليل التباين (ANOVA ) واختبار توكي للمدى. كما يُمكن تطبيق CLD بعد اختبار دنكان الجديد للمدى المتعدد (المُشابه لاختبار توكي للمدى). يُسهّل CLD تحديد المتغيرات، أو العوامل ، التي لها متوسطات (أو مُعدّلات) مُختلفة إحصائيًا مُقارنةً بتلك التي لا تملك متوسطات (أو مُعدّلات) مُختلفة إحصائيًا.

تعتمد التقنية الأساسية لعرض الأحرف المختصرة على تسمية المتغيرات بحرف واحد أو أكثر، بحيث لا يمكن تمييز المتغيرات إحصائيًا إلا إذا وفقط إذا اشتركت في حرف واحد على الأقل. ويمكن تمثيل مشكلة القيام بذلك، باستخدام أقل عدد ممكن من الأحرف المختلفة، توافقيًا على أنها مشكلة حساب غطاء زمرة الحواف لرسم بياني يمثل أزواجًا من المتغيرات غير القابلة للتمييز. [ 1 ]

إلى جانب تحديد قابلية التمييز بهذه الطريقة، يقوم تحليل CLD أيضًا بترتيب المتغيرات، أو العوامل، حسب متوسطها (أو معدلها) بترتيب تنازلي. ويمكن تطبيق منهجية CLD على البيانات الجدولية ( جداول البيانات ، إطارات البيانات ) أو البيانات المرئية ( مخطط الصندوق والمخطط الشريطي ).

أساسيات CLD

يحدد تحليل CLD المتغيرات التي تختلف إحصائياً عن تلك التي لا تختلف إحصائياً

كل متغير يشترك في متوسط ​​لا يختلف إحصائيًا عن متوسط ​​متغير آخر سيُرمز له بنفس الحرف. [ 2 ] [ 3 ] [ 4 ]   على سبيل المثال:

"أ" "أب" "ب"

يشير ما سبق إلى أن متوسط ​​المتغير الأول "أ" يختلف إحصائيًا عن متوسط ​​المتغير الثالث "ب". أما متوسط ​​المتغير الثاني "أب" فلا يختلف إحصائيًا عن متوسط ​​أي من المتغيرين الأول أو الثالث. لننظر إلى مثال آخر:

"أ" "أب" "بج" "ج"

يشير ما سبق إلى أن متوسط ​​المتغير الأول "أ" يختلف إحصائيًا عن متوسط ​​المتغير الثالث "ب ج" والمتغير الرابع "ج". لكن هذا المتغير الأول "أ" لا يختلف إحصائيًا عن المتغير الثاني "أب".

بالنظر إلى بنية الأبجدية اللاتينية، يمكن لمنهجية CLD بسهولة مقارنة ما يصل إلى 26 متغيرًا أو عاملًا مختلفًا. هذا القيد عادةً ما يكون أعلى بكثير من الغالبية العظمى من اختبارات الفرضيات المتعددة التي تُجرى باستخدام تحليل التباين (ANOVA) واختبارات نطاق توكي.

يصنف CLD المتغيرات بترتيب تنازلي حسب المتوسط ​​(أو المعدل).

لذا، سيُسمى المتغير ذو أعلى متوسط ​​(أو معدل) "أ" (إذا كان مختلفًا إحصائيًا عن جميع المتغيرات الأخرى، وإلا فقد يُسمى "أب"، وهكذا). أما المتغير ذو أدنى متوسط ​​(أو معدل) فسيحمل الحرف الأعلى بين المتغيرات المختبرة. [ 2 ] [ 3 ] [ 4 ]

مثال على CLD

سنختبر ما إذا كان متوسط ​​هطول الأمطار في خمس مدن على الساحل الغربي يختلف إحصائياً. وهذه المدن هي:

  1. يوجين (أوريغون)
  2. بورتلاند (أوريغون)
  3. سان فرانسيسكو (كاليفورنيا)
  4. سياتل (واشنطن)
  5. سبوكان (واشنطن)

البيانات هي كمية الأمطار السنوية بالبوصة (1951 - 2021).

مصدر البيانات هو الإدارة الوطنية للمحيطات والغلاف الجوي (NOAA) .

أولاً، سنقوم بتحسين البيانات الجدولية باستخدام CLD.

بعد ذلك، سنقوم بتحسين البيانات المرئية باستخدام CLD.

تحسين البيانات الجدولية باستخدام CLD

فيما يلي بيانات هطول الأمطار في خمس مدن على الساحل الغربي قبل تطبيق منهجية CLD.

بيانات هطول الأمطار لخمس مدن على الساحل الغربي

كما هو موضح أعلاه، تم ترتيب بيانات هطول الأمطار لمدن الساحل الغربي الخمس أبجديًا. هذا الترتيب غير مفيد، إذ يصعب تحديد أي المدن تختلف معدلات هطول الأمطار فيها عن بعضها.

بعد ذلك، نقوم بإعادة إنتاج نفس الجدول ولكننا نرتب المدن باستخدام منهجية CLD بعد أن كنا سنجري اختبار نطاق Tukey.

بيانات هطول الأمطار لخمس مدن على الساحل الغربي باستخدام منهجية CLD

يُعد الجدول أعلاه، المُستخدم في منهجية CLD، أكثر إفادة. فقد رتب المدن حسب متوسط ​​هطول الأمطار فيها تنازليًا. كما جمع المدن ذات متوسط ​​هطول الأمطار المتقارب (غير المختلف إحصائيًا باستخدام قيمة ألفا 0.05).

كما هو موضح، فإن متوسط ​​هطول الأمطار في سياتل وبورتلاند لا يختلف إحصائياً عن بعضهما البعض، لذا يُصنفان ضمن الفئة "ب". كذلك، فإن متوسط ​​هطول الأمطار في سان فرانسيسكو وسبوكين لا يختلف إحصائياً عن بعضهما البعض، لذا يُصنفان ضمن الفئة "ج". أما متوسط ​​هطول الأمطار في يوجين فهو أعلى إحصائياً من متوسط ​​هطول الأمطار في كل من سياتل وبورتلاند، وسان فرانسيسكو وسبوكين. في المقابل، فإن متوسط ​​هطول الأمطار في سياتل وبورتلاند أعلى إحصائياً من متوسط ​​هطول الأمطار في سان فرانسيسكو وسبوكين.

تحسين البيانات المرئية باستخدام CLD

إليكم مخطط الصندوق الأول مع المدن مرتبة أبجديًا من اليسار إلى اليمين.

مخطط الصندوق لبيانات هطول الأمطار في خمس مدن على الساحل الغربي

الرسم البياني أعلاه غير واضح تمامًا. يصعب التمييز بين المدن المتشابهة إلى حد ما (حيث لا يوجد فرق إحصائي بين المتوسطين) والمدن المختلفة (حيث يوجد فرق إحصائي بين المتوسطين). الآن، دعونا نعرض الرسم البياني نفسه باستخدام منهجية CLD.

مخطط الصندوق لبيانات هطول الأمطار في خمس مدن على الساحل الغربي باستخدام منهجية CLD

أصبح مخطط الصندوق أعلاه، باستخدام منهجية CLD، أكثر إفادة. تم ترتيب المدن تنازليًا من اليسار إلى اليمين. تتدرج كثافة الألوان، حيث تُلوّن المدن ذات معدلات هطول الأمطار الأعلى بدرجات لونية أكثر كثافة أو عتامة، بينما تُلوّن المدن ذات معدلات هطول الأمطار الأقل بدرجات لونية أقل كثافة أو أكثر شفافية. بالإضافة إلى ذلك، يمكننا بسهولة تحديد المدن ذات متوسطات هطول الأمطار المتشابهة (غير المتباينة إحصائيًا)، مثل سياتل وبورتلاند اللتين تم تحديدهما بالحرف "b". كما أن سان فرانسيسكو وسبوكين لهما أيضًا متوسطات هطول أمطار متشابهة، حيث تم تحديدهما بالحرف "c". من ناحية أخرى، تتمتع يوجين بأعلى متوسط ​​لهطول الأمطار بينها جميعًا، وهو أعلى إحصائيًا من جميع المدن الأخرى، حيث إنها المدينة الوحيدة التي تم تحديدها بالحرف "a".

فوائد CLD

في غياب منهجية CLD، تُعدّ طريقة Tukey's range test المذكورة هي الطريقة الأساسية لتحديد الفروق الإحصائية في المتوسطات بين المتغيرات المزدوجة. وهذا الاختبار الأخير غني بالمعلومات ومُصمّم خصيصًا للإحصائيين. أما خارج هذه الفئة المتخصصة، فإنّ تفسير نتائج الاختبار الموضحة أدناه يُعدّ أمرًا صعبًا.

نتائج اختبار توكي لنطاق هطول الأمطار في خمس مدن على الساحل الغربي

أظهر اختبار توكي للمدى أن متوسط ​​هطول الأمطار بين سان فرانسيسكو وسبوكين لم يكن مختلفًا إحصائيًا (عند مستوى ألفا = 0.05) بقيمة احتمالية 0.08. كما لم يكن متوسط ​​هطول الأمطار بين سياتل وبورتلاند مختلفًا إحصائيًا، مع وجود فرق مرتبط بقيمة احتمالية 0.54.

كما سبق توضيحه، يُعدّ استخدام منهجية CLD أسهل بكثير في إيصال الفروقات بين متوسطات هطول الأمطار في المدن. كما أن المعلومات المُحسّنة باستخدام CLD يُمكن تفسيرها بسهولة من قِبل جمهور أوسع بكثير مقارنةً بالطرق الأخرى (كإيصال النتائج دون استخدام منهجية CLD، بما في ذلك إيصال نتيجة اختبار توكي للمدى مباشرةً).

كيفية إنشاء مخطط الصندوق في لغة R باستخدام خاصية عرض الأحرف المختصرة

مراجع

  1. غرام، ينس؛ غو، جيونغ؛ هوفنر، فالك؛ نيدرماير، رولف؛ بيفو، هانز-بيتر؛ شميد، رامونا (2008). "خوارزميات لعرض الأحرف بشكل مضغوط: مقارنة وتقييم". الإحصاءات الحاسوبية وتحليل البيانات . 52 (2): 725-736 . doi : 10.1016/j.csda.2006.09.035 . MR 2418523 . 
  2. 1 2 "عرض الأحرف المضغوطة (CLD)" . schmidtpaul.github.io . تم ​​الاطلاع عليه بتاريخ 2022-09-04 .
  3. 1 2 بييفو، هانز-بيتر (2004-06-01). "خوارزمية لتمثيل المقارنات الثنائية باستخدام الأحرف" . مجلة الإحصاءات الحاسوبية والرسومية . 13 (2): 456-466 . doi : 10.1198/1061860043515 . ISSN 1061-8600 . S2CID 122068627 .  
  4. 1 2 بييفو، هانز-بيتر (مارس 2018). "الحروف في مقارنات المتوسطات: ما تعنيه وما لا تعنيه" . Researchgate.com . تم الاطلاع عليه في 3 سبتمبر 2022 .
  5. "شاشات عرض الأحرف المدمجة" . مدونة جون كوينسن . 15 يناير 2020. تاريخ الاسترجاع: 4 سبتمبر 2022 .
  6. "cld: إعداد عرض مختصر لجميع المقارنات الثنائية في multcomp: الاستدلال المتزامن في النماذج البارامترية العامة" . rdrr.io. تم ​​الاطلاع عليه بتاريخ 2022-09-04 .
  7. "dsfair_quarto - Compact Letter Display (CLD)" . schmidtpaul.github.io . 2023-06-17 . تم الاطلاع عليه بتاريخ 2024-09-11 .

للمزيد من القراءة