مؤشر الحساسية

مؤشر الحساسية أو مؤشر التمييز أو مؤشر القدرة على الاكتشاف هو إحصائية بلا أبعاد تستخدم في نظرية اكتشاف الإشارة . يشير المؤشر الأعلى إلى إمكانية اكتشاف الإشارة بسهولة أكبر.
تعريف
مؤشر التمييز هو الفصل بين متوسطات توزيعين (عادةً توزيع الإشارة وتوزيع الضوضاء)، بوحدات الانحراف المعياري.
تباينات/تباينات متساوية
بالنسبة لتوزيعين أحاديين المتغير وبنفس الانحراف المعياري، يتم الإشارة إليه بواسطة ('dee-prime'):
- .
في الأبعاد الأعلى، أي مع توزيعين متعددين المتغيرات بنفس مصفوفة التباين-التغاير ، (التي يكون جذرها التربيعي المتماثل، مصفوفة الانحراف المعياري، هو )، فإن هذا يعمم على مسافة ماهالانوبيس بين التوزيعين:
- ,
أين هي الشريحة أحادية البعد للانحراف المعياري على طول متجه الوحدة عبر المتوسطات، أي أن تساوي على طول الشريحة أحادية البعد عبر المتوسطات. [1]
بالنسبة لتوزيعين ثنائيين لهما تباين-تباين متساويين، يتم إعطاء ذلك بواسطة:
- ,
أين معامل الارتباط، وهنا و ، أي بما في ذلك إشارات الفروق المتوسطة بدلاً من المطلقة. [1]
ويقدر أيضًا بـ . [2] : 8
التباينات/التغايرات غير المتساوية
عندما يكون للتوزيعين انحرافات معيارية مختلفة (أو في أبعاد عامة، مصفوفات تباين مختلفة)، توجد العديد من المؤشرات المتنافسة، والتي يتم تقليصها جميعًا إلى تباين/تباين متساوٍ.
مؤشر بايز للتمييز
هذا هو مؤشر التمييز الأقصى (الأمثل لبايز) لتوزيعين، بناءً على مقدار تداخلهما، أي الخطأ الأمثل (بايز) في التصنيف بواسطة مراقب مثالي، أو مكمله، الدقة المثلى :
- ، [1]
حيث هي دالة التوزيع التراكمي العكسي للتوزيع الطبيعي القياسي. يمكن حساب قابلية التمييز بين التوزيعات الطبيعية أحادية المتغير أو متعددة المتغيرات بواسطة بايز رقميًا [1] (كود ماتلاب)، ويمكن أيضًا استخدامها كتقريب عندما تكون التوزيعات قريبة من التوزيع الطبيعي.
هو مقياس مسافة إحصائية موجبة محددة خالية من الافتراضات حول التوزيعات، مثل تباعد كولباك-ليبلر . غير متماثل، في حين أنه متماثل للتوزيعين. ومع ذلك، لا يلبي متباينة المثلث، لذلك فهو ليس مقياسًا كاملاً. [1]
على وجه الخصوص، بالنسبة لمهمة نعم/لا بين توزيعين طبيعيين أحاديين المتغير مع المتوسطات والتباينات ، فإن دقة التصنيف الأمثل لبايز هي: [1]
- ,
حيث يشير إلى توزيع مربع كاي غير المركزي ، و، و . قابلية تمييز بايز
يمكن أيضًا حساب ROC من منحنى ROC لمهمة نعم/لا بين توزيعين طبيعيين أحاديين المتغير بمعيار تحول واحد. يمكن أيضًا حسابه من منحنى ROC لأي توزيعين (في أي عدد من المتغيرات) بنسبة احتمالية تحول، من خلال تحديد النقطة على منحنى ROC الأبعد عن القطر. [1]
بالنسبة لمهمة ذات فترتين بين هذه التوزيعات، فإن الدقة المثلى هي ( تشير إلى توزيع مربع كاي المعمم )، حيث . [1] قابلية تمييز بايز .
مؤشر التمييز RMS sd
مؤشر قابلية التمييز التقريبي الشائع (أي دون المستوى الأمثل) الذي له شكل مغلق هو أخذ متوسط التباينات، أي الجذر التربيعي المتوسط للانحرافين المعياريين: [3] (يُشار إليه أيضًا بـ ). إنه مضروبًا في - درجة المساحة الواقعة أسفل منحنى خاصية التشغيل المستقبل (AUC) لمراقب معياري واحد. يمتد هذا المؤشر إلى الأبعاد العامة كمسافة ماهالانوبيس باستخدام التباين المجمع، أي مع كمصفوفة الانحراف المعياري المشتركة. [1]
متوسط مؤشر التمييز الانحراف المعياري
هناك مؤشر آخر وهو ، يمتد إلى الأبعاد العامة باستخدام مصفوفة الانحراف المعياري المشتركة. [1]
مقارنة المؤشرات
وقد تبين أنه بالنسبة لتوزيعين طبيعيين أحاديين المتغير، ، وبالنسبة للتوزيعات الطبيعية المتعددة المتغيرات، لا يزال. [1]
وبالتالي، و التقليل من تقدير أقصى قابلية للتمييز للتوزيعات الطبيعية أحادية المتغير. يمكن التقليل من التقدير بحد أقصى يبلغ حوالي 30٪. عند حد قابلية التمييز العالية للتوزيعات الطبيعية أحادية المتغير، يتقارب إلى . غالبًا ما تكون هذه النتائج صحيحة في الأبعاد الأعلى، ولكن ليس دائمًا. [1] روج سيمبسون وفيتر [3] كأفضل مؤشر، وخاصة للمهام ذات الفترتين، لكن داس وجيسلر [1] أظهرا أن هو قابلية التمييز المثلى في جميع الحالات، وغالبًا ما يكون تقريبًا مغلق الشكل أفضل من ، حتى للمهام ذات الفترتين.
المؤشر التقريبي ، الذي يستخدم المتوسط الهندسي للانحرافات المعيارية، أقل من المؤشر عند التمييز الصغير، ولكنه أكبر عند التمييز الكبير. [1]
المساهمة في القدرة على التمييز حسب كل بُعد
بشكل عام، يمكن قياس المساهمة في القدرة على التمييز الإجمالية لكل بُعد أو سمة باستخدام المقدار الذي تنخفض به القدرة على التمييز عند إزالة هذا البعد. إذا كانت القدرة على التمييز الإجمالية لبايز هي والقدرة على التمييز لبايز مع إزالة البعد هي ، فيمكننا تعريف مساهمة البعد على أنها . وهذا هو نفس القدرة على التمييز الفردية للبعد عندما تكون مصفوفات التباين متساوية وقطرية، ولكن في الحالات الأخرى، يعكس هذا المقياس بدقة أكبر مساهمة البعد من قدرته الفردية على التمييز. [1]
قياس قابلية التمييز بين توزيعين

قد نرغب أحيانًا في زيادة قابلية التمييز بين توزيعين للبيانات عن طريق تقريبهما أو إبعادهما عن بعضهما البعض. ومن هذه الحالات عندما نقوم بنمذجة مهمة الكشف أو التصنيف، ويتجاوز أداء النموذج أداء البيانات الخاضعة للملاحظة أو الملاحظة. في هذه الحالة، يمكننا تقريب توزيعات متغيرات النموذج بحيث تتطابق مع الأداء الملاحظ، مع التنبؤ أيضًا بنقاط البيانات المحددة التي يجب أن تبدأ في التداخل وتصنيفها بشكل خاطئ.
هناك عدة طرق للقيام بذلك. إحداها هي حساب المتجه المتوسط ومصفوفة التباين للتوزيعين، ثم إجراء تحويل خطي لاستيفاء مصفوفة المتوسط والانحراف المعياري (الجذر التربيعي لمصفوفة التباين) لأحد التوزيعين تجاه الآخر. [1]
هناك طريقة أخرى تتمثل في حساب متغيرات القرار لنقاط البيانات (نسبة الاحتمال اللوغاريتمي لانتماء نقطة إلى توزيع واحد مقابل آخر) في ظل نموذج متعدد الطبيعيات، ثم تحريك متغيرات القرار هذه أقرب إلى بعضها البعض أو أبعد عن بعضها البعض. [1]
انظر أيضا
مراجع
- ^ abcdefghijklmnopqrs Das, Abhranil; Wilson S Geisler (2020). "طرق دمج المتغير متعدد الثوابت وحساب مقاييس التصنيف". arXiv : 2012.14331 [stat.ML].
- ^ MacMillan, N.; Creelman, C. (2005). Detection Theory: A User's Guide. Lawrence Erlbaum Associates. ISBN 9781410611147.
- ^ ab Simpson, AJ; Fitter, MJ (1973). "ما هو أفضل مؤشر لقابلية الكشف؟". النشرة النفسية . 80 (6): 481–488. doi :10.1037/h0035203.
- ويكينز، توماس د. (2001). نظرية الكشف عن الإشارة الأولية. دار نشر جامعة أوكسفورد، الولايات المتحدة الأمريكية. الفصل 2، ص 20. رقم ISBN 0-19-509250-3.
روابط خارجية
- دورة تدريبية تفاعلية حول نظرية كشف الإشارة بما في ذلك حساب d ′.
