شاذ

الشكل 1. مخطط الصندوق لبيانات تجربة ميكلسون-مورلي التي تعرض أربع قيم شاذة في العمود الأوسط، بالإضافة إلى قيمة شاذة واحدة في العمود الأول.

في الإحصاء ، تُعرف القيمة الشاذة بأنها نقطة بيانات تختلف اختلافًا كبيرًا عن الملاحظات الأخرى. [ 1 ] [ 2 ] قد تعود القيمة الشاذة إلى تباين في القياس، أو إلى دلالة على بيانات جديدة، أو قد تكون نتيجة خطأ تجريبي؛ وفي هذه الحالة، تُستبعد البيانات الشاذة أحيانًا من مجموعة البيانات . [ 3 ] [ 4 ] قد تشير القيمة الشاذة إلى إمكانية واعدة، ولكنها قد تُسبب أيضًا مشاكل خطيرة في التحليلات الإحصائية.

قد تظهر القيم الشاذة عشوائيًا في أي توزيع، ولكنها قد تشير إلى سلوكيات أو هياكل جديدة في مجموعة البيانات، أو خطأ في القياس ، أو أن التوزيع السكاني ذو ذيل سميك . في حالة خطأ القياس، يُفضل استبعاد هذه القيم أو استخدام إحصاءات مقاومة للقيم الشاذة، بينما في حالة التوزيعات ذات الذيول السميكة، فإنها تشير إلى أن التوزيع ذو التواء عالٍ ، ويجب توخي الحذر الشديد عند استخدام الأدوات أو البديهيات التي تفترض التوزيع الطبيعي . من الأسباب الشائعة للقيم الشاذة مزيج من توزيعين، قد يمثلان مجموعتين فرعيتين متميزتين، أو قد يشيران إلى "تجربة صحيحة" مقابل "خطأ في القياس"؛ ويتم نمذجة ذلك باستخدام نموذج الخليط .

في معظم العينات الكبيرة، قد تكون بعض نقاط البيانات أبعد عن متوسط ​​العينة مما يُعتبر معقولاً. قد يعود ذلك إلى خطأ منهجي عرضي أو عيوب في النظرية التي استند إليها افتراض توزيعات الاحتمالات ، أو قد يكون السبب هو بُعد بعض المشاهدات عن مركز البيانات. لذا، قد تشير النقاط الشاذة إلى بيانات خاطئة، أو إجراءات غير صحيحة، أو مناطق قد لا تكون فيها نظرية معينة صالحة. مع ذلك، في العينات الكبيرة، يُتوقع وجود عدد قليل من القيم الشاذة (وهذا لا يعود إلى أي حالة شاذة).

قد تشمل القيم المتطرفة، باعتبارها أكثر القيم تطرفًا، أعلى قيمة في العينة أو أدنى قيمة فيها ، أو كليهما، وذلك بحسب ما إذا كانت مرتفعة للغاية أو منخفضة للغاية. ومع ذلك، فإن أعلى قيمة وأدنى قيمة في العينة ليستا دائمًا قيمًا متطرفة، لأنهما قد لا تكونان بعيدتين بشكل غير عادي عن القيم الأخرى.

قد يكون التفسير الساذج للإحصاءات المستمدة من مجموعات بيانات تتضمن قيمًا متطرفة مضللًا. على سبيل المثال، إذا تم حساب متوسط ​​درجة حرارة 10 أجسام في غرفة، وكانت درجة حرارة تسعة منها تتراوح بين 20 و25 درجة مئوية ، بينما تبلغ درجة حرارة فرن 175  درجة مئوية، فإن الوسيط سيكون بين 20 و25  درجة مئوية، بينما سيكون المتوسط ​​بين 35.5 و40  درجة مئوية. في هذه الحالة، يعكس الوسيط درجة حرارة الجسم المأخوذ عشوائيًا (وليس درجة حرارة الغرفة) بشكل أفضل من المتوسط؛ لذا فإن تفسير المتوسط ​​على أنه "عينة نموذجية"، أي ما يعادل الوسيط، هو تفسير خاطئ. وكما هو موضح في هذه الحالة، قد تشير القيم المتطرفة إلى نقاط بيانات تنتمي إلى مجتمع إحصائي مختلف عن بقية مجموعة العينة .

يُقال إن المقدرات القادرة على التعامل مع القيم المتطرفة قوية: فالوسيط هو إحصائية قوية للنزعة المركزية ، بينما المتوسط ​​ليس كذلك. [ 5 ]

الحدوث والأسباب

الاحتمالات النسبية في التوزيع الطبيعي

في حالة البيانات الموزعة توزيعًا طبيعيًا ، تعني قاعدة الثلاثة سيجما أن ما يقارب 1 من كل 22 مشاهدة سيختلف بمقدار ضعف الانحراف المعياري أو أكثر عن المتوسط، وأن 1 من كل 370 مشاهدة سينحرف بمقدار ثلاثة أضعاف الانحراف المعياري. [ 6 ] في عينة مكونة من 1000 مشاهدة، يُعد وجود ما يصل إلى خمس مشاهدات تنحرف عن المتوسط ​​بأكثر من ثلاثة أضعاف الانحراف المعياري ضمن النطاق المتوقع، حيث يقل عن ضعف العدد المتوقع، وبالتالي يقع ضمن انحراف معياري واحد عن العدد المتوقع - انظر توزيع بواسون - ولا يشير إلى شذوذ. أما إذا كان حجم العينة 100 فقط، فإن وجود ثلاث مشاهدات شاذة فقط يُعد سببًا للقلق، حيث يزيد عن 11 ضعف العدد المتوقع.

بشكل عام، إذا كانت طبيعة توزيع المجتمع معروفة مسبقًا ، فمن الممكن اختبار ما إذا كان عدد القيم الشاذة ينحرف بشكل كبير عما هو متوقع: بالنسبة لقيمة قطع معينة (بحيث تقع العينات خارج قيمة القطع باحتمالية p ) لتوزيع معين، فإن عدد القيم الشاذة سيتبع توزيعًا ثنائي الحدين بمعامل p ، والذي يمكن تقريبه بشكل عام بتوزيع بواسون بمعامل λ = pn . وبالتالي، إذا أخذنا توزيعًا طبيعيًا بقيمة قطع تساوي 3 انحرافات معيارية عن المتوسط، فإن p تساوي تقريبًا 0.3%، وبالتالي، بالنسبة لـ 1000 تجربة، يمكن تقريب عدد العينات التي يتجاوز انحرافها 3 سيجما بتوزيع بواسون بمعامل λ = 3.

الأسباب

قد يكون للقيم الشاذة أسبابٌ شاذةٌ عديدة. فقد يكون جهاز القياس قد تعرض لعطلٍ مؤقت. أو ربما حدث خطأٌ في نقل البيانات أو نسخها. وتنشأ القيم الشاذة نتيجةً لتغيراتٍ في سلوك النظام، أو سلوكٍ احتيالي، أو خطأٍ بشري، أو خللٍ في الجهاز، أو ببساطةٍ نتيجةً لانحرافاتٍ طبيعيةٍ في المجتمعات. وقد تكون العينة ملوثةً بعناصر من خارج المجتمع قيد الدراسة. أو قد تكون القيمة الشاذة ناتجةً عن خللٍ في النظرية المفترضة، مما يستدعي مزيدًا من البحث من قِبل الباحث. إضافةً إلى ذلك، يظهر نمطٌ مرضيٌ للقيم الشاذة في مجموعةٍ متنوعةٍ من مجموعات البيانات، مما يشير إلى أن الآلية المسببة للبيانات قد تختلف عند الطرف المتطرف ( تأثير كينغ ).

التعريفات والكشف

لا يوجد تعريف رياضي دقيق لما يشكل قيمة شاذة؛ فتحديد ما إذا كانت الملاحظة قيمة شاذة أم لا هو في النهاية عملية ذاتية. [ 7 ]

توجد طرق متنوعة للكشف عن القيم الشاذة، بعضها يُعتبر مرادفًا للكشف عن الحالات الجديدة. [ 3 ] [ 8 ] [ 9 ] [ 10 ] [ 11 ] بعضها رسومي، مثل مخططات الاحتمالية الطبيعية . وبعضها الآخر يعتمد على النماذج. أما مخططات الصندوق فهي مزيج بين الطريقتين.

تعتمد الأساليب القائمة على النماذج، والتي تُستخدم عادةً في عملية التحديد، على افتراض أن البيانات تتبع التوزيع الطبيعي، وتحدد الملاحظات التي تُعتبر "غير محتملة" بناءً على المتوسط ​​والانحراف المعياري:

معيار بيرس

يُقترح تحديد ذلك في سلسلة منم{\displaystyle m}تُحدد الملاحظات حد الخطأ، الذي يمكن بعده رفض جميع الملاحظات التي تنطوي على هذا القدر الكبير من الخطأ، شريطة أن يكون هناك عدد كافٍ منها.ن{\displaystyle n}مثل هذه الملاحظات. ويتمثل المبدأ الذي يُقترح على أساسه حل هذه المشكلة في رفض الملاحظات المقترحة عندما يكون احتمال نظام الأخطاء الناتج عن الاحتفاظ بها أقل من احتمال نظام الأخطاء الناتج عن رفضها مضروبًا في احتمال إجراء هذا العدد من الملاحظات الشاذة، لا أكثر. (مقتبس من الملاحظة التحريرية في الصفحة 516 من كتاب بيرس (طبعة 1982) من كتاب " دليل علم الفلك 2: 558" لشوفينيه.) [ 13 ] [ 14 ] [ 15 ] [ 16 ]

أسوار توكي

تُشير طرق أخرى إلى الملاحظات بناءً على مقاييس مثل المدى الربيعي . على سبيل المثال، إذاسؤال1{\displaystyle Q_{1}}وسؤال3{\displaystyle Q_{3}}إذا كانت القيمتان تمثلان الربعين الأدنى والأعلى على التوالي، فيمكن تعريف القيمة الشاذة بأنها أي قيمة خارج النطاق:

[سؤال1-ك(سؤال3-سؤال1)،سؤال3+ك(سؤال3-سؤال1)]{\displaystyle {\big [}Q_{1}-k(Q_{3}-Q_{1}),Q_{3}+k(Q_{3}-Q_{1}){\big ]}}

لبعض الثوابت غير السالبةك{\displaystyle k}اقترح جون توكي هذا الاختبار، حيثك=1.5{\displaystyle k=1.5}يشير إلى "قيمة شاذة"، وك=3{\displaystyle k=3}يشير إلى بيانات "بعيدة عن الواقع". [ 17 ]

في مجال الكشف عن الحالات الشاذة

في مجالات متنوعة ، كالإحصاء ومعالجة الإشارات والتمويل والاقتصاد القياسي والتصنيع والشبكات واستخراج البيانات ، قد تتخذ مهمة كشف الشذوذ مناهج مختلفة. بعض هذه المناهج يعتمد على المسافة [ 18 ] [ 19 ] ، وبعضها الآخر يعتمد على الكثافة، مثل عامل الشذوذ المحلي ( LOF ) [ 20 ] . وقد تستخدم بعض المناهج المسافة إلى أقرب k جار لتصنيف الملاحظات كقيم شاذة أو غير شاذة [ 21 ] .

اختبار تاو المعدل لثومبسون

اختبار تومسون تاو المُعدَّل هو طريقة تُستخدم لتحديد ما إذا كانت هناك قيمة شاذة في مجموعة بيانات. [ 22 ] تكمن قوة هذه الطريقة في أنها تأخذ في الاعتبار الانحراف المعياري ومتوسط ​​مجموعة البيانات، وتُحدد منطقة رفض إحصائيًا؛ مما يوفر طريقة موضوعية لتحديد ما إذا كانت نقطة بيانات ما قيمة شاذة. [ 23 ] آلية العمل: أولًا، يُحدد متوسط ​​مجموعة البيانات. ثانيًا، يُحدد الانحراف المطلق بين كل نقطة بيانات والمتوسط. ثالثًا، تُحدد منطقة الرفض باستخدام الصيغة التالية:

منطقة الرفض=تα/2(ن-1)نن-2+تα/22{\displaystyle {\text{Rejection Region}}{=}{\frac {{t_{\alpha /2}}{\left(n-1\right)}}{{\sqrt {n}}{\sqrt {n-2+{t_{\alpha /2}^{2}}}}}}}؛

أينتα/2{\displaystyle \scriptstyle {t_{\alpha /2}}}القيمة الحرجة هي القيمة الحرجة لتوزيع t للطالب بدرجات حرية n - 2، حيث n هو حجم العينة، وs هو الانحراف المعياري للعينة. لتحديد ما إذا كانت القيمة شاذة: احسبدلتا=|(X-مهـأن(X))/s|{\displaystyle \scriptstyle \delta =|(X-mean(X))/s|}إذا كانت قيمة δ أكبر من منطقة الرفض، فإن نقطة البيانات تُعتبر قيمة شاذة. أما إذا كانت قيمة δ أصغر من أو تساوي منطقة الرفض، فإن نقطة البيانات لا تُعتبر قيمة شاذة.

يُستخدم اختبار تومسون تاو المُعدَّل للكشف عن قيمة شاذة واحدة في كل مرة (تُحذف أكبر قيمة لـ δ إذا كانت قيمة شاذة). بمعنى آخر، إذا وُجدت نقطة بيانات شاذة، تُحذف من مجموعة البيانات، ويُعاد تطبيق الاختبار بمتوسط ​​جديد ومنطقة رفض جديدة. تستمر هذه العملية حتى لا تبقى أي قيم شاذة في مجموعة البيانات.

تناولت بعض الدراسات أيضًا القيم الشاذة للبيانات الاسمية (أو الفئوية). وفي سياق مجموعة من الأمثلة (أو الحالات) في مجموعة بيانات، يقيس مدى صعوبة الحالة احتمال تصنيف حالة ما بشكل خاطئ.1-ص(y|x){\displaystyle 1-p(y|x)}حيث يمثل y تصنيف الفئة المعين، ويمثل x قيمة سمة الإدخال لمثال في مجموعة التدريب t ). [ 24 ] من الناحية المثالية، يتم حساب صعوبة المثال عن طريق جمع جميع الفرضيات الممكنة H :

أناح(x،y)=ح(1-ص(y،x،ح))ص(ح|ت)=حص(ح|ت)-ص(y،x،ح)ص(ح|ت)=1-حص(y،x،ح)ص(ح|ت).{\displaystyle {\begin{aligned}IH(\langle x,y\rangle )&=\sum _{H}(1-p(y,x,h))p(h|t)\\&=\sum _{H}p(h|t)-p(y,x,h)p(h|t)\\&=1-\sum _{H}p(y,x,h)p(h|t).\end{aligned}}}

من الناحية العملية، هذه الصيغة غير قابلة للتطبيق لأن H قد تكون لانهائية، والحساباتص(ح|ت){\displaystyle p(h|t)}غير معروف بالنسبة للعديد من الخوارزميات. وبالتالي، يمكن تقريب صعوبة الحالة باستخدام مجموعة فرعية متنوعةلح{\displaystyle L\subset H}:

أناحل(x،y)=1-1|ل|ج=1|ل|ص(y|x،زج(ت،α)){\displaystyle IH_{L}(\langle x,y\rangle )=1-{\frac {1}{|L|}}\sum _{j=1}^{|L|}p(y|x,g_{j}(t,\alpha ))}

أينزج(ت،α){\displaystyle g_{j}(t,\alpha )}هي الفرضية التي تم التوصل إليها بواسطة خوارزمية التعلمزج{\displaystyle g_{j}}تم تدريبها على مجموعة التدريب t باستخدام المعلمات الفائقةα{\displaystyle \alpha }توفر صلابة الحالة قيمة متصلة لتحديد ما إذا كانت الحالة حالة شاذة.

العمل مع الحالات الشاذة

يعتمد اختيار طريقة التعامل مع القيم الشاذة على سببها. بعض المقدرات حساسة للغاية للقيم الشاذة، ولا سيما تقدير مصفوفات التغاير .

حفظ

حتى عندما يكون نموذج التوزيع الطبيعي مناسبًا للبيانات قيد التحليل، فمن المتوقع وجود قيم متطرفة في العينات الكبيرة، ولا ينبغي استبعادها تلقائيًا في هذه الحالة. [ 25 ] بدلًا من ذلك، ينبغي استخدام طريقة قوية في التعامل مع القيم المتطرفة لنمذجة أو تحليل البيانات التي تحتوي على قيم متطرفة طبيعية. [ 25 ]

الاستبعاد

عند اتخاذ قرار بشأن إزالة قيمة شاذة، يجب مراعاة السبب. وكما ذُكر سابقًا، إذا كان من الممكن عزو أصل القيمة الشاذة إلى خطأ تجريبي، أو إذا أمكن تحديد أن نقطة البيانات الشاذة خاطئة، يُنصح عمومًا بإزالتها. [ 25 ] [ 26 ] ومع ذلك، يُفضّل تصحيح القيمة الخاطئة، إن أمكن.

من ناحية أخرى، يُعدّ حذف نقطة بيانات لمجرد كونها شاذة ممارسةً مثيرةً للجدل، وغالبًا ما يرفضها العديد من العلماء ومدرّسي العلوم، لأنها تُبطل النتائج الإحصائية في أغلب الأحيان. [ 25 ] [ 26 ] في حين أن المعايير الرياضية تُوفّر طريقةً موضوعيةً وكميةً لرفض البيانات، إلا أنها لا تجعل هذه الممارسة أكثر سلامةً من الناحية العلمية أو المنهجية، خاصةً في المجموعات الصغيرة أو عندما لا يُمكن افتراض التوزيع الطبيعي. يُعدّ رفض القيم الشاذة أكثر قبولًا في مجالات الممارسة التي يكون فيها النموذج الأساسي للعملية المقاسة والتوزيع المعتاد لخطأ القياس معروفين بدقة.

هناك طريقتان شائعتان لاستبعاد القيم الشاذة، وهما التقطيع (أو الحذف) وتعديل وينسور . يتخلص التقطيع من القيم الشاذة، بينما يستبدلها تعديل وينسور بأقرب بيانات "غير مشتبه بها". [ 27 ] قد يكون الاستبعاد أيضًا نتيجة لعملية القياس، كما في حالة عدم قدرة التجربة على قياس هذه القيم المتطرفة بشكل كامل، مما يؤدي إلى بيانات خاضعة للرقابة . [ 28 ]

في مسائل الانحدار ، قد يكون النهج البديل هو استبعاد النقاط التي تظهر درجة كبيرة من التأثير على المعاملات المقدرة فقط، باستخدام مقياس مثل مسافة كوك . [ 29 ]

إذا تم استبعاد نقطة بيانات (أو نقاط بيانات) من تحليل البيانات ، فيجب ذكر ذلك بوضوح في أي تقرير لاحق.

التوزيعات غير الطبيعية

ينبغي مراعاة احتمال أن التوزيع الأساسي للبيانات ليس توزيعًا طبيعيًا تقريبًا، أي أنه ذو " ذيول سميكة ". على سبيل المثال، عند أخذ عينة من توزيع كوشي [ 30 ] ، يزداد تباين العينة مع ازدياد حجمها، ولا يتقارب متوسط ​​العينة مع ازدياد حجمها، ومن المتوقع وجود قيم متطرفة بمعدلات أعلى بكثير مما هو عليه الحال في التوزيع الطبيعي. حتى اختلاف طفيف في سُمك الذيول قد يُحدث فرقًا كبيرًا في العدد المتوقع للقيم المتطرفة.

عدم اليقين بشأن عضوية المجموعة

تعتمد طريقة عضوية المجموعة على اعتبار عدم اليقين المقابل للقياس رقم i لمتجه عشوائي مجهول x ممثلاً بمجموعة Xi (بدلاً من دالة كثافة احتمالية). في حال عدم وجود قيم شاذة، ينبغي أن ينتمي x إلى تقاطع جميع مجموعات Xi . عند وجود قيم شاذة، قد يكون هذا التقاطع فارغًا، ولذا ينبغي تخفيف عدد صغير من مجموعات Xi ( أصغر ما يمكن) لتجنب أي تناقض. [ 31 ] يمكن تحقيق ذلك باستخدام مفهوم التقاطع المُخفف q . كما هو موضح في الشكل، يتوافق التقاطع المُخفف q مع مجموعة جميع قيم x التي تنتمي إلى جميع المجموعات باستثناء q منها. قد يُشتبه في أن المجموعات Xi التي لا تتقاطع مع التقاطع المُخفف q هي قيم شاذة.

الشكل 5. تقاطع q المريح لـ 6 مجموعات لـ q = 2 (أحمر)، q = 3 (أخضر)، q = 4 (أزرق)، q = 5 (أصفر).

نماذج بديلة

في الحالات التي يكون فيها سبب القيم الشاذة معروفاً، قد يكون من الممكن دمج هذا التأثير في بنية النموذج، على سبيل المثال باستخدام نموذج بايز هرمي ، أو نموذج خليط . [ 32 ] [ 33 ]

اختيار مقاييس المسافة

في تحليل التجميع ، يمكن للقيم المتطرفة أن تشوه النتائج بشكل كبير. ولذلك، كانت معالجة القيم المتطرفة موضوع نقاش واسع.

يعتمد تحليل التجميع بشكل كبير على مقاييس المسافة. وقد أشير إلى أن مسافة مانهاتن ، نظرًا لعدم تربيعها لقيم الفروق الكبيرة بشكل غير متناسب، من المرجح أن تتعامل مع القيم الشاذة بشكل أفضل من المسافة الإقليدية . [ 34 ]

انظر أيضاً

مراجع

  1. جروبس، إف إي (فبراير 1969). "إجراءات الكشف عن القيم الشاذة في العينات". تكنومتركس . 11 (1): 1-21 . doi : 10.1080/00401706.1969.10490657 . القيمة الشاذة، أو "القيمة المتطرفة"، هي قيمة تبدو منحرفة بشكل ملحوظ عن باقي عناصر العينة التي تظهر فيها.
  2. مادالا، جي إس ( 1992). "القيم المتطرفة" . مقدمة في الاقتصاد القياسي ( الطبعة الثانية). نيويورك: ماكميلان. ص 89. ISBN   978-0-02-374545-4. القيمة الشاذة هي ملاحظة بعيدة كل البعد عن بقية الملاحظات.
  3. 1 2 بيمينتل، إم إيه، كليفتون، دي إيه، كليفتون، إل، وتاراسينكو، إل. (2014). مراجعة لكشف الحداثة. معالجة الإشارات، 99، 215-249.
  4. ذكر جروبس (1969 ، ص 1) أن "الملاحظة الشاذة قد تكون مجرد مظهر متطرف للتباين العشوائي المتأصل في البيانات. ... من ناحية أخرى، قد تكون الملاحظة الشاذة نتيجة انحراف كبير عن الإجراء التجريبي المحدد أو خطأ في حساب أو تسجيل القيمة العددية." 
  5. ريبلي، برايان د. 2004. إحصاءات قوية. مؤرشف في 21 أكتوبر 2012 على موقع Wayback Machine.
  6. روان، دا ؛ تشين ، غوتشينغ؛ كير، إتيان (2005). ويتس، ج. (محرر). التنقيب الذكي عن البيانات: التقنيات والتطبيقات . دراسات في الذكاء الحسابي، المجلد 5. سبرينغر. ص 318. ISBN  978-3-540-26256-5.
  7. زيمك، آرثر؛ فيلموسر، بيتر (2018). "ذهابًا وإيابًا: الكشف عن القيم الشاذة بين الاستدلال الإحصائي وخوارزميات استخراج البيانات" (ملف PDF) . مراجعات وايلي متعددة التخصصات: استخراج البيانات واكتشاف المعرفة . 8 (6) e1280. doi : 10.1002/widm.1280 . ISSN 1942-4787 . S2CID 53305944. مؤرشف من الأصل (ملف PDF) بتاريخ 14 نوفمبر 2021. تم الاطلاع عليه بتاريخ 11 ديسمبر 2019 .  
  8. روسيو، ب ؛ ليروي، أ. (1996)، الانحدار القوي والكشف عن القيم الشاذة ( الطبعة الثالثة)، جون وايلي وأولاده 
  9. هودج، فيكتوريا جيه؛ أوستن، جيم (2004)، "دراسة استقصائية لمنهجيات الكشف عن القيم الشاذة"، مراجعة الذكاء الاصطناعي ، 22 (2): 85-126 ، CiteSeerX 10.1.1.109.1943 ، doi : 10.1023/B:AIRE.0000045502.10941.a9 ، S2CID 3330313  
  10. بارنيت، فيك؛ لويس، توبي (1994) [1978]، القيم المتطرفة في البيانات الإحصائية ( الطبعة الثالثة)، وايلي، ISBN  978-0-471-93094-5
  11. 1 2 زيمك، أ.؛ شوبرت، إ.؛ كريغل، هـ.-ب. (2012). "دراسة استقصائية حول الكشف غير الخاضع للإشراف عن القيم الشاذة في البيانات العددية عالية الأبعاد". التحليل الإحصائي واستخراج البيانات . 5 (5): 363-387 . doi : 10.1002/sam.11161 . S2CID 6724536 . 
  12. E178: الممارسة القياسية للتعامل مع الملاحظات الشاذة
  13. بنيامين بيرس ، "معيار رفض الملاحظات المشكوك فيها" ، المجلة الفلكية II 45 (1852) وتصويبات الورقة الأصلية .
  14. بيرس، بنيامين (مايو 1877 - مايو 1878). "حول معيار بيرس". وقائع الأكاديمية الأمريكية للفنون والعلوم . 13 : 348-351 . doi : 10.2307/25138498 . JSTOR 25138498 . 
  15. بيرس، تشارلز ساندرز (1873) [1870]. "الملحق رقم 21. حول نظرية أخطاء الملاحظة". تقرير مشرف هيئة المسح الساحلي للولايات المتحدة يوضح تقدم المسح خلال عام 1870 : 200-224 .. NOAA PDF Eprint (ينتقل إلى التقرير صفحة 200، ملفات PDF صفحة 215).
  16. بيرس، تشارلز ساندرز (1986) [1982]. "حول نظرية أخطاء الملاحظة". في كلوزيل، كريستيان جيه دبليو؛ وآخرون (محررون). كتابات تشارلز إس. بيرس: طبعة زمنية . المجلد 1872-1878 . بلومنجتون، إنديانا: مطبعة جامعة إنديانا. الصفحات 140-160 . ISBN    978-0-253-37201-7.– الملحق 21، وفقًا للملاحظة التحريرية في الصفحة 515
  17. توكي، جون دبليو (1977). تحليل البيانات الاستكشافي . أديسون-ويسلي. ISBN 978-0-201-07616-5. OCLC 3058187 . 
  18. كنور، إي إم؛ نغ، آر تي؛ توكاكوف، في. (2000). "القيم الشاذة القائمة على المسافة: الخوارزميات والتطبيقات". مجلة VLDB، المجلة الدولية لقواعد البيانات الضخمة جدًا . 8 ( 3-4 ): 237. CiteSeerX 10.1.1.43.1842 . doi : 10.1007/s007780050006 . S2CID 11707259 .  
  19. راماسوامي، س.؛ راستوجي، ر.؛ شيم، ك. (2000). خوارزميات فعالة لاستخراج القيم الشاذة من مجموعات البيانات الكبيرة . وقائع مؤتمر ACM SIGMOD الدولي لإدارة البيانات لعام 2000 - SIGMOD '00. ص 427. doi : 10.1145/342009.335437 . ISBN  1-58113-217-4.
  20. برونينغ، م.م.؛ كريغل، هـ.-ب .؛ نغ، ر.ت.؛ ساندر، ج. (2000). LOF: تحديد القيم الشاذة المحلية القائمة على الكثافة (ملف PDF) . وقائع مؤتمر ACM SIGMOD الدولي لإدارة البيانات لعام 2000. SIGMOD . الصفحات 93-104 . doi : 10.1145/335191.335388 . ISBN  1-58113-217-4أُرشف من النسخة الأصلية (PDF) بتاريخ 23 سبتمبر 2015. تم الاطلاع عليه بتاريخ 28 أغسطس 2015 .
  21. شوبرت، إي.؛ زيمك، أ.؛ كريغل، هـ. -ب. (2012). "إعادة النظر في الكشف عن القيم الشاذة المحلية: نظرة معممة على المحلية مع تطبيقات للكشف عن القيم الشاذة المكانية والفيديو والشبكية". استخراج البيانات واكتشاف المعرفة . 28 : 190-237 . doi : 10.1007/s10618-012-0300-z . S2CID 19036098 . 
  22. ويلر، دونالد ج. (11 يناير 2021). "بعض اختبارات القيم الشاذة: الجزء 2" . ملخص الجودة . تم الاسترجاع في 9 فبراير 2025 .
  23. تومسون، ر. (1985). " ملاحظة حول تقدير الاحتمال الأقصى المقيد مع نموذج بديل للقيم الشاذة ". مجلة الجمعية الإحصائية الملكية. السلسلة ب (المنهجية)، المجلد 47، العدد 1، الصفحات 53-55
  24. سميث، إم آر؛ مارتينيز، تي؛ جيرو-كاريير، سي. (2014). " تحليل على مستوى الحالة لتعقيد البيانات ". تعلم الآلة، 95(2): 225-256.
  25. 1 2 3 4 كارتش، جوليان د. (2023). "قد لا تُزال القيم المتطرفة تلقائيًا" . مجلة علم النفس التجريبي: عام . 152 (6): 1735-1753 . doi : 10.1037 / xge0001357 . hdl : 1887/4103722 . PMID 37104797. S2CID 258376426 .  
  26. 1 2 باكر، مارجان؛ ويشيرتس، جيلتي م. (2014). "إزالة القيم المتطرفة، ومجموع الدرجات، وتضخم معدل الخطأ من النوع الأول في اختبارات t للعينات المستقلة: قوة البدائل والتوصيات". الأساليب النفسية . 19 (3): 409-427 . doi : 10.1037/met0000014 . PMID 24773354 . 
  27. ويك، إدوارد ل. (2006). تحليل البيانات: مدخل إحصائي لطلاب علم النفس . دار ترانزكشن للنشر. ص 24-25 . ISBN  978-0-202-36535-0.
  28. ديكسون، دبليو جيه (يونيو 1960). "التقدير المبسط من عينات طبيعية خاضعة للرقابة" . حوليات الإحصاء الرياضي . 31 (2): 385-391 . doi : 10.1214/aoms/1177705900 .
  29. كوك، ر. دينيس (فبراير 1977). "الكشف عن الملاحظات المؤثرة في الانحدار الخطي". تكنومتركس (الجمعية الإحصائية الأمريكية) 19 (1): 15-18.
  30. وايسشتاين، إريك دبليو. توزيع كوشي. من ماث وورلد - مورد ويب من وولفرام
  31. جاولين، ل. (2010). "نهج الانتماء الاحتمالي للمجموعات في الانحدار القوي" (ملف PDF) . مجلة النظرية والتطبيق الإحصائي . 4 : 155-167 . doi : 10.1080/15598608.2010.10411978 . S2CID 16500768 . 
  32. روبرتس، إس. وتاراسينكو، إل.: 1995، شبكة تخصيص موارد احتمالية للكشف عن الحالات الجديدة. الحوسبة العصبية 6، 270-284.
  33. بيشوب، سي إم (أغسطس 1994). "الكشف عن المستجدات والتحقق من صحة الشبكة العصبية". وقائع معهد مهندسي الكهرباء والإلكترونيات - الرؤية، ومعالجة الصور، والإشارات . 141 (4): 217-222 . doi : 10.1049/ip-vis:19941330 (غير نشط في 12 يوليو 2025).{{cite journal}}: صيانة CS1: رقم التعريف الرقمي غير نشط اعتبارًا من يوليو 2025 ( رابط )
  34. مثال: موخاميدوفا، ف. وتيوكين، إ.، 2024. تحليل التعلم الآلي لتأثيرات كوفيد-19 على أنماط الهجرة. التقارير العلمية ، 14(1)، ص 29815. وقد ذكرا: "يمكن عزو هذه الميزة إلى اعتماد مسافة مانهاتن على جمع الفروق المطلقة، مما يجعلها أقل حساسية للقيم المتطرفة ويضمن معاملة جميع الأبعاد على قدم المساواة."