الإحصاءات اللامعلمية

الإحصاءات اللامعلمية هي نوع من التحليل الإحصائي يعتمد على افتراضات قليلة حول التوزيع الأساسي للبيانات المدروسة. غالبًا ما تكون هذه النماذج لا نهائية الأبعاد، على عكس الإحصاءات المعلمية التي تكون محدودة الأبعاد . [ 1 ] يمكن استخدام الإحصاءات اللامعلمية في الإحصاءات الوصفية أو الاستدلال الإحصائي . تُستخدم الاختبارات اللامعلمية عادةً عندما تكون افتراضات الاختبارات المعلمية غير محققة بشكل واضح. [ 2 ]

التعريفات

تم تعريف مصطلح "الإحصاءات غير البارامترية" بشكل غير دقيق بالطريقتين التاليتين، من بين طرق أخرى:

يشير المعنى الأول للمصطلح غير البارامتري إلى التقنيات التي لا تعتمد على بيانات تنتمي إلى أي عائلة بارامترية محددة من التوزيعات الاحتمالية. وتشمل هذه التقنيات، على سبيل المثال لا الحصر:

  • الأساليب التي لا تعتمد على التوزيع ، والتي لا تعتمد على افتراضات أن البيانات مستمدة من عائلة بارامترية معينة من التوزيعات الاحتمالية .
  • تُعرَّف الإحصاءات بأنها دالة على عينة، دون الاعتماد على معلمة .

ومن الأمثلة على ذلك إحصاءات الترتيب ، والتي تعتمد على الترتيب الترتيبي للملاحظات.

المناقشة التالية مأخوذة من كتاب كيندال "النظرية المتقدمة للإحصاء" . [ 3 ]

تتعلق الفرضيات الإحصائية بسلوك المتغيرات العشوائية القابلة للملاحظة... على سبيل المثال، الفرضية (أ) التي تنص على أن التوزيع الطبيعي له متوسط ​​وتباين محددين هي فرضية إحصائية؛ وكذلك الفرضية (ب) التي تنص على أن له متوسطًا معينًا ولكن تباينًا غير محدد؛ وكذلك الفرضية (ج) التي تنص على أن التوزيع له شكل طبيعي مع كل من المتوسط ​​والتباين غير محددين؛ وأخيرًا، كذلك الفرضية (د) التي تنص على أن توزيعين مستمرين غير محددين متطابقان.

يُلاحظ أنه في المثالين (أ) و(ب)، تم افتراض أن التوزيع الذي تستند إليه المشاهدات يتبع شكلاً معيناً (التوزيع الطبيعي)، وأن الفرضية تركز كلياً على قيمة أحد أو كلا معلَمَتيه. وتُسمى هذه الفرضية، لأسباب واضحة، بالفرضية المعلمية .

كانت الفرضية (ج) ذات طبيعة مختلفة، إذ لم تُحدد قيم المعلمات في نصها؛ ويمكننا أن نُطلق عليها اسم الفرضية غير المعلمية . أما الفرضية (د) فهي أيضاً غير معلمية، ولكنها بالإضافة إلى ذلك لا تُحدد حتى الشكل الأساسي للتوزيع، ويمكن الآن تسميتها بشكل معقول بالفرضية غير المعتمدة على التوزيع . وعلى الرغم من هذه الفروقات، فإن الأدبيات الإحصائية تُطبق الآن بشكل شائع مصطلح "غير معلمي" على إجراءات الاختبار التي وصفناها للتو بأنها "غير معتمدة على التوزيع"، مما يُفقدنا تصنيفاً مفيداً.

المعنى الثاني للمصطلح "غير البارامتري" يشمل تقنيات لا تفترض ثبات بنية النموذج. عادةً ما يتوسع حجم النموذج ليتناسب مع تعقيد البيانات. في هذه التقنيات، يُفترض عادةً أن المتغيرات الفردية تنتمي إلى توزيعات بارامترية، كما تُوضع افتراضات حول أنواع العلاقات بين المتغيرات. تشمل هذه التقنيات، على سبيل المثال لا الحصر:

  • الانحدار غير البارامتري ، وهو نمذجة يتم فيها التعامل مع بنية العلاقة بين المتغيرات بشكل غير بارامتري، ولكن مع ذلك قد تكون هناك افتراضات بارامترية حول توزيع بقايا النموذج.
  • النماذج البايزية الهرمية غير البارامترية ، مثل النماذج القائمة على عملية ديريشليت ، والتي تسمح لعدد المتغيرات الكامنة بالنمو حسب الضرورة لتناسب البيانات، ولكن حيث لا تزال المتغيرات الفردية تتبع التوزيعات البارامترية وحتى العملية التي تتحكم في معدل نمو المتغيرات الكامنة تتبع توزيعًا بارامتريًا.

التطبيقات والغرض

تُستخدم الأساليب غير البارامترية على نطاق واسع لدراسة المجتمعات التي لها ترتيب تصنيفي (مثل تقييمات الأفلام التي تتراوح بين نجمة واحدة وخمس نجوم). وقد يكون استخدام هذه الأساليب ضروريًا عندما تكون البيانات مُرتبة ولكن ليس لها تفسير رقمي واضح ، كما هو الحال عند تقييم التفضيلات . ومن حيث مستويات القياس ، تُنتج الأساليب غير البارامترية بيانات ترتيبية .

نظراً لأن الأساليب غير البارامترية تعتمد على افتراضات أقل، فإن نطاق تطبيقها أوسع بكثير من نطاق تطبيق الأساليب البارامترية المقابلة. وعلى وجه الخصوص، يمكن تطبيقها في الحالات التي تكون فيها المعلومات المتوفرة عن التطبيق قيد الدراسة قليلة. كما أن الأساليب غير البارامترية، نظراً لاعتمادها على افتراضات أقل، تتميز بمتانتها .

تُعتبر الطرق غير البارامترية أحيانًا أسهل استخدامًا وأكثر موثوقية من الطرق البارامترية، حتى عندما تكون افتراضات الطرق البارامترية صحيحة. ويعود ذلك إلى طبيعتها الأكثر عمومية، مما يجعلها أقل عرضة لسوء الاستخدام وسوء الفهم. ويمكن اعتبار الطرق غير البارامترية خيارًا متحفظًا، إذ أنها فعّالة حتى في حال عدم تحقق افتراضاتها، بينما قد تُنتج الطرق البارامترية نتائج مُضللة عند انتهاك افتراضاتها.

إنّ اتساع نطاق تطبيق الاختبارات اللامعلمية وزيادة متانتها يأتيان بتكلفة: ففي الحالات التي تتحقق فيها افتراضات الاختبار المعلمي، تقلّ القوة الإحصائية للاختبارات اللامعلمية . بعبارة أخرى، قد يتطلب الأمر حجم عينة أكبر للوصول إلى استنتاجات بنفس درجة الثقة.

النماذج غير البارامترية

تختلف النماذج غير البارامترية عن النماذج البارامترية في أن بنية النموذج لا تُحدد مسبقًا، بل تُحدد بناءً على البيانات. ولا يُقصد بمصطلح "غير بارامتري" أن هذه النماذج تفتقر تمامًا إلى المعلمات، بل إن عدد المعلمات وطبيعتها مرنان وغير ثابتين مسبقًا.

الاختبارات غير المعلمية

الأساليب الإحصائية الاستدلالية غير المعلمية (أو غير المعتمدة على التوزيع ) هي إجراءات رياضية لاختبار الفرضيات الإحصائية، والتي، على عكس الإحصاءات المعلمية ، لا تفترض أي شيء عن التوزيعات الاحتمالية للمتغيرات التي يتم تقييمها. وتشمل الاختبارات الأكثر استخدامًا ما يلي:

الإحصاء الرياضي

في الإحصاء الرياضي ، تُعتبر النماذج غير المعلمية نماذج لا تعتمد على افتراض معلمي لتوزيع البيانات المجهولة (في مسائل تقدير الكثافة ) أو لدالة الانحدار (في مسائل الانحدار ). بينما يتمثل هدف أي نموذج معلمي في تقدير عدد محدود من المعلمات.θ1،...،θصR{\displaystyle \theta _{1},\dots ,\theta _{p}\in \mathbb {R} }تهدف النماذج غير البارامترية إلى تقدير دالة توزيع/انحدار البيانات بشكل مباشر. [ 5 ] [ 6 ]

أما بالنسبة للتحليل الرياضي، فإن الأساليب البارامترية وغير البارامترية تندرج ضمن نفس الإطار: بافتراض أن الدالة المراد تقديرها (توزيع البيانات أو دالة الانحدار) تنتمي إلى مجموعة من الدوال التي تم تحديدها بواسطة مجموعةΘ{\displaystyle \Theta }يبحث المرء عن دالة (قابلة للقياس)تين:XنΘ{\displaystyle T_{n}:{\mathcal {X}}^{n}\to \Theta }التي تُقدّر المعلمة "الحقيقية" بناءً على نقاط البياناتx1،...،xنX{\displaystyle x_{1},\dots ,x_{n}\in {\mathcal {X}}}الفرق الرئيسي بين الأساليب البارامترية وغير البارامترية هو أن الأولΘRد{\displaystyle \Theta \subset \mathbb {R} ^{d}}بالنسبة للبعضدشمال{\displaystyle d\in \mathbb {N} }بينما في الأخيرΘ{\displaystyle \Theta }عادة ما تكون مجموعة الدوال المستهدفة الممكنة نفسها، على سبيل المثال، مجموعة الدوال المتصلة أو الدوال القابلة للتفاضل .

تتعلق الأسئلة ذات الصلة في هذا المجال ببناء مقدرات معقولة، والاتساق ، ومعدلات التقارب وأمثليتها، والتقدير التكيفي. [ 7 ]

تناسق

كما هو الحال في الإحصاءات البارامترية ، وهي خاصية مرغوبة للمُقدِّرون^{\displaystyle {\hat {f_{n}}}}وهي أنها تتقارب مع الدالة المستهدفةو{\displaystyle f}حجم العينةن{\displaystyle n}يؤول إلى اللانهاية، أي أن خطأ التقريب يتقارب إلى الصفر. عادةً ما يُقاس التقريب بدلالةL2{\displaystyle L^{2}}المسافة المعيارية بينون^{\displaystyle {\hat {f_{n}}}}وو{\displaystyle f}بما أن المُقدِّر هو دالة للبيانات المسحوبة عشوائياًX=(X1،...،Xن){\displaystyle X=(X_{1},\dots ,X_{n})}، والتقريب هو متغير عشوائي أيضًا، ولذلك نميز بين نمطين مختلفين من التقارب:

اتساق ضعيف:ليمنهـ[ون^(X)-وL22]=0{\displaystyle \lim _{n\to \infty }\mathbb {E} [\lVert {\hat {f_{n}}}(X)-f\rVert _{L^{2}}^{2}]=0}.

اتساق قوي:ليمنون^(X)-وL22=0{\displaystyle \lim _{n\to \infty }\lVert {\hat {f_{n}}}(X)-f\rVert _{L^{2}}^{2}=0}من شبه المؤكد .

إذا كان المُقدِّر متسقًا لجميع الدوال القابلة للتكامل التربيعيو{\displaystyle f}ثم يُطلق عليه اسم متسق عالميًا . [ 8 ]

تتميز العديد من المقدرات غير البارامترية الشائعة باتساق عالمي ضعيف في ظل اختيار مناسب للمعلمات الفائقة للنموذج، على سبيل المثال، مقدر ناداريا-واتسون ، و kNNs وبعض المقدرات متعددة الحدود المحلية . [ 9 ]

معدلات التقارب المثلى لـ Minimax

يُعدّ معدل تقارب المقدرات غير المعلمية نحو دالة الهدف الحقيقية موضوعًا محوريًا في التحليل الإحصائي لها.و{\displaystyle f}وما إذا كانت السرعة مثالية، أي ما إذا كان التقارب بأسرع ما يمكن. الطريقة الأكثر شيوعًا لقياس سرعة تقارب المُقدِّر هي معدل التقارب الأدنى الأقصى ، الذي يأخذ في الاعتبار الخسارة المتوقعة للمُقدِّر في أسوأ سيناريو. في ظل افتراضات معينة حول سلاسةو{\displaystyle f}، يمكن للمرء أن يثبت أن هناك معدلات تقارب دنيا لا يمكن لأي مقدر أن يتجاوزها، وبالتالي فإن أي مقدر يحقق هذا المعدل الأدنى يسمى الأمثل.

رياضياً، الدالة المستهدفةو{\displaystyle f}يُفترض أن تنتمي إلى فئة معينة من الدوالح{\displaystyle {\mathcal {H}}}، والتي تسمى فئة الفرضية ، والتي تؤدي إلى توزيعPو{\displaystyle \mathbb {P} _{f}}علىX{\displaystyle {\mathcal {X}}}وجودة تقريب المُقدِّرون^:Xنح{\displaystyle {\hat {f_{n}}}:{\mathcal {X}}^{n}\to {\mathcal {H}}}يتم قياسه بواسطة دالة ماL:ح×ح[0،){\displaystyle L:{\mathcal {H}}\times {\mathcal {H}}\to [0,\infty )}معدل تقارب المينيماكس لـون^{\displaystyle {\hat {f_{n}}}}هو تسلسل(ψن)نشمال{\displaystyle (\psi _{n})_{n\in \mathbb {N} }}من الأعداد الحقيقية التي تنطبق عليها هذه الخاصيةليم سوبن1ψنرشفةوحهـو[L(و،ون^(X1،...،Xن))]<،الحد الأقصى غير محدودن1ψنرشفةوحهـو[L(و،ون^(X1،...،Xن))]>0،\begin{aligned}\limsup _{n\to \infty }{\frac {1}{\psi _{n}}}\sup _{f\in {\mathcal {H}}}\mathbb {E} _{f}{\big [}L{\big (}f,{\hat {f_{n}}}(X_{1},\dots ,X_{n}){\big )}{\big ]}&<\infty ,\\\liminf _{n\to \infty }{\frac {1}{\psi _{n}}}\sup _{f\in {\mathcal {H}}}\mathbb {E} _{f}{\big [}L{\big (}f,{\hat {f_{n}}}(X_{1},\dots ,X_{n}){\big )}{\big ]}&>0,\end{aligned}}}أينهـو[]{\displaystyle \mathbb {E} _{f}[\cdot ]}يشير ذلك إلى أن المتغيرات العشوائيةX1،...،Xن{\displaystyle X_{1},\dots ,X_{n}}، والتي ترسم نقاط البيانات، لها توزيعPو{\displaystyle \mathbb {P} _{f}}.

حد أدنى عالمي للتقدير لفئة الفرضياتح{\displaystyle {\mathcal {H}}}هو تسلسل(ψن)نشمال{\displaystyle (\psi _{n})_{n\in \mathbb {N} }}والتي تحملهاليم سوبن1ψنمعلوماتρن^رشفةوحهـو[L(و،ρ^ن(X1،...،Xن))]<،الحد الأقصى غير محدودن1ψنمعلوماتρن^رشفةوحهـو[L(و،ρ^ن(X1،...،Xن))]>0،{\displaystyle {\begin{aligned}\limsup _{n\to \infty }{\frac {1}{\psi _{n}}}\inf _{\hat {\rho _{n}}}\sup _{f\in {\mathcal {H}}}\mathbb {E} _{f}{\big [}L{\big (}f,{\hat {\rho }}_{n}(X_{1},\dots ,X_{n}){\big )}{\big ]}&<\infty ,\\\liminf _{n\to \infty }{\frac {1}{\psi _{n}}}\inf _{\hat {\rho _{n}}}\sup _{f\in {\mathcal {H}}}\mathbb {E} _{f}{\big [}L{\big (}f,{\hat {\rho }}_{n}(X_{1},\dots ,X_{n}){\big )}{\big ]}&>0,\end{aligned}}}حيث يتم أخذ القيم الدنيا على جميع المقدرات الممكنةρ^ن{\displaystyle {\hat {\rho }}_{n}}(أي الدوال القابلة للقياس ) بناءً علىن{\displaystyle n}ملاحظات.

ثم ينقسم التحليل المفصل للمقدرات غير البارامترية إلى تقدير كثافات الاحتمال ووظائف الانحدار.

تقدير الكثافة

تتضمن عملية تقدير الكثافة عادةً فضاءً معياريًا من الدوال(F،){\displaystyle ({\mathcal {F}},\lVert \cdot \rVert )}، مجموعة فرعية من دوال الكثافةح={وF:و0،Xو(x)دx=1،و1}{\displaystyle {\mathcal {H}}=\{f\in {\mathcal {F}}:f\geq 0,\int _{\mathcal {X}}f(x)dx=1,\lVert f\rVert \leq 1\}}والمتغيرات العشوائية المستقلةX1،...،XنXRد{\displaystyle X_{1},\dots ,X_{n}\in {\mathcal {X}}\subset \mathbb {R} ^{d}}موزعة وفقًا للمقياس ذي الكثافةوح{\displaystyle f\in {\mathcal {H}}}، والتي تُنتج البيانات.

تُعرف الحدود الدنيا لـ Minimax لأزواج مختلفة من فئات الدوالF{\displaystyle {\mathcal {F}}}ومقاييس المقارنةL{\displaystyle L}الخيارات الشائعة لـF{\displaystyle {\mathcal {F}}}نكون:

  • F=جα(X)،α>0{\displaystyle {\mathcal {F}}=C^{\alpha }({\mathcal {X}}),\alpha >0}مساحةα{\displaystyle \lfloor \alpha \rfloor }الدوال القابلة للتفاضل مرات عديدة والتي يكون أعلى مشتق لها هو(α-α){\displaystyle (\alpha -\lfloor \alpha \rfloor )}- هولدر - ناعم.
  • F=حs(X)=دبليوs،2(X)،s>0{\displaystyle {\mathcal {F}}=H^{s}({\mathcal {X}})=W^{s,2}({\mathcal {X}}),s>0}: فضاء الدوال السلسة من نوع سوبوليف ذات المشتقات الضعيفة القابلة للتكامل التربيعي .
  • F=بص،qs(X)،s>0،ص،q(0،]{\displaystyle {\mathcal {F}}=B_{p,q}^{s}({\mathcal {X}}),s>0,p,q\in (0,\infty ]}: فضاء الدوال السلسة من نوع بيسوف .

في الواقع، تُعد فضاءات هولدر وفضاءات سوبوليف حالات خاصة من بعض فضاءات بيسوف، وهي:جα(X)=ب،α(X){\displaystyle C^{\alpha }({\mathcal {X}})=B_{\infty ,\infty }^{\alpha }({\mathcal {X}})}لαZ{\displaystyle \alpha \notin \mathbb {Z} }وحs(X)=ب2،2s(X){\displaystyle H^{s}({\mathcal {X}})=B_{2,2}^{s}({\mathcal {X}})}[ 10 ] وبالتالي ، غالبًا ما يكفي اشتقاق الحدود الدنيا في ظل افتراضات بيسوف-السلاسة.

الخيارات الشائعة لـL{\displaystyle L}نكون:

  • L(و،ز)=(و(x0)-ز(x0))2،x0X{\displaystyle L(f,g)=(f(x_{0})-g(x_{0}))^{2},x_{0}\in {\mathcal {X}}}: الخطأ التربيعي النقطي (MSE).
  • L(و،ز)=و-زL2(X)2{\displaystyle L(f,g)=\lVert f-g\rVert _{L^{2}({\mathcal {X}})}^{2}}: متوسط ​​الخطأ التربيعي المتكامل (MISE).
  • L(و،ز)=و-زL(X){\displaystyle L(f,g)=\lVert f-g\rVert _{L^{\infty }({\mathcal {X}})}}: المسافة المعيارية العليا .
  • L(و،ز)=كL(PوPز){\displaystyle L(f,g)=\mathrm {KL} (\mathbb {P} _{f}\lVert \mathbb {P} _{g})}: تباعد كولباك-لايبير للتوزيعات الناتج عنو{\displaystyle f}وز{\displaystyle g}.
  • L(و،ز)=تيV(Pو،Pز){\displaystyle L(f,g)=\mathrm {TV} (\mathbb {P} _{f},\mathbb {P} _{g})}: إجمالي مسافة التباين للتوزيعات الناتجة عنو{\displaystyle f}وز{\displaystyle g}.
  • L(و،ز)=دبليوβ(Pو،Pز)،β1{\displaystyle L(f,g)=W_{\beta }(\mathbb {P} _{f},\mathbb {P} _{g}),\beta \geq 1}TheWasserstein-β{\displaystyle \beta }مسافة التوزيعات الناتجة عنو{\displaystyle f}وز{\displaystyle g}.

بحسب نظرية شيفيه، فإن مسافة التباين الكليةتيV(Pو،Pز){\displaystyle \mathrm {TV} (\mathbb {P} _{f},\mathbb {P} _{g})}يعادلL1{\displaystyle L^{1}}-مسافةو{\displaystyle f}وز{\displaystyle g}.

فئة النعومةو-زL2(X)2{\displaystyle \lVert f-g\rVert _{L^{2}({\mathcal {X}})}^{2}}دبليوβ(Pو،Pز){\displaystyle W_{\beta }(\mathbb {P} _{f},\mathbb {P} _{g})}تيV(Pو،Pز){\displaystyle \mathrm {TV} (\mathbb {P} _{f},\mathbb {P} _{g})}كL(PوPز){\displaystyle \mathrm {KL} (\mathbb {P} _{f}\lVert \mathbb {P} _{g})}
بص،qs(X){\displaystyle B_{p,q}^{s}({\mathcal {X}})}ن-2s2s+د{\displaystyle n^{-{\frac {2s}{2s+d}}}}[ 11 ](ص،q1،s>د/q){\displaystyle (p,q\geq 1,\,s>d/q)}ن-s+12s+د{\displaystyle n^{-{\frac {s+1}{2s+d}}}}[ 12 ]ن-s2s+د{\displaystyle n^{-{\frac {s}{2s+d}}}}[ 11 ]ن-2s2s+د{\displaystyle n^{-{\frac {2s}{2s+d}}}}
L2(R)ج(R){\displaystyle L^{2}(\mathbb {R} )\cap C^{\infty }(\mathbb {R} )}ن-1{\displaystyle n^{-1}}[ 13 ]---

يُقارن الحد الأدنى لمتوسط ​​مربع الخطأ (MISE) أحيانًا بحد كرامر-راو من الإحصاءات البارامترية، وهو حد أدنى لمتوسط ​​مربع الخطأ للمُقدِّرات غير المتحيزة المنتظمة لمعلمة ما.θ{\displaystyle \theta }:رشفةθΘهـ[θ-θ^ن2]ن-1رشفةθΘتر(أنا(θ)-1)=جoنsت.،رشفةوبص،qs(X)هـ[و-ون^L2(X)2]جن-2s/(2s+د)،{\displaystyle {\begin{aligned}\sup _{\theta \in \Theta }\mathbb {E} &[\lVert \theta -{\hat {\theta }}_{n}\rVert ^{2}]\geq n^{-1}\underbrace {\sup _{\theta \in \Theta }\mathrm {tr} (I(\theta )^{-1})} _{=const.},\\\sup _{f\in B_{p,q}^{s}({\mathcal {X}})}\mathbb {E} &[\lVert f-{\hat {f_{n}}}\rVert _{L^{2}({\mathcal {X}})}^{2}]\geq cn^{-2s/(2s+d)},\end{aligned}}}أينأنا(θ){\displaystyle I(\theta )}هي معلومات فيشر للنموذج البارامتري وج>0{\displaystyle c>0}هو ثابت ما. وبالتالي، فإن المعدل غير البارامتري أبطأ من المعدل البارامتري.ن-1{\displaystyle n^{-1}}، خاصة في الأبعاد الكبيرة، ويقترب من المعدل البارامتري عندما تميل نعومة الكثافة إلى اللانهاية.

على سبيل المثال، تحقق مُقدِّرات كثافة النواة الحد الأدنى فيما يتعلق بمتوسط ​​الخطأ التربيعي المتكامل (MISE) في ظل فئة فرضية سوبوليف عند اختيار عرض نطاق مناسب، وبالتالي فهي مثالية من حيث المينيماكس. [ 14 ] ومؤخرًا، ثبت أيضًا أن النماذج التوليدية القائمة على الدرجات تحقق معدلات تقارب من المينيماكس في التباين الكلي وفي مسافة واسرشتين-1 لـبص،qs([0،1]د){\displaystyle B_{p,q}^{s}([0,1]^{d})}التوزيعات السلسة،s>(1/ص-1/2)+{\displaystyle s>(1/p-1/2)_{+}}، والتي تكون محدودة بعيدًا عن الصفر من الأسفل. [ 15 ]

الانحدار

في سياق الانحدار ، تظهر البيانات في أزواج.(X1،Y1)،...،(Xن،Yن){\displaystyle (X_{1},Y_{1}),\dots ,(X_{n},Y_{n})}بافتراض أن البيانات مستقلة وموزعة توزيعًا متطابقًا، وهـ[|Y1|]<{\displaystyle \mathbb {E} [|Y_{1}|]<\infty }يمكن للمرء دائماً أن يكتبYأنا=و(Xأنا)+εأنا،{\displaystyle Y_{i}=f(X_{i})+\varepsilon _{i},}معو(x)=هـ[Y1|X1=x]{\displaystyle f(x)=\mathbb {E} [Y_{1}\mid X_{1}=x]}حيث تمثل دالة الانحدار المراد تقديرها ومتغير الضوضاءεأنا{\displaystyle \varepsilon _{i}}مُرضٍهـ[εأنا]=0{\displaystyle \mathbb {E} [\varepsilon _{i}]=0}وهـ[ε2]=σ2>0{\displaystyle \mathbb {E} [\varepsilon ^{2}]=\sigma ^{2}>0}عادةً، المتغيرات المستقلةXأنا{\displaystyle X_{i}}يُفترض أن لها قيمًا في مكعب الوحدة[0،1]د{\displaystyle [0,1]^{d}}وأن تكون إما نقاطًا محددة على شبكة (تصميم محدد) أو موزعة بشكل منتظم (تصميم عشوائي). وبالتالي،X=[0،1]د×R{\displaystyle {\mathcal {X}}=[0,1]^{d}\times \mathbb {R} }.

ينطبق الإعداد المذكور أعلاه على التصنيف الثنائي أيضًا. في هذه الحالة، تأخذ الملاحظات قيمتين فقط، ولتكن 0 و1، بحيثو(x)=هـ[1{Y1=1}|X=x]=P(Y1=1|X=x){\displaystyle f(x)=\mathbb {E} [\mathbb {1} _{\{Y_{1}=1\}}\mid X=x]=\mathbb {P} (Y_{1}=1\mid X=x)}وبافتراض وجود مُقدِّرون^{\displaystyle {\hat {f_{n}}}}لو{\displaystyle f}، يُفترض أن تكون المصنفات على الشكل التاليج(x)=1[1/2،1](ون^(x)){\displaystyle C(x)=\mathbb {1} _{[1/2,1]}({\hat {f_{n}}}(x))}أي أنهم يصنفون النقطة على أنها 1 إذا كانت الاحتمالية المقدرة لـY=1{\displaystyle Y=1}أكبر من1/2{\displaystyle 1/2}(و 0 فيما عدا ذلك). في الواقع، العديد من طرق التصنيف تأتي على هذا الشكل، على سبيل المثال الانحدار اللوجستي ، وتحليل التمييز الخطي ، وتحليل التمييز التربيعي ، وخوارزمية أقرب الجيران k ، وآلات المتجهات الداعمة .

ثم، بالنسبة للتحليل الإحصائي، تكون فئة الفرضية على الشكل التالي:ح={وF:و1}{\displaystyle {\mathcal {H}}=\{f\in {\mathcal {F}}:\lVert f\rVert \leq 1\}}لبعض الفضاء المعياري للدوال(F،){\displaystyle ({\mathcal {F}},\lVert \cdot \rVert )}والتوقعاتهـو{\displaystyle \mathbb {E} _{f}}يتم أخذها فيما يتعلق بالتوزيع المشترك لـX{\displaystyle X}وY{\displaystyle Y}(أو فقط)Y{\displaystyle Y}إذاXأنا{\displaystyle X_{i}}حتمية).

في الانحدار غير البارامتري ، تتطلب فئة الفرضيات بالضرورة بعض الافتراضات القوية حول دالة الانحدار، وإلا فقد يكون الحد الأدنى الأدنى للتحسين بطيئًا بشكل تعسفي. على سبيل المثال، إذاF=L([0،1]){\displaystyle {\mathcal {F}}=L^{\infty }([0,1])}أي مجموعة الدوال المحدودة ، إذن لأي مقدرون^{\displaystyle {\hat {f_{n}}}}وأي تسلسل صفري(ψن)نشمال{\displaystyle (\psi _{n})_{n\in \mathbb {N} }}، يوجدوح{\displaystyle f\in {\mathcal {H}}}بحيث [ 16 ]

ليم سوبنهـ[و-ون^L2([0،1])2]ψن1.{\displaystyle \limsup _{n\to \infty }{\frac {\mathbb {E} [\lVert f-{\hat {f_{n}}}\rVert _{L^{2}([0,1])}^{2}]}{\psi _{n}}}\geq 1.}

وبالتالي، فإن الخيارات الشائعة لـF{\displaystyle {\mathcal {F}}}نكون:

  • F=جα([0،1]د)،α>0{\displaystyle {\mathcal {F}}=C^{\alpha }([0,1]^{d}),\alpha >0}مساحةα{\displaystyle \lfloor \alpha \rfloor }الدوال القابلة للتفاضل مرات عديدة والتي يكون أعلى مشتق لها هو(α-α){\displaystyle (\alpha -\lfloor \alpha \rfloor )}- هولدر - ناعم.
  • F=دبليوك،q([0،1]د)،كشمال،q>د{\displaystyle {\mathcal {F}}=W^{k,q}([0,1]^{d}),k\in \mathbb {N} ,q>d}فضاء الدوال الملساء من نوع سوبوليف معLq{\displaystyle L^{q}}المشتقات الضعيفة القابلة للتكامل .

الخيارات الشائعة لـL{\displaystyle L}نكون:

  • L(و،ز)=(و(x0)-ز(x0))2،x0[0،1]د{\displaystyle L(f,g)=(f(x_{0})-g(x_{0}))^{2},x_{0}\in [0,1]^{d}}: الخطأ التربيعي النقطي (MSE).
  • L(و،ز)=و-زLص([0،1]د)،ص[1،){\displaystyle L(f,g)=\lVert f-g\rVert _{L^{p}([0,1]^{d})},p\in [1,\infty )}: الص{\displaystyle p}المعيار -th.
  • L(و،ز)=و-زL([0،1]د){\displaystyle L(f,g)=\lVert f-g\rVert _{L^{\infty }([0,1]^{d})}}: المسافة المعيارية العليا .

في ظل افتراضات فنية معينة، تُعرف الحدود الدنيا التالية.

فئة النعومة(و(x0)-ز(x0))2{\displaystyle (f(x_{0})-g(x_{0}))^{2}}Lص([0،1]د){\displaystyle L^{p}([0,1]^{d})}L([0،1]د){\displaystyle L^{\infty }([0,1]^{d})}
جα([0،1]د){\displaystyle C^{\alpha }([0,1]^{d})}ن-2α2α+د{\displaystyle n^{-{\frac {2\alpha }{2\alpha +d}}}}[ 17 ] (تصميم محدد)ن-α2α+د{\displaystyle n^{-{\frac {\alpha }{2\alpha +d}}}}[ 18 ] [ 19 ](سجلن/ن)α2α+د{\displaystyle (\log n/n)^{\frac {\alpha }{2\alpha +d}}}[ 20 ] [ 19 ]
دبليوك،q([0،1]د){\displaystyle W^{k,q}([0,1]^{d})}-ن-ك2ك+د{\displaystyle n^{-{\frac {k}{2k+d}}}}[ 19 ](ن/σ1){\displaystyle ({\sqrt {n}}/\sigma \geq 1)}ن-ك2ك+د{\displaystyle n^{-{\frac {k}{2k+d}}}}[ 19 ](ن/σ1){\displaystyle ({\sqrt {n}}/\sigma \geq 1)}

بعض مقدرات كثيرات الحدود المحلية هي الأمثلية الدنيا القصوى فيما يتعلق بمتوسط ​​مربع الخطأ،L2{\displaystyle L^{2}}وL{\displaystyle L^{\infty }}تحتح=جα([0،1]د){\displaystyle {\mathcal {H}}=C^{\alpha }([0,1]^{d})}لأيα>0{\displaystyle \alpha >0}عندما يكون عرض النطاق الترددي من رتبةيا(ن-12α+د){\displaystyle {\mathcal {O}}(n^{-{\frac {1}{2\alpha +d}}})}[ 21 ] تُعتبر خوارزمية أقرب الجيران (kNNs) أيضًا مثالية من حيث الحد الأدنى الأقصى لمتوسط ​​مربع الخطأ (MSE) في ظلح=ج2([0،1]د){\displaystyle {\mathcal {H}}=C^{2}([0,1]^{d})}و فيما يتعلقL2{\displaystyle L^{2}}تحتح=ج1([0،1]د){\displaystyle {\mathcal {H}}=C^{1}([0,1]^{d})}عندما يكون عدد الجيران المعتبرين من رتبةيا(ن1د+4){\displaystyle {\mathcal {O}}(n^{\frac {1}{d+4}})}ويا(ن1د+2){\displaystyle {\mathcal {O}}(n^{\frac {1}{d+2}})}على التوالي. [ 22 ]

القدرة على التكيف

يعتمد اختيار المعلمات الفائقة للنموذج (مثل عرض النطاق الترددي لطرق النواة أو عدد الجيران لـ kNN) اللازمة لتحقيق معدل التقارب الأمثل عادةً على معلمة السلاسة للدالة الهدف غير المعروفة، مما يعني أنه من الناحية العملية، بدون تقدير مناسب للمعلمات الفائقة، فإن الطرق المذكورة أعلاه ليست مثالية في الواقع .

بدلاً من ذلك، يهتم المرء بالأساليب التي تحقق معدلات التقارب المثلى الدنيا القصوى ليس فقط لمعامل سلاسة محدد، ولكن عبر قيم مختلفة. لنفترض أن فئة الفرضيات على الشكل التالي:ح=β>0حβ{\displaystyle {\mathcal {H}}=\bigcup _{\beta >0}{\mathcal {H}}_{\beta }}(على سبيل المثالحβ=جβ([0،1]د){\displaystyle {\mathcal {H}}_{\beta }=C^{\beta }([0,1]^{d})}أوحβ=حβ([0،1]د){\displaystyle {\mathcal {H}}_{\beta }=H^{\beta }([0,1]^{d})}) ودعψنβ{\displaystyle \psi _{n}^{\beta }}يكون معدل التقارب الأمثل فيحβ{\displaystyle {\mathcal {H}}_{\beta }}ثم، مجموعة من المُقدِّرات(ون^)نشمال{\displaystyle ({\hat {f_{n}}})_{n\in \mathbb {N} }}يُطلق عليه اسم التكيفي بمعنى المينيماكس ، إذا كان هناك ثابتج(β){\displaystyle C(\beta )}بالاعتماد فقط علىβ{\displaystyle \beta }بحيث [ 23 ]

رشفةوحβهـ[L(ون^،و)]ج(β)ψنβ،β>0،نشمال.{\displaystyle \sup _{f\in {\mathcal {H}}_{\beta }}\mathbb {E} [L({\hat {f_{n}}},f)]\leq C(\beta )\psi _{n}^{\beta },\quad \forall \beta >0,\quad \forall n\in \mathbb {N} .}

بمعنى آخر، يلزم وجود مُقدِّر تكيفي لتحقيق معدل التقارب الأدنى الأقصى في جميع فئات الفرضياتحβ{\displaystyle {\mathcal {H}}_{\beta }}ولكن دون أخذ المعلمة المجهولةβ{\displaystyle \beta }كحجة. غالبًا ما يتم تحقيق المقدرات التكيفية عن طريق أخذ المقدرات المثلى الدنيا القصوى لمجموعة من فئات الفرضيات وتقدير المعلمات الفائقة من خلال إجراء ذي مستوى أعلى، مثل التحقق المتبادل ، أو عن طريق عقوبة التعقيد. [ 24 ]

تاريخ

تشمل الإحصاءات اللامعلمية المبكرة الوسيط (القرن الثالث عشر أو ما قبله، استُخدم في التقدير بواسطة إدوارد رايت ، 1599؛ انظر الوسيط §  التاريخ ) واختبار الإشارة لجون أربوثنوت (1710) في تحليل نسبة الجنس عند الولادة (انظر اختبار الإشارة §  التاريخ ). [ 25 ] [ 26 ]

انظر أيضاً

ملحوظات

  1. "جميع الإحصاءات اللامعلمية" . نصوص سبرينغر في الإحصاء . 2006. doi : 10.1007/0-387-30623-4 . ISBN 978-0-387-25145-5.
  2. بيرس، ج؛ ديريك، ب (2019). "الاختبارات الأولية: هل هي شيطان الإحصاء؟" . إعادة الابتكار: مجلة دولية لأبحاث الطلاب الجامعيين . 12 (2). doi : 10.31273/reinvention.v12i2.339 .
  3. ستيوارت أ.، أورد جيه كيه، أرنولد إس. (1999)، نظرية كيندال المتقدمة للإحصاء: المجلد 2أ - الاستدلال الكلاسيكي والنموذج الخطي ، الطبعة السادسة، §20.2–20.3 ( أرنولد ).
  4. أديكارام، ك.ك.ل.ب.؛ حسين، م.أ.؛ إيفنبرغر، م.؛ بيكر، ت. (16 نوفمبر 2015). "تحديد التوافق الخطي الشامل: طريقة مستقلة عن البيانات والقيم الشاذة ونموذج توزيع الضوضاء وخالية من معالجة البيانات المفقودة أو المحذوفة" . PLOS ONE . 10 (11) e0141486. ​​Bibcode : 2015PLoSO..1041486A . doi : 10.1371/ journal.pone.0141486 . ​​ISSN 1932-6203 . PMC 4646355. PMID 26571035 .   
  5. ^ جيورفي وآخرون. 2002 ، ص. 9-12.
  6. تسيباكوف 2009 ، ص. 1.
  7. تسيباكوف 2009 ، ص. 7.
  8. ^ جيورفي وآخرون. 2002 ، ص. 13.
  9. ^ جيورفي وآخرون. 2002 ، ص. 72، 81، 88.
  10. ^ تريبل ، هانز (1983). نظرية الفضاءات الوظيفية . دراسات في الرياضيات. دار بيركهاوزر. رقم ISBN 9783764313814.
  11. 1 2 يانغ، يوهونغ؛ بارون، أندرو (1999). "التحديد النظري للمعلومات لمعدلات التقارب الدنيا القصوى" . حوليات الإحصاء . 27 (5): 1564-1599 .
  12. نايلز-ويد، جوناثان؛ بيرثيت، كوينتين (2022). "تقدير الحد الأدنى الأقصى للكثافات السلسة في مسافة واسرشتين" . حوليات الإحصاء . 50 (3): 1519-1540 .
  13. بويد، ديفيد دبليو؛ ستيل، جيه مايكل (1978). "الحدود الدنيا لمعدلات تقدير الكثافة غير البارامترية". حوليات الإحصاء . 6 (4): 932-934 .
  14. تسيباكوف 2009 ، ص 15.
  15. أوكو، كازوساتو؛ أكياما، شونتا؛ سوزوكي، تايجي (2023). "نماذج الانتشار هي مقدرات التوزيع الأمثل من نوع مينيمكس" . وقائع المؤتمر الدولي الأربعين للتعلم الآلي . 202 : 26517-26582 .
  16. ^ جيورفي وآخرون. 2002 ، ص. 32.
  17. تسيباكوف 2009 ، ص 95، 132.
  18. تسيباكوف 2009 ، ص 107.
  19. 1 2 3 4 نيميروفسكي، أركادي (2000). مواضيع في الإحصاءات غير البارامترية . ص 5-31 . 
  20. تسيباكوف 2009 ، ص 110، 132.
  21. تسيباكوف 2009 ، ص 40، 44.
  22. ^ جيورفي وآخرون. 2002 ، ص 93-96.
  23. تسيباكوف 2009 ، ص 180.
  24. ^ جيورفي وآخرون. 2002 ، ص. 14-15، 26-28.
  25. كونوفير، دبليو جيه (1999)، "الفصل 3.4: اختبار الإشارة"، الإحصاءات اللامعلمية العملية ( الطبعة الثالثة)، وايلي، ص 157-176 ، ISBN   0-471-16068-7
  26. سبرنت، ب. (1989)، الأساليب الإحصائية اللامعلمية التطبيقية ( الطبعة الثانية)، تشابمان وهول، ISBN  0-412-44980-3

مراجع عامة

  • باجدونافيسيوس، ف.، كروبيس، ج.، نيكولين، م.س. (2011). "الاختبارات غير البارامترية للبيانات الكاملة"، ISTE وWILEY: لندن وهوبوكين. ISBN 978-1-84821-269-5.
  • كوردر، جي دبليو؛ فورمان، دي آي (2014). الإحصاءات اللامعلمية: منهج خطوة بخطوة . وايلي. ISBN 978-1-118-84031-3.
  • جيبونز، جين ديكنسون ؛ تشاكرابورتي، سوبابراتا (2003). الاستدلال الإحصائي غير البارامتري ، الطبعة الرابعة. مطبعة سي آر سي. رقم ISBN 0-8247-4052-1.
  • جيورفي، لازلو؛ كوهلر، مايكل. كرزيزاك، آدم؛ المشي هارو (2002). نظرية خالية من التوزيع للانحدار اللامعلمي . سبرينغر. رقم ISBN 0-387-95441-4.
  • هيتمانسبيرجر، تي بي؛ ماكين، جيه دبليو (1998). الأساليب الإحصائية غير البارامترية القوية . مكتبة كيندال للإحصاء. المجلد  5. لندن: إدوارد أرنولد . ISBN 0-340-54937-8MR 1604954 . رقم ISBN أيضًا 0-471-19479-4.
  • هولاندر م.، وولف د.أ.، تشيكن إ. (2014). الأساليب الإحصائية غير البارامترية ، جون وايلي وأولاده.
  • شيسكين، ديفيد ج. (2003) دليل الإجراءات الإحصائية البارامترية وغير البارامترية . مطبعة سي آر سي. رقم ISBN 1-58488-440-1
  • تسيباكوف، ألكسندر ب. (2009). مقدمة في التقدير غير البارامتري . سبرينغر. ISBN 978-0-387-79051-0.
  • واسرمان، لاري (2007). جميع الإحصاءات اللامعلمية ، سبرينغر. ISBN 0-387-25145-6.