دالة التوزيع التجريبية

المنحنى الأخضر، الذي يقترب تقاربًا من الارتفاعين 0 و1 دون بلوغهما، هو دالة التوزيع التراكمي الحقيقية للتوزيع الطبيعي القياسي . تمثل علامات التجزئة الرمادية المشاهدات في عينة معينة مسحوبة من هذا التوزيع، وتشكل الخطوات الأفقية لدالة الخطوة الزرقاء (بما في ذلك النقطة اليسرى في كل خطوة ولكن باستثناء النقطة اليمنى) دالة التوزيع التجريبية لتلك العينة.

في الإحصاء ، دالة التوزيع التجريبي ( أو دالة التوزيع التراكمي التجريبي ، eCDF ) هي دالة التوزيع المرتبطة بالقياس التجريبي لعينة ما . [ 1 ] هذه الدالة التراكمية هي دالة متدرجة تقفز بمقدار 1/ n عند كل نقطة من نقاط البيانات n . وقيمتها عند أي قيمة محددة للمتغير المقاس هي نسبة المشاهدات للمتغير المقاس التي تقل عن أو تساوي تلك القيمة المحددة.

دالة التوزيع التجريبي هي تقدير لدالة التوزيع التراكمي التي ولّدت النقاط في العينة. وهي تتقارب باحتمالية 1 مع ذلك التوزيع الأصلي، وفقًا لنظرية جليفنكو-كانتيلي . توجد عدة نتائج لتحديد معدل تقارب دالة التوزيع التجريبي مع دالة التوزيع التراكمي الأصلية. ومن أبسط التقديرات التجريبية توزيع التردد .

تعريف

لتكن ( X1 , …, Xn ) متغيرات عشوائية حقيقية مستقلة ومتطابقة التوزيع ولها دالة التوزيع التراكمي المشتركة F ( t ) . عندئذٍ تُعرَّف دالة التوزيع التجريبية على النحو التالي [ 2 ] .F^ن(ت)=عدد العناصر في العينةتن=1نأنا=1ن1Xأنات،{\displaystyle {\widehat {F}}_{n}(t)={\frac {{\text{عدد العناصر في العينة}}\leq t}{n}}={\frac {1}{n}}\sum _{i=1}^{n}\mathbf {1} _{X_{i}\leq t},} أين1أ{\displaystyle \mathbf {1} _{A}}هو مؤشر الحدث A. بالنسبة لقيمة t ثابتة ، يكون المؤشر1Xأنات{\displaystyle \mathbf {1} _{X_{i}\leq t}}هو متغير عشوائي برنولي ذو معامل p = F ( t ) ؛ وبالتالينF^ن(ت){\displaystyle n{\widehat {F}}_{n}(t)}هو متغير عشوائي ذو توزيع ثنائي بمتوسط ​​nF ( t ) وتباين nF ( t )(1 − F ( t )) . وهذا يعني أنF^ن(ت){\displaystyle {\widehat {F}}_{n}(t)}هو مقدر غير متحيز لـ F ( t ) .

في بعض الكتب المدرسية، يتم تعريف دالة التوزيع التجريبية على النحو التالي [ 3 ] [ 4 ]F^ن(ت)=1ن+1أنا=1ن1Xأنات{\displaystyle {\widehat {F}}_{n}(t)={\frac {1}{n+1}}\sum _{i=1}^{n}\mathbf {1} _{X_{i}\leq t}} ومع ذلك، بما أن النسبة ( ن + 1) / ن تقترب من 1 عندما تؤول ن إلى اللانهاية، فإن الخصائص التقاربية للتعريفين هي نفسها.

الخصائص التقاربية

بحسب قانون الأعداد الكبيرة القوي ، فإن المُقدِّرF^ن(ت){\displaystyle {\widehat {F}}_{n}(t)}يتقارب إلى F ( t ) عندما n → ∞ بشكل شبه مؤكد ، لكل قيمة من t : [ 2 ]F^ن(ت) مثل F(ت)؛{\displaystyle {\widehat {F}}_{n}(t)\ {\xrightarrow {\text{a.s.}}}\ F(t);} وبالتالي فإن المُقدِّرF^ن(ت){\displaystyle {\widehat {F}}_{n}(t)}متسق . يؤكد هذا التعبير التقارب النقطي لدالة التوزيع التجريبية مع دالة التوزيع التراكمي الحقيقية. وهناك نتيجة أقوى، تُسمى نظرية جليفنكو-كانتيلي ، تنص على أن التقارب يحدث في الواقع بشكل منتظم على مدى t : [ 5 ]F^ن-FرشفةتR|F^ن(ت)-F(ت)| 0.{\displaystyle \left\|{\widehat {F}}_{n}-F\right\|_{\infty }\equiv \sup _{t\in \mathbb {R} }\left|{\widehat {F}}_{n}(t)-F(t)\right|\xrightarrow {} \ 0.} يُطلق على المعيار الأعلى في هذا التعبير اسم إحصائية كولموغوروف-سميرنوف لاختبار مدى تطابق التوزيع التجريبيF^ن(ت){\textstyle {\widehat {F}}_{n}(t)}ودالة التوزيع التراكمي الحقيقية المفترضة F. يمكن استخدام دوال معيارية أخرى هنا بدلاً من معيار السوبر. على سبيل المثال، ينتج عن معيار L2 إحصائية كرامر-فون ميزس .

يمكن وصف التوزيع التقاربي بشكل أكبر بعدة طرق مختلفة. أولاً، تنص نظرية النهاية المركزية على أنه عند نقطة معينة ،F^ن(ت){\textstyle {\widehat {F}}_{n}(t)}له توزيع طبيعي تقاربي مع المعيارن{\textstyle {\sqrt {n}}}معدل التقارب: [ 2 ]ن(F^ن(ت)-F(ت))  د  شمال(0،F(ت)(1-F(ت))).{\displaystyle {\sqrt {n}}{\big (}{\widehat {F}}_{n}(t)-F(t){\big )}\ \ {\xrightarrow {d}}\ \ {\mathcal {N}}{\Big (}0,F(t){\big (}1-F(t){\big )}{\Big )}.} يتم توسيع هذه النتيجة بواسطة نظرية دونسكر ، التي تؤكد أن العملية التجريبيةن(F^ن-F){\textstyle {\sqrt {n}}({\widehat {F}}_{n}-F)}، يُنظر إليها كدالة مفهرسة بواسطةتR{\textstyle t\in \mathbb {R} }، يتقارب في التوزيع في فضاء سكوروهودد[-،+]{\displaystyle D[-\infty ,+\infty ]}إلى عملية غاوسية ذات متوسط ​​صفريجيF=بF{\textstyle G_{F}=B\circ F}حيث B هو جسر براون القياسي . [ 5 ] بنية التغاير لهذه العملية الغاوسية هي هـ[جيF(ت1)جيF(ت2)]=F(ت1ت2)-F(ت1)F(ت2).{\displaystyle \operatorname {E} [\,G_{F}(t_{1})G_{F}(t_{2})\,]=F(t_{1}\wedge t_{2})-F(t_{1})F(t_{2}).} يمكن تحديد معدل التقارب المنتظم في نظرية دونسكر من خلال النتيجة المعروفة باسم التضمين المجري : [ 6 ]ليم سوبننln2نن(F^ن-F)-جيF،ن<،مثل{\displaystyle \limsup _{n\to \infty }{\frac {\sqrt {n}}{\ln ^{2}n}}\left\|{\sqrt {n}}({\widehat {F}}_{n}-F)-G_{F,n}\right\|_{\infty }<\infty ,\quad {\text{a.s.}}}

أو بدلاً من ذلك، معدل تقاربن(F^ن-F){\displaystyle {\sqrt {n}}({\widehat {F}}_{n}-F)}يمكن أيضًا تحديد ذلك كميًا من خلال السلوك التقاربي لمعيار القيمة العليا لهذا التعبير. يوجد عدد من النتائج في هذا المجال، على سبيل المثال، توفر متباينة دفورتسكي-كيفر-وولفويتز حدًا على احتمالات الذيل لـنF^ن-F{\textstyle {\sqrt {n}}\left\|{\widehat {F}}_{n}-F\right\|_{\infty }}[ 6 ]برو(نF^ن-F>z)2هـ-2z2.{\displaystyle \Pr \!{\Big (}{\sqrt {n}}\|{\widehat {F}}_{n}-F\|_{\infty }>z{\Big )}\leq 2e^{-2z^{2}}.} في الواقع، أثبت كولموغوروف أنه إذا كانت دالة التوزيع التراكمي F متصلة، فإن التعبيرنF^ن-F{\textstyle {\sqrt {n}}\left\|{\widehat {F}}_{n}-F\right\|_{\infty }}يتقارب في التوزيع إلىب{\textstyle \left\|B\right\|_{\infty }}، والتي لها توزيع كولموغوروف الذي لا يعتمد على شكل F.

نتيجة أخرى، تترتب على قانون اللوغاريتم المتكرر ، هي أن [ 6 ]ليم سوبنن2lnlnنF^ن-F12،مثل{\displaystyle \limsup _{n\to \infty }{\sqrt {\frac {n}{2\ln \ln n}}}\left\|{\widehat {F}}_{n}-F\right\|_{\infty }\leq {\frac {1}{2}},\quad {\text{a.s.}}} و الحد الأقصى غير محدودن2نlnlnنF^ن-F=π2،مثل{\displaystyle \liminf _{n\to \infty }{\sqrt {2n\ln \ln n}}\left\|{\widehat {F}}_{n}-F\right\|_{\infty }={\frac {\pi }{2}},\quad {\text{a.s.}}}

فترات الثقة

مخططات دالة التوزيع التراكمي التجريبية، ودالة التوزيع التراكمي، وفترات الثقة لأحجام عينات مختلفة من التوزيع الطبيعي
مخططات دالة التوزيع التراكمي التجريبية، ودالة التوزيع التراكمي، وفترات الثقة لأحجام عينات مختلفة من توزيع كوشي
مخططات التوزيع التراكمي التجريبي، ومخططات التوزيع التراكمي وفترات الثقة لأحجام عينات مختلفة من التوزيع المثلثي

بحسب متباينة دفورتسكي-كيفر-وولفويتز، فإن الفترة التي تحتوي على دالة التوزيع التراكمي الحقيقية،F(x){\displaystyle F(x)}باحتمالية1-α{\displaystyle 1-\alpha }تم تحديده على النحو التالي:

Fن(x)-εF(x)Fن(x)+ε أين ε=ln2α2ن.{\displaystyle F_{n}(x){-}\varepsilon \leq F(x)\leq F_{n}(x){+}\varepsilon \;{\text{ where }}\varepsilon ={\sqrt {\frac {\ln {\frac {2}{\alpha }}}{2n}}}.}

وفقًا للحدود المذكورة أعلاه، يمكننا رسم دالة التوزيع التراكمي التجريبية، ودالة التوزيع التراكمي وفترات الثقة لتوزيعات مختلفة باستخدام أي من التطبيقات الإحصائية.

التنفيذ الإحصائي

تتضمن قائمة غير شاملة لتطبيقات البرامج لوظيفة التوزيع التجريبي ما يلي:

انظر أيضاً

مراجع

  1. مقدمة حديثة في الاحتمالات والإحصاء: فهم لماذا وكيف . ميشيل ديكينج. لندن: سبرينغر. 2005. ص  219. ISBN 978-1-85233-896-1. OCLC 262680588 . {{cite book}}صيانة CS1: أخرى ( رابط )
  2. 1 2 3 فان دير فارت، AW (1998). إحصائيات مقاربة . مطبعة جامعة كامبريدج. ص. 265 . رقم ISBN  0-521-78450-6.
  3. كولز، س. (2001) مقدمة في النمذجة الإحصائية للقيم المتطرفة . سبرينغر، ص 36، التعريف 2.4. ISBN 978-1-4471-3675-0.
  4. مادسن، إتش أو، كرينك، إس، ليند، إس سي (2006) أساليب السلامة الإنشائية . منشورات دوفر. ص 148-149. ISBN 0486445976
  5. 1 2 فان دير فارت، AW (1998). إحصائيات مقاربة . مطبعة جامعة كامبريدج. ص. 266 . رقم ISBN  0-521-78450-6.
  6. 1 2 3 فان دير فارت، AW (1998). إحصائيات مقاربة . مطبعة جامعة كامبريدج. ص. 268 . رقم ISBN  0-521-78450-6.
  7. "ما الجديد في Matplotlib 3.8.0 (13 سبتمبر 2023) — وثائق Matplotlib 3.8.3" .

للمزيد من القراءة

  • شعار ويكيميديا ​​كومنزالوسائط المتعلقة بدوال التوزيع التجريبية على ويكيميديا ​​كومنز