متوسط ​​مربع خطأ التنبؤ

في الإحصاء، يُعرف متوسط ​​مربع خطأ التنبؤ ( MSPE )، أو متوسط ​​مربع خطأ التنبؤات ، لإجراءات التنعيم أو ملاءمة المنحنيات أو الانحدار ، بأنه القيمة المتوقعة لمربعات أخطاء التنبؤ ( PE )، أي مربع الفرق بين القيم المتوقعة التي تشير إليها دالة التنبؤ.ز^{\displaystyle {\widehat {g}}}وقيم القيمة الحقيقية (غير القابلة للملاحظة) g . وهو مقياس عكسي للقوة التفسيرية لـز^،{\displaystyle {\widehat {g}},}ويمكن استخدامها في عملية التحقق المتبادل للنموذج المُقدَّر. يتطلب حساب متوسط ​​مربع الخطأ التربيعي بدقة معرفة قيمة g ؛ أما عمليًا، فيتم تقدير متوسط ​​مربع الخطأ التربيعي. [ 1 ]

التركيبة

إذا كانت عملية التنعيم أو المطابقة تحتوي على مصفوفة إسقاط (أي مصفوفة القبعة) L ، والتي تقوم برسم متجه القيم المرصودةy{\displaystyle y}متجه القيم المتوقعةy^=Ly،{\displaystyle {\hat {y}}=Ly,}ثم يتم صياغة PE و MSPE على النحو التالي:

Pهـأنا=ز(xأنا)-ز^(xأنا)،{\displaystyle \operatorname {PE_{i}} =g(x_{i})-{\widehat {g}}(x_{i}),}
MSPE=هـ[البولي إيثيلينأنا2]=أنا=1نالبولي إيثيلينأنا2/ن.{\displaystyle \operatorname {MSPE} =\operatorname {E} \left[\operatorname {PE} _{i}^{2}\right]=\sum _{i=1}^{n}\operatorname {PE} _{i}^{2}/n.}

يمكن تقسيم MSPE إلى مصطلحين: الانحياز التربيعي (متوسط ​​الخطأ) للقيم المُقدَّرة وتباين القيم المُقدَّرة:

MSPE=أنا2+متغير،{\displaystyle \operatorname {MSPE} =\operatorname {ME} ^{2}+\operatorname {VAR} ,}
أنا=هـ[ز^(xأنا)-ز(xأنا)]{\displaystyle \operatorname {ME} =\operatorname {E} \left[{\widehat {g}}(x_{i})-g(x_{i})\right]}
متغير=هـ[(ز^(xأنا)-هـ[ز(xأنا)])2].{\displaystyle \operatorname {VAR} =\operatorname {E} \left[\left({\widehat {g}}(x_{i})-\operatorname {E} \left[{g}(x_{i})\right]\right)^{2}\right].}

تُسمى الكمية SSPE = n MSPE مجموع مربعات أخطاء التنبؤ . أما الجذر التربيعي لمتوسط ​​مربعات أخطاء التنبؤ فهو الجذر التربيعي لـ MSPE: RMSPE = √MSPE .

حساب متوسط ​​مربع الخطأ التربيعي (MSPE) على بيانات خارج العينة

يمكن حساب متوسط ​​مربع خطأ التنبؤ بدقة في سياقين. أولًا، مع عينة بيانات طولها n ، قد يُجري محلل البيانات تحليل الانحدار على q نقطة بيانات فقط (حيث q < n )، مع استبعاد نقاط البيانات المتبقية ( n – q) لاستخدامها تحديدًا في حساب متوسط ​​مربع خطأ التنبؤ خارج العينة (أي، دون استخدام البيانات المستخدمة في عملية تقدير النموذج). بما أن عملية الانحدار مُصممة خصيصًا لنقاط البيانات الـ q داخل العينة، فعادةً ما يكون متوسط ​​مربع خطأ التنبؤ داخل العينة أصغر من نظيره خارج العينة المحسوب على النقاط المتبقية (n – q) . إذا كانت الزيادة في متوسط ​​مربع خطأ التنبؤ خارج العينة مقارنةً بداخلها طفيفة نسبيًا، فإن ذلك يُعطي انطباعًا إيجابيًا بالنموذج. وإذا كان المطلوب مقارنة نموذجين، فإن النموذج ذو متوسط ​​مربع خطأ التنبؤ الأقل على نقاط البيانات المتبقية (n – q) خارج العينة يُعتبر أكثر إيجابية، بغض النظر عن أداء النموذجين النسبي داخل العينة. إن متوسط ​​مربع الخطأ خارج العينة في هذا السياق دقيق بالنسبة لنقاط البيانات خارج العينة التي تم حسابها عليها، ولكنه مجرد تقدير لمتوسط ​​مربع الخطأ للنموذج بالنسبة للمجتمع غير المرصود في الغالب والذي تم سحب البيانات منه.

ثانيًا، مع مرور الوقت قد تتوفر المزيد من البيانات لمحلل البيانات، ومن ثم يمكن حساب MSPE على هذه البيانات الجديدة.

تقدير متوسط ​​مربع الخطأ النسبي على مستوى السكان

عندما يتم تقدير النموذج على جميع البيانات المتاحة دون حجب أي منها، يمكن تقدير متوسط ​​مربع الخطأ للنموذج على كامل مجموعة البيانات غير المرصودة في الغالب على النحو التالي.

بالنسبة للنموذجyأنا=ز(xأنا)+σεأنا{\displaystyle y_{i}=g(x_{i})+\sigma \varepsilon _{i}}أينεأناشمال(0،1){\displaystyle \varepsilon _{i}\sim {\mathcal {N}}(0,1)}يمكن للمرء أن يكتب

نMSPE(L)=زتي(أنا-L)تي(أنا-L)ز+σ2tr[LتيL].{\displaystyle n\cdot \operatorname {MSPE} (L)=g^{\text{T}}(IL)^{\text{T}}(IL)g+\sigma ^{2}\operatorname {tr} \left[L^{\text{T}}L\right].}

باستخدام قيم البيانات داخل العينة، يكون الحد الأول على الجانب الأيمن مكافئًا لـ

أنا=1ن(هـ[ز(xأنا)-ز^(xأنا)])2=هـ[أنا=1ن(yأنا-ز^(xأنا))2]-σ2tr[(أنا-L)تي(أنا-L)].{\displaystyle \sum _{i=1}^{n}\left(\operatorname {E} \left[g(x_{i})-{\widehat {g}}(x_{i})\right]\right)^{2}=\operatorname {E} \left[\sum _{i=1}^{n}\left(y_{i}-{\widehat {g}}(x_{i})\right)^{2}\right]-\sigma ^{2}\operatorname {tr} \left[\left(IL\right)^{T}\left(IL\right)\right].}

هكذا،

نMSPE(L)=هـ[أنا=1ن(yأنا-ز^(xأنا))2]-σ2(ن-tr[L]).{\displaystyle n\cdot \operatorname {MSPE} (L)=\operatorname {E} \left[\sum _{i=1}^{n}\left(y_{i}-{\widehat {g}}(x_{i})\right)^{2}\right]-\sigma ^{2}\left(n-\operatorname {tr} \left[L\right]\right).}

لوσ2{\displaystyle \sigma ^{2}}معروف أو مقدر بشكل جيد بواسطةσ^2{\displaystyle {\widehat {\sigma }}^{2}}وبذلك يصبح من الممكن تقدير متوسط ​​مربع الخطأ (MSPE) بواسطة

نمSPهـ^(L)=أنا=1ن(yأنا-ز^(xأنا))2-σ^2(ن-tr[L]).{\displaystyle n\cdot \operatorname {\widehat {MSPE}} (L)=\sum _{i=1}^{n}\left(y_{i}-{\widehat {g}}(x_{i})\right)^{2}-{\widehat {\sigma }}^{2}\left(n-\operatorname {tr} \left[L\right]\right).}

وقد دافع كولين مالوز عن هذه الطريقة في بناء إحصائية اختيار النموذج C p ، وهي نسخة معيارية من MSPE المقدر:

جص=أنا=1ن(yأنا-ز^(xأنا))2σ^2-ن+2ص.{\displaystyle C_{p}={\frac {\sum _{i=1}^{n}\left(y_{i}-{\widehat {g}}(x_{i})\right)^{2}}{{\widehat {\sigma }}^{2}}}-n+2p.}

حيث يمثل p عدد المعلمات المقدرة p وσ^2{\displaystyle {\widehat {\sigma }}^{2}}يتم حسابها من نسخة النموذج التي تتضمن جميع المتغيرات المستقلة الممكنة. بذلك ينتهي هذا البرهان.

انظر أيضاً

مراجع

  1. بينديك، روبرت سروبينفيلد، دانيال ل. (1991). "التنبؤ باستخدام نماذج السلاسل الزمنية" . النماذج الاقتصادية القياسية والتنبؤات الاقتصادية (  الطبعة الثالثة). نيويورك: ماكجرو هيل. الصفحات 516-535 . ISBN  0-07-050098-3.