Mean squared error
In statistics, the mean squared error (MSE)[1] or mean squared deviation (MSD) of an estimator (of a procedure for estimating an unobserved quantity) measures the average of the squares of the errors—that is, the average squared difference between the estimated values and the true value. MSE is a risk function, corresponding to the expected value of the squared error loss.[2] The fact that MSE is almost always strictly positive (and not zero) is because of randomness or because the estimator does not account for information that could produce a more accurate estimate.[3] In machine learning, specifically empirical risk minimization, MSE may refer to the empirical risk (the average loss on an observed data set), as an estimate of the true MSE (the true risk: the average loss on the actual population distribution).
The MSE is a measure of the quality of an estimator. As it is derived from the square of Euclidean distance, it is always a positive value that decreases as the error approaches zero.
The MSE is the second moment (about the origin) of the error, and thus incorporates both the variance of the estimator (how widely spread the estimates are from one data sample to another) and its bias (how far off the average estimated value is from the true value). For an unbiased estimator, the MSE is the variance of the estimator. Like the variance, MSE has the same units of measurement as the square of the quantity being estimated. In an analogy to standard deviation, taking the square root of MSE yields the root-mean-square error or root-mean-square deviation (RMSE or RMSD), which has the same units as the quantity being estimated; for an unbiased estimator, the RMSE is the square root of the variance, known as the standard error.
Definition and basic properties
The MSE either assesses the quality of a predictor (i.e., a function mapping arbitrary inputs to a sample of values of some random variable), or of an estimator (i.e., a mathematical function mapping a sample of data to an estimate of a parameter of the population from which the data is sampled). In the context of prediction, understanding the prediction interval can also be useful as it provides a range within which a future observation will fall, with a certain probability. The definition of an MSE differs according to whether one is describing a predictor or an estimator.
Predictor
If a vector of predictions is generated from a sample of data points on all variables, and is the vector of observed values of the variable being predicted, with being the predicted values (e.g. as from a least-squares fit), then the within-sample MSE of the predictor is computed as
In other words, the MSE is the mean of the squares of the errors. This is an easily computable quantity for a particular sample (and hence is sample-dependent).
In matrix notation, where is and is a column vector.
The MSE can also be computed on q data points that were not used in estimating the model, either because they were held back for this purpose, or because these data have been newly obtained. Within this process, known as cross-validation, the MSE is often called the test MSE,[4] and is computed as
Estimator
The MSE of an estimator with respect to an unknown parameter is defined as[1]
This definition depends on the unknown parameter, therefore the MSE is a priori property of an estimator. The MSE could be a function of unknown parameters, in which case any estimator of the MSE based on estimates of these parameters would be a function of the data (and thus a random variable). If the estimator is derived as a sample statistic and is used to estimate some population parameter, then the expectation is with respect to the sampling distribution of the sample statistic.
The MSE can be written as the sum of the variance of the estimator and the squared bias of the estimator, providing a useful way to calculate the MSE and implying that in the case of unbiased estimators, the MSE and variance are equivalent.[5]
Proof of variance and bias relationship
يمكن التوصل إلى برهان أقصر باستخدام الصيغة المعروفة التي تنص على أنه بالنسبة لمتغير عشوائي،عن طريق الاستبدالمع،لدينا لكن في حالة النمذجة الواقعية، يمكن وصف متوسط مربع الخطأ (MSE) بأنه مجموع تباين النموذج، وانحياز النموذج، وعدم اليقين غير القابل للاختزال (انظر: المفاضلة بين الانحياز والتباين ). وبناءً على هذه العلاقة، يمكن استخدام متوسط مربع الخطأ للمُقدِّرات ببساطة لمقارنة الكفاءة ، وهو ما يشمل معلومات تباين المُقدِّر وانحيازه. وهذا ما يُسمى بمعيار متوسط مربع الخطأ.
الانحدار
في تحليل الانحدار ، يُعدّ الرسم البياني طريقةً أكثر طبيعيةً لعرض الاتجاه العام للبيانات. يُمكن حساب متوسط المسافة من كل نقطة إلى نموذج الانحدار المُتوقع، وعرضه كمتوسط مربع الخطأ. يُعدّ التربيع ضروريًا لتقليل التعقيد الناتج عن الإشارات السالبة. لتقليل متوسط مربع الخطأ، يُمكن أن يكون النموذج أكثر دقة، مما يعني أنه أقرب إلى البيانات الفعلية. أحد الأمثلة على الانحدار الخطي باستخدام هذه الطريقة هو طريقة المربعات الصغرى ، التي تُقيّم مدى ملاءمة نموذج الانحدار الخطي لنمذجة مجموعة بيانات ثنائية المتغيرات [ 6 ]، ولكنّ قيدها يتعلق بمعرفة توزيع البيانات.
يُستخدم مصطلح متوسط مربع الخطأ أحيانًا للإشارة إلى التقدير غير المتحيز لتباين الخطأ: وهو مجموع مربعات البواقي مقسومًا على عدد درجات الحرية . يختلف هذا التعريف لكمية معروفة ومحسوبة عن التعريف المذكور أعلاه لمتوسط مربع الخطأ المحسوب لمتغير تنبؤي، في استخدام مقام مختلف. المقام هو حجم العينة مطروحًا منه عدد معلمات النموذج المُقدَّرة من البيانات نفسها، ( ن - ص ) لـ p من المتغيرات المستقلة أو ( ن - ص - 1) في حالة استخدام حد ثابت (انظر الأخطاء والبواقي في الإحصاء لمزيد من التفاصيل). [ 7 ] على الرغم من أن متوسط مربع الخطأ (كما هو مُعرَّف في هذه المقالة) ليس مُقدِّرًا غير متحيز لتباين الخطأ، إلا أنه متسق ، نظرًا لاتساق المتغير التنبؤي.
في تحليل الانحدار، يُشار إلى "متوسط مربع الخطأ"، والذي يُسمى غالبًا متوسط مربع خطأ التنبؤ أو "متوسط مربع الخطأ خارج العينة"، بأنه متوسط مربعات انحرافات التنبؤات عن القيم الحقيقية، ضمن فضاء اختبار خارج العينة ، والذي ينتجه نموذج مُقدَّر على فضاء عينة مُحدد . وهذه قيمة معروفة ومحسوبة، وتختلف باختلاف العينة وفضاء الاختبار خارج العينة.
في سياق خوارزميات التدرج الهبوطي ، من الشائع إدخال عامل منيُستخدم مصطلح MSE لتسهيل الحساب بعد الاشتقاق. لذا، يمكن تسمية القيمة التي تساوي نصف متوسط مربعات الأخطاء بـ MSE.
أمثلة
يقصد
لنفترض أن لدينا عينة عشوائية بحجممن السكان،لنفترض أن وحدات العينة قد تم اختيارها مع الإحلال . أي أنيتم اختيار الوحدات واحدة تلو الأخرى، وتبقى الوحدات التي تم اختيارها مسبقًا مؤهلة للاختيار للجميع.السحوبات. المقدر المعتاد لمتوسط المجتمعهو متوسط العينة
والتي لها قيمة متوقعة تساوي المتوسط الحقيقي(لذا فهو غير متحيز) ومتوسط خطأ تربيعي قدره
أينهو تباين السكان .
بالنسبة للتوزيع الغاوسي، يُعد هذا أفضل مُقدِّر غير متحيز لمتوسط المجتمع، أي المُقدِّر ذو أقل متوسط مربع خطأ (وبالتالي أقل تباين) بين جميع المُقدِّرات غير المتحيزة. يمكن التحقق من أن متوسط مربع الخطأ المذكور أعلاه يساوي معكوس معلومات فيشر (انظر حد كرامر-راو ). لكن متوسط العينة نفسه ليس أفضل مُقدِّر لمتوسط المجتمع، على سبيل المثال، بالنسبة للتوزيع المنتظم .
التباين
المقدر المعتاد للتباين هو تباين العينة المصحح :
هذا غير متحيز (قيمته المتوقعة هي)، ومن ثم يطلق عليه أيضًا تباين العينة غير المتحيز، و MSE الخاص به هو [ 8 ]
أينوهي اللحظة المركزية الرابعة للتوزيع أو السكان، وهو التفرطح الزائد .
ومع ذلك، يمكن استخدام مقدرات أخرى لـوالتي تتناسب معويمكن للاختيار المناسب دائمًا أن يؤدي إلى انخفاض متوسط مربع الخطأ. إذا عرّفنا
ثم نقوم بالحساب:
يتم تقليل ذلك إلى الحد الأدنى عندما
بالنسبة للتوزيع الغاوسي ، حيثوهذا يعني أن متوسط مربع الخطأ (MSE) يكون في أدنى قيمة له عند قسمة المجموع علىالحد الأدنى لفرط التفرطح هو، [ أ ] والذي يتم تحقيقه بواسطة توزيع برنولي مع p = 1/2 (رمي عملة معدنية)، ويتم تقليل متوسط مربع الخطأ لـوبالتالي، بغض النظر عن التفرطح، نحصل على تقدير "أفضل" (بمعنى انخفاض متوسط مربع الخطأ) عن طريق تقليل حجم المقدر غير المتحيز قليلاً؛ هذا مثال بسيط على مقدر الانكماش : حيث يتم "تقليص" المقدر نحو الصفر (تقليل حجم المقدر غير المتحيز).
علاوة على ذلك، في حين أن تباين العينة المصحح هو أفضل مقدر غير متحيز (أقل متوسط مربع خطأ بين المقدرات غير المتحيزة) للتباين في التوزيعات الغاوسية، فإذا لم يكن التوزيع غاوسيًا، فقد لا يكون أفضل مقدر غير متحيز للتباين هو نفسه بين المقدرات غير المتحيزة.
التوزيع الغاوسي
يُقدّم الجدول التالي عدة تقديرات للمعلمات الحقيقية للمجتمع، μ و σ 2 ، في حالة التوزيع الغاوسي. [ 9 ]
| القيمة الحقيقية | المُقدِّر | متوسط مربع الخطأ |
|---|---|---|
| = المُقدِّر غير المتحيز لمتوسط المجتمع ، | ||
| = المُقدِّر غير المتحيز لتباين المجتمع ، | ||
| = المُقدِّر المتحيز لتباين المجتمع ، | ||
| = المُقدِّر المتحيز لتباين المجتمع ، |
تفسير
متوسط مربع الخطأ يساوي صفرًا، مما يعني أن المُقدِّريتنبأ بملاحظات المعلمةيُعدّ تحقيق الدقة التامة أمراً مثالياً (لكنه غير ممكن عادةً).
يمكن استخدام قيم متوسط مربعات الخطأ (MSE) لأغراض المقارنة. يمكن مقارنة نموذجين إحصائيين أو أكثر باستخدام قيم MSE الخاصة بهما - كمقياس لمدى جودة تفسيرهما لمجموعة معينة من الملاحظات: المقدر غير المتحيز (المقدر من نموذج إحصائي) الذي يتمتع بأصغر تباين بين جميع المقدرات غير المتحيزة هو أفضل مقدر غير متحيز أو MVUE ( المقدر غير المتحيز ذو التباين الأدنى ).
تُقدّر كلٌّ من تقنيات تحليل التباين والانحدار الخطي متوسط مربع الخطأ (MSE) كجزء من التحليل، وتستخدم هذه القيمة لتحديد الدلالة الإحصائية للعوامل أو المتغيرات التنبؤية قيد الدراسة. يهدف تصميم التجارب إلى تصميمها بطريقة تجعل متوسط مربع الخطأ (MSE) عند تحليل الملاحظات قريبًا من الصفر بالنسبة لحجم تأثير واحد على الأقل من تأثيرات المعالجة المُقدَّرة.
في تحليل التباين أحادي الاتجاه ، يمكن حساب متوسط مربع الخطأ (MSE) بقسمة مجموع مربعات الأخطاء على درجة الحرية. كما أن قيمة f هي نسبة متوسط مربع المعالجة إلى متوسط مربع الخطأ (MSE).
كما يتم استخدام MSE في العديد من تقنيات الانحدار التدريجي كجزء من تحديد عدد المتغيرات التنبؤية من مجموعة مرشحة يتم تضمينها في نموذج لمجموعة معينة من الملاحظات.
التطبيقات
يُعدّ تقليل متوسط مربع الخطأ (MSE) معيارًا أساسيًا في اختيار المُقدِّرات؛ انظر: الحد الأدنى لمتوسط مربع الخطأ . في المُقدِّرات غير المتحيزة، يُعادل تقليل متوسط مربع الخطأ تقليل التباين، والمُقدِّر الذي يُحقق ذلك هو مُقدِّر الحد الأدنى للتباين غير المتحيز . مع ذلك، قد يكون للمُقدِّر المتحيز متوسط مربع خطأ أقل؛ انظر: تحيز المُقدِّر .
في النمذجة الإحصائية، يُمكن أن يُمثل متوسط مربع الخطأ (MSE) الفرق بين القيم الفعلية المُشاهدة والقيم المُشاهدة التي يتنبأ بها النموذج. في هذا السياق، يُستخدم لتحديد مدى مُلاءمة النموذج للبيانات، وكذلك ما إذا كان من الممكن حذف بعض المتغيرات التفسيرية دون الإضرار بشكل كبير بقدرة النموذج على التنبؤ.
في التنبؤ والتوقع ، يعتبر مؤشر بريير مقياسًا لمهارة التنبؤ بناءً على متوسط مربع الخطأ.
دالة الخسارة
يُعدّ فقدان مربع الخطأ أحد أكثر دوال الخسارة استخدامًا في الإحصاء، مع أن شيوع استخدامه ينبع في الغالب من سهولة حسابه رياضيًا أكثر من اعتبارات الخسارة الفعلية في التطبيقات. كان كارل فريدريش غاوس ، الذي أدخل استخدام متوسط مربع الخطأ، مُدركًا لعشوائيته، وكان مُتفقًا مع الاعتراضات عليه لهذا السبب. [ 3 ] تتجلى الفوائد الرياضية لمتوسط مربع الخطأ بوضوح عند استخدامه في تحليل أداء الانحدار الخطي ، إذ يسمح بتقسيم التباين في مجموعة البيانات إلى تباين يُفسّره النموذج وتباين يُفسّره العشوائية.
نقد
انتقد جيمس بيرغر، عالم نظرية القرار ، استخدام متوسط مربع الخطأ دون تمحيص . متوسط مربع الخطأ هو معكوس القيمة المتوقعة لدالة منفعة محددة ، وهي دالة المنفعة التربيعية، والتي قد لا تكون دالة المنفعة المناسبة في ظل ظروف معينة. مع ذلك، توجد بعض الحالات التي يمكن فيها لمتوسط مربع الخطأ أن يكون تقريبًا جيدًا لدالة الخسارة التي تظهر بشكل طبيعي في التطبيق. [ 10 ]
على غرار التباين ، يعاني متوسط مربع الخطأ من عيب يتمثل في إعطاء وزن كبير للقيم المتطرفة . [ 11 ] ويعود ذلك إلى تربيع كل حد، مما يُعطي وزنًا أكبر للأخطاء الكبيرة مقارنةً بالأخطاء الصغيرة. هذه الخاصية، غير المرغوب فيها في العديد من التطبيقات، دفعت الباحثين إلى استخدام بدائل مثل متوسط الخطأ المطلق ، أو تلك القائمة على الوسيط .
انظر أيضاً
ملحوظات
- ↑ يمكن إثبات ذلك باستخدام متباينة جنسن كما يلي. العزم المركزي الرابعهو حد أعلى لمربع التباين، وبالتالي فإن أقل قيمة لنسبتهما هي واحد، ومن ثم فإن أقل قيمة للتفرطح الزائد هي -2، والتي تتحقق، على سبيل المثال، بواسطة توزيع برنولي مع p = 1/2.
مراجع
- 1 2 "متوسط مربع الخطأ (MSE)" . www.probabilitycourse.com . تم الاطلاع عليه بتاريخ 12 سبتمبر 2020 .
- ↑ بيكل، بيتر ج .؛ دوكسوم، كيل أ. (2015). الإحصاء الرياضي: الأفكار الأساسية والمواضيع المختارة . المجلد الأول ( الطبعة الثانية). ص 20.
إذا استخدمنا دالة الخسارة التربيعية، فإن دالة المخاطرة لدينا تسمى
متوسط مربع الخطأ
(MSE)...
- 1 2 ليمان، إي إل؛ كاسيلا، جورج (1998). نظرية التقدير النقطي ( الطبعة الثانية). نيويورك: سبرينغر. ISBN 978-0-387-98502-2MR 1639875 .
- ↑ غاريث، جيمس؛ ويتن، دانييلا؛ هاستي، تريفور؛ تيبشيراني، روب (2021). مقدمة في التعلم الإحصائي: مع تطبيقات في لغة البرمجة R. سبرينغر. ISBN 978-1071614174.
- ↑ واكرلي، دينيس؛ ميندنهال، ويليام؛ شيفر، ريتشارد ل. (2008). الإحصاء الرياضي مع التطبيقات ( الطبعة السابعة). بلمونت، كاليفورنيا، الولايات المتحدة الأمريكية: تومسون للتعليم العالي. ISBN 978-0-495-38508-0.
- ↑ مقدمة حديثة في الاحتمالات والإحصاء : فهم لماذا وكيف . ديكينج، ميشيل، 1946–. لندن: سبرينغر. 2005. ISBN 978-1-85233-896-1. OCLC 262680588 .
{{cite book}}صيانة CS1: أخرى ( رابط ) - ↑ ستيل، آر جي دي، وتوري، جيه إتش، مبادئ وإجراءات الإحصاء مع إشارة خاصة إلى العلوم البيولوجية. ، ماكجرو هيل ، 1960، صفحة 288.
- ↑ مود، أ.؛ غرايبيل، ف.؛ بوس، د. (1974). مقدمة في نظرية الإحصاء ( الطبعة الثالثة). ماكجرو هيل. ص 229 .
- ↑ ديغروت، موريس هـ. (1980). الاحتمالات والإحصاء ( الطبعة الثانية). أديسون-ويسلي.
- ↑ بيرغر، جيمس أو. ( 1985). "2.4.2 دوال الخسارة القياسية المحددة". نظرية القرار الإحصائي والتحليل البايزي ( الطبعة الثانية). نيويورك: سبرينغر-فيرلاغ. ص 60. ISBN 978-0-387-96098-2MR 0804611 .
- ↑ بيرميخو، سيرجيو؛ كابيستاني، جوان (2001). "تحليل المكونات الرئيسية الموجه لمصنفات الهامش الكبير". الشبكات العصبية . 14 (10): 1447-1461 . doi : 10.1016/S0893-6080(01)00106-X . PMID 11771723 .
- أداء تقدير النقاط
- الانحراف الإحصائي والتشتت
- دوال الخسارة
- طريقة المربعات الصغرى
