التوقف المبكر
في مجال تعلم الآلة ، يُعد التوقف المبكر أحد أشكال التنظيم المستخدم لتجنب فرط التخصيص عند تدريب نموذج باستخدام طريقة تكرارية ، مثل خوارزمية التدرج الهبوطي . تُحدِّث هذه الطرق النموذج لتحسين ملاءمته لبيانات التدريب مع كل تكرار. إلى حدٍّ معين، يُحسِّن هذا أداء النموذج على البيانات خارج مجموعة التدريب (مثل مجموعة التحقق ). ولكن بعد تجاوز هذا الحد، يأتي تحسين ملاءمة النموذج لبيانات التدريب على حساب زيادة خطأ التعميم . تُقدِّم قواعد التوقف المبكر إرشادات حول عدد التكرارات التي يُمكن تشغيلها قبل أن يبدأ المُتعلِّم في فرط التخصيص. وقد استُخدمت قواعد التوقف المبكر في العديد من طرق تعلم الآلة المختلفة، مع تفاوت في الأساس النظري.
خلفية
يقدم هذا القسم بعض المفاهيم الأساسية للتعلم الآلي اللازمة لوصف أساليب التوقف المبكر.
الإفراط في التخصيص

تُدرّب خوارزميات التعلّم الآلي نموذجًا بناءً على مجموعة بيانات تدريبية محدودة . خلال هذا التدريب، يُقيّم النموذج بناءً على مدى دقة تنبؤه بالبيانات الواردة في مجموعة التدريب. عمومًا، يهدف نظام التعلّم الآلي إلى إنتاج نموذج قادر على التعميم، أي التنبؤ ببيانات لم يسبق رؤيتها. يحدث التجاوز في التدريب عندما يُطابق النموذج بيانات مجموعة التدريب بشكل جيد، ولكنه يُكبّد خطأ تعميم أكبر .
التنظيم
يشير مصطلح "التنظيم" في سياق التعلم الآلي إلى عملية تعديل خوارزمية التعلم لمنع فرط التخصيص. ويتضمن ذلك عادةً فرض نوع من قيود السلاسة على النموذج المُتعلم. [ 1 ] ويمكن فرض هذه السلاسة بشكل صريح، إما بتحديد عدد المعلمات في النموذج، أو بزيادة دالة التكلفة كما في تنظيم تيكهونوف . ويندرج تنظيم تيكهونوف، إلى جانب انحدار المكونات الرئيسية والعديد من مخططات التنظيم الأخرى، تحت مظلة التنظيم الطيفي، وهو تنظيم يتميز بتطبيق مرشح. كما ينتمي التوقف المبكر إلى هذه الفئة من الأساليب.
طرق الانحدار التدرجي
تُعدّ طرق التدرج الهبوطي من طرق التحسين التكرارية من الدرجة الأولى. في كل تكرار، يتم تحديث حل تقريبي لمسألة التحسين من خلال اتخاذ خطوة في اتجاه معاكس لتدرج دالة الهدف. باختيار حجم الخطوة المناسب، يمكن جعل هذه الطريقة تتقارب نحو الحد الأدنى المحلي لدالة الهدف. يُستخدم التدرج الهبوطي في التعلّم الآلي من خلال تعريف دالة خسارة تعكس خطأ المُتعلّم على مجموعة التدريب، ثم تقليل هذه الدالة.
التوقف المبكر بناءً على نتائج التحليل
التوقف المبكر في نظرية التعلم الإحصائي
يمكن استخدام التوقف المبكر لتنظيم مشاكل الانحدار غير البارامتري التي تُصادف في نظرية التعلم الإحصائي . بالنسبة لمساحة إدخال معينة،مساحة الإخراج،، وعينات مسحوبة من مقياس احتمالية غير معروف ،، على، والهدف من هذه المسائل هو تقريب دالة الانحدار ،، مقدمة من
أينهو التوزيع الشرطي عندناتج عن[ 2 ] من الخيارات الشائعة لتقريب دالة الانحدار استخدام دوال من فضاء هيلبرت ذي النواة المُستنسخة . [ 2 ] قد تكون هذه الفضاءات لانهائية الأبعاد، ما قد يُؤدي إلى حلول تُفرط في ملاءمة مجموعات التدريب مهما كان حجمها. لذا ، يُعدّ التنظيم بالغ الأهمية لهذه الطرق. ومن طرق تنظيم مسائل الانحدار غير البارامتري تطبيق قاعدة التوقف المبكر على إجراء تكراري مثل خوارزمية التدرج الهبوطي.
تعتمد قواعد التوقف المبكر المقترحة لهذه المسائل على تحليل الحدود العليا لخطأ التعميم كدالة لعدد التكرارات. وتُقدّم هذه القواعد توصيات بشأن عدد التكرارات التي يجب تشغيلها والتي يمكن حسابها قبل بدء عملية الحل. [ 3 ] [ 4 ]
مثال: خسارة المربعات الصغرى
(مقتبس من ياو، روساسكو وكابونيتو، 2007 [ 3 ] )
يتركوبالنظر إلى مجموعة من العينات
تم رسمها بشكل مستقل عن، تقليل الوظائف
أين،هو عضو في فضاء هيلبرت ذي النواة المُستنسخةأي تقليل المخاطر المتوقعة لدالة خسارة المربعات الصغرى.يعتمد ذلك على مقياس الاحتمالية غير المعروفلا يمكن استخدامه في الحسابات. بدلاً من ذلك، ضع في اعتبارك المخاطر التجريبية التالية
يتركولتكن التكرارات رقم t لخوارزمية التدرج الهبوطي المطبقة على المخاطر المتوقعة والتجريبية، على التوالي، حيث يتم تهيئة كلا التكرارين عند نقطة الأصل، ويستخدم كلاهما حجم الخطوة. التشكيل تكرار السكان ، والذي يتقارب إلىلكن لا يمكن استخدامها في الحساب، بينماتشكل هذه العملية تكرارًا نموذجيًا يتقارب عادةً إلى حل مفرط التخصيص.
نريد التحكم في الفرق بين المخاطر المتوقعة لتكرار العينة والحد الأدنى للمخاطر المتوقعة، أي المخاطر المتوقعة لدالة الانحدار:
يمكن إعادة كتابة هذا الفرق كمجموع حدين: الفرق في المخاطر المتوقعة بين تكرارات العينة وتكرارات السكان، والفرق بين تكرار السكان ودالة الانحدار:
تُقدّم هذه المعادلة مفاضلة بين التحيز والتباين ، والتي تُحلّ للحصول على قاعدة توقف مثلى قد تعتمد على التوزيع الاحتمالي غير المعروف . لهذه القاعدة حدود احتمالية مرتبطة بخطأ التعميم. للاطلاع على التحليل الذي أدى إلى قاعدة التوقف المبكر وحدودها، يُرجى الرجوع إلى المقالة الأصلية. [ 3 ] عمليًا، يمكن استخدام أساليب تعتمد على البيانات، مثل التحقق المتبادل، للحصول على قاعدة توقف تكيفية.
التوقف المبكر عن زيادة السرعة
يشير مصطلح "التعزيز" إلى مجموعة من الخوارزميات التي يتم فيها دمج مجموعة من المتعلمين الضعفاء (المتعلمين الذين يرتبطون ارتباطًا طفيفًا بالعملية الحقيقية) لإنتاج متعلم قوي . وقد ثبت، بالنسبة للعديد من خوارزميات التعزيز (بما في ذلك AdaBoost )، أن التنظيم عبر التوقف المبكر يمكن أن يوفر ضمانات للاتساق ، أي أن نتيجة الخوارزمية تقترب من الحل الحقيقي كلما ازداد عدد العينات إلى ما لا نهاية. [ 5 ] [ 6 ] [ 7 ] [ 8 ]
L2 - تعزيز
ترتبط طرق التعزيز ارتباطًا وثيقًا بطرق التدرج الهبوطي المذكورة أعلاه ، ويمكن اعتبارها طريقة تعزيز تعتمد علىالخسارة : تعزيز L 2. [ 3 ]
التوقف المبكر القائم على التحقق
تعمل قواعد التوقف المبكر هذه عن طريق تقسيم مجموعة التدريب الأصلية إلى مجموعة تدريب جديدة ومجموعة تحقق . يُستخدم الخطأ في مجموعة التحقق كمؤشر لخطأ التعميم لتحديد متى يبدأ التجاوز. تُستخدم هذه الأساليب في تدريب العديد من خوارزميات التعلم الآلي التكرارية، بما في ذلك الشبكات العصبية . يقدم بريشيلت الملخص التالي لتطبيق بسيط للتوقف المبكر القائم على التحقق من البيانات : [ 9 ]
- قسّم بيانات التدريب إلى مجموعة تدريب ومجموعة تحقق، على سبيل المثال بنسبة 2 إلى 1.
- قم بالتدريب فقط على مجموعة التدريب وقم بتقييم الخطأ لكل مثال على مجموعة التحقق من الصحة من حين لآخر، على سبيل المثال بعد كل خمس دورات تدريبية.
- أوقف التدريب بمجرد أن يصبح الخطأ في مجموعة التحقق أعلى مما كان عليه في المرة الأخيرة التي تم فحصها فيها.
- استخدم الأوزان التي كانت لدى الشبكة في تلك الخطوة السابقة كنتيجة لعملية التدريب.
— لوتز بريشيلت، التوقف المبكر – ولكن متى؟
يُعدّ التحقق المتقاطع بديلاً قابلاً للتطبيق في سيناريوهات غير السلاسل الزمنية. يتضمن هذا التحقق تقسيم البيانات إلى عدة أقسام، كل قسم عبارة عن مجموعة تدريب ومجموعة تحقق ، بدلاً من تقسيمها إلى قسم واحد. مع ذلك، فإن هذه العملية البسيطة تُصبح معقدة عملياً بسبب احتمال تذبذب خطأ التحقق أثناء التدريب، مما يُنتج العديد من القيم الدنيا المحلية. وقد أدى هذا التعقيد إلى ابتكار العديد من القواعد المخصصة لتحديد متى يبدأ التجاوز في التدريب. [ 9 ]
انظر أيضاً
- الشبكات العصبية
- التحقق المتبادل ، وخاصة باستخدام "مجموعة التحقق"
- تعزيز التعلم الآلي
- خطأ التعميم
- شبكة الخروج المبكر
- يُعدّ التوقف المبكر أحد الأساليب المستخدمة لمنع الإفراط في التخصيص.
- التنظيم (الرياضيات)
مراجع
- ↑ جيروسي، فيديريكو؛ مايكل جونز؛ توماسو بوجيو (1995-03-01). "نظرية التنظيم وهياكل الشبكات العصبية". الحوسبة العصبية . 7 (2): 219-269 . CiteSeerX 10.1.1.48.9258 . doi : 10.1162/neco.1995.7.2.219 . ISSN 0899-7667 . S2CID 49743910 .
- 1 2 سميل، ستيف؛ دينغ-شوان تشو (2007-08-01). "تقديرات نظرية التعلم عبر المؤثرات التكاملية وتقريباتها". التقريب البنّاء . 26 (2): 153-172 . CiteSeerX 10.1.1.210.722 . doi : 10.1007/s00365-006-0659-y . ISSN 0176-4276 . S2CID 5977083 .
- 1 2 3 4 ياو، يوان؛ لورينزو روساسكو؛ أندريا كابونيتو (2007-08-01). "حول التوقف المبكر في تعلم التدرج الهبوطي". التقريب البنّاء . 26 (2): 289-315 . CiteSeerX 10.1.1.329.2482 . doi : 10.1007/s00365-006-0663-2 . ISSN 0176-4276 . S2CID 8323954 .
- ↑ راسكوتي، جي؛ إم جيه واينرايت؛ بين يو (2011). "التوقف المبكر للانحدار غير البارامتري: قاعدة توقف مثلى تعتمد على البيانات". المؤتمر السنوي التاسع والأربعون لأليرتون للاتصالات والتحكم والحوسبة (أليرتون). الصفحات 1318-1325 . doi : 10.1109/Allerton.2011.6120320 .
- ↑ وينكسين جيانغ (فبراير 2004). "اتساق العملية لخوارزمية AdaBoost" . حوليات الإحصاء . 32 (1): 13-29 . doi : 10.1214/aos/1079120128 . ISSN 0090-5364 .
- ↑ بوهلمان، بيتر؛ بين يو (1 يونيو 2003). "التعزيز باستخدام دالة الخسارة L₂: الانحدار والتصنيف". مجلة الجمعية الإحصائية الأمريكية . 98 (462): 324-339 . doi : 10.1198/016214503000125 . ISSN 0162-1459 . JSTOR 30045243. S2CID 123059267 .
- ↑ تونغ تشانغ؛ بين يو (1 أغسطس/آب 2005). "التعزيز مع التوقف المبكر: التقارب والاتساق". حوليات الإحصاء . 33 (4): 1538-1579 . arXiv : math/0508276 . Bibcode : 2005math......8276Z . doi : 10.1214/009053605000000255 . ISSN: 0090-5364 . JSTOR : 3448617. S2CID : 13158356 .
- ↑ ستانكويتز، برنارد (2024-04-01). "التوقف المبكر لتعزيز L2 في النماذج الخطية عالية الأبعاد". حوليات الإحصاء . 52 (2): 491-518 . arXiv : 2210.07850 . doi : 10.1214/24-AOS2356 .
- 1 2 بريشيلت، لوتز؛ جينيفيف ب. أور (2012-01-01). "التوقف المبكر - ولكن متى؟". في غريغوار مونتافون؛ كلاوس-روبرت مولر (محرران). الشبكات العصبية: حيل المهنة . سلسلة محاضرات في علوم الحاسوب. سبرينغر برلين هايدلبرغ. ص 53-67 . doi : 10.1007/978-3-642-35289-8_5 . ISBN 978-3-642-35289-8.
- الشبكات العصبية الاصطناعية
