طريقة تدرج السياسة
تُعدّ طرق تدرج السياسة فئة من خوارزميات التعلم المعزز ، وفئة فرعية من طرق تحسين السياسة. على عكس الطرق القائمة على القيمة التي تتعلم دالة قيمة لاستخلاص سياسة، فإن طرق تحسين السياسة تتعلم دالة السياسة مباشرةً.التي تختار الإجراءات دون الرجوع إلى دالة القيمة. لكي يتم تطبيق تدرج السياسة، يجب أن تكون دالة السياسةيتم تحديدها بواسطة معامل قابل للتفاضل[ 1 ]
ملخص
في التعلم المعزز القائم على السياسات، يكون الفاعل عبارة عن دالة سياسة ذات معلمات، أينهي معايير الفاعل. يأخذ الفاعل حالة البيئة كمعامل.وينتج توزيعًا احتماليًا.
إذا كانت مساحة الفعل منفصلة، فإنإذا كانت مساحة الفعل متصلة، فإن.
الهدف من تحسين السياسات هو إيجاد بعضذلك الذي يزيد من المكافأة العرضية المتوقعة:أينهو عامل الخصم ،المكافأة في الخطوة،هي الحالة الابتدائية، وهو الأفق الزمني (الذي يمكن أن يكون لانهائيًا).
يُعرَّف تدرج السياسة على النحو التالي:تُقدّر طرق تدرج السياسة المختلفة تدرج السياسة بشكل عشوائي بطرق مختلفة. والهدف من أي طريقة لتدرج السياسة هو تعظيم القيمة بشكل تكراري.عن طريق التدرج الصاعد . ولأن الجزء الأساسي من أي طريقة لتدرج السياسة هو التقدير العشوائي لتدرج السياسة، فإنها تُدرس أيضًا تحت عنوان "تقدير تدرج مونت كارلو". [ 2 ]
تعزز
تدرج السياسة
كانت خوارزمية REINFORCE ، التي قدمها رونالد ج. ويليامز عام 1992، أول طريقة تعتمد على تدرج السياسة. [ 3 ] وهي تستند إلى متطابقة تدرج السياسة.والتي يمكن تحسينها من خلال "حيلة السببية"، أي عن طريق ترجيح كل إجراء بالمكافآت من تلك الخطوة الزمنية فصاعدًا، [ 1 ]
اللمة — إن القيمة المتوقعة لدالة النتيجة تساوي صفرًا، بشرط أي حالة حاضرة أو سابقة. أي، لأيوأي ولايةلدينا
علاوة على ذلك، إذاهو متغير عشوائي مستقل عن، ثم
استخدم حيلة إعادة تحديد المعلمات .
منذ السياسةهو توزيع احتمالي للأفعال في حالة معينة،.
بحسب قانون البرج والفرضية السابقة.
بتطبيق حيلة إعادة تحديد المعلمات ،
وهي المعادلة الأولى.
بحسب اللمة،لأيوبإدخال هذا في الصيغة السابقة، نقوم بتصفير مثلث كامل من الحدود، لنحصل على وهي المعادلة الثانية.
وبالتالي، لدينا مقدر غير متحيز لتدرج السياسة:حيث الفهرسنطاقاتمسارات النشر باستخدام السياسة.
دالة التقييميمكن تفسير ذلك على أنه الاتجاه في فضاء المعلمات الذي يزيد من احتمالية اتخاذ إجراءفي الولايةإذن، فإن تدرج السياسة هو متوسط مرجح لجميع الاتجاهات الممكنة لزيادة احتمالية اتخاذ أي إجراء في أي حالة، ولكن يتم ترجيحه بإشارات المكافأة، بحيث إذا كان اتخاذ إجراء معين في حالة معينة مرتبطًا بمكافأة عالية، فسيتم تعزيز هذا الاتجاه بشكل كبير، والعكس صحيح.
الخوارزمية
خوارزمية REINFORCE عبارة عن حلقة تكرارية:
- طرحالمسارات في البيئة، باستخدامكوظيفة سياسية.
- احسب تقدير تدرج السياسة:
- قم بتحديث السياسة باستخدام أسلوب التدرج التصاعدي:
هنا،معدل التعلم في خطوة التحديث.
تقليل التباين
تُعتبر خوارزمية REINFORCE خوارزمية داخلية ، مما يعني أنه يجب أخذ عينات من المسارات المستخدمة للتحديث من السياسة الحالية.قد يؤدي ذلك إلى تباين كبير في التحديثات، حيث أن العوائدقد تختلف اختلافاً كبيراً بين المسارات. وقد تم تقديم العديد من المتغيرات لخوارزمية REINFORCE، تحت مسمى تقليل التباين .
تعزيز بالخط الأساسي
إحدى الطرق الشائعة لتقليل التباين هي خوارزمية REINFORCE مع خط الأساس ، والتي تعتمد على الهوية التالية:لأي وظيفةويمكن إثبات ذلك بتطبيق اللمة السابقة.
تستخدم الخوارزمية مقدر التدرج المعدلوتُعد خوارزمية REINFORCE الأصلية حالة خاصة حيث.
أساليب الممثل الناقد
لويتم اختيارها بشكل جيد، بحيثوهذا من شأنه أن يقلل بشكل كبير من التباين في تقدير التدرج. أي أن خط الأساس يجب أن يكون أقرب ما يمكن إلى دالة القيمة.قدر الإمكان، والاقتراب من المثال الأمثل لـ:لاحظ أن السياسةالتحديثات، دالة القيمةيتم تحديث البيانات أيضًا، لذا يجب تحديث خط الأساس. يتمثل أحد الأساليب الشائعة في تدريب دالة منفصلة لتقدير دالة القيمة، واستخدامها كخط أساس. هذه إحدى طرق الممثل-الناقد ، حيث تمثل دالة السياسة الممثل، وتمثل دالة القيمة الناقد.
دالة Qويمكن استخدامه أيضًا كناقد، لأنوبحجة مماثلة باستخدام قانون البرج.
بطرح دالة القيمة كخط أساس، نجد أن دالة الميزةويمكن استخدامه كناقد أيضًا:باختصار، هناك العديد من المقدرات غير المتحيزة لـ، وكلها على شكل:أينهو أي مجموع خطي للحدود التالية:
- لم يُستخدم قط.
- : يستخدم بواسطة خوارزمية REINFORCE.
- : يستخدم بواسطة خوارزمية REINFORCE مع خط الأساس.
- التعلم الرقمي بخطوة واحدة.
- .
- .
بعض الاحتمالات الأخرىوهي كما يلي، مع براهين متشابهة للغاية.
- التعلم عبر الزمن بخطوتين.
- التعلم الزمني ذو الخطوات المتعددة.
- : تعلم TD(λ)، المعروف أيضًا باسم GAE (تقدير الميزة المعمم) . [ 4 ] يتم الحصول على هذا من خلال مجموع متناقص أُسّيًا لخطوات تعلم TD.
التدرج الطبيعي للسياسة
تُعدّ طريقة التدرج الطبيعي للسياسة أحد أشكال طريقة التدرج للسياسة، التي اقترحها شام كاكادي عام 2001. [ 5 ] على عكس طرق التدرج القياسية للسياسة، التي تعتمد على اختيار المعلمات(جعل التحديثات تعتمد على الإحداثيات)، يهدف تدرج السياسة الطبيعية إلى توفير تحديث خالٍ من الإحداثيات ، وهو "طبيعي" هندسيًا.
تحفيز
تحديثات تدرج السياسة القياسيةحل مسألة تحسين مقيدة: بينما يُعد الهدف (التحسين الخطي) ذا معنى هندسي، فإن القيد الإقليدييُدخل هذا الأمر تبعية الإحداثيات. ولمعالجة ذلك، يستبدل تدرج السياسة الطبيعية القيد الإقليدي بقيد تباعد كولباك-لايبير (KL):حيث يتم حساب متوسط تباعد كولباك-لايبير بين سياستين على توزيع الدولة في ظل السياسة. إنه،وهذا يضمن أن التحديثات ثابتة بالنسبة لتحويلات المعلمات الأفينية القابلة للعكس.
تقريب معلومات فيشر
للصغار، يتم تقريب تباعد كولباك-لايبير بواسطة مقياس معلومات فيشر :أينهي مصفوفة معلومات فيشر للسياسة، والتي تُعرَّف على النحو التالي:هذا يحول المشكلة إلى مشكلة في البرمجة التربيعية ، مما ينتج عنه تحديث تدرج السياسة الطبيعي:حجم الخطوةيتم تعديلها عادةً للحفاظ على قيد KL، مع.
قلبتتطلب هذه العملية موارد حسابية كبيرة، خاصةً بالنسبة للمعاملات ذات الأبعاد العالية (مثل الشبكات العصبية). وغالبًا ما تستخدم التطبيقات العملية تقريبات.
تحسين سياسة منطقة الثقة (TRPO)
تُعدّ خوارزمية تحسين سياسة منطقة الثقة (TRPO) طريقةً تعتمد على تدرج السياسة، وهي تُوسّع نطاق منهج تدرج السياسة الطبيعي من خلال فرض قيد منطقة الثقة على تحديثات السياسة. [ 6 ] وقد طوّرها شولمان وآخرون في عام 2015، وهي تُحسّن من منهج تدرج السياسة الطبيعي.
يُعدّ التدرج الطبيعي الأمثل نظريًا إذا كانت الدالة الهدف دالة تربيعية فعلًا، لكن هذا مجرد تقريب. يسعى بحث الخط وقيد كولباك-لايبير في خوارزمية TRPO إلى حصر الحل ضمن "منطقة ثقة" لا ينهار فيها هذا التقريب. وهذا ما يجعل TRPO أكثر فعالية عمليًا.
التركيبة
على غرار تدرج السياسة الطبيعية، يقوم TRPO بتحديث معلمات السياسة بشكل متكررعن طريق حل مسألة تحسين مقيدة محددة بدون إحداثيات:أين
- وهي الميزة البديلة ، التي تقيس أداءمقارنة بالسياسة القديمة.
- نصف قطر منطقة الثقة.
تجدر الإشارة إلى أنه بشكل عام، توجد مزايا بديلة أخرى ممكنة:أينهو أي مجموع خطي من النوع المذكور سابقًا. في الواقع، أوصت OpenAI باستخدام تقدير الميزة المعمم، بدلاً من الميزة البسيطة..
ميزة البديلتم تصميمه ليتماشى مع تدرج السياسةعلى وجه التحديد، عندما،يساوي تدرج السياسة المستمد من دالة الميزة: لكن عندماهذا ليس صحيحاً بالضرورة. لذا فهو "بديل" عن الهدف الحقيقي.
كما هو الحال مع تدرج السياسة الطبيعية، بالنسبة لتحديثات السياسة الصغيرة، فإن TRPO تقارب الميزة البديلة وتباعد KL باستخدام متسلسلات تايلور حول: أين:
- هو تدرج السياسة.
- هي مصفوفة معلومات فيشر.
يؤدي هذا إلى اختزال المشكلة إلى تحسين تربيعي، مما ينتج عنه تحديث تدرج السياسة الطبيعي: حتى الآن، هذا يشبه إلى حد كبير طريقة التدرج الطبيعي. ومع ذلك، فإن TRPO يحسّنها من خلال تعديلين:
- استخدم طريقة التدرج المترافق لحل المعادلة.فيبشكل تكراري دون عكس المصفوفة بشكل صريح.
- استخدم البحث الخطي التراجعي لضمان استيفاء قيد منطقة الثقة. تحديدًا، يقوم بتراجع حجم الخطوة لضمان استيفاء قيد كولباك-لايبير وتحسين السياسة. أي أنه يختبر كلًا من حلول الاختبار التالية.إلى أن يجد حلاً واحداً يفي بشرط كولباك-ليبر.وينتج عنه ارتفاع. هنا،هو معامل التراجع.
تحسين السياسة التقريبية (PPO)
ومن التحسينات الأخرى تحسين السياسة التقريبية (PPO)، الذي يتجنب حتى حسابوعن طريق تقريب من الدرجة الأولى باستخدام نسب الاحتمال المقطوعة. [ 7 ]
على وجه التحديد، بدلاً من تعظيم ميزة البديلفي ظل قيد تباعد كولباك-لايبير، يتم إدخال القيد مباشرة في الميزة البديلة:ويعمل PPO على زيادة الميزة البديلة عن طريق الانحدار التدرجي العشوائي، كالمعتاد.
بعبارة أخرى، يعني الصعود التدريجي لدالة الميزة البديلة الجديدة أنه في حالة ما، إذا كانت الميزة إيجابية:إذاً، يجب أن يكون التدرج موجهاًباتجاه الاتجاه الذي يزيد من احتمالية القيام بالعملتحت الدولةومع ذلك، بمجردلقد تغير كثيراً لدرجةإذاً، يجب أن يتوقف التدرج عن توجيهه في ذلك الاتجاه. وبالمثل إذاوبالتالي، يتجنب PPO الضغط على تحديث المعلمات بشكل مفرط، ويتجنب تغيير السياسة بشكل كبير.
وبعبارة أدق، للتحديثليتطلب الأمر عدة خطوات تحديث على نفس دفعة البيانات. سيتم تهيئتهاثم قم بتطبيق خوارزمية التدرج الهبوطي (مثل مُحسِّن آدم ) بشكل متكرر لتحديثإلى أن تستقر ميزة البديل. ثم يتم التعيينلثم كرر ذلك.
خلال هذه الحلقة الداخلية، يتم التحديث الأول إلىلن يصيبحدود، ولكن كمايتم تحديثها بشكل متزايد بعيدًا عنفي النهاية، يبدأ البرنامج بالوصول إلى الحدود. عند كل وصول إلى هذه الحدود، يصبح التدرج المقابل صفرًا، وبالتالي يتجنب PPO التحديث.بعيد جدًا عن.
هذا أمر مهم، لأن الخسارة البديلة تفترض أن زوج الحالة والفعليتم أخذ عينة مما سيراه الوكيل إذا قام الوكيل بتشغيل السياسةلكن ينبغي أن يكون تدرج السياسة متوافقًا مع السياسة. لذا، كمامع تغير الظروف، يصبح التعويض البديل للخسارة خارج نطاق السياسة بشكل متزايد . ولهذا السبب، من الضروري الحفاظ علىقريب منضروري.
إذا كانت هناك سياسة مرجعيةبحيث لا تنحرف السياسة المدربة كثيراً عن ذلك، يمكن إضافة عقوبة انحراف KL إضافية:أينيُعدِّل هذا الأسلوب قوة العقوبة. وقد استُخدم في تدريب نماذج لغة الاستدلال باستخدام التعلم المعزز من خلال التغذية الراجعة البشرية . [ 8 ] يمكن تقدير حد عقوبة تباعد كولباك-لايبير بتباين أقل باستخدام الصيغة المكافئة (انظر تباعد f لمزيد من التفاصيل): [ 9 ]
تحسين السياسة النسبية للمجموعات (GRPO)
يُعدّ تحسين السياسة النسبية للمجموعة (GRPO) شكلاً مُعدَّلاً من PPO، حيث يتم فيه حذف مُقدِّر دالة القيمة.بدلاً من ذلك، لكل ولايةيقوم بأخذ عينات من إجراءات متعددةمن السياسةثم احسب الميزة النسبية للمجموعة [ 9 ]أينيمثل المتوسط والانحراف المعياري لـأي أنها الدرجة المعيارية للمكافآت.
ثم يقوم بتعظيم هدف PPO، بمتوسط جميع الإجراءات:بشكل بديهي، فإن كل خطوة لتحديث السياسة في GRPO تجعل السياسة أكثر عرضة للاستجابة لكل حالة بإجراء كان أداؤه أفضل نسبيًا من الإجراءات الأخرى التي تم تجربتها في تلك الحالة، وأقل عرضة للاستجابة بإجراء كان أداؤه أسوأ نسبيًا.
كما في السابق، يمكن تطبيق معامل جزاء كولباك-لايبر لتشجيع السياسة المدربة على البقاء قريبة من السياسة المرجعية. وقد طُرحت خوارزمية GRPO لأول مرة في سياق تدريب نماذج لغة الاستدلال من قبل باحثين في شركة DeepSeek . [ 9 ]
تحسين السياسات ومنظور الهبوط المرآوي (MDPO)
تشترك طرق مثل TRPO و PPO وتدرج السياسة الطبيعية في فكرة مشتركة - فبينما يجب تحديث السياسة في اتجاه تدرج السياسة، يجب أن يتم التحديث بطريقة آمنة ومستقرة، وعادة ما يتم قياسها بمسافة معينة بالنسبة للسياسة قبل التحديث.
يوجد مفهوم مشابه لاستقرار التحديث في تقنيات التحسين المحدب التقريبي مثل تقنية النزول المرآوي . [ 10 ] هناك،، المُصغِّر المُقترح لـفي مجموعة قيود معينة، يتم تحديثها بشكل متكرر في اتجاه التدرج، مع فرض عقوبة تقارب بالنسبة للتيار الحاليقياسًا ببعض تباعد بريغمانوالتي يمكن صياغتها بالصيغة التالية:أين يتحكم في التقارب بين التكرارات المتتالية، على غرار معدل التعلم في انحدار التدرج.
يؤدي هذا إلى إعادة النظر في إجراء تحديث السياسة كإجراء تحسين يهدف إلى إيجاد سياسة مثلى، في فضاء التحسين (غير المحدب) لعملية اتخاذ القرار ماركوف الأساسية (MDP). يُطلق على وجهة نظر التحسين هذه، التي تستخدم تدرج السياسة، اسم تحسين سياسة الهبوط المرآوي (MDPO)، [ 11 ] [ 12 ] مما يؤدي إلى التحديث التالي عندما يكون تباعد بريغمان هو تباعد كولباك-لايبير المُختار:باستخدام سياسة محددة المعايير، تصبح خسارة MDPO كالتالي:يمكن استخدام هذا الهدف بالتزامن مع تقنيات شائعة أخرى مثل تقنية القص المستخدمة في خوارزمية تحسين السياسات العامة (PPO). في الواقع، تظهر عقوبة تباعد كولباك-لايبير أيضًا في ورقة بحثية أصلية حول خوارزمية تحسين السياسات العامة [ 7 ] ، مما يشير إلى أن منظور خوارزمية تحسين السياسات العامة المتعددة (MDPO) يمثل توحيدًا نظريًا للمفاهيم الأساسية للاشتقاق الكامنة وراء العديد من تقنيات تدرج السياسات المتزامنة.
انظر أيضاً
مراجع
- 1 2 ساتون، ريتشارد س؛ ماكاليستر، ديفيد؛ سينغ، ساتيندر؛ منصور، يشاي (1999). "أساليب تدرج السياسة للتعلم المعزز مع تقريب الدالة" . التقدم في أنظمة معالجة المعلومات العصبية . 12. مطبعة معهد ماساتشوستس للتكنولوجيا.
- ↑ محمد، شاكر؛ روسكا، ميهايلا؛ فيغورنوف، مايكل؛ منيه، أندري (2020). "تقدير تدرج مونت كارلو في التعلم الآلي" . مجلة أبحاث التعلم الآلي . 21 (132): 1-62 . arXiv : 1906.10652 . ISSN 1533-7928 .
- ↑ ويليامز، رونالد ج. (مايو 1992). "خوارزميات بسيطة لتتبع التدرج الإحصائي للتعلم المعزز الترابطي" . تعلم الآلة . 8 ( 3-4 ): 229-256 . doi : 10.1007/BF00992696 . ISSN 0885-6125 .
- ↑ شولمان، جون؛ موريتز، فيليب؛ ليفين، سيرجي ؛ جوردان، مايكل؛ أبيل، بيتر (2018-10-20). "التحكم المستمر عالي الأبعاد باستخدام تقدير الميزة المعمم". arXiv : 1506.02438 [ cs.LG ].
- ↑ كاكادي، شام م (2001). "تدرج السياسة الطبيعية" . التقدم في أنظمة معالجة المعلومات العصبية . 14. مطبعة معهد ماساتشوستس للتكنولوجيا.
- ↑ شولمان، جون؛ ليفين، سيرجي؛ موريتز، فيليب؛ جوردان، مايكل؛ أبيل، بيتر (2015-07-06). "تحسين سياسة منطقة الثقة" . وقائع المؤتمر الدولي الثاني والثلاثين للتعلم الآلي . 37. ليل، فرنسا: JMLR.org: 1889-1897 .
- 1 2 شولمان، جون؛ وولسكي، فيليب؛ داريوال، برافولا؛ رادفورد، أليك؛ كليموف، أوليغ (2017-08-28). "خوارزميات تحسين السياسة التقريبية". arXiv : 1707.06347 [ cs.LG ].
- ↑ نيسان ستينون؛ لونغ أويانغ؛ جيفري وو؛ دانيال زيغلر؛ رايان لوي؛ تشيلسي فوس؛ أليك رادفورد؛ داريو أمودي؛ بول إف. كريستيانو (2020). "التعلم على التلخيص باستخدام التغذية الراجعة البشرية" . التطورات في أنظمة معالجة المعلومات العصبية . 33 .
- 1 2 3 شاو، تشيهونغ؛ وانغ، بيي. تشو، تشيهاو؛ شو، رونكسين؛ سونغ، جونشياو؛ بي شياو. تشانغ، هاوي؛ تشانغ، مينغتشوان. لي ، واي كيه (2024/04/27). “DeepSeekMath: دفع حدود الاستدلال الرياضي في نماذج اللغة المفتوحة”. أرخايف : 2402.03300 [ cs.CL ].
- ↑ أركادي نيميروفسكي وديفيد يودين. تعقيد المشكلة وكفاءة الأسلوب في التحسين. جون وايلي وأولاده، 1983.
- ↑ شاني، ليور؛ إفروني، يوناثان؛ مانور، شي (2020-04-03). "تحسين سياسة منطقة الثقة التكيفية: التقارب العالمي ومعدلات أسرع لأنظمة معالجة البيانات المتعددة المنتظمة" . وقائع مؤتمر AAAI حول الذكاء الاصطناعي . 34 (4): 5668-5675 . arXiv : 1909.02769 . doi : 10.1609/aaai.v34i04.6021 . ISSN 2374-3468 .
- ↑ تومار، منان؛ شاني، ليئور؛ إيفروني، يوناثان؛ قوام زاده، محمد (2020-05-20). “تحسين سياسة نزول المرآة”. أرخايف : 2005.09814v5 [ cs.LG ].
- ساتون، ريتشارد س.؛ بارتو، أندرو ج. (2018). التعلم المعزز: مقدمة . سلسلة الحوسبة التكيفية والتعلم الآلي ( الطبعة الثانية). كامبريدج، ماساتشوستس: مطبعة معهد ماساتشوستس للتكنولوجيا. ISBN 978-0-262-03924-6.
- بيرتسيكاس، ديمتري ب. (2019). التعلم المعزز والتحكم الأمثل ( الطبعة الثانية). بلمونت، ماساتشوستس: أثينا ساينتيفيك. ISBN 978-1-886529-39-7.
- جروسي، تشابا (2010). خوارزميات التعلم المعزز . محاضرات توليفية في الذكاء الاصطناعي والتعلم الآلي ( الطبعة الأولى). تشام: دار نشر سبرينغر الدولية. ISBN 978-3-031-00423-0.
- محمد، شاكر؛ روسكا، ميهايلا؛ فيغورنوف، مايكل؛ منيه، أندري (2020). "تقدير تدرج مونت كارلو في التعلم الآلي" . مجلة أبحاث التعلم الآلي . 21 (132): 1-62 . arXiv : 1906.10652 . ISSN 1533-7928 .
روابط خارجية
- وينغ، ليليان (2018-04-08). "خوارزميات تدرج السياسة" . lilianweng.github.io . تاريخ الاسترجاع: 2025-01-25 .
- "تدرج السياسة الأساسية - وثائق Spinning Up" . spinningup.openai.com . تم الاطلاع عليه بتاريخ 25 يناير 2025 .
- التعلم المعزز
- خوارزميات التعلم الآلي
- خوارزميات وأساليب التحسين
