خوارزمية الممثل الناقد
خوارزمية الممثل -الناقد (AC) هي عائلة من خوارزميات التعلم المعزز (RL) التي تجمع بين خوارزميات التعلم المعزز القائمة على السياسة مثل طرق تدرج السياسة ، وخوارزميات التعلم المعزز القائمة على القيمة مثل تكرار القيمة، والتعلم Q ، و SARSA ، والتعلم TD . [ 1 ]
تتألف خوارزمية التحكم النشط من عنصرين رئيسيين: " فاعل " يحدد الإجراءات الواجب اتخاذها وفقًا لدالة السياسة، و" ناقد " يقيم تلك الإجراءات وفقًا لدالة القيمة. [ 2 ] بعض خوارزميات التحكم النشط تعمل ضمن السياسة، وبعضها خارجها. بعضها ينطبق على فضاءات الإجراءات المتصلة أو المنفصلة، وبعضها الآخر يعمل في كلا الحالتين.
ملخص
يمكن فهم أساليب الممثل-الناقد على أنها تحسين على أساليب تدرج السياسة البحتة مثل REINFORCE من خلال إدخال خط أساس.
ممثل
يستخدم الممثل وظيفة السياسةبينما يقوم الناقد بتقدير دالة القيمةدالة Q لقيمة الفعلوظيفة الميزةأو أي مزيج منها.
الممثل عبارة عن دالة ذات معلمات، أينهي معايير الفاعل. يأخذ الفاعل حالة البيئة كمعامل.وينتج توزيعًا احتماليًا.
إذا كانت مساحة الفعل منفصلة، فإنإذا كانت مساحة الفعل متصلة، فإن.
يهدف تحسين السياسات إلى تحسين أداء الفاعل. أي إيجاد بعضذلك الذي يزيد من المكافأة العرضية المتوقعة:أينهو عامل الخصم ،المكافأة في الخطوة، وهو الأفق الزمني (الذي يمكن أن يكون لانهائيًا).
يهدف أسلوب تدرج السياسة إلى التحسينعن طريق الصعود التدريجي على تدرج السياسة.
كما هو موضح بالتفصيل في صفحة طريقة تدرج السياسة ، هناك العديد من المقدرات غير المتحيزة لتدرج السياسة:أينهو مجموع خطي لما يلي:
- .
- : خوارزمية التعزيز .
- : خوارزمية REINFORCE مع خط الأساس. هناهي دالة اختيارية.
- : التعلم TD(1) .
- .
- : ميزة الممثل الناقد (A2C) . [ 3 ]
- : التعلم TD(2).
- : التعلم TD(n).
- : تعلم TD(λ)، المعروف أيضًا باسم GAE (تقدير الميزة المعمم) . [ 4 ] يتم الحصول على هذا من خلال مجموع متناقص أُسّيًا لحدود تعلم TD(n).
الناقد
في المقدرات غير المتحيزة المذكورة أعلاه، توجد دوال معينة مثلتظهر هذه القيم. ويتم تقريبها بواسطة الناقد . وبما أن هذه الوظائف تعتمد جميعها على الممثل، فيجب على الناقد أن يتعلم بالتوازي مع الممثل. ويتم تعلم الناقد بواسطة خوارزميات التعلم المعزز القائمة على القيمة.
على سبيل المثال، إذا كان الناقد يُقدّر دالة قيمة الحالةعندئذٍ، يمكن تعلمها بأي طريقة تقريب لدالة القيمة. لنفترض أن الناقد هو مُقَرِّب دالة.مع المعلمات.
أبسط مثال على ذلك هو التعلم TD(1)، الذي يدرب الناقد على تقليل خطأ TD(1):يتم تحديث معلمات الناقد عن طريق انحدار التدرج على خطأ TD التربيعي:أينيمثل معدل التعلم. لاحظ أن التدرج يُحسب بالنسبة إلىفيفقط، منذ أنفييشكل هدفًا متحركًا، ولا يُحسب التدرج بالنسبة إليه. وهذا مصدر شائع للخطأ في التطبيقات التي تستخدم التفاضل التلقائي ، ويتطلب "إيقاف التدرج" عند تلك النقطة.
وبالمثل، إذا كان الناقد يُقدّر دالة قيمة الفعلثم يمكن تعلمها باستخدام خوارزمية Q-learning أو SARSA . في خوارزمية SARSA، يحتفظ الناقد بتقدير لدالة Q، مُعَلمة بواسطة، المشار إليه بـثم يتم حساب خطأ الفرق الزمني على النحو التالي:ثم يقوم الناقد بتحديث المعلومات.يمكن تدريب ناقد الميزة من خلال تدريب كل من دالة Qودالة قيمة الحالةثم دععلى الرغم من ذلك، من الشائع أكثر تدريب دالة قيمة الحالة فقطثم قم بتقدير الميزة بواسطة [ 3 ]هنا،هو عدد صحيح موجب. كلما زادأي أن التحيز في تقدير الميزة يكون أقل، ولكن على حساب زيادة التباين.
يقدم تقدير الميزة المعمم (GAE) معلمة فائقةالتي تقوم بالاستكمال بسلاسة بين نتائج مونت كارلو ((تباين عالٍ، بدون تحيز) والتعلم الزمني الزمني بخطوة واحدة ((تباين منخفض، تحيز عالٍ). يمكن تعديل هذه المعلمة الفائقة لاختيار التوازن الأمثل بين التحيز والتباين في تقدير الميزة. وهي تستخدم متوسطًا متناقصًا أُسّيًا لعوائد n خطوة معكونها قوة الاضمحلال. [ 4 ]
المتغيرات
- ميزة الممثل الناقد غير المتزامن (A3C) : نسخة متوازية وغير متزامنة من A2C. [ 3 ]
- نموذج الممثل-الناقد المرن (SAC) : يدمج تعظيم الإنتروبيا لتحسين الاستكشاف. [ 5 ]
- تدرج السياسة الحتمي العميق (DDPG) : متخصص في مساحات العمل المستمرة. [ 6 ]
انظر أيضاً
مراجع
- ↑ أرولكوماران، كاي؛ دايزنروث، مارك بيتر؛ بروندج، مايلز؛ بهارات، أنيل أنتوني (نوفمبر 2017). "التعلم العميق المعزز: دراسة موجزة". مجلة معالجة الإشارات IEEE . 34 (6): 26-38 . arXiv : 1708.05866 . Bibcode : 2017ISPM...34...26A . doi : 10.1109/MSP.2017.2743240 . ISSN 1053-5888 .
- ↑ كوندا، فيجاي؛ تسيتسيكليس، جون (1999). "خوارزميات الممثل-الناقد" . التطورات في أنظمة معالجة المعلومات العصبية . 12. مطبعة معهد ماساتشوستس للتكنولوجيا.
- 1 2 3 منيه، فولوديمير؛ باديا، أدريا بويغدومينيك؛ ميرزا، مهدي؛ غريفز، أليكس؛ ليليكرب، تيموثي ب.؛ هارلي، تيم؛ سيلفر، ديفيد؛ كافوكوغلو، كوراي (2016-06-16)، أساليب غير متزامنة للتعلم العميق المعزز ، arXiv : 1602.01783
- 1 2 شولمان، جون؛ موريتز، فيليب؛ ليفين، سيرجي ؛ جوردان، مايكل؛ أبيل، بيتر (2018-10-20)، التحكم المستمر عالي الأبعاد باستخدام تقدير الميزة المعمم ، arXiv : 1506.02438
- ^ هارنوجا ، توماس. تشو، أوريك. هارتيكينن، كريستيان؛ تاكر، جورج؛ ها، سيهون؛ تان، جي. كومار، فيكاش؛ تشو، هنري. غوبتا، أبهيشيك (29/01/2019)، خوارزميات وتطبيقات نقد الممثل الناعم ، أرخايف : 1812.05905
- ^ ليليكراب ، تيموثي ب. هانت، جوناثان J.؛ بريتزل، الكسندر. هيس، نيكولاس. إيريز، توم؛ تاسا، يوفال؛ الفضة، ديفيد؛ ويرسترا، دان (2019-07-05)، التحكم المستمر مع التعلم المعزز العميق ، أرخايف : 1509.02971
- كوندا، فيجاي ر.؛ تسيتسيكليس، جون ن. (يناير 2003). "حول خوارزميات الممثل-الناقد" . مجلة SIAM للتحكم والتحسين . 42 (4): 1143-1166 . doi : 10.1137/S0363012901385691 . ISSN 0363-0129 .
- ساتون، ريتشارد س.؛ بارتو، أندرو ج. (2018). التعلم المعزز: مقدمة . سلسلة الحوسبة التكيفية والتعلم الآلي ( الطبعة الثانية). كامبريدج، ماساتشوستس: مطبعة معهد ماساتشوستس للتكنولوجيا. ISBN 978-0-262-03924-6.
- بيرتسيكاس، ديمتري ب. (2019). التعلم المعزز والتحكم الأمثل ( الطبعة الثانية). بلمونت، ماساتشوستس: أثينا ساينتيفيك. ISBN 978-1-886529-39-7.
- جروسي، تشابا (2010). خوارزميات التعلم المعزز . محاضرات توليفية في الذكاء الاصطناعي والتعلم الآلي ( الطبعة الأولى). تشام: دار نشر سبرينغر الدولية. ISBN 978-3-031-00423-0.
- غروندمان، إيفو؛ بوسونيو، لوسيان؛ لوبيز، غابرييل أ.د.؛ بابوسكا، روبرت (نوفمبر 2012). "دراسة استقصائية للتعلم المعزز القائم على نموذج الممثل-الناقد: تدرجات السياسة القياسية والطبيعية" . مجلة IEEE للمعاملات في الأنظمة والإنسان وعلم التحكم الآلي - الجزء ج: التطبيقات والمراجعات . 42 (6): 1291-1307 . رمز Bibcode : 2012ITHMS..42.1291G . doi : 10.1109/TSMCC.2012.2218595 . ISSN 1094-6977 .
- التعلم المعزز
- خوارزميات التعلم الآلي
- الذكاء الاصطناعي
