خوارزمية الممثل الناقد

خوارزمية الممثل -الناقد (AC) هي عائلة من خوارزميات التعلم المعزز (RL) التي تجمع بين خوارزميات التعلم المعزز القائمة على السياسة مثل طرق تدرج السياسة ، وخوارزميات التعلم المعزز القائمة على القيمة مثل تكرار القيمة، والتعلم Q ، و SARSA ، والتعلم TD . [ 1 ]

تتألف خوارزمية التحكم النشط من عنصرين رئيسيين: " فاعل " يحدد الإجراءات الواجب اتخاذها وفقًا لدالة السياسة، و" ناقد " يقيم تلك الإجراءات وفقًا لدالة القيمة. [ 2 ] بعض خوارزميات التحكم النشط تعمل ضمن السياسة، وبعضها خارجها. بعضها ينطبق على فضاءات الإجراءات المتصلة أو المنفصلة، ​​وبعضها الآخر يعمل في كلا الحالتين.

ملخص

يمكن فهم أساليب الممثل-الناقد على أنها تحسين على أساليب تدرج السياسة البحتة مثل REINFORCE من خلال إدخال خط أساس.

ممثل

يستخدم الممثل وظيفة السياسةπ(أ|s){\displaystyle \pi (a|s)}بينما يقوم الناقد بتقدير دالة القيمةV(s){\displaystyle V(s)}دالة Q لقيمة الفعلسؤال(s،أ)،{\displaystyle Q(s,a),}وظيفة الميزةأ(s،أ){\displaystyle A(s,a)}أو أي مزيج منها.

الممثل عبارة عن دالة ذات معلماتπθ{\displaystyle \pi _{\theta }}، أينθ{\displaystyle \theta }هي معايير الفاعل. يأخذ الفاعل حالة البيئة كمعامل.s{\displaystyle s}وينتج توزيعًا احتماليًاπθ(|s){\displaystyle \pi _{\theta }(\cdot |s)}.

إذا كانت مساحة الفعل منفصلة، ​​فإنأπθ(أ|s)=1{\displaystyle \sum _{a}\pi _{\theta }(a|s)=1}إذا كانت مساحة الفعل متصلة، فإنأπθ(أ|s)دأ=1{\displaystyle \int _{a}\pi _{\theta }(a|s)da=1}.

يهدف تحسين السياسات إلى تحسين أداء الفاعل. أي إيجاد بعضθ{\displaystyle \theta }ذلك الذي يزيد من المكافأة العرضية المتوقعةج(θ){\displaystyle J(\theta )}:ج(θ)=هـπθ[ت=0تيγترت]{\displaystyle J(\theta )=\mathbb {E} _{\pi _{\theta }}\left[\sum _{t=0}^{T}\gamma ^{t}r_{t}\right]}أينγ{\displaystyle \gamma }هو عامل الخصم ،رت{\displaystyle r_{t}}المكافأة في الخطوةت{\displaystyle t}، وتي{\displaystyle T}هو الأفق الزمني (الذي يمكن أن يكون لانهائيًا).

يهدف أسلوب تدرج السياسة إلى التحسينج(θ){\displaystyle J(\theta )}عن طريق الصعود التدريجي على تدرج السياسةج(θ){\displaystyle \nabla J(\theta )}.

كما هو موضح بالتفصيل في صفحة طريقة تدرج السياسة ، هناك العديد من المقدرات غير المتحيزة لتدرج السياسة:θج(θ)=هـπθ[0جتيθlnπθ(أج|Sج)Ψج|S0=s0]{\displaystyle \nabla _{\theta }J(\theta )=\mathbb {E} _{\pi _{\theta }}\left[\sum _{0\leq j\leq T}\nabla _{\theta }\ln \pi _{\theta }(A_{j}|S_{j})\cdot \Psi _{j}{\Big |}S_{0}=s_{0}\right]}أينΨج{\textstyle \Psi _{j}}هو مجموع خطي لما يلي:

  • 0أناتي(γأناRأنا){\textstyle \sum _{0\leq i\leq T}(\gamma ^{i}R_{i})}.
  • γججأناتي(γأنا-جRأنا){\textstyle \gamma ^{j}\sum _{j\leq i\leq T}(\gamma ^{ij}R_{i})}: خوارزمية التعزيز .
  • γججأناتي(γأنا-جRأنا)-ب(Sج){\textstyle \gamma ^{j}\sum _{j\leq i\leq T}(\gamma ^{ij}R_{i})-b(S_{j})}: خوارزمية REINFORCE مع خط الأساس. هناب{\displaystyle b}هي دالة اختيارية.
  • γج(Rج+γVπθ(Sج+1)-Vπθ(Sج)){\textstyle \gamma ^{j}\left(R_{j}+\gamma V^{\pi _{\theta }}(S_{j+1})-V^{\pi _{\theta }}(S_{j})\right)}: التعلم TD(1) .
  • γجسؤالπθ(Sج،أج){\textstyle \gamma ^{j}Q^{\pi _{\theta }}(S_{j},A_{j})}.
  • γجأπθ(Sج،أج){\textstyle \gamma ^{j}A^{\pi _{\theta }}(S_{j},A_{j})}: ميزة الممثل الناقد (A2C) . [ 3 ]
  • γج(Rج+γRج+1+γ2Vπθ(Sج+2)-Vπθ(Sج)){\textstyle \gamma ^{j}\left(R_{j}+\gamma R_{j+1}+\gamma ^{2}V^{\pi _{\theta }}(S_{j+2})-V^{\pi _{\theta }}(S_{j})\right)}: التعلم TD(2).
  • γج(ك=0ن-1γكRج+ك+γنVπθ(Sج+ن)-Vπθ(Sج)){\textstyle \gamma ^{j}\left(\sum _{k=0}^{n-1}\gamma ^{k}R_{j+k}+\gamma ^{n}V^{\pi _{\theta }}(S_{j+n})-V^{\pi _{\theta }}(S_{j})\right)}: التعلم TD(n).
  • γجن=1λن-11-λ(ك=0ن-1γكRج+ك+γنVπθ(Sج+ن)-Vπθ(Sج)){\textstyle \gamma ^{j}\sum _{n=1}^{\infty }{\frac {\lambda ^{n-1}}{1-\lambda }}\cdot \left(\sum _{k=0}^{n-1}\gamma ^{k}R_{j+k}+\gamma ^{n}V^{\pi _{\theta }}(S_{j+n})-V^{\pi _{\theta }}(S_{j})\right)}: تعلم TD(λ)، المعروف أيضًا باسم GAE (تقدير الميزة المعمم) . [ 4 ] يتم الحصول على هذا من خلال مجموع متناقص أُسّيًا لحدود تعلم TD(n).

الناقد

في المقدرات غير المتحيزة المذكورة أعلاه، توجد دوال معينة مثلVπθ،سؤالπθ،أπθ{\displaystyle V^{\pi _{\theta }},Q^{\pi _{\theta }},A^{\pi _{\theta }}}تظهر هذه القيم. ويتم تقريبها بواسطة الناقد . وبما أن هذه الوظائف تعتمد جميعها على الممثل، فيجب على الناقد أن يتعلم بالتوازي مع الممثل. ويتم تعلم الناقد بواسطة خوارزميات التعلم المعزز القائمة على القيمة.

على سبيل المثال، إذا كان الناقد يُقدّر دالة قيمة الحالةVπθ(s){\displaystyle V^{\pi _{\theta }}(s)}عندئذٍ، يمكن تعلمها بأي طريقة تقريب لدالة القيمة. لنفترض أن الناقد هو مُقَرِّب دالة.Vϕ(s){\displaystyle V_{\phi }(s)}مع المعلماتϕ{\displaystyle \phi }.

أبسط مثال على ذلك هو التعلم TD(1)، الذي يدرب الناقد على تقليل خطأ TD(1):دلتاأنا=Rأنا+γVϕ(Sأنا+1)-Vϕ(Sأنا){\displaystyle \delta _{i}=R_{i}+\gamma V_{\phi }(S_{i+1})-V_{\phi }(S_{i})}يتم تحديث معلمات الناقد عن طريق انحدار التدرج على خطأ TD التربيعي:ϕϕ-αϕ(دلتاأنا)2=ϕ+αدلتاأناϕVϕ(Sأنا){\displaystyle \phi \leftarrow \phi -\alpha \nabla _{\phi }(\delta _{i})^{2}=\phi +\alpha \delta _{i}\nabla _{\phi }V_{\phi }(S_{i})}أينα{\displaystyle \alpha }يمثل معدل التعلم. لاحظ أن التدرج يُحسب بالنسبة إلىϕ{\displaystyle \phi }فيVϕ(Sأنا){\displaystyle V_{\phi }(S_{i})}فقط، منذ أنϕ{\displaystyle \phi }فيγVϕ(Sأنا+1){\displaystyle \gamma V_{\phi }(S_{i+1})}يشكل هدفًا متحركًا، ولا يُحسب التدرج بالنسبة إليه. وهذا مصدر شائع للخطأ في التطبيقات التي تستخدم التفاضل التلقائي ، ويتطلب "إيقاف التدرج" عند تلك النقطة.

وبالمثل، إذا كان الناقد يُقدّر دالة قيمة الفعلسؤالπθ{\displaystyle Q^{\pi _{\theta }}}ثم يمكن تعلمها باستخدام خوارزمية Q-learning أو SARSA . في خوارزمية SARSA، يحتفظ الناقد بتقدير لدالة Q، مُعَلمة بواسطةϕ{\displaystyle \phi }، المشار إليه بـسؤالϕ(s،أ){\displaystyle Q_{\phi }(s,a)}ثم يتم حساب خطأ الفرق الزمني على النحو التالي:دلتاأنا=Rأنا+γسؤالθ(Sأنا+1،أأنا+1)-سؤالθ(Sأنا،أأنا){\displaystyle \delta _{i}=R_{i}+\gamma Q_{\theta }(S_{i+1},A_{i+1})-Q_{\theta }(S_{i},A_{i})}ثم يقوم الناقد بتحديث المعلومات.θθ+αدلتاأناθسؤالθ(Sأنا،أأنا){\displaystyle \theta \leftarrow \theta +\alpha \delta _{i}\nabla _{\theta }Q_{\theta }(S_{i},A_{i})}يمكن تدريب ناقد الميزة من خلال تدريب كل من دالة Qسؤالϕ(s،أ){\displaystyle Q_{\phi }(s,a)}ودالة قيمة الحالةVϕ(s){\displaystyle V_{\phi }(s)}ثم دعأϕ(s،أ)=سؤالϕ(s،أ)-Vϕ(s){\displaystyle A_{\phi }(s,a)=Q_{\phi }(s,a)-V_{\phi }(s)}على الرغم من ذلك، من الشائع أكثر تدريب دالة قيمة الحالة فقطVϕ(s){\displaystyle V_{\phi }(s)}ثم قم بتقدير الميزة بواسطة [ 3 ]أϕ(Sأنا،أأنا)ج0:ن-1γجRأنا+ج+γنVϕ(Sأنا+ن)-Vϕ(Sأنا){\displaystyle A_{\phi }(S_{i},A_{i})\approx \sum _{j\in 0:n-1}\gamma ^{j}R_{i+j}+\gamma ^{n}V_{\phi }(S_{i+n})-V_{\phi }(S_{i})}هنا،ن{\displaystyle n}هو عدد صحيح موجب. كلما زادن{\displaystyle n}أي أن التحيز في تقدير الميزة يكون أقل، ولكن على حساب زيادة التباين.

يقدم تقدير الميزة المعمم (GAE) معلمة فائقةλ{\displaystyle \lambda }التي تقوم بالاستكمال بسلاسة بين نتائج مونت كارلو (λ=1{\displaystyle \lambda =1}(تباين عالٍ، بدون تحيز) والتعلم الزمني الزمني بخطوة واحدة (λ=0{\displaystyle \lambda =0}(تباين منخفض، تحيز عالٍ). يمكن تعديل هذه المعلمة الفائقة لاختيار التوازن الأمثل بين التحيز والتباين في تقدير الميزة. وهي تستخدم متوسطًا متناقصًا أُسّيًا لعوائد n خطوة معλ{\displaystyle \lambda }كونها قوة الاضمحلال. [ 4 ]

المتغيرات

  • ميزة الممثل الناقد غير المتزامن (A3C) : نسخة متوازية وغير متزامنة من A2C. [ 3 ]
  • نموذج الممثل-الناقد المرن (SAC) : يدمج تعظيم الإنتروبيا لتحسين الاستكشاف. [ 5 ]
  • تدرج السياسة الحتمي العميق (DDPG) : متخصص في مساحات العمل المستمرة. [ 6 ]

انظر أيضاً

مراجع

  1. أرولكوماران، كاي؛ دايزنروث، مارك بيتر؛ بروندج، مايلز؛ بهارات، أنيل أنتوني (نوفمبر 2017). "التعلم العميق المعزز: دراسة موجزة". مجلة معالجة الإشارات IEEE . 34 (6): 26-38 . arXiv : 1708.05866 . Bibcode : 2017ISPM...34...26A . doi : 10.1109/MSP.2017.2743240 . ISSN 1053-5888 . 
  2. كوندا، فيجاي؛ تسيتسيكليس، جون (1999). "خوارزميات الممثل-الناقد" . التطورات في أنظمة معالجة المعلومات العصبية . 12. مطبعة معهد ماساتشوستس للتكنولوجيا.
  3. 1 2 3 منيه، فولوديمير؛ باديا، أدريا بويغدومينيك؛ ميرزا، مهدي؛ غريفز، أليكس؛ ليليكرب، تيموثي ب.؛ هارلي، تيم؛ سيلفر، ديفيد؛ كافوكوغلو، كوراي (2016-06-16)، أساليب غير متزامنة للتعلم العميق المعزز ، arXiv : 1602.01783
  4. 1 2 شولمان، جون؛ موريتز، فيليب؛ ليفين، سيرجي ؛ جوردان، مايكل؛ أبيل، بيتر (2018-10-20)، التحكم المستمر عالي الأبعاد باستخدام تقدير الميزة المعمم ، arXiv : 1506.02438
  5. ^ هارنوجا ، توماس. تشو، أوريك. هارتيكينن، كريستيان؛ تاكر، جورج؛ ها، سيهون؛ تان، جي. كومار، فيكاش؛ تشو، هنري. غوبتا، أبهيشيك (29/01/2019)، خوارزميات وتطبيقات نقد الممثل الناعم ، أرخايف : 1812.05905
  6. ^ ليليكراب ، تيموثي ب. هانت، جوناثان J.؛ بريتزل، الكسندر. هيس، نيكولاس. إيريز، توم؛ تاسا، يوفال؛ الفضة، ديفيد؛ ويرسترا، دان (2019-07-05)، التحكم المستمر مع التعلم المعزز العميق ، أرخايف : 1509.02971