طريقة تدرج السياسة

تُعدّ طرق تدرج السياسة فئة من خوارزميات التعلم المعزز ، وفئة فرعية من طرق تحسين السياسة. على عكس الطرق القائمة على القيمة التي تتعلم دالة قيمة لاستخلاص سياسة، فإن طرق تحسين السياسة تتعلم دالة السياسة مباشرةً.π{\displaystyle \pi }التي تختار الإجراءات دون الرجوع إلى دالة القيمة. لكي يتم تطبيق تدرج السياسة، يجب أن تكون دالة السياسةπθ{\displaystyle \pi _{\theta }}يتم تحديدها بواسطة معامل قابل للتفاضلθ{\displaystyle \theta }[ 1 ]

ملخص

في التعلم المعزز القائم على السياسات، يكون الفاعل عبارة عن دالة سياسة ذات معلماتπθ{\displaystyle \pi _{\theta }}، أينθ{\displaystyle \theta }هي معايير الفاعل. يأخذ الفاعل حالة البيئة كمعامل.s{\displaystyle s}وينتج توزيعًا احتماليًاπθ(|s){\displaystyle \pi _{\theta }(\cdot \mid s)}.

إذا كانت مساحة الفعل منفصلة، ​​فإنأπθ(أ|s)=1{\displaystyle \sum _{a}\pi _{\theta }(a\mid s)=1}إذا كانت مساحة الفعل متصلة، فإنأπθ(أ|s)دأ=1{\displaystyle \int _{a}\pi _{\theta }(a\mid s)\mathrm {d} a=1}.

الهدف من تحسين السياسات هو إيجاد بعضθ{\displaystyle \theta }ذلك الذي يزيد من المكافأة العرضية المتوقعةج(θ){\displaystyle J(\theta )}:ج(θ)=هـπθ[ت=0تيγتRت|S0=s0]{\displaystyle J(\theta )=\mathbb {E} _{\pi _{\theta }}\left[\sum _{t=0}^{T}\gamma ^{t}R_{t}{\Big |}S_{0}=s_{0}\right]}أينγ{\displaystyle \gamma }هو عامل الخصم ،Rت{\displaystyle R_{t}}المكافأة في الخطوةت{\displaystyle t}،s0{\displaystyle s_{0}}هي الحالة الابتدائية، وتي{\displaystyle T}هو الأفق الزمني (الذي يمكن أن يكون لانهائيًا).

يُعرَّف تدرج السياسة على النحو التالي:θج(θ){\displaystyle \nabla _{\theta }J(\theta )}تُقدّر طرق تدرج السياسة المختلفة تدرج السياسة بشكل عشوائي بطرق مختلفة. والهدف من أي طريقة لتدرج السياسة هو تعظيم القيمة بشكل تكراري.ج(θ){\displaystyle J(\theta )}عن طريق التدرج الصاعد . ولأن الجزء الأساسي من أي طريقة لتدرج السياسة هو التقدير العشوائي لتدرج السياسة، فإنها تُدرس أيضًا تحت عنوان "تقدير تدرج مونت كارلو". [ 2 ]

تعزز

تدرج السياسة

كانت خوارزمية REINFORCE ، التي قدمها رونالد ج. ويليامز عام 1992، أول طريقة تعتمد على تدرج السياسة. [ 3 ] وهي تستند إلى متطابقة تدرج السياسة.θج(θ)=هـπθ[ت=0تيθlnπθ(أت|Sت)ت=0تي(γتRت)|S0=s0]{\displaystyle \nabla _{\theta }J(\theta )=\mathbb {E} _{\pi _{\theta }}\left[\sum _{t=0}^{T}\nabla _{\theta }\ln \pi _{\theta }(A_{t}\mid S_{t})\;\sum _{t=0}^{T}(\gamma ^{t}R_{t}){\Big |}S_{0}=s_{0}\right]}والتي يمكن تحسينها من خلال "حيلة السببية"، أي عن طريق ترجيح كل إجراء بالمكافآت من تلك الخطوة الزمنية فصاعدًا، [ 1 ]θج(θ)=هـπθ[ت=0تيθlnπθ(أت|Sت)τ=تتي(γτRτ)|S0=s0]{\displaystyle \nabla _{\theta }J(\theta )=\mathbb {E} _{\pi _{\theta }}\left[\sum _{t=0}^{T}\nabla _{\theta }\ln \pi _{\theta }(A_{t}\mid S_{t})\sum _{\tau =t}^{T}(\gamma ^{\tau }R_{\tau }){\Big |}S_{0}=s_{0}\right]}

اللمة إن القيمة المتوقعة لدالة النتيجة تساوي صفرًا، بشرط أي حالة حاضرة أو سابقة. أي، لأي0أناجتي{\displaystyle 0\leq i\leq j\leq T}وأي ولايةsأنا{\displaystyle s_{i}}لديناهـπθ[θlnπθ(أج|Sج)|Sأنا=sأنا]=0.{\displaystyle \mathbb {E} _{\pi _{\theta }}[\nabla _{\theta }\ln \pi _{\theta }(A_{j}|S_{j})|S_{i}=s_{i}]=0.}

علاوة على ذلك، إذاΨأنا{\textstyle \Psi _{i}}هو متغير عشوائي مستقل عنأأنا،Sأنا+1،أأنا+1،...{\textstyle A_{i},S_{i+1},A_{i+1},\dots }، ثمهـπθ[θlnπθ(أج|Sج)Ψأنا|Sأنا=sأنا]=0.{\displaystyle \mathbb {E} _{\pi _{\theta }}[\nabla _{\theta }\ln \pi _{\theta }(A_{j}|S_{j})\cdot \Psi _{i}|S_{i}=s_{i}]=0.}

البراهين
برهان اللمة

استخدم حيلة إعادة تحديد المعلمات .

هـπθ[θlnπθ(أج|Sج)|Sأنا=sأنا]=sPر(Sج=s|Sأنا=sأنا)أπθ(أ|s)θlnπθ(أ|s)=sPر(Sج=s|Sأنا=sأنا)أπθ(أ|s)θπθ(أ|s)πθ(أ|s)=sPر(Sج=s|Sأنا=sأنا)أθπθ(أ|s)=sPر(Sج=s|Sأنا=sأنا)θأπθ(أ|s)\begin{aligned}\mathbb{E}_{\pi_{\theta}}[\nabla_{\theta}\ln\pi_{\theta}(A_{j}|S_{j})|S_{i}=s_{i}]&=\sum_{s}Pr(S_{j}=s|S_{i}=s_{i})\sum_{a}\pi_{\theta}(a|s)\nabla_{\theta}\ln\pi_{\theta}(a|s)\\&=\sum_{s}Pr(S_{j}=s|S_{i}=s_{i})\sum_{a}\pi_{\theta}(a|s){\frac{\nabla_{\theta}\pi_{\theta}(a|s)}{\pi \begin{aligned}}\\&=\sum_{s}Pr(S_{j}=s|S_{i}=s_{i})\sum_{a}\nabla_{\theta}\pi_{\theta}(a|s)\\&=\sum_{s}Pr(S_{j}=s|S_{i}=s_{i})\nabla_{\theta}\sum_{a}\pi_{\theta}(a|s)\end{aligned}}}منذ السياسةπθ(أ|s){\displaystyle \pi _{\theta }(a|s)}هو توزيع احتمالي للأفعال في حالة معينة،أπθ(أ|s)=1{\textstyle \sum _{a}\pi _{\theta }(a|s)=1}.هـπθ[θlnπθ(أ|S)]=sPر(Sج=s|Sأنا=sأنا)θ(1)=sPر(Sج=s|Sأنا=sأنا)0=0{\displaystyle {\begin{aligned}\mathbb {E} _{\pi _{\theta }}[\nabla _{\theta }\ln \pi _{\theta }(A|S)]&=\sum _{s}Pr(S_{j}=s|S_{i}=s_{i})\nabla _{\theta }(1)\\&=\sum _{s}Pr(S_{j}=s|S_{i}=s_{i})0\\&=0\end{aligned}}}

بحسب قانون البرج والفرضية السابقة.

هـπθ[Ψأناθlnπθ(أج|Sج)|Sأنا=sأنا]=هـπθ[هـπθ[Ψأناθlnπθ(أج|Sج)|Sج]|Sأنا=sأنا]=هـπθ[Ψأناهـπθ[θlnπθ(أج|Sج)|Sج]|Sأنا=sأنا]=هـπθ[Ψأنا0|Sأنا=sأنا]=0\begin{aligned}\mathbb{E}_{\pi_{\theta}}\left[\Psi_{i}\nabla_{\theta}\ln\pi_{\theta}(A_{j}|S_{j})\Big|}S_{i}=s_{i}\right]&=\mathbb{E}_{\pi_{\theta}}\left[\mathbb{E}_{\pi_{\theta}}[\Psi_{i}\nabla_{\theta}\ln\pi_{\theta}(A_{j}|S_{j})|S_{j}]\Big|}S_{i}=s_{i}\right]\\&=\mathbb{E}_{\pi_{\theta}}\left[\Psi_{i}\mathbb {E} _{\pi _{\theta }}[\nabla _{\theta }\ln \pi _{\theta }(A_{j}|S_{j})|S_{j}]{\Big |}S_{i}=s_{i}\right]\\&=\mathbb {E} _{\pi _{\theta }}\left[\Psi _{i}0{\Big |}S_{i}=s_{i}\right]\\&=0\end{aligned}}}

إثبات الهويتين

بتطبيق حيلة إعادة تحديد المعلمات ،

θج(θ)=θهـπθ[أنا0:تيγأناRأنا|S0=s0]=هـπθ[(أنا0:تيγأناRأنا)θln(πθ(أ0،أ1،...،أتي|S0،S1،...،Sتي))|S0=s0]=هـπθ[(أنا0:تيγأناRأنا)ج0:تيθln(πθ(أج|Sج))|S0=s0]=هـπθ[أنا،ج0:تي(γأناRأنا)θlnπθ(أج|Sج)|S0=s0]{\displaystyle {\begin{aligned}\nabla _{\theta }J(\theta )&=\nabla _{\theta }\mathbb {E} _{\pi _{\theta }}\left[\sum _{i\in 0:T}\gamma ^{i}R_{i}{\Big |}S_{0}=s_{0}\right]\\&=\mathbb {E} _{\pi _{\theta }}\left[\left(\sum _{i\in 0:T}\gamma ^{i}R_{i}\right)\nabla _{\theta }\ln(\pi _{\theta }(A_{0},A_{1},\dots ,A_{T}|S_{0},S_{1},\dots ,S_{T})){\Big |}S_{0}=s_{0}\right]\\&=\mathbb {E} _{\pi _{\theta }}\left[\left(\sum _{i\in 0:T}\gamma ^{i}R_{i}\right)\sum _{j\in 0:T}\nabla _{\theta }\ln(\pi _{\theta }(A_{j}|S_{j})){\Big |}S_{0}=s_{0}\right]\\&=\mathbb {E} _{\pi _{\theta }}\left[\sum _{i,j\in 0:T}(\gamma ^{i}R_{i})\nabla _{\theta }\ln \pi _{\theta }(A_{j}|S_{j}){\Big |}S_{0}=s_{0}\right]\end{aligned}}} وهي المعادلة الأولى.

بحسب اللمة،هـπθ[(γأناRأنا)θlnπθ(أج|Sج)|S0=s0]=0{\displaystyle \mathbb {E} _{\pi _{\theta }}\left[(\gamma ^{i}R_{i})\nabla _{\theta }\ln \pi _{\theta }(A_{j}|S_{j}){\Big |}S_{0}=s_{0}\right]=0}لأي0أنا<جتي{\textstyle 0\leq i<j\leq T}وبإدخال هذا في الصيغة السابقة، نقوم بتصفير مثلث كامل من الحدود، لنحصل علىθج(θ)=هـπθ[0جأناتي(γأناRأنا)θlnπθ(أج|Sج)|S0=s0]=هـπθ[ج0:تيθlnπθ(أج|Sج)أناج:تي(γأناRأنا)|S0=s0]{\displaystyle {\begin{aligned}\nabla _{\theta }J(\theta )&=\mathbb {E} _{\pi _{\theta }}\left[\sum _{0\leq j\leq i\leq T}(\gamma ^{i}R_{i})\nabla _{\theta }\ln \pi _{\theta }(A_{j}|S_{j}){\Big |}S_{0}=s_{0}\right]\\&=\mathbb {E} _{\pi _{\theta }}\left[\sum _{j\in 0:T}\nabla _{\theta }\ln \pi _{\theta }(A_{j}|S_{j})\sum _{i\in j:T}(\gamma ^{i}R_{i}){\Big |}S_{0}=s_{0}\right]\end{aligned}}} وهي المعادلة الثانية.

وبالتالي، لدينا مقدر غير متحيز لتدرج السياسة:θج(θ)1شمالن=1شمال[ت=0تيθlnπθ(أت،ن|Sت،ن)τ=تتي(γτ-تRτ،ن)]{\displaystyle \nabla _{\theta }J(\theta )\approx {\frac {1}{N}}\sum _{n=1}^{N}\left[\sum _{t=0}^{T}\nabla _{\theta }\ln \pi _{\theta }(A_{t,n}\mid S_{t,n})\sum _{\tau =t}^{T}(\gamma ^{\tau -t}R_{\tau ,n})\right]}حيث الفهرسن{\displaystyle n}نطاقاتشمال{\displaystyle N}مسارات النشر باستخدام السياسةπθ{\displaystyle \pi _{\theta }}.

دالة التقييمθlnπθ(أت|Sت){\displaystyle \nabla _{\theta }\ln \pi _{\theta }(A_{t}\mid S_{t})}يمكن تفسير ذلك على أنه الاتجاه في فضاء المعلمات الذي يزيد من احتمالية اتخاذ إجراءأت{\displaystyle A_{t}}في الولايةSت{\displaystyle S_{t}}إذن، فإن تدرج السياسة هو متوسط ​​مرجح لجميع الاتجاهات الممكنة لزيادة احتمالية اتخاذ أي إجراء في أي حالة، ولكن يتم ترجيحه بإشارات المكافأة، بحيث إذا كان اتخاذ إجراء معين في حالة معينة مرتبطًا بمكافأة عالية، فسيتم تعزيز هذا الاتجاه بشكل كبير، والعكس صحيح.

الخوارزمية

خوارزمية REINFORCE عبارة عن حلقة تكرارية:

  1. طرحشمال{\displaystyle N}المسارات في البيئة، باستخدامπθت{\displaystyle \pi _{\theta _{t}}}كوظيفة سياسية.
  2. احسب تقدير تدرج السياسة:زأنا1شمالن=1شمال[ت=0تيθتlnπθ(أت،ن|Sت،ن)τ=تتي(γτRτ،ن)]{\displaystyle g_{i}\leftarrow {\frac {1}{N}}\sum _{n=1}^{N}\left[\sum _{t=0}^{T}\nabla _{\theta _{t}}\ln \pi _{\theta }(A_{t,n}\mid S_{t,n})\sum _{\tau =t}^{T}(\gamma ^{\tau }R_{\tau ,n})\right]}
  3. قم بتحديث السياسة باستخدام أسلوب التدرج التصاعدي:θأنا+1θأنا+αأنازأنا{\displaystyle \theta _{i+1}\leftarrow \theta _{i}+\alpha _{i}g_{i}}

هنا،αأنا{\displaystyle \alpha _{i}}معدل التعلم في خطوة التحديثأنا{\displaystyle i}.

تقليل التباين

تُعتبر خوارزمية REINFORCE خوارزمية داخلية ، مما يعني أنه يجب أخذ عينات من المسارات المستخدمة للتحديث من السياسة الحالية.πθ{\displaystyle \pi _{\theta }}قد يؤدي ذلك إلى تباين كبير في التحديثات، حيث أن العوائدR(τ){\displaystyle R(\tau )}قد تختلف اختلافاً كبيراً بين المسارات. وقد تم تقديم العديد من المتغيرات لخوارزمية REINFORCE، تحت مسمى تقليل التباين .

تعزيز بالخط الأساسي

إحدى الطرق الشائعة لتقليل التباين هي خوارزمية REINFORCE مع خط الأساس ، والتي تعتمد على الهوية التالية:θج(θ)=هـπθ[ت=0تيθlnπθ(أت|Sت)(τ=تتي(γτRτ)-ب(Sت))|S0=s0]{\displaystyle \nabla _{\theta }J(\theta )=\mathbb {E} _{\pi _{\theta }}\left[\sum _{t=0}^{T}\nabla _{\theta }\ln \pi _{\theta }(A_{t}|S_{t})\left(\sum _{\tau =t}^{T}(\gamma ^{\tau }R_{\tau })-b(S_{t})\right){\Big |}S_{0}=s_{0}\right]}لأي وظيفةب:الولاياتR{\displaystyle b:{\text{States}}\to \mathbb {R} }ويمكن إثبات ذلك بتطبيق اللمة السابقة.

تستخدم الخوارزمية مقدر التدرج المعدلزأنا1شمالن=1شمال[ت=0تيθتlnπθ(أت،ن|Sت،ن)(τ=تتي(γτRτ،ن)-بأنا(Sت،ن))]{\displaystyle g_{i}\leftarrow {\frac {1}{N}}\sum _{n=1}^{N}\left[\sum _{t=0}^{T}\nabla _{\theta _{t}}\ln \pi _{\theta }(A_{t,n}|S_{t,n})\left(\sum _{\tau =t}^{T}(\gamma ^{\tau }R_{\tau ,n})-b_{i}(S_{t,n})\right)\right]}وتُعد خوارزمية REINFORCE الأصلية حالة خاصة حيثبأنا0{\displaystyle b_{i}\equiv 0}.

أساليب الممثل الناقد

لوبأنا{\textstyle b_{i}}يتم اختيارها بشكل جيد، بحيثبأنا(Sت)τ=تتي(γτRτ)=γتVπθأنا(Sت){\textstyle b_{i}(S_{t})\approx \sum _{\tau =t}^{T}(\gamma ^{\tau }R_{\tau })=\gamma ^{t}V^{\pi _{\theta _{i}}}(S_{t})}وهذا من شأنه أن يقلل بشكل كبير من التباين في تقدير التدرج. أي أن خط الأساس يجب أن يكون أقرب ما يمكن إلى دالة القيمة.Vπθأنا(Sت){\displaystyle V^{\pi _{\theta _{i}}}(S_{t})}قدر الإمكان، والاقتراب من المثال الأمثل لـ:θج(θ)=هـπθ[ت=0تيθlnπθ(أت|Sت)(τ=تتي(γτRτ)-γتVπθ(Sت))|S0=s0]{\displaystyle \nabla _{\theta }J(\theta )=\mathbb {E} _{\pi _{\theta }}\left[\sum _{t=0}^{T}\nabla _{\theta }\ln \pi _{\theta }(A_{t}|S_{t})\left(\sum _{\tau =t}^{T}(\gamma ^{\tau }R_{\tau })-\gamma ^{t}V^{\pi _{\theta }}(S_{t})\right){\Big |}S_{0}=s_{0}\right]}لاحظ أن السياسةπθت{\displaystyle \pi _{\theta _{t}}}التحديثات، دالة القيمةVπθأنا(Sت){\displaystyle V^{\pi _{\theta _{i}}}(S_{t})}يتم تحديث البيانات أيضًا، لذا يجب تحديث خط الأساس. يتمثل أحد الأساليب الشائعة في تدريب دالة منفصلة لتقدير دالة القيمة، واستخدامها كخط أساس. هذه إحدى طرق الممثل-الناقد ، حيث تمثل دالة السياسة الممثل، وتمثل دالة القيمة الناقد.

دالة Qسؤالπ{\displaystyle Q^{\pi }}ويمكن استخدامه أيضًا كناقد، لأنθج(θ)=هـπθ[0تتيγتθlnπθ(أت|Sت)سؤالπθ(Sت،أت)|S0=s0]{\displaystyle \nabla _{\theta }J(\theta )=E_{\pi _{\theta }}\left[\sum _{0\leq t\leq T}\gamma ^{t}\nabla _{\theta }\ln \pi _{\theta }(A_{t}|S_{t})\cdot Q^{\pi _{\theta }}(S_{t},A_{t}){\Big |}S_{0}=s_{0}\right]}وبحجة مماثلة باستخدام قانون البرج.

بطرح دالة القيمة كخط أساس، نجد أن دالة الميزةأπ(S،أ)=سؤالπ(S،أ)-Vπ(S){\displaystyle A^{\pi }(S,A)=Q^{\pi }(S,A)-V^{\pi }(S)}ويمكن استخدامه كناقد أيضًا:θج(θ)=هـπθ[0تتيγتθlnπθ(أت|Sت)أπθ(Sت،أت)|S0=s0]{\displaystyle \nabla _{\theta }J(\theta )=E_{\pi _{\theta }}\left[\sum _{0\leq t\leq T}\gamma ^{t}\nabla _{\theta }\ln \pi _{\theta }(A_{t}|S_{t})\cdot A^{\pi _{\theta }}(S_{t},A_{t}){\Big |}S_{0}=s_{0}\right]}باختصار، هناك العديد من المقدرات غير المتحيزة لـθجθ{\textstyle \nabla _{\theta }J_{\theta }}، وكلها على شكل:θج(θ)=هـπθ[0تتيθlnπθ(أت|Sت)Ψت|S0=s0]{\displaystyle \nabla _{\theta }J(\theta )=E_{\pi _{\theta }}\left[\sum _{0\leq t\leq T}\nabla _{\theta }\ln \pi _{\theta }(A_{t}|S_{t})\cdot \Psi _{t}{\Big |}S_{0}=s_{0}\right]}أينΨت{\textstyle \Psi _{t}}هو أي مجموع خطي للحدود التالية:

  • 0τتي(γτRτ){\textstyle \sum _{0\leq \tau \leq T}(\gamma ^{\tau }R_{\tau })}لم يُستخدم قط.
  • γتتτتي(γτ-تRτ){\textstyle \gamma ^{t}\sum _{t\leq \tau \leq T}(\gamma ^{\tau -t}R_{\tau })}: يستخدم بواسطة خوارزمية REINFORCE.
  • γتتτتي(γτ-تRτ)-ب(Sت){\textstyle \gamma ^{t}\sum _{t\leq \tau \leq T}(\gamma ^{\tau -t}R_{\tau })-b(S_{t})}: يستخدم بواسطة خوارزمية REINFORCE مع خط الأساس.
  • γت(Rت+γVπθ(Sت+1)-Vπθ(Sت)){\textstyle \gamma ^{t}\left(R_{t}+\gamma V^{\pi _{\theta }}(S_{t+1})-V^{\pi _{\theta }}(S_{t})\right)}التعلم الرقمي بخطوة واحدة.
  • γتسؤالπθ(Sت،أت){\textstyle \gamma ^{t}Q^{\pi _{\theta }}(S_{t},A_{t})}.
  • γتأπθ(Sت،أت){\textstyle \gamma ^{t}A^{\pi _{\theta }}(S_{t},A_{t})}.

بعض الاحتمالات الأخرىΨت{\textstyle \Psi _{t}}وهي كما يلي، مع براهين متشابهة للغاية.

  • γت(Rت+γRت+1+γ2Vπθ(Sت+2)-Vπθ(Sت)){\textstyle \gamma ^{t}\left(R_{t}+\gamma R_{t+1}+\gamma ^{2}V^{\pi _{\theta }}(S_{t+2})-V^{\pi _{\theta }}(S_{t})\right)}التعلم عبر الزمن بخطوتين.
  • γت(ك=0ن-1γكRت+ك+γنVπθ(Sت+ن)-Vπθ(Sت)){\textstyle \gamma ^{t}\left(\sum _{k=0}^{n-1}\gamma ^{k}R_{t+k}+\gamma ^{n}V^{\pi _{\theta }}(S_{t+n})-V^{\pi _{\theta }}(S_{t})\right)}التعلم الزمني ذو الخطوات المتعددة.
  • γتن=1λن-11-λ(ك=0ن-1γكRت+ك+γنVπθ(Sت+ن)-Vπθ(Sت)){\textstyle \gamma ^{t}\sum _{n=1}^{\infty }{\frac {\lambda ^{n-1}}{1-\lambda }}\cdot \left(\sum _{k=0}^{n-1}\gamma ^{k}R_{t+k}+\gamma ^{n}V^{\pi _{\theta }}(S_{t+n})-V^{\pi _{\theta }}(S_{t})\right)}: تعلم TD(λ)، المعروف أيضًا باسم GAE (تقدير الميزة المعمم) . [ 4 ] يتم الحصول على هذا من خلال مجموع متناقص أُسّيًا لخطوات تعلم TD.

التدرج الطبيعي للسياسة

تُعدّ طريقة التدرج الطبيعي للسياسة أحد أشكال طريقة التدرج للسياسة، التي اقترحها شام كاكادي عام 2001. [ 5 ] على عكس طرق التدرج القياسية للسياسة، التي تعتمد على اختيار المعلماتθ{\displaystyle \theta }(جعل التحديثات تعتمد على الإحداثيات)، يهدف تدرج السياسة الطبيعية إلى توفير تحديث خالٍ من الإحداثيات ، وهو "طبيعي" هندسيًا.

تحفيز

تحديثات تدرج السياسة القياسيةθأنا+1=θأنا+αθج(θأنا){\displaystyle \theta _{i+1}=\theta _{i}+\alpha \nabla _{\theta }J(\theta _{i})}حل مسألة تحسين مقيدة:{الأعلىθأنا+1ج(θأنا)+(θأنا+1-θأنا)تيθج(θأنا)θأنا+1-θأناαθج(θأنا){\displaystyle {\begin{cases}\max _{\theta _{i+1}}J(\theta _{i})+(\theta _{i+1}-\theta _{i})^{T}\nabla _{\theta }J(\theta _{i})\\\|\theta _{i+1}-\theta _{i}\|\leq \alpha \cdot \|\nabla _{\theta }J(\theta _{i})\|\end{cases}}} بينما يُعد الهدف (التحسين الخطي) ذا معنى هندسي، فإن القيد الإقليديθأنا+1-θأنا{\displaystyle \|\theta _{i+1}-\theta _{i}\|}يُدخل هذا الأمر تبعية الإحداثيات. ولمعالجة ذلك، يستبدل تدرج السياسة الطبيعية القيد الإقليدي بقيد تباعد كولباك-لايبير (KL):{الأعلىθأنا+1ج(θأنا)+(θأنا+1-θأنا)تيθج(θأنا)د¯كل(πθأنا+1πθأنا)ϵ{\displaystyle {\begin{cases}\max _{\theta _{i+1}}J(\theta _{i})+(\theta _{i+1}-\theta _{i})^{T}\nabla _{\theta }J(\theta _{i})\\{\bar {D}}_{KL}(\pi _{\theta _{i+1}}\|\pi _{\theta _{i}})\leq \epsilon \end{cases}}}حيث يتم حساب متوسط ​​تباعد كولباك-لايبير بين سياستين على توزيع الدولة في ظل السياسةπθأنا{\displaystyle \pi _{\theta _{i}}}. إنه،د¯كل(πθأنا+1πθأنا):=هـsπθأنا[دكل(πθأنا+1(|s)πθأنا(|s))]{\displaystyle {\bar {D}}_{KL}(\pi _{\theta _{i+1}}\|\pi _{\theta _{i}}):=\mathbb {E} _{s\sim \pi _{\theta _{i}}}[D_{KL}(\pi _{\theta _{i+1}}(\cdot |s)\|\pi _{\theta _{i}}(\cdot |s))]}وهذا يضمن أن التحديثات ثابتة بالنسبة لتحويلات المعلمات الأفينية القابلة للعكس.

تقريب معلومات فيشر

للصغارϵ{\displaystyle \epsilon }، يتم تقريب تباعد كولباك-لايبير بواسطة مقياس معلومات فيشر :د¯كل(πθأنا+1πθأنا)12(θأنا+1-θأنا)تيF(θأنا)(θأنا+1-θأنا){\displaystyle {\bar {D}}_{KL}(\pi _{\theta _{i+1}}\|\pi _{\theta _{i}})\approx {\frac {1}{2}}(\theta _{i+1}-\theta _{i})^{T}F(\theta _{i})(\theta _{i+1}-\theta _{i})}أينF(θ){\displaystyle F(\theta )}هي مصفوفة معلومات فيشر للسياسة، والتي تُعرَّف على النحو التالي:F(θ)=هـs،أπθ[θlnπθ(أ|s)(θlnπθ(أ|s))تي]{\displaystyle F(\theta )=\mathbb {E} _{s,a\sim \pi _{\theta }}\left[\nabla _{\theta }\ln \pi _{\theta }(a|s)\left(\nabla _{\theta }\ln \pi _{\theta }(a|s)\right)^{T}\right]}هذا يحول المشكلة إلى مشكلة في البرمجة التربيعية ، مما ينتج عنه تحديث تدرج السياسة الطبيعي:θأنا+1=θأنا+αF(θأنا)-1θج(θأنا){\displaystyle \theta _{i+1}=\theta _{i}+\alpha F(\theta _{i})^{-1}\nabla _{\theta }J(\theta _{i})}حجم الخطوةα{\displaystyle \alpha }يتم تعديلها عادةً للحفاظ على قيد KL، معα2ϵ(θج(θأنا))تيF(θأنا)-1θج(θأنا){\textstyle \alpha \approx {\sqrt {\frac {2\epsilon }{(\nabla _{\theta }J(\theta _{i}))^{T}F(\theta _{i})^{-1}\nabla _{\theta }J(\theta _{i})}}}}.

قلبF(θ){\displaystyle F(\theta )}تتطلب هذه العملية موارد حسابية كبيرة، خاصةً بالنسبة للمعاملات ذات الأبعاد العالية (مثل الشبكات العصبية). وغالبًا ما تستخدم التطبيقات العملية تقريبات.

تحسين سياسة منطقة الثقة (TRPO)

تُعدّ خوارزمية تحسين سياسة منطقة الثقة (TRPO) طريقةً تعتمد على تدرج السياسة، وهي تُوسّع نطاق منهج تدرج السياسة الطبيعي من خلال فرض قيد منطقة الثقة على تحديثات السياسة. [ 6 ] وقد طوّرها شولمان وآخرون في عام 2015، وهي تُحسّن من منهج تدرج السياسة الطبيعي.

يُعدّ التدرج الطبيعي الأمثل نظريًا إذا كانت الدالة الهدف دالة تربيعية فعلًا، لكن هذا مجرد تقريب. يسعى بحث الخط وقيد كولباك-لايبير في خوارزمية TRPO إلى حصر الحل ضمن "منطقة ثقة" لا ينهار فيها هذا التقريب. وهذا ما يجعل TRPO أكثر فعالية عمليًا.

التركيبة

على غرار تدرج السياسة الطبيعية، يقوم TRPO بتحديث معلمات السياسة بشكل متكررθ{\displaystyle \theta }عن طريق حل مسألة تحسين مقيدة محددة بدون إحداثيات:{الأعلىθل(θ،θأنا)د¯كل(πθπθأنا)ϵ{\displaystyle {\begin{cases}\max _{\theta }L(\theta ,\theta _{i})\\{\bar {D}}_{KL}(\pi _{\theta }\|\pi _{\theta _{i}})\leq \epsilon \end{cases}}}أين

  • ل(θ،θأنا)=هـs،أπθأنا[πθ(أ|s)πθأنا(أ|s)أπθأنا(s،أ)]{\displaystyle L(\theta ,\theta _{i})=\mathbb {E} _{s,a\sim \pi _{\theta _{i}}}\left[{\frac {\pi _{\theta }(a|s)}{\pi _{\theta _{i}}(a|s)}}A^{\pi _{\theta _{i}}}(s,a)\right]}وهي الميزة البديلة ، التي تقيس أداءπθ{\displaystyle \pi _{\theta }}مقارنة بالسياسة القديمةπθأنا{\displaystyle \pi _{\theta _{i}}}.
  • ϵ{\displaystyle \epsilon }نصف قطر منطقة الثقة.

تجدر الإشارة إلى أنه بشكل عام، توجد مزايا بديلة أخرى ممكنة:ل(θ،θأنا)=هـs،أπθأنا[πθ(أ|s)πθأنا(أ|s)Ψπθأنا(s،أ)]{\displaystyle L(\theta ,\theta _{i})=\mathbb {E} _{s,a\sim \pi _{\theta _{i}}}\left[{\frac {\pi _{\theta }(a|s)}{\pi _{\theta _{i}}(a|s)}}\Psi ^{\pi _{\theta _{i}}}(s,a)\right]}أينΨ{\displaystyle \Psi }هو أي مجموع خطي من النوع المذكور سابقًا. في الواقع، أوصت OpenAI باستخدام تقدير الميزة المعمم، بدلاً من الميزة البسيطة.أπθ{\displaystyle A^{\pi _{\theta }}}.

ميزة البديلل(θ،θت){\displaystyle L(\theta ,\theta _{t})}تم تصميمه ليتماشى مع تدرج السياسةθج(θ){\displaystyle \nabla _{\theta }J(\theta )}على وجه التحديد، عندماθ=θت{\displaystyle \theta =\theta _{t}}،θل(θ،θت){\displaystyle \nabla _{\theta }L(\theta ,\theta _{t})}يساوي تدرج السياسة المستمد من دالة الميزة: θج(θ)=هـ(s،أ)πθ[θlnπθ(أ|s)أπθ(s،أ)]=θل(θ،θت){\displaystyle \nabla _{\theta }J(\theta )=\mathbb {E} _{(s,a)\sim \pi _{\theta }}\left[\nabla _{\theta }\ln \pi _{\theta }(a|s)\cdot A^{\pi _{\theta }}(s,a)\right]=\nabla _{\theta }L(\theta ,\theta _{t})}لكن عندماθθأنا{\displaystyle \theta \neq \theta _{i}}هذا ليس صحيحاً بالضرورة. لذا فهو "بديل" عن الهدف الحقيقي.

كما هو الحال مع تدرج السياسة الطبيعية، بالنسبة لتحديثات السياسة الصغيرة، فإن TRPO تقارب الميزة البديلة وتباعد KL باستخدام متسلسلات تايلور حولθت{\displaystyle \theta _{t}}:ل(θ،θأنا)زتي(θ-θأنا)،د¯كوالالمبور(πθπθأنا)12(θ-θأنا)تيح(θ-θأنا)،{\displaystyle {\begin{aligned}L(\theta ,\theta _{i})&\approx g^{T}(\theta -\theta _{i}),\\{\bar {D}}_{\text{KL}}(\pi _{\theta }\|\pi _{\theta _{i}})&\approx {\frac {1}{2}}(\theta -\theta _{i})^{T}H(\theta -\theta _{i}),\end{aligned}}} أين:

  • ز=θل(θ،θأنا)|θ=θأنا{\displaystyle g=\nabla _{\theta }L(\theta ,\theta _{i}){\big |}_{\theta =\theta _{i}}}هو تدرج السياسة.
  • F=θ2د¯كوالالمبور(πθπθأنا)|θ=θأنا{\displaystyle F=\nabla _{\theta }^{2}{\bar {D}}_{\text{KL}}(\pi _{\theta }\|\pi _{\theta _{i}}){\big |}_{\theta =\theta _{i}}}هي مصفوفة معلومات فيشر.

يؤدي هذا إلى اختزال المشكلة إلى تحسين تربيعي، مما ينتج عنه تحديث تدرج السياسة الطبيعي: θأنا+1=θأنا+2ϵزتيF-1زF-1ز.{\displaystyle \theta _{i+1}=\theta _{i}+{\sqrt {\frac {2\epsilon }{g^{T}F^{-1}g}}}F^{-1}g.}حتى الآن، هذا يشبه إلى حد كبير طريقة التدرج الطبيعي. ومع ذلك، فإن TRPO يحسّنها من خلال تعديلين:

  • استخدم طريقة التدرج المترافق لحل المعادلة.x{\displaystyle x}فيFx=ز{\displaystyle Fx=g}بشكل تكراري دون عكس المصفوفة بشكل صريح.
  • استخدم البحث الخطي التراجعي لضمان استيفاء قيد منطقة الثقة. تحديدًا، يقوم بتراجع حجم الخطوة لضمان استيفاء قيد كولباك-لايبير وتحسين السياسة. أي أنه يختبر كلًا من حلول الاختبار التالية.θأنا+1=θأنا+2ϵxتيFxx،θأنا+α2ϵxتيFxx،θأنا+α22ϵxتيFxx،...{\displaystyle \theta _{i+1}=\theta _{i}+{\sqrt {\frac {2\epsilon }{x^{T}Fx}}}x,\;\theta _{i}+\alpha {\sqrt {\frac {2\epsilon }{x^{T}Fx}}}x,\;\theta _{i}+\alpha ^{2}{\sqrt {\frac {2\epsilon }{x^{T}Fx}}}x,\;\dots }إلى أن يجد حلاً واحداً يفي بشرط كولباك-ليبر.د¯كل(πθأنا+1πθأنا)ϵ{\displaystyle {\bar {D}}_{KL}(\pi _{\theta _{i+1}}\|\pi _{\theta _{i}})\leq \epsilon }وينتج عنه ارتفاعل(θأنا+1،θأنا)ل(θأنا،θأنا){\displaystyle L(\theta _{i+1},\theta _{i})\geq L(\theta _{i},\theta _{i})}. هنا،α(0،1){\displaystyle \alpha \in (0,1)}هو معامل التراجع.

تحسين السياسة التقريبية (PPO)

ومن التحسينات الأخرى تحسين السياسة التقريبية (PPO)، الذي يتجنب حتى حسابF(θ){\displaystyle F(\theta )}وF(θ)-1{\displaystyle F(\theta )^{-1}}عن طريق تقريب من الدرجة الأولى باستخدام نسب الاحتمال المقطوعة. [ 7 ]

على وجه التحديد، بدلاً من تعظيم ميزة البديلالأعلىθل(θ،θت)=هـs،أπθت[πθ(أ|s)πθت(أ|s)أπθت(s،أ)]{\displaystyle \max _{\theta }L(\theta ,\theta _{t})=\mathbb {E} _{s,a\sim \pi _{\theta _{t}}}\left[{\frac {\pi _{\theta }(a|s)}{\pi _{\theta _{t}}(a|s)}}A^{\pi _{\theta _{t}}}(s,a)\right]}في ظل قيد تباعد كولباك-لايبير، يتم إدخال القيد مباشرة في الميزة البديلة:الأعلىθهـs،أπθت[{مين(πθ(أ|s)πθت(أ|s)،1+ϵ)أπθت(s،أ) لو أπθت(s،أ)>0الأعلى(πθ(أ|s)πθت(أ|s)،1-ϵ)أπθت(s،أ) لو أπθت(s،أ)<0]{\displaystyle \max _{\theta }\mathbb {E} _{s,a\sim \pi _{\theta _{t}}}\left[{\begin{cases}\min \left({\frac {\pi _{\theta }(a|s)}{\pi _{\theta _{t}}(a|s)}},1+\epsilon \right)A^{\pi _{\theta _{t}}}(s,a)&{\text{ if }}A^{\pi _{\theta _{t}}}(s,a)>0\\\max \left({\frac {\pi _{\theta }(a|s)}{\pi _{\theta _{t}}(a|s)}},1-\epsilon \right)A^{\pi _{\theta _{t}}}(s,a)&{\text{ if }}A^{\pi _{\theta _{t}}}(s,a)<0\end{cases}}\right]}ويعمل PPO على زيادة الميزة البديلة عن طريق الانحدار التدرجي العشوائي، كالمعتاد.

بعبارة أخرى، يعني الصعود التدريجي لدالة الميزة البديلة الجديدة أنه في حالة ماs،أ{\displaystyle s,a}، إذا كانت الميزة إيجابية:أπθت(s،أ)>0{\displaystyle A^{\pi _{\theta _{t}}}(s,a)>0}إذاً، يجب أن يكون التدرج موجهاًθ{\displaystyle \theta }باتجاه الاتجاه الذي يزيد من احتمالية القيام بالعملأ{\displaystyle a}تحت الدولةs{\displaystyle s}ومع ذلك، بمجردθ{\displaystyle \theta }لقد تغير كثيراً لدرجةπθ(أ|s)(1+ϵ)πθت(أ|s){\displaystyle \pi _{\theta }(a|s)\geq (1+\epsilon )\pi _{\theta _{t}}(a|s)}إذاً، يجب أن يتوقف التدرج عن توجيهه في ذلك الاتجاه. وبالمثل إذاأπθت(s،أ)<0{\displaystyle A^{\pi _{\theta _{t}}}(s,a)<0}وبالتالي، يتجنب PPO الضغط على تحديث المعلمات بشكل مفرط، ويتجنب تغيير السياسة بشكل كبير.

وبعبارة أدق، للتحديثθت{\displaystyle \theta _{t}}لθت+1{\displaystyle \theta _{t+1}}يتطلب الأمر عدة خطوات تحديث على نفس دفعة البيانات. سيتم تهيئتهاθ=θت{\displaystyle \theta =\theta _{t}}ثم قم بتطبيق خوارزمية التدرج الهبوطي (مثل مُحسِّن آدم ) بشكل متكرر لتحديثθ{\displaystyle \theta }إلى أن تستقر ميزة البديل. ثم يتم التعيينθت+1{\displaystyle \theta _{t+1}}لθ{\displaystyle \theta }ثم كرر ذلك.

خلال هذه الحلقة الداخلية، يتم التحديث الأول إلىθ{\displaystyle \theta }لن يصيب1-ϵ،1+ϵ{\displaystyle 1-\epsilon ,1+\epsilon }حدود، ولكن كماθ{\displaystyle \theta }يتم تحديثها بشكل متزايد بعيدًا عنθت{\displaystyle \theta _{t}}في النهاية، يبدأ البرنامج بالوصول إلى الحدود. عند كل وصول إلى هذه الحدود، يصبح التدرج المقابل صفرًا، وبالتالي يتجنب PPO التحديث.θ{\displaystyle \theta }بعيد جدًا عنθت{\displaystyle \theta _{t}}.

هذا أمر مهم، لأن الخسارة البديلة تفترض أن زوج الحالة والفعلs،أ{\displaystyle s,a}يتم أخذ عينة مما سيراه الوكيل إذا قام الوكيل بتشغيل السياسةπθت{\displaystyle \pi _{\theta _{t}}}لكن ينبغي أن يكون تدرج السياسة متوافقًا مع السياسة. لذا، كماθ{\displaystyle \theta }مع تغير الظروف، يصبح التعويض البديل للخسارة خارج نطاق السياسة بشكل متزايد . ولهذا السبب، من الضروري الحفاظ علىθ{\displaystyle \theta }قريب منθت{\displaystyle \theta _{t}}ضروري.

إذا كانت هناك سياسة مرجعيةπمرجع{\displaystyle \pi _{\text{ref}}}بحيث لا تنحرف السياسة المدربة كثيراً عن ذلك، يمكن إضافة عقوبة انحراف KL إضافية:-βهـs،أπθت[سجل(πθ(أ|s)πمرجع(أ|s))]{\displaystyle -\beta \mathbb {E} _{s,a\sim \pi _{\theta _{t}}}\left[\log \left({\frac {\pi _{\theta }(a|s)}{\pi _{\text{ref}}(a|s)}}\right)\right]}أينβ{\displaystyle \beta }يُعدِّل هذا الأسلوب قوة العقوبة. وقد استُخدم في تدريب نماذج لغة الاستدلال باستخدام التعلم المعزز من خلال التغذية الراجعة البشرية . [ 8 ] يمكن تقدير حد عقوبة تباعد كولباك-لايبير بتباين أقل باستخدام الصيغة المكافئة (انظر تباعد f لمزيد من التفاصيل): [ 9 ]-βهـs،أπθت[سجل(πθ(أ|s)πمرجع(أ|s))+πمرجع(أ|s)πθ(أ|s)-1]{\displaystyle -\beta \mathbb {E} _{s,a\sim \pi _{\theta _{t}}}\left[\log \left({\frac {\pi _{\theta }(a|s)}{\pi _{\text{ref}}(a|s)}}\right)+{\frac {\pi _{\text{ref}}(a|s)}{\pi _{\theta }(a|s)}}-1\right]}

تحسين السياسة النسبية للمجموعات (GRPO)

يُعدّ تحسين السياسة النسبية للمجموعة (GRPO) شكلاً مُعدَّلاً من PPO، حيث يتم فيه حذف مُقدِّر دالة القيمة.V{\displaystyle V}بدلاً من ذلك، لكل ولايةs{\displaystyle s}يقوم بأخذ عينات من إجراءات متعددةأ1،...،أجي{\displaystyle a_{1},\dots ,a_{G}}من السياسةπθت{\displaystyle \pi _{\theta _{t}}}ثم احسب الميزة النسبية للمجموعة [ 9 ]أπθت(s،أج)=ر(s،أج)-μσ{\displaystyle A^{\pi _{\theta _{t}}}(s,a_{j})={\frac {r(s,a_{j})-\mu }{\sigma }}}أينμ،σ{\displaystyle \mu ,\sigma }يمثل المتوسط ​​والانحراف المعياري لـر(s،أ1)،...،ر(s،أجي){\displaystyle r(s,a_{1}),\dots ,r(s,a_{G})}أي أنها الدرجة المعيارية للمكافآت.

ثم يقوم بتعظيم هدف PPO، بمتوسط ​​جميع الإجراءات:الأعلىθ1جيأنا=1جيهـ(s،أ1،...،أجي)πθت[{مين(πθ(أأنا|s)πθت(أأنا|s)،1+ϵ)أπθت(s،أأنا) لو أπθت(s،أأنا)>0الأعلى(πθ(أأنا|s)πθت(أأنا|s)،1-ϵ)أπθت(s،أأنا) لو أπθت(s،أأنا)<0]{\displaystyle \max _{\theta }{\frac {1}{G}}\sum _{i=1}^{G}\mathbb {E} _{(s,a_{1},\dots ,a_{G})\sim \pi _{\theta _{t}}}\left[{\begin{cases}\min \left({\frac {\pi _{\theta }(a_{i}|s)}{\pi _{\theta _{t}}(a_{i}|s)}},1+\epsilon \right)A^{\pi _{\theta _{t}}}(s,a_{i})&{\text{ if }}A^{\pi _{\theta _{t}}}(s,a_{i})>0\\\max \left({\frac {\pi _{\theta }(a_{i}|s)}{\pi _{\theta _{t}}(a_{i}|s)}},1-\epsilon \right)A^{\pi _{\theta _{t}}}(s,a_{i})&{\text{ if }}A^{\pi _{\theta _{t}}}(s,a_{i})<0\end{cases}}\right]}بشكل بديهي، فإن كل خطوة لتحديث السياسة في GRPO تجعل السياسة أكثر عرضة للاستجابة لكل حالة بإجراء كان أداؤه أفضل نسبيًا من الإجراءات الأخرى التي تم تجربتها في تلك الحالة، وأقل عرضة للاستجابة بإجراء كان أداؤه أسوأ نسبيًا.

كما في السابق، يمكن تطبيق معامل جزاء كولباك-لايبر لتشجيع السياسة المدربة على البقاء قريبة من السياسة المرجعية. وقد طُرحت خوارزمية GRPO لأول مرة في سياق تدريب نماذج لغة الاستدلال من قبل باحثين في شركة DeepSeek . [ 9 ]

تحسين السياسات ومنظور الهبوط المرآوي (MDPO)

تشترك طرق مثل TRPO و PPO وتدرج السياسة الطبيعية في فكرة مشتركة - فبينما يجب تحديث السياسة في اتجاه تدرج السياسة، يجب أن يتم التحديث بطريقة آمنة ومستقرة، وعادة ما يتم قياسها بمسافة معينة بالنسبة للسياسة قبل التحديث.

يوجد مفهوم مشابه لاستقرار التحديث في تقنيات التحسين المحدب التقريبي مثل تقنية النزول المرآوي . [ 10 ] هناك،x{\textstyle \mathbf {x} }، المُصغِّر المُقترح لـو{\textstyle f}في مجموعة قيود معينةج{\textstyle {\mathcal {C}}}، يتم تحديثها بشكل متكرر في اتجاه التدرجو{\textstyle \nabla f}، مع فرض عقوبة تقارب بالنسبة للتيار الحاليxت{\textstyle \mathbf {x} _{t}}قياسًا ببعض تباعد بريغمانبω{\textstyle B_{\omega }}والتي يمكن صياغتها بالصيغة التالية:xت+1argمينxجو(xت)تي(x-xت)+1ηتبω(x،xت)،{\displaystyle \mathbf {x} _{t+1}\in \arg \min _{\mathbf {x} \in {\mathcal {C}}}\nabla f(\mathbf {x} _{t})^{T}(\mathbf {x} -\mathbf {x} _{t})+{\frac {1}{\eta _{t}}}B_{\omega }(x,x_{t}),}أين ηت{\textstyle \eta _{t}}يتحكم في التقارب بين التكرارات المتتالية، على غرار معدل التعلم في انحدار التدرج.

يؤدي هذا إلى إعادة النظر في إجراء تحديث السياسة كإجراء تحسين يهدف إلى إيجاد سياسة مثلى، في فضاء التحسين (غير المحدب) لعملية اتخاذ القرار ماركوف الأساسية (MDP). يُطلق على وجهة نظر التحسين هذه، التي تستخدم تدرج السياسة، اسم تحسين سياسة الهبوط المرآوي (MDPO)، [ 11 ] [ 12 ] مما يؤدي إلى التحديث التالي عندما يكون تباعد بريغمان هو تباعد كولباك-لايبير المُختار:πت+1argالأعلىπهـs،أπ[أπت(s،أ)]+1ηتدكل(π||πت){\displaystyle \pi _{t+1}\in \arg \max _{\pi }\mathbb {E} _{s,a\sim \pi }\left[A^{\pi _{t}}(s,a)\right]+{\frac {1}{\eta _{t}}}D_{KL}(\pi ||\pi _{t})}باستخدام سياسة محددة المعاييرπθ{\textstyle \pi _{\theta }}، تصبح خسارة MDPO كالتالي:الأعلىθل(θ،θت)=هـs،أπθت[πθ(أ|s)πθت(أ|s)أπθت(s،أ)]+1ηتدكل(πθ||πθت){\displaystyle \max _{\theta }L(\theta ,\theta _{t})=\mathbb {E} _{s,a\sim \pi _{\theta _{t}}}\left[{\frac {\pi _{\theta }(a|s)}{\pi _{\theta _{t}}(a|s)}}A^{\pi _{\theta _{t}}}(s,a)\right]+{\frac {1}{\eta _{t}}}D_{KL}(\pi _{\theta }||\pi _{\theta _{t}})}يمكن استخدام هذا الهدف بالتزامن مع تقنيات شائعة أخرى مثل تقنية القص المستخدمة في خوارزمية تحسين السياسات العامة (PPO). في الواقع، تظهر عقوبة تباعد كولباك-لايبير أيضًا في ورقة بحثية أصلية حول خوارزمية تحسين السياسات العامة [ 7 ] ، مما يشير إلى أن منظور خوارزمية تحسين السياسات العامة المتعددة (MDPO) يمثل توحيدًا نظريًا للمفاهيم الأساسية للاشتقاق الكامنة وراء العديد من تقنيات تدرج السياسات المتزامنة.

انظر أيضاً

مراجع

  1. 1 2 ساتون، ريتشارد س؛ ماكاليستر، ديفيد؛ سينغ، ساتيندر؛ منصور، يشاي (1999). "أساليب تدرج السياسة للتعلم المعزز مع تقريب الدالة" . التقدم في أنظمة معالجة المعلومات العصبية . 12. مطبعة معهد ماساتشوستس للتكنولوجيا.
  2. محمد، شاكر؛ روسكا، ميهايلا؛ فيغورنوف، مايكل؛ منيه، أندري (2020). "تقدير تدرج مونت كارلو في التعلم الآلي" . مجلة أبحاث التعلم الآلي . 21 (132): 1-62 . arXiv : 1906.10652 . ISSN 1533-7928 . 
  3. ويليامز، رونالد ج. (مايو 1992). "خوارزميات بسيطة لتتبع التدرج الإحصائي للتعلم المعزز الترابطي" . تعلم الآلة . 8 ( 3-4 ): 229-256 . doi : 10.1007/BF00992696 . ISSN 0885-6125 . 
  4. شولمان، جون؛ موريتز، فيليب؛ ليفين، سيرجي ؛ جوردان، مايكل؛ أبيل، بيتر (2018-10-20). "التحكم المستمر عالي الأبعاد باستخدام تقدير الميزة المعمم". arXiv : 1506.02438 [ cs.LG ].
  5. كاكادي، شام م (2001). "تدرج السياسة الطبيعية" . التقدم في أنظمة معالجة المعلومات العصبية . 14. مطبعة معهد ماساتشوستس للتكنولوجيا.
  6. شولمان، جون؛ ليفين، سيرجي؛ موريتز، فيليب؛ جوردان، مايكل؛ أبيل، بيتر (2015-07-06). "تحسين سياسة منطقة الثقة" . وقائع المؤتمر الدولي الثاني والثلاثين للتعلم الآلي . 37. ليل، فرنسا: JMLR.org: 1889-1897 .
  7. 1 2 شولمان، جون؛ وولسكي، فيليب؛ داريوال، برافولا؛ رادفورد، أليك؛ كليموف، أوليغ (2017-08-28). "خوارزميات تحسين السياسة التقريبية". arXiv : 1707.06347 [ cs.LG ].
  8. نيسان ستينون؛ لونغ أويانغ؛ جيفري وو؛ دانيال زيغلر؛ رايان لوي؛ تشيلسي فوس؛ أليك رادفورد؛ داريو أمودي؛ بول إف. كريستيانو (2020). "التعلم على التلخيص باستخدام التغذية الراجعة البشرية" . التطورات في أنظمة معالجة المعلومات العصبية . 33 .
  9. 1 2 3 شاو، تشيهونغ؛ وانغ، بيي. تشو، تشيهاو؛ شو، رونكسين؛ سونغ، جونشياو؛ بي شياو. تشانغ، هاوي؛ تشانغ، مينغتشوان. لي ، واي كيه (2024/04/27). “DeepSeekMath: دفع حدود الاستدلال الرياضي في نماذج اللغة المفتوحة”. أرخايف : 2402.03300 [ cs.CL ].
  10. أركادي نيميروفسكي وديفيد يودين. تعقيد المشكلة وكفاءة الأسلوب في التحسين. جون وايلي وأولاده، 1983.
  11. شاني، ليور؛ إفروني، يوناثان؛ مانور، شي (2020-04-03). "تحسين سياسة منطقة الثقة التكيفية: التقارب العالمي ومعدلات أسرع لأنظمة معالجة البيانات المتعددة المنتظمة" . وقائع مؤتمر AAAI حول الذكاء الاصطناعي . 34 (4): 5668-5675 . arXiv : 1909.02769 . doi : 10.1609/aaai.v34i04.6021 . ISSN 2374-3468 . 
  12. تومار، منان؛ شاني، ليئور؛ إيفروني، يوناثان؛ قوام زاده، محمد (2020-05-20). “تحسين سياسة نزول المرآة”. أرخايف : 2005.09814v5 [ cs.LG ].
  • ساتون، ريتشارد س.؛ بارتو، أندرو ج. (2018). التعلم المعزز: مقدمة . سلسلة الحوسبة التكيفية والتعلم الآلي (  الطبعة الثانية). كامبريدج، ماساتشوستس: مطبعة معهد ماساتشوستس للتكنولوجيا. ISBN 978-0-262-03924-6.
  • بيرتسيكاس، ديمتري ب. (2019). التعلم المعزز والتحكم الأمثل (  الطبعة الثانية). بلمونت، ماساتشوستس: أثينا ساينتيفيك. ISBN 978-1-886529-39-7.
  • جروسي، تشابا (2010). خوارزميات التعلم المعزز . محاضرات توليفية في الذكاء الاصطناعي والتعلم الآلي (  الطبعة الأولى). تشام: دار نشر سبرينغر الدولية. ISBN 978-3-031-00423-0.
  • محمد، شاكر؛ روسكا، ميهايلا؛ فيغورنوف، مايكل؛ منيه، أندري (2020). "تقدير تدرج مونت كارلو في التعلم الآلي" . مجلة أبحاث التعلم الآلي . 21 (132): 1-62 . arXiv : 1906.10652 . ISSN 1533-7928 .