التنظيم (الرياضيات)

لا تُسبب الدالتان الخضراء والزرقاء أي خسارة على نقاط البيانات المُعطاة. ويمكن توجيه النموذج المُدرَّب لتفضيل الدالة الخضراء، التي قد تُعمِّم بشكل أفضل على المزيد من النقاط المُستمدة من التوزيع الأساسي غير المعروف، عن طريق التعديل.λ{\displaystyle \lambda }، وزن مصطلح التنظيم.

في الرياضيات والإحصاء والتمويل [ 1 ] وعلوم الحاسوب ، وخاصة في مجال التعلم الآلي والمسائل العكسية ، يُعدّ التنظيم عمليةً تُحوّل حلّ المسألة إلى حلّ أبسط. ويُستخدم غالبًا في حلّ المسائل غير المُحدّدة جيدًا أو لمنع التجاوز في التدريب [2 ] . ثمة ارتباط وثيق بين أساليب التنظيم والمناهج البايزية لحلّ هذه المسائل غير المُحدّدة جيدًا [ 3 ] .

على الرغم من إمكانية تقسيم إجراءات التنظيم بطرق عديدة، إلا أن التحديد التالي مفيد بشكل خاص:

  • التنظيم الصريح هو عملية تنظيم تُضاف فيها حدودٌ صريحة إلى مسألة التحسين. قد تكون هذه الحدود معلوماتٍ مسبقة ، أو عقوبات، أو قيودًا. يُستخدم التنظيم الصريح عادةً مع مسائل التحسين غير المُحددة جيدًا. يفرض حد التنظيم، أو العقوبة، تكلفةً على دالة التحسين لجعل الحل الأمثل فريدًا.
  • التنظيم الضمني هو جميع أشكال التنظيم الأخرى. ويشمل ذلك، على سبيل المثال، التوقف المبكر، واستخدام دالة خسارة قوية، واستبعاد القيم الشاذة. يُعدّ التنظيم الضمني شائعًا في مناهج التعلّم الآلي الحديثة، بما في ذلك انحدار التدرج العشوائي لتدريب الشبكات العصبية العميقة ، وطرق التجميع (مثل الغابات العشوائية وأشجار التدرج المعزز ).

في التنظيم الصريح، وبغض النظر عن المشكلة أو النموذج، يوجد دائمًا حدٌّ للبيانات، يُقابل احتمالية القياس، وحدٌّ للتنظيم يُقابل التوزيع الاحتمالي المسبق. وبدمج هذين الحدّين باستخدام الإحصاءات البايزية ، يُمكن حساب التوزيع الاحتمالي اللاحق، الذي يشمل كلا مصدري المعلومات، وبالتالي يُثبّت عملية التقدير. ومن خلال الموازنة بين الهدفين، يُمكن اختيار التوافق مع البيانات أو فرض التنظيم (لمنع التجاوز). يوجد فرع بحثي كامل يُعنى بجميع أنواع التنظيم الممكنة. عمليًا، عادةً ما يتم تجربة تنظيم مُحدد، ثم يتم حساب دالة كثافة الاحتمال المُناسبة لهذا التنظيم لتبرير الاختيار. كما يُمكن أن يكون هذا الاختيار مُبررًا منطقيًا أو بديهيًا.

في مجال التعلم الآلي ، يُشير مصطلح البيانات إلى بيانات التدريب، بينما يُشير مصطلح التنظيم إما إلى اختيار النموذج أو إلى تعديلات تُجرى على الخوارزمية. والهدف دائمًا هو تقليل خطأ التعميم ، أي نسبة الخطأ في النموذج المُدرَّب على مجموعة التقييم (بيانات الاختبار) وليس على بيانات التدريب. [ 4 ]

أحد أقدم استخدامات التنظيم هو تنظيم تيخونوف (انحدار ريدج)، المرتبط بطريقة المربعات الصغرى.

التنظيم في التعلم الآلي

في مجال تعلم الآلة ، يتمثل أحد التحديات الرئيسية في تمكين النماذج من التنبؤ بدقة بالنتائج على بيانات غير مرئية، وليس فقط على بيانات التدريب المألوفة. يُعدّ التنظيم ضروريًا لمعالجة مشكلة التجاوز في التدريب ، حيث يحفظ النموذج تفاصيل بيانات التدريب ولكنه يعجز عن التعميم على بيانات جديدة. يهدف التنظيم إلى تشجيع النماذج على تعلم الأنماط الأوسع نطاقًا داخل البيانات بدلًا من حفظها. صُممت تقنيات مثل التوقف المبكر ، والتنظيم L1 وL2 ، والتسرب لمنع التجاوز في التدريب والنقص فيه، وبالتالي تعزيز قدرة النموذج على التكيف مع البيانات الجديدة والأداء الجيد معها، مما يُحسّن من قدرة النموذج على التعميم. [ 5 ]

التوقف المبكر

يتوقف التدريب عندما يتدهور أداء التحقق، مما يمنع التجاوز في التدريب عن طريق التوقف قبل أن يحفظ النموذج بيانات التدريب. [ 5 ]

التنظيم L1 و L2

يضيف شروط جزائية إلى دالة التكلفة لتثبيط النماذج المعقدة:

  • يؤدي تنظيم L1 (المعروف أيضًا باسم LASSO ) إلى نماذج متفرقة عن طريق إضافة عقوبة تعتمد على القيمة المطلقة للمعاملات.
  • يشجع تنظيم L2 (المعروف أيضًا باسم انحدار ريدج ) على استخدام أوزان أصغر وأكثر توزيعًا بالتساوي عن طريق إضافة عقوبة تعتمد على مربع المعاملات. [ 5 ]

أوقع

في سياق الشبكات العصبية، تتجاهل تقنية Dropout بشكل متكرر مجموعات فرعية عشوائية من الخلايا العصبية أثناء التدريب، مما يحاكي تدريب بنى شبكات عصبية متعددة في وقت واحد لتحسين التعميم. [ 5 ]

تصنيف

يُعد التعلم التجريبي للمصنفات (من مجموعة بيانات محدودة) دائمًا مشكلة غير محددة ، لأنه يحاول استنتاج دالة لأيx{\displaystyle x}تم تقديم أمثلة فقطx1،x2،...،xن{\displaystyle x_{1},x_{2},\dots ,x_{n}}.

مصطلح التنظيم (أو المنظم)R(و){\displaystyle R(f)}تُضاف إلى دالة الخسارة : مينوأنا=1نV(و(xأنا)،yأنا)+λR(و){\displaystyle \min _{f}\sum _{i=1}^{n}V(f(x_{i}),y_{i})+\lambda R(f)} أينV{\displaystyle V}هي دالة خسارة أساسية تصف تكلفة التنبؤو(x){\displaystyle f(x)}عندما يكون التصنيفy{\displaystyle y}مثل فقدان المربع أو فقدان المفصلة ؛ وλ{\displaystyle \lambda }هو مُعامل يتحكم في أهمية مصطلح التنظيم.R(و){\displaystyle R(f)}يتم اختيارها عادة لفرض عقوبة على تعقيدو{\displaystyle f}. تشمل المفاهيم الملموسة للتعقيد المستخدمة قيودًا على السلاسة وحدودًا على معيار فضاء المتجهات . [ 6 ]

يتمثل أحد المبررات النظرية للتنظيم في محاولته تطبيق مبدأ أوكام على الحل (كما هو موضح في الشكل أعلاه، حيث قد يُفضّل استخدام الدالة الخضراء، الأبسط). من وجهة نظر بايزية ، تتوافق العديد من تقنيات التنظيم مع فرض توزيعات احتمالية مسبقة معينة على معلمات النموذج. [ 7 ]

يمكن أن يخدم التنظيم أغراضًا متعددة، بما في ذلك تعلم نماذج أبسط، وحث النماذج على أن تكون متفرقة، وإدخال بنية جماعية في مشكلة التعلم.

ظهرت الفكرة نفسها في العديد من المجالات العلمية . يُعدّ شكل بسيط من أشكال التنظيم المطبق على المعادلات التكاملية ( تنظيم تيخونوف ) بمثابة موازنة بين مطابقة البيانات وتقليل معيار الحل. ومؤخراً، شاع استخدام أساليب التنظيم غير الخطي، بما في ذلك تنظيم التباين الكلي .

تعميم

يمكن تبرير استخدام التنظيم كتقنية لتحسين قابلية تعميم النموذج المتعلم.

الهدف من هذه المسألة التعليمية هو إيجاد دالة تُطابق أو تتنبأ بالنتيجة (التصنيف) بحيث تُقلل الخطأ المتوقع لجميع المدخلات والتصنيفات الممكنة. الخطأ المتوقع للدالةون{\displaystyle f_{n}}يكون: أنا[ون]=X×YV(ون(x)،y)ρ(x،y)دxدy{\displaystyle I[f_{n}]=\int _{X\times Y}V(f_{n}(x),y)\rho (x,y)\,dx\,dy} أينX{\displaystyle X}وY{\displaystyle Y}هي مجالات بيانات الإدخالx{\displaystyle x}وعلاماتهم التجاريةy{\displaystyle y}على التوالى.

في مسائل التعلم، عادةً ما تتوفر مجموعة فرعية فقط من بيانات الإدخال والتصنيفات، ويتم قياسها مع بعض التشويش. لذلك، يكون الخطأ المتوقع غير قابل للقياس، وأفضل بديل متاح هو الخطأ التجريبي على مدىشمال{\displaystyle N}العينات المتوفرة: أناS[ون]=1نأنا=1شمالV(ون(x^أنا)،y^أنا){\displaystyle I_{S}[f_{n}]={\frac {1}{n}}\sum _{i=1}^{N}V(f_{n}({\hat {x}}_{i}),{\hat {y}}_{i})} بدون وجود حدود لتعقيد فضاء الدالة (رسميًا، فضاء هيلبرت ذو النواة المُستنسخة )، سيتم تعلم نموذج لا يُسبب أي خسارة في الخطأ التجريبي البديل. إذا توفرت قياسات (مثل قياساتxأنا{\displaystyle x_{i}}إذا تم إنشاء هذا النموذج باستخدام التشويش، فقد يعاني من فرط التخصيص ويُظهر خطأً متوقعًا ضعيفًا. يُضيف التنظيم عقوبةً لاستكشاف مناطق معينة من فضاء الدالة المستخدم في بناء النموذج، مما قد يُحسّن التعميم.

تنظيم تيكهونوف (انحدار ريدج)

سميت هذه التقنيات نسبة إلى أندريه نيكولايفيتش تيخونوف ، الذي طبق التنظيم على المعادلات التكاملية وقدم مساهمات مهمة في العديد من المجالات الأخرى.

عند تعلم دالة خطيةو{\displaystyle f}، يتميز بمتجه غير معروفw{\displaystyle w}بحيثو(x)=wx{\displaystyle f(x)=w\cdot x}ويمكن للمرء أن يضيفل2{\displaystyle L_{2}}المعيار - للمتجهw{\displaystyle w}يُستخدم تنظيم تيكهونوف في معادلة الخسارة لتفضيل الحلول ذات المعايير الأصغر. وهو أحد أكثر أشكال التنظيم شيوعًا، ويُعرف أيضًا باسم انحدار ريدج. ويُعبّر عنه كما يلي: مينwأنا=1نV(x^أناw،y^أنا)+λw22،{\displaystyle \min _{w}\sum _{i=1}^{n}V({\hat {x}}_{i}\cdot w,{\hat {y}}_{i})+\lambda \left\|w\right\|_{2}^{2},} أين(x^أنا،y^أنا)،1أنان،{\displaystyle ({\hat {x}}_{i},{\hat {y}}_{i}),\,1\leq i\leq n,}ستمثل هذه العينات المستخدمة للتدريب.

في حالة الدالة العامة، يكون معيار الدالة في فضاء هيلبرت ذي النواة المُستنسخة هو: مينوأنا=1نV(و(x^أنا)،y^أنا)+λوح2{\displaystyle \min _{f}\sum _{i=1}^{n}V(f({\hat {x}}_{i}),{\hat {y}}_{i})+\lambda \left\|f\right\|_{\mathcal {H}}^{2}}

بصفتنال2{\displaystyle L_{2}}المعيار قابل للتفاضل ، ويمكن تطوير التعلم عن طريق انحدار التدرج .

المربعات الصغرى المنتظمة وفقًا لتيكهونوف

يمكن حل مشكلة التعلم باستخدام دالة خسارة المربعات الصغرى وتنظيم تيخونوف تحليليًا. ويُكتب الحل الأمثل في شكل مصفوفة.w{\displaystyle w}هو الذي يكون فيه تدرج دالة الخسارة بالنسبة إلىw{\displaystyle w}يساوي صفرًا. مينw1ن(X^w-Y)تي(X^w-Y)+λw22{\displaystyle \min _{w}{\frac {1}{n}}\left({\hat {X}}wY\right)^{\mathsf {T}}\left({\hat {X}}wY\right)+\lambda \left\|w\right\|_{2}^{2}}w=2نX^تي(X^w-Y)+2λw{\displaystyle \nabla _{w}={\frac {2}{n}}{\hat {X}}^{\mathsf {T}}\left({\hat {X}}wY\right)+2\lambda w}0=X^تي(X^w-Y)+نλw{\displaystyle 0={\hat {X}}^{\mathsf {T}}\left({\hat {X}}wY\right)+n\lambda w}w=(X^تيX^+λنأنا)-1(X^تيY){\displaystyle w=\left({\hat {X}}^{\mathsf {T}}{\hat {X}}+\lambda nI\right)^{-1}\left({\hat {X}}^{\mathsf {T}}Y\right)} حيث أن العبارة الثالثة هي شرط من الدرجة الأولى .

من خلال بناء مسألة التحسين، يمكن الحصول على قيم أخرى لـw{\displaystyle w}تعطي قيمًا أكبر لدالة الخسارة. ويمكن التحقق من ذلك بفحص المشتقة الثانية.ww{\displaystyle \nabla _{ww}}.

أثناء التدريب، تأخذ هذه الخوارزميةيا(د3+ند2){\displaystyle O(d^{3}+nd^{2})}الزمن . تتوافق المصطلحات مع عملية عكس المصفوفة وحسابها.XتيX{\displaystyle X^{\mathsf {T}}X}على التوالي. يستغرق الاختباريا(ند){\displaystyle O(nd)}وقت.

التوقف المبكر

يمكن اعتبار التوقف المبكر بمثابة تنظيم زمني. وبشكل بديهي، تميل عملية التدريب، مثل خوارزمية التدرج الهبوطي، إلى تعلم دوال أكثر تعقيدًا مع ازدياد عدد التكرارات. ومن خلال التنظيم الزمني، يمكن التحكم في تعقيد النموذج، مما يحسن من قدرته على التعميم.

يتم تطبيق التوقف المبكر باستخدام مجموعة بيانات واحدة للتدريب، ومجموعة بيانات مستقلة إحصائياً للتحقق، وأخرى للاختبار. يتم تدريب النموذج حتى يتوقف تحسن الأداء على مجموعة التحقق، ثم يتم تطبيقه على مجموعة الاختبار.

الدافع النظري في المربعات الصغرى

لنفترض التقريب المحدود لمتسلسلة نيومان لمصفوفة قابلة للعكس A حيثأنا-أ<1{\displaystyle \left\|IA\right\|<1}: أنا=0تي-1(أنا-أ)أناأ-1{\displaystyle \sum _{i=0}^{T-1}\left(IA\right)^{i}\approx A^{-1}}

يمكن استخدام هذا لتقريب الحل التحليلي للمربعات الصغرى غير المنتظمة، إذا تم إدخال γ لضمان أن يكون المعيار أقل من واحد. wتي=γنأنا=0تي-1(أنا-γنX^تيX^)أناX^تيY^{\displaystyle w_{T}={\frac {\gamma }{n}}\sum _{i=0}^{T-1}\left(I-{\frac {\gamma }{n}}{\hat {X}}^{\mathsf {T}}{\hat {X}}\right)^{i}{\hat {X}}^{\mathsf {T}}{\hat {Y}}}

يُقلل الحل الدقيق لمسألة التعلم باستخدام المربعات الصغرى غير المنتظمة من الخطأ التجريبي، ولكنه قد لا ينجح. بتقييد T ، وهو المعامل الحر الوحيد في الخوارزمية المذكورة أعلاه، يتم تنظيم المسألة زمنيًا، مما قد يُحسّن من تعميمها.

تُعادل الخوارزمية المذكورة أعلاه تقييد عدد تكرارات انحدار التدرج للمخاطرة التجريبية أناs[w]=12نX^w-Y^Rن2{\displaystyle I_{s}[w]={\frac {1}{2n}}\left\|{\hat {X}}w-{\hat {Y}}\right\|_{\mathbb {R} ^{n}}^{2}} مع تحديث خوارزمية التدرج الهبوطي: w0=0wت+1=(أنا-γنX^تيX^)wت+γنX^تيY^{\displaystyle {\begin{aligned}w_{0}&=0\\[1ex]w_{t+1}&=\left(I-{\frac {\gamma }{n}}{\hat {X}}^{\mathsf {T}}{\hat {X}}\right)w_{t}+{\frac {\gamma }{n}}{\hat {X}}^{\mathsf {T}}{\hat {Y}}\end{aligned}}}

الحالة الأساسية بديهية. أما الحالة الاستقرائية فقد تم إثباتها على النحو التالي: wتي=(أنا-γنX^تيX^)γنأنا=0تي-2(أنا-γنX^تيX^)أناX^تيY^+γنX^تيY^=γنأنا=1تي-1(أنا-γنX^تيX^)أناX^تيY^+γنX^تيY^=γنأنا=0تي-1(أنا-γنX^تيX^)أناX^تيY^\begin{aligned}w_{T}&=\left(I-{\frac {\gamma }{n}}{\hat {X}}^{\mathsf {T}}{\hat {X}}\right){\frac {\gamma }{n}}\sum _{i=0}^{T-2}\left(I-{\frac {\gamma }{n}}{\hat {X}}^{\mathsf {T}}{\hat {X}}\right)^{i}{\hat {X}}^{\mathsf {T}}{\hat {Y}}+{\frac {\gamma }{n}}{\hat {X}}^{\mathsf {T}}{\hat {Y}}\\[1ex]&={\frac {\gamma }{n}}\sum _{i=1}^{T-1}\left(I-{\frac {\gamma }{n}}{\hat {X}}^{\mathsf {T}}{\hat {X}}\right)^{i}{\hat {X}}^{\mathsf {T}}{\hat {Y}}+{\frac {\gamma }{n}}{\hat {X}}^{\mathsf {T}}{\hat {Y}}\\[1ex]&={\frac {\gamma }{n}}\sum _{i=0}^{T-1}\left(I-{\frac {\gamma }{n}}{\hat {X}}^{\mathsf {T}}{\hat {X}}\right)^{i}{\hat {X}}^{\mathsf {T}}{\hat {Y}}\end{aligned}}}

أدوات تنظيمية للتخفيف من حدة البيانات

افترض أن قاموسًاϕج{\displaystyle \phi _{j}}بأبعادص{\displaystyle p}يتم إعطاء دالة بحيث يمكن التعبير عن دالة في فضاء الدوال على النحو التالي: و(x)=ج=1صϕج(x)wج{\displaystyle f(x)=\sum _{j=1}^{p}\phi _{j}(x)w_{j}}

تُعطي المقارنة بين كرة L1 وكرة L2 في بعدين فكرة بديهية عن كيفية تحقيق تنظيم L1 للتباعد.

فرض قيد التباعد علىw{\displaystyle w}يمكن أن يؤدي ذلك إلى نماذج أبسط وأكثر قابلية للتفسير. وهذا مفيد في العديد من التطبيقات العملية، مثل علم الأحياء الحاسوبي . ومن الأمثلة على ذلك تطوير اختبار تنبؤي بسيط لمرض ما بهدف تقليل تكلفة إجراء الفحوصات الطبية مع زيادة القدرة التنبؤية إلى أقصى حد.

يُعدّ قيد التباعد المعقول هول0{\displaystyle L_{0}}معيارw0{\displaystyle \|w\|_{0}}، ويُعرَّف بأنه عدد العناصر غير الصفرية فيw{\displaystyle w}حل مشكلةل0{\displaystyle L_{0}}ومع ذلك، فقد ثبت أن مشكلة التعلم المنتظم هي مشكلة صعبة من نوع NP . [ 8 ]

الل1{\displaystyle L_{1}}يمكن استخدام المعيار (انظر أيضًا المعايير ) لتقريب الأمثلل0{\displaystyle L_{0}}المعيار عبر الاسترخاء المحدب. يمكن إثبات أنل1{\displaystyle L_{1}}يؤدي المعيار إلى التباعد. في حالة المربعات الصغرى، تُعرف هذه المشكلة باسم LASSO في الإحصاء والبحث عن الأساس في معالجة الإشارات. مينwRص1نX^w-Y^2+λw1{\displaystyle \min _{w\in \mathbb {R} ^{p}}{\frac {1}{n}}\left\|{\hat {X}}w-{\hat {Y}}\right\|^{2}+\lambda \left\|w\right\|_{1}}

التنظيم الشبكي المرن

ل1{\displaystyle L_{1}}قد ينتج عن التنظيم أحيانًا حلول غير فريدة. يوضح الشكل مثالًا بسيطًا عندما تقع فضاء الحلول الممكنة على خط بزاوية 45 درجة. قد يمثل هذا مشكلة في بعض التطبيقات، ويتم التغلب عليه من خلال الجمع بينل1{\displaystyle L_{1}}معل2{\displaystyle L_{2}}التنظيم في تنظيم الشبكة المرنة ، والذي يأخذ الشكل التالي: مينwRص1نX^w-Y^2+λ(αw1+(1-α)w22)،α[0،1]{\displaystyle \min _{w\in \mathbb {R} ^{p}}{\frac {1}{n}}\left\|{\hat {X}}w-{\hat {Y}}\right\|^{2}+\lambda \left(\alpha \left\|w\right\|_{1}+(1-\alpha )\left\|w\right\|_{2}^{2}\right),\alpha \in [0,1]}

يميل تنظيم الشبكة المرنة إلى إحداث تأثير تجميعي، حيث يتم تعيين أوزان متساوية لميزات الإدخال المترابطة.

تُستخدم تقنية تنظيم الشبكة المرنة بشكل شائع في الممارسة العملية ويتم تطبيقها في العديد من مكتبات التعلم الآلي.

الطرق القريبة

بينمال1{\displaystyle L_{1}}لا ينتج عن المعيار مشكلة صعبة من نوع NP،ل1{\displaystyle L_{1}}المعيار محدب ولكنه غير قابل للتفاضل تمامًا بسبب وجود نقطة انعطاف عند x = 0. ويمكن استخدام طرق التدرج الفرعي التي تعتمد على المشتقة الفرعية لحل المسألة.ل1{\displaystyle L_{1}}مشاكل التعلم المنتظم. ومع ذلك، يمكن تحقيق تقارب أسرع من خلال الطرق التقريبية.

لحل مشكلةمينwحF(w)+R(w){\displaystyle \min _{w\in H}F(w)+R(w)}بحيثF{\displaystyle F}هي دالة محدبة، متصلة، قابلة للتفاضل، ذات تدرج متصل وفقًا لشرط ليبشيتز (مثل دالة خسارة المربعات الصغرى)، وR{\displaystyle R}إذا كانت الدالة محدبة ومتصلة ومناسبة، فإن طريقة التقريب لحل المسألة تكون كما يلي. أولاً، نُعرّف المؤثر التقريبي .تقريبيR(v)=أرجينينwRد{R(w)+12w-v2}،{\displaystyle \operatorname {prox} _{R}(v)=\mathop {\operatorname {argmin} } _{w\in \mathbb {R} ^{D}}\left\{R(w)+{\frac {1}{2}}\left\|w-v\right\|^{2}\right\},} ثم كرر العملية wك+1=تقريبيγ،R(wك-γF(wك)){\displaystyle w_{k+1}=\mathop {\operatorname {prox} } _{\gamma ,R}\left(w_{k}-\gamma \nabla F(w_{k})\right)}

تُجري الطريقة التقريبية عملية هبوط التدرج بشكل تكراري، ثم تُسقط النتيجة مرة أخرى في المساحة المسموح بها بواسطةR{\displaystyle R}.

متىR{\displaystyle R}هو منظم L1 ، والمؤثر التقريبي مكافئ لمؤثر العتبة الناعمة. Sλ(v)و(ن)={vأنا-λ،لو vأنا>λ0،لو vأنا[-λ،λ]vأنا+λ،لو vأنا<-λ{\displaystyle S_{\lambda }(v)f(n)={\begin{cases}v_{i}-\lambda ,&{\text{if }}v_{i}>\lambda \\0,&{\text{if }}v_{i}\in [-\lambda ,\lambda ]\\v_{i}+\lambda ,&{\text{if }}v_{i}<-\lambda \end{cases}}}

وهذا يسمح بإجراء حسابات فعالة.

تباعد المجموعات بدون تداخلات

يمكن تنظيم مجموعات الميزات بواسطة قيد التباعد، والذي يمكن أن يكون مفيدًا للتعبير عن معرفة مسبقة معينة في مشكلة تحسين.

في حالة النموذج الخطي ذي المجموعات المعروفة غير المتداخلة، يمكن تعريف مُنظِّم: R(w)=ز=1جيwز2،{\displaystyle R(w)=\sum _{g=1}^{G}\left\|w_{g}\right\|_{2},}أينwز2=ج=1|جيز|(wزج)2{\displaystyle \|w_{g}\|_{2}={\sqrt {\sum _{j=1}^{|G_{g}|}\left(w_{g}^{j}\right)^{2}}}}

يمكن اعتبار هذا بمثابة إدخال مُنظِّم علىل2{\displaystyle L_{2}}المعيار على أعضاء كل مجموعة متبوعًا بـل1{\displaystyle L_{1}}المعيار فوق المجموعات.

يمكن حل هذه المشكلة باستخدام الطريقة التقريبية، حيث يكون عامل التقريب عبارة عن دالة عتبة ناعمة على مستوى الكتلة:

تقريبيλ،R،ز(wز)={(1-λwز2)wز،لو wز2>λ0،لو wز2λ{\displaystyle \operatorname {prox} \limits _{\lambda ,R,g}(w_{g})={\begin{cases}\left(1-{\dfrac {\lambda }{\left\|w_{g}\right\|_{2}}}\right)w_{g},&{\text{if }}\left\|w_{g}\right\|_{2}>\lambda \\[1ex]0,&{\text{if }}\|w_{g}\|_{2}\leq \lambda \end{cases}}}

تباعد المجموعات مع وجود تداخلات

يمكن تطبيق الخوارزمية الموصوفة لتوزيع المجموعات المتباعدة دون تداخل على حالة تداخل المجموعات، في بعض الحالات. ومن المرجح أن ينتج عن ذلك بعض المجموعات التي تحتوي على جميع عناصرها على أصفار، ومجموعات أخرى تحتوي على بعض العناصر غير الصفرية وبعض العناصر الصفرية.

إذا رغبنا في الحفاظ على بنية المجموعة، فيمكن تعريف مُنظِّم جديد: R(w)=معلومات{ز=1جيwز2:w=ز=1جيw¯ز}{\displaystyle R(w)=\inf \left\{\sum _{g=1}^{G}\|w_{g}\|_{2}:w=\sum _{g=1}^{G}{\bar {w}}_{g}\right\}}

لكلwز{\displaystyle w_{g}}،w¯ز{\displaystyle {\bar {w}}_{g}}يُعرَّف بأنه المتجه الذي يكون فيه تقييدw¯ز{\displaystyle {\bar {w}}_{g}}إلى المجموعةز{\displaystyle g}يساويwز{\displaystyle w_{g}}وجميع الإدخالات الأخرى لـw¯ز{\displaystyle {\bar {w}}_{g}}تساوي صفرًا. يجد المنظم التفكك الأمثل لـw{\displaystyle w}إلى أجزاء. يمكن اعتبارها تكرارًا لجميع العناصر الموجودة في مجموعات متعددة. يمكن أيضًا حل مشاكل التعلم باستخدام هذا المنظم مع طريقة التقريب، ولكن مع وجود تعقيد. لا يمكن حساب عامل التقريب بصيغة مغلقة، ولكن يمكن حله بفعالية بشكل تكراري، مما يؤدي إلى تكرار داخلي ضمن تكرار طريقة التقريب.

أدوات تنظيم التعلم شبه الموجه

عندما يكون جمع التصنيفات أكثر تكلفة من جمع أمثلة الإدخال، يمكن أن يكون التعلم شبه الموجه مفيدًا. صُممت المُنظِّمات لتوجيه خوارزميات التعلم نحو تعلم نماذج تحترم بنية عينات التدريب غير الموجهة. إذا كانت مصفوفة الأوزان متناظرةدبليو{\displaystyle W}إذا تم تحديد قيمة معينة، يمكن تعريف مُنظِّم: R(و)=أنا،جwأناج(و(xأنا)-و(xج))2{\displaystyle R(f)=\sum _{i,j}w_{ij}\left(f(x_{i})-f(x_{j})\right)^{2}}

لودبليوأناج{\displaystyle W_{ij}}يشفر نتيجة مقياس مسافة معين للنقاطxأنا{\displaystyle x_{i}}وxج{\displaystyle x_{j}}من المستحسن أنو(xأنا)و(xج){\displaystyle f(x_{i})\approx f(x_{j})}يُجسّد هذا المُنتظم هذه الفكرة البديهية، وهو يُعادل ما يلي: R(و)=و¯تيلو¯{\displaystyle R(f)={\bar {f}}^{\mathsf {T}}L{\bar {f}}}أينل=د-دبليو{\displaystyle L=D-W}هي مصفوفة لابلاس للرسم البياني الناتج عندبليو{\displaystyle W}.

مشكلة التحسينمينوRمR(و)،م=u+ل{\displaystyle \min _{f\in \mathbb {R} ^{m}}R(f),m=u+l}يمكن حلها تحليليًا إذا كان القيدو(xأنا)=yأنا{\displaystyle f(x_{i})=y_{i}}يتم تطبيق ذلك على جميع العينات الخاضعة للإشراف. الجزء المسمى من المتجهو{\displaystyle f}لذا، من الواضح أن الجزء غير المسمى منو{\displaystyle f}يتم حلها بواسطة: مينوuRuوتيلو=مينوuRu{وuتيلuuوu+ولتيللuوu+وuتيلuلول}{\displaystyle \min _{f_{u}\in \mathbb {R} ^{u}}f^{\mathsf {T}}Lf=\min _{f_{u}\in \mathbb {R} ^{u}}\left\{f_{u}^{\mathsf {T}}L_{uu}f_{u}+f_{l}^{\mathsf {T}}L_{lu}f_{u}+f_{u}^{\mathsf {T}}L_{ul}f_{l}\right\}}وu=2لuuوu+2لuلY{\displaystyle \nabla _{f_{u}}=2L_{uu}f_{u}+2L_{ul}Y}وu=لuu(لuلY){\displaystyle f_{u}=L_{uu}^{\dagger }\left(L_{ul}Y\right)} يمكن أخذ المعكوس الزائف لأنلuل{\displaystyle L_{ul}}له نفس المدى مثللuu{\displaystyle L_{uu}}.

أدوات تنظيمية للتعلم متعدد المهام

في حالة التعلم متعدد المهام،تي{\displaystyle T}تُدرس المشكلات في آن واحد، وكل منها مرتبط بطريقة ما. والهدف هو التعلمتي{\displaystyle T}الوظائف، التي تستمد قوتها بشكل مثالي من ترابط المهام، والتي تتمتع بقدرة تنبؤية. وهذا يعادل تعلم المصفوفةدبليو:تي×د{\displaystyle W:T\times D}.

مُنظِّم مُتفرق على الأعمدة

R(w)=أنا=1ددبليو2،1{\displaystyle R(w)=\sum _{i=1}^{D}\left\|W\right\|_{2,1}}

يُعرّف هذا المُنظِّم معيار L2 على كل عمود ومعيار L1 على جميع الأعمدة. ويمكن حله باستخدام الطرق التقريبية.

تنظيم المعيار النظيف

R(w)=σ(دبليو)1{\displaystyle R(w)=\left\|\sigma (W)\right\|_{1}}أينσ(دبليو){\displaystyle \sigma (W)}هي القيم الذاتية في تحليل القيم المفردة لـدبليو{\displaystyle W}.

التنظيم المقيد بالمتوسط

R(و1وتي)=ت=1تيوت-1تيs=1تيوsحك2{\displaystyle R(f_{1}\cdots f_{T})=\sum _{t=1}^{T}\left\|f_{t}-{\frac {1}{T}}\sum _{s=1}^{T}f_{s}\right\|_{H_{k}}^{2}}

يُقيّد هذا المُنظِّم الدوال المُستخلصة لكل مهمة لتكون مُشابهة للمتوسط ​​العام للدوال في جميع المهام. يُفيد هذا في التعبير عن المعلومات المُسبقة التي يُتوقع أن تتشاركها كل مهمة مع المهام الأخرى. مثال على ذلك هو التنبؤ بمستويات الحديد في الدم المُقاسة في أوقات مُختلفة من اليوم، حيث تُمثل كل مهمة فرداً.

التنظيم المقيد بالمتوسط ​​العنقودي

R(و1وتي)=ر=1جتأنا(ر)وت-1أنا(ر)sأنا(ر)وsحك2{\displaystyle R(f_{1}\cdots f_{T})=\sum _{r=1}^{C}\sum _{t\in I(r)}\left\|f_{t}-{\frac {1}{I(r)}}\sum _{s\in I(r)}f_{s}\right\|_{H_{k}}^{2}}أينأنا(ر){\displaystyle I(r)}هي مجموعة من المهام.

يشبه هذا المُنظِّم المُنظِّم المُقيد بالمتوسط، ولكنه يُفرض التشابه بين المهام داخل المجموعة نفسها. وهذا يُتيح استيعاب معلومات مسبقة أكثر تعقيدًا. وقد استُخدمت هذه التقنية للتنبؤ بتوصيات نتفليكس . وتُمثل المجموعة مجموعة من الأشخاص الذين يتشاركون تفضيلات مُتشابهة.

التشابه القائم على الرسم البياني

بشكل أعم مما سبق، يمكن تعريف التشابه بين المهام بواسطة دالة. ويشجع المُنظِّم النموذج على تعلم دوال متشابهة لمهام متشابهة. R(و1وتي)=ت،s=1،تsتيوت-وs2متs{\displaystyle R(f_{1}\cdots f_{T})=\sum _{t,s=1,t\neq s}^{\mathsf {T}}\left\|f_{t}-f_{s}\right\|^{2}M_{ts}}لمصفوفة تشابه متناظرة معينةم{\displaystyle M}.

استخدامات أخرى للتنظيم في الإحصاء والتعلم الآلي

تستخدم أساليب التعلم البايزية احتمالاً مسبقاً يُعطي (عادةً) احتمالاً أقل للنماذج الأكثر تعقيداً. تشمل تقنيات اختيار النموذج المعروفة معيار معلومات أكايكي (AIC)، والحد الأدنى لطول الوصف (MDL)، ومعيار معلومات بايز (BIC). ومن الطرق البديلة للتحكم في فرط التخصيص، والتي لا تتضمن التنظيم، التحقق المتبادل .

أمثلة على تطبيقات طرق التنظيم المختلفة على النموذج الخطي هي:

نموذجقياس المقاسمقياس الإنتروبيا [ 6 ] [ 9 ]
AIC / BICY-Xβ2{\displaystyle \left\|Y-X\beta \right\|_{2}}β0{\displaystyle \left\|\beta \right\|_{0}}
لاسو [ 10 ]Y-Xβ2{\displaystyle \left\|Y-X\beta \right\|_{2}}β1{\displaystyle \left\|\beta \right\|_{1}}
الانحدار الخطي [ 11 ]Y-Xβ2{\displaystyle \left\|Y-X\beta \right\|_{2}}β2{\displaystyle \left\|\beta \right\|_{2}}
إزالة الضوضاء من تتبع الأساسY-Xβ2{\displaystyle \left\|Y-X\beta \right\|_{2}}λβ1{\displaystyle \lambda \left\|\beta \right\|_{1}}
رودين – أوشر – فاطمي نموذجاً (تلفزيون)Y-Xβ2{\displaystyle \left\|Y-X\beta \right\|_{2}}λβ1{\displaystyle \lambda \left\|\nabla \beta \right\|_{1}}
نموذج بوتسY-Xβ2{\displaystyle \left\|Y-X\beta \right\|_{2}}λβ0{\displaystyle \lambda \left\|\nabla \beta \right\|_{0}}
RLAD [ 12 ]Y-Xβ1{\displaystyle \left\|Y-X\beta \right\|_{1}}β1{\displaystyle \left\|\beta \right\|_{1}}
محدد دانتزيج [ 13 ]Xتي(Y-Xβ){\displaystyle \left\|X^{\mathsf {T}}(Y-X\beta )\right\|_{\infty }}β1{\displaystyle \left\|\beta \right\|_{1}}
المنحدر [ 14 ]Y-Xβ2{\displaystyle \left\|Y-X\beta \right\|_{2}}أنا=1صλأنا|β|(أنا){\displaystyle \sum _{i=1}^{p}\lambda _{i}\left|\beta \right|_{(i)}}

انظر أيضاً

ملحوظات

  1. كراتسيوس، أناستاسيس (2020). "التعلم العميق الخالي من المراجحة في إطار عمل HJM المعمم عبر بيانات تنظيم المراجحة" . المخاطر . 8 (2):arXiv : 1710.05114 . doi : 10.3390 / risks8020040 . hdl : 20.500.11850/456375 . يمكن تنظيم نماذج هيكل المدة لإزالة فرص المراجحة .
  2. بوهلمان، بيتر؛ فان دي جير، سارة (2011). إحصاءات البيانات عالية الأبعاد . سلسلة سبرينغر في الإحصاء. ص 9. doi : 10.1007/978-3-642-20192-9 . ISBN  978-3-642-20191-2إذا كانت قيمة p أكبر من n ، فإن مُقدِّر المربعات الصغرى العادي لن يكون فريدًا وسيؤدي إلى مُبالغة كبيرة في ملاءمة البيانات. لذا، سيكون من الضروري استخدام شكل من أشكال تنظيم التعقيد.
  3. هوانغ، يونفي؛ وآخرون (2019). "مجهر قوة الجر مع تنظيم مُحسَّن واختيار تلقائي لمعاملات بايز لمقارنة الخلايا" . التقارير العلمية . 9 (1) 539: 537. arXiv : 1810.05848 . Bibcode : 2019NatSR...9..539H . doi : 10.1038/ s41598-018-36896 -x . PMC 6345967. PMID 30679578 .   
  4. غودفيلو، إيان؛ بينجيو، يوشوا؛ كورفيل، آرون. كتاب التعلم العميق . تم الاطلاع عليه بتاريخ 29-01-2021 .
  5. 1 2 3 4 غو، جينغرو. "ملاحظات حول الذكاء الاصطناعي: تنظيم الشبكات العصبية" . deeplearning.ai . تم الاسترجاع في 4 فبراير 2024 .
  6. 1 2 بيشوب، كريستوفر م. (2007). التعرف على الأنماط والتعلم الآلي (طبعة منقحة ). نيويورك: سبرينغر. ISBN  978-0-387-31073-2.
  7. للاطلاع على العلاقة بين تقدير الاحتمال اللاحق الأقصى وانحدار ريدج ، انظر: واينبرغر، كيليان (11 يوليو 2018). "الانحدار الخطي/انحدار ريدج" . محاضرة 13 من مقرر تعلم الآلة CS4780 . جامعة كورنيل.
  8. ناتاراجان، ب. (1995-04-01). "حلول تقريبية متفرقة للأنظمة الخطية" . مجلة SIAM للحوسبة . 24 (2): 227-234 . doi : 10.1137/S0097539792240406 . ISSN 0097-5397 . S2CID 2072045 .  
  9. دودا، ريتشارد أو. (2004). تصنيف الأنماط + دليل الحاسوب : مجموعة غلاف مقوى ( الطبعة الثانية). نيويورك [ua]: وايلي. ISBN   978-0-471-70350-1.
  10. تيبشيراني، روبرت (1996). "انكماش الانحدار والاختيار عبر طريقة لاسو" . مجلة الجمعية الإحصائية الملكية، السلسلة ب . 58 (1): 267-288 . doi : 10.1111/j.2517-6161.1996.tb02080.x . MR 1379242. مؤرشف من الأصل ( PostScript ) بتاريخ 31 أكتوبر 2008. تم الاطلاع عليه بتاريخ 19 مارس 2009 . 
  11. آرثر إي. هورل؛ روبرت دبليو. كينارد (1970). "انحدار ريدج: تقدير متحيز للمسائل غير المتعامدة". تكنومتركس . 12 (1): 55-67 . doi : 10.2307/1267351 . JSTOR 1267351 . 
  12. لي وانغ؛ مايكل د. غوردون؛ جي تشو (2006). "انحدار الانحرافات المطلقة الصغرى المنتظمة وخوارزمية فعالة لضبط المعلمات". المؤتمر الدولي السادس حول استخراج البيانات . الصفحات 690-700 . doi : 10.1109/ICDM.2006.134 . ISBN  978-0-7695-2701-7.
  13. كانديس، إيمانويل ؛ تاو، تيرينس (2007). "محدد دانتزيج: التقدير الإحصائي عندما تكون قيمة p أكبر بكثير من n " . حوليات الإحصاء . 35 (6): 2313-2351 . arXiv : math/0506081 . doi : 10.1214/009053606000001523 . MR 2382644. S2CID 88524200 .  
  14. ^ مالغورزاتا بوجدان . إيوت فان دن بيرج; ويجي سو؛ إيمانويل ج. كانديس (2013). “التقدير الإحصائي والاختبار عبر قاعدة L1 المطلوبة”. أرخايف : 1310.1969 [ stat.ME ].

مراجع

  • نيومير، أ. (1998). "حل الأنظمة الخطية سيئة التكييف والمنفردة: دليل تعليمي حول التنظيم" (ملف PDF) . مجلة SIAM Review ، 40 (3): 636-666 . رمز Bibcode : 1998SIAMR..40..636N . doi : 10.1137/S0036144597321909 . مؤرشف من النسخة الأصلية (ملف PDF) بتاريخ 30 يونيو 2007.
  • كوكاكا، يان؛ غولكوف، فلاديمير؛ كريمرز، دانيال (2017). "التنظيم للتعلم العميق: تصنيف". arXiv : 1710.10686 [ cs.LG ].