شبكة الطرق السريعة

في مجال تعلم الآلة ، كانت شبكة الطريق السريع أول شبكة عصبية أمامية عميقة جدًا تعمل بكفاءة عالية ، إذ تضم مئات الطبقات، وهي أعمق بكثير من الشبكات العصبية السابقة . [ 1 ] [ 2 ] [ 3 ] تستخدم هذه الشبكة وصلات تخطي مُعدَّلة بآليات بوابات مُتعلَّمة لتنظيم تدفق المعلومات، مستوحاة من شبكات الذاكرة طويلة المدى (LSTM) العصبية المتكررة . [ 4 ] [ 5 ] وتكمن ميزة شبكة الطريق السريع على غيرها من بنى التعلم العميق في قدرتها على التغلب على مشكلة تلاشي التدرج أو الحد منها جزئيًا ، [ 6 ] مما يُحسِّن من أدائها. تُستخدم آليات البوابات لتسهيل تدفق المعلومات عبر الطبقات المتعددة ("طرق المعلومات السريعة"). [ 1 ] [ 2 ]

وقد وجدت شبكات الطرق السريعة استخداماً في تصنيف تسلسل النصوص ومهام التعرف على الكلام . [ 7 ] [ 8 ]

في عام 2014، كان أحدث ما توصلت إليه التكنولوجيا هو تدريب الشبكات العصبية العميقة التي تتكون من 20 إلى 30 طبقة. [ 9 ] أدى تكديس عدد كبير جدًا من الطبقات إلى انخفاض حاد في دقة التدريب ، [ 10 ] وهو ما يُعرف بمشكلة "التدهور". [ 11 ] في عام 2015، طُوّرت تقنيتان لتدريب هذه الشبكات: شبكة الطريق السريع (نُشرت في مايو)، والشبكة العصبية المتبقية ، أو ResNet [ 12 ] (ديسمبر). تعمل ResNet كشبكة طريق سريع مفتوحة البوابة.

نموذج

يحتوي النموذج على بوابتين بالإضافة إلىح(دبليوح،x){\displaystyle H(W_{H},x)}البوابة: بوابة التحولتي(دبليوتي،x){\displaystyle T(W_{T},x)}وبوابة الحملج(دبليوج،x){\displaystyle C(W_{C},x)}البوابتان الأخيرتان عبارة عن دوال نقل غير خطية (وتحديدًا دالة سيجمويد حسب الاصطلاح).ح{\displaystyle H}يمكن أن تكون أي دالة نقل مطلوبة.

يتم تعريف بوابة الحمل على النحو التالي:

ج(دبليوج،x)=1-تي(دبليوتي،x){\displaystyle C(W_{C},x)=1-T(W_{T},x)}

بينما بوابة التحويل هي مجرد بوابة ذات دالة نقل سيجمويد.

بناء

يتبع هيكل الطبقة المخفية في شبكة الطرق السريعة المعادلة التالية:

y=ح(x،دبليوح)تي(x،دبليوتي)+xج(x،دبليوج)=ح(x،دبليوح)تي(x،دبليوتي)+x(1-تي(x،دبليوتي)){\displaystyle {\begin{aligned}y=H(x,W_{H})\cdot T(x,W_{T})+x\cdot C(x,W_{C})\\=H(x,W_{H})\cdot T(x,W_{T})+x\cdot (1-T(x,W_{T}))\end{aligned}}}

قام سيب هوكريتر بتحليل مشكلة تلاشي التدرج في عام 1991، وعزا إليها سبب عدم نجاح التعلم العميق . [ 6 ] وللتغلب على هذه المشكلة، تحتوي الشبكات العصبية المتكررة ذات الذاكرة طويلة المدى (LSTM) [ 4 ] على وصلات متبقية بوزن 1.0 في كل خلية من خلايا LSTM (تُسمى دائرة الخطأ الثابت) لحسابyت+1=F(xت)+xت{\textstyle y_{t+1}=F(x_{t})+x_{t}}أثناء عملية الانتشار العكسي عبر الزمن ، تصبح هذه هي الصيغة المتبقيةy=F(x)+x{\textstyle y=F(x)+x}بالنسبة للشبكات العصبية ذات التغذية الأمامية، يُمكّن هذا من تدريب شبكات عصبية متكررة عميقة جدًا ذات نطاق زمني طويل جدًا (t). في إصدار لاحق من LSTM نُشر عام 2000 [ 5 ] ، تم تعديل وصلات LSTM المطابقة باستخدام ما يُسمى "بوابات النسيان"، بحيث لا تكون أوزانها ثابتة عند 1.0، بل يمكن تعلمها. في التجارب، تم تهيئة بوابات النسيان بأوزان انحياز موجبة [ 5 ] ، وبالتالي تم فتحها، مما عالج مشكلة تلاشي التدرج. طالما أن بوابات النسيان في LSTM لعام 2000 مفتوحة، فإنها تتصرف مثل LSTM لعام 1997.

تُطبّق شبكة الطرق السريعة لشهر مايو 2015 [ 1 ] هذه المبادئ على الشبكات العصبية التغذية الأمامية . وقد وُصفت بأنها "أول شبكة تغذية أمامية عميقة جدًا تضم ​​مئات الطبقات". [ 13 ] وهي تُشبه شبكة LSTM لعام 2000 مع بوابات نسيان مُطوَّرة بمرور الوقت ، [ 5 ] بينما لا تحتوي الشبكات المتبقية اللاحقة على ما يُعادل بوابات النسيان، وهي تُشبه شبكة LSTM الأصلية لعام 1997 بعد تفكيكها. [ 4 ] إذا كانت وصلات التخطي في شبكات الطرق السريعة "بدون بوابات"، أو إذا ظلت بواباتها مفتوحة (تفعيل 1.0)، فإنها تُصبح شبكات متبقية.

يُعدّ الاتصال المتبقي حالة خاصة من "الوصلة المختصرة" أو "الوصلة المتجاوزة" التي وضعها روزنبلات (1961) [ 14 ] ولانغ وويتبروك (1988) [ 15 ] ، والتي تأخذ الشكل التالي:xF(x)+أx{\displaystyle x\mapsto F(x)+Ax}هنا ، لا يشترط أن تكون مصفوفة الأوزان A المُهيأة عشوائيًا هي مصفوفة التطابق. كل اتصال متبقٍ هو اتصال تخطي، ولكن معظم اتصالات التخطي ليست اتصالات متبقية.

لم تقتصر ورقة بحث شبكة الطرق السريعة الأصلية [ 16 ] على تقديم المبدأ الأساسي للشبكات التغذية الأمامية العميقة جدًا، بل تضمنت أيضًا نتائج تجريبية لشبكات مكونة من 20 و50 و100 طبقة، وأشارت إلى تجارب جارية تصل إلى 900 طبقة. وقد أظهرت الشبكات المكونة من 50 أو 100 طبقة خطأ تدريب أقل من نظيراتها من الشبكات البسيطة، ولكن ليس أقل من نظيراتها المكونة من 20 طبقة (على مجموعة بيانات MNIST، الشكل 1 في [ 16 ] ). ولم يُلاحظ أي تحسن في دقة الاختبار مع الشبكات التي يزيد عمقها عن 19 طبقة (على مجموعة بيانات CIFAR-10؛ الجدول 1 في [ 16 ] ). ومع ذلك، قدمت ورقة بحث ResNet [ 17 ] أدلة تجريبية قوية على فوائد زيادة العمق عن 20 طبقة. وأكدت الورقة على أهمية مطابقة البيانات بدون تعديل، وذكرت أن التعديل في وصلة التخطي قد يؤدي إلى تلاشي الإشارات في الانتشار الأمامي والخلفي (القسم 3 في [ 17 ] ). ولهذا السبب أيضًا، فُتحت بوابات النسيان في شبكة LSTM لعام 2000 [ 18 ] مبدئيًا باستخدام أوزان انحياز موجبة: فما دامت البوابات مفتوحة، فإنها تتصرف مثل شبكة LSTM لعام 1997. وبالمثل، فإن شبكة Highway Net التي تُفتح بواباتها باستخدام أوزان انحياز موجبة قوية تتصرف مثل شبكة ResNet. أما وصلات التخطي المستخدمة في الشبكات العصبية الحديثة (مثل Transformers ) فهي في الغالب عبارة عن دوال مطابقة.

مراجع

  1. 1 2 3 سريفاستافا، روبيش كومار؛ جريف، كلاوس. شميدهوبر، يورغن (2015-05-02). “شبكات الطرق السريعة”. أرخايف : 1505.00387 [ cs.LG ].
  2. 1 2 سريفاستافا، روبيش ك؛ جريف، كلاوس؛ شميدهوبر، يورغن (2015). "تدريب الشبكات العميقة جدًا" . التطورات في أنظمة معالجة المعلومات العصبية . 28. كوران أسوشيتس، إنك: 2377-2385 .
  3. شميدهوبر، يورغن (2021). "جميع الشبكات العصبية الأكثر استشهادًا مبنية على أعمال أُجريت في مختبراتي" . مدونة الذكاء الاصطناعي . معهد دراسات الذكاء الاصطناعي والعلوم الاجتماعية، سويسرا . تاريخ الاسترجاع: 30 أبريل 2022 .
  4. 1 2 3 سيب هوخريتر ; يورغن شميدهوبر (1997). "الذاكرة الطويلة وقصيرة المدى" . الحساب العصبي . 9 (8): 1735–1780 . دوى : 10.1162/neco.1997.9.8.1735 . بميد 9377276 . S2CID 1915014 .  
  5. ١ ٢ ٣ ٤ فيليكس أ. جيرز؛ يورغن شميدهوبر؛ فريد كامينز (٢٠٠٠). "التعلم من النسيان: التنبؤ المستمر باستخدام LSTM". الحوسبة العصبية . ١٢ (١٠): ٢٤٥١-٢٤٧١ . CiteSeerX ١٠.١.١.٥٥.٥٧٠٩ . doi : ١٠.١١٦٢/٠٨٩٩٧٦٦٠٠٣٠٠٠١٥٠١٥ . PMID ١١٠٣٢٠٤٢. S2CID ١١٥٩٨٦٠٠ .   
  6. 1 2 هوخريتر، سيب (1991). Unter suchungen zu dynamischen neuronalen Netzen (PDF) (أطروحة الدبلوم). جامعة ميونيخ التقنية ، معهد علوم الكمبيوتر، المستشار: ج. شميدهوبر.
  7. ^ ليو ، ليوان. شانغ، جينغبو؛ شو، فرانك F.؛ رن، شيانغ؛ واجهة المستخدم الرسومية، هوان؛ بنغ، جيان. هان جياوي (12 سبتمبر 2017). “تمكين وضع العلامات التسلسلية باستخدام نموذج اللغة العصبية المدرك للمهام”. أرخايف : 1709.04109 [ cs.CL ].
  8. ^ كوراتا، جاكوتو. Ramabhadran, بوفانا ; ساون، جورج؛ سيثي ، أبهيناف (19 سبتمبر 2017). “نمذجة اللغة باستخدام الطريق السريع LSTM”. أرخايف : 1709.06436 [ cs.CL ].
  9. سيمونيان، كارين؛ زيسرمان، أندرو (2015-04-10)، شبكات الالتفاف العميقة جدًا للتعرف على الصور واسعة النطاق ، arXiv : 1409.1556
  10. هي، كايمينغ؛ تشانغ، شيانغيو؛ رين، شاوكينغ؛ صن، جيان (2016). "التعمق في المصححات: تجاوز الأداء البشري في تصنيف ImageNet". arXiv : 1502.01852 [ cs.CV ].
  11. ^ هو كايمينغ. تشانغ، شيانغيو. رن، شاوتشينج؛ صن جيان (10 ديسمبر 2015). التعلم المتبقي العميق للتعرف على الصور . أرخايف : 1512.03385 .
  12. هي، كايمينغ؛ تشانغ، شيانغيو؛ رن، شاوكينغ؛ صن، جيان (2016). "التعلم العميق المتبقي للتعرف على الصور". مؤتمر IEEE لعام 2016 حول رؤية الحاسوب والتعرف على الأنماط (CVPR) . IEEE. ص 770-778 . arXiv : 1512.03385 . doi : 10.1109/CVPR.2016.90 . ISBN  978-1-4673-8851-1.
  13. شميدهوبر، يورغن (2015). "شبكات الطرق السريعة (مايو 2015): أول شبكات عصبية أمامية عميقة عاملة حقًا بأكثر من 100 طبقة" .
  14. روزنبلات، فرانك (1961). مبادئ الديناميكا العصبية. البيرسيبترونات ونظرية آليات الدماغ (PDF) .
  15. لانغ، كيفن؛ ويتبروك، مايكل (1988). "تعلم التمييز بين حلزونين" (ملف PDF) . وقائع المدرسة الصيفية لنماذج الاتصال لعام 1988 : 52-59 .
  16. 1 2 3 سريفاستافا، روبيش كومار؛ جريف، كلاوس. شميدهوبر، يورغن (3 مايو 2015). “شبكات الطرق السريعة”. أرخايف : 1505.00387 [ cs.LG ].
  17. 1 2 هو، كايمينغ؛ تشانغ، شيانغيو. رن، شاوتشينج؛ صن ، جيان (2015). “تعيينات الهوية في الشبكات العميقة المتبقية”. أرخايف : 1603.05027 [ cs.CV ].
  18. فيليكس أ. جيرز؛ يورغن شميدهوبر؛ فريد كامينز (2000). " التعلم من النسيان: التنبؤ المستمر باستخدام LSTM". الحوسبة العصبية . 12 (10): 2451-2471 . CiteSeerX 10.1.1.55.5709 . doi : 10.1162/089976600300015015 . PMID 11032042. S2CID 11598600 .