الانتشار العكسي عبر الزمن
تُعدّ تقنية الانتشار العكسي عبر الزمن ( BPTT ) أسلوبًا قائمًا على التدرج لتدريب أنواع معينة من الشبكات العصبية المتكررة ، مثل شبكات إلمان . وقد طُوّرت هذه الخوارزمية بشكل مستقل من قِبل العديد من الباحثين. [ 1 ] [ 2 ] [ 3 ]
الخوارزمية

بيانات التدريب لشبكة عصبية متكررة هي عبارة عن تسلسل مرتب منأزواج المدخلات والمخرجات،يجب تحديد قيمة ابتدائية للحالة المخفية، والتي يتم اختيارها عادةً لتكون متجهًا صفريًا .
تبدأ تقنية BPTT بفك تشفير شبكة عصبية متكررة بمرور الوقت. تحتوي الشبكة المفكوكة علىالمدخلات والمخرجات، ولكن كل نسخة من الشبكة تشترك في نفس المعلمات. بعد ذلك، تُستخدم خوارزمية الانتشار العكسي لإيجاد تدرج دالة الخسارة بالنسبة لجميع معلمات الشبكة.
لنأخذ مثالاً على شبكة عصبية تحتوي على طبقة متكررةوطبقة تغذية أماميةتوجد طرق مختلفة لتحديد تكلفة التدريب، لكن التكلفة الإجمالية هي دائمًا متوسط تكاليف كل خطوة زمنية. ويمكن حساب تكلفة كل خطوة زمنية على حدة. يوضح الشكل أعلاه كيفية حساب التكلفة في كل خطوة زمنية.يمكن حساب ذلك عن طريق فك الطبقة المتكررةلثلاث خطوات زمنية وإضافة طبقة التغذية الأماميةكل حالة منتتشارك الشبكة غير المطوية نفس المعلمات. وبالتالي، يتم تحديث الأوزان في كل حالة (يتم جمعها معًا.
الشفرة الزائفة
فيما يلي رمز زائف لنسخة مختصرة من BPTT، حيث تحتوي بيانات التدريب علىأزواج المدخلات والمخرجات، ويتم فرد الشبكة لـالخطوات الزمنية:
Back_Propagation_Through_Time(a, y) // a[t] هو المدخل عند الزمن t. y[t] هو المخرج قم بفرد الشبكة لتضم k من حالات f do حتى يتم استيفاء معيار التوقف: x := متجه ذو مقدار صفري // x هو السياق الحالي for t from 0 to n − k do // t هو الزمن. n هو طول سلسلة التدريب قم بتعيين مدخلات الشبكة إلى x، a[t]، a[t+1]، ...، a[t+k−1] p := نشر المدخلات للأمام على كامل الشبكة غير المطوية e := y[t+k] − p; // الخطأ = الهدف − التوقع انشر الخطأ، e، عكسيًا عبر الشبكة غير المطوية بأكملها اجمع تغيرات الوزن في الحالات k من الدالة f معًا. قم بتحديث جميع الأوزان في f و g. x := f(x, a[t]); // حساب سياق الخطوة الزمنية التالية
المزايا
يميل BPTT إلى أن يكون أسرع بكثير في تدريب الشبكات العصبية المتكررة مقارنة بتقنيات التحسين العامة مثل التحسين التطوري . [ 4 ]
العيوب
تواجه خوارزمية BPTT صعوبة في التعامل مع الحلول المثلى المحلية. في الشبكات العصبية المتكررة، تُعدّ الحلول المثلى المحلية مشكلة أكثر أهمية بكثير منها في الشبكات العصبية ذات التغذية الأمامية. [ 5 ] تميل التغذية الراجعة المتكررة في هذه الشبكات إلى إحداث استجابات فوضوية في سطح الخطأ، مما يؤدي إلى ظهور الحلول المثلى المحلية بشكل متكرر، وفي مواقع غير مناسبة على سطح الخطأ.
انظر أيضاً
مراجع
- ↑ موزر، م. س. (1995). "خوارزمية الانتشار العكسي المركزة للتعرف على الأنماط الزمنية" . في: شوفان، ي.؛ روميلهارت، د. (محرران). الانتشار العكسي: النظرية، والبنى، والتطبيقات . هيلزديل، نيوجيرسي: لورانس إيرلبوم أسوشيتس. ص 137-169 . تاريخ الاسترجاع : 21 أغسطس 2017 .
{{cite book}}تم|website=تجاهله ( مساعدة ) - ↑ روبنسون، أ. ج. وفولسايد، ف. (1987). شبكة انتشار الخطأ الديناميكي المدفوعة بالمنفعة (تقرير فني). جامعة كامبريدج، قسم الهندسة. CUED/F-INFENG/TR.1.
- ↑ ويربوس، بول ج. (1988). "تعميم الانتشار العكسي مع تطبيق على نموذج سوق الغاز المتكرر" . الشبكات العصبية . 1 (4): 339-356 . doi : 10.1016/0893-6080(88)90007-x .
- ^ سيوبيرج، جوناس. تشانغ، تشينغهوا؛ ليونج، لينارت؛ بنفينيست، ألبرت؛ ديليون، برنارد. غلورينك، بيير إيف؛ الأماكن القريبة : جوديتسكي ، أناتولي (1995). “نمذجة الصندوق الأسود غير الخطي في تحديد النظام: نظرة عامة موحدة”. أوتوماتيكا . 31 (12): 1691–1724 . CiteSeerX 10.1.1.27.81 . دوى : 10.1016/0005-1098(95)00120-8 .
- ↑ إم بي كوييار، إم ديلجادو، وإم سي بيجالاجار (2006). "تطبيق البرمجة غير الخطية لتدريب الشبكات العصبية المتكررة في مسائل التنبؤ بالسلاسل الزمنية". نظم معلومات المؤسسات VII . سبرينغر هولندا. ص 95-102 . doi : 10.1007/978-1-4020-5347-4_11 . ISBN 978-1-4020-5323-8.
- الشبكات العصبية الاصطناعية
