الذاكرة الطويلة والقصيرة المدى
قد تكون هذه المقالة تقنية للغاية بحيث يصعب على معظم القراء فهمها . ( مارس 2022 ) |
| جزء من سلسلة عن |
| التعلم الآلي واستخراج البيانات |
|---|

الذاكرة الطويلة قصيرة المدى ( LSTM ) [1] هي نوع من الشبكات العصبية المتكررة (RNN) تهدف إلى التخفيف من مشكلة التدرج المتلاشي [2] التي تواجهها الشبكات العصبية المتكررة التقليدية عادةً. إن عدم حساسيتها النسبية لطول الفجوة هي ميزتها على الشبكات العصبية المتكررة الأخرى ونماذج ماركوف المخفية وطرق التعلم التسلسلي الأخرى. وتهدف إلى توفير ذاكرة قصيرة المدى للشبكة العصبية المتكررة التي يمكن أن تستمر لآلاف الخطوات الزمنية (وبالتالي " الذاكرة الطويلة قصيرة المدى"). [1] تم صنع الاسم على غرار الذاكرة طويلة المدى والذاكرة قصيرة المدى وعلاقتهما، والتي درسها علماء النفس الإدراكي منذ أوائل القرن العشرين.
تتكون وحدة LSTM عادةً من خلية وثلاث بوابات : بوابة إدخال وبوابة إخراج [3] وبوابة نسيان [ 4] . تتذكر الخلية القيم على فترات زمنية عشوائية، وتنظم البوابات تدفق المعلومات إلى داخل الخلية وخارجها. تقرر بوابات النسيان المعلومات التي يجب التخلص منها من الحالة السابقة، عن طريق تعيين الحالة السابقة والإدخال الحالي إلى قيمة بين 0 و1. تشير القيمة (المقربة) 1 إلى الاحتفاظ بالمعلومات، وتمثل القيمة 0 التخلص منها. تقرر بوابات الإدخال أي أجزاء من المعلومات الجديدة يجب تخزينها في حالة الخلية الحالية، باستخدام نفس النظام مثل بوابات النسيان. تتحكم بوابات الإخراج في أجزاء المعلومات في حالة الخلية الحالية التي يجب إخراجها، عن طريق تعيين قيمة من 0 إلى 1 للمعلومات، مع مراعاة الحالات السابقة والحالية. يسمح إخراج المعلومات ذات الصلة بشكل انتقائي من الحالة الحالية لشبكة LSTM بالحفاظ على تبعيات مفيدة وطويلة الأمد للتنبؤات، سواء في خطوات الوقت الحالية أو المستقبلية.
تستخدم تقنية LSTM في تطبيقات واسعة في التصنيف ، [5] [6] معالجة البيانات ، مهام تحليل السلاسل الزمنية ، [7] التعرف على الكلام ، [8] [9] الترجمة الآلية ، [10] [11] اكتشاف نشاط الكلام، [12] التحكم في الروبوت ، [13] [14] ألعاب الفيديو ، [15] [16] والرعاية الصحية . [17]
تحفيز
من الناحية النظرية، يمكن لشبكات RNN الكلاسيكية تتبع التبعيات طويلة المدى التعسفية في تسلسلات الإدخال. المشكلة مع شبكات RNN الكلاسيكية هي حسابية (أو عملية) بطبيعتها: عند تدريب شبكة RNN كلاسيكية باستخدام الانتشار الخلفي ، يمكن أن "تتلاشى" التدرجات طويلة المدى التي يتم انتشارها للخلف ، مما يعني أنها يمكن أن تميل إلى الصفر بسبب الأعداد الصغيرة جدًا التي تتسلل إلى الحسابات، مما يتسبب في توقف النموذج عن التعلم بشكل فعال. تحل شبكات RNN التي تستخدم وحدات LSTM جزئيًا مشكلة التدرج المتلاشي ، لأن وحدات LSTM تسمح للتدرجات بالتدفق أيضًا مع القليل من التوهين أو بدونه. ومع ذلك، لا تزال شبكات LSTM تعاني من مشكلة التدرج المتفجر. [18]
الحدس وراء بنية LSTM هو إنشاء وحدة إضافية في الشبكة العصبية تتعلم متى تتذكر ومتى تنسى المعلومات ذات الصلة. [4] بعبارة أخرى، تتعلم الشبكة بشكل فعال المعلومات التي قد تكون هناك حاجة إليها لاحقًا في تسلسل ومتى لم تعد هناك حاجة إلى هذه المعلومات. على سبيل المثال، في سياق معالجة اللغة الطبيعية ، يمكن للشبكة تعلم التبعيات النحوية. [19] قد تعالج LSTM الجملة " Dave ، نتيجة لادعاءاته المثيرة للجدل، أصبح الآن منبوذًا" من خلال تذكر الجنس النحوي (المرجح إحصائيًا) وعدد الفاعل Dave ، لاحظ أن هذه المعلومات ذات صلة بالضمير his ولاحظ أن هذه المعلومات لم تعد مهمة بعد الفعل is .
المتغيرات
في المعادلات أدناه، تمثل المتغيرات ذات الأحرف الصغيرة متجهات. تحتوي المصفوفات و على التوالي على أوزان اتصالات الإدخال والتكرار، حيث يمكن أن يكون الرمز السفلي إما بوابة الإدخال أو بوابة الإخراج أو بوابة النسيان أو خلية الذاكرة ، اعتمادًا على التنشيط الذي يتم حسابه. في هذا القسم، نستخدم "ترميز المتجه". على سبيل المثال، ليست وحدة واحدة فقط من خلية LSTM واحدة، ولكنها تحتوي على وحدات خلية LSTM.
انظر [20] لدراسة تجريبية لـ 8 متغيرات معمارية من LSTM.
LSTM مع بوابة النسيان
الأشكال المدمجة لمعادلات المرور الأمامي لخلية LSTM ذات بوابة النسيان هي: [1] [4]
حيث تكون القيم الأولية هي و و يشير المشغل إلى حاصل ضرب هادامارد (حاصل ضرب على مستوى العناصر). يشير الرمز السفلي إلى خطوة الوقت.
المتغيرات
نسمح للعلامات العلوية والإشارة إلى عدد ميزات الإدخال وعدد الوحدات المخفية على التوالي:
- : متجه الإدخال إلى وحدة LSTM
- :انسَ متجه تنشيط البوابة
- :متجه تنشيط بوابة الإدخال/التحديث
- : متجه تنشيط بوابة الإخراج
- : ناقل الحالة المخفية المعروف أيضًا باسم ناقل الإخراج لوحدة LSTM
- :ناقل تنشيط مدخلات الخلية
- :متجه حالة الخلية
- ، و : مصفوفات الوزن ومعلمات متجه التحيز التي يجب تعلمها أثناء التدريب
- : دالة سيجما .
- : دالة الظل الزائدية .
- : دالة الظل الزائدية أو كما تشير ورقة LSTM ذات الفتحة الصغيرة [21] [22] ، .
ثقب الباب LSTM

الشكل الموجود على اليمين هو تمثيل بياني لوحدة LSTM ذات اتصالات ثقب الباب (أي LSTM ذات ثقب الباب). [21] [22] تسمح اتصالات ثقب الباب للبوابات بالوصول إلى دائرة الخطأ الثابت (CEC)، والتي يكون تنشيطها هو حالة الخلية. [21] لا يتم استخدام هذه الخاصية، بل يتم استخدامها بدلاً من ذلك في معظم الأماكن.
يمكن اعتبار كل بوابة بمثابة خلية عصبية "قياسية" في شبكة عصبية ذات تغذية أمامية (أو متعددة الطبقات): أي أنها تحسب تنشيطًا (باستخدام دالة تنشيط) لمجموع مرجح. وتمثل تنشيطات بوابات الإدخال والإخراج والنسيان على التوالي، في خطوة زمنية .
تمثل الأسهم الثلاثة التي تخرج من خلية الذاكرة إلى البوابات الثلاث وصلات ثقب الباب . تشير وصلات ثقب الباب هذه في الواقع إلى مساهمات تنشيط خلية الذاكرة في خطوة زمنية ، أي مساهمة (وليس ، كما قد تشير الصورة). بعبارة أخرى، تحسب البوابات و عمليات تنشيطها في خطوة زمنية (أي، على التوالي، و ) مع الأخذ في الاعتبار أيضًا تنشيط خلية الذاكرة في خطوة زمنية ، أي .
السهم الوحيد من اليسار إلى اليمين الذي يخرج من خلية الذاكرة ليس اتصالاً بثقب الباب ويشير إلى .
تمثل الدوائر الصغيرة التي تحتوي على رمز عملية ضرب عنصرية بين مدخلاته. تمثل الدوائر الكبيرة التي تحتوي على منحنى يشبه حرف S تطبيق دالة قابلة للاشتقاق (مثل دالة سيجمايد) على مجموع مرجح.
LSTM ملتوية ثقب الباب
LSTM التفافية لثقب الباب . [23] يشير إلى عامل الالتفاف .
تمرين
يمكن تدريب RNN باستخدام وحدات LSTM بطريقة إشرافية على مجموعة من تسلسلات التدريب، باستخدام خوارزمية تحسين مثل الانحدار التدرجي مع الانتشار الخلفي عبر الزمن لحساب التدرجات اللازمة أثناء عملية التحسين، من أجل تغيير كل وزن لشبكة LSTM بما يتناسب مع مشتق الخطأ (في طبقة الإخراج لشبكة LSTM) فيما يتعلق بالوزن المقابل.
تتمثل إحدى المشكلات المتعلقة باستخدام الانحدار التدريجي للشبكات العصبية المتكررة القياسية في أن تدرجات الخطأ تتلاشى بسرعة كبيرة مع حجم الفارق الزمني بين الأحداث المهمة. ويرجع هذا إلى أن نصف القطر الطيفي أصغر من 1. [2] [24]
ومع ذلك، في وحدات LSTM، عندما يتم نشر قيم الخطأ من طبقة الإخراج، يظل الخطأ في خلية وحدة LSTM. تقوم "دائرة الأخطاء" هذه باستمرار بتغذية الخطأ إلى كل بوابة من بوابات وحدة LSTM، حتى تتعلم قطع القيمة.
دالة درجة CTC
تستخدم العديد من التطبيقات مجموعات من شبكات RNN LSTM [25] وتدربها من خلال التصنيف الزمني الترابطي (CTC) [5] للعثور على مصفوفة وزن RNN تعمل على تعظيم احتمالية تسلسلات العلامات في مجموعة التدريب، مع الأخذ في الاعتبار تسلسلات الإدخال المقابلة. يحقق التصنيف الزمني الترابطي كلاً من المحاذاة والتعرف.
البدائل
في بعض الأحيان، قد يكون من المفيد تدريب (أجزاء من) LSTM من خلال التطور العصبي [7] أو من خلال أساليب تدرج السياسة، خاصةً عندما لا يكون هناك "معلم" (أي تسميات التدريب).
التطبيقات
تتضمن تطبيقات LSTM ما يلي:
- التحكم في الروبوت [13]
- التنبؤ بالسلسلة الزمنية [7]
- التعرف على الكلام [26] [27] [28]
- تعلم الإيقاع [22]
- نمذجة هطول الأمطار والجريان الهيدرولوجي [29]
- التأليف الموسيقي [30]
- تعلم القواعد النحوية [31] [21] [32]
- التعرف على خط اليد [33] [34]
- التعرف على الفعل البشري [35]
- ترجمة لغة الإشارة [36]
- الكشف عن تشابه البروتين [37]
- التنبؤ بتوطين البروتينات تحت الخلوية [38]
- اكتشاف شذوذ السلسلة الزمنية [39]
- عدة مهام تنبؤية في مجال إدارة العمليات التجارية [40]
- التنبؤ في مسارات الرعاية الطبية [41]
- التحليل الدلالي [42]
- تقسيم الأشياء إلى أجزاء [43] [44]
- إدارة ركاب المطار [45]
- توقعات حركة المرور على المدى القصير [46]
- تصميم الدواء [47]
- التنبؤ بالسوق [48]
- تصنيف النشاط في الفيديو [49]
2015: بدأت Google في استخدام LSTM المدربة بواسطة CTC للتعرف على الكلام على Google Voice. [50] [51] وفقًا لمنشور المدونة الرسمي، قلل النموذج الجديد من أخطاء النسخ بنسبة 49%. [52]
2016: بدأت جوجل في استخدام LSTM لاقتراح الرسائل في تطبيق المحادثة Allo. [53] في نفس العام، أصدرت جوجل نظام Google Neural Machine Translation لـ Google Translate والذي استخدم LSTMs لتقليل أخطاء الترجمة بنسبة 60%. [10] [54] [55]
أعلنت شركة Apple في مؤتمر المطورين العالميين الخاص بها أنها ستبدأ في استخدام LSTM للكتابة السريعة [56] [57] [58] في iPhone ولـ Siri. [59] [60]
أطلقت أمازون برنامج Polly ، الذي يقوم بتوليد الأصوات خلف Alexa، باستخدام LSTM ثنائي الاتجاه لتقنية تحويل النص إلى كلام. [61]
2017: أجرى فيسبوك حوالي 4.5 مليار ترجمة آلية يوميًا باستخدام شبكات الذاكرة قصيرة المدى الطويلة. [11]
أفادت شركة مايكروسوفت بأنها وصلت إلى دقة التعرف بنسبة 94.9% على مجموعة المفاتيح Switchboard، والتي تضم مفردات من 165000 كلمة. وقد استخدم النهج "ذاكرة طويلة المدى تعتمد على جلسة حوار". [62]
2018: استخدمت OpenAI LSTM المدربة من خلال تدرجات السياسة للتغلب على البشر في لعبة الفيديو المعقدة Dota 2، [15] وللتحكم في يد روبوتية تشبه يد الإنسان تتلاعب بالأشياء المادية ببراعة غير مسبوقة. [14] [63]
2019: استخدمت DeepMind LSTM المدربة من خلال تدرجات السياسة للتفوق في لعبة الفيديو المعقدة Starcraft II . [16] [63]
تاريخ
تطوير
تم توقع جوانب LSTM من خلال "الانتشار الخلفي المركّز" (Mozer، 1989)، [64] كما ورد في ورقة LSTM. [1]
قام سيب هوخرايتر في أطروحته للدبلومة الألمانية عام 1991 بتحليل مشكلة التدرج المتلاشي وتطوير مبادئ الطريقة. [2] اعتبر مشرفه، يورجن شميدهوبر ، الأطروحة ذات أهمية كبيرة. [65]
نُشرت نسخة مبكرة من LSTM في عام 1995 في تقرير فني كتبه Sepp Hochreiter و Jürgen Schmidhuber ، [66] ثم نُشر في مؤتمر NIPS 1996. [3]
تم نشر نقطة المرجع الأكثر استخدامًا لـ LSTM في عام 1997 في مجلة Neural Computation . [1] من خلال تقديم وحدات Constant Error Carousel (CEC)، تتعامل LSTM مع مشكلة التدرج المتلاشي . تضمنت النسخة الأولية من كتلة LSTM خلايا وبوابات إدخال وإخراج. [20]
( فيليكس جيرس ، ويورجن شميدهوبر، وفريد كومينز، 1999) [67] قدم بوابة النسيان (وتسمى أيضًا "بوابة الاحتفاظ") في بنية LSTM في عام 1999، مما مكن LSTM من إعادة تعيين حالتها الخاصة. [20] هذه هي النسخة الأكثر استخدامًا من LSTM في الوقت الحاضر.
(Gers, Schmidhuber, and Cummins, 2000) أضافوا وصلات ثقب الباب. [21] [22] بالإضافة إلى ذلك، تم حذف وظيفة تنشيط الإخراج. [20]
تطوير المتغيرات
(Graves, Fernandez, Gomez, and Schmidhuber, 2006) [5] قدموا دالة خطأ جديدة لـ LSTM: التصنيف الزمني الاتصالي (CTC) للمحاذاة والتعرف على التسلسلات في وقت واحد.
(Graves, Schmidhuber, 2005) [26] نشر LSTM مع الانتشار الخلفي الكامل عبر الزمن وLSTM ثنائي الاتجاه.
(Kyunghyun Cho et al., 2014) [68] نشر نسخة مبسطة من بوابة النسيان LSTM [67] تسمى الوحدة المتكررة المبوابة (GRU).
(روبيش كومار سريفاستافا، كلاوس جريف، وشميدهوبر، 2015) استخدموا مبادئ LSTM [67] لإنشاء شبكة الطريق السريع ، وهي شبكة عصبية تغذية أمامية تحتوي على مئات الطبقات، وهي أعمق بكثير من الشبكات السابقة. [69] [70] [71] وفي الوقت نفسه، تم تطوير بنية ResNet . وهي تعادل شبكة الطرق السريعة المفتوحة أو غير المفتوحة. [72]
تم نشر ترقية حديثة لـ LSTM تسمى xLSTM بواسطة فريق بقيادة Sepp Hochreiter (Maximilian et al، 2024). [73] [74] يمكن تنفيذ إحدى الكتلتين (mLSTM) للهندسة المعمارية بالتوازي مثل هندسة Transformer ، بينما تسمح الكتل الأخرى (sLSTM) بتتبع الحالة.
التطبيقات
2004: أول تطبيق ناجح لتقنية LSTM على الكلام أليكس جريفز وآخرون. [75] [63]
2001: قام جيرز وشميدهوبر بتدريب LSTM على تعلم اللغات التي لا يمكن تعلمها باستخدام النماذج التقليدية مثل نماذج ماركوف المخفية. [21] [63]
استخدم Hochreiter وآخرون LSTM للتعلم الفوقي (أي تعلم خوارزمية التعلم). [76]
2005: قام دان ويرسترا، وفاوستينو جوميز، وشميدهوبر بتدريب LSTM من خلال التطور العصبي دون معلم. [7]
قام ماير وآخرون بتدريب LSTM للتحكم في الروبوتات . [13]
2007: قام Wierstra وFoerster وPeters وSchmidhuber بتدريب LSTM من خلال تدرجات السياسة للتعلم التعزيزي دون معلم. [77]
قام هوخرايتر، وهيوزيل، وأوبرماير بتطبيق تقنية LSTM للكشف عن تشابه البروتينات في مجال علم الأحياء . [37]
2009: قدم جاستن باير وآخرون البحث عن البنية العصبية لـ LSTM. [78] [63]
2009: فازت إحدى ماكينات LSTM التي دربتها CTC بمسابقة التعرف على خط اليد المتصلة ICDAR . وقد قدم فريق بقيادة أليكس جريفز ثلاثة نماذج من هذا القبيل . [79] كان أحدها هو النموذج الأكثر دقة في المسابقة وكان الآخر هو الأسرع. [80] كانت هذه هي المرة الأولى التي تفوز فيها شبكة عصبية متكررة بمسابقات دولية. [63]
2013: استخدم أليكس جريفز وعبد الرحمن محمد وجيفري هينتون شبكات LSTM كمكون رئيسي لشبكة حققت معدل خطأ صوتي قياسي بلغ 17.7% على مجموعة بيانات الكلام الطبيعي TIMIT الكلاسيكية . [28]
نشر باحثون من جامعة ولاية ميشيغان ، وIBM Research ، وجامعة كورنيل دراسة في مؤتمر اكتشاف المعرفة واستخراج البيانات (KDD). [81] [82] [83] يعمل LSTM الذي يدرك الوقت (T-LSTM) بشكل أفضل على مجموعات بيانات معينة من LSTM القياسي.
انظر أيضا
مراجع
- ^ abcde سيب هوخريتر . يورغن شميدهوبر (1997). “الذاكرة طويلة المدى قصيرة المدى”. الحساب العصبي . 9 (8): 1735-1780. دوى :10.1162/neco.1997.9.8.1735. بميد 9377276. S2CID 1915014.
- ^ اي بي سي هوخريتر ، سيب (1991). Unter suchungen zu dynamischen neuronalen Netzen (PDF) (أطروحة الدبلوم). جامعة ميونيخ التقنية، معهد علوم الكمبيوتر.
- ^ ab Hochreiter, Sepp; Schmidhuber, Jürgen (1996-12-03). "LSTM يمكن أن تحل مشاكل التأخير الزمني الطويل الصعبة". وقائع المؤتمر الدولي التاسع لأنظمة معالجة المعلومات العصبية . NIPS'96. كامبريدج، ماساتشوستس، الولايات المتحدة الأمريكية: مطبعة معهد ماساتشوستس للتكنولوجيا: 473-479.
- ^ abc Felix A. Gers; Jürgen Schmidhuber; Fred Cummins (2000). "تعلم النسيان: التنبؤ المستمر باستخدام LSTM". الحوسبة العصبية . 12 (10): 2451–2471. CiteSeerX 10.1.1.55.5709 . doi :10.1162/089976600300015015. PMID 11032042. S2CID 11598600.
- ^ abc Graves, Alex; Fernández, Santiago; Gomez, Faustino; Schmidhuber, Jürgen (2006). "التصنيف الزمني الاتصالي: وسم بيانات التسلسل غير المجزأة باستخدام الشبكات العصبية المتكررة". في وقائع المؤتمر الدولي للتعلم الآلي، ICML 2006 : 369–376. CiteSeerX 10.1.1.75.6306 .
- ^ كريم، فازلي؛ ماجومدار، سومشوبرا؛ دارابي، هوشانغ؛ تشن، شون (2018). "شبكات LSTM التلافيفية الكاملة لتصنيف السلاسل الزمنية". IEEE Access . 6 : 1662–1669. arXiv : 1709.05206 . doi :10.1109/ACCESS.2017.2779939. ISSN 2169-3536.
- ^ abcd Wierstra, Daan; Schmidhuber, J.; Gomez, FJ (2005). "Evolino: Hybrid Neuroevolution/Optimal Linear Search for Sequence Learning". وقائع المؤتمر الدولي المشترك التاسع عشر حول الذكاء الاصطناعي (IJCAI)، إدنبرة : 853–858.
- ^ Sak, Hasim; Senior, Andrew; Beaufays, Francoise (2014). "Long Short-Term Memory recurrent neural network architectures for large scale acoustic modeling" (PDF) . مؤرشف من الأصل (PDF) في 2018-04-24.
- ^ لي، شيانغانغ؛ وو، شي هونغ (2014-10-15). "إنشاء شبكات عصبية متكررة عميقة تعتمد على الذاكرة طويلة المدى والقصيرة المدى للتعرف على الكلام ذي المفردات الكبيرة". arXiv : 1410.4281 [cs.CL].
- ^ ab Wu, Yonghui; Schuster, Mike; Chen, Zhifeng; Le, Quoc V.; Norouzi, Mohammad; Macherey, Wolfgang; Krikun, Maxim; Cao, Yuan; Gao, Qin (2016-09-26). "نظام الترجمة الآلية العصبية من Google: سد الفجوة بين الترجمة البشرية والآلية". arXiv : 1609.08144 [cs.CL].
- ^ ab Ong, Thuy (4 أغسطس 2017). "ترجمات Facebook تعمل الآن بالكامل بواسطة الذكاء الاصطناعي". www.allthingsdistributed.com . تم الاسترجاع في 2019-02-15 .
- ^ شهيد الله، ماريلاند؛ باتينو، خوسيه. كورنيل، صامويل. يين، رويكينج؛ سيفاسانكاران، سونيت؛ بريدين، هيرفيه. كورشونوف، بافيل؛ بروتي، أليسيو؛ سيريزيل، رومان؛ فنسنت، إيمانويل؛ إيفانز، نيكولاس. مارسيل، سيباستيان. سكوارتيني، ستيفانو؛ باراس ، كلود (2019/11/06). “التقديم السريع إلى ديهارد الثاني: المساهمات والدروس المستفادة”. أرخايف : 1911.02388 [eess.AS].
- ^ abc Mayer, H.; Gomez, F.; Wierstra, D.; Nagy, I.; Knoll, A.; Schmidhuber, J. (أكتوبر 2006). "نظام لجراحة القلب الآلية يتعلم كيفية ربط العقد باستخدام الشبكات العصبية المتكررة". مؤتمر IEEE/RSJ الدولي لعام 2006 حول الروبوتات والأنظمة الذكية . ص 543-548. CiteSeerX 10.1.1.218.3399 . doi :10.1109/IROS.2006.282190. ISBN 978-1-4244-0258-8. S2CID 12284900.
- ^ ab "Learning Dexterity". OpenAI . 30 يوليو 2018 . تم الاسترجاع 2023-06-28 .
- ^ ab Rodriguez, Jesus (2 يوليو 2018). "العلم وراء OpenAI Five that just Produced One of the Greatest Breakthrough in the History of AI". نحو علم البيانات . مؤرشف من الأصل في 2019-12-26 . تم الاسترجاع في 2019-01-15 .
- ^ ab Stanford, Stacy (January 25, 2019). "DeepMind's AI, AlphaStar Showcases Significant Progress Towards AGI". Medium ML Memoirs . تم الاسترجاع في 2019-01-15 .
- ^ شميدهوبر، يورجن (2021). "عقد العشرينيات: عقدنا من التعلم العميق / نظرة إلى عقد العشرينيات". مدونة الذكاء الاصطناعي . IDSIA، سويسرا . تم الاسترجاع في 30 أبريل 2022 .
- ^ كالين، أوفيديو (14 فبراير 2020). Deep Learning Architectures . Cham, Switzerland: Springer Nature. ص. 555. ISBN 978-3-030-36720-6.
- ^ لاكريتز، يائير؛ كروسزيفسكي، ألماني؛ ديسبوردس، ثيو؛ هوبكيس، ديوك؛ ديهيني، ستانيسلاس؛ باروني ، ماركو (2019)، “ظهور وحدات العدد وبناء الجملة في”، ظهور وحدات العدد وبناء الجملة (PDF) ، جمعية اللغويات الحاسوبية، الصفحات من 11 إلى 20، دوى :10.18653/v1/N19-1002، hdl :11245.1/16cb6800-e10d-4166-8e0b-fed61ca6ebb4, S2CID 81978369
- ^ abcd Klaus Greff؛ Rupesh Kumar Srivastava؛ Jan Koutník؛ Bas R. Steunebrink؛ Jürgen Schmidhuber (2015). "LSTM: A Search Space Odyssey". معاملات IEEE للشبكات العصبية وأنظمة التعلم . 28 (10): 2222–2232. arXiv : 1503.04069 . رمز Bibcode : 2015arXiv150304069G. doi : 10.1109/TNNLS.2016.2582924. PMID 27411231. S2CID 3356463.
- ^ abcdef Gers, FA; Schmidhuber, J. (2001). "شبكات LSTM المتكررة تتعلم لغات بسيطة خالية من السياق وحساسة للسياق" (PDF) . معاملات IEEE للشبكات العصبية . 12 (6): 1333–1340. doi :10.1109/72.963769. PMID 18249962. S2CID 10192330.
- ^ abcd Gers, F.; Schraudolph, N.; Schmidhuber, J. (2002). "تعلم التوقيت الدقيق باستخدام شبكات LSTM المتكررة" (PDF) . مجلة أبحاث التعلم الآلي . 3 : 115–143.
- ^ Xingjian Shi؛ Zhourong Chen؛ Hao Wang؛ Dit-Yan Yeung؛ Wai-kin Wong؛ Wang-chun Woo (2015). "شبكة LSTM التلافيفية: نهج التعلم الآلي للتنبؤ بالهطول الآني". وقائع المؤتمر الدولي الثامن والعشرين حول أنظمة معالجة المعلومات العصبية : 802-810. arXiv : 1506.04214 . Bibcode : 2015arXiv150604214S.
- ^ Hochreiter, S.; Bengio, Y.; Frasconi, P.; Schmidhuber, J. (2001). "Gradient Flow in Recurrent Nets: the Difficulty of Learning Long-Term Dependencies (PDF Download Available)". في Kremer and, SC؛ Kolen, JF (المحررون). دليل ميداني للشبكات العصبية المتكررة الديناميكية . مطبعة معهد مهندسي الكهرباء والإلكترونيات.
- ^ فرنانديز، سانتياجو؛ جريفز، أليكس؛ شميدهوبر، يورجن (2007). "تصنيف التسلسل في المجالات المنظمة ذات الشبكات العصبية المتكررة الهرمية". وقائع المؤتمر الدولي المشترك العشرين حول الذكاء الاصطناعي، إجكاي 2007 : 774-779. CiteSeerX 10.1.1.79.1887 .
- ^ ab Graves, A.; Schmidhuber, J. (2005). "تصنيف الفونيمات الإطارية باستخدام LSTM ثنائية الاتجاه وهياكل الشبكات العصبية الأخرى". الشبكات العصبية . 18 (5-6): 602-610. CiteSeerX 10.1.1.331.5800 . doi :10.1016/j.neunet.2005.06.042. PMID 16112549. S2CID 1856462.
- ^ Fernández, S.; Graves, A.; Schmidhuber, J. (9 September 2007). "An Application of Recurrent Neural Networks to Discriminative Keyword Spotting". Proceedings of the 17th International Conference on Artificial Neural Networks . ICANN'07. Berlin, Heidelberg: Springer-Verlag: 220–229. ISBN 978-3540746935تم الاسترجاع بتاريخ 28 ديسمبر 2023 .
- ^ ab Graves, Alex; Mohamed, Abdel-rahman; Hinton, Geoffrey (2013). "التعرف على الكلام باستخدام الشبكات العصبية المتكررة العميقة". مؤتمر معهد مهندسي الكهرباء والإلكترونيات الدولي لعام 2013 حول الصوتيات والكلام ومعالجة الإشارات . ص. 6645–6649. arXiv : 1303.5778 . doi :10.1109/ICASSP.2013.6638947. ISBN 978-1-4799-0356-6. S2CID 206741496.
- ^ كراتزرت، فريدريك؛ كلوتز، دانييل؛ شاليف، جاي؛ كلامباور، غونتر؛ هوخرايتر، سيب؛ نيرينغ، جراي (2019-12-17). "نحو تعلم السلوكيات الهيدرولوجية العالمية والإقليمية والمحلية عبر التعلم الآلي المطبق على مجموعات البيانات ذات العينات الكبيرة". علم المياه وعلوم نظام الأرض . 23 (12): 5089-5110. arXiv : 1907.08456 . Bibcode :2019HESS...23.5089K. doi : 10.5194/hess-23-5089-2019 . ISSN 1027-5606.
- ^ إيك، دوغلاس؛ شميدهوبر، يورجن (2002-08-28). "تعلم البنية طويلة الأمد لموسيقى البلوز". الشبكات العصبية الاصطناعية — ICANN 2002. محاضرات في علوم الكمبيوتر. المجلد 2415. سبرينغر، برلين، هايدلبرغ. ص 284-289. CiteSeerX 10.1.1.116.3620 . doi :10.1007/3-540-46084-5_47. ISBN 978-3540460848.
- ^ Schmidhuber, J.; Gers, F.; Eck, D.; Schmidhuber, J.; Gers, F. (2002). "تعلم اللغات غير المنتظمة: مقارنة بين الشبكات المتكررة البسيطة وLSTM". الحوسبة العصبية . 14 (9): 2039–2041. CiteSeerX 10.1.1.11.7369 . doi :10.1162/089976602320263980. PMID 12184841. S2CID 30459046.
- ^ بيريز-أورتيز، جيه إيه؛ جيرس، إف إيه؛ إيك، دي؛ شميدهوبر، جيه (2003). "مرشحات كالمان تعمل على تحسين أداء شبكة LSTM في المشكلات التي لا يمكن حلها باستخدام الشبكات المتكررة التقليدية". الشبكات العصبية . 16 (2): 241-250. CiteSeerX 10.1.1.381.1992 . doi :10.1016/s0893-6080(02)00219-8. PMID 12628609.
- ^ أ. جريفز، ج. شميدهوبر. التعرف على خط اليد دون اتصال بالإنترنت باستخدام الشبكات العصبية المتكررة متعددة الأبعاد. التقدم في أنظمة معالجة المعلومات العصبية 22، NIPS'22، ص 545-552، فانكوفر، مطبعة معهد ماساتشوستس للتكنولوجيا، 2009.
- ^ Graves, A.; Fernández, S.; Liwicki, M.; Bunke, H.; Schmidhuber, J. (3 ديسمبر 2007). "التعرف على خط اليد عبر الإنترنت بدون قيود باستخدام الشبكات العصبية المتكررة". وقائع المؤتمر الدولي العشرين لأنظمة معالجة المعلومات العصبية . NIPS'07. الولايات المتحدة الأمريكية: Curran Associates Inc.: 577–584. ISBN 9781605603520تم الاسترجاع بتاريخ 28 ديسمبر 2023 .
- ^ Baccouche, M.; Mamalet, F.; Wolf, C.; Garcia, C.; Baskurt, A. (2011). "Sequential Deep Learning for Human Action Recognition". In Saleh, AA; Lepri, B. (eds.). 2nd International Workshop on Human Behavior Understanding (HBU) . Lecture Notes in Computer Science. المجلد 7065. أمستردام، هولندا: سبرينغر. ص 29-39. doi :10.1007/978-3-642-25446-8_4. ISBN 978-3-642-25445-1.
- ^ هوانغ جي. تشو، وينجانج؛ تشانغ، كيلين؛ لي، هوكيانغ؛ لي ، ويبينغ (2018/01/30). “التعرف على لغة الإشارة عبر الفيديو دون تجزئة زمنية”. أرخايف : 1801.10111 [cs.CV].
- ^ ab Hochreiter, S.; Heusel, M.; Obermayer, K. (2007). "الكشف السريع عن تشابه البروتينات المستند إلى النموذج دون محاذاة". Bioinformatics . 23 (14): 1728–1736. doi : 10.1093/bioinformatics/btm247 . PMID 17488755.
- ^ Thireou, T.; Reczko, M. (2007). "شبكات الذاكرة طويلة الأمد ثنائية الاتجاه للتنبؤ بالتوطين الفرعي للبروتينات حقيقية النواة". معاملات IEEE/ACM في علم الأحياء الحاسوبي وعلم المعلومات الحيوية . 4 (3): 441–446. doi :10.1109/tcbb.2007.1015. PMID 17666763. S2CID 11787259.
- ^ مالهوترا، بانكاج؛ فيج، لوفكش؛ شروف، جوتام؛ أجراوال، بونيت (أبريل 2015). "شبكات الذاكرة الطويلة والقصيرة المدى للكشف عن الشذوذ في السلاسل الزمنية" (PDF) . الندوة الأوروبية حول الشبكات العصبية الاصطناعية والذكاء الحاسوبي والتعلم الآلي — ESANN 2015. مؤرشف من الأصل (PDF) في 2020-10-30 . تم الاسترجاع في 2018-02-21 .
- ^ Tax, N.; Verenich, I.; La Rosa, M.; Dumas, M. (2017). "Predictive Business Process Monitoring with LSTM Neural Networks". Advanced Information Systems Engineering . Lecture Notes in Computer Science. المجلد 10253. ص 477-492. arXiv : 1612.02130 . doi :10.1007/978-3-319-59536-8_30. ISBN 978-3-319-59535-1. S2CID 2192354.
- ^ Choi, E.; Bahadori, MT; Schuetz, E.; Stewart, W.; Sun, J. (2016). "Doctor AI: Predicting Clinical Events via Recurrent Neural Networks". JMLR Workshop and Conference Proceedings . 56 : 301–318. arXiv : 1511.05942 . Bibcode :2015arXiv151105942C. PMC 5341604 . PMID 28286600.
- ^ جيا، روبن؛ ليانغ، بيرسي (2016). "إعادة تجميع البيانات للتحليل الدلالي العصبي". arXiv : 1606.03622 [cs.CL].
- ^ وانج، لي؛ دوان، شوهوان؛ تشانغ، تشيلين؛ نيو، زينكسينج؛ هوا، جانج؛ تشنغ، ناننينغ (2018-05-22). "Segment-Tube: تحديد موقع الفعل المكاني الزمني في مقاطع الفيديو غير المقصوصة باستخدام التجزئة لكل إطار" (PDF) . أجهزة الاستشعار . 18 (5): 1657. رمز Bibcode : 2018Senso..18.1657W. doi : 10.3390/s18051657 . ISSN 1424-8220. PMC 5982167. PMID 29789447 .
- ^ دوان ، شوهوان. وانغ، لو؛ تشاي، تشانغبو؛ تشنغ، ناننينغ؛ تشانغ، كيلين؛ نيو، زينشينغ؛ هوا جانج (2018). “توطين العمل المكاني والزماني المشترك في مقاطع الفيديو غير المقطوعة مع تجزئة لكل إطار”. مؤتمر IEEE الدولي الخامس والعشرون لعام 2018 حول معالجة الصور (ICIP) . مؤتمر IEEE الدولي الخامس والعشرون لمعالجة الصور (ICIP). ص 918-922. دوى :10.1109/icip.2018.8451692. رقم ISBN 978-1-4799-7061-2.
- ^ Orsini, F.; Gastaldi, M.; Mantecchini, L.; Rossi, R. (2019). الشبكات العصبية المدربة باستخدام تتبعات WiFi للتنبؤ بسلوك ركاب المطار . المؤتمر الدولي السادس حول النماذج والتقنيات لأنظمة النقل الذكية. كراكوف: معهد مهندسي الكهرباء والإلكترونيات. arXiv : 1910.14026 . doi :10.1109/MTITS.2019.8883365. 8883365.
- ^ Zhao, Z.; Chen, W.; Wu, X.; Chen, PCY; Liu, J. (2017). "شبكة LSTM: نهج التعلم العميق للتنبؤ بحركة المرور قصيرة المدى". IET Intelligent Transport Systems . 11 (2): 68–75. doi :10.1049/iet-its.2016.0208. S2CID 114567527.
- ^ Gupta A, Müller AT, Huisman BJH, Fuchs JA, Schneider P, Schneider G (2018). "Generative Recurrent Networks for De Novo Drug Design". Mol Inform . 37 (1–2). doi :10.1002/minf.201700111. PMC 5836943. PMID 29095571 .
{{cite journal}}: CS1 maint: multiple names: authors list (link) - ^ سيف الإسلام، محمد؛ حسين، إمام (2020-10-26). "التنبؤ بسعر صرف العملات الأجنبية باستخدام شبكة هجينة GRU-LSTM". رسائل الحوسبة الناعمة . 3 : 100009. doi : 10.1016/j.socl.2020.100009 . ISSN 2666-2221.
- ^ {{استشهد بـ Abbey Martin وAndrew J. Hill وKonstantin M. Seiler وMehala Balamurali (2023) التعرف التلقائي على حركة الحفار وتحديد موقعه لمقاطع الفيديو غير المقطوعة باستخدام شبكات LSTM-Transformer الهجينة، المجلة الدولية للتعدين والاستصلاح والبيئة، DOI: 10.1080/17480930.2023.2290364}}
- ^ Beaufays, Françoise (11 أغسطس 2015). "الشبكات العصبية وراء النسخ الصوتي من Google Voice". مدونة الأبحاث . تم الاسترجاع في 2017-06-27 .
- ^ ساك، هاشم؛ سينيور، أندرو؛ راو، كانيشكا؛ بيوفيس، فرانسواز؛ شالكويك، يوهان (24 سبتمبر 2015). "البحث الصوتي من جوجل: أسرع وأكثر دقة". مدونة الأبحاث . تم الاسترجاع في 2017-06-27 .
- ^ "وصفة النيون... أو بالأحرى، نسخة جديدة منقولة لـ Google Voice". مدونة Google الرسمية . 23 يوليو 2015. تم الاسترجاع في 2020-04-25 .
- ^ خيتان، براناف (18 مايو 2016). "الدردشة بذكاء مع ألو". مدونة الأبحاث . تم الاسترجاع في 2017-06-27 .
- ^ ميتز، كيد (27 سبتمبر 2016). "ضخ الذكاء الاصطناعي يجعل خدمة Google Translate أكثر قوة من أي وقت مضى | WIRED". Wired . تم الاسترجاع في 2017-06-27 .
- ^ "شبكة عصبية للترجمة الآلية على نطاق الإنتاج". مدونة جوجل للذكاء الاصطناعي . 27 سبتمبر 2016. تم الاسترجاع في 2020-04-25 .
- ^ إفراتي، أمير (13 يونيو 2016). "آلات آبل قادرة على التعلم أيضًا". المعلومات . تم الاسترجاع في 2017-06-27 .
- ^ Ranger, Steve (14 يونيو 2016). "iPhone, AI and big data: Here's how Apple plans to protect your privacy". ZDNet . تم الاسترجاع في 2017-06-27 .
- ^ "هل يمكن للسياق الدلالي العالمي تحسين نماذج اللغة العصبية؟ – Apple". مجلة Apple Machine Learning Journal . تم الاسترجاع في 2020-04-30 .
- ^ سميث، كريس (2016-06-13). "iOS 10: Siri يعمل الآن في تطبيقات الطرف الثالث، ويأتي مع ميزات الذكاء الاصطناعي الإضافية". BGR . تم الاسترجاع في 2017-06-27 .
- ^ Capes, Tim; Coles, Paul; Conkie, Alistair; Golipour, Ladan; Hadjitarkhani, Abie; Hu, Qiong; Huddleston, Nancy; Hunt, Melvyn; Li, Jiangchuan; Neeracher, Matthias; Prahallad, Kishore (2017-08-20). "نظام تحويل النص إلى كلام باستخدام Siri على الجهاز الموجه بالتعلم العميق". Interspeech 2017. ISCA: 4011–4015. doi :10.21437/Interspeech.2017-1798.
- ^ فوجيلز، فيرنر (30 نوفمبر 2016). "جلب سحر أمازون للذكاء الاصطناعي وأليكسا إلى التطبيقات على AWS. – كل الأشياء الموزعة". www.allthingsdistributed.com . تم الاسترجاع في 2017-06-27 .
- ^ Xiong, W.; Wu, L.; Alleva, F.; Droppo, J.; Huang, X.; Stolcke, A. (أبريل 2018). "نظام التعرف على الكلام المحادثة من Microsoft 2017". مؤتمر IEEE الدولي لعام 2018 حول الصوتيات والكلام ومعالجة الإشارات (ICASSP) . IEEE. ص 5934-5938. doi :10.1109/ICASSP.2018.8461870. ISBN 978-1-5386-4658-8.
- ^ abcdef Schmidhuber, Juergen (10 مايو 2021). "التعلم العميق: عامنا المعجزة 1990-1991". arXiv : 2005.05744 [cs.NE].
- ^ موزر، مايك (1989). "خوارزمية الانتشار الخلفي المركزة للتعرف على الأنماط الزمنية". الأنظمة المعقدة .
- ^ شميدهوبر، يورجن (2022). "التاريخ الموضح للذكاء الاصطناعي الحديث والتعلم العميق". arXiv : 2212.11279 [cs.NE].
- ^ سيب هوخريتر . يورغن شميدهوبر (21 أغسطس 1995)، الذاكرة طويلة المدى، ويكي بيانات Q98967430
- ^ abc Gers, Felix; Schmidhuber, Jürgen; Cummins, Fred (1999). "تعلم النسيان: التنبؤ المستمر باستخدام LSTM". المؤتمر الدولي التاسع حول الشبكات العصبية الاصطناعية: ICANN '99 . المجلد 1999. ص 850-855. doi :10.1049/cp:19991218. ISBN 0-85296-721-7.
- ^ تشو، كيونغ هيون؛ فان ميرينبور، بارت؛ جولتشيهري، كاجلار؛ بهداناو، ديمتري؛ بوجاريس، فتحي؛ شوينك، هولجر؛ بينجيو، يوشوا (2014). "تعلم تمثيلات العبارات باستخدام مشفر وفك تشفير RNN للترجمة الآلية الإحصائية". arXiv : 1406.1078 [cs.CL].
- ^ سريفاستافا، روبيش كومار؛ جريف، كلاوس. شميدهوبر، يورغن (2015-05-02). “شبكات الطرق السريعة”. أرخايف : 1505.00387 [cs.LG].
- ^ Srivastava, Rupesh K; Greff, Klaus; Schmidhuber, Juergen (2015). "Training Very Deep Networks". Advances in Neural Information Processing Systems . 28. Curran Associates, Inc.: 2377–2385.
- ^ شميدهوبر، يورجن (2021). "أكثر الشبكات العصبية استشهادًا تعتمد جميعها على العمل الذي تم إنجازه في مختبراتي". مدونة الذكاء الاصطناعي . IDSIA، سويسرا . تم الاسترجاع في 2022-04-30 .
- ^ He, Kaiming; Zhang, Xiangyu; Ren, Shaoqing; Sun, Jian (2016). Deep Residual Learning for Image Recognition. 2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR) . لاس فيجاس، نيفادا، الولايات المتحدة الأمريكية: IEEE. ص 770-778. arXiv : 1512.03385 . doi :10.1109/CVPR.2016.90. ISBN 978-1-4673-8851-1.
- ^ بيك ، ماكسيميليان. بوبل، كوربينيان؛ سبانرينج، ماركوس؛ أوير، أندرياس. برودنيكوفا، أولكسندرا؛ كوب، مايكل. كلامباور، غونتر؛ براندستيتر، يوهانس؛ هوخريتر ، سيب (2024/05/07). “xLSTM: ذاكرة طويلة المدى موسعة”. أرخايف : 2405.04517 [cs.LG].
- ^ NX-AI / xlstm، NXAI، 04/06/2024 ، استرجاعها 04/06/2024
- ^ جريفز، أليكس؛ بيرينجر، نيكول؛ إيك، دوغلاس؛ شميدهوبر، يورجن (2004). التعرف على الكلام بطريقة بيولوجية معقولة باستخدام شبكات LSTM العصبية . ورشة عمل حول الأساليب المستوحاة بيولوجيًا لتكنولوجيا المعلومات المتقدمة، Bio-ADIT 2004، لوزان، سويسرا. ص 175-184.
- ^ Hochreiter, S.; Younger, AS; Conwell, PR (2001). "تعلم كيفية التعلم باستخدام الانحدار التدريجي". الشبكات العصبية الاصطناعية — ICANN 2001 (PDF) . مذكرات محاضرات في علوم الكمبيوتر. المجلد 2130. ص 87-94. CiteSeerX 10.1.1.5.323 . doi :10.1007/3-540-44668-0_13. ISBN 978-3-540-42486-4. ISSN 0302-9743. S2CID 52872549.
- ^ Wierstra, Daan; Foerster, Alexander; Peters, Jan; Schmidhuber, Juergen (2005). "حل مشكلات الذاكرة العميقة POMDPs باستخدام تدرجات السياسة المتكررة". المؤتمر الدولي حول الشبكات العصبية الاصطناعية ICANN'07 .
- ^ باير، جوستين؛ ويرسترا، دان؛ توجيليوس، جوليان؛ شميدهوبر، يورجن (2009). "تطوير هياكل خلايا الذاكرة لتعلم التسلسل". المؤتمر الدولي حول الشبكات العصبية الاصطناعية ICANN'09، قبرص .
- ^ Graves, A.; Liwicki, M.; Fernández, S.; Bertolami, R.; Bunke, H.; Schmidhuber, J. (مايو 2009). "نظام اتصالي جديد للتعرف على خط اليد غير المقيد". معاملات معهد مهندسي الكهرباء والإلكترونيات في تحليل الأنماط والذكاء الاصطناعي . 31 (5): 855–868. CiteSeerX 10.1.1.139.4502 . doi :10.1109/tpami.2008.137. ISSN 0162-8828. PMID 19299860. S2CID 14635907.
- ^ مارغنر، فولكر؛ عابد، هيكل إل (يوليو 2009). "مسابقة التعرف على خط اليد باللغة العربية ICDAR 2009". المؤتمر الدولي العاشر لتحليل الوثائق والتعرف عليها ، 2009. ص 1383-1387. doi :10.1109/ICDAR.2009.256. ISBN 978-1-4244-4500-4. S2CID 52851337.
- ^ "تصنيف المرضى الفرعي عبر شبكات LSTM التي تدرك الوقت" (PDF) . msu.edu . تم الاسترجاع في 21 نوفمبر 2018 .
- ^ "تصنيف المرضى الفرعي عبر شبكات LSTM التي تدرك الوقت". Kdd.org . تم الاسترجاع في 24 مايو 2018 .
- ^ "SIGKDD". Kdd.org . تم الاسترجاع في 24 مايو 2018 .
قراءة إضافية
- مونر، ديريك د.؛ ريجيا، جيمس أ. (2010). "خوارزمية تدريب عامة شبيهة بـ LSTM للشبكات العصبية المتكررة من الدرجة الثانية" (PDF) . الشبكات العصبية . 25 (1): 70–83. doi :10.1016/j.neunet.2011.07.003. PMC 3217173. PMID 21803542. امتداد
عالي الأداء لـ LSTM تم تبسيطه إلى نوع عقدة واحدة ويمكنه تدريب بنيات عشوائية
- جيرس، فيليكس أ.؛ شراودولف، نيكول ن.؛ شميدهوبر، يورجن (أغسطس 2002). "تعلم التوقيت الدقيق باستخدام شبكات LSTM المتكررة" (ملف PDF) . مجلة أبحاث التعلم الآلي . 3 : 115-143.
- جيرس، فيليكس (2001). "الذاكرة الطويلة والقصيرة المدى في الشبكات العصبية المتكررة" (PDF) . أطروحة دكتوراه .
- أبيدوجون، أولوسولا أدينيي (2005). استخراج البيانات وكشف الاحتيال والاتصالات المتنقلة: تحليل أنماط المكالمات باستخدام الشبكات العصبية غير الخاضعة للإشراف. أطروحة الماجستير (رسالة). جامعة كيب الغربية. hdl :11394/249. مؤرشف من الأصل (PDF) في 22 مايو 2012.
- الأصل مع فصلين مخصصين لشرح الشبكات العصبية المتكررة، وخاصة LSTM.
روابط خارجية
- الشبكات العصبية المتكررة مع أكثر من 30 ورقة بحثية من تأليف مجموعة يورجن شميدهوبر في IDSIA
- Zhang, Aston; Lipton, Zachary; Li, Mu; Smola, Alexander J. (2024). "10.1. الذاكرة الطويلة والقصيرة المدى (LSTM)". الغوص في التعلم العميق . Cambridge New York Port Melbourne New Delhi Singapore: Cambridge University Press. ISBN 978-1-009-38943-3.
