الانتباه (التعلم الآلي)

في مجال تعلم الآلة ، تُعدّ آلية الانتباه طريقةً لتحديد أهمية كل عنصر في تسلسل ما مقارنةً بالعناصر الأخرى فيه. أما في معالجة اللغة الطبيعية ، فتُعبّر الأهمية بأوزان "مرنة" تُسند إلى كل كلمة في الجملة. وبشكلٍ أعم، تُشفّر آلية الانتباه متجهات تُسمى تضمينات الرموز عبر تسلسل ذي عرض ثابت، يتراوح حجمه بين عشرات وملايين الرموز.
على عكس الأوزان "الصلبة" التي تُحسب خلال مرحلة التدريب العكسي، فإن الأوزان "المرنة" موجودة فقط في مرحلة التدريب الأمامي، وبالتالي تتغير مع كل خطوة من خطوات الإدخال. طبّقت التصاميم السابقة آلية الانتباه في نظام ترجمة لغوية يعتمد على شبكة عصبية متكررة متسلسلة (RNN)، لكن تصميمًا أحدث، وهو تصميم المحوّل ، استغنى عن الشبكة العصبية المتكررة المتسلسلة الأبطأ واعتمد بشكل أكبر على آلية الانتباه المتوازية الأسرع.
استُلهمت آلية الانتباه من مفاهيم الانتباه لدى البشر ، وطُوّرت لمعالجة نقاط ضعف استخدام المعلومات من الطبقات الخفية للشبكات العصبية المتكررة. تُفضّل هذه الشبكات المعلومات الموجودة في الكلمات الأخيرة من الجملة، والتي تُعتبر بالتالي أحدث، مما يُقلّل من أهمية المعلومات السابقة في الجملة ووزنها التنبؤي. يُتيح الانتباه للرمز الوصول المباشر إلى أي جزء من الجملة، بدلاً من الوصول إليه عبر الحالة السابقة فقط.
تاريخ
| الخمسينيات - الستينيات | علم النفس وعلم الأحياء للانتباه. تأثير حفلة الكوكتيل [ 1 ] - التركيز على المحتوى عن طريق تصفية الضوضاء الخلفية. نموذج التصفية للانتباه ، [ 2 ] نموذج التقرير الجزئي ، والتحكم في حركات العين السريعة . [ 3 ] |
| ثمانينيات القرن العشرين | وحدات سيجما باي، [ 4 ] الشبكات العصبية ذات الرتبة الأعلى. |
| التسعينيات | وحدات تحكم سريعة في الوزن وروابط ديناميكية بين الخلايا العصبية، تستبق آليات المفتاح والقيمة في الانتباه. [ 5 ] [ 6 ] [ 7 ] [ 8 ] |
| 1998 | تم إدخال المرشح الثنائي في معالجة الصور. وهو يستخدم مصفوفات التقارب الزوجية لنشر الصلة بين العناصر. [ 9 ] |
| 2005 | يشير مصطلح "غير محلي" إلى ترشيح موسع قائم على التقارب في إزالة التشويش من الصور، باستخدام نواة التشابه الغاوسية كأوزان ثابتة تشبه الانتباه. [ 10 ] |
| 2014 | خوارزمية seq2seq مع الشبكات العصبية المتكررة (RNN) وآلية الانتباه. [ 11 ] تم إدخال آلية الانتباه لتحسين ترجمة RNN من مُشفِّر إلى مُفكِّك، خاصةً للجمل الطويلة. انظر قسم النظرة العامة. قدمت الشبكات العصبية الانتباهية آلية لاختيار الميزات المتعلمة باستخدام التعديل المعرفي من أعلى إلى أسفل، موضحة كيف يمكن لأوزان الانتباه أن تسلط الضوء على المدخلات ذات الصلة. [ 12 ] |
| 2015 | تم توجيه الاهتمام إلى الرؤية في مهام وصف الصور. [ 13 ] [ 14 ] |
| 2016 | تم دمج آلية الانتباه الذاتي في النماذج القائمة على الشبكات العصبية المتكررة لالتقاط التبعيات داخل التسلسل. [ 15 ] [ 16 ] تم استكشاف الانتباه الذاتي في نماذج الانتباه القابلة للتحليل لاستنتاج اللغة الطبيعية [ 17 ] وتضمينات الجمل المنظمة ذاتية الانتباه. [ 18 ] |
| 2017 | لقد قامت بنية Transformer التي تم تقديمها في ورقة البحث Attention is All You Need [ 19 ] بصياغة الانتباه الذاتي ذي الضرب النقطي المقياس بشكل رسمي: شبكات العلاقات [ 20 ] ومحولات المجموعات [ 21 ] طبقت الاهتمام على المجموعات غير المرتبة والاستدلال العلائقي، مما أدى إلى تعميم نماذج التفاعل الزوجي. |
| 2018 | وسّعت الشبكات العصبية غير المحلية [ 22 ] نطاق الانتباه ليشمل رؤية الحاسوب من خلال رصد التبعيات بعيدة المدى في المكان والزمان. وطبّقت شبكات الانتباه البياني [ 23 ] آليات الانتباه على البيانات ذات البنية البيانية. |
| 2019–2020 | قدمت المحولات الفعالة، بما في ذلك Reformer، [ 24 ] و Linformer، [ 25 ] وPerformer، [ 26 ] تقريبات قابلة للتطوير للانتباه للتسلسلات الطويلة. |
| 2019+ | أُعيد تفسير شبكات هوبفيلد على أنها أنظمة انتباه قائمة على الذاكرة الترابطية، [ 27 ] وحققت محولات الرؤية (ViTs) نتائج تنافسية في تصنيف الصور. [ 28 ] تم اعتماد المحولات عبر المجالات العلمية، بما في ذلك AlphaFold لطي البروتين، [ 29 ] وCLIP للتدريب المسبق للرؤية واللغة، [ 30 ] ونماذج التجزئة الكثيفة القائمة على الانتباه مثل CCNet [ 31 ] وDANet. [ 32 ] |
وقد قدم كل من نيو وآخرون [ 33 ] وسويدانر [ 34 ] دراسات استقصائية إضافية حول آلية الانتباه في التعلم العميق.
تمثلت الطفرة الكبرى في آلية الانتباه الذاتي، حيث ينتبه كل عنصر في سلسلة المدخلات إلى جميع العناصر الأخرى، مما يمكّن النموذج من استيعاب التبعيات الشاملة. كانت هذه الفكرة محورية في بنية Transformer ، التي استبدلت التكرار بآليات الانتباه. ونتيجة لذلك، أصبحت Transformers أساسًا لنماذج مثل BERT و T5 و GPT ( المحولات التوليدية المدربة مسبقًا ). [ 19 ]
ملخص
تم إحياء العصر الحديث لانتباه الآلة من خلال دمج آلية الانتباه (الشكل 1، باللون البرتقالي) مع جهاز التشفير وفك التشفير. [ 35 ]
الشكل 1. نموذج التشفير-فك التشفير مع آلية الانتباه. [ 36 ] تشير الأرقام السفلية (100، 300، 500، 9k، 10k) إلى أحجام المتجهات، بينما تشير الأحرف السفلية i و i − 1 إلى الخطوات الزمنية. المناطق الوردية في المصفوفة H والمتجه w تمثل قيمًا صفرية. انظر إلى مفتاح الشكل لمزيد من التفاصيل.
|
يوضح الشكل 2 العملية الداخلية خطوة بخطوة لكتلة الانتباه (A) في الشكل 1.
- يركز هذا المثال على الانتباه لكلمة واحدة هي "that". عمليًا، يُحسب الانتباه لكل كلمة على حدة لتسريع العمليات الحسابية. يكفي تغيير متجه "x" الصغير إلى مصفوفة "X" الكبيرة للحصول على الصيغة المناسبة.
- يمنع مقياس Softmax qW k T / √ 100 التباين العالي في qW k T الذي من شأنه أن يسمح لكلمة واحدة بالسيطرة بشكل مفرط على softmax مما يؤدي إلى التركيز على كلمة واحدة فقط، كما يفعل max الصلب المنفصل.
- ملاحظة : تفترض صيغة softmax الصفية الشائعة أعلاه أن المتجهات عبارة عن صفوف، وهو ما يتعارض مع الصيغة الرياضية القياسية لمتجهات الأعمدة. والأصح أن نأخذ منقول متجه السياق ونستخدم دالة softmax العمودية ، مما ينتج عنه الصيغة الأكثر دقة.
تفسير أوزان الانتباه
في الترجمة بين اللغات، تُعرف عملية المحاذاة بأنها مطابقة الكلمات من الجملة الأصلية مع كلمات الجملة المترجمة. تُظهر الشبكات التي تُجري ترجمة حرفية دون مراعاة ترتيب الكلمات أعلى الدرجات على طول القطر الرئيسي (المهيمن) للمصفوفة. أما هيمنة العناصر غير القطرية فتدل على أن آلية الانتباه أكثر دقة.
لنأخذ مثالاً على ترجمة عبارة "أحبك" إلى الفرنسية. في المرحلة الأولى من فك التشفير، يتركز 94% من الانتباه على الكلمة الإنجليزية الأولى " I" ، لذا يقترح النظام كلمة "je" . في المرحلة الثانية، يتركز 88% من الانتباه على الكلمة الإنجليزية الثالثة " you " ، لذا يقترح النظام كلمة "t'" . في المرحلة الأخيرة، يتركز 95% من الانتباه على الكلمة الإنجليزية الثانية " love" ، لذا يقترح النظام كلمة "aime" .
في مثال "أحبك" ، تتم محاذاة الكلمة الثانية "حب" مع الكلمة الثالثة "أحب" . يؤدي تجميع متجهات الصفوف المرنة معًا للكلمات " je" و "t'" و "aime" إلى مصفوفة محاذاة .
| أنا | حب | أنت | |
|---|---|---|---|
| جي | 0.94 | 0.02 | 0.04 |
| ت' | 0.11 | 0.01 | 0.88 |
| أحب | 0.03 | 0.95 | 0.02 |
أحيانًا، قد يكون التوافق متعددًا. على سبيل المثال، العبارة الإنجليزية look it up تُقابل cherchez-le . لذا، فإن أوزان الانتباه "المرنة" أفضل من أوزان الانتباه "القاسية" (حيث يتم ضبط وزن انتباه واحد على 1، والباقي على 0)، لأننا نرغب في أن يُنشئ النموذج متجه سياق يتكون من مجموع مرجح للمتجهات المخفية، بدلًا من "أفضل متجه"، إذ قد لا يكون هناك متجه مخفي مثالي.
المتغيرات

تستخدم العديد من أنواع الانتباه أوزاناً مرنة، مثل
- مبرمجو الأوزان السريعة، أو متحكمو الأوزان السريعة (1992). [ 5 ] تقوم الشبكة العصبية "البطيئة" بإخراج الأوزان "السريعة" لشبكة عصبية أخرى من خلال الضرب الخارجي . تتعلم الشبكة البطيئة عن طريق انحدار التدرج. وقد أُعيد تسميتها لاحقًا باسم "الانتباه الذاتي الخطي". [ 38 ]
- الانتباه على طريقة بهدانو، [ 11 ] ويشار إليه أيضًا بالانتباه الإضافي ،
- الانتباه على طريقة لونغ، [ 39 ] والذي يُعرف بالانتباه المضاعف ،
- تم اقتراح آليات انتباه مبكرة مشابهة للانتباه الذاتي الحديث باستخدام الشبكات العصبية المتكررة. ومع ذلك، تم تقديم الانتباه الذاتي عالي التوازي في عام 2017 واستُخدم بنجاح في نموذج Transformer.
- الانتباه الموضعي والانتباه الموضعي المُحلل . [ 40 ]
بالنسبة للشبكات العصبية الالتفافية ، يمكن تمييز آليات الانتباه حسب البُعد الذي تعمل عليه، وهي: الانتباه المكاني، [ 41 ] الانتباه القنوي، [ 42 ] أو مزيج منهما. [ 43 ] [ 44 ]
تُعيد هذه المتغيرات تجميع مدخلات جانب المُشفِّر لإعادة توزيع تلك التأثيرات على كل مُخرَج مُستهدف. غالبًا ما تُوفِّر مصفوفة الارتباط من الضرب النقطي معاملات إعادة الترجيح. في الأشكال أدناه، W هي مصفوفة أوزان انتباه السياق، على غرار الصيغة الواردة في قسم النظرة العامة أعلاه.
| 1. حاصل الضرب النقطي بين المُشفِّر والمُفكِّك | 2. جهاز التشفير وفك التشفير QKV | 3. الضرب النقطي للمشفر فقط | 4. QKV للمشفّر فقط | 5. برنامج تعليمي لـ PyTorch |
|---|---|---|---|---|
| ملصق | وصف |
|---|---|
| المتغيرات X، H، S، T | تمثل المتغيرات المكتوبة بأحرف كبيرة الجملة بأكملها، وليس الكلمة الحالية فقط. على سبيل المثال، H هي مصفوفة الحالة المخفية للمشفّر - كلمة واحدة لكل عمود. |
| شارع | S: الحالة المخفية للمفكك؛ T: تضمين الكلمة المستهدفة. في مرحلة التدريب الخاصة بنموذج PyTorch التعليمي، يتناوب T بين مصدرين حسب مستوى التوجيه المُستخدم. قد يكون T هو تضمين كلمة الإخراج من الشبكة، أي embedding(argmax(FC output)). أو، مع التوجيه، قد يكون T هو تضمين الكلمة الصحيحة المعروفة، والتي يمكن أن تظهر باحتمالية توجيه ثابتة، ولتكن 1/2. |
| X، H | H، حالة التشفير المخفية؛ X، تضمينات الكلمات المدخلة. |
| دبليو | معاملات الانتباه |
| Qw، Kw، Vw، FC | مصفوفات الأوزان للاستعلام والمفتاح والقيمة على التوالي. FC هي مصفوفة أوزان متصلة بالكامل. |
| ⊕, ⊗ | ⊕، دمج المتجهات؛ ⊗، ضرب المصفوفات. |
| تصحيح | دالة softmax العمودية (مصفوفة جميع تركيبات الضرب النقطي). الضرب النقطي هو xᵢ * xⱼ في المتغير رقم 3، و hᵢ * sⱼ في المتغير 1، والعمود i (Kw * H) * العمود j (Qw * S) في المتغير 2، والعمود i (Kw * X) * العمود j (Qw * X) في المتغير 4. يستخدم المتغير 5 طبقة متصلة بالكامل لتحديد المعاملات. إذا كان المتغير QKV، فسيتم تطبيع الضرب النقطي بقسمته على √d ، حيث d هو ارتفاع مصفوفات QKV. |
التحسينات
انتباه سريع
يتناسب حجم مصفوفة الانتباه طرديًا مع مربع عدد رموز الإدخال. لذا، عندما يكون الإدخال طويلًا، يتطلب حساب مصفوفة الانتباه ذاكرة كبيرة لوحدة معالجة الرسومات (GPU) . يُعدّ "الانتباه السريع" تطبيقًا يقلل من احتياجات الذاكرة ويزيد الكفاءة دون المساس بالدقة. ويتحقق ذلك من خلال تقسيم حساب الانتباه إلى كتل أصغر تتناسب مع ذاكرة وحدة معالجة الرسومات الأسرع، مما يقلل الحاجة إلى تخزين مصفوفات وسيطة كبيرة، وبالتالي يخفض استخدام الذاكرة مع زيادة الكفاءة الحسابية. [ 49 ]
فليكس أتينشن
FlexAttention [ 50 ] عبارة عن نواة انتباه طورتها شركة Meta تسمح للمستخدمين بتعديل درجات الانتباه قبل softmax وتختار ديناميكيًا خوارزمية الانتباه المثلى.
التطبيقات
يُستخدم الانتباه على نطاق واسع في معالجة اللغات الطبيعية، ورؤية الحاسوب، والتعرف على الكلام. في معالجة اللغات الطبيعية، يُحسّن الانتباه فهم السياق في مهام مثل الإجابة على الأسئلة وتلخيص النصوص. أما في مجال رؤية الحاسوب، فيساعد الانتباه البصري النماذج على التركيز على مناطق الصورة ذات الصلة، مما يُحسّن اكتشاف الكائنات ووصف الصور.
خرائط الانتباه كشرح لمُحَوِّلات الرؤية
منذ الورقة البحثية الأصلية حول محولات الرؤية (ViT)، أصبح تصوير درجات الانتباه على شكل خريطة حرارية (تُسمى خرائط البروز أو خرائط الانتباه) طريقةً مهمةً وروتينيةً لفحص عملية اتخاذ القرار في نماذج ViT. [ 51 ] يمكن حساب خرائط الانتباه بالنسبة لأي رأس انتباه في أي طبقة، بينما تميل الطبقات الأعمق إلى إظهار تصور أكثر دلالةً من الناحية الدلالية. يُعدّ نشر الانتباه خوارزميةً تكراريةً لدمج درجات الانتباه عبر جميع الطبقات، وذلك بحساب حاصل الضرب النقطي لخرائط الانتباه المتتالية. [ 52 ]
نظرًا لأن محولات الرؤية تُدرَّب عادةً بطريقة ذاتية الإشراف ، فإن خرائط الانتباه لا تكون حساسة للفئات بشكل عام. عند ربط رأس تصنيف بالعمود الفقري لمحولات الرؤية، تجمع خرائط الانتباه التمييزية للفئات (CDAM) بين خرائط الانتباه والتدرجات بالنسبة [CLS]لرمز الفئة. [ 53 ] يمكن أيضًا تطبيق بعض أساليب التفسير الحساسة للفئات، التي طُوِّرت في الأصل للشبكات العصبية الالتفافية، على محولات الرؤية، مثل GradCAM، التي تنشر التدرجات عكسيًا إلى مخرجات طبقة الانتباه النهائية. [ 54 ]
إن استخدام الانتباه كأساس لتفسير التحولات في اللغة والرؤية ليس بالأمر الخالي من الجدل. فبينما حللت بعض الدراسات الرائدة درجات الانتباه وقدمتها كتفسيرات، [ 55 ] [ 56 ] إلا أن ارتفاع درجات الانتباه لا يرتبط دائمًا بتأثير أكبر على أداء النموذج. [ 57 ]
التمثيل الرياضي
الانتباه القياسي لضرب النقاط
بالنسبة للمصفوفات:و، ويُعرَّف حاصل الضرب النقطي المُقاس، أو انتباه QKV، على النحو التالي: أينيشير الرمز إلى عملية النقل ، ويتم تطبيق دالة softmax بشكل مستقل على كل صف من صفوف المصفوفة.يتضمنالاستعلامات، بينما المصفوفاتتحتوي مجتمعة على مجموعة غير مرتبة منأزواج المفتاح والقيمة. متجهات القيم في مصفوفةيتم ترجيحها باستخدام الأوزان الناتجة عن عملية softmax، بحيث تكون صفوف-بواسطة-تقتصر مصفوفة الإخراج على الغلاف المحدب للنقاط فيمُعطاة بواسطة صفوف.
لفهم خصائص ثبات التبديل وتكافؤ التبديل لانتباه QKV، [ 58 ] لنفترضولتكن مصفوفات التبديل ؛ ومصفوفة عشوائية. دالة softmax متغيرة بالتبديل بمعنى أن: وبملاحظة أن منقولة مصفوفة التبديل هي أيضاً معكوسها، فإنه يترتب على ذلك ما يلي: مما يدل على أن آلية الانتباه QKV متغيرة بالنسبة لإعادة ترتيب الاستعلامات (صفوف من)؛ وثابتة عند إعادة ترتيب أزواج المفتاح والقيمة فيتُورَث هذه الخصائص عند تطبيق التحويلات الخطية على مدخلات ومخرجات وحدات الانتباه QKV. على سبيل المثال، دالة انتباه ذاتي بسيطة مُعرَّفة على النحو التالي: هل يكون التبديل متكافئًا بالنسبة لإعادة ترتيب صفوف مصفوفة الإدخال؟بطريقة غير بديهية، لأن كل صف من المخرجات هو دالة لجميع صفوف المدخلات. تنطبق خصائص مماثلة على آلية الانتباه متعددة الرؤوس ، والتي سيتم تعريفها أدناه.
انتباه مقنع
عند استخدام آلية الانتباه QKV كعنصر أساسي لفك التشفير التراجعي الذاتي، وعندما تكون جميع مصفوفات الإدخال والإخراج في وقت التدريبفي الصفوف، يتم استخدام نوع من أنواع الانتباه المقنع: أين القناع،هي مصفوفة مثلثية علوية تمامًا ، مع وجود أصفار على القطر الرئيسي وأسفله.في كل عنصر أعلى القطر. ناتج دالة softmax، فيتكون المصفوفة حينها مثلثية سفلية ، مع وجود أصفار في جميع العناصر فوق القطر الرئيسي. ويضمن الحجب أن يكون ذلك صحيحًا لجميع العناصر.، صفإن مخرجات الانتباه مستقلة عن الصفمن أي من مصفوفات الإدخال الثلاث. لا تنطبق خصائص ثبات التبديل وتكافؤ التغاير لآلية الانتباه QKV القياسية على المتغير المقنّع.
انتباه متعدد الرؤوس

انتباه متعدد الرؤوس حيث يتم حساب كل رأس باستخدام آلية الانتباه QKV على النحو التالي: و، وهي مصفوفات المعاملات.
تنطبق خصائص التبديل الخاصة بآلية الانتباه QKV (القياسية، غير المقنعة) هنا أيضًا. بالنسبة لمصفوفات التبديل،: ومن ذلك نرى أيضاً أن الانتباه الذاتي متعدد الرؤوس: وهي متغيرة بالنسبة لإعادة ترتيب صفوف مصفوفة الإدخال.
بهداناو (الاهتمام الإضافي)
أينوهي مصفوفات أوزان قابلة للتعلم. [ 11 ]
انتباه لونغ (عام)
أينهي مصفوفة أوزان قابلة للتعلم. [ 39 ]
الاهتمام الذاتي
يُعدّ الانتباه الذاتي مماثلاً للانتباه المتبادل، باستثناء أن متجهات الاستعلام والمفتاح والقيمة جميعها تأتي من النموذج نفسه. يمكن لكل من المُشفِّر والمُفكِّك استخدام الانتباه الذاتي، ولكن مع وجود اختلافات طفيفة.
بالنسبة لآلية الانتباه الذاتي في المشفر، يمكننا البدء بمشفر بسيط بدون آلية انتباه ذاتي، مثل "طبقة التضمين"، التي تقوم ببساطة بتحويل كل كلمة مُدخلة إلى متجه باستخدام جدول بحث ثابت . وهذا يُعطي سلسلة من المتجهات المخفية.ويمكن بعد ذلك تطبيق هذه النتائج على آلية الانتباه القائمة على الضرب النقطي، للحصول علىأو باختصار أكثر،يمكن تطبيق ذلك بشكل متكرر للحصول على مُشفِّر متعدد الطبقات. يُعرف هذا بـ "الانتباه الذاتي للمُشفِّر"، ويُسمى أحيانًا "الانتباه الشامل"، حيث يمكن للمتجه في كل موضع أن ينتبه إلى كل متجه آخر.
التغطية

بالنسبة لآلية الانتباه الذاتي للمفكك، فإن الانتباه الشامل غير مناسب، لأنه خلال عملية فك التشفير التراجعي الذاتي، لا يستطيع المفكك الانتباه إلى المخرجات المستقبلية التي لم يتم فك تشفيرها بعد. ويمكن حل هذه المشكلة عن طريق فرض أوزان الانتباه.للجميعوتسمى هذه الآلية "الإخفاء السببي". وتسمى آلية الانتباه هذه "الانتباه الذاتي المقنع سببيًا".
انظر أيضاً
مراجع
- ↑ تشيري، إي. كولين (1953). "بعض التجارب على تمييز الكلام، بأذن واحدة وبأذنين". مجلة الجمعية الصوتية الأمريكية . 25 (5): 975-979 . Bibcode : 1953ASAJ...25..975C . doi : 10.1121/1.1907229 . hdl : 11858/00-001M-0000-002A-F750-3 .
- ↑ برودبنت، دونالد إي. (1958). الإدراك والتواصل . دار بيرغامون للنشر.
- ↑ كولر، إيلين (1995). "التحكم في حركات العين السريعة". مراجعات أبحاث حركة العين . 5 : 1-70 .
- ↑ روميلهارت، ديفيد إي.؛ هينتون، جي إي؛ ماكليلاند، جيمس إل. (29 يوليو 1987). "إطار عام للمعالجة الموزعة المتوازية" (ملف PDF) . في: روميلهارت، ديفيد إي.؛ هينتون، جي إي؛ مجموعة أبحاث المعالجة الموزعة المتوازية (محررون). المعالجة الموزعة المتوازية، المجلد 1: استكشافات في البنية الدقيقة للإدراك: الأسس . كامبريدج، ماساتشوستس: مطبعة معهد ماساتشوستس للتكنولوجيا. ISBN 978-0-262-68053-0.
- 1 2 شميدهوبر، يورغن (1992). "تعلم التحكم في الذاكرة ذات الوزن السريع: بديل للشبكات المتكررة". الحوسبة العصبية . 4 (1): 131-139 . doi : 10.1162/neco.1992.4.1.131 . S2CID 16683347 .
- ↑ فون دير مالسبورغ، كريستوف (1981). "نظرية الارتباط لوظائف الدماغ". تقرير داخلي 81-2، معهد ماكس بلانك للكيمياء الفيزيائية الحيوية .
- ↑ فيلدمان، جيروم أ. (1982). "الروابط الديناميكية في الشبكات العصبية". علم التحكم الآلي البيولوجي . 46 (1): 27-39 . doi : 10.1007/BF00335349 . PMID 6307398 .
- ↑ هينتون، جيفري إي. (1989). "إجراءات التعلم الترابطي". الذكاء الاصطناعي . 40 ( 1-3 ): 185-234 . doi : 10.1016/0004-3702(89)90049-0 .
- ↑ توماسي، كارلو (1998). الترشيح الثنائي للصور الرمادية والملونة . المؤتمر الدولي لرؤية الحاسوب (ICCV).
- ^ بوديس ، أنتوني (2005). خوارزمية غير محلية لتقليل ضوضاء الصورة . CVPR.
- 1 2 3 باهدانو، ديمتري؛ تشو، كيونغ هيون؛ بينجيو، يوشوا (2014). "الترجمة الآلية العصبية من خلال التعلم المشترك للمحاذاة والترجمة". arXiv : 1409.0473 [ cs.CL ].
- ↑ وانغ، تشيان (2014). الشبكة العصبية الانتباهية: اختيار الميزات باستخدام التغذية الراجعة المعرفية . NeurIPS.
- ↑ شو، كيلفن؛ با، جيمي؛ كيروس، رايان (2015). العرض، الانتباه، والشرح: توليد تعليقات الصور العصبية باستخدام الانتباه البصري . arXiv : 1502.03044 .
- ↑ فينيالز، أوريول؛ توشيف، ألكسندر؛ بينجيو، سامي؛ إرهان، دوميترو (2015). "Show and Tell: A Neural Image Caption Generator". مؤتمر IEEE لعام 2015 حول رؤية الحاسوب والتعرف على الأنماط (CVPR) . الصفحات 3156-3164 . doi : 10.1109/CVPR.2015.7298935 . ISBN 978-1-4673-6964-0.
- ↑ تشنغ، جيانبنغ (2016). "شبكات الذاكرة طويلة المدى للقراءة الآلية". arXiv : 1601.06733 [ cs.CL ].
- ↑ باولوس، رومان (2017). "نموذج معزز عميق للتلخيص التجريدي". arXiv : 1705.04304 [ cs.CL ].
- ↑ باريك، أنيس (2016). نموذج الانتباه القابل للتحليل لاستنتاج اللغة الطبيعية . EMNLP. arXiv : 1606.01933 .
- ↑ لين، زيتشاو (2017). تضمين الجملة ذات الانتباه الذاتي المنظم . ICLR. arXiv : 1703.03130 .
- 1 2 فاسواني، أشيش؛ شازير، نعوم؛ بارمار، نيكي؛ أوسزكوريت، جاكوب؛ جونز، ليون؛ جوميز، ايدان N.؛ كايزر، لوكاس؛ بولوسوخين، إيليا (2017). "الاهتمام هو كل ما تحتاجه". أرخايف : 1706.03762 [ cs.CL ].
- ↑ سانتورو، آدم (2017). شبكات العلاقات للاستدلال العلائقي . ICLR. arXiv : 1706.01427 .
- ↑ لي، جوهو (2019). محول المجموعة: إطار عمل للشبكات العصبية الثابتة التبديل القائمة على الانتباه . ICML. arXiv : 1810.00825 .
- ↑ وانغ، شياولونغ (2018). الشبكات العصبية غير المحلية . مؤتمر رؤية الحاسوب وأنماط التعرف.
- ^ فيليكوفيتش ، بيتار (2018). شبكات الاهتمام الرسم البياني . ICLR.
- ↑ كيتايف، نيكيتا (2020). المُصلِح: المُحوِّل الفعال . ICLR. arXiv : 2001.04451 .
- ↑ وانغ، صلاح (2020). لينفورمر: الانتباه الذاتي ذو التعقيد الخطي . ICLR. arXiv : 2006.04768 .
- ↑ تشورومانسكي، كريستوف (2020). إعادة التفكير في الانتباه مع المؤدين . ICLR. arXiv : 2009.14794 .
- ↑ رامساور، يوهانس (2021). شبكات هوبفيلد هي كل ما تحتاجه . NeurIPS. arXiv : 2008.02217 .
- ↑ دوسوفيتسكي، ألكسندر (2021). صورة تساوي 16×16 كلمة: محولات للتعرف على الصور على نطاق واسع . ICLR. arXiv : 2010.11929 .
- ↑ جامبر، جون (2021). "تنبؤ دقيق للغاية ببنية البروتين باستخدام AlphaFold" . Nature . 596 (7873): 583–589 . Bibcode : 2021Natur.596..583J . doi : 10.1038/ s41586-021-03819-2 . PMC 8371605. PMID 34265844 .
- ↑ رادفورد، أليك (2021). تعلم النماذج البصرية القابلة للنقل من خلال الإشراف على اللغة الطبيعية . المؤتمر الدولي للتعلم الآلي (ICML).
- ↑ هوانغ، شيانغيو (2019). CCNet: الانتباه المتقاطع للتجزئة الدلالية . ICCV. arXiv : 1811.11721 .
- ↑ فو، جينغ (2019). شبكة الانتباه المزدوج لتقسيم المشهد . CVPR. arXiv : 1809.02983 .
- ↑ نيو، تشاويانغ؛ تشونغ، غوتشيانغ؛ يو، هوي (10 سبتمبر 2021). "مراجعة لآلية الانتباه في التعلم العميق" . الحوسبة العصبية . 452 : 48-62 . doi : 10.1016/j.neucom.2021.03.091 . ISSN 0925-2312 .
- ↑ سويدانر، ديريا (أغسطس 2022). "آلية الانتباه في الشبكات العصبية: من أين تأتي وإلى أين تذهب" . الحوسبة العصبية وتطبيقاتها . 34 (16): 13371-13385 . arXiv : 2204.13154 . doi : 10.1007/s00521-022-07366-3 . ISSN 0941-0643 .
- ↑ باهدانو، ديمتري؛ تشو، كيونغ هيون؛ بينجيو، يوشوا (2014). "الترجمة الآلية العصبية من خلال التعلم المشترك للمحاذاة والترجمة". arXiv : 1409.0473 [ cs.CL ].
- ↑ بريتز، ديني؛ غولدي، آنا؛ لونغ، مينه-ثانه؛ لي، كوك (2017-03-21). "استكشاف واسع النطاق لبنى الترجمة الآلية العصبية". arXiv : 1703.03906 [ cs.CV ].
- ↑ "برنامج تعليمي حول seq2seq من Pytorch.org" . تم الاطلاع عليه في 2 ديسمبر 2021 .
- ^ شلاغ، إيمانول ؛ إيري، كازوكي؛ شميدهوبر، يورغن (2021). “المحولات الخطية هي مبرمجين سريعين للوزن بشكل سري”. آي سي إم إل 2021 . سبرينغر. ص 9355 – 9366.
- 1 2 3 لونغ، مينه-ثانغ (2015-09-20). "مناهج فعالة للترجمة الآلية العصبية القائمة على الانتباه". arXiv : 1508.04025v5 [ cs.CL ].
- ↑ لو، فان؛ تشانغ، جوان؛ شو، شنغوي (3 يوليو 2024). "تعلم الانتباه الموضعي للتوصية المتسلسلة" . catalyzex.com .
- ↑ تشو، شيتشو؛ تشنغ، داتشي؛ تشانغ، تشنغ؛ لين، ستيفن؛ داي، جيفنغ (2019). "دراسة تجريبية لآليات الانتباه المكاني في الشبكات العميقة". المؤتمر الدولي IEEE/CVF لرؤية الحاسوب (ICCV) لعام 2019. الصفحات 6687-6696 . arXiv : 1904.05873 . doi : 10.1109/ICCV.2019.00679 . ISBN 978-1-7281-4803-8. S2CID 118673006 .
- ↑ هو، جي؛ شين، لي؛ صن، غانغ (2018). "شبكات الضغط والإثارة". مؤتمر IEEE/CVF لعام 2018 حول رؤية الحاسوب والتعرف على الأنماط . الصفحات 7132-7141 . arXiv : 1709.01507 . doi : 10.1109/CVPR.2018.00745 . ISBN 978-1-5386-6420-9. S2CID 206597034 .
- ^ وو، سانغيون؛ بارك، جونغتشان؛ لي جون يونج؛ كوون ، إن سو (2018/07/18). “CBAM: وحدة الانتباه للكتلة التلافيفية”. أرخايف : 1807.06521 [ cs.CV ].
- ^ جورجيسكو، ماريانا-يوليانا؛ إيونيسكو، رادو تيودور؛ ميرون، أندريا-يوليانا؛ سافينكو، أوليفيان؛ ريستيا، نيكولاي كاتالين؛ فيرغا، نيكولاي؛ خان، فهد شهباز (2022-10-12). “انتباه تلافيفي متعدد الوسائط متعدد الرؤوس بأحجام مختلفة للنواة للحصول على دقة فائقة للصورة الطبية”. أرخايف : 2204.04218 [ eess.IV ].
- ↑ نيل رودس (2021). CS 152 NN—27: الانتباه: المفاتيح والاستعلامات والقيم . حدث في الساعة 06:30 . تم الاطلاع عليه بتاريخ 22 ديسمبر 2021 .
- ↑ ألفريدو كانزياني ويان ليكان (2021). دورة التعلم العميق بجامعة نيويورك، ربيع 2020. يبدأ الحدث الساعة 5:30 صباحًا . تاريخ الاسترجاع: 22 ديسمبر 2021 .
- ↑ ألفريدو كانزياني ويان ليكان (2021). دورة التعلم العميق بجامعة نيويورك، ربيع 2020. يبدأ الحدث في الساعة 20:15 . تاريخ الاسترجاع: 22 ديسمبر 2021 .
- ↑ روبرتسون، شون. "معالجة اللغة الطبيعية من الصفر: الترجمة باستخدام شبكة تسلسل إلى تسلسل وآلية الانتباه" . pytorch.org . تم الاطلاع عليه بتاريخ 22-12-2021 .
- ↑ ميتال، أيوش (17 يوليو 2024). "الانتباه الخاطف: إحداث ثورة في كفاءة المحولات" . Unite.AI . تم الاطلاع عليه بتاريخ 16 نوفمبر 2024 .
- ↑ "FlexAttention: مرونة PyTorch مع أداء FlashAttention – PyTorch" .
- ^ دوسوفيتسكي ، أليكسي. باير، لوكاس. كوليسنيكوف، الكسندر؛ ويسينبورن، ديرك. تشاي، شياو هوا؛ أونترثينر، توماس؛ دهقاني، مصطفى؛ مينديرر، ماتياس؛ هيجولد، جورج (2021-06-03)، الصورة تستحق 16 × 16 كلمة: محولات للتعرف على الصور على نطاق واسع ، أرخايف : 2010.11929
- ↑ أبنار، سميرة؛ زويديما، ويليم (2020-05-31)، قياس تدفق الانتباه في المحولات ، arXiv : 2005.00928
- ↑ بروكي، لينارت؛ بيندا، جاكوب؛ تشونغ، نيو كريستوفر (2024-10-25)، خرائط الانتباه التمييزية للفئات لمُحوِّلات الرؤية ، arXiv : 2312.02364
- ^ جيلدنبلات ، جاكوب (21 يوليو 2025)، جاكوبجيل / pytorch-grad-cam ، استرجاعها 2025/07/21
- ↑ مولينباخ، جيمس؛ ويغريف، سارة؛ ديوك، جون؛ صن، جيمينغ؛ أيزنشتاين، جاكوب (2018-04-16)، التنبؤ القابل للتفسير بالرموز الطبية من النصوص السريرية ، arXiv : 1802.05695
- ↑ باهدانو، ديمتري؛ تشو، كيونغ هيون؛ بينجيو، يوشوا (19-05-2016)، الترجمة الآلية العصبية من خلال التعلم المشترك للمحاذاة والترجمة ، arXiv : 1409.0473
- ↑ سيرانو، صوفيا؛ سميث، نوح أ . (2019-06-09)، هل يمكن تفسير الانتباه؟، arXiv : 1906.03731
- ↑ لي، جوهو؛ لي، يون هو؛ كيم، جونغ تايك؛ كوسوريك، آدم ر؛ تشوي، سيونغ جين؛ تيه، يي واي (2018). "محول المجموعة: إطار عمل للشبكات العصبية الثابتة التبديل القائمة على الانتباه". arXiv : 1810.00825 [ cs.LG ].
روابط خارجية
- أولاه، كريس؛ كارتر، شان (8 سبتمبر 2016). "الانتباه والشبكات العصبية المتكررة المعززة" . ديستيل . 1 (9). فريق عمل ديستيل. doi : 10.23915/distill.00001 .
- دان جورافسكي وجيمس إتش. مارتن (2022). معالجة الكلام واللغة (الطبعة الثالثة، مسودة يناير 2022) - الفصل 10.4 (الانتباه) والفصل 9.7 (شبكات الانتباه الذاتي: المحولات)
- أليكس غريفز (2020). الانتباه والذاكرة في التعلم العميق - محاضرة فيديو من ديب مايند / جامعة لندن
- التعلم الآلي





