الانتباه (التعلم الآلي)

آلية الانتباه، نظرة عامة

في مجال تعلم الآلة ، تُعدّ آلية الانتباه طريقةً لتحديد أهمية كل عنصر في تسلسل ما مقارنةً بالعناصر الأخرى فيه. أما في معالجة اللغة الطبيعية ، فتُعبّر الأهمية بأوزان "مرنة" تُسند إلى كل كلمة في الجملة. وبشكلٍ أعم، تُشفّر آلية الانتباه متجهات تُسمى تضمينات الرموز عبر تسلسل ذي عرض ثابت، يتراوح حجمه بين عشرات وملايين الرموز.

على عكس الأوزان "الصلبة" التي تُحسب خلال مرحلة التدريب العكسي، فإن الأوزان "المرنة" موجودة فقط في مرحلة التدريب الأمامي، وبالتالي تتغير مع كل خطوة من خطوات الإدخال. طبّقت التصاميم السابقة آلية الانتباه في نظام ترجمة لغوية يعتمد على شبكة عصبية متكررة متسلسلة (RNN)، لكن تصميمًا أحدث، وهو تصميم المحوّل ، استغنى عن الشبكة العصبية المتكررة المتسلسلة الأبطأ واعتمد بشكل أكبر على آلية الانتباه المتوازية الأسرع.

استُلهمت آلية الانتباه من مفاهيم الانتباه لدى البشر ، وطُوّرت لمعالجة نقاط ضعف استخدام المعلومات من الطبقات الخفية للشبكات العصبية المتكررة. تُفضّل هذه الشبكات المعلومات الموجودة في الكلمات الأخيرة من الجملة، والتي تُعتبر بالتالي أحدث، مما يُقلّل من أهمية المعلومات السابقة في الجملة ووزنها التنبؤي. يُتيح الانتباه للرمز الوصول المباشر إلى أي جزء من الجملة، بدلاً من الوصول إليه عبر الحالة السابقة فقط.

تاريخ

الخمسينيات - الستينياتعلم النفس وعلم الأحياء للانتباه. تأثير حفلة الكوكتيل [ 1 ] - التركيز على المحتوى عن طريق تصفية الضوضاء الخلفية. نموذج التصفية للانتباه ، [ 2 ] نموذج التقرير الجزئي ، والتحكم في حركات العين السريعة . [ 3 ]
ثمانينيات القرن العشرينوحدات سيجما باي، [ 4 ] الشبكات العصبية ذات الرتبة الأعلى.
التسعينياتوحدات تحكم سريعة في الوزن وروابط ديناميكية بين الخلايا العصبية، تستبق آليات المفتاح والقيمة في الانتباه. [ 5 ] [ 6 ] [ 7 ] [ 8 ]
1998تم إدخال المرشح الثنائي في معالجة الصور. وهو يستخدم مصفوفات التقارب الزوجية لنشر الصلة بين العناصر. [ 9 ]
2005يشير مصطلح "غير محلي" إلى ترشيح موسع قائم على التقارب في إزالة التشويش من الصور، باستخدام نواة التشابه الغاوسية كأوزان ثابتة تشبه الانتباه. [ 10 ]
2014خوارزمية seq2seq مع الشبكات العصبية المتكررة (RNN) وآلية الانتباه. [ 11 ] تم إدخال آلية الانتباه لتحسين ترجمة RNN من مُشفِّر إلى مُفكِّك، خاصةً للجمل الطويلة. انظر قسم النظرة العامة.

قدمت الشبكات العصبية الانتباهية آلية لاختيار الميزات المتعلمة باستخدام التعديل المعرفي من أعلى إلى أسفل، موضحة كيف يمكن لأوزان الانتباه أن تسلط الضوء على المدخلات ذات الصلة. [ 12 ]

2015تم توجيه الاهتمام إلى الرؤية في مهام وصف الصور. [ 13 ] [ 14 ]
2016تم دمج آلية الانتباه الذاتي في النماذج القائمة على الشبكات العصبية المتكررة لالتقاط التبعيات داخل التسلسل. [ 15 ] [ 16 ]

تم استكشاف الانتباه الذاتي في نماذج الانتباه القابلة للتحليل لاستنتاج اللغة الطبيعية [ 17 ] وتضمينات الجمل المنظمة ذاتية الانتباه. [ 18 ]

2017لقد قامت بنية Transformer التي تم تقديمها في ورقة البحث Attention is All You Need [ 19 ] بصياغة الانتباه الذاتي ذي الضرب النقطي المقياس بشكل رسمي:
أ=سوفتماكس(سؤالكتيدك)V{\displaystyle A={\text{softmax}}\left({\frac {QK^{T}}{\sqrt {d_{k}}}}\right)V}

شبكات العلاقات [ 20 ] ومحولات المجموعات [ 21 ] طبقت الاهتمام على المجموعات غير المرتبة والاستدلال العلائقي، مما أدى إلى تعميم نماذج التفاعل الزوجي.

2018وسّعت الشبكات العصبية غير المحلية [ 22 ] نطاق الانتباه ليشمل رؤية الحاسوب من خلال رصد التبعيات بعيدة المدى في المكان والزمان. وطبّقت شبكات الانتباه البياني [ 23 ] آليات الانتباه على البيانات ذات البنية البيانية.
2019–2020قدمت المحولات الفعالة، بما في ذلك Reformer، [ 24 ] و Linformer، [ 25 ] وPerformer، [ 26 ] تقريبات قابلة للتطوير للانتباه للتسلسلات الطويلة.
2019+أُعيد تفسير شبكات هوبفيلد على أنها أنظمة انتباه قائمة على الذاكرة الترابطية، [ 27 ] وحققت محولات الرؤية (ViTs) نتائج تنافسية في تصنيف الصور. [ 28 ]

تم اعتماد المحولات عبر المجالات العلمية، بما في ذلك AlphaFold لطي البروتين، [ 29 ] وCLIP للتدريب المسبق للرؤية واللغة، [ 30 ] ونماذج التجزئة الكثيفة القائمة على الانتباه مثل CCNet [ 31 ] وDANet. [ 32 ]

وقد قدم كل من نيو وآخرون [ 33 ] وسويدانر [ 34 ] دراسات استقصائية إضافية حول آلية الانتباه في التعلم العميق.

تمثلت الطفرة الكبرى في آلية الانتباه الذاتي، حيث ينتبه كل عنصر في سلسلة المدخلات إلى جميع العناصر الأخرى، مما يمكّن النموذج من استيعاب التبعيات الشاملة. كانت هذه الفكرة محورية في بنية Transformer ، التي استبدلت التكرار بآليات الانتباه. ونتيجة لذلك، أصبحت Transformers أساسًا لنماذج مثل BERT و T5 و GPT ( المحولات التوليدية المدربة مسبقًا ). [ 19 ]

ملخص

تم إحياء العصر الحديث لانتباه الآلة من خلال دمج آلية الانتباه (الشكل 1، باللون البرتقالي) مع جهاز التشفير وفك التشفير. [ 35 ]

تسلسل متحرك لترجمة اللغة
الشكل 1. نموذج التشفير-فك التشفير مع آلية الانتباه. تشير الأرقام السفلية (100، 300، 500، 9k، 10k) إلى أحجام المتجهات، بينما تشير الأحرف السفلية i و i − 1 إلى الخطوات الزمنية. تمثل المناطق الوردية في المصفوفة H والمتجه w قيمًا صفرية. انظر إلى مفتاح الشكل لمزيد من التفاصيل.
الشكل 1. نموذج التشفير-فك التشفير مع آلية الانتباه. [ 36 ] تشير الأرقام السفلية (100، 300، 500، 9k، 10k) إلى أحجام المتجهات، بينما تشير الأحرف السفلية i و i − 1 إلى الخطوات الزمنية. المناطق الوردية في المصفوفة H والمتجه w تمثل قيمًا صفرية. انظر إلى مفتاح الشكل لمزيد من التفاصيل.
أسطورة
ملصقوصف
100الحد الأقصى لطول الجملة
300حجم التضمين (أبعاد الكلمة)
500طول المتجه المخفي
9 آلاف، 10 آلافحجم قاموس لغات الإدخال والإخراج على التوالي.
س ، صمتجهات قاموس أحادية الترميز بحجم 9k و10k . يتم تنفيذ x → x باستخدام جدول بحث بدلاً من ضرب المتجهات. Y هو مُعَظِّم أحادي الترميز لطبقة فك التشفير الخطية D؛ أي أنه يأخذ قيمة argmax لمخرج الطبقة الخطية D.
xمتجه تضمين الكلمات بطول 300 حرف. عادةً ما يتم حساب المتجهات مسبقًا من مشاريع أخرى مثل GloVe أو Word2Vec .
حمتجه مخفي في المشفر بطول 500 كلمة. في كل لحظة زمنية، يلخص هذا المتجه جميع الكلمات السابقة له. يمكن اعتبار الحرف الأخير (h) متجه "جملة"، أو متجه فكرة كما يسميه هينتون.
sمتجه الحالة المخفية لفك التشفير بطول 500.
هـمُشفِّر شبكة عصبية متكررة مكون من 500 عصبون . 500 مخرج. عدد المدخلات 800 - 300 من تضمين المصدر + 500 من الاتصالات المتكررة. يُغذي المُشفِّر وحدة فك التشفير مباشرةً فقط لتهيئتها، وليس بعد ذلك؛ لذا، يظهر هذا الاتصال المباشر بشكل خافت جدًا.
دمُفكِّك شفرة ثنائي الطبقات. تحتوي الطبقة المتكررة على 500 عصبون، بينما تحتوي الطبقة الخطية كاملة الاتصال على 10 آلاف عصبون (حجم المفردات المستهدفة). [ 37 ] تحتوي الطبقة الخطية وحدها على 5 ملايين وزن (500 × 10 آلاف) - أي ما يقارب عشرة أضعاف عدد الأوزان الموجودة في الطبقة المتكررة.
نتيجةنتيجة محاذاة طويلة من 100
wوزن الانتباه المتجهي بطول 100. هذه أوزان "مرنة" تتغير أثناء المرور الأمامي، على عكس الأوزان العصبية "الصلبة" التي تتغير أثناء مرحلة التعلم.
أوحدة الانتباه – يمكن أن تكون هذه الوحدة ناتج ضرب نقطي لحالات متكررة، أو طبقات الاستعلام-المفتاح-القيمة المتصلة بالكامل. يكون الناتج عبارة عن متجه طوله 100 عنصر w.
ح500×100. 100 متجه مخفي h مدمجة في مصفوفة
جمتجه السياق بطول 500 = H * w. c عبارة عن تركيبة خطية من متجهات h موزونة بواسطة w.

يوضح الشكل 2 العملية الداخلية خطوة بخطوة لكتلة الانتباه (A) في الشكل 1.

الشكل 2. يوضح الرسم التخطيطي عملية الانتباه الأمامي لحساب ارتباطات كلمة "that" مع الكلمات الأخرى في جملة "See that girl run". وباستخدام الأوزان الصحيحة من التدريب، ينبغي أن تتمكن الشبكة من تحديد كلمة "girl" ككلمة ذات ارتباط قوي. ملاحظات هامة:
  • يركز هذا المثال على الانتباه لكلمة واحدة هي "that". عمليًا، يُحسب الانتباه لكل كلمة على حدة لتسريع العمليات الحسابية. يكفي تغيير متجه "x" الصغير إلى مصفوفة "X" الكبيرة للحصول على الصيغة المناسبة.
  • يمنع مقياس Softmax qW k T / 100 التباين العالي في qW k T الذي من شأنه أن يسمح لكلمة واحدة بالسيطرة بشكل مفرط على softmax مما يؤدي إلى التركيز على كلمة واحدة فقط، كما يفعل max الصلب المنفصل.
  • ملاحظة : تفترض صيغة softmax الصفية الشائعة أعلاه أن المتجهات عبارة عن صفوف، وهو ما يتعارض مع الصيغة الرياضية القياسية لمتجهات الأعمدة. والأصح أن نأخذ منقول متجه السياق ونستخدم دالة softmax العمودية ، مما ينتج عنه الصيغة الأكثر دقة.
(Xدبليوv)تي*[(دبليوكXتي)*(x_دبليوq)تي]sم{\displaystyle {\begin{aligned}(XW_{v})^{T}*{[(W_{k}X^{T})*{({\underline {x}}W_{q})^{T}}]_{sm}}\end{aligned}}}.

تفسير أوزان الانتباه

في الترجمة بين اللغات، تُعرف عملية المحاذاة بأنها مطابقة الكلمات من الجملة الأصلية مع كلمات الجملة المترجمة. تُظهر الشبكات التي تُجري ترجمة حرفية دون مراعاة ترتيب الكلمات أعلى الدرجات على طول القطر الرئيسي (المهيمن) للمصفوفة. أما هيمنة العناصر غير القطرية فتدل على أن آلية الانتباه أكثر دقة.

لنأخذ مثالاً على ترجمة عبارة "أحبك" إلى الفرنسية. في المرحلة الأولى من فك التشفير، يتركز 94% من الانتباه على الكلمة الإنجليزية الأولى " I" ، لذا يقترح النظام كلمة "je" . في المرحلة الثانية، يتركز 88% من الانتباه على الكلمة الإنجليزية الثالثة " you " ، لذا يقترح النظام كلمة "t'" . في المرحلة الأخيرة، يتركز 95% من الانتباه على الكلمة الإنجليزية الثانية " love" ، لذا يقترح النظام كلمة "aime" .

في مثال "أحبك" ، تتم محاذاة الكلمة الثانية "حب" مع الكلمة الثالثة "أحب" . يؤدي تجميع متجهات الصفوف المرنة معًا للكلمات " je" و "t'" و "aime" إلى مصفوفة محاذاة .

أناحبأنت
جي0.940.020.04
ت'0.110.010.88
أحب0.030.950.02

أحيانًا، قد يكون التوافق متعددًا. على سبيل المثال، العبارة الإنجليزية look it up تُقابل cherchez-le . لذا، فإن أوزان الانتباه "المرنة" أفضل من أوزان الانتباه "القاسية" (حيث يتم ضبط وزن انتباه واحد على 1، والباقي على 0)، لأننا نرغب في أن يُنشئ النموذج متجه سياق يتكون من مجموع مرجح للمتجهات المخفية، بدلًا من "أفضل متجه"، إذ قد لا يكون هناك متجه مخفي مثالي.

المتغيرات

مقارنة تدفق البيانات في الشبكات العصبية الالتفافية (CNN) والشبكات العصبية المتكررة (RNN) وتقنية الانتباه الذاتي

تستخدم العديد من أنواع الانتباه أوزاناً مرنة، مثل

  • مبرمجو الأوزان السريعة، أو متحكمو الأوزان السريعة (1992). [ 5 ] تقوم الشبكة العصبية "البطيئة" بإخراج الأوزان "السريعة" لشبكة عصبية أخرى من خلال الضرب الخارجي . تتعلم الشبكة البطيئة عن طريق انحدار التدرج. وقد أُعيد تسميتها لاحقًا باسم "الانتباه الذاتي الخطي". [ 38 ]
  • الانتباه على طريقة بهدانو، [ 11 ] ويشار إليه أيضًا بالانتباه الإضافي ،
  • الانتباه على طريقة لونغ، [ 39 ] والذي يُعرف بالانتباه المضاعف ،
  • تم اقتراح آليات انتباه مبكرة مشابهة للانتباه الذاتي الحديث باستخدام الشبكات العصبية المتكررة. ومع ذلك، تم تقديم الانتباه الذاتي عالي التوازي في عام 2017 واستُخدم بنجاح في نموذج Transformer.
  • الانتباه الموضعي والانتباه الموضعي المُحلل . [ 40 ]

بالنسبة للشبكات العصبية الالتفافية ، يمكن تمييز آليات الانتباه حسب البُعد الذي تعمل عليه، وهي: الانتباه المكاني، [ 41 ] الانتباه القنوي، [ 42 ] أو مزيج منهما. [ 43 ] [ 44 ]

تُعيد هذه المتغيرات تجميع مدخلات جانب المُشفِّر لإعادة توزيع تلك التأثيرات على كل مُخرَج مُستهدف. غالبًا ما تُوفِّر مصفوفة الارتباط من الضرب النقطي معاملات إعادة الترجيح. في الأشكال أدناه، W هي مصفوفة أوزان انتباه السياق، على غرار الصيغة الواردة في قسم النظرة العامة أعلاه.

1. حاصل الضرب النقطي بين المُشفِّر والمُفكِّك2. جهاز التشفير وفك التشفير QKV3. الضرب النقطي للمشفر فقط4. QKV للمشفّر فقط5. برنامج تعليمي لـ PyTorch
يلزم وجود كل من المُشفِّر والمُفكِّك لحساب الانتباه. [ 39 ]
يلزم وجود كل من المُشفِّر والمُفكِّك لحساب الانتباه. [ 45 ]
لا يُستخدم المُفكِّك لحساب الانتباه. مع وجود مُدخل واحد فقط في دالة corr، فإن W عبارة عن ارتباط ذاتي لضرب النقاط. w ij = x i x j . [ 46 ]
لا يُستخدم جهاز فك التشفير لحساب الانتباه. [ 47 ]
تُستخدم طبقة متصلة بالكامل لحساب الانتباه بدلاً من معامل الارتباط النقطي. [ 48 ]
أسطورة
ملصقوصف
المتغيرات X، H، S، Tتمثل المتغيرات المكتوبة بأحرف كبيرة الجملة بأكملها، وليس الكلمة الحالية فقط. على سبيل المثال، H هي مصفوفة الحالة المخفية للمشفّر - كلمة واحدة لكل عمود.
شارعS: الحالة المخفية للمفكك؛ T: تضمين الكلمة المستهدفة. في مرحلة التدريب الخاصة بنموذج PyTorch التعليمي، يتناوب T بين مصدرين حسب مستوى التوجيه المُستخدم. قد يكون T هو تضمين كلمة الإخراج من الشبكة، أي embedding(argmax(FC output)). أو، مع التوجيه، قد يكون T هو تضمين الكلمة الصحيحة المعروفة، والتي يمكن أن تظهر باحتمالية توجيه ثابتة، ولتكن 1/2.
X، HH، حالة التشفير المخفية؛ X، تضمينات الكلمات المدخلة.
دبليومعاملات الانتباه
Qw، Kw، Vw، FCمصفوفات الأوزان للاستعلام والمفتاح والقيمة على التوالي. FC هي مصفوفة أوزان متصلة بالكامل.
⊕, ⊗⊕، دمج المتجهات؛ ⊗، ضرب المصفوفات.
تصحيحدالة softmax العمودية (مصفوفة جميع تركيبات الضرب النقطي). الضرب النقطي هو xᵢ * xⱼ في المتغير رقم 3، و hᵢ * sⱼ في المتغير 1، والعمود i (Kw * H) * العمود j (Qw * S) في المتغير 2، والعمود i (Kw * X) * العمود j (Qw * X) في المتغير 4. يستخدم المتغير 5 طبقة متصلة بالكامل لتحديد المعاملات. إذا كان المتغير QKV، فسيتم تطبيع الضرب النقطي بقسمته على √d ، حيث d هو ارتفاع مصفوفات QKV.    

التحسينات

انتباه سريع

يتناسب حجم مصفوفة الانتباه طرديًا مع مربع عدد رموز الإدخال. لذا، عندما يكون الإدخال طويلًا، يتطلب حساب مصفوفة الانتباه ذاكرة كبيرة لوحدة معالجة الرسومات (GPU) . يُعدّ "الانتباه السريع" تطبيقًا يقلل من احتياجات الذاكرة ويزيد الكفاءة دون المساس بالدقة. ويتحقق ذلك من خلال تقسيم حساب الانتباه إلى كتل أصغر تتناسب مع ذاكرة وحدة معالجة الرسومات الأسرع، مما يقلل الحاجة إلى تخزين مصفوفات وسيطة كبيرة، وبالتالي يخفض استخدام الذاكرة مع زيادة الكفاءة الحسابية. [ 49 ]

فليكس أتينشن

FlexAttention [ 50 ] عبارة عن نواة انتباه طورتها شركة Meta تسمح للمستخدمين بتعديل درجات الانتباه قبل softmax وتختار ديناميكيًا خوارزمية الانتباه المثلى.

التطبيقات

يُستخدم الانتباه على نطاق واسع في معالجة اللغات الطبيعية، ورؤية الحاسوب، والتعرف على الكلام. في معالجة اللغات الطبيعية، يُحسّن الانتباه فهم السياق في مهام مثل الإجابة على الأسئلة وتلخيص النصوص. أما في مجال رؤية الحاسوب، فيساعد الانتباه البصري النماذج على التركيز على مناطق الصورة ذات الصلة، مما يُحسّن اكتشاف الكائنات ووصف الصور.

خرائط الانتباه كشرح لمُحَوِّلات الرؤية

منذ الورقة البحثية الأصلية حول محولات الرؤية (ViT)، أصبح تصوير درجات الانتباه على شكل خريطة حرارية (تُسمى خرائط البروز أو خرائط الانتباه) طريقةً مهمةً وروتينيةً لفحص عملية اتخاذ القرار في نماذج ViT. [ 51 ] يمكن حساب خرائط الانتباه بالنسبة لأي رأس انتباه في أي طبقة، بينما تميل الطبقات الأعمق إلى إظهار تصور أكثر دلالةً من الناحية الدلالية. يُعدّ نشر الانتباه خوارزميةً تكراريةً لدمج درجات الانتباه عبر جميع الطبقات، وذلك بحساب حاصل الضرب النقطي لخرائط الانتباه المتتالية. [ 52 ]

نظرًا لأن محولات الرؤية تُدرَّب عادةً بطريقة ذاتية الإشراف ، فإن خرائط الانتباه لا تكون حساسة للفئات بشكل عام. عند ربط رأس تصنيف بالعمود الفقري لمحولات الرؤية، تجمع خرائط الانتباه التمييزية للفئات (CDAM) بين خرائط الانتباه والتدرجات بالنسبة [CLS]لرمز الفئة. [ 53 ] يمكن أيضًا تطبيق بعض أساليب التفسير الحساسة للفئات، التي طُوِّرت في الأصل للشبكات العصبية الالتفافية، على محولات الرؤية، مثل GradCAM، التي تنشر التدرجات عكسيًا إلى مخرجات طبقة الانتباه النهائية. [ 54 ]

إن استخدام الانتباه كأساس لتفسير التحولات في اللغة والرؤية ليس بالأمر الخالي من الجدل. فبينما حللت بعض الدراسات الرائدة درجات الانتباه وقدمتها كتفسيرات، [ 55 ] [ 56 ] إلا أن ارتفاع درجات الانتباه لا يرتبط دائمًا بتأثير أكبر على أداء النموذج. [ 57 ]

التمثيل الرياضي

الانتباه القياسي لضرب النقاط

بالنسبة للمصفوفات:سؤالRم×دك،كRن×دك{\displaystyle Q\in \mathbb {R} ^{m\times d_{k}},K\in \mathbb {R} ^{n\times d_{k}}}وVRن×دv{\displaystyle V\in \mathbb {R} ^{n\times d_{v}}}، ويُعرَّف حاصل الضرب النقطي المُقاس، أو انتباه QKV، على النحو التالي: انتباه(سؤال،ك،V)=سوفتماكس(سؤالكتيدك)VRم×دv{\displaystyle {\text{Attention}}(Q,K,V)={\text{softmax}}\left({\frac {QK^{T}}{\sqrt {d_{k}}}}\right)V\in \mathbb {R} ^{m\times d_{v}}} أينتي{\displaystyle {}^{T}}يشير الرمز إلى عملية النقل ، ويتم تطبيق دالة softmax بشكل مستقل على كل صف من صفوف المصفوفة.سؤال{\displaystyle Q}يتضمنم{\displaystyle m}الاستعلامات، بينما المصفوفاتك،V{\displaystyle K,V}تحتوي مجتمعة على مجموعة غير مرتبة منن{\displaystyle n}أزواج المفتاح والقيمة. متجهات القيم في مصفوفةV{\displaystyle V}يتم ترجيحها باستخدام الأوزان الناتجة عن عملية softmax، بحيث تكون صفوفم{\displaystyle m}-بواسطة-دv{\displaystyle d_{v}}تقتصر مصفوفة الإخراج على الغلاف المحدب للنقاط فيRدv{\displaystyle \mathbb {R} ^{d_{v}}}مُعطاة بواسطة صفوفV{\displaystyle V}.

لفهم خصائص ثبات التبديل وتكافؤ التبديل لانتباه QKV، [ 58 ] لنفترضأRم×م{\displaystyle A\in \mathbb {R} ^{m\times m}}وبRن×ن{\displaystyle B\in \mathbb {R} ^{n\times n}}لتكن مصفوفات التبديل ؛ ودRم×ن{\displaystyle D\in \mathbb {R} ^{m\times n}}مصفوفة عشوائية. دالة softmax متغيرة بالتبديل بمعنى أن: سوفتماكس(أدب)=أسوفتماكس(د)ب{\displaystyle {\text{softmax}}(ADB)=A\,{\text{softmax}}(D)B} وبملاحظة أن منقولة مصفوفة التبديل هي أيضاً معكوسها، فإنه يترتب على ذلك ما يلي: انتباه(أسؤال،بك،بV)=أانتباه(سؤال،ك،V){\displaystyle {\text{Attention}}(AQ,BK,BV)=A\,{\text{Attention}}(Q,K,V)} مما يدل على أن آلية الانتباه QKV متغيرة بالنسبة لإعادة ترتيب الاستعلامات (صفوف منسؤال{\displaystyle Q})؛ وثابتة عند إعادة ترتيب أزواج المفتاح والقيمة فيك،V{\displaystyle K,V}تُورَث هذه الخصائص عند تطبيق التحويلات الخطية على مدخلات ومخرجات وحدات الانتباه QKV. على سبيل المثال، دالة انتباه ذاتي بسيطة مُعرَّفة على النحو التالي: Xانتباه(Xتيq،Xتيك،Xتيv){\displaystyle X\mapsto {\text{Attention}}(XT_{q},XT_{k},XT_{v})} هل يكون التبديل متكافئًا بالنسبة لإعادة ترتيب صفوف مصفوفة الإدخال؟X{\displaystyle X}بطريقة غير بديهية، لأن كل صف من المخرجات هو دالة لجميع صفوف المدخلات. تنطبق خصائص مماثلة على آلية الانتباه متعددة الرؤوس ، والتي سيتم تعريفها أدناه.

انتباه مقنع

عند استخدام آلية الانتباه QKV كعنصر أساسي لفك التشفير التراجعي الذاتي، وعندما تكون جميع مصفوفات الإدخال والإخراج في وقت التدريبن{\displaystyle n}في الصفوف، يتم استخدام نوع من أنواع الانتباه المقنع: انتباه(سؤال،ك،V)=سوفتماكس(سؤالكتيدك+م)V{\displaystyle {\text{Attention}}(Q,K,V)={\text{softmax}}\left({\frac {QK^{T}}{\sqrt {d_{k}}}}+M\right)V} أين القناع،م{0،-}ن×ن{\displaystyle M\in \mathbb {\{0,-\infty \}} ^{n\times n}}هي مصفوفة مثلثية علوية تمامًا ، مع وجود أصفار على القطر الرئيسي وأسفله.-{\displaystyle -\infty }في كل عنصر أعلى القطر. ناتج دالة softmax، فيRن×ن{\displaystyle \mathbb {R} ^{n\times n}}تكون المصفوفة حينها مثلثية سفلية ، مع وجود أصفار في جميع العناصر فوق القطر الرئيسي. ويضمن الحجب أن يكون ذلك صحيحًا لجميع العناصر.1أنا<جن{\displaystyle 1\leq i<j\leq n}، صفأنا{\displaystyle i}إن مخرجات الانتباه مستقلة عن الصفج{\displaystyle j}من أي من مصفوفات الإدخال الثلاث. لا تنطبق خصائص ثبات التبديل وتكافؤ التغاير لآلية الانتباه QKV القياسية على المتغير المقنّع.

انتباه متعدد الرؤوس

آلية الانتباه المتقاطع متعدد الرؤوس في وحدة فك التشفير

انتباه متعدد الرؤوس متعدد الرؤوس(سؤال،ك،V)=سلسلة(رأس1،...،رأسح)دبليويا{\displaystyle {\text{MultiHead}}(Q,K,V)={\text{Concat}}({\text{head}}_{1},...,{\text{head}}_{h})W^{O}} حيث يتم حساب كل رأس باستخدام آلية الانتباه QKV على النحو التالي: رأسأنا=انتباه(سؤالدبليوأناسؤال،كدبليوأناك،VدبليوأناV){\displaystyle {\text{head}}_{i}={\text{Attention}}(QW_{i}^{Q},KW_{i}^{K},VW_{i}^{V})} ودبليوأناسؤال،دبليوأناك،دبليوأناV{\displaystyle W_{i}^{Q},W_{i}^{K},W_{i}^{V}}، ودبليويا{\displaystyle W^{O}}هي مصفوفات المعاملات.

تنطبق خصائص التبديل الخاصة بآلية الانتباه QKV (القياسية، غير المقنعة) هنا أيضًا. بالنسبة لمصفوفات التبديل،أ،ب{\displaystyle A,B}: متعدد الرؤوس(أسؤال،بك،بV)=أمتعدد الرؤوس(سؤال،ك،V){\displaystyle {\text{MultiHead}}(AQ,BK,BV)=A\,{\text{MultiHead}}(Q,K,V)} ومن ذلك نرى أيضاً أن الانتباه الذاتي متعدد الرؤوس: Xمتعدد الرؤوس(Xتيq،Xتيك،Xتيv){\displaystyle X\mapsto {\text{MultiHead}}(XT_{q},XT_{k},XT_{v})} وهي متغيرة بالنسبة لإعادة ترتيب صفوف مصفوفة الإدخالX{\displaystyle X}.

بهداناو (الاهتمام الإضافي)

انتباه(سؤال،ك،V)=سوفتماكس(tanh(دبليوسؤالسؤال+دبليوكك))V{\displaystyle {\text{Attention}}(Q,K,V)={\text{softmax}}(\tanh(W_{Q}Q+W_{K}K))V} أيندبليوسؤال{\displaystyle W_{Q}}ودبليوك{\displaystyle W_{K}}هي مصفوفات أوزان قابلة للتعلم. [ 11 ]

انتباه لونغ (عام)

انتباه(سؤال،ك،V)=سوفتماكس(سؤالدبليوكتي)V{\displaystyle {\text{Attention}}(Q,K,V)={\text{softmax}}(QWK^{T})V} أيندبليو{\displaystyle W}هي مصفوفة أوزان قابلة للتعلم. [ 39 ]

الاهتمام الذاتي

يُعدّ الانتباه الذاتي مماثلاً للانتباه المتبادل، باستثناء أن متجهات الاستعلام والمفتاح والقيمة جميعها تأتي من النموذج نفسه. يمكن لكل من المُشفِّر والمُفكِّك استخدام الانتباه الذاتي، ولكن مع وجود اختلافات طفيفة.

بالنسبة لآلية الانتباه الذاتي في المشفر، يمكننا البدء بمشفر بسيط بدون آلية انتباه ذاتي، مثل "طبقة التضمين"، التي تقوم ببساطة بتحويل كل كلمة مُدخلة إلى متجه باستخدام جدول بحث ثابت . وهذا يُعطي سلسلة من المتجهات المخفية.ح0،ح1،...{\displaystyle h_{0},h_{1},\dots }ويمكن بعد ذلك تطبيق هذه النتائج على آلية الانتباه القائمة على الضرب النقطي، للحصول علىح0=أتتهـنتأناoن(ح0دبليوسؤال،حدبليوك،حدبليوV)ح1=أتتهـنتأناoن(ح1دبليوسؤال،حدبليوك،حدبليوV){\displaystyle {\begin{aligned}h_{0}'&=\mathrm {Attention} (h_{0}W^{Q},HW^{K},HW^{V})\\h_{1}'&=\mathrm {Attention} (h_{1}W^{Q},HW^{K},HW^{V})\\&\;\,\vdots \end{aligned}}}أو باختصار أكثر،ح=أتتهـنتأناoن(حدبليوسؤال،حدبليوك،حدبليوV){\displaystyle H'=\mathrm {Attention} (HW^{Q},HW^{K},HW^{V})}يمكن تطبيق ذلك بشكل متكرر للحصول على مُشفِّر متعدد الطبقات. يُعرف هذا بـ "الانتباه الذاتي للمُشفِّر"، ويُسمى أحيانًا "الانتباه الشامل"، حيث يمكن للمتجه في كل موضع أن ينتبه إلى كل متجه آخر.

التغطية

آلية الانتباه الذاتي للمفكك مع إخفاء السببية، رسم تخطيطي مفصل

بالنسبة لآلية الانتباه الذاتي للمفكك، فإن الانتباه الشامل غير مناسب، لأنه خلال عملية فك التشفير التراجعي الذاتي، لا يستطيع المفكك الانتباه إلى المخرجات المستقبلية التي لم يتم فك تشفيرها بعد. ويمكن حل هذه المشكلة عن طريق فرض أوزان الانتباه.wأناج=0{\displaystyle w_{ij}=0}للجميعأنا<ج{\displaystyle i<j}وتسمى هذه الآلية "الإخفاء السببي". وتسمى آلية الانتباه هذه "الانتباه الذاتي المقنع سببيًا".

انظر أيضاً

مراجع

  1. تشيري، إي. كولين (1953). "بعض التجارب على تمييز الكلام، بأذن واحدة وبأذنين". مجلة الجمعية الصوتية الأمريكية . 25 (5): 975-979 . Bibcode : 1953ASAJ...25..975C . doi : 10.1121/1.1907229 . hdl : 11858/00-001M-0000-002A-F750-3 .
  2. برودبنت، دونالد إي. (1958). الإدراك والتواصل . دار بيرغامون للنشر.
  3. كولر، إيلين (1995). "التحكم في حركات العين السريعة". مراجعات أبحاث حركة العين . 5 : 1-70 .
  4. روميلهارت، ديفيد إي.؛ هينتون، جي إي؛ ماكليلاند، جيمس إل. (29 يوليو 1987). "إطار عام للمعالجة الموزعة المتوازية" (ملف PDF) . في: روميلهارت، ديفيد إي.؛ هينتون، جي إي؛ مجموعة أبحاث المعالجة الموزعة المتوازية (محررون). المعالجة الموزعة المتوازية، المجلد 1: استكشافات في البنية الدقيقة للإدراك: الأسس . كامبريدج، ماساتشوستس: مطبعة معهد ماساتشوستس للتكنولوجيا. ISBN 978-0-262-68053-0.
  5. 1 2 شميدهوبر، يورغن (1992). "تعلم التحكم في الذاكرة ذات الوزن السريع: بديل للشبكات المتكررة". الحوسبة العصبية . 4 (1): 131-139 . doi : 10.1162/neco.1992.4.1.131 . S2CID 16683347 . 
  6. فون دير مالسبورغ، كريستوف (1981). "نظرية الارتباط لوظائف الدماغ". تقرير داخلي 81-2، معهد ماكس بلانك للكيمياء الفيزيائية الحيوية .
  7. فيلدمان، جيروم أ. (1982). "الروابط الديناميكية في الشبكات العصبية". علم التحكم الآلي البيولوجي . 46 (1): 27-39 . doi : 10.1007/BF00335349 . PMID 6307398 . 
  8. هينتون، جيفري إي. (1989). "إجراءات التعلم الترابطي". الذكاء الاصطناعي . 40 ( 1-3 ): 185-234 . doi : 10.1016/0004-3702(89)90049-0 .
  9. توماسي، كارلو (1998). الترشيح الثنائي للصور الرمادية والملونة . المؤتمر الدولي لرؤية الحاسوب (ICCV).
  10. ^ بوديس ، أنتوني (2005). خوارزمية غير محلية لتقليل ضوضاء الصورة . CVPR.
  11. 1 2 3 باهدانو، ديمتري؛ تشو، كيونغ هيون؛ بينجيو، يوشوا (2014). "الترجمة الآلية العصبية من خلال التعلم المشترك للمحاذاة والترجمة". arXiv : 1409.0473 [ cs.CL ].
  12. وانغ، تشيان (2014). الشبكة العصبية الانتباهية: اختيار الميزات باستخدام التغذية الراجعة المعرفية . NeurIPS.
  13. شو، كيلفن؛ با، جيمي؛ كيروس، رايان (2015). العرض، الانتباه، والشرح: توليد تعليقات الصور العصبية باستخدام الانتباه البصري . arXiv : 1502.03044 .
  14. فينيالز، أوريول؛ توشيف، ألكسندر؛ بينجيو، سامي؛ إرهان، دوميترو (2015). "Show and Tell: A Neural Image Caption Generator". مؤتمر IEEE لعام 2015 حول رؤية الحاسوب والتعرف على الأنماط (CVPR) . الصفحات 3156-3164 . doi : 10.1109/CVPR.2015.7298935 . ISBN  978-1-4673-6964-0.
  15. تشنغ، جيانبنغ (2016). "شبكات الذاكرة طويلة المدى للقراءة الآلية". arXiv : 1601.06733 [ cs.CL ].
  16. باولوس، رومان (2017). "نموذج معزز عميق للتلخيص التجريدي". arXiv : 1705.04304 [ cs.CL ].
  17. باريك، أنيس (2016). نموذج الانتباه القابل للتحليل لاستنتاج اللغة الطبيعية . EMNLP. arXiv : 1606.01933 .
  18. لين، زيتشاو (2017). تضمين الجملة ذات الانتباه الذاتي المنظم . ICLR. arXiv : 1703.03130 .
  19. 1 2 فاسواني، أشيش؛ شازير، نعوم؛ بارمار، نيكي؛ أوسزكوريت، جاكوب؛ جونز، ليون؛ جوميز، ايدان N.؛ كايزر، لوكاس؛ بولوسوخين، إيليا (2017). "الاهتمام هو كل ما تحتاجه". أرخايف : 1706.03762 [ cs.CL ].
  20. سانتورو، آدم (2017). شبكات العلاقات للاستدلال العلائقي . ICLR. arXiv : 1706.01427 .
  21. لي، جوهو (2019). محول المجموعة: إطار عمل للشبكات العصبية الثابتة التبديل القائمة على الانتباه . ICML. arXiv : 1810.00825 .
  22. وانغ، شياولونغ (2018). الشبكات العصبية غير المحلية . مؤتمر رؤية الحاسوب وأنماط التعرف.
  23. ^ فيليكوفيتش ، بيتار (2018). شبكات الاهتمام الرسم البياني . ICLR.
  24. كيتايف، نيكيتا (2020). المُصلِح: المُحوِّل الفعال . ICLR. arXiv : 2001.04451 .
  25. وانغ، صلاح (2020). لينفورمر: الانتباه الذاتي ذو التعقيد الخطي . ICLR. arXiv : 2006.04768 .
  26. تشورومانسكي، كريستوف (2020). إعادة التفكير في الانتباه مع المؤدين . ICLR. arXiv : 2009.14794 .
  27. رامساور، يوهانس (2021). شبكات هوبفيلد هي كل ما تحتاجه . NeurIPS. arXiv : 2008.02217 .
  28. دوسوفيتسكي، ألكسندر (2021). صورة تساوي 16×16 كلمة: محولات للتعرف على الصور على نطاق واسع . ICLR. arXiv : 2010.11929 .
  29. جامبر، جون (2021). "تنبؤ دقيق للغاية ببنية البروتين باستخدام AlphaFold" . Nature . 596 (7873): 583–589 . Bibcode : 2021Natur.596..583J . doi : 10.1038/ s41586-021-03819-2 . PMC 8371605. PMID 34265844 .  
  30. رادفورد، أليك (2021). تعلم النماذج البصرية القابلة للنقل من خلال الإشراف على اللغة الطبيعية . المؤتمر الدولي للتعلم الآلي (ICML).
  31. هوانغ، شيانغيو (2019). CCNet: الانتباه المتقاطع للتجزئة الدلالية . ICCV. arXiv : 1811.11721 .
  32. فو، جينغ (2019). شبكة الانتباه المزدوج لتقسيم المشهد . CVPR. arXiv : 1809.02983 .
  33. نيو، تشاويانغ؛ تشونغ، غوتشيانغ؛ يو، هوي (10 سبتمبر 2021). "مراجعة لآلية الانتباه في التعلم العميق" . الحوسبة العصبية . 452 : 48-62 . doi : 10.1016/j.neucom.2021.03.091 . ISSN 0925-2312 . 
  34. سويدانر، ديريا (أغسطس 2022). "آلية الانتباه في الشبكات العصبية: من أين تأتي وإلى أين تذهب" . الحوسبة العصبية وتطبيقاتها . 34 (16): 13371-13385 . arXiv : 2204.13154 . doi : 10.1007/s00521-022-07366-3 . ISSN 0941-0643 . 
  35. باهدانو، ديمتري؛ تشو، كيونغ هيون؛ بينجيو، يوشوا (2014). "الترجمة الآلية العصبية من خلال التعلم المشترك للمحاذاة والترجمة". arXiv : 1409.0473 [ cs.CL ].
  36. بريتز، ديني؛ غولدي، آنا؛ لونغ، مينه-ثانه؛ لي، كوك (2017-03-21). "استكشاف واسع النطاق لبنى الترجمة الآلية العصبية". arXiv : 1703.03906 [ cs.CV ].
  37. "برنامج تعليمي حول seq2seq من Pytorch.org" . تم الاطلاع عليه في 2 ديسمبر 2021 .
  38. ^ شلاغ، إيمانول ؛ إيري، كازوكي؛ شميدهوبر، يورغن (2021). “المحولات الخطية هي مبرمجين سريعين للوزن بشكل سري”. آي سي إم إل 2021 . سبرينغر. ص 9355 – 9366. 
  39. 1 2 3 لونغ، مينه-ثانغ (2015-09-20). "مناهج فعالة للترجمة الآلية العصبية القائمة على الانتباه". arXiv : 1508.04025v5 [ cs.CL ].
  40. لو، فان؛ تشانغ، جوان؛ شو، شنغوي (3 يوليو 2024). "تعلم الانتباه الموضعي للتوصية المتسلسلة" . catalyzex.com .
  41. تشو، شيتشو؛ تشنغ، داتشي؛ تشانغ، تشنغ؛ لين، ستيفن؛ داي، جيفنغ (2019). "دراسة تجريبية لآليات الانتباه المكاني في الشبكات العميقة". المؤتمر الدولي IEEE/CVF لرؤية الحاسوب (ICCV) لعام 2019. الصفحات 6687-6696 . arXiv : 1904.05873 . doi : 10.1109/ICCV.2019.00679 . ISBN  978-1-7281-4803-8. S2CID 118673006 . 
  42. هو، جي؛ شين، لي؛ صن، غانغ (2018). "شبكات الضغط والإثارة". مؤتمر IEEE/CVF لعام 2018 حول رؤية الحاسوب والتعرف على الأنماط . الصفحات 7132-7141 . arXiv : 1709.01507 . doi : 10.1109/CVPR.2018.00745 . ISBN  978-1-5386-6420-9. S2CID 206597034 . 
  43. ^ وو، سانغيون؛ بارك، جونغتشان؛ لي جون يونج؛ كوون ، إن سو (2018/07/18). “CBAM: وحدة الانتباه للكتلة التلافيفية”. أرخايف : 1807.06521 [ cs.CV ].
  44. ^ جورجيسكو، ماريانا-يوليانا؛ إيونيسكو، رادو تيودور؛ ميرون، أندريا-يوليانا؛ سافينكو، أوليفيان؛ ريستيا، نيكولاي كاتالين؛ فيرغا، نيكولاي؛ خان، فهد شهباز (2022-10-12). “انتباه تلافيفي متعدد الوسائط متعدد الرؤوس بأحجام مختلفة للنواة للحصول على دقة فائقة للصورة الطبية”. أرخايف : 2204.04218 [ eess.IV ].
  45. نيل رودس (2021). CS 152 NN—27: الانتباه: المفاتيح والاستعلامات والقيم . حدث في الساعة 06:30 . تم الاطلاع عليه بتاريخ 22 ديسمبر 2021 .
  46. ألفريدو كانزياني ويان ليكان (2021). دورة التعلم العميق بجامعة نيويورك، ربيع 2020. يبدأ الحدث الساعة 5:30 صباحًا . تاريخ الاسترجاع: 22 ديسمبر 2021 .
  47. ألفريدو كانزياني ويان ليكان (2021). دورة التعلم العميق بجامعة نيويورك، ربيع 2020. يبدأ الحدث في الساعة 20:15 . تاريخ الاسترجاع: 22 ديسمبر 2021 .
  48. روبرتسون، شون. "معالجة اللغة الطبيعية من الصفر: الترجمة باستخدام شبكة تسلسل إلى تسلسل وآلية الانتباه" . pytorch.org . تم الاطلاع عليه بتاريخ 22-12-2021 .
  49. ميتال، أيوش (17 يوليو 2024). "الانتباه الخاطف: إحداث ثورة في كفاءة المحولات" . Unite.AI . تم الاطلاع عليه بتاريخ 16 نوفمبر 2024 .
  50. "FlexAttention: مرونة PyTorch مع أداء FlashAttention – PyTorch" .
  51. ^ دوسوفيتسكي ، أليكسي. باير، لوكاس. كوليسنيكوف، الكسندر؛ ويسينبورن، ديرك. تشاي، شياو هوا؛ أونترثينر، توماس؛ دهقاني، مصطفى؛ مينديرر، ماتياس؛ هيجولد، جورج (2021-06-03)، الصورة تستحق 16 × 16 كلمة: محولات للتعرف على الصور على نطاق واسع ، أرخايف : 2010.11929
  52. أبنار، سميرة؛ زويديما، ويليم (2020-05-31)، قياس تدفق الانتباه في المحولات ، arXiv : 2005.00928
  53. بروكي، لينارت؛ بيندا، جاكوب؛ تشونغ، نيو كريستوفر (2024-10-25)، خرائط الانتباه التمييزية للفئات لمُحوِّلات الرؤية ، arXiv : 2312.02364
  54. ^ جيلدنبلات ، جاكوب (21 يوليو 2025)، جاكوبجيل / pytorch-grad-cam ، استرجاعها 2025/07/21
  55. مولينباخ، جيمس؛ ويغريف، سارة؛ ديوك، جون؛ صن، جيمينغ؛ أيزنشتاين، جاكوب (2018-04-16)، التنبؤ القابل للتفسير بالرموز الطبية من النصوص السريرية ، arXiv : 1802.05695
  56. باهدانو، ديمتري؛ تشو، كيونغ هيون؛ بينجيو، يوشوا (19-05-2016)، الترجمة الآلية العصبية من خلال التعلم المشترك للمحاذاة والترجمة ، arXiv : 1409.0473
  57. ↑ سيرانو، صوفيا؛ سميث، نوح أ . (2019-06-09)، هل يمكن تفسير الانتباه؟، arXiv : 1906.03731
  58. لي، جوهو؛ لي، يون هو؛ كيم، جونغ تايك؛ كوسوريك، آدم ر؛ تشوي، سيونغ جين؛ تيه، يي واي (2018). "محول المجموعة: إطار عمل للشبكات العصبية الثابتة التبديل القائمة على الانتباه". arXiv : 1810.00825 [ cs.LG ].