تسلسل2تسلسل

Seq2seq هي عائلة من أساليب التعلم الآلي المستخدمة في معالجة اللغة الطبيعية . [1] تشمل التطبيقات ترجمة اللغة ، وترجمة الصور ، ونماذج المحادثة ، وتلخيص النص . [2] يستخدم Seq2seq تحويل التسلسل : يحول تسلسلًا واحدًا إلى تسلسل آخر.
تاريخ
من الطبيعي أن يتساءل المرء عما إذا كان من الممكن التعامل مع مشكلة الترجمة باعتبارها مشكلة في التشفير. فحين أقرأ مقالاً باللغة الروسية أقول: "هذا المقال مكتوب باللغة الإنجليزية في واقع الأمر، ولكنه مشفر ببعض الرموز الغريبة. وسأشرع الآن في فك التشفير".
— وارن ويفر ، رسالة إلى نوربرت وينر ، 4 مارس 1947

seq2seq هو نهج للترجمة الآلية (أو بشكل عام، نقل التسلسل ) له جذور في نظرية المعلومات، حيث يُفهم الاتصال كعملية ترميز-إرسال-فك تشفير، ويمكن دراسة الترجمة الآلية كحالة خاصة من الاتصالات. تم توضيح وجهة النظر هذه، على سبيل المثال، في نموذج القناة الضوضائية للترجمة الآلية.
في الممارسة العملية، تقوم seq2seq بتعيين تسلسل إدخال إلى متجه عددي حقيقي باستخدام شبكة عصبية ( المشفر )، ثم تقوم بتعيينه مرة أخرى إلى تسلسل إخراج باستخدام شبكة عصبية أخرى ( المشفر ).
تم تطوير فكرة نقل تسلسل المشفر-الفك في أوائل العقد الأول من القرن الحادي والعشرين (انظر [3] [1] للأوراق السابقة). الأوراق التي يُستشهد بها بشكل شائع باعتبارها المنشئة التي أنتجت seq2seq هي ورقتان من عام 2014. [3] [1]
في seq2seq كما اقترحوا، كان كل من المشفر وفك التشفير عبارة عن LSTMs . كان لهذا مشكلة "عنق الزجاجة"، نظرًا لأن متجه التشفير له حجم ثابت، لذلك بالنسبة لتسلسلات الإدخال الطويلة، تميل المعلومات إلى الضياع، حيث يصعب وضعها في متجه التشفير ذي الطول الثابت. حلت آلية الانتباه ، المقترحة في عام 2014، [4] مشكلة عنق الزجاجة. أطلقوا على نموذجهم اسم RNNsearch ، لأنه "يحاكي البحث من خلال جملة مصدر أثناء فك تشفير الترجمة".
كانت المشكلة في نماذج seq2seq في هذه المرحلة هي صعوبة تشغيل الشبكات العصبية المتكررة بالتوازي. وقد حلت نشرة Transformers لعام 2017 [5] المشكلة عن طريق استبدال RNN المشفرة بكتل Transformer ذات الاهتمام الذاتي ("كتل التشفير")، وفك تشفير RNN بكتل Transformer مقنعة سببيًا ("كتل فك التشفير").
نزاع الأولوية
أحد الأوراق التي تم الاستشهاد بها كمبتكر لـ seq2seq هو (Sutskever et al 2014)، [1] نُشر في Google Brain أثناء وجودهم في مشروع الترجمة الآلية الخاص بـ Google. سمح البحث لـ Google بإصلاح Google Translate إلى Google Neural Machine Translation في عام 2016. [1] [6] يدعي Tomáš Mikolov أنه طور فكرة (قبل الانضمام إلى Google Brain ) لاستخدام "نموذج لغوي عصبي على أزواج من الجمل ... ثم [إنشاء] ترجمة بعد رؤية الجملة الأولى" - وهو ما يعادله بالترجمة الآلية seq2seq، وذكر الفكرة لإيليا سوتسكيفر وكووك لي (أثناء وجوده في Google Brain)، اللذين فشلا في الاعتراف به في ورقتهما. [7] عمل ميكولوف على RNNLM (باستخدام RNN لنمذجة اللغة) لأطروحته للدكتوراه، [8] وهو أكثر شهرة لتطوير word2vec .
بنيان
مُشفّر

المشفر مسؤول عن معالجة تسلسل الإدخال والتقاط معلوماته الأساسية، والتي يتم تخزينها كحالة مخفية للشبكة، وفي نموذج بآلية انتباه، متجه سياق. متجه السياق هو المجموع المرجح لحالات الإدخال المخفية ويتم إنشاؤه لكل مثيل زمني في تسلسلات الإخراج.
فك التشفير

يأخذ المفكك متجه السياق والحالات المخفية من المشفر ويولد تسلسل الإخراج النهائي. يعمل المفكك بطريقة انحدارية تلقائية، حيث ينتج عنصرًا واحدًا من تسلسل الإخراج في كل مرة. في كل خطوة، يأخذ في الاعتبار العناصر التي تم إنشاؤها مسبقًا ومتجه السياق ومعلومات تسلسل الإدخال للتنبؤ بالعنصر التالي في تسلسل الإخراج. على وجه التحديد، في نموذج به آلية انتباه، يتم ربط متجه السياق والحالة المخفية معًا لتشكيل متجه انتباه مخفي، والذي يستخدم كمدخل للمفكك.
آلية الانتباه


آلية الانتباه هي تحسين قدمه باهداناو وآخرون في عام 2014 لمعالجة القيود في بنية Seq2Seq الأساسية حيث يؤدي تسلسل الإدخال الأطول إلى أن يصبح خرج الحالة المخفية للمشفر غير ذي صلة بفك التشفير. إنه يمكّن النموذج من التركيز بشكل انتقائي على أجزاء مختلفة من تسلسل الإدخال أثناء عملية فك التشفير. في كل خطوة من خطوات فك التشفير، يحسب نموذج المحاذاة درجة الانتباه باستخدام حالة فك التشفير الحالية وجميع متجهات الانتباه المخفية كمدخلات. نموذج المحاذاة هو نموذج شبكة عصبية آخر يتم تدريبه بالاشتراك مع نموذج seq2seq المستخدم لحساب مدى تطابق المدخلات، الممثلة بالحالة المخفية، مع المخرجات السابقة، الممثلة بالحالة المخفية للانتباه. ثم يتم تطبيق دالة softmax على درجة الانتباه للحصول على وزن الانتباه.

في بعض النماذج، يتم إدخال حالات الترميز مباشرة في دالة التنشيط، مما يزيل الحاجة إلى نموذج المحاذاة. تتلقى دالة التنشيط حالة فك تشفير واحدة وحالة ترميز واحدة وتعيد قيمة عددية لأهميتها. [9]
تطبيقات أخرى
في عام 2019، أعلنت شركة فيسبوك عن استخدامها في التكامل الرمزي وحل المعادلات التفاضلية . وزعمت الشركة أنها تستطيع حل المعادلات المعقدة بسرعة أكبر وبدقة أكبر من الحلول التجارية مثل Mathematica و MATLAB و Maple . أولاً، يتم تحليل المعادلة إلى بنية شجرة لتجنب التعقيدات التدوينية. ثم تطبق شبكة عصبية LSTM مرافق التعرف على الأنماط القياسية لمعالجة الشجرة. [10]
في عام 2020، أصدرت جوجل برنامج Meena، وهو روبوت محادثة قائم على تسلسل 2 تسلسل يحتوي على 2.6 مليار معلمة تم تدريبه على مجموعة بيانات بحجم 341 جيجابايت. ادعت جوجل أن روبوت المحادثة لديه سعة نموذج أكبر بمقدار 1.7 مرة من GPT-2 من OpenAI ، [11] والذي تم تدريب خليفته في مايو 2020، GPT-3 الذي يحتوي على 175 مليار معلمة ، على "مجموعة بيانات بحجم 45 تيرابايت من كلمات النص العادي (45000 جيجابايت) والتي تم ... تصفيتها إلى 570 جيجابايت." [12]
في عام 2022، قدمت أمازون نموذج AlexaTM 20B، وهو نموذج لغة seq2seq متوسط الحجم (20 مليار معلمة) . يستخدم مشفرًا وفك تشفير لإنجاز التعلم من لقطات قليلة. يُخرج المشفر تمثيلًا للمدخلات التي يستخدمها فك التشفير كمدخلات لأداء مهمة معينة، مثل ترجمة المدخلات إلى لغة أخرى. يتفوق النموذج على GPT-3 الأكبر بكثير في ترجمة اللغة والتلخيص. يمزج التدريب بين إزالة الضوضاء (إدراج نص مفقود بشكل مناسب في السلاسل) والنمذجة اللغوية السببية (توسيع نص الإدخال بشكل هادف). يسمح بإضافة ميزات عبر لغات مختلفة دون تدفقات عمل تدريبية ضخمة. حقق AlexaTM 20B أداءً متطورًا في مهام التعلم من لقطات قليلة عبر جميع أزواج لغات Flores-101، متفوقًا على GPT-3 في العديد من المهام. [13]
انظر أيضا
مراجع
- ^ abcde Sutskever, Ilya; Vinyals, Oriol; Le, Quoc Viet (2014). "التعلم من تسلسل إلى تسلسل باستخدام الشبكات العصبية". arXiv : 1409.3215 [cs.CL].
- ^ Wadhwa, Mani (2018-12-05). "نموذج seq2seq في التعلم الآلي". GeeksforGeeks . تم الاسترجاع في 2019-12-17 .
- ^ ab Cho, Kyunghyun; van Merrienboer, Bart; Gulcehre, Caglar; Bahdanau, Dzmitry; Bougares, Fethi; Schwenk, Holger; Bengio, Yoshua (2014-06-03). "تعلم تمثيلات العبارات باستخدام مشفر وفك تشفير RNN للترجمة الآلية الإحصائية". arXiv : 1406.1078 [cs.CL].
- ^ باهداناو، دميتري؛ تشو، كيونغ هيون؛ بينجيو، يوشوا (2014). "الترجمة الآلية العصبية من خلال التعلم المشترك للمحاذاة والترجمة". arXiv : 1409.0473 [cs.CL].
- ^ فاسواني ، اشيش. شازير، نعوم؛ بارمار، نيكي؛ أوسزكوريت، جاكوب؛ جونز، ليون؛ جوميز ، ايدان ن. كايزر، Ł ukasz؛ بولوسوخين، إيليا (2017). "الاهتمام هو كل ما تحتاجه". التقدم في أنظمة معالجة المعلومات العصبية . 30 . شركة كوران أسوشيتس
- ^ وو، يونغ هوي؛ شوستر، مايك؛ تشن، زيفنغ؛ لي، كووك ف؛ نوروزي، محمد؛ ماشيري، ولفجانج؛ كريكون، ماكسيم؛ كاو، يوان؛ جاو، تشين؛ ماشيري، كلاوس؛ كلينجنر، جيف؛ شاه، أبورفا؛ جونسون، ميلفين؛ ليو، شياوبينغ؛ كايزر، لوكاس (2016). "نظام الترجمة الآلية العصبية من جوجل: سد الفجوة بين الترجمة البشرية والآلية". arXiv : 1609.08144 [cs.CL].
- ^ ميكولوف، توماس (13 ديسمبر 2023). "لقد حصلنا أمس على جائزة اختبار الزمن في NeurIPS عن ورقة word2vec التي صدرت قبل عشر سنوات". فيسبوك . مؤرشف من الأصل في 24 ديسمبر 2023.
- ^ ميكولوف، توماس. "نماذج اللغة الإحصائية القائمة على الشبكات العصبية." (2012).
- ^ Voita, Lena. "تسلسل إلى تسلسل (seq2seq) والانتباه" . تم الاسترجاع في 2023-12-20 .
- ^ "فيسبوك لديه شبكة عصبية يمكنها إجراء عمليات حسابية متقدمة". MIT Technology Review . 17 ديسمبر 2019 . تم الاسترجاع في 2019-12-17 .
- ^ ميهتا، إيفان (2020-01-29). "تزعم جوجل أن روبوت الدردشة الجديد مينا هو الأفضل في العالم". The Next Web . تم الاسترجاع في 2020-02-03 .
- ^ Gage, Justin. "ما هو GPT-3؟" . تم الاسترجاع في 1 أغسطس 2020 .
- ^ رودريجيز، جيسوس (8 سبتمبر 2022). "🤘Edge#224: AlexaTM 20B هو نموذج لغة أمازون الجديد الفائق القادر أيضًا على التعلم من خلال لقطات قليلة". thesequence.substack.com . تم الاسترجاع في 2022-09-08 .
روابط خارجية
- "مقدمة مدتها عشر دقائق حول التعلم من تسلسل إلى تسلسل في Keras". blog.keras.io . تم الاسترجاع في 2019-12-19 .
- أديوواردانا، دانيال؛ لونج، مينه ثانج؛ لذلك، ديفيد ر. هول، جيمي؛ فيدل، نوح؛ توبيلان، رومال؛ يانغ زي. كولشرشتا، أبورف؛ نيماد، غوراف؛ لو، يفينغ. لو كووك ف. (2020-01-31). “نحو Chatbot مفتوح المجال يشبه الإنسان”. أرخايف : 2001.09977 [cs.CL].
