نموذج بيرت اللغوي
نموذج BERT ( تمثيلات المشفر ثنائي الاتجاه من المحولات ) هو نموذج لغوي طُوِّر في أكتوبر 2018 من قِبَل باحثين في جوجل . [ 2 ] [ 3 ] يتعلم هذا النموذج تمثيل النصوص كسلسلة من المتجهات باستخدام التعلم الذاتي . ويعتمد على بنية المحولات التي تحتوي على المشفر فقط . وقد أحدث BERT نقلة نوعية في مجال نماذج اللغة الكبيرة . اعتبارًا من عام 2020يُعدّ BERT معيارًا أساسيًا شائعًا في تجارب معالجة اللغة الطبيعية (NLP). [ 4 ]
يتم تدريب نموذج BERT من خلال التنبؤ بالرموز المقنعة والتنبؤ بالجمل التالية. وبفضل هذا التدريب، يتعلم BERT تمثيلات سياقية كامنة للرموز في سياقها، على غرار ELMo و GPT-2 . [ 5 ] وقد وجد تطبيقات في العديد من مهام معالجة اللغة الطبيعية، مثل حل الإحالات وحل تعدد المعاني . [ 6 ] وقد تفوق على ELMo وأدى إلى ظهور علم "BERTology"، الذي يسعى إلى تفسير ما يتعلمه BERT. [ 4 ]
طُبِّقَ نموذج BERT في الأصل باللغة الإنجليزية بحجمين: BERT BASE (110 ملايين مُعامل) وBERT LARGE (340 مليون مُعامل). دُرِّب كلا النموذجين على مجموعة بيانات Toronto BookCorpus [ 7 ] (800 مليون كلمة) وموسوعة ويكيبيديا الإنجليزية (2.5 مليون كلمة). [ 2 ] : 5 نُشرت الأوزان على منصة GitHub . [ 8 ] في 11 مارس 2020، أُصدرت 24 نموذجًا أصغر حجمًا، أصغرها BERT TINY الذي يحتوي على 4 ملايين مُعامل فقط. [ 8 ]
بنيان

يُعدّ BERT بنية محوّل "تعتمد على المُشفّر فقط" . يتكون BERT بشكل عام من 4 وحدات:
- مُجزئ الكلمات: تقوم هذه الوحدة بتحويل جزء من النص الإنجليزي إلى سلسلة من الأعداد الصحيحة ("الرموز").
- التضمين : تقوم هذه الوحدة بتحويل سلسلة الرموز إلى مصفوفة من المتجهات ذات القيم الحقيقية التي تمثل هذه الرموز. وهي تمثل تحويل أنواع الرموز المنفصلة إلى فضاء إقليدي ذي أبعاد أقل .
- المشفر: مجموعة من كتل المحول مع الانتباه الذاتي ، ولكن بدون إخفاء سببي.
- رأس المهمة: تقوم هذه الوحدة بتحويل متجهات التمثيل النهائية إلى رموز مشفرة لمرة واحدة مرة أخرى، وذلك من خلال إنتاج توزيع احتمالي متوقع لأنواع الرموز. ويمكن اعتبارها وحدة فك تشفير بسيطة، تقوم بفك تشفير التمثيل الكامن إلى أنواع الرموز، أو كطبقة "إزالة تضمين".
يُعدّ رأس المهمة ضروريًا للتدريب المسبق، ولكنه غالبًا ما يكون غير ضروري لما يُسمى "المهام اللاحقة"، مثل الإجابة على الأسئلة أو تصنيف المشاعر . بدلًا من ذلك، يُزال رأس المهمة ويُستبدل بوحدة مُهيأة حديثًا ومُلائمة للمهمة، ثم تُضبط هذه الوحدة الجديدة بدقة. يُغذّى تمثيل المتجه الكامن للنموذج مباشرةً إلى هذه الوحدة الجديدة، مما يسمح بنقل التعلم بكفاءة عالية من حيث عدد العينات . [ 2 ] [ 9 ]

التضمين
يصف هذا القسم طريقة تضمين البيانات المستخدمة في BERT BASE . أما BERT LARGE فهو مشابه، ولكنه أكبر حجماً.
يستخدم نموذج BERT أداة WordPiece لتقسيم الكلمات، وهي استراتيجية تعتمد على تقسيم الكلمات الفرعية مثل ترميز أزواج البايت . يبلغ حجم مفرداتها 30000 كلمة، ويتم استبدال أي كلمة غير موجودة في مفرداتها بـ [UNK]("غير معروف").

الطبقة الأولى هي طبقة التضمين، والتي تحتوي على ثلاثة مكونات: تضمينات نوع الرمز المميز، وتضمينات الموضع، وتضمينات نوع المقطع.
- نوع الرمز المميز: نوع الرمز المميز هو طبقة تضمين قياسية، تقوم بترجمة متجه أحادي ساخن إلى متجه كثيف بناءً على نوع الرمز المميز الخاص به.
- الموقع: تعتمد تمثيلات الموقع على موقع الرمز المميز في التسلسل. يستخدم BERT تمثيلات الموقع المطلقة، حيث يُرسم كل موقع في التسلسل إلى متجه ذي قيم حقيقية. يتكون كل بُعد من أبعاد المتجه من دالة جيبية تأخذ الموقع في التسلسل كمدخل.
- نوع المقطع: باستخدام مفردات من 0 أو 1 فقط، تُنتج طبقة التضمين هذه متجهًا كثيفًا بناءً على ما إذا كان الرمز ينتمي إلى المقطع النصي الأول أو الثاني في المدخلات. بعبارة أخرى، الرموز من النوع 1 هي جميع الرموز التي تظهر بعد
[SEP]الرمز الخاص. أما جميع الرموز السابقة فهي من النوع 0.
تُجمع متجهات التضمين الثلاثة معًا لتمثيل التمثيل الأولي للرمز كدالة لهذه المعلومات الثلاث. بعد التضمين، يُجرى تطبيع تمثيل المتجه باستخدام عملية LayerNorm ، مما ينتج عنه متجه ذو 768 بُعدًا لكل رمز مُدخل. بعد ذلك، تُمرر متجهات التمثيل عبر 12 وحدة تشفير Transformer، ثم تُفك شفرتها مرة أخرى إلى فضاء مفردات ذي 30000 بُعد باستخدام طبقة تحويل خطي أساسية.
عائلة معمارية
تحتوي مجموعة مشفرات BERT على معلَمَين حرين:، وعدد الطبقات، والحجم الخفي . هناك دائمًارؤوس الانتباه الذاتي، وحجم التغذية الأمامية/المرشح يكون دائمًابتغيير هذين الرقمين، نحصل على عائلة كاملة من نماذج BERT. [ 10 ]
لبيرت:
- حجم التغذية الأمامية وحجم المرشح مترادفان. يشير كلاهما إلى عدد الأبعاد في الطبقة الوسطى من شبكة التغذية الأمامية.
- حجم البيانات المخفية وحجم البيانات المضمنة مترادفان. يشير كلاهما إلى عدد الأعداد الحقيقية المستخدمة لتمثيل رمز مميز.
يُكتب ترميز مكدس المشفر على النحو التالي: L/H. على سبيل المثال، يُكتب BERT BASE على النحو التالي: 12L/768H، وBERT LARGE على النحو التالي: 24L/1024H، وBERT TINY على النحو التالي: 2L/128H.
تمرين
التدريب المسبق
تم تدريب BERT مسبقًا في وقت واحد على مهمتين: [ 11 ]
- نمذجة اللغة المقنّعة (MLM): في هذه المهمة، يستقبل نموذج BERT سلسلة من الكلمات، حيث قد تُغيّر كلمة واحدة عشوائيًا ("مقنّعة")، ويحاول BERT التنبؤ بالكلمات الأصلية التي تم تغييرها. على سبيل المثال، في جملة "The cat sat on the
[MASK]"، سيحتاج BERT إلى التنبؤ بكلمة "mat". يساعد هذا BERT على تعلّم السياق ثنائي الاتجاه، أي أنه يفهم العلاقات بين الكلمات ليس فقط من اليسار إلى اليمين أو من اليمين إلى اليسار، بل من كلا الاتجاهين في الوقت نفسه.
- التنبؤ بالجملة التالية (NSP): في هذه المهمة، يتم تدريب نموذج BERT على التنبؤ بما إذا كانت جملة ما تتبع جملة أخرى منطقيًا. على سبيل المثال، عند إعطاء جملتين، "جلست القطة على السجادة" و"كان يومًا مشمسًا"، يتعين على BERT تحديد ما إذا كانت الجملة الثانية امتدادًا صحيحًا للجملة الأولى. يساعد هذا BERT على فهم العلاقات بين الجمل، وهو أمر بالغ الأهمية لمهام مثل الإجابة على الأسئلة أو تصنيف المستندات.
نمذجة اللغة المقنعة

في نمذجة اللغة المقنّعة، يتم اختيار 15% من الكلمات عشوائيًا لمهمة التنبؤ المقنّعة، ويكون هدف التدريب هو التنبؤ بالكلمة المقنّعة بناءً على سياقها. بتفصيل أكثر، الكلمة المختارة هي:
- تم استبدالها
[MASK]برمز مميز باحتمالية 80%، - تم استبدالها برمز كلمة عشوائي باحتمالية 10%،
- لا يتم استبدالها باحتمالية 10%.
السبب في عدم إخفاء جميع الرموز المختارة هو تجنب مشكلة انزياح مجموعة البيانات. تنشأ هذه المشكلة عندما يختلف توزيع المدخلات المُشاهدة أثناء التدريب اختلافًا كبيرًا عن التوزيع المُصادف أثناء الاستدلال. يمكن تطبيق نموذج BERT المُدرَّب على تمثيل الكلمات (مثل Word2Vec )، حيث يُشغَّل على جمل لا تحتوي على أي [MASK]رموز. وقد وُجِد لاحقًا أن تنويع أهداف التدريب يُحسِّن الأداء عمومًا. [ 12 ]
كمثال توضيحي، لنأخذ جملة "كلبي لطيف". تُقسّم هذه الجملة أولًا إلى أجزاء مثل "كلبي ١، كلبي ٢، هو ٣، لطيف ٤ ". ثم يُختار جزء عشوائي من الجملة، ولنفترض أنه الجزء الرابع "لطيف ٤ ". بعد ذلك، ستكون هناك ثلاثة احتمالات:
- باحتمالية 80٪، يتم إخفاء الرمز المميز المختار، مما ينتج عنه " كلبي 1 هو 3 4 " ؛
[MASK] - باحتمالية 10٪، يتم استبدال الرمز المميز المختار برمز عشوائي تم أخذ عينة منه بشكل منتظم، مثل "happy"، مما ينتج عنه "my 1 dog 2 is 3 happy 4 "؛
- باحتمالية 10%، لا يتم فعل أي شيء، مما ينتج عنه " كلبي رقم 1 لطيف 4 " .
بعد معالجة النص المدخل، يتم تمرير متجه الإخراج الرابع للنموذج إلى طبقة فك التشفير الخاصة به، والتي تقوم بإخراج توزيع احتمالي على مساحة المفردات ذات الأبعاد 30000.
توقع الجملة التالية

عند إدخال جملتين، يتنبأ النموذج بما إذا كانتا ستظهران بالتتابع في مجموعة التدريب، ويُخرج إما "صحيح" [IsNext]أو "خطأ [NotNext]". أثناء التدريب، تقوم الخوارزمية أحيانًا بأخذ عينة من جملتين من نطاق متصل واحد في مجموعة التدريب، بينما في أحيان أخرى، تأخذ عينة من جملتين من نطاقين غير متصلين.
تبدأ الجملة الأولى برمز خاص [CLS](يرمز إلى "تصنيف"). ويفصل بين الجملتين رمز خاص آخر [SEP](يرمز إلى "فصل"). بعد معالجة الجملتين، [CLS]يُمرر المتجه النهائي للرمز إلى طبقة خطية للتصنيف الثنائي إلى [IsNext]فئتين [NotNext].
على سبيل المثال:
- بافتراض أن "
[CLS]كلبي لطيف[SEP]ويحب اللعب[SEP]"، يجب أن يتنبأ النموذج بـ[IsNext]... - بافتراض أن "
[CLS]كلبي لطيف،[SEP]كيف تعمل المغناطيسات[SEP]؟"، يجب أن يتنبأ النموذج بـ[NotNext]...
الكون المثالى
تصنيف المشاعر
تصنيف الجمل
الإجابة على أسئلة الاختيار من متعدد
يُعدّ BERT نموذجًا عامًا مُدرّبًا مسبقًا لتطبيقات متنوعة في معالجة اللغة الطبيعية. بمعنى آخر، بعد التدريب المسبق، يُمكن ضبط BERT بدقة باستخدام موارد أقل على مجموعات بيانات أصغر لتحسين أدائه في مهام محددة مثل استنتاج اللغة الطبيعية وتصنيف النصوص ، ومهام توليد اللغة القائمة على التسلسل إلى التسلسل مثل الإجابة على الأسئلة وتوليد الردود الحوارية. [ 13 ]
نشرت ورقة BERT الأصلية نتائج توضح أن قدرًا صغيرًا من الضبط الدقيق (لـ BERT LARGE ، ساعة واحدة على 1 Cloud TPU) سمح له بتحقيق أداء متطور في عدد من مهام فهم اللغة الطبيعية : [ 2 ]
- مجموعة مهام GLUE ( تقييم الفهم العام للغة ) (تتكون من 9 مهام)؛
- SQuAD (مجموعة بيانات الإجابة على الأسئلة في جامعة ستانفورد [ 14 ] ) الإصدار 1.1 والإصدار 2.0؛
- SWAG (المواقف مع الأجيال العدائية [ 15 ] ).
في الورقة الأصلية، تم ضبط جميع معلمات BERT بدقة، وأوصي بأنه بالنسبة للتطبيقات اللاحقة التي تتمثل في تصنيف النصوص، [CLS]يتم تغذية رمز الإخراج عند رمز الإدخال إلى طبقة softmax الخطية لإنتاج مخرجات التصنيف. [ 2 ]
عرّفت قاعدة التعليمات البرمجية الأصلية الطبقة الخطية النهائية على أنها "طبقة تجميع"، قياسًا على التجميع العالمي في رؤية الكمبيوتر، على الرغم من أنها ببساطة تتجاهل جميع رموز الإخراج باستثناء الرمز المقابل لـ [CLS]. [ 16 ]
يكلف
تم تدريب BERT على BookCorpus (800 مليون كلمة) ونسخة منقحة من ويكيبيديا الإنجليزية (2500 مليون كلمة) بدون قوائم وجداول وعناوين.
استغرق تدريب نموذج BERT BASE على 4 وحدات TPU سحابية (16 شريحة TPU إجمالاً) 4 أيام، بتكلفة تقديرية قدرها 500 دولار أمريكي. [ 8 ] واستغرق تدريب نموذج BERT LARGE على 16 وحدة TPU سحابية (64 شريحة TPU إجمالاً) 4 أيام. [ 2 ]
تفسير
أدت نماذج اللغة مثل ELMo وGPT-2 وBERT إلى ظهور علم "BERTology"، الذي يسعى إلى تفسير ما تتعلمه هذه النماذج. ولا يزال أداؤها في مهام فهم اللغة الطبيعية غير مفهوم تمامًا. [ 4 ] [ 17 ] [ 18 ] ركزت العديد من المنشورات البحثية في عامي 2018 و2019 على دراسة العلاقة الكامنة وراء مخرجات BERT نتيجةً لتسلسلات الإدخال المختارة بعناية، [ 19 ] [ 20 ] وتحليل تمثيلات المتجهات الداخلية من خلال فحص المصنفات، [ 21 ] [ 22 ] والعلاقات التي تمثلها أوزان الانتباه . [ 17 ] [ 18 ]
يمكن أيضًا عزو الأداء العالي لنموذج BERT إلى تدريبه ثنائي الاتجاه. [ 23 ] وهذا يعني أن BERT، المبني على بنية نموذج Transformer، يُطبّق آلية الانتباه الذاتي لتعلم المعلومات من النص من الجانبين الأيمن والأيسر أثناء التدريب، وبالتالي يكتسب فهمًا عميقًا للسياق. على سبيل المثال، قد تحمل كلمة "fine" معنيين مختلفين حسب السياق ( أشعر أنني بخير اليوم ، لديها شعر أشقر ناعم ). يأخذ BERT في الاعتبار الكلمات المحيطة بكلمة "fine" من الجانبين الأيمن والأيسر.
لكن هذا يأتي بتكلفة: فبسبب اعتماد بنية BERT على المُشفِّر فقط دون مُفكِّك، لا يمكن إدخال بيانات فيه ولا يمكنه توليد نص ، بينما لا تعمل النماذج ثنائية الاتجاه عمومًا بكفاءة دون الجانب الأيمن، مما يجعل إدخال البيانات فيها صعبًا. على سبيل المثال، إذا أراد المرء استخدام BERT لإكمال جملة "اليوم، ذهبتُ إلى"، فسيقوم ببساطة بإخفاء جميع الكلمات لتصبح "اليوم، ذهبتُ إلى [MASK][MASK][MASK]... [MASK]"، حيث يُمثِّل عدد الكلمات [MASK] طول الجملة المراد إكمالها. مع ذلك، يُشكِّل هذا تغييرًا في مجموعة البيانات، إذ لم يسبق لـ BERT، أثناء التدريب، أن رأى جملًا تحتوي على هذا العدد الكبير من الكلمات المخفية. وبالتالي، يتراجع أداؤه. تسمح تقنيات أكثر تطورًا بتوليد النص، ولكن بتكلفة حسابية عالية. [ 24 ]
تاريخ
نُشر نموذج BERT في الأصل من قِبل باحثي جوجل: جاكوب ديفلين، ومينغ-وي تشانغ، وكينتون لي، وكريستينا توتانوفا. يستند تصميمه إلى التدريب المسبق على التمثيلات السياقية، بما في ذلك تعلم التسلسل شبه الموجه [ 25 ] ، والتدريب المسبق التوليدي، و ELMo [ 26 ] ، وULMFit [ 27 ] . على عكس النماذج السابقة، يُعد BERT تمثيلًا لغويًا ثنائي الاتجاه وغير موجه ، يتم تدريبه مسبقًا باستخدام مجموعة نصوص عادية فقط . تُولّد النماذج غير السياقية، مثل word2vec أو GloVe ، تمثيلًا واحدًا لكل كلمة في المفردات، بينما يأخذ BERT السياق في الاعتبار عند كل ظهور لكلمة معينة. على سبيل المثال، بينما سيكون لمتجه كلمة "running" نفس تمثيل متجه word2vec في كلتا الحالتين اللتين وردت فيهما في الجملتين "He is running a company" و "He is running a marathon"، فإن BERT سيقدم تضمينًا سياقيًا يختلف باختلاف الجملة. [ 5 ]
في 25 أكتوبر 2019، أعلنت جوجل عن بدء تطبيق نماذج BERT على استعلامات البحث باللغة الإنجليزية على محرك بحث جوجل في الولايات المتحدة. [ 28 ] وفي 9 ديسمبر 2019، أفادت التقارير بأن جوجل اعتمدت BERT لأكثر من 70 لغة. [ 29 ] [ 30 ] وفي أكتوبر 2020، تمت معالجة جميع استعلامات البحث باللغة الإنجليزية تقريبًا باستخدام نموذج BERT. [ 31 ]
المتغيرات
كانت نماذج BERT مؤثرة وألهمت العديد من المتغيرات.
كان RoBERTa (2019) [ 32 ] تحسينًا هندسيًا. فهو يحافظ على بنية BERT (أكبر قليلاً، حيث يحتوي على 355 مليون معلمة)، ولكنه يحسن تدريبه، ويغير المعلمات الفائقة الرئيسية، ويزيل مهمة التنبؤ بالجملة التالية ، ويستخدم أحجام دفعات صغيرة أكبر بكثير .
كان نموذج XLM-RoBERTa (2019) [ 33 ] نموذجًا متعدد اللغات من نوع RoBERTa. وكان من أوائل الأعمال التي تناولت نمذجة اللغات المتعددة على نطاق واسع.
يُبسّط DistilBERT (2019) نموذج BERT BASE إلى نموذج يحتوي على 60% فقط من معاييره (66 مليونًا)، مع الحفاظ على 95% من نتائجه المعيارية. [ 34 ] [ 35 ] وبالمثل، يُعد TinyBERT (2019) [ 36 ] نموذجًا مُبسّطًا يحتوي على 28% فقط من معاييره.
استخدم ألبرت (2019) [ 37 ] معلمات مشتركة بين الطبقات، وجرّب تغيير حجم الطبقة المخفية وحجم مخرجات طبقة تضمين الكلمات بشكل مستقل كمعلمتين فائقتين. كما استبدل مهمة التنبؤ بالجملة التالية بمهمة التنبؤ بترتيب الجمل ، حيث يجب على النموذج التمييز بين الترتيب الصحيح لجزأين نصيين متتاليين وترتيبهما المعكوس.
طبّقت ELECTRA (2020) [ 38 ] فكرة الشبكات التوليدية التنافسية على مهمة MLM. فبدلاً من إخفاء الرموز، يقوم نموذج لغوي صغير بتوليد بدائل عشوائية معقولة، وتقوم شبكة أكبر بتحديد هذه الرموز المستبدلة. ويهدف النموذج الصغير إلى خداع النموذج الكبير.
يُعدّ نموذج DeBERTa (2020) [ 39 ] نموذجًا معماريًا هامًا، يتميز بفصل آلية الانتباه . وتتمثل فكرته الأساسية في معالجة ترميز الموضع وترميز الرمز بشكل منفصل طوال آلية الانتباه. فبدلاً من دمج ترميز الموضع () وتشفير الرموز () إلى متجه إدخال واحد ()، يحتفظ برنامج DeBERTa بهما منفصلين كزوج مرتب:ثم، في كل طبقة من طبقات الانتباه الذاتي، يقوم DeBERTa بحساب ثلاث مصفوفات انتباه متميزة، بدلاً من مصفوفة الانتباه الواحدة المستخدمة في BERT: [ ملاحظة 1 ]
| نوع الانتباه | نوع الاستعلام | نوع المفتاح | مثال |
|---|---|---|---|
| المحتوى إلى المحتوى | رمز مميز | رمز مميز | "أوروبي"؛ "اتحاد"، "قارة" |
| تحديد موقع المحتوى | رمز مميز | موضع | [صفة]؛ +1، +2، +3 |
| الموقع بالنسبة للمحتوى | موضع | رمز مميز | -1؛ "ليس"، "جداً" |
يتم جمع مصفوفات الانتباه الثلاث معًا عنصرًا بعنصر، ثم يتم تمريرها عبر طبقة softmax وضربها بمصفوفة إسقاط.
يتم تضمين ترميز الموضع المطلق في طبقة الانتباه الذاتي النهائية كمدخل إضافي.
ملحوظات
- ↑ تم حذف نوع الموضع إلى الموضع من قبل المؤلفين لكونه غير مفيد.
مراجع
- ↑ "الإصدار الأولي لـ BERT · google-research/bert@fe35475" . GitHub . مؤرشف من الأصل في 26 مايو 2026. تم الاطلاع عليه في 26 مايو 2026 .
- 1 2 3 4 5 6 ديفلين، جاكوب؛ تشانغ، مينغ-وي؛ لي، كينتون؛ توتانوفا، كريستينا (11 أكتوبر 2018). "BERT: التدريب المسبق للمحولات ثنائية الاتجاه العميقة لفهم اللغة". arXiv : 1810.04805v2 [ cs.CL ].
- ↑ "إتاحة BERT كمصدر مفتوح: أحدث تقنيات التدريب المسبق لمعالجة اللغة الطبيعية" . مدونة جوجل للذكاء الاصطناعي . 2 نوفمبر 2018. تم الاطلاع عليه بتاريخ 27 نوفمبر 2019 .
- 1 2 3 روجرز، آنا؛ كوفاليفا، أولغا؛ رومشيسكي، آنا (2020). "مقدمة في علم BERT: ما نعرفه عن كيفية عمل BERT" . معاملات رابطة اللغويات الحاسوبية . 8 : 842-866 . arXiv : 2002.12327 . doi : 10.1162/tacl_a_00349 . S2CID 211532403 .
- 1 2 إيثاياراج، كاوين (1 سبتمبر 2019)، ما مدى سياقية تمثيلات الكلمات السياقية؟ مقارنة هندسة تضمينات BERT وELMo وGPT-2 ، arXiv : 1909.00512
- ↑ أندرسون، داون (5 نوفمبر 2019). "نظرة معمقة على BERT: كيف أطلق BERT صاروخًا نحو فهم اللغة الطبيعية" . سيرش إنجن لاند . تم الاسترجاع في 6 أغسطس 2024 .
- ^ تشو، يوكون؛ كيروس، ريان؛ زيميل، ريتش؛ صلاح الدينوف، رسلان؛ أورتاسون، راكيل. تورالبا، أنطونيو؛ فيدلر ، سانجا (2015). “محاذاة الكتب والأفلام: نحو تفسيرات مرئية تشبه القصة من خلال مشاهدة الأفلام وقراءة الكتب”. ص 19 – 27. أرخايف : 1506.06724 [ cs.CV ].
- 1 2 3 "BERT" . GitHub . تم الاسترجاع في 28 مارس 2023 .
- ↑ تشانغ، تياني؛ وو، فيليكس؛ كاتيار، أرزو؛ واينبرغر، كيليان كيو؛ أرتزي، يواف (11 مارس 2021)، إعادة النظر في ضبط BERT الدقيق باستخدام عينات قليلة ، arXiv : 2006.05987
- ↑ تورك، يوليا؛ تشانغ، مينغ-وي؛ لي، كينتون؛ توتانوفا، كريستينا (25 سبتمبر 2019)، الطلاب المطلعون جيدًا يتعلمون بشكل أفضل: حول أهمية التدريب المسبق للنماذج المدمجة ، arXiv : 1908.08962
- ↑ "ملخص النماذج - وثائق Transformers 3.4.0" . huggingface.co . تم الاطلاع عليه بتاريخ 16 فبراير 2023 .
- ↑ تاي، يي؛ دهقاني، مصطفى؛ تران، فينه كيو؛ غارسيا، خافيير؛ وي، جيسون؛ وانغ، شوزي؛ تشونغ، هيونغ وون؛ شاكري، سياماك؛ بحري، دارا (28 فبراير 2023)، UL2: توحيد نماذج تعلم اللغة ، arXiv : 2205.05131
- 1 2 تشانغ، أستون؛ ليبتون، زاكاري؛ لي، مو؛ سمولا، ألكسندر ج. (2024). "11.9. التدريب المسبق واسع النطاق باستخدام المحولات" . الغوص في التعلم العميق . كامبريدج، نيويورك، بورت ملبورن، نيودلهي، سنغافورة: مطبعة جامعة كامبريدج. ISBN 978-1-009-38943-3.
- ↑ راجبوركار، براناف؛ تشانغ، جيان؛ لوبيريف، كونستانتين؛ ليانغ، بيرسي (10 أكتوبر 2016). "SQuAD: أكثر من 100000 سؤال لفهم الآلة للنصوص". arXiv : 1606.05250 [ cs.CL ].
- ^ زيلرز، روان. بيسك، يوناتان؛ شوارتز، روي. تشوي ، يجين (15 أغسطس 2018). “SWAG: مجموعة بيانات عدائية واسعة النطاق لاستدلال المنطق السليم”. أرخايف : 1808.05326 [ cs.CL ].
- ↑ "bert/modeling.py at master · google-research/bert" . GitHub . تم الاطلاع عليه في 16 سبتمبر 2024 .
- 1 2 كوفاليفا، أولغا؛ رومانوف، أليكسي؛ روجرز، آنا؛ رومشيسكي، آنا (نوفمبر 2019). "كشف الأسرار الخفية لـ BERT" . وقائع مؤتمر 2019 حول الأساليب التجريبية في معالجة اللغة الطبيعية والمؤتمر الدولي المشترك التاسع حول معالجة اللغة الطبيعية (EMNLP-IJCNLP) . الصفحات 4364-4373 . doi : 10.18653/v1/D19-1445 . S2CID 201645145 .
- 1 2 كلارك، كيفن؛ خانديلوال، أورفاشي؛ ليفي، عمر؛ مانينغ، كريستوفر د. (2019). "ما الذي ينظر إليه BERT؟ تحليل آلية الانتباه في BERT" . وقائع ورشة عمل ACL لعام 2019 بعنوان BlackboxNLP: تحليل وتفسير الشبكات العصبية لمعالجة اللغة الطبيعية . سترودسبيرغ، بنسلفانيا، الولايات المتحدة الأمريكية: رابطة اللغويات الحاسوبية: 276-286 . arXiv : 1906.04341 . doi : 10.18653/v1/w19-4828 .
- ↑ خانديلوال، أورفاشي؛ هي، هي؛ تشي، بينغ؛ جورافسكي، دان (2018). "الوضوح القريب، والغموض البعيد: كيف تستخدم نماذج اللغة العصبية السياق". وقائع الاجتماع السنوي السادس والخمسين لجمعية اللغويات الحاسوبية (المجلد 1: الأوراق البحثية الطويلة) . سترودسبيرغ، بنسلفانيا، الولايات المتحدة الأمريكية: جمعية اللغويات الحاسوبية: 284-294 . arXiv : 1805.04623 . doi : 10.18653/v1/p18-1027 . S2CID 21700944 .
- ↑ غولوردافا، كريستينا؛ بوجانوفسكي، بيوتر؛ غريف، إدوارد؛ لينزن، تال؛ باروني، ماركو (2018). "الشبكات المتكررة الخضراء عديمة اللون تحلم بشكل هرمي". وقائع مؤتمر 2018 لفرع أمريكا الشمالية لجمعية اللغويات الحاسوبية: تقنيات اللغة البشرية، المجلد 1 (أوراق بحثية مطولة) . سترودسبيرغ، بنسلفانيا، الولايات المتحدة الأمريكية: جمعية اللغويات الحاسوبية. الصفحات 1195-1205 . arXiv : 1803.11138 . doi : 10.18653/v1/ n18-1108 . S2CID 4460159 .
- ↑ جوليانيلي، ماريو؛ هاردينغ، جاك؛ مونرت، فلوريان؛ هوبكس، ديوك؛ زويديما، ويليم (2018). "تحت الغطاء: استخدام المصنفات التشخيصية للتحقيق في كيفية تتبع نماذج اللغة لمعلومات الاتفاق وتحسينها". وقائع ورشة عمل EMNLP لعام 2018 بعنوان BlackboxNLP: تحليل وتفسير الشبكات العصبية لمعالجة اللغة الطبيعية . سترودسبيرغ، بنسلفانيا، الولايات المتحدة الأمريكية: رابطة اللغويات الحاسوبية: 240-248 . arXiv : 1808.08079 . doi : 10.18653/v1/w18-5426 . S2CID 52090220 .
- ↑ تشانغ، كيلي؛ بومان، صموئيل (2018). "نمذجة اللغة تُعلّمك أكثر مما تُعلّمه الترجمة: دروس مستفادة من تحليل المهام النحوية المساعدة" . وقائع ورشة عمل EMNLP لعام 2018 بعنوان BlackboxNLP: تحليل وتفسير الشبكات العصبية لمعالجة اللغة الطبيعية . سترودسبيرغ، بنسلفانيا، الولايات المتحدة الأمريكية: رابطة اللغويات الحاسوبية: 359-361 . doi : 10.18653/v1/w18-5448 .
- ↑ سور، شيرانجيب (يناير 2020). "RBN: تحسين التنبؤ بخصائص اللغة باستخدام التمثيل العالمي لتقنية التعلم بنقل اللغة الطبيعية مثل Google BERT" . SN Applied Sciences . 2 (1) 22. doi : 10.1007/s42452-019-1765-9 .
- ↑ باتيل، أجاي؛ لي، برايان؛ محمد صادق رسولي؛ كونستانت، نوح؛ رافيل، كولين؛ كاليسون-بيرش، كريس (2022). "نماذج اللغة ثنائية الاتجاه هي أيضًا متعلمون بأمثلة قليلة". arXiv : 2209.14500 [ cs.LG ].
- ↑ داي، أندرو؛ لي، كوك (4 نوفمبر 2015). "التعلم التسلسلي شبه الخاضع للإشراف". arXiv : 1511.01432 [ cs.LG ].
- ↑ بيترز، ماثيو؛ نيومان، مارك؛ إيير، موهيت؛ غاردنر، مات؛ كلارك، كريستوفر؛ لي، كينتون؛ لوك، زيتلموير (15 فبراير 2018). "تمثيلات الكلمات السياقية العميقة". arXiv : 1802.05365v2 [ cs.CL ].
- ↑ هوارد، جيريمي؛ رودر، سيباستيان (18 يناير 2018). "ضبط نموذج اللغة العالمي لتصنيف النصوص". arXiv : 1801.06146v5 [ cs.CL ].
- ↑ ناياك، باندو (25 أكتوبر 2019). "فهم عمليات البحث بشكل أفضل من أي وقت مضى" . مدونة جوجل . تم الاطلاع عليه في 10 ديسمبر 2019 .
- ↑ "فهم عمليات البحث بشكل أفضل من أي وقت مضى" . جوجل . ٢٥ أكتوبر ٢٠١٩. تم الاطلاع عليه في ٦ أغسطس ٢٠٢٤ .
- ↑ مونتي، روجر (10 ديسمبر 2019). "إطلاق جوجل لتقنية BERT عالميًا" . مجلة محركات البحث . تم الاطلاع عليه بتاريخ 10 ديسمبر 2019 .
- ↑ "جوجل: BERT يُستخدم الآن في كل استعلام باللغة الإنجليزية تقريبًا" . سيرش إنجن لاند . 15 أكتوبر 2020. تم الاطلاع عليه بتاريخ 24 نوفمبر 2020 .
- ↑ ليو، ينهان؛ أوت، مايل؛ غويال، نامان؛ دو، جينغفي؛ جوشي، ماندر؛ تشين، دانكي؛ ليفي، عمر؛ لويس، مايك؛ زيتلموير، لوك؛ ستويانوف، فيسلين (2019). "روبرتا: نهج تدريب مسبق مُحسَّن بشكل قوي لنموذج BERT". arXiv : 1907.11692 [ cs.CL ].
- ^ كونو ، الكسيس. خاندلوال، كارتيكاي؛ جويال، نعمان؛ تشودري، فيشرف؛ وينزك، غيوم. جوزمان، فرانسيسكو؛ قبر إدوارد. أوت، مايل. زيتليموير، لوقا؛ ستويانوف ، فيسيلين (2019). “تعلم التمثيل عبر اللغات غير الخاضع للرقابة على نطاق واسع”. أرخايف : 1911.02116 [ cs.CL ].
- ↑ سان، فيكتور؛ ديبوت، ليساندر؛ شوموند، جوليان؛ وولف، توماس (29 فبراير 2020)، DistilBERT، نسخة مُصغّرة من BERT: أصغر حجمًا وأسرع وأرخص وأخف وزنًا ، arXiv : 1910.01108
- ↑ "DistilBERT" . huggingface.co . تم الاطلاع عليه بتاريخ 5 أغسطس 2024 .
- ^ جياو، شياو تشي؛ يين، ييتشون؛ شانغ، ليفينج؛ جيانغ، شين؛ تشن، شياو. لي لينلين. وانغ، فانغ. ليو، كون (15 أكتوبر 2020)، TinyBERT: تقطير BERT لفهم اللغة الطبيعية ، أرخايف : 1909.10351
- ↑ لان، تشنزونغ؛ تشين، مينغدا؛ غودمان، سيباستيان؛ جيمبل، كيفن؛ شارما، بيوش؛ سوريكوت، رادو (8 فبراير 2020)، ألبرت: نموذج BERT خفيف للتعلم الذاتي لتمثيلات اللغة ، arXiv : 1909.11942
- ↑ كلارك، كيفن؛ لونغ، مينه-ثانغ؛ لي، كوك ف.؛ مانينغ، كريستوفر د. (23 مارس 2020)، إلكترا: التدريب المسبق لمشفرات النصوص كمميزين بدلاً من مولدين ، arXiv : 2003.10555
- ^ هو، بنغتشنغ؛ ليو، شياو دونغ؛ جاو، جيان فنغ؛ تشين ، ويتشو (6 أكتوبر 2021) ، DeBERTa: BERT المحسّن لفك التشفير مع انتباه منفصل ، أرخايف : 2006.03654
للمزيد من القراءة
- روغرز، آنا؛ كوفاليفا، أولغا؛ رومشيسكي، آنا (2020). "مقدمة في علم BERT: ما نعرفه عن كيفية عمل BERT". arXiv : 2002.12327 [ cs.CL ].
روابط خارجية
- برنامج جوجل
- نماذج لغوية كبيرة
- برامج 2018
- 2018 في مجال الذكاء الاصطناعي
