الشنشيلة (نموذج اللغة)

Chinchilla هي عائلة من نماذج اللغة الكبيرة (LLMs) التي طورها فريق البحث في Google DeepMind ، وتم تقديمها في مارس 2022. [ 1 ]

نماذج

يُطلق عليه اسم " شينشيلا " لأنه تطويرٌ لنموذج سابق يُدعى "غوفر". وقد تم تدريب كلا النموذجين بهدف دراسة قوانين التوسع في نماذج اللغة الكبيرة . [ 2 ]

ادّعى هذا النموذج تفوّقه على GPT-3 . فهو يُبسّط استخدامه بشكل كبير في المراحل اللاحقة، إذ يتطلب قدرة حاسوبية أقل بكثير للاستدلال والضبط الدقيق. وبناءً على تدريب نماذج لغوية سابقة، تبيّن أنه عند مضاعفة حجم النموذج، يجب مضاعفة عدد رموز التدريب. وقد استُخدمت هذه الفرضية لتدريب Chinchilla بواسطة DeepMind. وعلى غرار Gopher من حيث التكلفة، يحتوي Chinchilla على 70 مليار مُعامل وأربعة أضعاف البيانات (1.4 تريليون رمز مقابل 300 مليار). [ 3 ]

حققت شينشيلا دقة متوسطة بلغت 67.5% في اختبار قياس فهم اللغة متعددة المهام واسعة النطاق (MMLU)، أي أعلى بنسبة 7% من أداء غوفر. وكانت شينشيلا لا تزال في مرحلة الاختبار حتى 12 يناير 2023. [ 4 ]

يُساهم مشروع Chinchilla في تطوير نموذج تدريب فعّال لنماذج اللغة الانحدارية الذاتية الكبيرة ذات الموارد الحاسوبية المحدودة. ويوصي فريق Chinchilla بمضاعفة عدد رموز التدريب مع كل مضاعفة لحجم النموذج، ما يعني أن استخدام مجموعات بيانات تدريب أكبر وأعلى جودة يُمكن أن يُحسّن نتائج المهام اللاحقة. [ 5 ] [ 6 ]

وقد تم استخدامه في نموذج فلامينغو للرؤية واللغة . [ 7 ]

بنيان

تُعد كل من عائلة Gopher وعائلة Chinchilla من عائلات نماذج المحولات .

على وجه الخصوص، تُعدّ هذه النماذج مُشابهة لنموذج GPT-2 ، مع اختلافات طفيفة في الحجم وتعديلات بسيطة. تستخدم عائلة Gopher تقنية RMSNorm بدلاً من LayerNorm ، والترميز الموضعي النسبي بدلاً من الترميز الموضعي المطلق. أما عائلة Chinchilla فهي مُشابهة لعائلة Gopher، ولكنها مُدرّبة باستخدام مُحسِّن AdamW بدلاً من مُحسِّن Adam .

تضم عائلة غوفر ستة نماذج ذات أحجام متزايدة، تتراوح من 44 مليون مُعامل إلى 280 مليار مُعامل. ويُشار إلى أكبرها باسم "غوفر" افتراضيًا. وتُطبق اصطلاحات تسمية مماثلة على عائلة شينشيلا.

يُظهر الجدول 1 من [ 2 ] عائلة غوفر بأكملها:

مواصفات نموذج عائلة غوفر
عدد المعلماتالطبقاتعدد الرؤوسحجم المفتاح/القيمةالبعد الداخليماكس ليرنينج 1حجم الدفعة
44 مليون816325126 × 10 −40.25 مليون
117 مليون1212647686 × 10 −40.25 مليون
417 مليون121212815362 × 10 −40.25 مليون
1.4 مليار241612820482 × 10 −40.25 مليون
7.1B323212840961.2 × 10 −42 مليون
جوفر 280ب80128128163844 × 10 −53 أشهر ← 6 أشهر

الجدول 4 من [ 1 ] يقارن بين Chinchilla ذات 70 مليار معلمة و Gopher 280B.

مقارنة بين الشنشيلة والجرذ الغوفر
عدد المعلماتالطبقاتعدد الرؤوسحجم المفتاح/القيمةالبعد الداخليماكس ليرنينج 1حجم الدفعة
جوفر 280ب80128128163844 × 10 −53 أشهر ← 6 أشهر
شينشيلا 70B806412881921 × 10 −41.5 مليون → 3 مليون

انظر أيضاً

مراجع

  1. 1 2 هوفمان، الأردن؛ بورجود، سيباستيان. مينش، آرثر. بوشاتسكايا، إيلينا؛ كاي، تريفور. رذرفورد، إليزا؛ كاساس، دييغو دي لاس؛ هندريكس، ليزا آن؛ ويلبل، يوهانس؛ كلارك، ايدان. هينيجان، توم؛ نولاند، اريك. ميليكان، كاتي. دريش، جورج فان دن؛ داموك، بوجدان (2022-03-29). “تدريب نماذج اللغة الكبيرة الأمثل للحوسبة”. أرخايف : 2203.15556 [ cs.CL ].
  2. 1 2 راي، جاك دبليو؛ بورجود، سيباستيان؛ كاي، تريفور؛ ميليكان، كاتي؛ هوفمان، جوردان؛ سونغ، فرانسيس؛ أسلانيدس، جون؛ هندرسون، سارة؛ رينغ، رومان؛ يونغ، سوزانا؛ روثرفورد، إليزا؛ هينيغان، توم؛ مينيك، جاكوب؛ كاسيرر، ألبين؛ باول، ريتشارد (2022-01-21). "توسيع نطاق نماذج اللغة: الأساليب والتحليل والرؤى من تدريب غوفر". arXiv : 2112.11446 [ cs.CL ].
  3. إلياجيك، إيراي (12 يناير 2023). "ذكاء شينشيلا الاصطناعي قادم لعرش GPT-3" . داتاكونومي . مؤرشف من الأصل في 26 مارس 2023.
  4. هندريكس، دان (14 مارس 2023)، قياس فهم اللغة متعدد المهام على نطاق واسع ، مؤرشف من الأصل في 15 مارس 2023 ، تم استرجاعه في 15 مارس 2023
  5. تشايثالي، ج. (9 أبريل 2022). "اطلع على نموذج اللغة الجديد من ديب مايند، شينشيلا (70 مليار مُعامل)، الذي يتفوق بشكل ملحوظ على غوفر (280 مليار) وجي بي تي-3 (175 مليار) في مجموعة واسعة من مهام التقييم اللاحقة" . مؤرشف من الأصل في 27 مارس 2023. تم الاطلاع عليه في 15 يناير 2023 .
  6. والي، كارتيك (12 أبريل 2022). "ديب مايند تطلق منافسًا لـ GPT-3، شينشيلا" . مجلة أناليتكس إنديا . مؤرشف من الأصل في 26 مارس 2023. تم الاطلاع عليه في 15 يناير 2023 .
  7. ألايراك، جان بابتيست؛ دوناهو، جيف؛ لوك، بولين؛ ميش، أنطوان؛ بار، إيان؛ حسون، يانا؛ لينس، كاريل؛ مينش، آرثر؛ ميليكان، كاثرين؛ رينولدز، مالكولم؛ رينغ، رومان؛ رذرفورد، إليزا؛ كابي، سيركان؛ هان، تينغدا؛ غونغ، زيتاو (2022-12-06). "فلامينغو: نموذج لغوي مرئي للتعلم باستخدام عدد قليل من الأمثلة" . التقدم في أنظمة معالجة المعلومات العصبية . 35 : 23716-23736 . arXiv : 2204.14198 .