مزيج من الخبراء

مزيج الخبراء ( MoE ) هو أسلوب من أساليب التعلم الآلي ، حيث تُستخدم فيه شبكات خبراء متعددة (متعلمين) لتقسيم مساحة المشكلة إلى مناطق متجانسة. [ 1 ] يُمثل مزيج الخبراء شكلاً من أشكال التعلم الجماعي . [ 2 ] وقد سُميت أيضاً بآلات اللجان . [ 3 ]

النظرية الأساسية

يحتوي نظام إدارة التعليم دائمًا على المكونات التالية، ولكن يتم تنفيذها ودمجها بشكل مختلف وفقًا للمشكلة التي يتم حلها:

  • خبراءو1،...،ون{\displaystyle f_{1},...,f_{n}}، كل منها يأخذ نفس المدخلاتx{\displaystyle x}وإنتاج المخرجاتو1(x)،...،ون(x){\displaystyle f_{1}(x),...,f_{n}(x)}.
  • دالة الترجيح (المعروفة أيضًا باسم دالة البوابة)w{\displaystyle w}، والذي يأخذ المدخلاتx{\displaystyle x}وينتج متجهًا من المخرجات(w(x)1،...،w(x)ن){\displaystyle (w(x)_{1},...,w(x)_{n})}قد يكون هذا توزيعًا احتماليًا أو لا، ولكن في كلتا الحالتين، تكون مدخلاته غير سالبة.
  • θ=(θ0،θ1،...،θن){\displaystyle \theta =(\theta _{0},\theta _{1},...,\theta _{n})}هي مجموعة المعاملات. المعاملθ0{\displaystyle \theta _{0}}يُستخدم هذا لوظيفة الترجيح. المعاملاتθ1،...،θن{\displaystyle \theta _{1},\dots ,\theta _{n}}هذه مخصصة للمختصين.
  • بفرض مدخلاتx{\displaystyle x}ينتج عن مزيج الخبراء مخرج واحد من خلال الجمع بينو1(x)،...،ون(x){\displaystyle f_{1}(x),...,f_{n}(x)}وفقًا للأوزانw(x)1،...،w(x)ن{\displaystyle w(x)_{1},...,w(x)_{n}}بطريقة ما، عادة عن طريقو(x)=أناw(x)أناوأنا(x){\displaystyle f(x)=\sum _{i}w(x)_{i}f_{i}(x)}.

يتم تدريب كل من الخبراء ودالة الترجيح عن طريق تقليل دالة خسارة معينة ، عادةً باستخدام خوارزمية التدرج الهبوطي . وهناك حرية كبيرة في اختيار الشكل الدقيق للخبراء، ودالة الترجيح، ودالة الخسارة.

شبكة ميتا باي

تستخدم شبكة ميتا-باي، التي أوردها هامبشاير وويبيل، [ 4 ]و(x)=أناw(x)أناوأنا(x){\displaystyle f(x)=\sum _{i}w(x)_{i}f_{i}(x)}كمخرج. يتم تدريب النموذج عن طريق تطبيق خوارزمية التدرج الهبوطي على دالة خسارة متوسط ​​مربع الخطأ.ل:=1شمالكyك-و(xك)2{\displaystyle L:={\frac {1}{N}}\sum _{k}\|y_{k}-f(x_{k})\|^{2}}قد تكون وظائف الخبراء وظائف اعتباطية.

في منشورهم الأصلي، كانوا يحلون مشكلة تصنيف الأصوات في الإشارات الصوتية لستة متحدثين يابانيين مختلفين، اثنتان من الإناث وأربعة من الذكور. قاموا بتدريب ستة خبراء، كل منهم عبارة عن "شبكة عصبية متأخرة زمنيًا" [ 5 ] (وهي في الأساس شبكة التفاف متعددة الطبقات على مخطط الطيف الصوتي ). ووجدوا أن مزيج الخبراء الناتج خصص خمسة خبراء لخمسة من المتحدثين، لكن المتحدث السادس (ذكر) لم يكن لديه خبير مخصص، بل تم تصنيف صوته من خلال توليفة خطية من خبراء المتحدثين الذكور الثلاثة الآخرين.

مزيج تكيفي من الخبراء المحليين

تستخدم نماذج المزج التكيفي للخبراء المحليين [ 6 ] [ 7 ] نموذج مزيج غاوسي . يتنبأ كل خبير ببساطة بتوزيع غاوسي، ويتجاهل المدخلات تمامًا. على وجه التحديد،أنا{\displaystyle i}يتوقع الخبير رقم - أن يكون الناتج هوyشمال(μأنا،أنا){\displaystyle y\sim N(\mu _{i},I)}، أينμأنا{\displaystyle \mu _{i}}هو مُعامل قابل للتعلم. دالة الترجيح هي دالة خطية من نوع سوفتماكس:w(x)أنا=هـكأناتيx+بأناجهـكجتيx+بج{\displaystyle w(x)_{i}={\frac {e^{k_{i}^{T}x+b_{i}}}{\sum _{j}e^{k_{j}^{T}x+b_{j}}}}}يتوقع فريق الخبراء أن يتم توزيع الناتج وفقًا لدالة كثافة الاحتمال اللوغاريتمي:lnوθ(y|x)=ln[أناهـكأناتيx+بأناجهـكجتيx+بجشمال(y|μأنا،أنا)]=ln[(2π)-د/2أناهـكأناتيx+بأناجهـكجتيx+بجهـ-12y-μأنا2]{\displaystyle \ln f_{\theta }(y|x)=\ln \left[\sum _{i}{\frac {e^{k_{i}^{T}x+b_{i}}}{\sum _{j}e^{k_{j}^{T}x+b_{j}}}}N(y|\mu _{i},I)\right]=\ln \left[(2\pi )^{-d/2}\sum _{i}{\frac {e^{k_{i}^{T}x+b_{i}}}{\sum _{j}e^{k_{j}^{T}x+b_{j}}}}e^{-{\frac {1}{2}}\|y-\mu _{i}\|^{2}}\right]}يتم تدريبها عن طريق تقدير الاحتمالية القصوى، أي صعود التدرج علىو(y|x){\displaystyle f(y|x)}. تدرج لـأنا{\displaystyle i}الخبير رقم - هو

μأناlnوθ(y|x)=w(x)أناشمال(y|μأنا،أنا)جw(x)جشمال(y|μج،أنا)(y-μأنا){\displaystyle \nabla _{\mu _{i}}\ln f_{\theta }(y|x)={\frac {w(x)_{i}N(y|\mu _{i},I)}{\sum _{j}w(x)_{j}N(y|\mu _{j},I)}}\;(y-\mu _{i})}

وتدرج دالة الترجيح هو[كأنا،بأنا]lnوθ(y|x)=[x1]w(x)أناجw(x)جشمال(y|μج،أنا)(وأنا(x)-وθ(y|x)){\displaystyle \nabla _{[k_{i},b_{i}]}\ln f_{\theta }(y|x)={\begin{bmatrix}x\\1\end{bmatrix}}{\frac {w(x)_{i}}{\sum _{j}w(x)_{j}N(y|\mu _{j},I)}}(f_{i}(x)-f_{\theta }(y|x))}

لكل زوج من المدخلات والمخرجات(x،y){\displaystyle (x,y)}يتم تعديل دالة الترجيح لزيادة وزن جميع الخبراء الذين أدوا أداءً أعلى من المتوسط، وتقليل وزن جميع الخبراء الذين أدوا أداءً أقل من المتوسط. وهذا يشجع دالة الترجيح على التعلم لاختيار الخبراء الذين يقدمون تنبؤات صحيحة لكل مدخل.

الأنا{\displaystyle i}تم تغيير الخبير رقم -th لجعل توقعاته أقرب إلىy{\displaystyle y}لكن مقدار التغيير يتناسب معw(x)أناشمال(y|μأنا،أنا){\displaystyle w(x)_{i}N(y|\mu _{i},I)}هذا له تفسير بايزي. بالنظر إلى المدخلاتx{\displaystyle x}، الاحتمال المسبق الذي قد يكون عليه الخبيرأنا{\displaystyle i}هو الشخص الصحيحw(x)أنا{\displaystyle w(x)_{i}}، وشمال(y|μأنا،أنا){\displaystyle N(y|\mu _{i},I)}احتمال وجود دليلy{\displaystyle y}. لذا،w(x)أناشمال(y|μأنا،أنا)جw(x)جشمال(y|μج،أنا){\displaystyle {\frac {w(x)_{i}N(y|\mu _{i},I)}{\sum _{j}w(x)_{j}N(y|\mu _{j},I)}}}الاحتمال اللاحق للخبيرأنا{\displaystyle i}وبالتالي فإن معدل التغير لـأنا{\displaystyle i}يتناسب الخبير رقم -th مع احتماله اللاحق.

بمعنى آخر، يُطلب من الخبراء الذين بدا، بعد فوات الأوان، أنهم خبراء جيدون للاستشارة، أن يتعلموا من هذا المثال. أما الخبراء الذين لم يكونوا كذلك، فيُتركون وشأنهم.

يتمثل التأثير المُجتمَع في تخصص الخبراء: لنفترض أن خبيرين بارعين في التنبؤ بنوع معين من المدخلات، لكن أحدهما أفضل قليلاً، فإن دالة الترجيح ستتعلم في النهاية تفضيل الخبير الأفضل. بعد ذلك، يعجز الخبير الأقل كفاءة عن الحصول على إشارة تدرج عالية، ويصبح أداؤه أسوأ في التنبؤ بهذا النوع من المدخلات. في المقابل، قد يتحسن أداء الخبير الأقل كفاءة في التنبؤ بأنواع أخرى من المدخلات، وينجذب تدريجيًا إلى مجال آخر. وهذا يُحدث تأثيرًا ارتداديًا إيجابيًا، يدفع كل خبير إلى الابتعاد عن البقية والاهتمام بمنطقة محلية بمفرده (ومن هنا جاء مصطلح " الخبراء المحليين ").

وزارة التعليم الهرمية

تستخدم نماذج مزيج الخبراء الهرمية [ 8 ] [ 9 ] مستويات متعددة من البوابات في شجرة. كل بوابة هي توزيع احتمالي على المستوى التالي من البوابات، ويتواجد الخبراء على العقد الطرفية للشجرة. وهي تشبه أشجار القرار .

على سبيل المثال، سيكون لنموذج MoE الهرمي ذي المستويين وظيفة بوابية من الدرجة الأولىwأنا{\displaystyle w_{i}}ووظائف البوابات من الدرجة الثانيةwج|أنا{\displaystyle w_{j|i}}والخبراءوج|أنا{\displaystyle f_{j|i}}إذن، يكون التوقع الكلي هوأناwأنا(x)جwج|أنا(x)وج|أنا(x){\displaystyle \sum _{i}w_{i}(x)\sum _{j}w_{j|i}(x)f_{j|i}(x)}.

المتغيرات

يمكن تدريب نموذج مزيج الخبراء، المشابه لنموذج مزيج غاوسي، باستخدام خوارزمية التوقع والتعظيم، تمامًا كما هو الحال مع نماذج مزيج غاوسي . فعلى وجه التحديد، خلال خطوة التوقع، يتم توزيع "عبء" تفسير كل نقطة بيانات على الخبراء، وخلال خطوة التعظيم، يتم تدريب الخبراء لتحسين التفسيرات التي حظيت بعبء كبير، بينما يتم تدريب البوابة لتحسين توزيع العبء عليها. ويمكن لهذا أن يتقارب بشكل أسرع من خوارزمية التدرج الصاعد على دالة الاحتمال اللوغاريتمي. [ 9 ] [ 10 ]

غالباً ما يتم اختيار دالة البوابات softmax. بالإضافة إلى ذلك، قد تستخدم البوابات التوزيعات الغاوسية [ 11 ] والعائلات الأسية [ 10 ] .

بدلاً من إجراء عملية جمع مرجحة لجميع الخبراء، في منهجية التقييم الصعبة [ 12 ] يتم اختيار الخبير الأعلى تصنيفاً فقط. أي،و(x)=وargالأعلىأناwأنا(x)(x){\displaystyle f(x)=f_{\arg \max _{i}w_{i}(x)}(x)}وهذا من شأنه أن يسرع وقت التدريب والاستدلال. [ 13 ]

يمكن للخبراء استخدام أشكال أكثر عمومية من التوزيعات الغاوسية متعددة المتغيرات. على سبيل المثال، اقترح [ 8 ]وأنا(y|x)=شمال(y|أأناx+بأنا،Σأنا){\displaystyle f_{i}(y|x)=N(y|A_{i}x+b_{i},\Sigma _{i})}، أينأأنا،بأنا،Σأنا{\displaystyle A_{i},b_{i},\Sigma _{i}}هي معلمات قابلة للتعلم. بعبارة أخرى، يتعلم كل خبير كيفية إجراء الانحدار الخطي، مع تقدير قابل للتعلم لعدم اليقين.

يمكن استخدام خبراء مختلفين عن التوزيعات الغاوسية. على سبيل المثال، يمكن استخدام توزيع لابلاس [ 14 ] أو توزيع t للطالب [ 15 ] . وللتصنيف الثنائي، تم اقتراح خبراء الانحدار اللوجستي أيضًا.وأنا(y|x)={11+هـβأناتيx+βأنا،0،y=01-11+هـβأناتيx+βأنا،0،y=1{\displaystyle f_{i}(y|x)={\begin{cases}{\frac {1}{1+e^{\beta _{i}^{T}x+\beta _{i,0}}}},&y=0\\1-{\frac {1}{1+e^{\beta _{i}^{T}x+\beta _{i,0}}}},&y=1\end{cases}}}أينβأنا،βأنا،0{\displaystyle \beta _{i},\beta _{i,0}}هي معلمات قابلة للتعلم. ويتم تعميم ذلك لاحقًا لتصنيف متعدد الفئات، مع خبراء الانحدار اللوجستي متعدد الحدود . [ 16 ]

اقترحت إحدى الدراسات استخدام مزيج من دوال softmax لنمذجة اللغة التراجعية الذاتية. [ 17 ] على وجه التحديد، لنفترض نموذج لغة يعتمد على نص سابقج{\displaystyle c}، يتنبأ بالكلمة التاليةx{\displaystyle x}تقوم الشبكة بتشفير النص إلى متجهvج{\displaystyle v_{c}}ويتنبأ بتوزيع احتمالية الكلمة التالية على النحو التالي:Soوتمأx(vجدبليو){\displaystyle \mathrm {Softmax} (v_{c}W)}لمصفوفة التضميندبليو{\displaystyle W}في نموذج مزيج من دوال softmax، يُخرج النموذج متجهات متعددة.vج،1،...،vج،ن{\displaystyle v_{c,1},\dots ,v_{c,n}}وتوقع الكلمة التالية على النحو التالي:أنا=1نصأناSoوتمأx(vج،أنادبليوأنا){\displaystyle \sum _{i=1}^{n}p_{i}\;\mathrm {Softmax} (v_{c,i}W_{i})}، أينصأنا{\displaystyle p_{i}}هو توزيع احتمالي ناتج عن عملية دالة سوفتماكس الخطية على تنشيطات الخلايا العصبية المخفية داخل النموذج. وقد أثبتت الورقة البحثية الأصلية فعاليته للشبكات العصبية المتكررة . وتبين لاحقًا أنه يعمل مع شبكات المحولات أيضًا. [ 18 ]

التعلم العميق

وصف القسم السابق نموذج MoE كما كان يُستخدم قبل عصر التعلم العميق . بعد التعلم العميق، وجد نموذج MoE تطبيقات في تشغيل أكبر النماذج، كطريقة بسيطة لإجراء حسابات مشروطة : حيث تُستخدم أجزاء فقط من النموذج، ويتم اختيار هذه الأجزاء وفقًا للمدخلات. [ 19 ]

يعود تاريخ أول ورقة بحثية تُطبّق نموذج MoE على التعلّم العميق إلى عام 2013، [ 20 ] حيث اقترحت استخدام شبكة بوابات مختلفة في كل طبقة من طبقات الشبكة العصبية العميقة. تحديدًا، كل بوابة هي شبكة خطية ReLU-خطية softmax، وكل خبير هو شبكة خطية ReLU. ولأن مخرجات البوابات ليست متفرقة ، فإن جميع مخرجات الخبراء مطلوبة، ولا يتم إجراء أي حسابات شرطية.

الهدف الرئيسي من استخدام منهجية الخبراء المتعددة (MoE) في التعلم العميق هو تقليل تكلفة الحوسبة. ولذلك، لكل استعلام، يجب استعلام مجموعة فرعية صغيرة فقط من الخبراء. هذا ما يميز منهجية الخبراء المتعددة في التعلم العميق عن منهجية الخبراء المتعددة التقليدية. ففي منهجية الخبراء المتعددة التقليدية، يكون ناتج كل استعلام عبارة عن مجموع مرجح لمخرجات جميع الخبراء. أما في منهجية الخبراء المتعددة في التعلم العميق، فلا يمكن أن يتضمن ناتج كل استعلام إلا مخرجات عدد قليل من الخبراء. وبالتالي، يصبح التوجيه هو الخيار التصميمي الرئيسي في منهجية الخبراء المتعددة: أي كيفية توجيه مجموعة من الاستعلامات إلى أفضل الخبراء.

طبقة MoE ذات بوابات متفرقة

تستخدم طبقة MoE ذات البوابات المتفرقة [ 21 ] ، التي نشرها باحثون من Google Brain ، شبكات التغذية الأمامية كخبراء، وبوابات softmax الخطية. على غرار طبقة MoE الصلبة المقترحة سابقًا، تحقق هذه الطبقة التفرق من خلال مجموع مرجح لأفضل k خبير فقط، بدلًا من المجموع المرجح لجميع الخبراء. تحديدًا، تحتوي طبقة MoE على شبكات تغذية أمامية .و1،...،ون{\displaystyle f_{1},...,f_{n}}وشبكة بواباتw{\displaystyle w}يتم تعريف شبكة البوابات بواسطةw(x)=soوتمأx(تoصك(دبليوx+ضوضاء)){\displaystyle w(x)=\mathrm {softmax} (\mathrm {top} _{k}(Wx+{\text{noise}}))}، أينتoصك{\displaystyle \mathrm {top} _{k}}هي دالة تحافظ على أول k عنصر من عناصر المتجه كما هي، ولكنها تُعيّن جميع العناصر الأخرى إلى-{\displaystyle -\infty }. إضافة الضوضاء تساعد في موازنة الأحمال.

اختيارك{\displaystyle k}هو مُعامل فائق يتم اختياره وفقًا للتطبيق. القيم النموذجية هيك=1،2{\displaystyle k=1,2}. الك=1{\displaystyle k=1}يُطلق على هذا الإصدار أيضًا اسم Switch Transformer. تم تطبيق Switch Transformer الأصلي على نموذج لغة T5 . [ 22 ]

كمثال توضيحي، قاموا بتدريب سلسلة من نماذج الترجمة الآلية باستخدام طبقات متناوبة من MoE و LSTM ، وقارنوها بنماذج LSTM العميقة. [ 23 ] يوضح الجدول 3 أن نماذج MoE استخدمت وقتًا أقل في حساب الاستدلال، على الرغم من احتوائها على 30 ضعفًا من المعلمات.

نُشرت هذه الوحدة المعمارية في يناير 2017، بعد بضعة أشهر من نشر بنية Transformer (12 يونيو 2017)، ثم جُمعت في بنية متعددة الوسائط تُسمى MultiModel نُشرت بعد أربعة أيام (16 يونيو 2017). [ 24 ]

موازنة الأحمال

غالبًا ما تواجه أنظمة إدارة الخبرة التقليدية (MoE) مشاكل في موازنة الأحمال: حيث يُستشار بعض الخبراء بشكل متكرر، بينما يُستشار خبراء آخرون نادرًا أو لا يُستشارون على الإطلاق. ولتشجيع البوابة على اختيار كل خبير بنفس التواتر (موازنة الأحمال المناسبة) ضمن كل دفعة، تحتوي كل طبقة من طبقات إدارة الخبرة على دالتين مساعدتين للخسارة. وقد تم تحسين ذلك بواسطة محول التبديل [ 22 ] ليصبح دالة مساعدة واحدة للخسارة. تحديدًا، لنفترضن{\displaystyle n}ليكن عدد الخبراء، ثم بالنسبة لمجموعة معينة من الاستفسارات{x1،x2،...،xتي}{\displaystyle \{x_{1},x_{2},...,x_{T}\}}، الخسارة الإضافية للدفعة هينأنا=1نوأناPأنا{\displaystyle n\sum _{i=1}^{n}f_{i}P_{i}}هنا،وأنا=1تي8(تم إرسال الاستفسارات إلى الخبير أنا){\displaystyle f_{i}={\frac {1}{T}}\#({\text{queries sent to expert }}i)}هي نسبة الرموز المميزة التي اختارت الخبيرأنا{\displaystyle i}، وPأنا=1تيج=1تيwأنا(xج)أناخبراءwأنا(xج){\displaystyle P_{i}={\frac {1}{T}}\sum _{j=1}^{T}{\frac {w_{i}(x_{j})}{\sum _{i'\in {\text{experts}}}w_{i'}(x_{j})}}}يمثل جزء الوزن على الخبيرأنا{\displaystyle i}يتم تقليل هذه الخسارة إلى الحد الأدنى عند1{\displaystyle 1}، تحديداً عندما يكون لكل خبير وزن متساوٍ1/ن{\displaystyle 1/n}في جميع الحالات.

بنية DeepSeek MoE. يظهر أيضًا MLA، وهو أحد أنواع آليات الانتباه في Transformer. [ 25 ] : الشكل 2

صمّم باحثون في شركة DeepSeek نسخةً معدّلة من نموذج MoE، تتضمن "خبراء مشتركين" يتمّ الاستعلام عنهم باستمرار، و"خبراء موجّهين" قد لا يتمّ الاستعلام عنهم. ووجدوا أن موازنة الأحمال القياسية تشجع على استشارة الخبراء بالتساوي، لكن هذا يؤدي إلى تكرار الخبراء لنفس القدرات الأساسية، مثل قواعد اللغة الإنجليزية. واقترحوا أن يتعلّم الخبراء المشتركون القدرات الأساسية التي تُستخدم بكثرة، وأن يتعلّم الخبراء الموجّهون القدرات الثانوية التي نادراً ما تُستخدم. [ 26 ]

كما اقترحوا "استراتيجية موازنة الأحمال الخالية من الفقد الإضافي"، والتي لا تستخدم الفقد الإضافي. بدلاً من ذلك، كل خبيرأنا{\displaystyle i}يحتوي على "تحيز إضافي من جانب الخبراء"بأنا{\displaystyle b_{i}}إذا تم تجاهل خبير، فإن تحيزه يزداد، والعكس صحيح. أثناء تخصيص الرموز، يختار كل رمز أفضل k خبير، ولكن مع إضافة التحيز. أي: [ 27 ]و(x)=أنا يقع ضمن أفضل k من {w(x)ج+بج}جw(x)أناوأنا(x){\displaystyle f(x)=\sum _{i{\text{ is in the top-k of }}\{w(x)_{j}+b_{j}\}_{j}}w(x)_{i}f_{i}(x)}لاحظ أن تحيز الخبراء مهم في اختيار الخبراء، ولكن ليس في جمع ردود الخبراء.

عامل السعة

لنفترض أن هناكن{\displaystyle n}خبراء في طبقة. لمجموعة معينة من الاستفسارات{x1،x2،...،xتي}{\displaystyle \{x_{1},x_{2},...,x_{T}\}}يتم توجيه كل استعلام إلى خبير واحد أو أكثر. على سبيل المثال، إذا تم توجيه كل استعلام إلى خبير واحد كما هو الحال في محولات التبديل، وإذا كان الخبراء موزعين بالتساوي على مستوى الأحمال، فيجب أن يتوقع كل خبير في المتوسطتي/ن{\displaystyle T/n}يتم إرسال الاستعلامات في دفعة واحدة. عمليًا، لا يمكن للخبراء توقع توازن مثالي في توزيع الأحمال: ففي بعض الدفعات، قد يكون أحد الخبراء أقل إرهاقًا، بينما في دفعات أخرى، قد يكون أكثر إرهاقًا.

بما أن المدخلات لا يمكنها الانتقال عبر الطبقة حتى ينتهي كل خبير فيها من الاستعلامات المخصصة له، فإن موازنة الأحمال أمر بالغ الأهمية. ويُستخدم عامل السعة أحيانًا لفرض قيد صارم على موازنة الأحمال، حيث يُسمح لكل خبير بمعالجة ما يصل إلىجتي/ن{\displaystyle c\cdot T/n}الاستعلامات في دفعة واحدة. وجد تقرير وزارة التعليم أنج[1.25،2]{\displaystyle c\in [1.25,2]}لتحقيق نتائج جيدة في الممارسة العملية. [ 28 ]

التوجيه

في نموذج MoE الأصلي ذي البوابات المتفرقة، يتم استطلاع آراء أفضل k خبير فقط، وتُجمع مخرجاتهم بوزن مُرجّح. توجد طرق أخرى. [ 28 ] بشكل عام، يُعد التوجيه مسألة تخصيص : كيف يتم تخصيص الرموز للخبراء، بحيث تُراعى مجموعة متنوعة من القيود (مثل الإنتاجية، وموازنة الأحمال، وما إلى ذلك)؟ توجد عادةً ثلاث فئات من خوارزميات التوجيه: اختيار الخبراء للرموز ("اختيار الخبراء")، [ 29 ] واختيار الرموز للخبراء (نموذج MoE الأصلي ذو البوابات المتفرقة)، ومُخصِّص عالمي يُطابق الخبراء والرموز. [ 30 ]

أثناء عملية الاستدلال، يعمل نموذج MoE على مجموعة كبيرة من الرموز في أي وقت. إذا كانت الرموز هي التي تختار الخبراء، فقد يحصل بعض الخبراء على عدد قليل من الرموز، بينما يحصل آخرون على عدد كبير منها يتجاوز الحد الأقصى لحجم المجموعة المخصصة لهم، مما يضطرهم إلى تجاهل بعضها. وبالمثل، إذا كان الخبراء هم من يختارون الرموز، فقد لا يختار أي خبير بعض الرموز. هذه هي مشكلة "فقدان الرموز". لا يُعد فقدان الرمز بالضرورة مشكلة خطيرة، ففي نماذج Transformers، وبسبب الاتصالات المتبقية ، إذا "فُقد" رمز، فإنه لا يختفي. بل يمر تمثيله المتجهي عبر طبقة التغذية الأمامية دون تغيير. [ 30 ]

تشمل الأساليب الأخرى حلها كمسألة برمجة خطية مقيدة ، [ 31 ] باستخدام التعلم المعزز لتدريب خوارزمية التوجيه (لأن اختيار الخبير إجراء منفصل، كما هو الحال في التعلم المعزز). [ 32 ] قد لا تتطلب مطابقة الرمز المميز مع الخبير أي تعلم ("التوجيه الثابت"): إذ يمكن إجراؤها بواسطة دالة تجزئة حتمية [ 33 ] أو مولد أرقام عشوائية. [ 34 ]

تطبيقات على نماذج المحولات

تُستخدم طبقات MoE في نماذج Transformer الأكبر حجمًا ، حيث يكون التعلم والاستدلال على النموذج الكامل مكلفًا للغاية. وعادةً ما تكون هذه الطبقات ذات بوابات متفرقة، بمعامل تفرق 1 أو 2. في نماذج Transformer، تُستخدم طبقات MoE غالبًا لاختيار طبقات التغذية الأمامية (عادةً شبكة خطية-ReLU-خطية)، والتي تظهر في كل كتلة Transformer بعد آلية الانتباه متعددة الرؤوس. وذلك لأن طبقات التغذية الأمامية تستحوذ على نسبة متزايدة من تكلفة الحوسبة مع ازدياد حجم النماذج. على سبيل المثال، في نموذج Palm-540B، تقع 90% من المعلمات في طبقات التغذية الأمامية. [ 35 ]

يمكن تحويل نموذج Transformer المدرب إلى نموذج MoE عن طريق تكرار طبقات التغذية الأمامية الخاصة به، مع تهيئة البوابات بشكل عشوائي، ثم تدريبه بشكل إضافي. تُعرف هذه التقنية باسم "إعادة التدوير المتفرقة". [ 36 ]

تتضمن عملية تقييم الأداء باستخدام برنامج Transformer عدداً كبيراً من خيارات التصميم التي تؤثر على استقرار التدريب والأداء النهائي. ويصف تقرير OLMoE هذه الخيارات بالتفصيل. [ 37 ]

اعتبارًا من عام 2023تميل النماذج الكبيرة بما يكفي لاستخدام تقنية MoE إلى أن تكون نماذج لغوية ضخمة ، حيث يمتلك كل خبير ما يقارب 10 مليارات مُعامل. إلى جانب النماذج اللغوية، يُعدّ Vision MoE [ 38 ] نموذج Transformer مزودًا بطبقات MoE. وقد أثبتوا ذلك من خلال تدريب نموذج يحتوي على 15 مليار مُعامل. كما طُبّق نموذج MoE Transformer على نماذج الانتشار . [ 39 ]

استخدمت سلسلة من نماذج اللغة الضخمة من جوجل تقنية MoE. يستخدم نموذج GShard [ 40 ] تقنية MoE مع اختيار خبيرين كحد أقصى لكل طبقة. تحديدًا، يتم اختيار الخبير الأول دائمًا، بينما يتم اختيار الخبير الثاني باحتمالية تتناسب مع وزنه وفقًا لدالة البوابة. لاحقًا، عرض نموذج GLaM [ 41 ] نموذج لغة يحتوي على 1.2 تريليون مُعامل، حيث تستخدم كل طبقة من طبقات MoE أفضل خبيرين من أصل 64. أما نموذج Switch Transformers [ 22 ] فيستخدم الخبير الأول في جميع طبقات MoE.

يُعدّ نموذج NLLB-200 من Meta AI نموذجًا للترجمة الآلية لـ 200 لغة. [ 42 ] تستخدم كل طبقة من طبقات MoE بنية MoE هرمية ثنائية المستويات. في المستوى الأول، تختار دالة البوابات إما استخدام طبقة تغذية أمامية "مشتركة"، أو استخدام الخبراء. في حال استخدام الخبراء، تقوم دالة بوابات أخرى بحساب الأوزان واختيار أفضل خبيرين. [ 43 ]

يمكن تكييف نماذج اللغة الكبيرة MoE للمهام اللاحقة عن طريق ضبط التعليمات . [ 44 ]

في ديسمبر 2023، أصدرت شركة ميسترال للذكاء الاصطناعي نموذج ميكسترال 8x7B بموجب ترخيص أباتشي 2.0. وهو نموذج لغوي متعدد المعاملات (MoE) يحتوي على 46.7 مليار مُعامل، و8 خبراء، ونسبة تباعد 2. كما أصدرت الشركة نسخة مُحسّنة لتتبع التعليمات. [ 45 ] [ 46 ]

في مارس 2024، أصدرت شركة داتابريكس نموذج DBRX ، وهو نموذج لغوي متعدد المعايير (MoE) يحتوي على 132 مليار مُعامل، و16 خبيرًا، ونسبة تباعد 4. كما أصدرت الشركة نسخة مُحسّنة لتتبع التعليمات. [ 47 ] [ 48 ]

انظر أيضاً

مراجع

  1. بالداكينو، تارا؛ كروس، إليزابيث جيه؛ ووردن، كيث؛ روسون، جينيفر (2016). "نماذج مزيج الخبراء البايزية المتغيرة وتحليل الحساسية للأنظمة الديناميكية غير الخطية". أنظمة ميكانيكية ومعالجة الإشارات . 66-67 : 178-200 . Bibcode : 2016MSSP...66..178B . doi : 10.1016/j.ymssp.2015.05.009 .
  2. روكاش، ليور (نوفمبر 2009). تصنيف الأنماط باستخدام أساليب التجميع . سلسلة في الإدراك الآلي والذكاء الاصطناعي. المجلد 75. وورلد ساينتيفيك. ص 142. doi : 10.1142/7238 . ISBN   978-981-4271-06-6.
  3. تريسب، ف. (2001). "آلات اللجنة" . دليل معالجة إشارات الشبكات العصبية . سلسلة الهندسة الكهربائية ومعالجة الإشارات التطبيقية. المجلد 5. doi : 10.1201/9781420038613.ch5 (غير نشط في 1 يوليو 2025). ISBN  978-0-8493-2359-1.{{cite book}}: صيانة CS1: تم تعطيل DOI اعتبارًا من يوليو 2025 ( رابط )
  4. هامبشاير، جيه بي؛ وايبيل، أ. (يوليو 1992). "شبكة ميتا-باي: بناء تمثيلات معرفية موزعة للتعرف القوي على الأنماط متعددة المصادر" (ملف PDF) . معاملات IEEE في تحليل الأنماط والذكاء الآلي . 14 (7): 751-769 . doi : 10.1109/34.142911 .
  5. ألكسندر وايبيل؛ توشيوكي هانازاوا؛ جيفري هينتون؛ كيوهيرو شيكانو؛ كيفن ج. لانغ (1995). "التعرف على الصوتيات باستخدام الشبكات العصبية ذات التأخير الزمني*" . في: شوفان، إيف؛ روميلهارت، ديفيد إي. (محرران). الانتشار العكسي . دار النشر النفسية. doi : 10.4324/9780203763247 . ISBN 978-0-203-76324-7.
  6. نولان، ستيفن؛ هينتون، جيفري إي (1990). "تقييم الخلطات التكيفية للخبراء المتنافسين" . التطورات في أنظمة معالجة المعلومات العصبية . 3. مورغان كوفمان.
  7. جاكوبس، روبرت أ.؛ جوردان، مايكل آي.؛ نولان، ستيفن ج.؛ هينتون، جيفري إي. (فبراير 1991). " مزيج تكيفي من الخبراء المحليين" . الحوسبة العصبية . 3 (1): 79-87 . doi : 10.1162/neco.1991.3.1.79 . ISSN 0899-7667 . PMID 31141872. S2CID 572361 .   
  8. 1 2 جوردان، مايكل؛ جاكوبس، روبرت (1991). "تسلسلات الخبراء التكيفيين" . التقدم في أنظمة معالجة المعلومات العصبية . 4. مورغان كوفمان.
  9. 1 2 جوردان، مايكل آي.؛ جاكوبس، روبرت أ. (مارس 1994). "الخلائط الهرمية للخبراء وخوارزمية EM" . الحوسبة العصبية . 6 (2): 181-214 . doi : 10.1162/neco.1994.6.2.181 . hdl : 1721.1/7206 . ISSN 0899-7667 . 
  10. 1 2 جوردان، مايكل آي.؛ شو، لي (1995-01-01). "نتائج التقارب لنهج EM لهياكل مزيج الخبراء %2895%2900014-3". الشبكات العصبية . 8 (9): 1409-1431 . doi : 10.1016/0893-6080(95)00014-3 . hdl : 1721.1/6620 . ISSN 0893-6080 . 
  11. شو، لي؛ جوردان، مايكل؛ هينتون، جيفري إي (1994). "نموذج بديل لمزيج الخبراء" . التطورات في أنظمة معالجة المعلومات العصبية . 7. مطبعة معهد ماساتشوستس للتكنولوجيا.
  12. كولوبيرت، رونان؛ بينجيو، سامي؛ بينجيو، يوشوا (2001). "مزيج متوازي من آلات المتجهات الداعمة لمشاكل واسعة النطاق للغاية" . التطورات في أنظمة معالجة المعلومات العصبية . 14. مطبعة معهد ماساتشوستس للتكنولوجيا.
  13. غودفيلو، إيان؛ بينجيو، يوشوا؛ كورفيل، آرون (2016). "12: التطبيقات". التعلم العميق . الحوسبة التكيفية والتعلم الآلي. كامبريدج، ماساتشوستس: مطبعة معهد ماساتشوستس للتكنولوجيا. ISBN 978-0-262-03561-3.
  14. نغوين، هين د.؛ ماكلاكلان، جيفري ج. (2016-01-01). "مزيج لابلاس للخبراء الخطيين" . الإحصاءات الحاسوبية وتحليل البيانات . 93 : 177-191 . doi : 10.1016/j.csda.2014.10.016 . ISSN 0167-9473 . 
  15. تشامروخي، ف. (2016-07-01). " نمذجة مزيج الخبراء القوي باستخدام توزيع t" . الشبكات العصبية . 79 : 20-36 . arXiv : 1701.07429 . doi : 10.1016/j.neunet.2016.03.002 . ISSN 0893-6080 . PMID 27093693. S2CID 3171144 .   
  16. تشين، ك.؛ شو، ل.؛ تشي، هـ. (1999-11-01). "خوارزميات تعلم محسّنة لمزيج الخبراء في التصنيف متعدد الفئات" . الشبكات العصبية . 12 (9): 1229-1252 . doi : 10.1016/S0893-6080(99)00043-X . ISSN 0893-6080 . PMID 12662629 .  
  17. يانغ، تشيلين؛ داي، زيهانغ؛ سالاخوتدينوف، روسلان؛ كوهين، ويليام دبليو. (2017-11-10). "كسر عنق الزجاجة في دالة سوفتماكس: نموذج لغة RNN عالي الرتبة". arXiv : 1711.03953 [ cs.CL ].
  18. نارانج، شاران؛ تشونغ، هيونغ وون؛ تاي، يي؛ فيدوس، ويليام؛ فيفري، ثيبو؛ ماتينا، مايكل؛ مالكان، كاريشما؛ فيدل، نوح؛ شازير، نوام (23-02-2021). "هل تنتقل تعديلات المحولات عبر التطبيقات والتنفيذات؟". arXiv : 2102.11972 [ cs.LG ].
  19. بينجيو، يوشوا؛ ليونارد، نيكولاس؛ كورفيل، آرون (2013). "تقدير أو نشر التدرجات من خلال الخلايا العصبية العشوائية للحساب الشرطي". arXiv : 1308.3432 [ cs.LG ].
  20. إيجن، ديفيد؛ رانزاتو، مارك أوريليو؛ سوتسكيفر، إيليا (2013). "تعلم التمثيلات المجزأة في مزيج عميق من الخبراء". arXiv : 1312.4314 [ cs.LG ].
  21. شازير، نوعام؛ ميرحسيني، أزاليا؛ مازيارز، كريستوف؛ ديفيس، آندي؛ لي، كوك؛ هينتون، جيفري؛ دين، جيف (2017). "الشبكات العصبية الضخمة بشكل غير معقول: طبقة مزيج الخبراء ذات البوابات المتفرقة". arXiv : 1701.06538 [ cs.LG ].
  22. 1 2 3 فيدوس، ويليام؛ زوف، باريت؛ شازير، نوام (2022-01-01). "محولات التبديل: التوسع إلى نماذج ذات تريليون معلمة مع تباعد بسيط وفعال" . مجلة أبحاث تعلم الآلة . 23 (1): 5232-5270 . arXiv : 2101.03961 . ISSN 1532-4435 . 
  23. وو، يونغهوي؛ شوستر، مايك؛ تشين، تشيفنغ؛ لي، كوك ف.؛ نوروزي، محمد؛ ماشيري، وولفغانغ؛ كريكن، مكسيم؛ كاو، يوان؛ غاو، تشين؛ ماشيري، كلاوس؛ كلينغر، جيف؛ شاه، أبورفا؛ جونسون، ملفين؛ ليو، شياوبينغ؛ كايزر، لوكاس (2016). "نظام جوجل للترجمة الآلية العصبية: سد الفجوة بين الترجمة البشرية والآلية". arXiv : 1609.08144 [ cs.CL ].
  24. كايزر، لوكاس؛ غوميز، أيدان ن.؛ شازير، نوام؛ فاسواني، أشيش؛ بارمار، نيكي؛ جونز، ليون؛ أوزكوريت، جاكوب (16-06-2017). "نموذج واحد لتعلمها جميعًا" . arXiv.org .
  25. ^ ديب سيك-AI؛ ليو، أيشين. فنغ، باي. وانغ بن. وانغ، بينجكسوان؛ ليو، بو؛ تشاو، تشنغ قانغ؛ دينجر، تشنغكي؛ روان ، تشونغ (19 يونيو 2024). “DeepSeek-V2: نموذج لغة قوي واقتصادي وفعال لمزيج من الخبراء”. أرخايف : 2405.04434 [ cs.CL ]..
  26. ^ داي، داماي؛ دينغ، تشنغكي. تشاو، تشنغ قانغ؛ شو، آر إكس؛ جاو، هوازو؛ تشن، ديلي؛ لي، جياشي؛ تسنغ، وانغدينغ؛ يو ، شينغكاي (11 يناير 2024). “DeepSeekMoE: نحو التخصص النهائي للخبراء في نماذج اللغات المختلطة من الخبراء”. أرخايف : 2401.06066 [ cs.CL ].
  27. ^ ديب سيك-AI؛ ليو، أيشين. فنغ، باي. شيويه، بنج. وانغ، بينجكسوان؛ وو، بوشاو؛ لو، تشنغدا؛ تشاو، تشنغ قانغ؛ دينغ ، تشنغكي (2024/12/27). “التقرير الفني لـ DeepSeek-V3”. أرخايف : 2412.19437 [ cs.CL ].
  28. 1 2 زوف، باريت؛ بيلو، إروان؛ كومار، سمير. دو، نان؛ هوانغ، يانبينغ؛ دين جيف. شازير، نعوم؛ فيدوس، ويليام (2022). “ST-MoE: تصميم نماذج خبراء متفرقة مستقرة وقابلة للتحويل”. أرخايف : 2202.08906 [ cs.CL ].
  29. ^ تشو، يانكي؛ لي، تاو؛ ليو، هانشياو؛ دو، نان؛ هوانغ، يانبينغ؛ تشاو، فنسنت؛ داي، أندرو م. تشن، زيفنغ؛ لو، كووك الخامس؛ لودون ، جيمس (2022/12/06). "خليط من الخبراء مع توجيه اختيار الخبراء" . التقدم في أنظمة معالجة المعلومات العصبية . 35 : 7103– 7114. أرخايف : 2202.09368 .
  30. 1 2 فيدوس، ويليام؛ دين، جيف؛ زوف، باريت (2022-09-04). "مراجعة لنماذج الخبراء المتفرقة في التعلم العميق". arXiv : 2209.01667 [ cs.LG ].
  31. لويس، مايك؛ بهوسالي، شروتي؛ ديتميرز، تيم؛ جويال، نامان؛ زيتلموير، لوك (2021-07-01). "طبقات BASE: تبسيط تدريب النماذج الكبيرة والمتفرقة" . وقائع المؤتمر الدولي الثامن والثلاثين للتعلم الآلي . PMLR: 6265–6274 . arXiv : 2103.16716 .
  32. بينجيو، إيمانويل؛ بيكون، بيير-لوك؛ بينو، جويل؛ بريكوب، دوينا (2015). "الحساب الشرطي في الشبكات العصبية لنماذج أسرع". arXiv : 1511.06297 [ cs.LG ].
  33. رولر، ستيفن؛ سوخباتار، ساينبايار؛ سزلام، آرثر؛ ويستون، جيسون (2021). "طبقات التجزئة للنماذج المتفرقة الكبيرة" . التطورات في أنظمة معالجة المعلومات العصبية . 34. كوران أسوشيتس، إنك: 17555-17566 .
  34. ^ زو، سيمياو؛ ليو، شياو دونغ؛ جياو، جيان؛ كيم، يونغ جين؛ حسن، هاني؛ تشانغ، روفى. تشاو، تو؛ جاو ، جيان فنغ (2022/02/03). “ترويض المحولات قليلة النشاط مع خبراء العشوائية”. أرخايف : 2110.04260 [ cs.CL ].
  35. "نظرة معمقة على المحولات: عدّ المعلمات" . نظرة معمقة على المحولات: عدّ المعلمات . تم الاطلاع عليه بتاريخ 10-10-2023 .
  36. ^ كوماتسوزاكي، آران؛ بويجسيرفر، جوان؛ لي ثورب، جيمس. رويز، كارلوس ريكيلمي؛ مصطفى، باسل؛ أينسلي، جوشوا؛ تاي، يي؛ دهقاني، مصطفى؛ هولسبي ، نيل (17/02/2023). “إعادة التدوير المتناثر: تدريب مزيج من الخبراء من نقاط التفتيش الكثيفة”. أرخايف : 2212.05055 [ cs.LG ].
  37. ^ نيكلاس مونيجوف. سولديني، لوكا؛ جرونيفيلد ، ديرك. لو كايل. موريسون، جاكوب؛ مين، سيون؛ شي، ويجيا؛ والش، بيت. تافجورد ، أويفيند (2024/09/03). “OLMoE: نماذج لغة مختلطة من الخبراء المفتوحة”. أرخايف : 2409.02060 [ cs.CL ].
  38. ريكيلمي، كارلوس؛ بويغسيرفر، جوان؛ مصطفى، باسل؛ نيومان، مكسيم؛ جيناتون، رودولف؛ سوسانو بينتو، أندريه؛ كيسرز، دانيال؛ هولزبي، نيل (2021). "توسيع نطاق الرؤية باستخدام مزيج متفرق من الخبراء" . التقدم في أنظمة معالجة المعلومات العصبية . 34 : 8583-8595 . arXiv : 2106.05974 .
  39. ^ فاي، زينجكونج؛ فان، مينجيوان؛ يو، تشانغتشيان؛ لي، ديبانج؛ هوانغ ، جونشي (2024/07/16). “تحجيم محولات الانتشار إلى 16 مليار معلمة”. أرخايف : 2407.11633 [ cs.CV ].
  40. ^ ليبيكين ، دميتري. لي هيوك جونج؛ شو، يوانزونغ؛ تشن، ديهاو؛ فرات، أورهان؛ هوانغ، يانبينغ؛ كريكون، مكسيم؛ شازير، نعوم؛ تشن، زيفنغ (2020). “GShard: توسيع نطاق النماذج العملاقة باستخدام الحساب الشرطي والمشاركة التلقائية”. أرخايف : 2006.16668 [ cs.CL ].
  41. ^ دو، نان؛ هوانغ، يانبينغ؛ داي، أندرو م. تونغ، سيمون. ليبيكين، ديمتري؛ شو، يوانزونغ؛ كريكون، مكسيم؛ تشو، يانكي؛ يو، آدامز وي. فرات، أورهان؛ زوف، باريت. فيدوس، ليام؛ بوسما، مارتن؛ تشو، زونغوي. وانغ ، تاو (2021). “GLaM: التوسع الفعال لنماذج اللغة مع مزيج من الخبراء”. أرخايف : 2112.06905 [ cs.CL ].
  42. "200 لغة ضمن نموذج ذكاء اصطناعي واحد: إنجازٌ رائد في الترجمة الآلية عالية الجودة" . ai.facebook.com . 19 يونيو 2022. مؤرشف من الأصل بتاريخ 9 يناير 2023.
  43. فريق NLLB؛ كوستا-جوسا، مارتا ر.؛ كروس، جيمس؛ تشيليبي، أونور؛ البيض، مها؛ هيفيلد، كينيث؛ هيفيرنان، كيفن؛ كلباسي، إلاهي؛ لام، جانيس؛ ليشت، دانيال؛ مايلارد، جان؛ صن، آنا؛ وانغ، سكايلر؛ وينزيك، غيوم؛ يونغبلود، آل (2022). "لا لغة تُترك خلف الركب: توسيع نطاق الترجمة الآلية التي تركز على الإنسان". arXiv : 2207.04672 [ cs.CL ].
  44. ^ شن ، شنغ. هو، لو؛ تشو، يانكي؛ دو، نان؛ لونجبري، شاين؛ وي، جايسون. تشونغ، هيونغ وون؛ زوف، باريت. فيدوس، وليام. تشن، شينيون؛ فو، تو؛ وو، يويكسين؛ تشن، ويانغ؛ ويبسون، ألبرت؛ لي ، يونشوان (2023). “مزيج من الخبراء يلبي ضبط التعليمات: مزيج رابح لنماذج اللغات الكبيرة”. أرخايف : 2305.14705 [ cs.CL ].
  45. الذكاء الاصطناعي، ميسترال (11 ديسمبر 2023). "مزيج من الخبراء" . mistral.ai . تم الاطلاع عليه بتاريخ 4 فبراير 2024 .
  46. ^ جيانغ، ألبرت ك. سابلايرولس، الكسندر؛ رو، أنطوان؛ مينش، آرثر. سافاري، بلانش؛ بامفورد، كريس. شابلوت، ديفيندرا سينغ؛ كاساس، دييغو دي لاس؛ حنا، إيما بو (2024/01/08). "مزيج الخبراء". أرخايف : 2401.04088 [ cs.LG ].
  47. "تقديم DBRX: برنامج ماجستير مفتوح جديد ومتطور" . داتابريكس . 27-03-2024 . تم الاطلاع عليه بتاريخ 28-03-2024 .
  48. نايت، ويل. "داخل عملية إنشاء أقوى نموذج ذكاء اصطناعي مفتوح المصدر في العالم" . مجلة وايرد . الرقم الدولي الموحد للدوريات 1059-1028 . تاريخ الاسترجاع: 28 مارس 2024 . 

للمزيد من القراءة

  • قبل عصر التعلم العميق
    • ماكلاكلان، جيفري جيه؛ بيل، ديفيد (2000). نماذج الخلط المحدود . سلسلة وايلي في الاحتمالات والإحصاء، قسم الاحتمالات والإحصاء التطبيقي. نيويورك، تشيتشستر، واينهايم، بريسبان، سنغافورة، تورنتو: جون وايلي وأولاده، المحدودة. ISBN 978-0-471-00626-8.
    • يوكسيل، إس إي؛ ويلسون، جيه إن؛ غادر، بي دي (أغسطس 2012). "عشرون عامًا من مزيج الخبراء". معاملات IEEE في الشبكات العصبية وأنظمة التعلم . 23 (8): 1177-1193 . Bibcode : 2012ITNNL..23.1177Y . doi : 10.1109/TNNLS.2012.2200299 . ISSN 2162-237X . PMID 24807516. S2CID 9922492 .   
    • مسعودنيا، سعيد؛ إبراهيم بور، رضا (12 مايو 2012). "مزيج من الخبراء: دراسة استقصائية للأدبيات". مجلة مراجعة الذكاء الاصطناعي . 42 (2): 275-293 . doi : 10.1007/s10462-012-9338-y . S2CID 3185688 . 
    • نغوين، هين د.؛ تشامروخي، فيصل (يوليو 2018). "الجوانب العملية والنظرية لنمذجة مزيج الخبراء: نظرة عامة" . مجلة WIREs لاستخراج البيانات واكتشاف المعرفة . 8 (4) e1246. doi : 10.1002/widm.1246 . ISSN 1942-4787 . S2CID 49301452 .  
  • تقنيات عملية لتدريب نماذج محولات وزارة التعليم
    • زوف، باريت. بيلو، إروان؛ كومار، سمير. دو، نان؛ هوانغ، يانبينغ؛ دين جيف. شازير، نعوم؛ فيدوس، ويليام (2022). “ST-MoE: تصميم نماذج خبراء متفرقة مستقرة وقابلة للتحويل”. أرخايف : 2202.08906 [ cs.CL ].
    • مونيجوف، نيكلاس؛ سولديني، لوكا؛ جرونيفيلد ، ديرك. لو كايل. موريسون، جاكوب؛ مين، سيون؛ شي، ويجيا؛ والش، بيت. تافجورد، أويفيند؛ لامبرت، ناثان. قو، يولينج؛ أرورا، شين؛ باجيا، أكشيتا؛ شوينك، داستن؛ وادن، ديفيد؛ ويتيج، الكسندر. هوي، بينيوان؛ ديتميرز، تيم؛ كيلا، دوي؛ فرهادي، علي؛ سميث، نوح أ؛ بانغ وي كوه؛ سينغ، أمانبريت؛ حاجشيرزي، حنانة (2024). “OLMoE: نماذج لغة مختلطة من الخبراء المفتوحة”. أرخايف : 2409.02060 [ cs.CL ].، مع نشر البيانات المرتبطة بها على "allenai/OLMoE" . Ai2. 2024-10-17 . تم الاطلاع عليه بتاريخ 2024-10-18 .
    • راجبهانداري، ساميام؛ لي، كونغلونغ؛ ياو، زهيوي؛ تشانغ، مينجيا؛ رضا يزداني أمين آبادي؛ عمار أحمد اعوان؛ راسلي، جيف. هو، يوكسيونغ (2022). “DeepSpeed-MoE: تطوير الاستدلال والتدريب على مزيج من الخبراء لتشغيل مقياس الذكاء الاصطناعي للجيل القادم”. أرخايف : 2201.05596 [ cs.LG ].
    • DeepSeek-AI؛ وآخرون  (2024). "DeepSeek-V2: نموذج لغوي قوي واقتصادي وفعال لمزيج من الخبراء". arXiv : 2405.04434 [ cs.CL ].
    • ديب سيك-AI؛ وآخرون  . (2024). “التقرير الفني لـ DeepSeek-V3”. أرخايف : 2412.19437 [ cs.CL ].
    • جين، تشاو؛ جيانغ، زيهينج؛ باي، تشيهاو؛ تشونغ، تشنغ. ليو، جونكاي؛ لي شيانغ. تشنغ، نينغشين؛ وانغ شي. شيه كونغ. هوانغ، تشي؛ هنغ، ون؛ ما، يييوان؛ باو، وينلي؛ تشنغ، الحجم؛ بنغ، يانغهوا؛ لين هايبين. ليو، شوانزي؛ جين، شين؛ ليو، شين (2025). “MegaScale-MoE: التدريب على كفاءة الاتصالات على نطاق واسع لنماذج مزيج من الخبراء في الإنتاج”. أرخايف : 2505.11432 [ cs.LG ].
  • مراجعة الأدبيات لعصر التعلم العميق