انهيار النموذج
في مجال الذكاء الاصطناعي ، يُعرف انهيار النموذج ، أو ما يُسمى أيضًا بـ " التزاوج الداخلي للذكاء الاصطناعي " [ 1 ] [ 2 ] ، و" التهام الذاتي للذكاء الاصطناعي " [ 3 ] [ 4 ] ، و"ذكاء هابسبورغ الاصطناعي" [5]، و"اضطراب الالتهام الذاتي للنموذج " أو " MAD " [ 6 ] [ 7 ] [ 8 ] ، بأنه تدهور نماذج التعلم الآلي نتيجة استخدام بيانات اصطناعية غير مُدققة ، أو نتيجة التدريب على مخرجات نموذج آخر، مثل نسخة سابقة منه. ولا يزال من غير الواضح إلى أي مدى يُهدد انهيار النموذج التطور طويل الأمد لنماذج الذكاء الاصطناعي، وقد طُرحت تقنيات للتخفيف من آثاره.
صفات
قام شومايلوف وآخرون [ 9 ] بصياغة المصطلح لوصف مرحلتين محددتين لتدهور نماذج التعلم الآلي: انهيار النموذج المبكر وانهيار النموذج المتأخر :
- في المراحل المبكرة من انهيار النموذج، يبدأ النموذج بفقدان المعلومات المتعلقة بذيل التوزيع ، مما يؤثر بشكل رئيسي على البيانات الأقل تمثيلاً. وقد أوضحت دراسات لاحقة أن ملاحظة المراحل المبكرة من انهيار النموذج أمر يصعب، إذ قد يبدو الأداء العام متحسناً، بينما يفقد النموذج كفاءته في التعامل مع البيانات الأقل تمثيلاً. [ 10 ]
- في مرحلة الانهيار المتأخر للنموذج، يفقد النموذج نسبة كبيرة من أدائه، مما يؤدي إلى تشويش المفاهيم وفقدان معظم تباينه . [ 9 ] [ 11 ] [ 12 ]
الآلية
قد يؤدي استخدام البيانات الاصطناعية كبيانات تدريب إلى مشاكل في جودة وموثوقية النموذج المُدرَّب. [ 13 ] [ 14 ] يحدث انهيار النموذج لثلاثة أسباب رئيسية:
- أخطاء التقريب الوظيفي
- أخطاء المعاينة
- أخطاء التعلم [ 9 ]
والأهم من ذلك، أن هذا يحدث حتى في أبسط النماذج، حيث لا تتواجد جميع مصادر الخطأ. أما في النماذج الأكثر تعقيداً، فغالباً ما تتراكم الأخطاء، مما يؤدي إلى انهيار أسرع.
خلاف حول التأثير على أرض الواقع

يحذر بعض الباحثين والمعلقين على انهيار النماذج من أن هذه الظاهرة قد تهدد بشكل جوهري تطوير الذكاء الاصطناعي التوليدي في المستقبل: فمع مشاركة البيانات المولدة بواسطة الذكاء الاصطناعي على الإنترنت، ستنتهي حتماً في مجموعات بيانات التدريب المستقبلية، والتي غالباً ما تُجمع من الإنترنت. وإذا كان التدريب على بيانات الذكاء الاصطناعي غير المصنفة (كميات كبيرة من البيانات الاصطناعية غير المصنفة) يؤدي حتماً إلى انهيار النموذج، فقد يُشكل ذلك مشكلة معقدة. [ 15 ]
مع ذلك، خالف باحثون آخرون هذا الرأي مؤخرًا، مُبينين أنه في حال تراكم البيانات الاصطناعية جنبًا إلى جنب مع البيانات المُولّدة بشريًا، يُمكن تجنب انهيار النموذج. [ 16 ] ويُجادل الباحثون بأن تراكم البيانات بمرور الوقت يُعد وصفًا أكثر واقعية للواقع من حذف جميع البيانات الموجودة سنويًا، وأن تأثير انهيار النموذج في العالم الحقيقي قد لا يكون كارثيًا كما يُخشى. [ 17 ]
يتناول فرع بديل من الأدبيات استخدام كاشفات التعلم الآلي والعلامات المائية لتحديد البيانات المولدة بواسطة النموذج وتصفيتها. [ 18 ] [ 19 ]
النماذج الرياضية للظاهرة
نموذج غاوسي أحادي البعد
في عام 2024، [ 9 ] تم بذل محاولة أولى لتوضيح الانهيار لأبسط نموذج ممكن - وهو نموذج توزيع طبيعي أحادي البعد باستخدام مقدرات غير متحيزة للمتوسط والتباين، محسوبة على عينات من الجيل السابق.
ولتوضيح ذلك بشكل أدق، نقول إن البيانات الأصلية تتبع التوزيع الطبيعيونحن نمتلكعيناتل. للدلالة على عينة عامةكعينةفي جيلثم يتم تقدير نموذج الجيل التالي باستخدام متوسط العينة والتباين:
مما يؤدي إلى نموذج الجيل التالي الطبيعي المشروطنظرياً، هذا يكفي لحساب التوزيع الكامل لـومع ذلك، حتى بعد الجيل الأول، لم يعد التوزيع الكامل طبيعيًا: بل يتبع توزيع جاما التباين .
لمواصلة التحليل، بدلاً من كتابة دالة كثافة الاحتمال في كل جيل، من الممكن بناؤها صراحةً بدلالة المتغيرات العشوائية المستقلة باستخدام نظرية كوكران . وبالتحديد،ومستقلون، معو، وفقًا لتوزيع جاما . بالرمز إلىالمتغيرات العشوائية الغاوسية موزعة وفقًا لـومعالمتغيرات العشوائية موزعة وفقًا لـاتضح أنه من الممكن كتابة عينات في كل جيل على النحو التالي:
وبشكل أعم
لاحظ أن هذه ليست توزيعات مشتركة، كماويعتمد بشكل مباشر علىلكن عند النظرتوفر الصيغة المذكورة أعلاه، بمفردها، جميع المعلومات المتعلقة بالتوزيع الكامل.
To analyse the model collapse, we can first calculate variance and mean of samples at generation . This would tell us what kind of distributions we expect to arrive at after generations. It is possible to find its exact value in closed form, but the mean and variance of the square root of gamma distribution are expressed in terms of gamma functions, making the result quite clunky. Following,[9] it is possible to expand all results to second order in each of , assuming each sample size to be large. It is then possible to show that
And if all sample sizes are constant, this diverges linearly as :
This is the same scaling as for a single dimensional Gaussian random walk. However, divergence of the variance of does not directly provide any information about the corresponding estimates of and , particularly how different they are from the original and . It turns out to be possible to calculate the distance between the true distribution and the approximated distribution at step , using the Wasserstein-2 distance (which is also sometimes referred to as risk):
This directly shows why model collapse occurs in this simple model. Due to errors from re-sampling the approximated distribution, each generation ends up corresponding to a new step in a random walk of model parameters. For a constant sample size at each generation, the average distance from the starting point diverges, and in order for the end distribution approximation to be accurate, or for the distance to be finite, the sampling rate needs to increase superlinearly, i.e. one needs to collect increasingly more samples over time, perhaps quadratically. However, even in that case the expected distance after steps remains non-zero and the only case in which it does in fact end up being zero is when sampling is infinite at each step. Overall, this only shows us how far on average one ends up from the original distribution, but the process can only "terminate", if the estimated variance at a certain generation becomes small enough, effectively turning the distribution into a delta function. This is shown to occur for a general gaussian model[13] in the subsection below. Empirical investigation has confirmed this theoretical analysis.[20]
N-D Gaussian model
Furthermore, in the case of multidimensional model with fully synthetic data, exact collapse can be shown.[13][9]
Linear regression
In the case of a linear regression model,[21][22]scaling laws and bounds on learning can be obtained.
Statistical language model
في حالة مصنف softmax الخطي للتنبؤ بالرمز التالي، [ 23 ] يمكن الحصول على حدود دقيقة للتعلم حتى مع مجموعة بيانات اصطناعية جزئيًا.
التأثير على نماذج اللغة الكبيرة
في سياق نماذج اللغة الكبيرة ، وجدت الأبحاث أن تدريب نماذج اللغة الكبيرة على النصوص المولدة من النماذج السابقة - حيث يتم تدريب نماذج اللغة على البيانات الاصطناعية التي تنتجها النماذج السابقة - يؤدي إلى انخفاض مستمر في التنوع المعجمي والنحوي والدلالي لمخرجات النموذج من خلال التكرارات المتتالية، لا سيما بالنسبة للمهام التي تتطلب مستويات عالية من الإبداع. [ 24 ]
تنوع مخرجات النموذج
مع إعادة تدريب النماذج على مخرجات مأخوذة بشكل غير متناسب من مركز التوزيع ذي الاحتمالية الأعلى، تُعد الكلمات النادرة والتراكيب النحوية غير الشائعة من بين أولى السمات التي تختفي. [ 25 ] وقد أظهر التحليل الإحصائي لتدريب التنبؤ المتكرر بالرمز التالي أنه عند تدريب نماذج اللغة بشكل متكرر على بيانات اصطناعية، فإن التوزيعات الشرطية المُتعلمة تُركز كتلة الاحتمالية على مجموعة فرعية صغيرة من التتابعات عالية التنبؤ (وهي ظاهرة تُوصف بأنها "انهيار تام"). [ 26 ]
تقليل التنوع المرتبط بالمحاذاة
بشكل منفصل، يُعزى انخفاض تنوع المخرجات في نماذج التعلم المعزز من خلال التغذية الراجعة البشرية (LLMs) إلى إجراءات الضبط الدقيق بعد التدريب، وليس إلى التدريب المتكرر على بيانات اصطناعية. وقد وُجد أن التعلم المعزز من خلال التغذية الراجعة البشرية (RLHF) وطرق تحسين التفضيلات ذات الصلة، التي تُحسّن النماذج لتتوافق مع الاستجابات المفضلة لدى البشر، تُقلل من تنوع المخرجات على مستوى النص المُولّد. [ 27 ] أظهر تحليل مُحكم لخط أنابيب RLHF أنه، مقارنةً بالضبط الدقيق الخاضع للإشراف، حسّن RLHF التعميم على المدخلات الخارجة عن التوزيع، ولكنه قلل بشكل كبير من تنوع المخرجات، وهي علاقة تُوصف بأنها مُفاضلة بين التعميم والتنوع . [ 27 ] وقد لوحظ هذا التأثير أيضًا على المستوى المفاهيمي: فعندما تُعامل مخرجات النموذج كعينات من مجتمع مُحاكٍ، تُظهر النماذج المُتوافقة تنوعًا مفاهيميًا أقل من نظيراتها غير المُتوافقة، على الرغم من أن أيًا من النماذج المدروسة لم يصل إلى مستوى التنوع الموجود في المجتمعات البشرية. [ 28 ] يُوصف التقارب نحو مجموعة ضيقة من الاستجابات ذات المكافأة العالية في ظل الضبط الدقيق القائم على التعلم المعزز أحيانًا بأنه شكل من أشكال انهيار النموذج ؛ وهذا يرتبط بالشكل التكراري لانهيار النموذج الموصوف أعلاه، ولكنه يختلف عنه من الناحية الآلية، لأنه لا يتطلب بيانات اصطناعية في مجموعة التدريب. [ 27 ]
قياس
طُوِّرت مقاييس مُخصصة لقياس انخفاضات تنوّع المخرجات. يُقدِّر مؤشر فيندي، المُستند إلى مفاهيم من علم البيئة ونظرية المعلومات ، العدد الفعلي للعناصر المُميزة في عينة دون الحاجة إلى مجموعة بيانات مرجعية. [ 29 ] وقد طُبِّق هذا المؤشر لتوصيف انهيار الأنماط، مُبينًا أن النماذج التوليدية التي تُعيد إنتاج كل نمط مُصنَّف في مجموعة بيانات قد تكون مع ذلك أقل تنوّعًا بشكل كبير من البيانات الأصلية. [ 29 ] بالنسبة للغة تحديدًا، تم تقسيم التنوّع إلى أبعاد قابلة للقياس بشكل منفصل (معجمية، نحوية، ودلالية) مع مقاييس مُخصصة طُوِّرت لتجارب التدريب التكراري. [ 24 ] تعمل أدوات أخرى على مستويات أعلى من البنية، مثل مؤشر سوي جينيريس ، الذي يقيس تفرّد عناصر الحبكة لتقييم التنوّع في توليد السرد. [ 30 ]
التخفيف
تندرج الاستجابات المقترحة لفقدان التنوع ضمن عدة فئات. تعالج تقنيات تصفية البيانات ووضع العلامات المائية، التي نوقشت في سياق انهيار النموذج بشكل أوسع أعلاه، مشكلة تكوين بيانات التدريب من خلال تحديد النصوص التي يُنشئها النموذج واستبعادها قبل إعادة إدخالها في مجموعات بيانات التدريب. [ 31 ] [ 32 ] ويُعدّل نهج آخر هدف الضبط الدقيق نفسه: نظرًا لأن هدف الإنتروبيا المتقاطعة القياسي يزيد من احتمالية المخرجات المرصودة دون الحفاظ على البدائل، فقد اقتُرحت طرق تتضمن تنظيم الإنتروبيا للحد من الإفراط في الحفظ والحفاظ على تنوع المخرجات مع الحفاظ على أداء المهمة. [ 33 ] كما أُفيد بأن الحفاظ على تنوع المخرجات بهذه الطريقة يُحسّن الأداء في ظل أخذ العينات المتكرر أثناء الاستدلال. [ 33 ]
تداعيات أوسع
يربط بعض الباحثين انخفاض تنوع المخرجات بمخاوف أوسع نطاقًا بشأن التجانس الثقافي والمعرفي. وقد أشارت دراسات التعاون بين الإنسان والذكاء الاصطناعي إلى أن المساعدة التوليدية يمكن أن ترفع من جودة المساهمات الفردية مع تقليل التنوع الجماعي للأعمال الناتجة، [ 34 ] كما وجدت تحليلات توليد القصص على نطاق واسع أن مخرجات النماذج غالبًا ما تعيد تجميع مجموعة محدودة من عناصر الحبكة. [ 30 ] وقد رُبطت هذه الأنماط باحتمالية تضييق نطاق الأفكار المتاحة للجمهور، وهو ما يُطلق عليه أحيانًا انهيار المعرفة. [ 35 ] وقد طُرحت فكرة أن الحفاظ على التنوع عبر منظومة من النماذج المتميزة، بدلًا من الاعتماد على عدد قليل من الأنظمة المتشابهة، قد يساعد في مواجهة هذا التوجه، وإن كان ذلك إلى حد معين فقط. [ 35 ]
انظر أيضاً
مراجع
- ↑ ""التزاوج الداخلي بين الأجيال" وخطره على الثقافة الإنسانية" . 26 أغسطس 2023.
- ↑ "قد يختنق الذكاء الاصطناعي بعوادمه الخاصة وهو يملأ الشبكة" . 28 أغسطس 2023.
- ↑ "أكل لحوم البشر في الذكاء الاصطناعي والقانون - مجلة قانون التكنولوجيا في كولورادو" .
- ↑ "الحالة الغريبة لأكل الذكاء الاصطناعي للحوم البشر والحلول الممكنة" . 26 يوليو 2023.،
- ↑ "هل هي نماذج ذكاء اصطناعي ناتجة عن التزاوج الداخلي، أم هراء، أم مجرد جنون؟ تحذيرات متزايدة بشأنها" . فرانس 24. 5 أغسطس 2024. تاريخ الاطلاع: 31 ديسمبر 2024 .
- ↑ "نموذج اضطراب الالتهام الذاتي - مبادرة لايفسكو حول علم الأعصاب والسرد والذكاء الاصطناعي" .
- ↑ "الذكاء الاصطناعي التوليدي يصاب بالجنون عند تدريبه على بيانات أنشأها الذكاء الاصطناعي لأكثر من خمس مرات" . 12 يوليو 2023.
- ↑ أليمحمد، سينا؛ كاسكو-رودريغيز، خوسيه؛ لوزي، لورينزو؛ أحمد امتياز همايون؛ بابائي، حسين؛ ليجون، دانيال؛ سياكوهي، علي؛ بارانيوك، ريتشارد ج. (2023). "النماذج التوليدية المستهلكة ذاتيًا تتجه نحو الجنون". arXiv : 2307.01850 [ cs.LG ].
- 123456Shumailov, Ilia; Shumaylov, Zakhar; Zhao, Yiren; Papernot, Nicolas; Anderson, Ross; Gal, Yarin (July 2024). "AI models collapse when trained on recursively generated data". Nature. 631 (8022): 755–759. Bibcode:2024Natur.631..755S. doi:10.1038/s41586-024-07566-y. ISSN 1476-4687. PMC 11269175. PMID 39048682.
- ↑Wyllie, Sierra; Shumailov, Ilia; Papernot, Nicolas (2024-06-05). "Fairness Feedback Loops: Training on Synthetic Data Amplifies Bias". The 2024 ACM Conference on Fairness, Accountability, and Transparency. FAccT '24. New York, NY, USA: Association for Computing Machinery. pp. 2113–2147. arXiv:2403.07857. doi:10.1145/3630106.3659029. ISBN 979-8-4007-0450-5.
- ↑Shumailov, Ilia; Shumaylov, Zakhar; Zhao, Yiren; Gal, Yarin; Papernot, Nicolas; Anderson, Ross (2023-05-31). "The Curse of Recursion: Training on Generated Data Makes Models Forget". arXiv:2305.17493 [cs.LG].
- ↑Mok, Aaron. "A disturbing AI phenomenon could completely upend the internet as we know it". Business Insider. Retrieved 2024-03-06.
- 123Alemohammad, Sina; Casco-Rodriguez, Josue; Luzi, Lorenzo; Humayun, Ahmed Imtiaz; Babaei, Hossein; LeJeune, Daniel; Siahkoohi, Ali; Baraniuk, Richard G. (July 4, 2023). "Self-Consuming Generative Models Go MAD". arXiv:2307.01850 [cs.LG].
- ↑Self-Consuming Generative Models Go MAD. The Twelfth International Conference on Learning Representations.
- ↑"What is Model Collapse and how to avoid it". The Register. Retrieved 11 July 2024.
- ↑Gerstgrasser, Matthias; Schaeffer, Rylan; Dey, Apratim; Rafailov, Rafael; Sleight, Henry; Hughes, John; Korbak, Tomasz; Agrawal, Rajashree; Pai, Dhruv; Gromov, Andrey; Roberts, Daniel A.; Yang, Diyi; Donoho, David L.; Koyejo, Sanmi (2024-04-01). "Is Model Collapse Inevitable? Breaking the Curse of Recursion by Accumulating Real and Synthetic Data". arXiv:2404.01413 [cs.LG].
- ↑"Big brains divided over training AI with more AI: Is model collapse inevitable?". The Register. Retrieved 11 July 2024.
- ↑Kirchenbauer, John; Geiping, Jonas; Wen, Yuxin; Katz, Jonathan; Miers, Ian; Goldstein, Tom (2023-07-03). "A Watermark for Large Language Models". Proceedings of the 40th International Conference on Machine Learning. PMLR: 17061–17084.
- ↑"My AI Safety Lecture for UT Effective Altruism". Shtetl-Optimized. 2022-11-29. Retrieved 2024-06-22.
- ↑Borji, Ali (2024-10-16). "A Note on Shumailov et al. (2024): "AI Models Collapse When Trained on Recursively Generated Data"". arXiv:2410.12954 [cs.LG].
- ↑Dohmatob, Elvis; Feng, Yunzhen; Kempe, Julia (2024-02-12). "Model Collapse Demystified: The Case of Regression". arXiv:2402.07712 [cs.LG].
- ↑Dohmatob, Elvis; Feng, Yunzhen; Yang, Pu; Charton, Francois; Kempe, Julia (2024-02-10). "A Tale of Tails: Model Collapse as a Change of Scaling Laws". arXiv:2402.07043 [cs.LG].
- ↑Seddik, Mohamed El Amine; Chen, Suei-Wen; Hayou, Soufiane; Youssef, Pierre; Debbah, Merouane (2024-04-07). "How Bad is Training on Synthetic Data? A Statistical Analysis of Language Model Collapse". arXiv:2404.05090 [cs.LG].
- 12Guo, Yanzhu; Shang, Guokan; Vazirgiannis, Michalis; Clavel, Chloé (2024-04-16). "The Curious Decline of Linguistic Diversity: Training Language Models on Synthetic Text". arXiv:2311.09807 [cs.CL].
- ↑Briesch, Martin; Sobania, Dominik; Rothlauf, Franz (2023). "Large Language Models Suffer From Their Own Output: An Analysis of the Self-Consuming Training Loop". arXiv:2311.16822 [cs.CL].
- ↑Seddik, Mohamed El Amine; Chen, Suei-Wen; Hayou, Soufiane; Youssef, Pierre; Debbah, Merouane (2024). "How Bad is Training on Synthetic Data? A Statistical Analysis of Language Model Collapse". arXiv:2404.05090 [cs.LG].
- 1 2 3 كيرك، روبرت؛ ميديراتا، إيشيتا؛ نالمبانتيس، خريستوفوروس؛ لوكيتينا، يلينا؛ هامبرو، اريك. جريفنستيت، إدوارد؛ رايليانو، روبرتا (2024). “فهم آثار RLHF على التعميم والتنوع LLM”. أرخايف : 2310.06452 [ cs.LG ].
- ↑ مورثي، سونيا كريشنا؛ أولمان، تومر؛ هو، جينيفر (2025). "سمكة واحدة، سمكتان، ولكن ليس البحر كله: المحاذاة تقلل من التنوع المفاهيمي لنماذج اللغة". arXiv : 2411.04427 [ cs.CL ].
- 1 2 فريدمان، دان؛ دينغ، أدجي بوسو (2022). "مؤشر فيندي: مقياس لتقييم التنوع في التعلم الآلي". arXiv : 2210.02410 [ cs.LG ].
- 1 2 Xu, Weijia; Jojic, Nebojsa; Rao, Sudha; Brockett, Chris; Dolan, Bill (2025). "أصداء في الذكاء الاصطناعي: قياس نقص تنوع الحبكات في مخرجات نماذج التعلم الآلي". وقائع الأكاديمية الوطنية للعلوم . 122 (35). doi : 10.1073/pnas.2504966122 .
- ↑ كيرشنباور، جون؛ جيبينغ، جوناس؛ وين، يوكسين؛ كاتز، جوناثان؛ مايرز، إيان؛ غولدشتاين، توم (2023-07-03). "علامة مائية لنماذج اللغة الكبيرة" . وقائع المؤتمر الدولي الأربعين للتعلم الآلي . PMLR: 17061–17084 .
- ↑ جيرستجراسر، ماتياس؛ شايفر، رايلان؛ دي، أبراتيم؛ رافائيلوف، رافائيل؛ وآخرون . (2024-04-01). "هل انهيار النموذج أمر لا مفر منه؟ كسر لعنة التكرار من خلال تجميع البيانات الحقيقية والاصطناعية". arXiv : 2404.01413 [ cs.LG ].
- 1 2 لي، زينيو؛ تشن، كونجليانج؛ شو، تيان؛ تشين، زيو؛ شياو، جيانكونج؛ لو، تشي تشيوان؛ صن ، رويو (2024). “الحفاظ على التنوع في الضبط الدقيق الخاضع للإشراف لنماذج اللغات الكبيرة”. أرخايف : 2408.16673 [ cs.LG ].
- ↑ دوشي، أنيل ر.؛ هاوزر، أوليفر ب. (2024). "الذكاء الاصطناعي التوليدي يعزز الإبداع الفردي ولكنه يقلل من التنوع الجماعي للمحتوى الجديد". مجلة ساينس أدفانسز . 10 (28). doi : 10.1126/sciadv.adn5290 .
- 1 2 هودل، داميان؛ ويست، جيفين د. (2025). "التنوع المعرفي عبر نماذج اللغة يخفف من انهيار المعرفة". arXiv : 2512.15011 [ cs.LG ].
- الذكاء الاصطناعي التوليدي
