انهيار النموذج

في مجال الذكاء الاصطناعي ، يُعرف انهيار النموذج ، أو ما يُسمى أيضًا بـ " التزاوج الداخلي للذكاء الاصطناعي " [ 1 ] [ 2 ] ، و" التهام الذاتي للذكاء الاصطناعي " [ 3 ] [ 4 ] ، و"ذكاء هابسبورغ الاصطناعي" [5]، و"اضطراب الالتهام الذاتي للنموذج " أو " MAD " [ 6 ] [ 7 ] [ 8 ] ، بأنه تدهور نماذج التعلم الآلي نتيجة استخدام بيانات اصطناعية غير مُدققة ، أو نتيجة التدريب على مخرجات نموذج آخر، مثل نسخة سابقة منه. ولا يزال من غير الواضح إلى أي مدى يُهدد انهيار النموذج التطور طويل الأمد لنماذج الذكاء الاصطناعي، وقد طُرحت تقنيات للتخفيف من آثاره.

صفات

قام شومايلوف وآخرون [ 9 ] بصياغة المصطلح لوصف مرحلتين محددتين لتدهور نماذج التعلم الآلي: انهيار النموذج المبكر وانهيار النموذج المتأخر :

  • في المراحل المبكرة من انهيار النموذج، يبدأ النموذج بفقدان المعلومات المتعلقة بذيل التوزيع ، مما يؤثر بشكل رئيسي على البيانات الأقل تمثيلاً. وقد أوضحت دراسات لاحقة أن ملاحظة المراحل المبكرة من انهيار النموذج أمر يصعب، إذ قد يبدو الأداء العام متحسناً، بينما يفقد النموذج كفاءته في التعامل مع البيانات الأقل تمثيلاً. [ 10 ]
  • في مرحلة الانهيار المتأخر للنموذج، يفقد النموذج نسبة كبيرة من أدائه، مما يؤدي إلى تشويش المفاهيم وفقدان معظم تباينه . [ 9 ] [ 11 ] [ 12 ]

الآلية

قد يؤدي استخدام البيانات الاصطناعية كبيانات تدريب إلى مشاكل في جودة وموثوقية النموذج المُدرَّب. [ 13 ] [ 14 ] يحدث انهيار النموذج لثلاثة أسباب رئيسية:

  1. أخطاء التقريب الوظيفي
  2. أخطاء المعاينة
  3. أخطاء التعلم [ 9 ]

والأهم من ذلك، أن هذا يحدث حتى في أبسط النماذج، حيث لا تتواجد جميع مصادر الخطأ. أما في النماذج الأكثر تعقيداً، فغالباً ما تتراكم الأخطاء، مما يؤدي إلى انهيار أسرع.

خلاف حول التأثير على أرض الواقع

يقل انهيار النموذج في النماذج التوليدية عندما تتراكم البيانات.

يحذر بعض الباحثين والمعلقين على انهيار النماذج من أن هذه الظاهرة قد تهدد بشكل جوهري تطوير الذكاء الاصطناعي التوليدي في المستقبل: فمع مشاركة البيانات المولدة بواسطة الذكاء الاصطناعي على الإنترنت، ستنتهي حتماً في مجموعات بيانات التدريب المستقبلية، والتي غالباً ما تُجمع من الإنترنت. وإذا كان التدريب على بيانات الذكاء الاصطناعي غير المصنفة (كميات كبيرة من البيانات الاصطناعية غير المصنفة) يؤدي حتماً إلى انهيار النموذج، فقد يُشكل ذلك مشكلة معقدة. [ 15 ]

مع ذلك، خالف باحثون آخرون هذا الرأي مؤخرًا، مُبينين أنه في حال تراكم البيانات الاصطناعية جنبًا إلى جنب مع البيانات المُولّدة بشريًا، يُمكن تجنب انهيار النموذج. [ 16 ] ويُجادل الباحثون بأن تراكم البيانات بمرور الوقت يُعد وصفًا أكثر واقعية للواقع من حذف جميع البيانات الموجودة سنويًا، وأن تأثير انهيار النموذج في العالم الحقيقي قد لا يكون كارثيًا كما يُخشى. [ 17 ]

يتناول فرع بديل من الأدبيات استخدام كاشفات التعلم الآلي والعلامات المائية لتحديد البيانات المولدة بواسطة النموذج وتصفيتها. [ 18 ] [ 19 ]

النماذج الرياضية للظاهرة

نموذج غاوسي أحادي البعد

في عام 2024، [ 9 ] تم بذل محاولة أولى لتوضيح الانهيار لأبسط نموذج ممكن - وهو نموذج توزيع طبيعي أحادي البعد باستخدام مقدرات غير متحيزة للمتوسط ​​والتباين، محسوبة على عينات من الجيل السابق.

ولتوضيح ذلك بشكل أدق، نقول إن البيانات الأصلية تتبع التوزيع الطبيعيX0شمال(μ،σ2){\displaystyle X^{0}\sim {\mathcal {N}}(\mu ,\sigma ^{2})}ونحن نمتلكم0{\displaystyle M_{0}}عيناتXج0{\displaystyle X_{j}^{0}}لج{1،...،م0}{\displaystyle j\in {\{\,1,\dots ,M_{0}\,{}\}}}. للدلالة على عينة عامةXجأنا{\displaystyle X_{j}^{i}}كعينةج{1،...،مأنا}{\displaystyle j\in {\{\,1,\dots ,M_{i}\,{}\}}}في جيلأنا{\displaystyle i}ثم يتم تقدير نموذج الجيل التالي باستخدام متوسط ​​العينة والتباين:

μأنا+1=1مأناجXجأنا؛σأنا+12=1مأنا-1ج(Xجأنا-μأنا+1)2.\displaystyle \mu _{i+1}={\frac {1}{M_{i}}}\sum _{j}X_{j}^{i};\quad \sigma _{i+1}^{2}={\frac {1}{M_{i}-1}}\sum _{j}(X_{j}^{i}-\mu _{i+1})^{2}.}

مما يؤدي إلى نموذج الجيل التالي الطبيعي المشروطXجأنا+1|μأنا+1،σأنا+1شمال(μأنا+1،σأنا+12){\displaystyle X_{j}^{i+1}|\mu _{i+1},\;\sigma _{i+1}\sim {\mathcal {N}}(\mu _{i+1},\sigma _{i+1}^{2})}نظرياً، هذا يكفي لحساب التوزيع الكامل لـXجأنا{\displaystyle X_{j}^{i}}ومع ذلك، حتى بعد الجيل الأول، لم يعد التوزيع الكامل طبيعيًا: بل يتبع توزيع جاما التباين .

لمواصلة التحليل، بدلاً من كتابة دالة كثافة الاحتمال في كل جيل، من الممكن بناؤها صراحةً بدلالة المتغيرات العشوائية المستقلة باستخدام نظرية كوكران . وبالتحديد،μ1{\displaystyle \mu _{1}}وσ1{\displaystyle \sigma _{1}}مستقلون، معμ1شمال(μ،σ2م0){\displaystyle \mu _{1}\sim {\mathcal {N}}\left(\mu ,{\frac {\sigma ^{2}}{M_{0}}}\right)}و(م0-1)σ12σ2Γ(م0-12،12){\displaystyle (M_{0}-1)\,\sigma _{1}^{2}\sim \sigma ^{2}\,\Gamma \left({\frac {M_{0}-1}{2}},{\frac {1}{2}}\right)}، وفقًا لتوزيع جاما . بالرمز إلىZ{\displaystyle Z}المتغيرات العشوائية الغاوسية موزعة وفقًا لـشمال(0،1){\displaystyle {\mathcal {N}}(0,1)}ومعSأنا{\displaystyle S^{i}}المتغيرات العشوائية موزعة وفقًا لـ1مأنا-1-1Γ(مأنا-1-12،12){\displaystyle {\frac {1}{M_{i-1}-1}}\Gamma \left({\frac {M_{i-1}-1}{2}},{\frac {1}{2}}\right)}اتضح أنه من الممكن كتابة عينات في كل جيل على النحو التالي:

Xج0=μ+σZج0،{\textstyle X_{j}^{0}=\mu +\sigma Z_{j}^{0},}

Xج1=μ+σم0Z1+σS1Zج1،{\textstyle X_{j}^{1}=\mu +{\frac {\sigma }{\sqrt {M_{0}}}}Z^{1}+\sigma {\sqrt {S^{1}}}Z_{j}^{1},}

وبشكل أعم

Xجن=μ+σم0Z1+σم1S1Z2++σمن-1S1××Sن-1Zن+σS1××SنZجن.{\displaystyle X_{j}^{n}=\mu +{\frac {\sigma }{\sqrt {M_{0}}}}Z^{1}+{\frac {\sigma }{\sqrt {M_{1}}}}{\sqrt {S^{1}}}Z^{2}+\dots +{\frac {\sigma }{\sqrt {M_{n-1}}}}{\sqrt {S^{1}\times \dots \times S^{n-1}}}Z^{n}+\sigma {\sqrt {S^{1}\times \dots \times S^{n}}}Z_{j}^{n}.}

لاحظ أن هذه ليست توزيعات مشتركة، كماZن{\displaystyle Z^{n}}وSن{\displaystyle S^{n}}يعتمد بشكل مباشر علىZجن-1{\displaystyle Z_{j}^{n-1}}لكن عند النظرXجن{\displaystyle X_{j}^{n}}توفر الصيغة المذكورة أعلاه، بمفردها، جميع المعلومات المتعلقة بالتوزيع الكامل.

To analyse the model collapse, we can first calculate variance and mean of samples at generation n{\displaystyle n}. This would tell us what kind of distributions we expect to arrive at after n{\displaystyle n} generations. It is possible to find its exact value in closed form, but the mean and variance of the square root of gamma distribution are expressed in terms of gamma functions, making the result quite clunky. Following,[9] it is possible to expand all results to second order in each of 1/Mi{\displaystyle 1/M_{i}}, assuming each sample size to be large. It is then possible to show that

1σ2Var(Xjn)=1M0+1M1++1Mn1+1+O(Mi2).{\displaystyle {\frac {1}{\sigma ^{2}}}\operatorname {Var} (X_{j}^{n})={\frac {1}{M_{0}}}+{\frac {1}{M_{1}}}+\dots +{\frac {1}{M_{n-1}}}+1+{\mathcal {O}}\left(M_{i}^{-2}\right).}

And if all sample sizes Mi=M{\displaystyle M_{i}=M} are constant, this diverges linearly as n{\displaystyle n\to \infty }:

Var(Xjn)=σ2(1+nM);E(Xjn)=μ.{\displaystyle \operatorname {Var} (X_{j}^{n})=\sigma ^{2}\left(1+{\frac {n}{M}}\right);\quad \mathbb {E} (X_{j}^{n})=\mu .}

This is the same scaling as for a single dimensional Gaussian random walk. However, divergence of the variance of Xjn{\displaystyle X_{j}^{n}} does not directly provide any information about the corresponding estimates of μn+1{\displaystyle \mu _{n+1}} and σn+1{\displaystyle \sigma _{n+1}}, particularly how different they are from the original μ{\displaystyle \mu } and σ{\displaystyle \sigma }. It turns out to be possible to calculate the distance between the true distribution and the approximated distribution at step n+1{\displaystyle n+1}, using the Wasserstein-2 distance (which is also sometimes referred to as risk):

E[W22(N(μ,σ2),N(μn+1,σn+12))]=32σ2(1M0+1M1++1Mn)+O(Mi2),{\displaystyle \mathbb {E} \left[\mathbb {W} _{2}^{2}\left({\mathcal {N}}(\mu ,\sigma ^{2}),{\mathcal {N}}(\mu _{n+1},\sigma _{n+1}^{2})\right)\right]={\frac {3}{2}}\sigma ^{2}\left({\frac {1}{M_{0}}}+{\frac {1}{M_{1}}}+\dots +{\frac {1}{M_{n}}}\right)+{\mathcal {O}}\left(M_{i}^{-2}\right),}

Var[W22(N(μ,σ2),N(μn+1,σn+12))]=12σ4(3M02+3M12++3Mn2+ij4MiMj)+O(Mi3).{\displaystyle \operatorname {Var} \left[\mathbb {W} _{2}^{2}\left({\mathcal {N}}(\mu ,\sigma ^{2}),{\mathcal {N}}(\mu _{n+1},\sigma _{n+1}^{2})\right)\right]={\frac {1}{2}}\sigma ^{4}\left({\frac {3}{M_{0}^{2}}}+{\frac {3}{M_{1}^{2}}}+\dots +{\frac {3}{M_{n}^{2}}}+\sum _{i\neq j}{\frac {4}{M_{i}M_{j}}}\right)+{\mathcal {O}}\left(M_{i}^{-3}\right).}

This directly shows why model collapse occurs in this simple model. Due to errors from re-sampling the approximated distribution, each generation ends up corresponding to a new step in a random walk of model parameters. For a constant sample size at each generation, the average distance from the starting point diverges, and in order for the end distribution approximation to be accurate, or for the distance to be finite, the sampling rate Mi{\displaystyle M_{i}} needs to increase superlinearly, i.e. one needs to collect increasingly more samples over time, perhaps quadratically. However, even in that case the expected distance after n{\displaystyle n} steps remains non-zero and the only case in which it does in fact end up being zero is when sampling is infinite at each step. Overall, this only shows us how far on average one ends up from the original distribution, but the process can only "terminate", if the estimated variance at a certain generation becomes small enough, effectively turning the distribution into a delta function. This is shown to occur for a general gaussian model[13] in the subsection below. Empirical investigation has confirmed this theoretical analysis.[20]

N-D Gaussian model

Furthermore, in the case of multidimensional model with fully synthetic data, exact collapse can be shown.[13][9]

Linear regression

In the case of a linear regression model,[21][22]scaling laws and bounds on learning can be obtained.

Statistical language model

في حالة مصنف softmax الخطي للتنبؤ بالرمز التالي، [ 23 ] يمكن الحصول على حدود دقيقة للتعلم حتى مع مجموعة بيانات اصطناعية جزئيًا.

التأثير على نماذج اللغة الكبيرة

في سياق نماذج اللغة الكبيرة ، وجدت الأبحاث أن تدريب نماذج اللغة الكبيرة على النصوص المولدة من النماذج السابقة - حيث يتم تدريب نماذج اللغة على البيانات الاصطناعية التي تنتجها النماذج السابقة - يؤدي إلى انخفاض مستمر في التنوع المعجمي والنحوي والدلالي لمخرجات النموذج من خلال التكرارات المتتالية، لا سيما بالنسبة للمهام التي تتطلب مستويات عالية من الإبداع. [ 24 ]

تنوع مخرجات النموذج

مع إعادة تدريب النماذج على مخرجات مأخوذة بشكل غير متناسب من مركز التوزيع ذي الاحتمالية الأعلى، تُعد الكلمات النادرة والتراكيب النحوية غير الشائعة من بين أولى السمات التي تختفي. [ 25 ] وقد أظهر التحليل الإحصائي لتدريب التنبؤ المتكرر بالرمز التالي أنه عند تدريب نماذج اللغة بشكل متكرر على بيانات اصطناعية، فإن التوزيعات الشرطية المُتعلمة تُركز كتلة الاحتمالية على مجموعة فرعية صغيرة من التتابعات عالية التنبؤ (وهي ظاهرة تُوصف بأنها "انهيار تام"). [ 26 ]

بشكل منفصل، يُعزى انخفاض تنوع المخرجات في نماذج التعلم المعزز من خلال التغذية الراجعة البشرية (LLMs) إلى إجراءات الضبط الدقيق بعد التدريب، وليس إلى التدريب المتكرر على بيانات اصطناعية. وقد وُجد أن التعلم المعزز من خلال التغذية الراجعة البشرية (RLHF) وطرق تحسين التفضيلات ذات الصلة، التي تُحسّن النماذج لتتوافق مع الاستجابات المفضلة لدى البشر، تُقلل من تنوع المخرجات على مستوى النص المُولّد. [ 27 ] أظهر تحليل مُحكم لخط أنابيب RLHF أنه، مقارنةً بالضبط الدقيق الخاضع للإشراف، حسّن RLHF التعميم على المدخلات الخارجة عن التوزيع، ولكنه قلل بشكل كبير من تنوع المخرجات، وهي علاقة تُوصف بأنها مُفاضلة بين التعميم والتنوع . [ 27 ] وقد لوحظ هذا التأثير أيضًا على المستوى المفاهيمي: فعندما تُعامل مخرجات النموذج كعينات من مجتمع مُحاكٍ، تُظهر النماذج المُتوافقة تنوعًا مفاهيميًا أقل من نظيراتها غير المُتوافقة، على الرغم من أن أيًا من النماذج المدروسة لم يصل إلى مستوى التنوع الموجود في المجتمعات البشرية. [ 28 ] يُوصف التقارب نحو مجموعة ضيقة من الاستجابات ذات المكافأة العالية في ظل الضبط الدقيق القائم على التعلم المعزز أحيانًا بأنه شكل من أشكال انهيار النموذج ؛ وهذا يرتبط بالشكل التكراري لانهيار النموذج الموصوف أعلاه، ولكنه يختلف عنه من الناحية الآلية، لأنه لا يتطلب بيانات اصطناعية في مجموعة التدريب. [ 27 ]

قياس

طُوِّرت مقاييس مُخصصة لقياس انخفاضات تنوّع المخرجات. يُقدِّر مؤشر فيندي، المُستند إلى مفاهيم من علم البيئة ونظرية المعلومات ، العدد الفعلي للعناصر المُميزة في عينة دون الحاجة إلى مجموعة بيانات مرجعية. [ 29 ] وقد طُبِّق هذا المؤشر لتوصيف انهيار الأنماط، مُبينًا أن النماذج التوليدية التي تُعيد إنتاج كل نمط مُصنَّف في مجموعة بيانات قد تكون مع ذلك أقل تنوّعًا بشكل كبير من البيانات الأصلية. [ 29 ] بالنسبة للغة تحديدًا، تم تقسيم التنوّع إلى أبعاد قابلة للقياس بشكل منفصل (معجمية، نحوية، ودلالية) مع مقاييس مُخصصة طُوِّرت لتجارب التدريب التكراري. [ 24 ] تعمل أدوات أخرى على مستويات أعلى من البنية، مثل مؤشر سوي جينيريس ، الذي يقيس تفرّد عناصر الحبكة لتقييم التنوّع في توليد السرد. [ 30 ]

التخفيف

تندرج الاستجابات المقترحة لفقدان التنوع ضمن عدة فئات. تعالج تقنيات تصفية البيانات ووضع العلامات المائية، التي نوقشت في سياق انهيار النموذج بشكل أوسع أعلاه، مشكلة تكوين بيانات التدريب من خلال تحديد النصوص التي يُنشئها النموذج واستبعادها قبل إعادة إدخالها في مجموعات بيانات التدريب. [ 31 ] [ 32 ] ويُعدّل نهج آخر هدف الضبط الدقيق نفسه: نظرًا لأن هدف الإنتروبيا المتقاطعة القياسي يزيد من احتمالية المخرجات المرصودة دون الحفاظ على البدائل، فقد اقتُرحت طرق تتضمن تنظيم الإنتروبيا للحد من الإفراط في الحفظ والحفاظ على تنوع المخرجات مع الحفاظ على أداء المهمة. [ 33 ] كما أُفيد بأن الحفاظ على تنوع المخرجات بهذه الطريقة يُحسّن الأداء في ظل أخذ العينات المتكرر أثناء الاستدلال. [ 33 ]

تداعيات أوسع

يربط بعض الباحثين انخفاض تنوع المخرجات بمخاوف أوسع نطاقًا بشأن التجانس الثقافي والمعرفي. وقد أشارت دراسات التعاون بين الإنسان والذكاء الاصطناعي إلى أن المساعدة التوليدية يمكن أن ترفع من جودة المساهمات الفردية مع تقليل التنوع الجماعي للأعمال الناتجة، [ 34 ] كما وجدت تحليلات توليد القصص على نطاق واسع أن مخرجات النماذج غالبًا ما تعيد تجميع مجموعة محدودة من عناصر الحبكة. [ 30 ] وقد رُبطت هذه الأنماط باحتمالية تضييق نطاق الأفكار المتاحة للجمهور، وهو ما يُطلق عليه أحيانًا انهيار المعرفة. [ 35 ] وقد طُرحت فكرة أن الحفاظ على التنوع عبر منظومة من النماذج المتميزة، بدلًا من الاعتماد على عدد قليل من الأنظمة المتشابهة، قد يساعد في مواجهة هذا التوجه، وإن كان ذلك إلى حد معين فقط. [ 35 ]

انظر أيضاً

مراجع

  1. ""التزاوج الداخلي بين الأجيال" وخطره على الثقافة الإنسانية" . 26 أغسطس 2023.
  2. "قد يختنق الذكاء الاصطناعي بعوادمه الخاصة وهو يملأ الشبكة" . 28 أغسطس 2023.
  3. "أكل لحوم البشر في الذكاء الاصطناعي والقانون - مجلة قانون التكنولوجيا في كولورادو" .
  4. "الحالة الغريبة لأكل الذكاء الاصطناعي للحوم البشر والحلول الممكنة" . 26 يوليو 2023.،
  5. "هل هي نماذج ذكاء اصطناعي ناتجة عن التزاوج الداخلي، أم هراء، أم مجرد جنون؟ تحذيرات متزايدة بشأنها" . فرانس 24. 5 أغسطس 2024. تاريخ الاطلاع: 31 ديسمبر 2024 .
  6. "نموذج اضطراب الالتهام الذاتي - مبادرة لايفسكو حول علم الأعصاب والسرد والذكاء الاصطناعي" .
  7. "الذكاء الاصطناعي التوليدي يصاب بالجنون عند تدريبه على بيانات أنشأها الذكاء الاصطناعي لأكثر من خمس مرات" . 12 يوليو 2023.
  8. أليمحمد، سينا؛ كاسكو-رودريغيز، خوسيه؛ لوزي، لورينزو؛ أحمد امتياز همايون؛ بابائي، حسين؛ ليجون، دانيال؛ سياكوهي، علي؛ بارانيوك، ريتشارد ج. (2023). "النماذج التوليدية المستهلكة ذاتيًا تتجه نحو الجنون". arXiv : 2307.01850 [ cs.LG ].
  9. 123456Shumailov, Ilia; Shumaylov, Zakhar; Zhao, Yiren; Papernot, Nicolas; Anderson, Ross; Gal, Yarin (July 2024). "AI models collapse when trained on recursively generated data". Nature. 631 (8022): 755–759. Bibcode:2024Natur.631..755S. doi:10.1038/s41586-024-07566-y. ISSN 1476-4687. PMC 11269175. PMID 39048682.
  10. Wyllie, Sierra; Shumailov, Ilia; Papernot, Nicolas (2024-06-05). "Fairness Feedback Loops: Training on Synthetic Data Amplifies Bias". The 2024 ACM Conference on Fairness, Accountability, and Transparency. FAccT '24. New York, NY, USA: Association for Computing Machinery. pp. 2113–2147. arXiv:2403.07857. doi:10.1145/3630106.3659029. ISBN 979-8-4007-0450-5.
  11. Shumailov, Ilia; Shumaylov, Zakhar; Zhao, Yiren; Gal, Yarin; Papernot, Nicolas; Anderson, Ross (2023-05-31). "The Curse of Recursion: Training on Generated Data Makes Models Forget". arXiv:2305.17493 [cs.LG].
  12. Mok, Aaron. "A disturbing AI phenomenon could completely upend the internet as we know it". Business Insider. Retrieved 2024-03-06.
  13. 123Alemohammad, Sina; Casco-Rodriguez, Josue; Luzi, Lorenzo; Humayun, Ahmed Imtiaz; Babaei, Hossein; LeJeune, Daniel; Siahkoohi, Ali; Baraniuk, Richard G. (July 4, 2023). "Self-Consuming Generative Models Go MAD". arXiv:2307.01850 [cs.LG].
  14. Self-Consuming Generative Models Go MAD. The Twelfth International Conference on Learning Representations.
  15. "What is Model Collapse and how to avoid it". The Register. Retrieved 11 July 2024.
  16. Gerstgrasser, Matthias; Schaeffer, Rylan; Dey, Apratim; Rafailov, Rafael; Sleight, Henry; Hughes, John; Korbak, Tomasz; Agrawal, Rajashree; Pai, Dhruv; Gromov, Andrey; Roberts, Daniel A.; Yang, Diyi; Donoho, David L.; Koyejo, Sanmi (2024-04-01). "Is Model Collapse Inevitable? Breaking the Curse of Recursion by Accumulating Real and Synthetic Data". arXiv:2404.01413 [cs.LG].
  17. "Big brains divided over training AI with more AI: Is model collapse inevitable?". The Register. Retrieved 11 July 2024.
  18. Kirchenbauer, John; Geiping, Jonas; Wen, Yuxin; Katz, Jonathan; Miers, Ian; Goldstein, Tom (2023-07-03). "A Watermark for Large Language Models". Proceedings of the 40th International Conference on Machine Learning. PMLR: 17061–17084.
  19. "My AI Safety Lecture for UT Effective Altruism". Shtetl-Optimized. 2022-11-29. Retrieved 2024-06-22.
  20. Borji, Ali (2024-10-16). "A Note on Shumailov et al. (2024): "AI Models Collapse When Trained on Recursively Generated Data"". arXiv:2410.12954 [cs.LG].
  21. Dohmatob, Elvis; Feng, Yunzhen; Kempe, Julia (2024-02-12). "Model Collapse Demystified: The Case of Regression". arXiv:2402.07712 [cs.LG].
  22. Dohmatob, Elvis; Feng, Yunzhen; Yang, Pu; Charton, Francois; Kempe, Julia (2024-02-10). "A Tale of Tails: Model Collapse as a Change of Scaling Laws". arXiv:2402.07043 [cs.LG].
  23. Seddik, Mohamed El Amine; Chen, Suei-Wen; Hayou, Soufiane; Youssef, Pierre; Debbah, Merouane (2024-04-07). "How Bad is Training on Synthetic Data? A Statistical Analysis of Language Model Collapse". arXiv:2404.05090 [cs.LG].
  24. 12Guo, Yanzhu; Shang, Guokan; Vazirgiannis, Michalis; Clavel, Chloé (2024-04-16). "The Curious Decline of Linguistic Diversity: Training Language Models on Synthetic Text". arXiv:2311.09807 [cs.CL].
  25. Briesch, Martin; Sobania, Dominik; Rothlauf, Franz (2023). "Large Language Models Suffer From Their Own Output: An Analysis of the Self-Consuming Training Loop". arXiv:2311.16822 [cs.CL].
  26. Seddik, Mohamed El Amine; Chen, Suei-Wen; Hayou, Soufiane; Youssef, Pierre; Debbah, Merouane (2024). "How Bad is Training on Synthetic Data? A Statistical Analysis of Language Model Collapse". arXiv:2404.05090 [cs.LG].
  27. 1 2 3 كيرك، روبرت؛ ميديراتا، إيشيتا؛ نالمبانتيس، خريستوفوروس؛ لوكيتينا، يلينا؛ هامبرو، اريك. جريفنستيت، إدوارد؛ رايليانو، روبرتا (2024). “فهم آثار RLHF على التعميم والتنوع LLM”. أرخايف : 2310.06452 [ cs.LG ].
  28. مورثي، سونيا كريشنا؛ أولمان، تومر؛ هو، جينيفر (2025). "سمكة واحدة، سمكتان، ولكن ليس البحر كله: المحاذاة تقلل من التنوع المفاهيمي لنماذج اللغة". arXiv : 2411.04427 [ cs.CL ].
  29. 1 2 فريدمان، دان؛ دينغ، أدجي بوسو (2022). "مؤشر فيندي: مقياس لتقييم التنوع في التعلم الآلي". arXiv : 2210.02410 [ cs.LG ].
  30. 1 2 Xu, Weijia; Jojic, Nebojsa; Rao, Sudha; Brockett, Chris; Dolan, Bill (2025). "أصداء في الذكاء الاصطناعي: قياس نقص تنوع الحبكات في مخرجات نماذج التعلم الآلي". وقائع الأكاديمية الوطنية للعلوم . 122 (35). doi : 10.1073/pnas.2504966122 .
  31. كيرشنباور، جون؛ جيبينغ، جوناس؛ وين، يوكسين؛ كاتز، جوناثان؛ مايرز، إيان؛ غولدشتاين، توم (2023-07-03). "علامة مائية لنماذج اللغة الكبيرة" . وقائع المؤتمر الدولي الأربعين للتعلم الآلي . PMLR: 17061–17084 .
  32. جيرستجراسر، ماتياس؛ شايفر، رايلان؛ دي، أبراتيم؛ رافائيلوف، رافائيل؛ وآخرون . (2024-04-01). "هل انهيار النموذج أمر لا مفر منه؟ كسر لعنة التكرار من خلال تجميع البيانات الحقيقية والاصطناعية". arXiv : 2404.01413 [ cs.LG ]. 
  33. 1 2 لي، زينيو؛ تشن، كونجليانج؛ شو، تيان؛ تشين، زيو؛ شياو، جيانكونج؛ لو، تشي تشيوان؛ صن ، رويو (2024). “الحفاظ على التنوع في الضبط الدقيق الخاضع للإشراف لنماذج اللغات الكبيرة”. أرخايف : 2408.16673 [ cs.LG ].
  34. دوشي، أنيل ر.؛ هاوزر، أوليفر ب. (2024). "الذكاء الاصطناعي التوليدي يعزز الإبداع الفردي ولكنه يقلل من التنوع الجماعي للمحتوى الجديد". مجلة ساينس أدفانسز . 10 (28). doi : 10.1126/sciadv.adn5290 .
  35. 1 2 هودل، داميان؛ ويست، جيفين د. (2025). "التنوع المعرفي عبر نماذج اللغة يخفف من انهيار المعرفة". arXiv : 2512.15011 [ cs.LG ].