نموذج الانتشار
في مجال تعلم الآلة ، تُعدّ نماذج الانتشار ، المعروفة أيضًا بنماذج التوليد القائمة على الانتشار أو نماذج التوليد القائمة على الدرجات ، فئةً من نماذج التوليد القائمة على المتغيرات الكامنة . يتكون نموذج الانتشار من عنصرين رئيسيين: عملية الانتشار الأمامي، وعملية أخذ العينات العكسية. يهدف نموذج الانتشار إلى تعلّم عملية انتشار لمجموعة بيانات معينة، بحيث تُولّد هذه العملية عناصر جديدة موزعة بشكل مشابه لمجموعة البيانات الأصلية. يُحاكي نموذج الانتشار البيانات كما لو كانت مُولّدة بواسطة عملية انتشار، حيث تقوم البيانات الجديدة بحركة عشوائية مع انحراف عبر فضاء جميع البيانات الممكنة. [ 1 ] يمكن أخذ عينات من نموذج الانتشار المُدرّب بطرق عديدة، بكفاءات وجودة متفاوتة.
توجد العديد من الصيغ المكافئة، بما في ذلك سلاسل ماركوف ، ونماذج الانتشار الاحتمالية لإزالة التشويش، وشبكات النقاط المشروطة بالتشويش، والمعادلات التفاضلية العشوائية. [ 2 ] ويتم تدريبها عادةً باستخدام الاستدلال التبايني . [ 3 ] يُطلق على النموذج المسؤول عن إزالة التشويش عادةً اسم " العمود الفقري ". قد يكون العمود الفقري من أي نوع، ولكنه عادةً ما يكون من نوع U-net أو المحولات .
اعتبارًا من عام 2024تُستخدم نماذج الانتشار بشكل أساسي في مهام رؤية الحاسوب ، بما في ذلك إزالة التشويش من الصور ، وترميم الصور ، وتحسين دقة الصور ، وتوليد الصور ، وتوليد الفيديو. وتتضمن هذه العمليات عادةً تدريب شبكة عصبية لإزالة التشويش من الصور المشوشة بضوضاء غاوسية بشكل متسلسل . [ 1 ] [ 4 ] يُدرَّب النموذج لعكس عملية إضافة الضوضاء إلى الصورة. بعد التدريب حتى الوصول إلى التقارب، يمكن استخدامه لتوليد الصور من خلال البدء بصورة مكونة من ضوضاء عشوائية، وتطبيق الشبكة بشكل تكراري لإزالة التشويش من الصورة.
حظيت مولدات الصور القائمة على الانتشار باهتمام تجاري واسع النطاق، مثل Stable Diffusion و DALL-E . تجمع هذه النماذج عادةً بين نماذج الانتشار ونماذج أخرى، مثل مشفرات النصوص ووحدات الانتباه المتبادل، للسماح بالتوليد المشروط بالنص. [ 5 ]
إلى جانب رؤية الحاسوب ، وجدت نماذج الانتشار تطبيقات في معالجة اللغة الطبيعية [ 6 ] مثل توليد النصوص [ 7 ] والتلخيص [ 8 ] وتوليد الصوت [ 9 ] والتعلم المعزز [ 10 ] [ 11 ] .
نموذج الانتشار لإزالة التشويش
الديناميكا الحرارية غير المتوازنة
تم تقديم نماذج الانتشار في عام 2015 كطريقة لتدريب نموذج يمكنه أخذ عينات من توزيع احتمالي شديد التعقيد. وقد استخدمت هذه النماذج تقنيات من الديناميكا الحرارية غير المتوازنة ، وخاصة الانتشار . [ 12 ]
لنتأمل، على سبيل المثال، كيف يمكن نمذجة توزيع جميع الصور التي تحدث في الطبيعة. كل صورة هي نقطة في فضاء جميع الصور، وتوزيع الصور التي تحدث في الطبيعة هو "سحابة" في الفضاء، والتي، بإضافة ضوضاء متكررة إلى الصور، تنتشر إلى بقية فضاء الصورة، حتى تصبح السحابة غير قابلة للتمييز تقريبًا عن التوزيع الغاوسي.يمكن استخدام نموذج قادر على عكس عملية الانتشار تقريبًا لأخذ عينات من التوزيع الأصلي. تُدرس هذه الظاهرة في الديناميكا الحرارية "غير المتوازنة"، حيث أن التوزيع الابتدائي ليس في حالة توازن، على عكس التوزيع النهائي.
التوزيع المتوازن هو التوزيع الغاوسيمع ملف PDFهذا مجرد توزيع ماكسويل-بولتزمان للجسيمات في بئر جهدعند درجة حرارة 1، ينتشر التوزيع الأولي، لكونه خارج حالة التوازن تمامًا، نحو توزيع التوازن، مُحدثًا خطوات عشوائية متحيزة تُمثل مجموعًا من العشوائية البحتة (مثل حركة براونية ) والانحدار التدريجي عبر بئر الجهد. العشوائية ضرورية: فلو خضعت الجسيمات للانحدار التدريجي فقط، لسقطت جميعها نحو نقطة الأصل، مما يؤدي إلى انهيار التوزيع.
نموذج الانتشار الاحتمالي لإزالة التشويش (DDPM)
اقترحت الورقة البحثية لعام 2020 نموذج الانتشار الاحتمالي لإزالة التشويش (DDPM)، والذي يحسن الطريقة السابقة عن طريق الاستدلال التبايني . [ 3 ] [ 13 ]
الانتشار الأمامي
لعرض النموذج، يلزم استخدام بعض الرموز.
- هي ثوابت ثابتة.
- التوزيع الطبيعي بمتوسطوالتباين، وهي دالة الكثافة الاحتمالية عند.
- يشير الخط العمودي إلى التكييف .
تبدأ عملية الانتشار الأمامي من نقطة بداية معينة، أينهو التوزيع الاحتمالي المراد تعلمه، ثم يضيف إليه ضوضاء بشكل متكرر بواسطةأينهي عينات من متغيرات عشوائية مستقلة وموزعة توزيعًا متطابقًا (IID ) منالمعاملاتوتأكد منبافتراض أنقيميتم اختيارها بحيث يكون لأي توزيع ابتدائي لـإذا كان لها عزم ثانٍ محدود، فإنيتقارب إلى.
وبذلك تُرضي عملية الانتشار بأكملهاأوأينهو ثابت معايرة وغالبًا ما يتم حذفه. على وجه الخصوص، نلاحظ أنهي عملية غاوسية ، مما يمنحنا حرية كبيرة في إعادة تحديد المعاملات . على سبيل المثال، من خلال المعالجة القياسية للعملية الغاوسية،لاحظ على وجه الخصوص أنه بالنسبة للكبيرالمتغيريتقارب إلىأي أنه بعد عملية انتشار طويلة بما فيه الكفاية، ينتهي بنا المطاف ببعضهذا قريب جدًا منمع جميع آثار الأصلذهب.
على سبيل المثال، بما أنيمكننا أخذ عيناتمباشرة "في خطوة واحدة"، بدلاً من المرور بجميع الخطوات الوسيطة.
نحن نعلمهو توزيع غاوسي، وهو توزيع غاوسي آخر. ونعلم أيضاً أن هذين التوزيعين مستقلان. وبالتالي، يمكننا إعادة تحديد المعاملات:أينهي توزيعات غاوسية مستقلة ومتطابقة التوزيع.
هناك 5 متغيراتومعادلتان خطيتان. مصدرا العشوائية هما، والتي يمكن إعادة تحديد معالمها عن طريق الدوران، لأن التوزيع الغاوسي المستقل والمتطابق التوزيع متناظر دورانيًا.
من خلال إدخال المعادلات، يمكننا إيجاد الحل لإعادة تحديد المعلمات الأولى:أينهو توزيع غاوسي بمتوسط صفر وتباين واحد.
لإيجاد القيمة الثانية، نكمل مصفوفة الدوران:
بما أن المصفوفات الدورانية كلها من الشكلنعلم أن المصفوفة يجب أن تكونوبما أن معكوس المصفوفة الدورانية هو منقولها،
بالعودة إلى العمل وتبسيطه، لدينا
الانتشار العكسي
تتمثل الفكرة الأساسية لـ DDPM في استخدام شبكة عصبية ذات معلمات بواسطةتستقبل الشبكة وسيطين، ويُخرج متجهًاومصفوفةبحيث يمكن التراجع عن كل خطوة في عملية الانتشار الأمامي تقريبًا بواسطةوهذا بدوره يعطينا عملية انتشار عكسيمحدد بواسطةالهدف الآن هو تعلم المعاييربحيثأقرب ما يكون إلىقدر الإمكان. وللقيام بذلك، نستخدم تقدير الاحتمال الأقصى مع الاستدلال التبايني.
الاستدلال التبايني
تنص متباينة إلبو على أنوبإضافة توقع آخر، نحصل علىنلاحظ أن تعظيم الكمية على اليمين سيعطينا حدًا أدنى لاحتمالية البيانات المرصودة. وهذا يسمح لنا بإجراء الاستدلال التبايني.
حدد دالة الخسارةوالهدف الآن هو تقليل الخسارة عن طريق التدرج العشوائي . ويمكن تبسيط التعبير إلى [ 14 ]أينلا يعتمد على المعامل، وبالتالي يمكن تجاهله.كما أنه لا يعتمد على المعامل، المصطلحويمكن تجاهل ذلك أيضاً. وهذا لا يترك سوىمعيجب تقليلها إلى أدنى حد.
شبكة التنبؤ بالضوضاء
منذوهذا يشير إلى أنه ينبغي علينا استخدامومع ذلك، لا تملك الشبكة إمكانية الوصول إلىوبالتالي، يتعين عليه تقديرها بدلاً من ذلك. الآن، بما أنقد نكتب، أينهو نوع من الضوضاء الغاوسية غير المعروفة. الآن نرى أن التقديريعادل تقدير.
لذلك، دع الشبكة تُخرج متجه ضوضاءودعها تتنبأيبقى التصميماقترحت ورقة DDPM عدم تعلمها (لأنها تؤدي إلى "تدريب غير مستقر وجودة عينة أضعف")، ولكن تثبيتها عند قيمة معينة.، حيث إماوقد حقق أداءً مماثلاً.
وبهذا، تتبسط الخسارة إلىوالتي يمكن تقليلها عن طريق التدرج العشوائي. وقد أشارت الورقة البحثية تجريبياً إلى أن دالة خسارة أبسطوأدى ذلك إلى نماذج أفضل.
عملية الانتشار العكسي
بعد تدريب شبكة التنبؤ بالضوضاء، يمكن استخدامها لتوليد نقاط البيانات في التوزيع الأصلي في حلقة تكرارية كما يلي:
- احسب تقدير الضوضاء
- احسب تقدير البيانات الأصلية
- قم بمعاينة البيانات السابقة
- تغيير الوقت
نموذج توليدي قائم على الدرجات
يُعدّ النموذج التوليدي القائم على الدرجات صيغةً أخرى لنمذجة الانتشار. ويُطلق عليه أيضًا اسم شبكة الدرجات الشرطية للضوضاء (NCSN) أو مطابقة الدرجات مع ديناميكيات لانجفين (SMLD). [ 15 ] [ 16 ] [ 17 ] [ 18 ]
مطابقة النقاط
فكرة دوال التقييم
لنفترض مشكلة توليد الصور.لنمثل صورة، ولندعليكن توزيع الاحتمالات على جميع الصور الممكنة. إذا كان لديناإذا نظرنا إلى الصورة نفسها، يمكننا حينها أن نحدد بدقة مدى احتمالية ظهور صورة معينة. مع ذلك، فإن هذا الأمر غير قابل للحل عموماً.
في أغلب الأحيان، لا يهمنا معرفة الاحتمالية المطلقة لظهور صورة معينة. بدلاً من ذلك، يهمنا عادةً معرفة مدى احتمالية ظهور صورة معينة مقارنةً بالصور المجاورة لها مباشرةً - على سبيل المثال، ما مدى احتمالية ظهور صورة قطة مقارنةً ببعض الصور المصغرة لها؟ هل تزداد احتمالية ظهورها إذا احتوت الصورة على شعيرتين، أو ثلاث، أو مع إضافة بعض التشويش الغاوسي؟
وبالتالي، فإننا في الواقع غير مهتمين تمامًا بـبل بالأحرى،وهذا له تأثيران رئيسيان:
- أولاً، لم نعد بحاجة إلى التطبيع، ولكن يمكن استخدام أي، أينهو أي ثابت مجهول لا يهمنا.
- ثانيًا، نحن نقارنالجيران، بواسطة
لنفترض أن دالة النتيجة هيثم فكر فيما يمكننا فعله بـ.
وكما اتضح،يسمح لنا بأخذ عينات منباستخدام الديناميكا الحرارية. تحديدًا، إذا كان لدينا دالة طاقة كامنةوإذا كان هناك عدد كبير من الجسيمات في بئر الجهد، فإن التوزيع عند التوازن الديناميكي الحراري يكون توزيع بولتزمان.عند درجة الحرارةتوزيع بولتزمان هو بالضبط.
لذلك، لنمذجةيمكننا البدء بجسيم تم اختياره عشوائيًا من أي توزيع مناسب (مثل التوزيع الغاوسي القياسي)، ثم محاكاة حركة الجسيم للأمام وفقًا لمعادلة لانجفين. وتوزيع بولتزمان، وفقًا لمعادلة فوكر-بلانك، هو التوازن الديناميكي الحراري الوحيد . لذا بغض النظر عن التوزيعتوزيعيتقارب في التوزيع إلىمثل.
تعلم وظيفة التسجيل
بافتراض الكثافةنرغب في تعلم تقريب دالة التقييمهذا ما يُعرف بمطابقة الدرجات . [ 19 ] عادةً ما تُصاغ مطابقة الدرجات رسميًا على أنها تقليل دالة تباعد فيشرعن طريق توسيع التكامل، وإجراء التكامل بالتجزئة ،مما يعطينا دالة خسارة، تُعرف أيضًا باسم قاعدة تسجيل Hyvärinen ، والتي يمكن تقليلها عن طريق الانحدار التدرجي العشوائي.
تلدين دالة النتيجة
لنفترض أننا بحاجة إلى نمذجة توزيع الصور، ونريدصورة ضوضاء بيضاء. الآن، معظم صور الضوضاء البيضاء لا تبدو كصور حقيقية، لذالمساحات واسعة منيمثل هذا مشكلة في تعلم دالة التقييم، لأنه إذا لم تكن هناك عينات حول نقطة معينة، فلن نتمكن من تعلم دالة التقييم عند تلك النقطة. إذا لم نكن نعرف دالة التقييمعند هذه النقطة، لا يمكننا فرض معادلة التطور الزمني على الجسيم:لحل هذه المشكلة، نقوم بعملية التلدين . إذاإذا كان التوزيع مختلفًا جدًا عن توزيع الضوضاء البيضاء، نضيف الضوضاء تدريجيًا حتى يصبح غير قابل للتمييز عنه. أي أننا نجري عملية انتشار أمامي، ثم نتعلم دالة التقييم، ثم نستخدم دالة التقييم لإجراء عملية انتشار عكسي.
عمليات الانتشار المستمر
عملية الانتشار الأمامي
لننظر مرة أخرى في عملية الانتشار الأمامي، ولكن هذه المرة في زمن مستمر:عن طريق أخذفي النهاية، نحصل على عملية انتشار مستمرة، على شكل معادلة تفاضلية عشوائية :أينهي عملية وينر (حركة براونية متعددة الأبعاد).
الآن، تُعدّ المعادلة حالة خاصة من معادلة لانجفين ذات التخميد الزائد.أينهو موتر الانتشار،درجة الحرارة، وهو مجال طاقة كامنة. إذا استبدلنا فيوبذلك نستعيد المعادلة المذكورة أعلاه. وهذا يفسر سبب استخدام عبارة "ديناميكيات لانجفين" أحيانًا في نماذج الانتشار.
المعادلة أعلاه تصف الحركة العشوائية لجسيم واحد. لنفترض أن لدينا سحابة من الجسيمات موزعة وفقًا لـفي ذلك الوقتثم بعد فترة طويلة، ستستقر سحابة الجسيمات في التوزيع المستقر لـ. يتركلتكن كثافة سحابة الجسيمات في الزمنثم لديناوالهدف هو عكس العملية بطريقة ما، بحيث يمكننا البدء من النهاية والعودة إلى البداية.
وفقًا لمعادلة فوكر-بلانك ، تتطور كثافة السحابة وفقًا لـأينهو بُعد الفضاء، وهو عامل لابلاس . أو بعبارة أخرى،
عملية الانتشار العكسي
إذا كنا قد حللنالوقتعندها يمكننا عكس تطور السحابة تمامًا. لنفترض أننا بدأنا بسحابة أخرى من الجسيمات ذات كثافةودع الجسيمات في السحابة تتطور وفقًا لـ
ثم بالتعويض في معادلة فوكر-بلانك، نجد أنوبالتالي فإن هذه السحابة من النقاط هي السحابة الأصلية، التي تتطور إلى الوراء. [ 20 ]
شبكة النقاط الشرطية للضوضاء (NCSN)
عند الحد المستمر، وهكذا على وجه الخصوص، نرى أنه يمكننا أخذ عينات مباشرة من أي نقطة في عملية الانتشار المستمر دون المرور بالخطوات الوسيطة، وذلك عن طريق أخذ العينات أولاً.ثم احصل علىأي أنه يمكننا أخذ عينات بسرعةلأي.
والآن، حدد توزيعًا احتماليًا معينًازيادةثم يتم تعريف دالة خسارة مطابقة الدرجات على أنها تباعد فيشر المتوقع: بعد التدريب،لذلك يمكننا إجراء عملية الانتشار العكسي عن طريق أخذ العينات أولاًثم دمج المعادلة التفاضلية العشوائية منل: يمكن القيام بذلك عن طريق أي طريقة تكامل للمعادلات التفاضلية العشوائية، مثل طريقة أويلر-ماروياما .
يُفسَّر اسم "شبكة النتيجة الشرطية للضوضاء" على النحو التالي:
- "شبكة"، لأنيتم تنفيذه كشبكة عصبية.
- "النتيجة"، لأن مخرجات الشبكة تُفسر على أنها تقارب دالة النتيجة.
- "مشروط بالضوضاء"، لأنيساوييتم تشويشها بواسطة ضوضاء غاوسية مضافة تزداد مع مرور الوقت، وبالتالي تعتمد دالة النتيجة على مقدار الضوضاء المضافة.
تكافؤهما
تُعتبر نماذج DDPM والنماذج التوليدية القائمة على الدرجات متكافئة. [ 16 ] [ 1 ] [ 21 ] وهذا يعني أنه يمكن استخدام شبكة مُدرَّبة باستخدام DDPM كشبكة NCSN، والعكس صحيح.
نحن نعلم ذلكوبناءً على صيغة تويدي ، لدينا كما سبق ذكره، فإن دالة خسارة DDPM هيمع أينبتغيير المتغيرات، ويصبح الحد الداخلي انحدارًا للمربعات الصغرى، لذلك إذا وصلت الشبكة بالفعل إلى الحد الأدنى العالمي للخسارة، فسنحصل على
وبالتالي، إذا كانت الشبكة جيدة وتعتمد على الدرجات، فإن الدرجة المتوقعة لها تمثل تنبؤًا جيدًا للضوضاء (بعد تعديلها بمعامل معين).وبالتالي يمكن استخدامها لإزالة الضوضاء.
وعلى العكس من ذلك، فإن النهاية المستمرةالمعادلة العكسية يعطينا نفس المعادلة تمامًا مثل الانتشار القائم على النتيجة: وبالتالي، في الخطوات المتناهية الصغر لـ DDPM، تقوم شبكة إزالة الضوضاء بتنفيذ عملية الانتشار القائمة على الدرجات.
المتغيرات الرئيسية
جدول الضوضاء

في نظام DDPM، تسلسل الأرقاميُطلق عليه اسم جدول الضوضاء (الزمن المتقطع) . بشكل عام، ضع في اعتبارك دالة رتيبة متزايدة تمامًامن النوع، مثل دالة سيجمويد . في هذه الحالة، يكون جدول الضوضاء عبارة عن سلسلة من الأعداد الحقيقيةثم يحدد سلسلة من الضوضاءوالتي بدورها تستنتج الكميات الأخرى.
من أجل استخدام جداول الضوضاء العشوائية، بدلاً من تدريب نموذج التنبؤ بالضوضاءقطار واحد.
وبالمثل، بالنسبة لشبكة النتيجة الشرطية للضوضاء، بدلاً من التدريبقطار واحد.
نموذج انتشار تقليل الضوضاء الضمني (DDIM)
تُعد طريقة DDPM الأصلية لتوليد الصور بطيئة، لأن عملية الانتشار الأمامي تستغرق عادةًلتسهيل توزيعليظهر التوزيع قريبًا من التوزيع الغاوسي. ومع ذلك، فهذا يعني أن عملية الانتشار العكسي تستغرق أيضًا 1000 خطوة. على عكس عملية الانتشار الأمامي، التي يمكنها تخطي بعض الخطوات.التوزيع غاوسي للجميعلا تسمح عملية الانتشار العكسي بتجاوز الخطوات. على سبيل المثال، لأخذ عينةيتطلب ذلك من النموذج أولاً أخذ عينةمحاولة أخذ عينات مباشرةسيتطلب ذلك منا تهميشوهو أمر يصعب حله عموماً.
تُعدّ DDIM [ 22 ] طريقةً لأخذ أي نموذج مُدرَّب على خسارة DDPM، واستخدامها لأخذ عينات مع تخطي بعض الخطوات، مما يُؤدي إلى التضحية بقدرٍ قابلٍ للتعديل من الجودة. إذا قمنا بتحويل حالة سلسلة ماركوفية في DDPM إلى حالة غير ماركوفية، فإن DDIM تُطابق الحالة التي يكون فيها تباين العملية العكسية مساويًا للصفر. بعبارة أخرى، تكون العملية العكسية (وكذلك العملية الأمامية) حتمية. عند استخدام عدد أقل من خطوات أخذ العينات، تتفوق DDIM على DDPM.
بالتفصيل، طريقة أخذ العينات DDIM هي كما يلي. ابدأ بعملية الانتشار الأماميثم، أثناء عملية إزالة التشويش العكسي، بالنظر إلى، يتم تقدير البيانات الأصلية على النحو التاليعندها يمكن لعملية الانتشار العكسي أن تنتقل إلى أي خطوةوالعينة التالية التي تم إزالة التشويش منها هيأينهو عدد حقيقي اختياري ضمن النطاق، وهو ضوضاء غاوسية تم أخذ عينات منها حديثًا. [ 14 ] إذا كان كلثم تصبح العملية العكسية حتمية، وتُسمى هذه الحالة الخاصة من DDIM أيضًا "DDIM". وقد أشارت الورقة البحثية الأصلية إلى أنه عندما تكون العملية حتمية، فإن العينات المُولَّدة بـ 20 خطوة فقط تكون متشابهة جدًا مع تلك المُولَّدة بـ 1000 خطوة على المستوى العالي.
أوصت الورقة الأصلية بتحديد "قيمة إيتا" واحدة.بحيث. متىهذا هو الإصدار الأصلي من DDPM. عندماهذا هو نموذج DDIM الحتمي بالكامل. أما بالنسبة للقيم المتوسطة، فإن العملية تقوم بالاستيفاء بينها.
وبناءً على ذلك، تنطبق خوارزمية DDIM أيضًا على نماذج الانتشار القائمة على الدرجات.
نموذج الانتشار الكامن (LDM)
بما أن نموذج الانتشار هو طريقة عامة لنمذجة التوزيعات الاحتمالية، فإذا أردنا نمذجة توزيع على الصور، يمكننا أولاً ترميز الصور في فضاء ذي أبعاد أقل باستخدام مُشفِّر، ثم استخدام نموذج الانتشار لنمذجة التوزيع على الصور المُرمَّزة. بعد ذلك، لإنشاء صورة، يمكننا أخذ عينة من نموذج الانتشار، ثم استخدام مُفكِّك ترميز لتحويلها إلى صورة. [ 23 ]
غالباً ما يكون زوج المشفر-المفكك عبارة عن مشفر تلقائي متغير (VAE).
التحسينات المعمارية
[ 24 ] اقترحوا تحسينات معمارية متنوعة. على سبيل المثال، اقترحوا استخدام الاستيفاء اللوغاريتمي أثناء أخذ العينات العكسي. بدلاً من أخذ العينات منوقد أوصوا بأخذ عينات منبالنسبة لمعامل مُتعلم.
في صيغة التنبؤ v ، صيغة الضوضاءيتم إعادة تحديد المعلمات بواسطة زاويةبحيثو"سرعة" محددة بواسطةيتم تدريب الشبكة على التنبؤ بالسرعةويتم إزالة الضوضاء بواسطة[ 25 ] وُجد أن هذه المعلمة تُحسّن الأداء، حيث يمكن تدريب النموذج للوصول إلى مستوى الضوضاء الكلي (أيثم يعكسها، في حين أن المعايرة القياسية لا تصل أبدًا إلى الضوضاء الكاملة لأنصحيح دائمًا. [ 26 ]
توجيه المصنف
تم اقتراح توجيه المصنف في عام 2021 لتحسين توليد الصور المشروطة بالفئة باستخدام مصنف. استخدم المنشور الأصلي مشفرات نص CLIP لتحسين توليد الصور المشروطة بالنص. [ 27 ]
لنفترض أننا نرغب في أخذ عينة ليس من التوزيع الكامل للصور، بل بناءً على وصف الصورة. لا نريد أخذ عينة من صورة عامة، بل من صورة تتناسب مع الوصف "قطة سوداء بعيون حمراء". عمومًا، نريد أخذ عينة من التوزيع، أينتتراوح بين الصور، وتتراوح بين فئات الصور (وصف "قطة سوداء ذات عيون حمراء" هو مجرد فئة مفصلة للغاية، وفئة "قطة" هي مجرد وصف غامض للغاية).
من منظور نموذج القناة المشوشة ، يمكننا فهم العملية على النحو التالي: لتوليد صورةمشروط بالوصفنتصور أن مقدم الطلب كان يقصد صورة معينة بالفعللكن الصورة تمر عبر قناة مشوشة فتخرج مشوشة، كماإن توليد الصور ليس إلا استنتاجًا لماما كان في ذهن مقدم الطلب.
بمعنى آخر، توليد الصور المشروط هو ببساطة "ترجمة من لغة نصية إلى لغة تصويرية". ثم، كما هو الحال في نموذج القناة المشوشة، نستخدم نظرية بايز للحصول على بمعنى آخر، إذا كان لدينا نموذج جيد لفضاء جميع الصور، ومترجم جيد من الصورة إلى الفئة، فسنحصل على مترجم من الفئة إلى الصورة "مجانًا". في معادلة الانتشار العكسي، تكون النتيجةيمكن استبدالها بـ أينهي دالة التقييم، التي تم تدريبها كما هو موضح سابقًا، ويتم إيجادها باستخدام مصنف صور قابل للتفاضل.
خلال عملية الانتشار، نحتاج إلى مراعاة عامل الوقت، مما يعطيعلى الرغم من أن نموذج المصنف عادةً لا يعتمد على الوقت، ففي هذه الحالة.
يتم تعريف توجيه المصنف لتدرج دالة النتيجة، وبالتالي لشبكة الانتشار القائمة على النتيجة، ولكن كما ذُكر سابقًا، فإن نماذج الانتشار القائمة على النتيجة تُعادل نماذج إزالة التشويش بواسطةوبالمثل،لذلك، فإن توجيه المصنف يعمل على إزالة التشويش من الانتشار أيضًا، باستخدام التنبؤ المعدل بالضوضاء: [ 27 ]
مع درجة الحرارة
عينات نموذج الانتشار الموجه بالمصنف من، والتي تتركز حول التقدير اللاحق الأقصىإذا أردنا إجبار النموذج على التحرك نحو تقدير الاحتمال الأقصى، يمكننا استخدام أينيمكن تفسيرها على أنها مقلوب درجة الحرارة . في سياق نماذج الانتشار، تُسمى عادةً مقياس التوجيه . قيمة عاليةسيجبر ذلك النموذج على أخذ عينات من توزيع يتركز حولوهذا يحسن أحيانًا جودة الصور المُولَّدة. [ 27 ]
وهذا يُعطي تعديلاً للمعادلة السابقة:بالنسبة لنماذج إزالة الضوضاء، فإنها تتوافق مع [ 28 ]
التوجيه بدون استخدام المصنفات (CFG)
إذا لم يكن لدينا مصنف، لا يزال بإمكاننا استخراج واحد من نموذج الصورة نفسه: [ 28 ] يتم تدريب هذا النموذج عادةً من خلال تزويده بكل منومما يسمح له بنمذجة كليهماو.
تجدر الإشارة إلى أنه بالنسبة لـ CFG، لا يمكن أن يكون نموذج الانتشار مجرد نموذج توليدي لتوزيع البيانات بأكمله.يجب أن يكون نموذجًا توليديًا مشروطًاعلى سبيل المثال، في الانتشار المستقر، يأخذ هيكل الانتشار كمدخل نموذجًا مشوشًا، وقت، ومتجه تهيئة(مثل متجه يشفر مطالبة نصية)، وينتج تنبؤًا بالضوضاء.
بالنسبة لنماذج إزالة التشويش، فإن ذلك يتوافق معكما تم أخذ عينات منها بواسطة DDIM، يمكن كتابة الخوارزمية على النحو التالي [ 29 ]تُطبَّق تقنية مماثلة على أخذ عينات من نموذج اللغة. كذلك، إذا كان التوليد غير المشروطيتم استبدالها بـثم ينتج عن ذلك تحريض سلبي، مما يدفع الجيل بعيدًا عنالشرط. [ 30 ] [ 31 ]
عينات
بالنظر إلى نموذج الانتشار، يمكن اعتباره إما عملية مستمرة، وأخذ عينات منه عن طريق تكامل معادلة تفاضلية عشوائية، أو يمكن اعتباره عملية منفصلة، وأخذ عينات منه عن طريق تكرار الخطوات المنفصلة. اختيار " جدول الضوضاء "يمكن أن يؤثر ذلك أيضًا على جودة العينات. جدول الضوضاء هو دالة تُرسل عددًا طبيعيًا إلى مستوى الضوضاء:غالباً ما يتم تحديد جدول الضوضاء بواسطة خريطةالتعريفان متكافئان، لأن.
من منظور DDPM، يمكن استخدام DDPM نفسه (مع التشويش)، أو DDIM (مع مقدار قابل للتعديل من التشويش). تُسمى الحالة التي يُضاف فيها التشويش أحيانًا بأخذ العينات الأصلية. [ 32 ] يمكن إجراء استيفاء بين وجود التشويش وعدم وجوده. يُشار إلى مقدار التشويش بـ"قيمة إيتا" في ورقة DDIM، معيشير إلى عدم وجود ضوضاء (كما هو الحال في DDIM الحتمي )، ويشير إلى الضوضاء الكاملة (كما في DDPM).
من منظور المعادلات التفاضلية العشوائية، يمكن استخدام أي من طرق التكامل العددي ، مثل طريقة أويلر-ماروياما ، وطريقة هيون ، وطرق الخطوات المتعددة الخطية ، وما إلى ذلك. وكما هو الحال في الحالة المنفصلة، يمكن إضافة مقدار قابل للتعديل من الضوضاء أثناء التكامل. [ 33 ]
تم إجراء مسح ومقارنة لأدوات أخذ العينات في سياق توليد الصور. [ 34 ]
أمثلة أخرى
تشمل المتغيرات البارزة [ 35 ] نموذج توليد تدفق بواسون، [ 36 ] نموذج الاتساق، [ 37 ] انتشار لانجفين المخمد بشكل حرج، [ 38 ] GenPhys، [ 39 ] الانتشار البارد، [ 40 ] إلخ.
نموذج الانتشار القائم على التدفق
بصورة مجردة، تقوم فكرة نموذج الانتشار على أخذ توزيع احتمالي غير معروف (توزيع الصور ذات المظهر الطبيعي)، ثم تحويله تدريجيًا إلى توزيع احتمالي معروف (التوزيع الغاوسي القياسي)، وذلك من خلال بناء مسار احتمالي متصل تمامًا يربط بينهما. في الواقع، يتم تحديد المسار الاحتمالي ضمنيًا بواسطة دالة التقييم..
في نماذج الانتشار لإزالة التشويش، تُضيف العملية الأمامية التشويش، بينما تُزيله العملية العكسية. كلتا العمليتين عبارة عن معادلات تفاضلية عشوائية ، إلا أن العملية الأمامية قابلة للتكامل بصيغة مغلقة، لذا يمكن إجراؤها دون تكلفة حسابية. أما العملية العكسية، فهي غير قابلة للتكامل بصيغة مغلقة، لذا يجب تكاملها خطوة بخطوة باستخدام حلول المعادلات التفاضلية العشوائية القياسية، وهو ما قد يكون مكلفًا للغاية. يُعرَّف مسار الاحتمالية في نموذج الانتشار من خلال عملية إيتو ، ويمكن استرجاع العملية الحتمية باستخدام صيغة تدفق المعادلات التفاضلية العادية الاحتمالية. [ 1 ]
في نماذج الانتشار القائمة على التدفق، تمثل العملية الأمامية تدفقًا حتميًا على طول حقل متجهي متغير مع الزمن، بينما تمثل العملية العكسية أيضًا تدفقًا حتميًا على طول الحقل المتجهي نفسه، ولكن في الاتجاه المعاكس. كلا العمليتين هما حلول لمعادلات تفاضلية عادية . إذا كان الحقل المتجهي منتظمًا، فستكون المعادلة التفاضلية العادية منتظمة أيضًا.
بافتراض وجود توزيعينوالنموذج القائم على التدفق هو حقل سرعة يعتمد على الزمنفيبحيث إذا بدأنا بأخذ عينة من نقطةودعها تتحرك وفقًا لحقل السرعة: نصل في النهاية إلى نقطةالحلتحدد المعادلة التفاضلية العادية المذكورة أعلاه مسارًا احتماليًابواسطة عامل قياس الدفع الأمامي . على وجه الخصوص،.
كما أن مسار الاحتمالية وحقل السرعة يحققان معادلة الاستمرارية ، بمعنى توزيع الاحتمالية: لإنشاء مسار احتمالي، نبدأ بإنشاء مسار احتمالي شرطيوحقل السرعة الشرطي المقابلفي بعض التوزيعات الشرطيةيُعد مسار الاحتمال الشرطي الغاوسي خيارًا طبيعيًا: حقل السرعة الشرطي الذي يتوافق مع المسار الجيوديسي بين المسار الغاوسي الشرطي هو ثم يتم حساب مسار الاحتمالية وحقل السرعة عن طريق التهميش
التدفق الأمثل للنقل
تتمثل فكرة تدفق النقل الأمثل [ 41 ] في إنشاء مسار احتمالي يقلل من مقياس واسرشتين . التوزيع الذي نعتمد عليه هو تقريب لخطة النقل الأمثل بينو:و، أينتُعدّ خطة النقل المثلى هي الخطة التي يمكن تقريبها باستخدام النقل الأمثل للدفعات الصغيرة. إذا لم يكن حجم الدفعة كبيرًا، فقد يكون النقل الذي تحسبه بعيدًا جدًا عن النقل الأمثل الحقيقي.
التدفق المُقوَّم
تتمثل فكرة التدفق المُقوَّم [ 42 ] [ 43 ] في تعلم نموذج تدفق بحيث تكون السرعة ثابتة تقريبًا على طول كل مسار تدفق. وهذا مفيد، لأنه يمكننا إجراء التكامل على طول حقل متجه كهذا بخطوات قليلة جدًا. على سبيل المثال، إذا كانت معادلة تفاضلية عاديةباتباع مسارات مستقيمة تمامًا، يصبح الأمر أبسط إلىمما يسمح بإيجاد حلول دقيقة في خطوة واحدة. عمليًا، لا يمكننا الوصول إلى هذه الدرجة من الكمال، ولكن عندما يكون مجال التدفق قريبًا من ذلك، يمكننا اتخاذ خطوات كبيرة قليلة بدلًا من خطوات صغيرة كثيرة.
| الاستيفاء الخطي | التدفق المعدل | التدفق المستقيم والمقوم |
الفكرة العامة هي البدء بتوزيعينوثم قم بإنشاء مجال التدفقثم قم بتطبيق عملية "إعادة التدفق" بشكل متكرر للحصول على حقول تدفق متتالية.كل مسار أكثر استقامة من سابقه. وعندما يصبح مجال التدفق مستقيماً بما يكفي للتطبيق، نتوقف.
بشكل عام، بالنسبة لأي عملية قابلة للتفاضل الزمني،يمكن تقدير ذلك عن طريق حل ما يلي:
في التدفق المعدل، من خلال حقن معلومات مسبقة قوية مفادها أن المسارات الوسيطة مستقيمة، يمكن تحقيق كل من الأهمية النظرية للنقل الأمثل والكفاءة الحسابية، حيث يمكن محاكاة المعادلات التفاضلية العادية ذات المسارات المستقيمة بدقة دون تجزئة زمنية.

وبشكلٍ أدق، يسعى التدفق المصحح إلى مطابقة معادلة تفاضلية عادية مع التوزيعات الهامشية للاستيفاء الخطي بين النقاط من التوزيعات.وبالنظر إلى الملاحظاتوالاستيفاء الخطي المتعارف عليهينتج عنه حالة تافهةوالتي لا يمكن محاكاتها سببيًا بدونولمعالجة هذا الأمر،يتم "إسقاطها" في فضاء من المعادلات التفاضلية العادية القابلة للمحاكاة السببية، عن طريق تقليل خسارة المربعات الصغرى بالنسبة للاتجاه:
زوج البياناتيمكن أن يكون أي اقتران منو، عادةً ما تكون مستقلة (أي) تم الحصول عليها من خلال الجمع العشوائي للملاحظات منوتضمن هذه العملية أن تعكس المسارات بدقة خريطة الكثافة لـالمسارات ولكن إعادة التوجيه عند التقاطعات لضمان السببية.

من السمات المميزة للتدفق المُقوَّم قدرته على " إعادة التدفق "، مما يُقوِّم مسار المعادلات التفاضلية العادية. لنرمز إلى التدفق المُقوَّم بـناتج عنمثلتطبيق هذا بشكل متكرريقوم المشغل بإنشاء سلسلة من التدفقات المصححةلا تقتصر عملية "إعادة التدفق" هذه على تقليل تكاليف النقل فحسب، بل تعمل أيضًا على تقويم مسارات التدفقات المُصححة، مما يجعلتصبح المسارات أكثر استقامة مع زيادة.
يتضمن التدفق المُقوَّم امتدادًا غير خطي حيث يكون الاستيفاء الخطييتم استبدالها بأي منحنى قابل للتفاضل زمنيًا يربطو، مقدمة منيشمل هذا الإطار المعادلات التفاضلية العادية ذات التدفق الاحتمالي ونماذج DDIM كحالات خاصة، مع خيارات محددة لـوومع ذلك، في حالة مسارإذا لم يكن مستقيماً، فإن عملية إعادة التدفق لم تعد تضمن تقليل تكاليف النقل المحدبة، كما أنها لم تعد تعمل على تقويم مسارات[ 42 ]
تم اكتشاف هذه الصيغ الخطية للتدفق بشكل مستقل وتكييفها من منظور مختلف لمسائل المعالجة العكسية الخاضعة للإشراف. على سبيل المثال، تقوم طريقة الانعكاس بالتكرار المباشر (InDI) بصياغة استعادة الصور من خلال تعلم معادلة تفاضلية عادية للتدفق المتبقي، والتي تعكس بشكل تكراري عملية الاستيفاء الخطي بين مدخلات متدهورة وهدف عالي الجودة لتجنب الانحدار نحو المتوسط. تُعد InDI فعالة لمجموعة متنوعة من مهام استعادة الصور. [ 44 ]
اختيار الهندسة المعمارية


نموذج الانتشار
لإنشاء الصور باستخدام DDPM، نحتاج إلى شبكة عصبية تستغرق وقتًاوصورة مشوشةويتوقع حدوث ضوضاءمنه. بما أن التنبؤ بالضوضاء هو نفسه التنبؤ بالصورة بعد إزالة الضوضاء، فإن طرحها منتميل بنى إزالة التشويش إلى العمل بشكل جيد. على سبيل المثال، تُستخدم شبكة U-Net ، التي وُجد أنها جيدة لإزالة التشويش من الصور، غالبًا لإزالة التشويش من نماذج الانتشار التي تولد الصور. [ 45 ]
في نموذج DDPM، لا يشترط أن تكون البنية الأساسية (العمود الفقري) شبكة U-Net، بل يكفي أن تتنبأ بالضوضاء بطريقة ما. على سبيل المثال، يستخدم مُحوِّل الانتشار (DiT) مُحوِّلًا للتنبؤ بالمتوسط والتباين القطري للضوضاء، مع الأخذ في الاعتبار التكييف النصي والصورة المُزالة الضوضاء جزئيًا. وهو يُشابه نموذج الانتشار القياسي لإزالة الضوضاء القائم على شبكة U-Net، مع استبدال شبكة U-Net بمُحوِّل. [ 46 ] كما يُمكن تطبيق نموذج مُحوِّل مزيج الخبراء . [ 47 ]
يمكن استخدام نموذج DDPM لنمذجة توزيعات البيانات العامة، وليس فقط الصور ذات المظهر الطبيعي. على سبيل المثال، يقوم نموذج Human Motion Diffusion [ 48 ] بنمذجة مسار حركة الإنسان باستخدام DDPM. كل مسار حركة بشرية هو عبارة عن سلسلة من الوضعيات، ممثلة إما بدوران المفاصل أو بمواقعها. ويستخدم هذا النموذج شبكة Transformer لتوليد مسار أقل تشويشًا من مسار مشوش.
تكييف
لا يستطيع نموذج الانتشار الأساسي توليد الصور إلا بشكل غير مشروط من التوزيع الكامل. على سبيل المثال، نموذج انتشار مُدرَّب على ImageNet سيُنتج صورًا تُشبه صورة عشوائية من ImageNet. لتوليد صور من فئة واحدة فقط، يجب فرض شرط، ثم أخذ عينة من التوزيع الشرطي. أيًا كان الشرط المطلوب فرضه، يجب أولًا تحويل الشرط إلى متجه من الأعداد العشرية، ثم إدخاله إلى الشبكة العصبية لنموذج الانتشار الأساسي. مع ذلك، يُمكن اختيار طريقة تحويل الشرط إلى متجه.
على سبيل المثال، يفرض الانتشار المستقر شرطًا في شكل آلية انتباه متبادل ، حيث يمثل الاستعلام تمثيلًا وسيطًا للصورة في شبكة U-Net، ويمثل كل من المفتاح والقيمة متجهات الشرط. يمكن تطبيق الشرط بشكل انتقائي على أجزاء محددة من الصورة، ويمكن ضبط أنواع جديدة من الشروط بدقة على النموذج الأساسي، كما هو مستخدم في ControlNet. [ 49 ]
كمثال بسيط بشكل خاص، لنأخذ عملية ترميم الصور . الشروط هي، الصورة المرجعية، و، قناع التعبئة . يتم فرض التكييف في كل خطوة من خطوات عملية الانتشار العكسي، عن طريق أخذ العينات أولاً، نسخة صاخبة منثم استبدالهامع، أينيعني الضرب العنصري . [ 50 ] ومن التطبيقات الأخرى لآلية الانتباه المتبادل تحرير الصور من لحظة إلى أخرى. [ 51 ]
لا يقتصر التكييف على توليد صور من فئة محددة، أو وفقًا لتعليق معين (كما في تحويل النص إلى صورة). على سبيل المثال، أوضح [ 48 ] كيفية توليد حركة بشرية، مشروطة بمقطع صوتي لمشي بشري (مما يسمح بمزامنة الحركة مع الصوت)، أو فيديو لجري بشري، أو وصف نصي لحركة بشرية، وما إلى ذلك. للاطلاع على كيفية صياغة نماذج الانتشار المشروط رياضيًا، انظر ملخصًا منهجيًا في [ 52 ] .
تحسين الدقة
بما أن توليد الصورة يستغرق وقتًا طويلاً، يمكن محاولة توليد صورة صغيرة باستخدام نموذج انتشار أساسي، ثم تكبيرها باستخدام نماذج أخرى. يمكن إجراء التكبير باستخدام الشبكات التوليدية التنافسية (GAN ) [ 53 ] ، أو نماذج المحولات [ 54 ] ، أو طرق معالجة الإشارات مثل إعادة التشكيل لانكزوس .
يمكن استخدام نماذج الانتشار نفسها لإجراء عملية تكبير الصورة. يقوم نموذج الانتشار المتتالي بتجميع نماذج انتشار متعددة واحدة تلو الأخرى، على غرار نموذج GAN التدريجي . المستوى الأدنى هو نموذج انتشار قياسي يُنتج صورة بحجم 32×32 بكسل، ثم يتم تكبير الصورة بواسطة نموذج انتشار مُدرَّب خصيصًا لتكبير الصورة، وتتكرر العملية. [ 45 ]
بمزيد من التفصيل، يتم تدريب مُحسِّن الانتشار على النحو التالي: [ 45 ]
- عينة، أينهي الصورة عالية الدقة،هي نفس الصورة ولكن بحجم مصغر وبدقة منخفضة، وهو الشرط، والذي يمكن أن يكون عنوان الصورة، أو فئة الصورة، وما إلى ذلك.
- عينة من الضوضاء البيضاءخطوتين زمنيتين. احسب النسخ المشوشة من الصور عالية الدقة ومنخفضة الدقة:.
- درب شبكة إزالة التشويش للتنبؤمنحأي تطبيق خوارزمية التدرج الهبوطي علىحول خسارة L2.
أمثلة
يجمع هذا القسم بعض نماذج الانتشار البارزة، ويصف بإيجاز بنيتها.
أوبن إيه آي
تُعد سلسلة DALL-E من OpenAI نماذج انتشار للصور تعتمد على النص.
لا يُعد الإصدار الأول من DALL-E (2021) نموذج انتشار بالمعنى الحرفي، بل يستخدم بنية Transformer التي تُولّد سلسلة من الرموز تلقائيًا، ثم تُحوّل هذه السلسلة إلى صورة بواسطة مُفكِّك VAE منفصل. وقد أُصدر مع DALL-E مُصنِّف CLIP، الذي استخدمه DALL-E لترتيب الصور المُولَّدة وفقًا لمدى تطابقها مع النص.
يُعدّ GLIDE (مارس 2022) [ 55 ] نموذج انتشار يبلغ حجمه 3.5 مليار بكسل، وقد تم إصدار نسخة مصغّرة منه للعموم. [ 5 ] بعد ذلك بوقت قصير، تم إصدار DALL-E 2 (أبريل 2022). [ 56 ] يُعدّ DALL-E 2 نموذج انتشار متتالي يبلغ حجمه 3.5 مليار بكسل، ويقوم بتوليد الصور من النصوص عن طريق "عكس مُشفّر صور CLIP"، وهي التقنية التي أطلقوا عليها اسم "unCLIP".
تتضمن طريقة unCLIP أربعة نماذج: مُشفِّر صور CLIP، ومُشفِّر نصوص CLIP، ومُفكِّك صور، ونموذج "مُسبق" (قد يكون نموذج انتشار أو نموذج انحدار ذاتي). أثناء التدريب، يُدرَّب النموذج المُسبق على تحويل ترميزات صور CLIP إلى ترميزات نصوص CLIP. ويُدرَّب مُفكِّك الصور على تحويل ترميزات صور CLIP مرة أخرى إلى صور. أثناء الاستدلال، يُحوِّل مُشفِّر نصوص CLIP النص إلى متجه، ثم يُحوِّله النموذج المُسبق إلى ترميز صورة، ثم يُحوِّله مُفكِّك الصور إلى صورة.
Sora (2024–02) هو نموذج محول الانتشار (DiT).
لايتريكس
LTX هي عائلة من نماذج الذكاء الاصطناعي مفتوحة المصدر لإنشاء مقاطع الفيديو ، طورتها شركة Lightricks ، وأُطلقت لأول مرة في نوفمبر 2024. [ 57 ] تُنشئ أحدث نماذجها، LTX-2، مقاطع فيديو بناءً على طلبات المستخدم ، المشروطة بنصوص أو صور أو مقاطع فيديو أو ملفات صوتية، وهي قادرة على توليد الصوت والصورة بطريقة موحدة. [ 58 ] [ 59 ] وقد سبقتها LTX Video، التي أُطلقت في عام 2024 كأول نموذج للشركة لتحويل النصوص إلى فيديو.
استقرار الذكاء الاصطناعي
يتألف برنامج Stable Diffusion (2022–08)، الذي أصدرته شركة Stability AI، من نموذج انتشار كامن لإزالة التشويش (860 مليون مُعامل)، وشبكة VAE، ومُشفِّر نصي. تعتمد شبكة إزالة التشويش على بنية U-Net، مع وحدات انتباه متقاطع تسمح بتوليد الصور المشروط. [ 60 ] [ 23 ]
لقد غيّر نموذج الانتشار المستقر 3 (2024-03) [ 61 ] نموذج الانتشار الكامن من UNet إلى نموذج Transformer، وبالتالي فهو DiT. وهو يستخدم التدفق المصحح.
Stable Video 4D (2024–07) [ 62 ] هو نموذج انتشار كامن لمقاطع الفيديو للأجسام ثلاثية الأبعاد.
جوجل
يستخدم برنامج Imagen (2022) [ 63 ] [ 64 ] نموذج لغة T5-XXL لترميز النص المُدخل إلى متجه تضمين. وهو نموذج انتشار متتالي يتكون من ثلاثة نماذج فرعية. في الخطوة الأولى، يُزيل التشويش من الضوضاء البيضاء إلى صورة بحجم 64×64، وذلك بناءً على متجه تضمين النص. يحتوي هذا النموذج على 2 مليار مُعامل. في الخطوة الثانية، يُكبّر حجم الصورة من 64×64 إلى 256×256، وذلك بناءً على متجه التضمين. يحتوي هذا النموذج على 650 مليون مُعامل. أما الخطوة الثالثة فهي مماثلة، حيث يُكبّر حجم الصورة من 256×256 إلى 1024×1024. يحتوي هذا النموذج على 400 مليون مُعامل. جميع شبكات إزالة التشويش الثلاث هي شبكات U-Net.
إن Muse (2023–01) [ 65 ] ليس نموذج انتشار، ولكنه عبارة عن مشفر فقط Transformer يتم تدريبه على التنبؤ برموز الصور المقنعة من رموز الصور غير المقنعة.
يعتمد برنامج Imagen 2 (2023–12) أيضًا على تقنية الانتشار. ويمكنه توليد صور بناءً على مُدخل يمزج بين الصور والنصوص. لا تتوفر معلومات إضافية. [ 66 ] وينطبق الأمر نفسه على برنامج Imagen 3 (2024–05). لا تتوفر معلومات إضافية. [ 67 ]
يقوم برنامج Veo (2024) بإنشاء مقاطع فيديو عن طريق الانتشار الكامن. ويعتمد هذا الانتشار على متجه يقوم بتشفير كل من موجه نصي وموجه صورة. [ 68 ]
ميتا
يُعدّ برنامج Make-A-Video (2022) نموذجًا لنشر النصوص وتحويلها إلى فيديوهات. [ 69 ] [ 70 ]
إن CM3leon (2023) ليس نموذج انتشار، بل هو نموذج Transformer مقنّع سببيًا ذاتيًا، وله نفس بنية LLaMa -2 تقريبًا. [ 71 ] [ 72 ]

يُعدّ برنامج Transfusion (2024) نموذجًا من نماذج Transformer يجمع بين توليد النصوص بالتراجع الذاتي ونشر إزالة التشويش. فعلى وجه التحديد، يقوم البرنامج بتوليد النصوص بالتراجع الذاتي (مع إخفاء السببية)، وتوليد الصور عن طريق إزالة التشويش عدة مرات على رموز الصورة (مع آلية الانتباه الشامل). [ 73 ]
فيلم Gen (2024) عبارة عن سلسلة من محولات الانتشار التي تعمل على الفضاء الكامن وعن طريق مطابقة التدفق. [ 74 ]
انظر أيضاً
للمزيد من القراءة
- أوراق بحثية
- يانغ، لينغ (2024-09-06)، YangLing0818/Diffusion-Models-Papers-Survey-Taxonomy ، تم الاطلاع عليه بتاريخ 2024-09-06
- يانغ، لينغ؛ تشانغ، شيلونج؛ سونغ يانغ. هونغ، شندا؛ شو، رونشنغ؛ تشاو، يو؛ تشانغ، وينتاو؛ كوي، بن؛ يانغ ، مينغ هسوان (2023/11/09). "نماذج الانتشار: مسح شامل للطرق والتطبيقات" . ايه سي ام للحوسبة. Surv . 56 (4): 105:1-105:39. أرخايف : 2209.00796 . دوى : 10.1145/3626235 . ISSN 0360-0300 .
- أوستن، جاكوب؛ جونسون، دانيال د.؛ هو، جوناثان؛ تارلو، دانيال؛ ريان فان دن بيرغ (2021). "نماذج انتشار إزالة الضوضاء المنظمة في فضاءات الحالة المنفصلة". arXiv : 2107.03006 [ cs.LG ].
- كرويتورو، فلورينل-ألين؛ هوندرو، فلاد. إيونيسكو، رادو تيودور؛ شاه مبارك (2023-09-01). “نماذج الانتشار في الرؤية: مسح”. معاملات IEEE بشأن تحليل الأنماط والذكاء الآلي . 45 (9): 10850–10869 . أرخايف : 2209.04747 . بيب كود : 2023ITPAM..4510850C . دوى : 10.1109/TPAMI.2023.3261988 . ردمك 0162-8828 . بميد 37030794 .
- تم حذف التفاصيل الرياضية من المقال.
- "قوة نماذج الانتشار" . مدونة أسترا . 25-09-2022 . تم الاطلاع عليه بتاريخ 25-09-2023 .
- لو، كالفن (2022-08-25). "فهم نماذج الانتشار: منظور موحد". arXiv : 2208.11970 [ cs.LG ].
- وينغ، ليليان (11 يوليو 2021). "ما هي نماذج الانتشار؟" . lilianweng.github.io . تاريخ الاسترجاع: 25 سبتمبر 2023 .
- دروس تعليمية
- نكيران، بريتوم؛ برادلي، أروين. تشو، هاتي؛ أدفاني، مادو (2024). “الانتشار خطوة بخطوة: برنامج تعليمي ابتدائي”. أرخايف : 2406.08929 [ cs.LG ].
- "إرشادات: دليل مختصر لنماذج الانتشار" . 26 مايو 2022.نظرة عامة على التوجيه باستخدام المصنفات والتوجيه بدون مصنفات، مع التركيز على التفاصيل الرياضية.
- كاثرين هيغام، ديزموند جيه هيغام، وبيتر غريندرود: "نماذج الانتشار للذكاء الاصطناعي التوليدي: مقدمة للرياضيين التطبيقيين"، مجلة SIAM، المجلد 67، العدد 3 (2025).
مراجع
- 1 2 3 4 سونغ، يانغ؛ سوهل ديكستين، جاشا؛ كينغما، ديدريك ب. كومار، ابهيشيك. إرمون، ستيفانو؛ بول ، بن (2021/02/10). “النمذجة التوليدية القائمة على النتائج من خلال المعادلات التفاضلية العشوائية”. أرخايف : 2011.13456 [ cs.LG ].
- ^ كرويتورو، فلورينل ألين؛ هوندرو، فلاد. إيونيسكو، رادو تيودور؛ شاه، مبارك (2023). “نماذج الانتشار في الرؤية: مسح”. معاملات IEEE بشأن تحليل الأنماط والذكاء الآلي . 45 (9): 10850–10869 . أرخايف : 2209.04747 . بيب كود : 2023ITPAM..4510850C . دوى : 10.1109/TPAMI.2023.3261988 . بميد 37030794 . S2CID 252199918 .
- 1 2 هو، جوناثان؛ جاين، أجاي؛ أبيل، بيتر (2020). "إزالة التشويش من نماذج الانتشار الاحتمالية" . التطورات في أنظمة معالجة المعلومات العصبية . 33. كوران أسوشيتس، إنك: 6840-6851 .
- ^ قو، شويانغ؛ تشن دونغ. باو، جيانمين؛ ون، فانغ؛ تشانغ، بو؛ تشن، دونغدونغ. يوان، لو؛ قوه ، باينينغ (2021). “نموذج الانتشار الكمي المتجه لتوليف النص إلى الصورة”. أرخايف : 2111.14822 [ cs.CV ].
- 1 2 GLIDE ، OpenAI، 22-09-2023 ، تم الاطلاع عليه بتاريخ 24-09-2023
- ↑ لي، ييفان؛ تشو، كون؛ تشاو، واين شين؛ وين، جي رونغ (أغسطس 2023). "نماذج الانتشار لتوليد النصوص غير التراجعية: دراسة استقصائية" . وقائع المؤتمر الدولي المشترك الثاني والثلاثين حول الذكاء الاصطناعي . كاليفورنيا: منظمة المؤتمرات الدولية المشتركة حول الذكاء الاصطناعي. الصفحات 6692-6701 . arXiv : 2303.06574 . doi : 10.24963/ijcai.2023/750 . ISBN 978-1-956792-03-4.
- ↑ شو، ويجي؛ هو، وينشيانغ؛ وو، فانيو؛ سينغاميدو، سرينيفاسان (2023). "DeTiME: نمذجة المواضيع المحسّنة بالانتشار باستخدام نموذج لغة-لغة قائم على المُشفّر-المُفكّك" . نتائج مؤتمر رابطة اللغويات الحاسوبية: EMNLP 2023. سترودسبيرغ، بنسلفانيا، الولايات المتحدة الأمريكية: رابطة اللغويات الحاسوبية: 9040-9057 . arXiv : 2310.15296 . doi : 10.18653/v1/2023.findings-emnlp.606 .
- ↑ تشانغ، هاوبنغ؛ ليو، شياو؛ تشانغ، جياوي (2023). "DiffuSum: التلخيص الاستخلاصي المُحسَّن بالتوليد باستخدام الانتشار" . نتائج مؤتمر رابطة اللغويات الحاسوبية: ACL 2023. سترودسبيرغ، بنسلفانيا، الولايات المتحدة الأمريكية: رابطة اللغويات الحاسوبية: 13089-13100 . arXiv : 2305.01735 . doi : 10.18653/v1/2023.findings-acl.828 .
- ↑ يانغ، دونغتشاو؛ يو، جيانوي؛ وانغ، هيلين؛ وانغ، وين؛ وينغ، تشاو؛ زو، يويشيان؛ يو، دونغ (2023). "Diffsound: نموذج الانتشار المنفصل لتوليد الصوت من النص" . معاملات IEEE/ACM في معالجة الصوت والكلام واللغة . 31 : 1720-1733 . arXiv : 2207.09983 . Bibcode : 2023ITASL..31.1720Y . doi : 10.1109/taslp.2023.3268730 . ISSN 2329-9290 .
- ↑ جانر، مايكل؛ دو، ييلون؛ تيننباوم، جوشوا ب.؛ ليفين، سيرجي (2022-12-20). "التخطيط باستخدام الانتشار لتوليف السلوك المرن". arXiv : 2205.09991 [ cs.LG ].
- ^ تشي تشنغ. شو، زينجيا؛ فنغ، سيوان. كوزينو، إريك؛ دو، ييلون؛ بورتشفيل، بنيامين؛ تيدريك، روس؛ سونغ شوران (2024/03/14). “سياسة الانتشار: تعلم السياسة الحركية عبر نشر العمل”. أرخايف : 2303.04137 [ cs.RO ].
- ↑ سول-ديكستين، ياشا؛ فايس، إريك؛ ماهيسواراناثان، نيرو؛ جانجولي، سوريا (2015-06-01). "التعلم العميق غير الخاضع للإشراف باستخدام الديناميكا الحرارية غير المتوازنة" (ملف PDF) . وقائع المؤتمر الدولي الثاني والثلاثين للتعلم الآلي . 37. PMLR: 2256–2265 . arXiv : 1503.03585 .
- ^ هو ، جوناثان (20 يونيو 2020)، هوجوناثانهو / نشر ، استرجاعها 2024/09/07
- 1 2 وينغ، ليليان (2021-07-11). "ما هي نماذج الانتشار؟" . lilianweng.github.io . تم الاطلاع عليه بتاريخ 2023-09-24 .
- ↑ "النمذجة التوليدية من خلال تقدير تدرجات توزيع البيانات | يانغ سونغ" . yang-song.net . تم الاطلاع عليه بتاريخ 24-09-2023 .
- 1 2 سونغ، يانغ؛ إرمون، ستيفانو (2019). "النمذجة التوليدية من خلال تقدير تدرجات توزيع البيانات" . التطورات في أنظمة معالجة المعلومات العصبية . 32. كوران أسوشيتس، إنك. arXiv : 1907.05600 .
- ^ سونغ يانغ. سوهل ديكستين، جاشا؛ كينغما، ديدريك ب. كومار، ابهيشيك. إرمون، ستيفانو؛ بول ، بن (2021/02/10). “النمذجة التوليدية القائمة على النتائج من خلال المعادلات التفاضلية العشوائية”. أرخايف : 2011.13456 [ cs.LG ].
- ↑ ermongroup/ncsn ، ermongroup، 2019 ، تم الاطلاع عليه بتاريخ 2024-09-07
- ↑ "مطابقة الدرجات المقطعية: منهج قابل للتطوير لتقدير الكثافة والدرجات | يانغ سونغ" . yang-song.net . تم الاطلاع عليه بتاريخ 24-09-2023 .
- ↑ أندرسون، برايان دي أو (مايو 1982). "نماذج معادلة الانتشار العكسي للزمن" . العمليات العشوائية وتطبيقاتها . 12 (3): 313-326 . doi : 10.1016/0304-4149(82)90051-5 . ISSN 0304-4149 .
- ↑ لو، كالفن (2022). "فهم نماذج الانتشار: منظور موحد". arXiv : 2208.11970v1 [ cs.LG ].
- ↑ سونغ، جيامينغ؛ مينغ، تشينلين؛ إرمون، ستيفانو (3 أكتوبر 2023). "إزالة التشويش من نماذج الانتشار الضمنية". arXiv : 2010.02502 [ cs.LG ].
- 1 2 رومباخ، روبن؛ بلاتمان، أندرياس. لورينز، دومينيك؛ إيسر، باتريك؛ عمر ، بيورن (13 أبريل 2022). “توليف الصور عالية الدقة مع نماذج الانتشار الكامنة”. أرخايف : 2112.10752 [ cs.CV ].
- ↑ نيكول، ألكسندر كوين؛ داريوال، برافولا (2021-07-01). "نماذج احتمالية محسّنة لإزالة التشويش من الانتشار" . وقائع المؤتمر الدولي الثامن والثلاثين للتعلم الآلي . PMLR: 8162–8171 .
- ↑ ساليمانس، تيم؛ هو، جوناثان (2021-10-06). التقطير التدريجي لأخذ عينات سريعة من نماذج الانتشار . المؤتمر الدولي العاشر حول تمثيلات التعلم (ICLR 2022).
- ↑ لين، شانشوان؛ ليو، بينغتشن؛ لي، جياشي؛ يانغ، شياو (2024). جداول ضوضاء الانتشار الشائعة وخطوات أخذ العينات معيبة . المؤتمر الشتوي لتطبيقات رؤية الحاسوب (WACV) التابع لمعهد مهندسي الكهرباء والإلكترونيات/مؤسسة رؤية الحاسوب. الصفحات 5404-5411 .
- 1 2 3 داريوال، برافولا؛ نيكول ، أليكس (2021-06-01). “نماذج الانتشار تتغلب على شبكات GAN في تركيب الصور”. أرخايف : 2105.05233 [ cs.LG ].
- 1 2 هو، جوناثان؛ ساليمانس، تيم (2022-07-25). "التوجيه الانتشار بدون مصنف". arXiv : 2207.12598 [ cs.LG ].
- ↑ تشونغ، هيونغجين؛ كيم، جيونغسول؛ بارك، جيون يونغ؛ نام، هييلين؛ يي، جونغ تشول (2024-06-12). "CFG++: توجيه بدون مصنف مقيد بالتعددية لنماذج الانتشار". arXiv : 2406.08070 [ cs.CV ].
- ↑ سانشيز، غيوم؛ فان، هونغلو؛ سبانغر، ألكسندر؛ ليفي، إيلاد؛ أمانامانتشي، باوان ساسانكا؛ بيدرمان، ستيلا (30-06-2023). "البقاء على الموضوع مع التوجيه الخالي من المصنفات". arXiv : 2306.17806 [ cs.CL ].
- ↑ أرماندبور، محمد رضا؛ صادقيان، علي؛ تشنغ، هوانغجي؛ صادقيان، أمير؛ تشو، مينغ يوان (2023-04-26). "إعادة تصور خوارزمية التوجيه السلبي: تحويل الانتشار ثنائي الأبعاد إلى ثلاثي الأبعاد، وتخفيف مشكلة يانوس وما بعدها". arXiv : 2304.04968 [ cs.CV ].
- ^ يانغ ، لينغ. تشانغ، شيلونج؛ سونغ يانغ. هونغ، شندا؛ شو، رونشنغ؛ تشاو، يو؛ تشانغ، وينتاو؛ كوي، بن؛ يانغ، مينغ هسوان (2022). “نماذج الانتشار: مسح شامل للطرق والتطبيقات”. أرخايف : 2206.00364 [ cs.CV ].
- ↑ شي، جياكسين؛ هان، كيهانغ؛ وانغ، تشي؛ دوسيت، أرنو؛ تيتسياس، ميخاليس ك. (2024). "الانتشار المقنع المبسط والمعمم للبيانات المنفصلة". arXiv : 2406.04329 [ cs.LG ].
- ^ كراس، تيرو. أيتالا، ميكا؛ ايلا، تيمو؛ لين ، سامولي (2022). “توضيح مساحة تصميم النماذج التوليدية القائمة على الانتشار”. أرخايف : 2206.00364v2 [ cs.CV ].
- ^ تساو، هانكون؛ تان، تشنغ. جاو، تشانغيانغ. شو، ييلون؛ تشن، قوانغيونغ؛ هنغ، فنغ-آن؛ لي ، ستان ز. (يوليو 2024). “مسح حول نماذج الانتشار التوليدي”. معاملات IEEE على المعرفة وهندسة البيانات . 36 (7): 2814– 2830. بيب كود : 2024ITKDE..36.2814C . دوى : 10.1109/TKDE.2024.3361474 . ردمك 1041-4347 .
- ↑ شو، ييلون؛ ليو، زيمينغ؛ تيان، يونغلونغ؛ تونغ، شانغ يوان؛ تيغمارك، ماكس؛ جاكولا، تومي (2023-07-03). "PFGM++: إطلاق العنان لإمكانات النماذج التوليدية المستوحاة من الفيزياء" . وقائع المؤتمر الدولي الأربعين للتعلم الآلي . PMLR: 38566–38591 . arXiv : 2302.04265 .
- ↑ سونغ، يانغ؛ داريوال، برافولا؛ تشين، مارك؛ سوتسكيفر، إيليا (2023-07-03). "نماذج الاتساق" . وقائع المؤتمر الدولي الأربعين للتعلم الآلي . PMLR: 32211–32252 .
- ↑ دوكهورن، تيم؛ فهدات، أراش؛ كرايس، كارستن (2021-10-06). "النمذجة التوليدية القائمة على الدرجات مع انتشار لانجفين المخمد حرجًا". arXiv : 2112.07068 [ stat.ML ].
- ↑ ليو، زيمينغ؛ لو، دي؛ شو، ييلون؛ جاكولا، تومي؛ تيغمارك، ماكس (2023-04-05). "GenPhys: من العمليات الفيزيائية إلى النماذج التوليدية". arXiv : 2304.02637 [ cs.LG ].
- ↑ بانسال، أربيت؛ بورغنيا، إيتان؛ تشو، هونغ مين؛ لي، جي؛ كازيمي، حميد؛ هوانغ، فورونغ؛ غولدبلوم، ميكا؛ غيبينغ، جوناس؛ غولدشتاين، توم (15-12-2023). "الانتشار البارد: عكس تحويلات الصور العشوائية بدون ضوضاء" . التقدم في أنظمة معالجة المعلومات العصبية . 36 : 41259-41282 . arXiv : 2208.09392 .
- ↑ تونغ، ألكسندر؛ فاتراس، كيليان؛ مالكين، نيكولاي؛ هوغيت، غيوم؛ تشانغ، يانلي؛ ريكتور-بروكس، جاريد؛ وولف، غاي؛ بينجيو، يوشوا (2023-11-08). "تحسين وتعميم النماذج التوليدية القائمة على التدفق باستخدام النقل الأمثل للدُفعات الصغيرة" . معاملات بحوث التعلم الآلي . arXiv : 2302.00482 . ISSN 2835-8856 .
- 1 2 3 4 ليو، شينغتشاو؛ غونغ، تشنغيو؛ ليو، تشيانغ (2022-09-07). "تدفق مستقيم وسريع: تعلم توليد ونقل البيانات باستخدام التدفق المصحح". arXiv : 2209.03003 [ cs.LG ].
- ↑ ليو، تشيانغ (2022-09-29). "التدفق المعدل: نهج الحفاظ على الحدود للنقل الأمثل". arXiv : 2209.14577 [ stat.ML ].
- ↑ ديلبراسيو، ماوريسيو؛ ميلانفار، بيمان (2023). "الانعكاس بالتكرار المباشر: بديل لانتشار إزالة التشويش لاستعادة الصور" . معاملات بحوث التعلم الآلي .
- ١ ٢ ٣ هو، جوناثان؛ ساهاريا، شيتوان؛ تشان، ويليام؛ فليت، ديفيد جيه؛ نوروزي، محمد؛ سالمانس، تيم (٢٠٢٢-٠١-٠١). "نماذج الانتشار المتتالي لتوليد صور عالية الدقة" . مجلة أبحاث تعلم الآلة . ٢٣ (١): ٤٧:٢٢٤٩–٤٧:٢٢٨١. arXiv : ٢١٠٦.١٥٢٨٢ . ISSN ١٥٣٢-٤٤٣٥ .
- ↑ بيبلز، ويليام؛ شي، ساينينغ (مارس 2023). "نماذج الانتشار القابلة للتطوير باستخدام المحولات". arXiv : 2212.09748v2 [ cs.CV ].
- ^ فاي، زينجكونج؛ فان، مينجيوان؛ يو، تشانغتشيان؛ لي، ديبانج؛ هوانغ ، جونشي (2024/07/16). “تحجيم محولات الانتشار إلى 16 مليار معلمة”. أرخايف : 2407.11633 [ cs.CV ].
- 1 2 تيفيت، جاي؛ راب، سيجال؛ جوردون، بريان. شافير، يوناتان؛ كوهين أور دانيال. برمانو، أميت هـ. (2022). “نموذج انتشار الحركة البشرية”. أرخايف : 2209.14916 [ cs.CV ].
- ↑ تشانغ، ليفمين؛ راو، أنيي؛ أغراوالا، مانيش (2023). "إضافة التحكم الشرطي إلى نماذج انتشار النص إلى الصورة". arXiv : 2302.05543 [ cs.CV ].
- ↑ لوغماير، أندرياس؛ دانيلجان، مارتن؛ روميرو، أندريس؛ يو، فيشر؛ تيموفتي، رادو؛ فان غول، لوك (2022). "إعادة الرسم: ترميم الصور باستخدام نماذج احتمالية الانتشار لإزالة التشويش". arXiv : 2201.09865v4 [ cs.CV ].
- ↑ هيرتز، أمير؛ موكادي، رون؛ تيننباوم، جاي؛ أبرمان، كفير؛ بريتش، يائيل؛ كوهين-أور، دانيال (2022-08-02). "تحرير الصور من موجه إلى موجه مع التحكم في الانتباه المتبادل". arXiv : 2208.01626 [ cs.CV ].
- ↑ تشاو، تشنغ؛ لو، زيوي؛ سيولوند، ينس؛ شون، توماس (19 يونيو 2025). "أخذ العينات المشروط ضمن نماذج الانتشار التوليدي" . المعاملات الفلسفية للجمعية الملكية أ: العلوم الرياضية والفيزيائية والهندسية . 383 (2299). doi : 10.1098/rsta.2024.0329 . ISSN 1364-503X . PMC 12177524 .
- ↑ وانغ، شينتاو؛ شي، ليانغبين؛ دونغ، تشاو؛ شان، يينغ (2021). "Real-ESRGAN: تدريب نموذج فائق الدقة للعمى في العالم الحقيقي باستخدام بيانات اصطناعية خالصة" (ملف PDF) . وقائع ورش عمل المؤتمر الدولي لرؤية الحاسوب (ICCV) التابع لمعهد مهندسي الكهرباء والإلكترونيات/مؤسسة رؤية الحاسوب، 2021. المؤتمر الدولي لرؤية الحاسوب. الصفحات 1905-1914 . arXiv : 2107.10833 .
- ↑ ليانغ، جينغيون؛ كاو، جيتشانغ؛ صن، غولي؛ تشانغ، كاي؛ فان غول، لوك؛ تيموفتي، رادو (2021). "SwinIR: استعادة الصور باستخدام محول Swin" (ملف PDF) . وقائع ورش عمل المؤتمر الدولي لرؤية الحاسوب (ICCV) التابع لمعهد مهندسي الكهرباء والإلكترونيات (IEEE) والاتحاد الدولي لرؤية الحاسوب (CVF) . المؤتمر الدولي لرؤية الحاسوب، 2021. الصفحات 1833-1844 . arXiv : 2108.10257v1 .
- ↑ نيكول، أليكس؛ داريوال، برافولا؛ راميش، أديتيا؛ شيام، براناف؛ ميشكين، باميلا؛ ماكجرو، بوب؛ سوتسكيفر، إيليا؛ تشين، مارك (2022-03-08). "GLIDE: نحو توليد وتحرير صور واقعية باستخدام نماذج الانتشار الموجهة بالنصوص". arXiv : 2112.10741 [ cs.CV ].
- ↑ راميش، أديتيا؛ داريوال، برافولا؛ نيكول، أليكس؛ تشو، كيسي؛ تشين، مارك (2022-04-12). "توليد الصور الهرمي المشروط بالنص باستخدام CLIP Latents". arXiv : 2204.06125 [ cs.CV ].
- ↑ "لايتريكس تتحدى عمالقة الذكاء الاصطناعي بمنصة مفتوحة المصدر لتحويل النصوص إلى فيديوهات" . ctech . 22-11-2024 . تاريخ الاسترجاع: 23-04-2026 .
- ↑ كيمبر، جوناثان (11 يناير 2026). "شركة لايتريكس تُطلق نموذج الذكاء الاصطناعي للفيديو LTX-2 مفتوح المصدر، ويتحدى سورا وفيو" . ذا ديكودر . تاريخ الاسترجاع: 23 أبريل 2026 .
- ↑ لايتريكس. "لايتريكس تُصدر LTX-2: أول نموذج أساسي كامل مفتوح المصدر للذكاء الاصطناعي للفيديو" . www.prnewswire.com . تاريخ الاسترجاع: 23 أبريل 2026 .
- ↑ العمار، جاي. "الانتشار المستقر المصور" . jalammar.github.io . تم الاطلاع عليه بتاريخ 31-10-2022 .
- ↑ إيسر، باتريك؛ كولال، سوميث؛ بلاتمان، أندرياس؛ إنتزاري، رحيم؛ مولر، جوناس؛ سايني، هاري؛ ليفي، يام؛ لورنز، دومينيك؛ ساوير، أكسل (2024-03-05). "توسيع نطاق محولات التدفق المعدلة لتوليف الصور عالية الدقة". arXiv : 2403.03206 [ cs.CV ].
- ↑ شي، ييمينغ؛ ياو، تشون هان؛ فوليتي، فيكرام؛ جيانغ، هوايزو؛ جامباني، فارون (24-07-2024). "SV4D: توليد محتوى ثلاثي الأبعاد ديناميكي مع اتساق متعدد الإطارات ومتعدد العروض". arXiv : 2407.17470 [ cs.CV ].
- ↑ "Imagen: نماذج انتشار النص إلى الصورة" . imagen.research.google . تم الاسترجاع في 4 أبريل 2024 .
- ↑ ساهاريا، شيتوان؛ تشان، ويليام؛ ساكسينا، سوراب؛ لي، لالا؛ وانغ، جاي؛ دينتون، إميلي ل.؛ قاسميبور، كاميار؛ غونتيو لوبيز، رافائيل؛ كاراغول أيان، بورجو؛ ساليمانس، تيم؛ هو، جوناثان؛ فليت، ديفيد ج.؛ نوروزي، محمد (2022-12-06). "نماذج نشر واقعية للنصوص والصور مع فهم عميق للغة" . التقدم في أنظمة معالجة المعلومات العصبية . 35 : 36479-36494 . arXiv : 2205.11487 .
- ↑ تشانغ، هويوين؛ تشانغ، هان؛ باربر، جاريد؛ ماشينو، إيه جيه؛ ليزاما، خوسيه؛ جيانغ، لو؛ يانغ، مينغ-هسوان؛ مورفي، كيفن؛ فريمان، ويليام تي. (2023-01-02). "Muse: توليد الصور من النصوص باستخدام محولات توليدية مقنعة". arXiv : 2301.00704 [ cs.CV ].
- ↑ "Imagen 2 - أحدث تقنياتنا لتحويل النصوص إلى صور" . جوجل ديب مايند . تم الاطلاع عليه بتاريخ 4 أبريل 2024 .
- ↑ إيماجن-فريق-جوجل؛ بالدريدج، جايسون؛ باور، جاكوب؛ بوتاني، موكول؛ بريشتوفا، نيكول؛ بونر، أندرو؛ كاستريجون، لويس؛ تشان، كلفن؛ تشن، ييتشانغ (2024-12-13)، الصورة 3 ، أرخايف : 2408.07009
{{citation}}له|last1=اسم عام ( مساعدة ) - ↑ "Veo" . جوجل ديب مايند . 14-05-2024 . تم الاسترجاع في 17-05-2024 .
- ↑ "تقديم Make-A-Video: نظام ذكاء اصطناعي يُنشئ مقاطع فيديو من النصوص" . ai.meta.com . تاريخ الاسترجاع: 2024-09-20 .
- ↑ سينغر، أوريل؛ بولياك، آدم؛ هايز، توماس؛ ين، شي؛ آن، جي؛ تشانغ، سونغيانغ؛ هو، تشييوان؛ يانغ، هاري؛ أشوال، أورون (2022-09-29). "Make-A-Video: تحويل النص إلى فيديو بدون بيانات نصية-فيديو". arXiv : 2209.14792 [ cs.CV ].
- ↑ "تقديم CM3leon، نموذج توليدي أكثر كفاءة وتطوراً للنصوص والصور" . ai.meta.com . تاريخ الاسترجاع: 2024-09-20 .
- ↑ فريق كاميليون (2024-05-16). "كاميليون: نماذج تأسيسية للاندماج المبكر متعددة الأنماط". arXiv : 2405.09818 [ cs.CL ].
- ^ تشو، تشونتينج؛ يو، ليلى؛ بابو آرون. تيرومالا، كوشال؛ ياسوناجا، ميتشيهيرو؛ شاميس، ليونيد؛ خان، يعقوب؛ ما، شيويزهي؛ زيتليموير ، لوك (2024/08/20). “نقل الدم: التنبؤ بالرمز التالي والصور المنتشرة باستخدام نموذج واحد متعدد الوسائط”. أرخايف : 2408.11039 [ cs.AI ].
- ↑ Movie Gen: A Cast of Media Foundation Models , The Movie Gen team @ Meta, October 4, 2024.
- نماذج ماركوف
- خوارزميات التعلم الآلي
