نموذج الانتشار

في مجال تعلم الآلة ، تُعدّ نماذج الانتشار ، المعروفة أيضًا بنماذج التوليد القائمة على الانتشار أو نماذج التوليد القائمة على الدرجات ، فئةً من نماذج التوليد القائمة على المتغيرات الكامنة . يتكون نموذج الانتشار من عنصرين رئيسيين: عملية الانتشار الأمامي، وعملية أخذ العينات العكسية. يهدف نموذج الانتشار إلى تعلّم عملية انتشار لمجموعة بيانات معينة، بحيث تُولّد هذه العملية عناصر جديدة موزعة بشكل مشابه لمجموعة البيانات الأصلية. يُحاكي نموذج الانتشار البيانات كما لو كانت مُولّدة بواسطة عملية انتشار، حيث تقوم البيانات الجديدة بحركة عشوائية مع انحراف عبر فضاء جميع البيانات الممكنة. [ 1 ] يمكن أخذ عينات من نموذج الانتشار المُدرّب بطرق عديدة، بكفاءات وجودة متفاوتة.

توجد العديد من الصيغ المكافئة، بما في ذلك سلاسل ماركوف ، ونماذج الانتشار الاحتمالية لإزالة التشويش، وشبكات النقاط المشروطة بالتشويش، والمعادلات التفاضلية العشوائية. [ 2 ] ويتم تدريبها عادةً باستخدام الاستدلال التبايني . [ 3 ] يُطلق على النموذج المسؤول عن إزالة التشويش عادةً اسم " العمود الفقري ". قد يكون العمود الفقري من أي نوع، ولكنه عادةً ما يكون من نوع U-net أو المحولات .

اعتبارًا من عام 2024تُستخدم نماذج الانتشار بشكل أساسي في مهام رؤية الحاسوب ، بما في ذلك إزالة التشويش من الصور ، وترميم الصور ، وتحسين دقة الصور ، وتوليد الصور ، وتوليد الفيديو. وتتضمن هذه العمليات عادةً تدريب شبكة عصبية لإزالة التشويش من الصور المشوشة بضوضاء غاوسية بشكل متسلسل . [ 1 ] [ 4 ] يُدرَّب النموذج لعكس عملية إضافة الضوضاء إلى الصورة. بعد التدريب حتى الوصول إلى التقارب، يمكن استخدامه لتوليد الصور من خلال البدء بصورة مكونة من ضوضاء عشوائية، وتطبيق الشبكة بشكل تكراري لإزالة التشويش من الصورة.

حظيت مولدات الصور القائمة على الانتشار باهتمام تجاري واسع النطاق، مثل Stable Diffusion و DALL-E . تجمع هذه النماذج عادةً بين نماذج الانتشار ونماذج أخرى، مثل مشفرات النصوص ووحدات الانتباه المتبادل، للسماح بالتوليد المشروط بالنص. [ 5 ]

إلى جانب رؤية الحاسوب ، وجدت نماذج الانتشار تطبيقات في معالجة اللغة الطبيعية [ 6 ] مثل توليد النصوص [ 7 ] والتلخيص [ 8 ] وتوليد الصوت [ 9 ] والتعلم المعزز [ 10 ] [ 11 ] .

نموذج الانتشار لإزالة التشويش

الديناميكا الحرارية غير المتوازنة

تم تقديم نماذج الانتشار في عام 2015 كطريقة لتدريب نموذج يمكنه أخذ عينات من توزيع احتمالي شديد التعقيد. وقد استخدمت هذه النماذج تقنيات من الديناميكا الحرارية غير المتوازنة ، وخاصة الانتشار . [ 12 ]

لنتأمل، على سبيل المثال، كيف يمكن نمذجة توزيع جميع الصور التي تحدث في الطبيعة. كل صورة هي نقطة في فضاء جميع الصور، وتوزيع الصور التي تحدث في الطبيعة هو "سحابة" في الفضاء، والتي، بإضافة ضوضاء متكررة إلى الصور، تنتشر إلى بقية فضاء الصورة، حتى تصبح السحابة غير قابلة للتمييز تقريبًا عن التوزيع الغاوسي.شمال(0،أنا){\displaystyle {\mathcal {N}}(0,I)}يمكن استخدام نموذج قادر على عكس عملية الانتشار تقريبًا لأخذ عينات من التوزيع الأصلي. تُدرس هذه الظاهرة في الديناميكا الحرارية "غير المتوازنة"، حيث أن التوزيع الابتدائي ليس في حالة توازن، على عكس التوزيع النهائي.

التوزيع المتوازن هو التوزيع الغاوسيشمال(0،أنا){\displaystyle {\mathcal {N}}(0,I)}مع ملف PDFρ(x)هـ-12x2{\displaystyle \rho (x)\propto e^{-{\frac {1}{2}}\|x\|^{2}}}هذا مجرد توزيع ماكسويل-بولتزمان للجسيمات في بئر جهدV(x)=12x2{\displaystyle V(x)={\frac {1}{2}}\|x\|^{2}}عند درجة حرارة 1، ينتشر التوزيع الأولي، لكونه خارج حالة التوازن تمامًا، نحو توزيع التوازن، مُحدثًا خطوات عشوائية متحيزة تُمثل مجموعًا من العشوائية البحتة (مثل حركة براونية ) والانحدار التدريجي عبر بئر الجهد. العشوائية ضرورية: فلو خضعت الجسيمات للانحدار التدريجي فقط، لسقطت جميعها نحو نقطة الأصل، مما يؤدي إلى انهيار التوزيع.

نموذج الانتشار الاحتمالي لإزالة التشويش (DDPM)

اقترحت الورقة البحثية لعام 2020 نموذج الانتشار الاحتمالي لإزالة التشويش (DDPM)، والذي يحسن الطريقة السابقة عن طريق الاستدلال التبايني . [ 3 ] [ 13 ]

الانتشار الأمامي

لعرض النموذج، يلزم استخدام بعض الرموز.

  • β1،...،βتي(0،1){\displaystyle \beta _{1},...,\beta _{T}\in (0,1)}هي ثوابت ثابتة.
  • αت:=1-βت{\displaystyle \alpha _{t}:=1-\beta _{t}}
  • α¯ت:=α1αت{\displaystyle {\bar {\alpha }}_{t}:=\alpha _{1}\cdots \alpha _{t}}
  • σت:=1-α¯ت{\displaystyle \sigma _{t}:={\sqrt {1-{\bar {\alpha }}_{t}}}}
  • σ~ت:=σت-1σتβت{\displaystyle {\tilde {\sigma }}_{t}:={\frac {\sigma _{t-1}}{\sigma _{t}}}{\sqrt {\beta _{t}}}}
  • μ~ت(xت،x0):=αت(1-α¯ت-1)xت+α¯ت-1(1-αت)x0σت2{\displaystyle {\tilde {\mu }}_{t}(x_{t},x_{0}):={\frac {{\sqrt {\alpha _{t}}}(1-{\bar {\alpha }}_{t-1})x_{t}+{\sqrt {{\bar {\alpha }}_{t-1}}}(1-\alpha _{t})x_{0}}{\sigma _{t}^{2}}}}
  • شمال(μ،Σ){\displaystyle {\mathcal {N}}(\mu ,\Sigma )}التوزيع الطبيعي بمتوسطμ{\displaystyle \mu }والتباينΣ{\displaystyle \Sigma }، وشمال(x|μ،Σ){\displaystyle {\mathcal {N}}(x|\mu ,\Sigma )}هي دالة الكثافة الاحتمالية عندx{\displaystyle x}.
  • يشير الخط العمودي إلى التكييف .

تبدأ عملية الانتشار الأمامي من نقطة بداية معينةx0q{\displaystyle x_{0}\sim q}، أينq{\displaystyle q}هو التوزيع الاحتمالي المراد تعلمه، ثم يضيف إليه ضوضاء بشكل متكرر بواسطةxت=1-βتxت-1+βتzت{\displaystyle x_{t}={\sqrt {1-\beta _{t}}}x_{t-1}+{\sqrt {\beta _{t}}}z_{t}}أينz1،...،zتي{\displaystyle z_{1},...,z_{T}}هي عينات من متغيرات عشوائية مستقلة وموزعة توزيعًا متطابقًا (IID ) منشمال(0،أنا){\displaystyle {\mathcal {N}}(0,I)}المعاملات1-βت{\displaystyle {\sqrt {1-\beta _{t}}}}وβت{\displaystyle {\sqrt {\beta _{t}}}}تأكد منمتغير(Xت)=أنا{\displaystyle {\mbox{Var}}(X_{t})=I}بافتراض أنمتغير(X0)=أنا{\displaystyle {\mbox{Var}}(X_{0})=I}قيمβت{\displaystyle \beta _{t}}يتم اختيارها بحيث يكون لأي توزيع ابتدائي لـx0{\displaystyle x_{0}}إذا كان لها عزم ثانٍ محدود، فإنليمتxت|x0{\displaystyle \lim _{t\to \infty }x_{t}|x_{0}}يتقارب إلىشمال(0،أنا){\displaystyle {\mathcal {N}}(0,I)}.

وبذلك تُرضي عملية الانتشار بأكملهاq(x0:تي)=q(x0)q(x1|x0)q(xتي|xتي-1)=q(x0)شمال(x1|α1x0،β1أنا)شمال(xتي|αتيxتي-1،βتيأنا){\displaystyle q(x_{0:T})=q(x_{0})q(x_{1}|x_{0})\cdots q(x_{T}|x_{T-1})=q(x_{0}){\mathcal {N}}(x_{1}|{\sqrt {\alpha _{1}}}x_{0},\beta _{1}I)\cdots {\mathcal {N}}(x_{T}|{\sqrt {\alpha _{T}}}x_{T-1},\beta _{T}I)}أوlnq(x0:تي)=lnq(x0)-ت=1تي12βتxت-1-βتxت-12+ج{\displaystyle \ln q(x_{0:T})=\ln q(x_{0})-\sum _{t=1}^{T}{\frac {1}{2\beta _{t}}}\|x_{t}-{\sqrt {1-\beta _{t}}}x_{t-1}\|^{2}+C}أينج{\displaystyle C}هو ثابت معايرة وغالبًا ما يتم حذفه. على وجه الخصوص، نلاحظ أنx1:تي|x0{\displaystyle x_{1:T}|x_{0}}هي عملية غاوسية ، مما يمنحنا حرية كبيرة في إعادة تحديد المعاملات . على سبيل المثال، من خلال المعالجة القياسية للعملية الغاوسية،xت|x0شمال(α¯تx0،σت2أنا){\displaystyle x_{t}|x_{0}\sim N\left({\sqrt {{\bar {\alpha }}_{t}}}x_{0},\sigma _{t}^{2}I\right)}xت-1|xت،x0شمال(μ~ت(xت،x0)،σ~ت2أنا){\displaystyle x_{t-1}|x_{t},x_{0}\sim {\mathcal {N}}({\tilde {\mu }}_{t}(x_{t},x_{0}),{\tilde {\sigma }}_{t}^{2}I)}لاحظ على وجه الخصوص أنه بالنسبة للكبيرت{\displaystyle t}المتغيرxت|x0شمال(α¯تx0،σت2أنا){\displaystyle x_{t}|x_{0}\sim N\left({\sqrt {{\bar {\alpha }}_{t}}}x_{0},\sigma _{t}^{2}I\right)}يتقارب إلىشمال(0،أنا){\displaystyle {\mathcal {N}}(0,I)}أي أنه بعد عملية انتشار طويلة بما فيه الكفاية، ينتهي بنا المطاف ببعضxتي{\displaystyle x_{T}}هذا قريب جدًا منشمال(0،أنا){\displaystyle {\mathcal {N}}(0,I)}مع جميع آثار الأصلx0q{\displaystyle x_{0}\sim q}ذهب.

على سبيل المثال، بما أنxت|x0شمال(α¯تx0،σت2أنا){\displaystyle x_{t}|x_{0}\sim N\left({\sqrt {{\bar {\alpha }}_{t}}}x_{0},\sigma _{t}^{2}I\right)}يمكننا أخذ عيناتxت|x0{\displaystyle x_{t}|x_{0}}مباشرة "في خطوة واحدة"، بدلاً من المرور بجميع الخطوات الوسيطةx1،x2،...،xت-1{\displaystyle x_{1},x_{2},...,x_{t-1}}.

الاشتقاق عن طريق إعادة تحديد المعلمات

نحن نعلمxت-1|x0{\textstyle x_{t-1}|x_{0}}هو توزيع غاوسي، وxت|xت-1{\textstyle x_{t}|x_{t-1}}هو توزيع غاوسي آخر. ونعلم أيضاً أن هذين التوزيعين مستقلان. وبالتالي، يمكننا إعادة تحديد المعاملات:xت-1=α¯ت-1x0+1-α¯ت-1z{\displaystyle x_{t-1}={\sqrt {{\bar {\alpha }}_{t-1}}}x_{0}+{\sqrt {1-{\bar {\alpha }}_{t-1}}}z}xت=αتxت-1+1-αتz{\displaystyle x_{t}={\sqrt {\alpha _{t}}}x_{t-1}+{\sqrt {1-\alpha _{t}}}z'}أينz،z{\textstyle z,z'}هي توزيعات غاوسية مستقلة ومتطابقة التوزيع.

هناك 5 متغيراتx0،xت-1،xت،z،z{\textstyle x_{0},x_{t-1},x_{t},z,z'}ومعادلتان خطيتان. مصدرا العشوائية هماz،z{\textstyle z,z'}، والتي يمكن إعادة تحديد معالمها عن طريق الدوران، لأن التوزيع الغاوسي المستقل والمتطابق التوزيع متناظر دورانيًا.

من خلال إدخال المعادلات، يمكننا إيجاد الحل لإعادة تحديد المعلمات الأولى:xت=α¯تx0+αت-α¯تz+1-αتz=σتz"{\displaystyle x_{t}={\sqrt {{\bar {\alpha }}_{t}}}x_{0}+\underbrace {{\sqrt {\alpha _{t}-{\bar {\alpha }}_{t}}}z+{\sqrt {1-\alpha _{t}}}z'} _{=\sigma _{t}z''}}أينz"{\textstyle z''}هو توزيع غاوسي بمتوسط ​​صفر وتباين واحد.

لإيجاد القيمة الثانية، نكمل مصفوفة الدوران:[z"z]=[αت-α¯تσتβتσت؟؟][zz]{\displaystyle {\begin{bmatrix}z''\\z'''\end{bmatrix}}={\begin{bmatrix}{\frac {\sqrt {\alpha _{t}-{\bar {\alpha }}_{t}}}{\sigma _{t}}}&{\frac {\sqrt {\beta _{t}}}{\sigma _{t}}}\\?&?\end{bmatrix}}{\begin{bmatrix}z\\z'\end{bmatrix}}}

بما أن المصفوفات الدورانية كلها من الشكل[كوسθالخطيئةθ-الخطيئةθكوسθ]{\textstyle {\begin{bmatrix}\cos \theta &\sin \theta \\-\sin \theta &\cos \theta \end{bmatrix}}}نعلم أن المصفوفة يجب أن تكون[z"z]=[αت-α¯تσتβتσت-βتσتαت-α¯تσت][zz]{\displaystyle {\begin{bmatrix}z''\\z'''\end{bmatrix}}={\begin{bmatrix}{\frac {\sqrt {\alpha _{t}-{\bar {\alpha }}_{t}}}{\sigma _{t}}}&{\frac {\sqrt {\beta _{t}}}{\sigma _{t}}}\\-{\frac {\sqrt {\beta _{t}}}{\sigma _{t}}}&{\frac {\sqrt {\alpha _{t}-{\bar {\alpha }}_{t}}}{\sigma _{t}}}\end{bmatrix}}{\begin{bmatrix}z\\z'\end{bmatrix}}}وبما أن معكوس المصفوفة الدورانية هو منقولها، [zz]=[αت-α¯تσت-βتσتβتσتαت-α¯تσت][z"z]{\displaystyle {\begin{bmatrix}z\\z'\end{bmatrix}}={\begin{bmatrix}{\frac {\sqrt {\alpha _{t}-{\bar {\alpha }}_{t}}}{\sigma _{t}}}&-{\frac {\sqrt {\beta _{t}}}{\sigma _{t}}}\\{\frac {\sqrt {\beta _{t}}}{\sigma _{t}}}&{\frac {\sqrt {\alpha _{t}-{\bar {\alpha }}_{t}}}{\sigma _{t}}}\end{bmatrix}}{\begin{bmatrix}z''\\z'''\end{bmatrix}}}

بالعودة إلى العمل وتبسيطه، لديناxت=α¯تx0+σتz"{\displaystyle x_{t}={\sqrt {{\bar {\alpha }}_{t}}}x_{0}+\sigma _{t}z''}xت-1=μ~ت(xت،x0)-σ~تz{\displaystyle x_{t-1}={\tilde {\mu }}_{t}(x_{t},x_{0})-{\tilde {\sigma }}_{t}z'''}

الانتشار العكسي

تتمثل الفكرة الأساسية لـ DDPM في استخدام شبكة عصبية ذات معلمات بواسطةθ{\displaystyle \theta }تستقبل الشبكة وسيطينxت،ت{\displaystyle x_{t},t}، ويُخرج متجهًاμθ(xت،ت){\displaystyle \mu _{\theta }(x_{t},t)}ومصفوفةΣθ(xت،ت){\displaystyle \Sigma _{\theta }(x_{t},t)}بحيث يمكن التراجع عن كل خطوة في عملية الانتشار الأمامي تقريبًا بواسطةxت-1شمال(μθ(xت،ت)،Σθ(xت،ت)){\displaystyle x_{t-1}\sim {\mathcal {N}}(\mu _{\theta }(x_{t},t),\Sigma _{\theta }(x_{t},t))}وهذا بدوره يعطينا عملية انتشار عكسيصθ{\displaystyle p_{\theta }}محدد بواسطةصθ(xتي)=شمال(xتي|0،أنا){\displaystyle p_{\theta }(x_{T})={\mathcal {N}}(x_{T}|0,I)}صθ(xت-1|xت)=شمال(xت-1|μθ(xت،ت)،Σθ(xت،ت)){\displaystyle p_{\theta }(x_{t-1}|x_{t})={\mathcal {N}}(x_{t-1}|\mu _{\theta }(x_{t},t),\Sigma _{\theta }(x_{t},t))}الهدف الآن هو تعلم المعاييرθ{\displaystyle \theta }بحيثصθ(x0){\displaystyle p_{\theta }(x_{0})}أقرب ما يكون إلىq(x0){\displaystyle q(x_{0})}قدر الإمكان. وللقيام بذلك، نستخدم تقدير الاحتمال الأقصى مع الاستدلال التبايني.

الاستدلال التبايني

تنص متباينة إلبو على أنlnصθ(x0)هـx1:تيq(|x0)[lnصθ(x0:تي)-lnq(x1:تي|x0)]{\displaystyle \ln p_{\theta }(x_{0})\geq E_{x_{1:T}\sim q(\cdot |x_{0})}[\ln p_{\theta }(x_{0:T})-\ln q(x_{1:T}|x_{0})]}وبإضافة توقع آخر، نحصل علىهـx0q[lnصθ(x0)]هـx0:تيq[lnصθ(x0:تي)-lnq(x1:تي|x0)]{\displaystyle E_{x_{0}\sim q}[\ln p_{\theta }(x_{0})]\geq E_{x_{0:T}\sim q}[\ln p_{\theta }(x_{0:T})-\ln q(x_{1:T}|x_{0})]}نلاحظ أن تعظيم الكمية على اليمين سيعطينا حدًا أدنى لاحتمالية البيانات المرصودة. وهذا يسمح لنا بإجراء الاستدلال التبايني.

حدد دالة الخسارةل(θ):=-هـx0:تيq[lnصθ(x0:تي)-lnq(x1:تي|x0)]{\displaystyle L(\theta ):=-E_{x_{0:T}\sim q}[\ln p_{\theta }(x_{0:T})-\ln q(x_{1:T}|x_{0})]}والهدف الآن هو تقليل الخسارة عن طريق التدرج العشوائي . ويمكن تبسيط التعبير إلى [ 14 ]ل(θ)=ت=1تيهـxت-1،xتq[-lnصθ(xت-1|xت)]+هـx0q[دكل(q(xتي|x0)صθ(xتي))]+ج{\displaystyle L(\theta )=\sum _{t=1}^{T}E_{x_{t-1},x_{t}\sim q}[-\ln p_{\theta }(x_{t-1}|x_{t})]+E_{x_{0}\sim q}[D_{KL}(q(x_{T}|x_{0})\|p_{\theta }(x_{T}))]+C}أينج{\displaystyle C}لا يعتمد على المعامل، وبالتالي يمكن تجاهله.صθ(xتي)=شمال(xتي|0،أنا){\displaystyle p_{\theta }(x_{T})={\mathcal {N}}(x_{T}|0,I)}كما أنه لا يعتمد على المعامل، المصطلحهـx0q[دكل(q(xتي|x0)صθ(xتي))]{\displaystyle E_{x_{0}\sim q}[D_{KL}(q(x_{T}|x_{0})\|p_{\theta }(x_{T}))]}ويمكن تجاهل ذلك أيضاً. وهذا لا يترك سوىل(θ)=ت=1تيلت{\displaystyle L(\theta )=\sum _{t=1}^{T}L_{t}}معلت=هـxت-1،xتq[-lnصθ(xت-1|xت)]{\displaystyle L_{t}=E_{x_{t-1},x_{t}\sim q}[-\ln p_{\theta }(x_{t-1}|x_{t})]}يجب تقليلها إلى أدنى حد.

شبكة التنبؤ بالضوضاء

منذxت-1|xت،x0شمال(μ~ت(xت،x0)،σ~ت2أنا){\displaystyle x_{t-1}|x_{t},x_{0}\sim {\mathcal {N}}({\tilde {\mu }}_{t}(x_{t},x_{0}),{\tilde {\sigma }}_{t}^{2}I)}وهذا يشير إلى أنه ينبغي علينا استخدامμθ(xت،ت)=μ~ت(xت،x0){\displaystyle \mu _{\theta }(x_{t},t)={\tilde {\mu }}_{t}(x_{t},x_{0})}ومع ذلك، لا تملك الشبكة إمكانية الوصول إلىx0{\displaystyle x_{0}}وبالتالي، يتعين عليه تقديرها بدلاً من ذلك. الآن، بما أنxت|x0شمال(α¯تx0،σت2أنا){\displaystyle x_{t}|x_{0}\sim N\left({\sqrt {{\bar {\alpha }}_{t}}}x_{0},\sigma _{t}^{2}I\right)}قد نكتبxت=α¯تx0+σتz{\displaystyle x_{t}={\sqrt {{\bar {\alpha }}_{t}}}x_{0}+\sigma _{t}z}، أينz{\displaystyle z}هو نوع من الضوضاء الغاوسية غير المعروفة. الآن نرى أن التقديرx0{\displaystyle x_{0}}يعادل تقديرz{\displaystyle z}.

لذلك، دع الشبكة تُخرج متجه ضوضاءϵθ(xت،ت){\displaystyle \epsilon _{\theta }(x_{t},t)}ودعها تتنبأμθ(xت،ت)=μ~ت(xت،xت-σتϵθ(xت،ت)α¯ت)=xت-ϵθ(xت،ت)βت/σتαت{\displaystyle \mu _{\theta }(x_{t},t)={\tilde {\mu }}_{t}\left(x_{t},{\frac {x_{t}-\sigma _{t}\epsilon _{\theta }(x_{t},t)}{\sqrt {{\bar {\alpha }}_{t}}}}\right)={\frac {x_{t}-\epsilon _{\theta }(x_{t},t)\beta _{t}/\sigma _{t}}{\sqrt {\alpha _{t}}}}}يبقى التصميمΣθ(xت،ت){\displaystyle \Sigma _{\theta }(x_{t},t)}اقترحت ورقة DDPM عدم تعلمها (لأنها تؤدي إلى "تدريب غير مستقر وجودة عينة أضعف")، ولكن تثبيتها عند قيمة معينة.Σθ(xت،ت)=ζت2أنا{\displaystyle \Sigma _{\theta }(x_{t},t)=\zeta _{t}^{2}I}، حيث إماζت2=βت أو σ~ت2{\displaystyle \zeta _{t}^{2}=\beta _{t}{\text{ or }}{\tilde {\sigma }}_{t}^{2}}وقد حقق أداءً مماثلاً.

وبهذا، تتبسط الخسارة إلىلت=βت22αتσت2ζت2هـx0q؛zشمال(0،أنا)[ϵθ(xت،ت)-z2]+ج{\displaystyle L_{t}={\frac {\beta _{t}^{2}}{2\alpha _{t}\sigma _{t}^{2}\zeta _{t}^{2}}}E_{x_{0}\sim q;z\sim {\mathcal {N}}(0,I)}\left[\left\|\epsilon _{\theta }(x_{t},t)-z\right\|^{2}\right]+C}والتي يمكن تقليلها عن طريق التدرج العشوائي. وقد أشارت الورقة البحثية تجريبياً إلى أن دالة خسارة أبسطلsأنامصلهـ،ت=هـx0q؛zشمال(0،أنا)[ϵθ(xت،ت)-z2]{\displaystyle L_{simple,t}=E_{x_{0}\sim q;z\sim {\mathcal {N}}(0,I)}\left[\left\|\epsilon _{\theta }(x_{t},t)-z\right\|^{2}\right]}وأدى ذلك إلى نماذج أفضل.

عملية الانتشار العكسي

بعد تدريب شبكة التنبؤ بالضوضاء، يمكن استخدامها لتوليد نقاط البيانات في التوزيع الأصلي في حلقة تكرارية كما يلي:

  1. احسب تقدير الضوضاءϵϵθ(xت،ت){\displaystyle \epsilon \leftarrow \epsilon _{\theta }(x_{t},t)}
  2. احسب تقدير البيانات الأصليةx~0(xت-σتϵ)/α¯ت{\displaystyle {\tilde {x}}_{0}\leftarrow (x_{t}-\sigma _{t}\epsilon )/{\sqrt {{\bar {\alpha }}_{t}}}}
  3. قم بمعاينة البيانات السابقةxت-1شمال(μ~ت(xت،x~0)،σ~ت2أنا){\displaystyle x_{t-1}\sim {\mathcal {N}}({\tilde {\mu }}_{t}(x_{t},{\tilde {x}}_{0}),{\tilde {\sigma }}_{t}^{2}I)}
  4. تغيير الوقتتت-1{\displaystyle t\leftarrow t-1}

نموذج توليدي قائم على الدرجات

يُعدّ النموذج التوليدي القائم على الدرجات صيغةً أخرى لنمذجة الانتشار. ويُطلق عليه أيضًا اسم شبكة الدرجات الشرطية للضوضاء (NCSN) أو مطابقة الدرجات مع ديناميكيات لانجفين (SMLD). [ 15 ] [ 16 ] [ 17 ] [ 18 ]

مطابقة النقاط

فكرة دوال التقييم

لنفترض مشكلة توليد الصور.x{\displaystyle x}لنمثل صورة، ولندعq(x){\displaystyle q(x)}ليكن توزيع الاحتمالات على جميع الصور الممكنة. إذا كان لديناq(x){\displaystyle q(x)}إذا نظرنا إلى الصورة نفسها، يمكننا حينها أن نحدد بدقة مدى احتمالية ظهور صورة معينة. مع ذلك، فإن هذا الأمر غير قابل للحل عموماً.

في أغلب الأحيان، لا يهمنا معرفة الاحتمالية المطلقة لظهور صورة معينة. بدلاً من ذلك، يهمنا عادةً معرفة مدى احتمالية ظهور صورة معينة مقارنةً بالصور المجاورة لها مباشرةً - على سبيل المثال، ما مدى احتمالية ظهور صورة قطة مقارنةً ببعض الصور المصغرة لها؟ هل تزداد احتمالية ظهورها إذا احتوت الصورة على شعيرتين، أو ثلاث، أو مع إضافة بعض التشويش الغاوسي؟

وبالتالي، فإننا في الواقع غير مهتمين تمامًا بـq(x){\displaystyle q(x)}بل بالأحرى،xlnq(x){\displaystyle \nabla _{x}\ln q(x)}وهذا له تأثيران رئيسيان:

  • أولاً، لم نعد بحاجة إلى التطبيعq(x){\displaystyle q(x)}، ولكن يمكن استخدام أيq~(x)=جq(x){\displaystyle {\tilde {q}}(x)=Cq(x)}، أينج=q~(x)دx>0{\displaystyle C=\int {\tilde {q}}(x)dx>0}هو أي ثابت مجهول لا يهمنا.
  • ثانيًا، نحن نقارنq(x){\displaystyle q(x)}الجيرانq(x+دx){\displaystyle q(x+dx)}، بواسطةq(x)q(x+دx)=هـ-xlnq،دx{\displaystyle {\frac {q(x)}{q(x+dx)}}=e^{-\langle \nabla _{x}\ln q,dx\rangle }}

لنفترض أن دالة النتيجة هيs(x):=xlnq(x){\displaystyle s(x):=\nabla _{x}\ln q(x)}ثم فكر فيما يمكننا فعله بـs(x){\displaystyle s(x)}.

وكما اتضح،s(x){\displaystyle s(x)}يسمح لنا بأخذ عينات منq(x){\displaystyle q(x)}باستخدام الديناميكا الحرارية. تحديدًا، إذا كان لدينا دالة طاقة كامنةيو(x)=-lnq(x){\displaystyle U(x)=-\ln q(x)}وإذا كان هناك عدد كبير من الجسيمات في بئر الجهد، فإن التوزيع عند التوازن الديناميكي الحراري يكون توزيع بولتزمان.qيو(x)هـ-يو(x)/كبتي=q(x)1/كبتي{\displaystyle q_{U}(x)\propto e^{-U(x)/k_{B}T}=q(x)^{1/k_{B}T}}عند درجة الحرارةكبتي=1{\displaystyle k_{B}T=1}توزيع بولتزمان هو بالضبطq(x){\displaystyle q(x)}.

لذلك، لنمذجةq(x){\displaystyle q(x)}يمكننا البدء بجسيم تم اختياره عشوائيًا من أي توزيع مناسب (مثل التوزيع الغاوسي القياسي)، ثم محاكاة حركة الجسيم للأمام وفقًا لمعادلة لانجفين.دxت=-xتيو(xت)دت+ددبليوت{\displaystyle dx_{t}=-\nabla _{x_{t}}U(x_{t})dt+dW_{t}} وتوزيع بولتزمان، وفقًا لمعادلة فوكر-بلانك، هو التوازن الديناميكي الحراري الوحيد . لذا بغض النظر عن التوزيعx0{\displaystyle x_{0}}توزيعxت{\displaystyle x_{t}}يتقارب في التوزيع إلىq{\displaystyle q}مثلت{\displaystyle t\to \infty }.

تعلم وظيفة التسجيل

بافتراض الكثافةq{\displaystyle q}نرغب في تعلم تقريب دالة التقييموθlnq{\displaystyle f_{\theta }\approx \nabla \ln q}هذا ما يُعرف بمطابقة الدرجات . [ 19 ] عادةً ما تُصاغ مطابقة الدرجات رسميًا على أنها تقليل دالة تباعد فيشرهـq[وθ(x)-lnq(x)2]{\displaystyle E_{q}[\|f_{\theta }(x)-\nabla \ln q(x)\|^{2}]}عن طريق توسيع التكامل، وإجراء التكامل بالتجزئة ،هـq[وθ(x)-lnq(x)2]=هـq[وθ2+2وθ]+ج{\displaystyle E_{q}[\|f_{\theta }(x)-\nabla \ln q(x)\|^{2}]=E_{q}[\|f_{\theta }\|^{2}+2\nabla \cdot f_{\theta }]+C}مما يعطينا دالة خسارة، تُعرف أيضًا باسم قاعدة تسجيل Hyvärinen ، والتي يمكن تقليلها عن طريق الانحدار التدرجي العشوائي.

تلدين دالة النتيجة

لنفترض أننا بحاجة إلى نمذجة توزيع الصور، ونريدx0شمال(0،أنا){\displaystyle x_{0}\sim {\mathcal {N}}(0,I)}صورة ضوضاء بيضاء. الآن، معظم صور الضوضاء البيضاء لا تبدو كصور حقيقية، لذاq(x0)0{\displaystyle q(x_{0})\approx 0}لمساحات واسعة منx0شمال(0،أنا){\displaystyle x_{0}\sim {\mathcal {N}}(0,I)}يمثل هذا مشكلة في تعلم دالة التقييم، لأنه إذا لم تكن هناك عينات حول نقطة معينة، فلن نتمكن من تعلم دالة التقييم عند تلك النقطة. إذا لم نكن نعرف دالة التقييمxتlnq(xت){\displaystyle \nabla _{x_{t}}\ln q(x_{t})}عند هذه النقطة، لا يمكننا فرض معادلة التطور الزمني على الجسيم:دxت=xتlnq(xت)دت+ددبليوت{\displaystyle dx_{t}=\nabla _{x_{t}}\ln q(x_{t})dt+dW_{t}}لحل هذه المشكلة، نقوم بعملية التلدين . إذاq{\displaystyle q}إذا كان التوزيع مختلفًا جدًا عن توزيع الضوضاء البيضاء، نضيف الضوضاء تدريجيًا حتى يصبح غير قابل للتمييز عنه. أي أننا نجري عملية انتشار أمامي، ثم نتعلم دالة التقييم، ثم نستخدم دالة التقييم لإجراء عملية انتشار عكسي.

عمليات الانتشار المستمر

عملية الانتشار الأمامي

لننظر مرة أخرى في عملية الانتشار الأمامي، ولكن هذه المرة في زمن مستمر:xت=1-βتxت-1+βتzت{\displaystyle x_{t}={\sqrt {1-\beta _{t}}}x_{t-1}+{\sqrt {\beta _{t}}}z_{t}}عن طريق أخذβتβ(ت)دت،دتzتددبليوت{\displaystyle \beta _{t}\to \beta (t)dt,{\sqrt {dt}}z_{t}\to dW_{t}}في النهاية، نحصل على عملية انتشار مستمرة، على شكل معادلة تفاضلية عشوائية :دxت=-12β(ت)xتدت+β(ت)ددبليوت{\displaystyle dx_{t}=-{\frac {1}{2}}\beta (t)x_{t}dt+{\sqrt {\beta (t)}}dW_{t}}أيندبليوت{\displaystyle W_{t}}هي عملية وينر (حركة براونية متعددة الأبعاد).

الآن، تُعدّ المعادلة حالة خاصة من معادلة لانجفين ذات التخميد الزائد.دxت=-دكبتي(xيو)دت+2دددبليوت{\displaystyle dx_{t}=-{\frac {D}{k_{B}T}}(\nabla _{x}U)dt+{\sqrt {2D}}dW_{t}}أيند{\displaystyle D}هو موتر الانتشار،تي{\displaystyle T}درجة الحرارة، ويو{\displaystyle U}هو مجال طاقة كامنة. إذا استبدلنا فيد=12β(ت)أنا،كبتي=1،يو=12x2{\displaystyle D={\frac {1}{2}}\beta (t)I,k_{B}T=1,U={\frac {1}{2}}\|x\|^{2}}وبذلك نستعيد المعادلة المذكورة أعلاه. وهذا يفسر سبب استخدام عبارة "ديناميكيات لانجفين" أحيانًا في نماذج الانتشار.

المعادلة أعلاه تصف الحركة العشوائية لجسيم واحد. لنفترض أن لدينا سحابة من الجسيمات موزعة وفقًا لـq{\displaystyle q}في ذلك الوقتت=0{\displaystyle t=0}ثم بعد فترة طويلة، ستستقر سحابة الجسيمات في التوزيع المستقر لـشمال(0،أنا){\displaystyle {\mathcal {N}}(0,I)}. يتركρت{\displaystyle \rho _{t}}لتكن كثافة سحابة الجسيمات في الزمنت{\displaystyle t}ثم لديناρ0=q؛ρتيشمال(0،أنا){\displaystyle \rho _{0}=q;\quad \rho _{T}\approx {\mathcal {N}}(0,I)}والهدف هو عكس العملية بطريقة ما، بحيث يمكننا البدء من النهاية والعودة إلى البداية.

وفقًا لمعادلة فوكر-بلانك ، تتطور كثافة السحابة وفقًا لـتlnρت=12β(ت)(ن+(x+lnρت)lnρت+Δlnρت){\displaystyle \partial _{t}\ln \rho _{t}={\frac {1}{2}}\beta (t)\left(n+(x+\nabla \ln \rho _{t})\cdot \nabla \ln \rho _{t}+\Delta \ln \rho _{t}\right)}أينن{\displaystyle n}هو بُعد الفضاء، وΔ{\displaystyle \Delta }هو عامل لابلاس . أو بعبارة أخرى،تρت=12β(ت)((xρت)+Δρت){\displaystyle \partial _{t}\rho _{t}={\frac {1}{2}}\beta (t)(\nabla \cdot (x\rho _{t})+\Delta \rho _{t})}

عملية الانتشار العكسي

إذا كنا قد حللناρت{\displaystyle \rho _{t}}لوقتت[0،تي]{\displaystyle t\in [0,T]}عندها يمكننا عكس تطور السحابة تمامًا. لنفترض أننا بدأنا بسحابة أخرى من الجسيمات ذات كثافةν0=ρتي{\displaystyle \nu _{0}=\rho _{T}}ودع الجسيمات في السحابة تتطور وفقًا لـ

دyت=12β(تي-ت)yتدت+β(تي-ت)yتlnρتي-ت(yت)دالة التقييم دت+β(تي-ت)ددبليوت{\displaystyle dy_{t}={\frac {1}{2}}\beta (T-t)y_{t}dt+\beta (T-t)\underbrace {\nabla _{y_{t}}\ln \rho _{T-t}\left(y_{t}\right)} _{\text{score function }}dt+{\sqrt {\beta (T-t)}}dW_{t}}

ثم بالتعويض في معادلة فوكر-بلانك، نجد أنتρتي-ت=تνت{\displaystyle \partial _{t}\rho _{T-t}=\partial _{t}\nu _{t}}وبالتالي فإن هذه السحابة من النقاط هي السحابة الأصلية، التي تتطور إلى الوراء. [ 20 ]

شبكة النقاط الشرطية للضوضاء (NCSN)

عند الحد المستمر، α¯ت=(1-β1)(1-βت)=هـأناln(1-βأنا)هـ-0تβ(ت)دت{\displaystyle {\bar {\alpha }}_{t}=(1-\beta _{1})\cdots (1-\beta _{t})=e^{\sum _{i}\ln(1-\beta _{i})}\to e^{-\int _{0}^{t}\beta (t)dt}} وهكذا xت|x0شمال(هـ-120تβ(ت)دتx0،(1-هـ-0تβ(ت)دت)أنا){\displaystyle x_{t}|x_{0}\sim N\left(e^{-{\frac {1}{2}}\int _{0}^{t}\beta (t)dt}x_{0},\left(1-e^{-\int _{0}^{t}\beta (t)dt}\right)I\right)} على وجه الخصوص، نرى أنه يمكننا أخذ عينات مباشرة من أي نقطة في عملية الانتشار المستمر دون المرور بالخطوات الوسيطة، وذلك عن طريق أخذ العينات أولاً.x0q،zشمال(0،أنا){\displaystyle x_{0}\sim q,z\sim {\mathcal {N}}(0,I)}ثم احصل علىxت=هـ-120تβ(ت)دتx0+(1-هـ-0تβ(ت)دت)z{\displaystyle x_{t}=e^{-{\frac {1}{2}}\int _{0}^{t}\beta (t)dt}x_{0}+\left(1-e^{-\int _{0}^{t}\beta (t)dt}\right)z}أي أنه يمكننا أخذ عينات بسرعةxتρت{\displaystyle x_{t}\sim \rho _{t}}لأيت0{\displaystyle t\geq 0}.

والآن، حدد توزيعًا احتماليًا معينًاγ{\displaystyle \gamma }زيادة[0،){\displaystyle [0,\infty )}ثم يتم تعريف دالة خسارة مطابقة الدرجات على أنها تباعد فيشر المتوقع: ل(θ)=هـتγ،xتρت[وθ(xت،ت)2+2وθ(xت،ت)]{\displaystyle L(\theta )=E_{t\sim \gamma ,x_{t}\sim \rho _{t}}[\|f_{\theta }(x_{t},t)\|^{2}+2\nabla \cdot f_{\theta }(x_{t},t)]} بعد التدريب،وθ(xت،ت)lnρت{\displaystyle f_{\theta }(x_{t},t)\approx \nabla \ln \rho _{t}}لذلك يمكننا إجراء عملية الانتشار العكسي عن طريق أخذ العينات أولاًxتيشمال(0،أنا){\displaystyle x_{T}\sim {\mathcal {N}}(0,I)}ثم دمج المعادلة التفاضلية العشوائية منت=تي{\displaystyle t=T}لت=0{\displaystyle t=0}: xت-دت=xت+12β(ت)xتدت+β(ت)وθ(xت،ت)دت+β(ت)ددبليوت{\displaystyle x_{t-dt}=x_{t}+{\frac {1}{2}}\beta (t)x_{t}dt+\beta (t)f_{\theta }(x_{t},t)dt+{\sqrt {\beta (t)}}dW_{t}} يمكن القيام بذلك عن طريق أي طريقة تكامل للمعادلات التفاضلية العشوائية، مثل طريقة أويلر-ماروياما .

يُفسَّر اسم "شبكة النتيجة الشرطية للضوضاء" على النحو التالي:

  • "شبكة"، لأنوθ{\displaystyle f_{\theta }}يتم تنفيذه كشبكة عصبية.
  • "النتيجة"، لأن مخرجات الشبكة تُفسر على أنها تقارب دالة النتيجةlnρت{\displaystyle \nabla \ln \rho _{t}}.
  • "مشروط بالضوضاء"، لأنρت{\displaystyle \rho _{t}}يساويρ0{\displaystyle \rho _{0}}يتم تشويشها بواسطة ضوضاء غاوسية مضافة تزداد مع مرور الوقت، وبالتالي تعتمد دالة النتيجة على مقدار الضوضاء المضافة.

تكافؤهما

تُعتبر نماذج DDPM والنماذج التوليدية القائمة على الدرجات متكافئة. [ 16 ] [ 1 ] [ 21 ] وهذا يعني أنه يمكن استخدام شبكة مُدرَّبة باستخدام DDPM كشبكة NCSN، والعكس صحيح.

نحن نعلم ذلكxت|x0شمال(α¯تx0،σت2أنا){\displaystyle x_{t}|x_{0}\sim N\left({\sqrt {{\bar {\alpha }}_{t}}}x_{0},\sigma _{t}^{2}I\right)}وبناءً على صيغة تويدي ، لدينا xتlnq(xت)=1σت2(-xت+α¯تهـq[x0|xت]){\displaystyle \nabla _{x_{t}}\ln q(x_{t})={\frac {1}{\sigma _{t}^{2}}}(-x_{t}+{\sqrt {{\bar {\alpha }}_{t}}}E_{q}[x_{0}|x_{t}])} كما سبق ذكره، فإن دالة خسارة DDPM هيتلsأنامصلهـ،ت{\displaystyle \sum _{t}L_{simple,t}}مع لsأنامصلهـ،ت=هـx0q؛zشمال(0،أنا)[ϵθ(xت،ت)-z2]{\displaystyle L_{simple,t}=E_{x_{0}\sim q;z\sim {\mathcal {N}}(0,I)}\left[\left\|\epsilon _{\theta }(x_{t},t)-z\right\|^{2}\right]} أينxت=α¯تx0+σتz{\displaystyle x_{t}={\sqrt {{\bar {\alpha }}_{t}}}x_{0}+\sigma _{t}z}بتغيير المتغيرات، لsأنامصلهـ،ت=هـx0،xتq[ϵθ(xت،ت)-xت-α¯تx0σت2]=هـxتq،x0q(|xت)[ϵθ(xت،ت)-xت-α¯تx0σت2]{\displaystyle L_{simple,t}=E_{x_{0},x_{t}\sim q}\left[\left\|\epsilon _{\theta }(x_{t},t)-{\frac {x_{t}-{\sqrt {{\bar {\alpha }}_{t}}}x_{0}}{\sigma _{t}}}\right\|^{2}\right]=E_{x_{t}\sim q,x_{0}\sim q(\cdot |x_{t})}\left[\left\|\epsilon _{\theta }(x_{t},t)-{\frac {x_{t}-{\sqrt {{\bar {\alpha }}_{t}}}x_{0}}{\sigma _{t}}}\right\|^{2}\right]} ويصبح الحد الداخلي انحدارًا للمربعات الصغرى، لذلك إذا وصلت الشبكة بالفعل إلى الحد الأدنى العالمي للخسارة، فسنحصل علىϵθ(xت،ت)=xت-α¯تهـq[x0|xت]σت=-σتxتlnq(xت){\displaystyle \epsilon _{\theta }(x_{t},t)={\frac {x_{t}-{\sqrt {{\bar {\alpha }}_{t}}}E_{q}[x_{0}|x_{t}]}{\sigma _{t}}}=-\sigma _{t}\nabla _{x_{t}}\ln q(x_{t})}

وبالتالي، إذا كانت الشبكة جيدة وتعتمد على الدرجات، فإن الدرجة المتوقعة لها تمثل تنبؤًا جيدًا للضوضاء (بعد تعديلها بمعامل معين).σت{\displaystyle \sigma _{t}}وبالتالي يمكن استخدامها لإزالة الضوضاء.

وعلى العكس من ذلك، فإن النهاية المستمرةxت-1=xت-دت،βت=β(ت)دت،zتدت=ددبليوت{\displaystyle x_{t-1}=x_{t-dt},\beta _{t}=\beta (t)dt,z_{t}{\sqrt {dt}}=dW_{t}}المعادلة العكسية xت-1=xتαت-βتσتαتϵθ(xت،ت)+βتzت؛zتشمال(0،أنا){\displaystyle x_{t-1}={\frac {x_{t}}{\sqrt {\alpha _{t}}}}-{\frac {\beta _{t}}{\sigma _{t}{\sqrt {\alpha _{t}}}}}\epsilon _{\theta }(x_{t},t)+{\sqrt {\beta _{t}}}z_{t};\quad z_{t}\sim {\mathcal {N}}(0,I)} يعطينا نفس المعادلة تمامًا مثل الانتشار القائم على النتيجة: xت-دت=xت(1+β(ت)دت/2)+β(ت)xتlnq(xت)دت+β(ت)ددبليوت{\displaystyle x_{t-dt}=x_{t}(1+\beta (t)dt/2)+\beta (t)\nabla _{x_{t}}\ln q(x_{t})dt+{\sqrt {\beta (t)}}dW_{t}}وبالتالي، في الخطوات المتناهية الصغر لـ DDPM، تقوم شبكة إزالة الضوضاء بتنفيذ عملية الانتشار القائمة على الدرجات.

المتغيرات الرئيسية

جدول الضوضاء

رسم توضيحي لجدول ضوضاء الانتشار الخطي. مع الإعداداتβ1=10-4،β1000=0.02{\displaystyle \beta _{1}=10^{-4},\beta _{1000}=0.02}.

في نظام DDPM، تسلسل الأرقام0=σ0<σ1<<σتي<1{\displaystyle 0=\sigma _{0}<\sigma _{1}<\cdots <\sigma _{T}<1}يُطلق عليه اسم جدول الضوضاء (الزمن المتقطع) . بشكل عام، ضع في اعتبارك دالة رتيبة متزايدة تمامًاσ{\displaystyle \sigma }من النوعR(0،1){\displaystyle \mathbb {R} \to (0,1)}، مثل دالة سيجمويد . في هذه الحالة، يكون جدول الضوضاء عبارة عن سلسلة من الأعداد الحقيقيةλ1<λ2<<λتي{\displaystyle \lambda _{1}<\lambda _{2}<\cdots <\lambda _{T}}ثم يحدد سلسلة من الضوضاءσت:=σ(λت){\displaystyle \sigma _{t}:=\sigma (\lambda _{t})}والتي بدورها تستنتج الكميات الأخرىβت=1-1-σت21-σت-12{\displaystyle \beta _{t}=1-{\frac {1-\sigma _{t}^{2}}{1-\sigma _{t-1}^{2}}}}.

من أجل استخدام جداول الضوضاء العشوائية، بدلاً من تدريب نموذج التنبؤ بالضوضاءϵθ(xت،ت){\displaystyle \epsilon _{\theta }(x_{t},t)}قطار واحدϵθ(xت،σت){\displaystyle \epsilon _{\theta }(x_{t},\sigma _{t})}.

وبالمثل، بالنسبة لشبكة النتيجة الشرطية للضوضاء، بدلاً من التدريبوθ(xت،ت){\displaystyle f_{\theta }(x_{t},t)}قطار واحدوθ(xت،σت){\displaystyle f_{\theta }(x_{t},\sigma _{t})}.

نموذج انتشار تقليل الضوضاء الضمني (DDIM)

تُعد طريقة DDPM الأصلية لتوليد الصور بطيئة، لأن عملية الانتشار الأمامي تستغرق عادةًتي1000{\displaystyle T\sim 1000}لتسهيل توزيعxتي{\displaystyle x_{T}}ليظهر التوزيع قريبًا من التوزيع الغاوسي. ومع ذلك، فهذا يعني أن عملية الانتشار العكسي تستغرق أيضًا 1000 خطوة. على عكس عملية الانتشار الأمامي، التي يمكنها تخطي بعض الخطوات.xت|x0{\displaystyle x_{t}|x_{0}}التوزيع غاوسي للجميعت1{\displaystyle t\geq 1}لا تسمح عملية الانتشار العكسي بتجاوز الخطوات. على سبيل المثال، لأخذ عينةxت-2|xت-1شمال(μθ(xت-1،ت-1)،Σθ(xت-1،ت-1)){\displaystyle x_{t-2}|x_{t-1}\sim {\mathcal {N}}(\mu _{\theta }(x_{t-1},t-1),\Sigma _{\theta }(x_{t-1},t-1))}يتطلب ذلك من النموذج أولاً أخذ عينةxت-1{\displaystyle x_{t-1}}محاولة أخذ عينات مباشرةxت-2|xت{\displaystyle x_{t-2}|x_{t}}سيتطلب ذلك منا تهميشxت-1{\displaystyle x_{t-1}}وهو أمر يصعب حله عموماً.

تُعدّ DDIM [ 22 ] طريقةً لأخذ أي نموذج مُدرَّب على خسارة DDPM، واستخدامها لأخذ عينات مع تخطي بعض الخطوات، مما يُؤدي إلى التضحية بقدرٍ قابلٍ للتعديل من الجودة. إذا قمنا بتحويل حالة سلسلة ماركوفية في DDPM إلى حالة غير ماركوفية، فإن DDIM تُطابق الحالة التي يكون فيها تباين العملية العكسية مساويًا للصفر. بعبارة أخرى، تكون العملية العكسية (وكذلك العملية الأمامية) حتمية. عند استخدام عدد أقل من خطوات أخذ العينات، تتفوق DDIM على DDPM.

بالتفصيل، طريقة أخذ العينات DDIM هي كما يلي. ابدأ بعملية الانتشار الأماميxت=α¯تx0+σتϵ{\displaystyle x_{t}={\sqrt {{\bar {\alpha }}_{t}}}x_{0}+\sigma _{t}\epsilon }ثم، أثناء عملية إزالة التشويش العكسي، بالنظر إلىxت،ϵθ(xت،ت){\displaystyle x_{t},\epsilon _{\theta }(x_{t},t)}، يتم تقدير البيانات الأصلية على النحو التاليx0=xت-σتϵθ(xت،ت)α¯ت{\displaystyle x_{0}'={\frac {x_{t}-\sigma _{t}\epsilon _{\theta }(x_{t},t)}{\sqrt {{\bar {\alpha }}_{t}}}}}عندها يمكن لعملية الانتشار العكسي أن تنتقل إلى أي خطوة0s<ت{\displaystyle 0\leq s<t}والعينة التالية التي تم إزالة التشويش منها هيxs=α¯sx0+σs2-(σs)2ϵθ(xت،ت)+σsϵ{\displaystyle x_{s}={\sqrt {{\bar {\alpha }}_{s}}}x_{0}'+{\sqrt {\sigma _{s}^{2}-(\sigma '_{s})^{2}}}\epsilon _{\theta }(x_{t},t)+\sigma _{s}'\epsilon }أينσs{\displaystyle \sigma _{s}'}هو عدد حقيقي اختياري ضمن النطاق[0،σs]{\displaystyle [0,\sigma _{s}]}، وϵشمال(0،أنا){\displaystyle \epsilon \sim {\mathcal {N}}(0,I)}هو ضوضاء غاوسية تم أخذ عينات منها حديثًا. [ 14 ] إذا كان كلσs=0{\displaystyle \sigma _{s}'=0}ثم تصبح العملية العكسية حتمية، وتُسمى هذه الحالة الخاصة من DDIM أيضًا "DDIM". وقد أشارت الورقة البحثية الأصلية إلى أنه عندما تكون العملية حتمية، فإن العينات المُولَّدة بـ 20 خطوة فقط تكون متشابهة جدًا مع تلك المُولَّدة بـ 1000 خطوة على المستوى العالي.

أوصت الورقة الأصلية بتحديد "قيمة إيتا" واحدة.η[0،1]{\displaystyle \eta \in [0,1]}بحيثσs=ησ~s{\displaystyle \sigma _{s}'=\eta {\tilde {\sigma }}_{s}}. متىη=1{\displaystyle \eta =1}هذا هو الإصدار الأصلي من DDPM. عندماη=0{\displaystyle \eta =0}هذا هو نموذج DDIM الحتمي بالكامل. أما بالنسبة للقيم المتوسطة، فإن العملية تقوم بالاستيفاء بينها.

وبناءً على ذلك، تنطبق خوارزمية DDIM أيضًا على نماذج الانتشار القائمة على الدرجات.

نموذج الانتشار الكامن (LDM)

بما أن نموذج الانتشار هو طريقة عامة لنمذجة التوزيعات الاحتمالية، فإذا أردنا نمذجة توزيع على الصور، يمكننا أولاً ترميز الصور في فضاء ذي أبعاد أقل باستخدام مُشفِّر، ثم استخدام نموذج الانتشار لنمذجة التوزيع على الصور المُرمَّزة. بعد ذلك، لإنشاء صورة، يمكننا أخذ عينة من نموذج الانتشار، ثم استخدام مُفكِّك ترميز لتحويلها إلى صورة. [ 23 ]

غالباً ما يكون زوج المشفر-المفكك عبارة عن مشفر تلقائي متغير (VAE).

التحسينات المعمارية

[ 24 ] اقترحوا تحسينات معمارية متنوعة. على سبيل المثال، اقترحوا استخدام الاستيفاء اللوغاريتمي أثناء أخذ العينات العكسي. بدلاً من أخذ العينات منxت-1شمال(μ~ت(xت،x~0)،σ~ت2أنا){\displaystyle x_{t-1}\sim {\mathcal {N}}({\tilde {\mu }}_{t}(x_{t},{\tilde {x}}_{0}),{\tilde {\sigma }}_{t}^{2}I)}وقد أوصوا بأخذ عينات منشمال(μ~ت(xت،x~0)،(σتvσ~ت1-v)2أنا){\displaystyle {\mathcal {N}}({\tilde {\mu }}_{t}(x_{t},{\tilde {x}}_{0}),(\sigma _{t}^{v}{\tilde {\sigma }}_{t}^{1-v})^{2}I)}بالنسبة لمعامل مُتعلمv{\displaystyle v}.

في صيغة التنبؤ v ، صيغة الضوضاءxت=α¯تx0+1-α¯تϵت{\displaystyle x_{t}={\sqrt {{\bar {\alpha }}_{t}}}x_{0}+{\sqrt {1-{\bar {\alpha }}_{t}}}\epsilon _{t}}يتم إعادة تحديد المعلمات بواسطة زاويةϕت{\displaystyle \phi _{t}}بحيثكوسϕت=α¯ت{\displaystyle \cos \phi _{t}={\sqrt {{\bar {\alpha }}_{t}}}}و"سرعة" محددة بواسطةكوسϕتϵت-الخطيئةϕتx0{\displaystyle \cos \phi _{t}\epsilon _{t}-\sin \phi _{t}x_{0}}يتم تدريب الشبكة على التنبؤ بالسرعةv^θ{\displaystyle {\hat {v}}_{\theta }}ويتم إزالة الضوضاء بواسطةxϕت-دلتا=كوس(دلتا)xϕت-الخطيئة(دلتا)v^θ(xϕت){\displaystyle x_{\phi _{t}-\delta }=\cos(\delta )\;x_{\phi _{t}}-\sin(\delta ){\hat {v}}_{\theta }\;(x_{\phi _{t}})}[ 25 ] وُجد أن هذه المعلمة تُحسّن الأداء، حيث يمكن تدريب النموذج للوصول إلى مستوى الضوضاء الكلي (أيϕت=90{\displaystyle \phi _{t}=90^{\circ }}ثم يعكسها، في حين أن المعايرة القياسية لا تصل أبدًا إلى الضوضاء الكاملة لأنα¯ت>0{\displaystyle {\sqrt {{\bar {\alpha }}_{t}}}>0}صحيح دائمًا. [ 26 ]

توجيه المصنف

تم اقتراح توجيه المصنف في عام 2021 لتحسين توليد الصور المشروطة بالفئة باستخدام مصنف. استخدم المنشور الأصلي مشفرات نص CLIP لتحسين توليد الصور المشروطة بالنص. [ 27 ]

لنفترض أننا نرغب في أخذ عينة ليس من التوزيع الكامل للصور، بل بناءً على وصف الصورة. لا نريد أخذ عينة من صورة عامة، بل من صورة تتناسب مع الوصف "قطة سوداء بعيون حمراء". عمومًا، نريد أخذ عينة من التوزيعص(x|y){\displaystyle p(x|y)}، أينx{\displaystyle x}تتراوح بين الصور، وy{\displaystyle y}تتراوح بين فئات الصور (وصف "قطة سوداء ذات عيون حمراء" هو مجرد فئة مفصلة للغاية، وفئة "قطة" هي مجرد وصف غامض للغاية).

من منظور نموذج القناة المشوشة ، يمكننا فهم العملية على النحو التالي: لتوليد صورةx{\displaystyle x}مشروط بالوصفy{\displaystyle y}نتصور أن مقدم الطلب كان يقصد صورة معينة بالفعلx{\displaystyle x}لكن الصورة تمر عبر قناة مشوشة فتخرج مشوشة، كماy{\displaystyle y}إن توليد الصور ليس إلا استنتاجًا لماx{\displaystyle x}ما كان في ذهن مقدم الطلب.

بمعنى آخر، توليد الصور المشروط هو ببساطة "ترجمة من لغة نصية إلى لغة تصويرية". ثم، كما هو الحال في نموذج القناة المشوشة، نستخدم نظرية بايز للحصول على ص(x|y)ص(y|x)ص(x){\displaystyle p(x|y)\propto p(y|x)p(x)} بمعنى آخر، إذا كان لدينا نموذج جيد لفضاء جميع الصور، ومترجم جيد من الصورة إلى الفئة، فسنحصل على مترجم من الفئة إلى الصورة "مجانًا". في معادلة الانتشار العكسي، تكون النتيجةlnص(x){\displaystyle \nabla \ln p(x)}يمكن استبدالها بـ xlnص(x|y)=xlnص(x)نتيجة+xlnص(y|x)توجيه المصنف{\displaystyle \nabla _{x}\ln p(x|y)=\underbrace {\nabla _{x}\ln p(x)} _{\text{score}}+\underbrace {\nabla _{x}\ln p(y|x)} _{\text{classifier guidance}}} أينxlnص(x){\displaystyle \nabla _{x}\ln p(x)}هي دالة التقييم، التي تم تدريبها كما هو موضح سابقًا، وxlnص(y|x){\displaystyle \nabla _{x}\ln p(y|x)}يتم إيجادها باستخدام مصنف صور قابل للتفاضل.

خلال عملية الانتشار، نحتاج إلى مراعاة عامل الوقت، مما يعطيxتlnص(xت|y،ت)=xتlnص(y|xت،ت)+xتlnص(xت|ت){\displaystyle \nabla _{x_{t}}\ln p(x_{t}|y,t)=\nabla _{x_{t}}\ln p(y|x_{t},t)+\nabla _{x_{t}}\ln p(x_{t}|t)}على الرغم من أن نموذج المصنف عادةً لا يعتمد على الوقت، ففي هذه الحالةص(y|xت،ت)=ص(y|xت){\displaystyle p(y|x_{t},t)=p(y|x_{t})}.

يتم تعريف توجيه المصنف لتدرج دالة النتيجة، وبالتالي لشبكة الانتشار القائمة على النتيجة، ولكن كما ذُكر سابقًا، فإن نماذج الانتشار القائمة على النتيجة تُعادل نماذج إزالة التشويش بواسطةϵθ(xت،ت)=-σتxتlnص(xت|ت){\displaystyle \epsilon _{\theta }(x_{t},t)=-\sigma _{t}\nabla _{x_{t}}\ln p(x_{t}|t)}وبالمثل،ϵθ(xت،y،ت)=-σتxتlnص(xت|y،ت){\displaystyle \epsilon _{\theta }(x_{t},y,t)=-\sigma _{t}\nabla _{x_{t}}\ln p(x_{t}|y,t)}لذلك، فإن توجيه المصنف يعمل على إزالة التشويش من الانتشار أيضًا، باستخدام التنبؤ المعدل بالضوضاء: [ 27 ]ϵθ(xت،y،ت)=ϵθ(xت،ت)-σتxتlnص(y|xت،ت)توجيه المصنف{\displaystyle \epsilon _{\theta }(x_{t},y,t)=\epsilon _{\theta }(x_{t},t)-\underbrace {\sigma _{t}\nabla _{x_{t}}\ln p(y|x_{t},t)} _{\text{classifier guidance}}}

مع درجة الحرارة

عينات نموذج الانتشار الموجه بالمصنف منص(x|y){\displaystyle p(x|y)}، والتي تتركز حول التقدير اللاحق الأقصىargالأعلىxص(x|y){\displaystyle \arg \max _{x}p(x|y)}إذا أردنا إجبار النموذج على التحرك نحو تقدير الاحتمال الأقصىargالأعلىxص(y|x){\displaystyle \arg \max _{x}p(y|x)}، يمكننا استخدام صγ(x|y)ص(y|x)γص(x){\displaystyle p_{\gamma }(x|y)\propto p(y|x)^{\gamma }p(x)} أينγ>0{\displaystyle \gamma >0}يمكن تفسيرها على أنها مقلوب درجة الحرارة . في سياق نماذج الانتشار، تُسمى عادةً مقياس التوجيه . قيمة عاليةγ{\displaystyle \gamma }سيجبر ذلك النموذج على أخذ عينات من توزيع يتركز حولargالأعلىxص(y|x){\displaystyle \arg \max _{x}p(y|x)}وهذا يحسن أحيانًا جودة الصور المُولَّدة. [ 27 ]

وهذا يُعطي تعديلاً للمعادلة السابقة:xlnصβ(x|y)=xlnص(x)+γxlnص(y|x){\displaystyle \nabla _{x}\ln p_{\beta }(x|y)=\nabla _{x}\ln p(x)+\gamma \nabla _{x}\ln p(y|x)}بالنسبة لنماذج إزالة الضوضاء، فإنها تتوافق مع [ 28 ]ϵθ(xت،y،ت)=ϵθ(xت،ت)-γσتxتlnص(y|xت،ت){\displaystyle \epsilon _{\theta }(x_{t},y,t)=\epsilon _{\theta }(x_{t},t)-\gamma \sigma _{t}\nabla _{x_{t}}\ln p(y|x_{t},t)}

التوجيه بدون استخدام المصنفات (CFG)

إذا لم يكن لدينا مصنفص(y|x){\displaystyle p(y|x)}، لا يزال بإمكاننا استخراج واحد من نموذج الصورة نفسه: [ 28 ]xlnصγ(x|y)=(1-γ)xlnص(x)+γxlnص(x|y){\displaystyle \nabla _{x}\ln p_{\gamma }(x|y)=(1-\gamma )\nabla _{x}\ln p(x)+\gamma \nabla _{x}\ln p(x|y)} يتم تدريب هذا النموذج عادةً من خلال تزويده بكل من(x،y){\displaystyle (x,y)}و(x،شمالoنهـ){\displaystyle (x,{\rm {None}})}مما يسمح له بنمذجة كليهماxlnص(x|y){\displaystyle \nabla _{x}\ln p(x|y)}وxlnص(x){\displaystyle \nabla _{x}\ln p(x)}.

تجدر الإشارة إلى أنه بالنسبة لـ CFG، لا يمكن أن يكون نموذج الانتشار مجرد نموذج توليدي لتوزيع البيانات بأكمله.xlnص(x){\displaystyle \nabla _{x}\ln p(x)}يجب أن يكون نموذجًا توليديًا مشروطًاxlnص(x|y){\displaystyle \nabla _{x}\ln p(x|y)}على سبيل المثال، في الانتشار المستقر، يأخذ هيكل الانتشار كمدخل نموذجًا مشوشًاxت{\displaystyle x_{t}}، وقتت{\displaystyle t}، ومتجه تهيئةy{\displaystyle y}(مثل متجه يشفر مطالبة نصية)، وينتج تنبؤًا بالضوضاءϵθ(xت،y،ت){\displaystyle \epsilon _{\theta }(x_{t},y,t)}.

بالنسبة لنماذج إزالة التشويش، فإن ذلك يتوافق معϵθ(xت،y،ت،γ)=ϵθ(xت،ت)+γ(ϵθ(xت،y،ت)-ϵθ(xت،ت)){\displaystyle \epsilon _{\theta }(x_{t},y,t,\gamma )=\epsilon _{\theta }(x_{t},t)+\gamma (\epsilon _{\theta }(x_{t},y,t)-\epsilon _{\theta }(x_{t},t))}كما تم أخذ عينات منها بواسطة DDIM، يمكن كتابة الخوارزمية على النحو التالي [ 29 ]ϵغير مشروطϵθ(xت،ت)ϵالحالةϵθ(xت،ت،ج)ϵCFGϵغير مشروط+γ(ϵالحالة-ϵغير مشروط)x0(xت-σتϵCFG)/1-σت2xs1-σs2x0+σs2-(σs)2ϵغير مشروط+σsϵ{\displaystyle {\begin{aligned}\epsilon _{\text{uncond}}&\leftarrow \epsilon _{\theta }(x_{t},t)\\\epsilon _{\text{cond}}&\leftarrow \epsilon _{\theta }(x_{t},t,c)\\\epsilon _{\text{CFG}}&\leftarrow \epsilon _{\text{uncond}}+\gamma (\epsilon _{\text{cond}}-\epsilon _{\text{uncond}})\\x_{0}&\leftarrow (x_{t}-\sigma _{t}\epsilon _{\text{CFG}})/{\sqrt {1-\sigma _{t}^{2}}}\\x_{s}&\leftarrow {\sqrt {1-\sigma _{s}^{2}}}x_{0}+{\sqrt {\sigma _{s}^{2}-(\sigma _{s}')^{2}}}\epsilon _{\text{uncond}}+\sigma _{s}'\epsilon \\\end{aligned}}}تُطبَّق تقنية مماثلة على أخذ عينات من نموذج اللغة. كذلك، إذا كان التوليد غير المشروطϵغير مشروطϵθ(xت،ت){\displaystyle \epsilon _{\text{uncond}}\leftarrow \epsilon _{\theta }(x_{t},t)}يتم استبدالها بـϵحالة سلبيةϵθ(xت،ت،ج){\displaystyle \epsilon _{\text{neg cond}}\leftarrow \epsilon _{\theta }(x_{t},t,c')}ثم ينتج عن ذلك تحريض سلبي، مما يدفع الجيل بعيدًا عنج{\displaystyle c'}الشرط. [ 30 ] [ 31 ]

عينات

بالنظر إلى نموذج الانتشار، يمكن اعتباره إما عملية مستمرة، وأخذ عينات منه عن طريق تكامل معادلة تفاضلية عشوائية، أو يمكن اعتباره عملية منفصلة، ​​وأخذ عينات منه عن طريق تكرار الخطوات المنفصلة. اختيار " جدول الضوضاء "βت{\displaystyle \beta _{t}}يمكن أن يؤثر ذلك أيضًا على جودة العينات. جدول الضوضاء هو دالة تُرسل عددًا طبيعيًا إلى مستوى الضوضاء:تβت،ت{1،2،...}،β(0،1){\displaystyle t\mapsto \beta _{t},\quad t\in \{1,2,\dots \},\beta \in (0,1)}غالباً ما يتم تحديد جدول الضوضاء بواسطة خريطةتσت{\displaystyle t\mapsto \sigma _{t}}التعريفان متكافئان، لأنβت=1-1-σت21-σت-12{\displaystyle \beta _{t}=1-{\frac {1-\sigma _{t}^{2}}{1-\sigma _{t-1}^{2}}}}.

من منظور DDPM، يمكن استخدام DDPM نفسه (مع التشويش)، أو DDIM (مع مقدار قابل للتعديل من التشويش). تُسمى الحالة التي يُضاف فيها التشويش أحيانًا بأخذ العينات الأصلية. [ 32 ] يمكن إجراء استيفاء بين وجود التشويش وعدم وجوده. يُشار إلى مقدار التشويش بـη{\displaystyle \eta }"قيمة إيتا" في ورقة DDIM، معη=0{\displaystyle \eta =0}يشير إلى عدم وجود ضوضاء (كما هو الحال في DDIM الحتمي )، وη=1{\displaystyle \eta =1}يشير إلى الضوضاء الكاملة (كما في DDPM).

من منظور المعادلات التفاضلية العشوائية، يمكن استخدام أي من طرق التكامل العددي ، مثل طريقة أويلر-ماروياما ، وطريقة هيون ، وطرق الخطوات المتعددة الخطية ، وما إلى ذلك. وكما هو الحال في الحالة المنفصلة، ​​يمكن إضافة مقدار قابل للتعديل من الضوضاء أثناء التكامل. [ 33 ]

تم إجراء مسح ومقارنة لأدوات أخذ العينات في سياق توليد الصور. [ 34 ]

أمثلة أخرى

تشمل المتغيرات البارزة [ 35 ] نموذج توليد تدفق بواسون، [ 36 ] نموذج الاتساق، [ 37 ] انتشار لانجفين المخمد بشكل حرج، [ 38 ] GenPhys، [ 39 ] الانتشار البارد، [ 40 ] إلخ.

نموذج الانتشار القائم على التدفق

بصورة مجردة، تقوم فكرة نموذج الانتشار على أخذ توزيع احتمالي غير معروف (توزيع الصور ذات المظهر الطبيعي)، ثم تحويله تدريجيًا إلى توزيع احتمالي معروف (التوزيع الغاوسي القياسي)، وذلك من خلال بناء مسار احتمالي متصل تمامًا يربط بينهما. في الواقع، يتم تحديد المسار الاحتمالي ضمنيًا بواسطة دالة التقييم.lnصت{\displaystyle \nabla \ln p_{t}}.

في نماذج الانتشار لإزالة التشويش، تُضيف العملية الأمامية التشويش، بينما تُزيله العملية العكسية. كلتا العمليتين عبارة عن معادلات تفاضلية عشوائية ، إلا أن العملية الأمامية قابلة للتكامل بصيغة مغلقة، لذا يمكن إجراؤها دون تكلفة حسابية. أما العملية العكسية، فهي غير قابلة للتكامل بصيغة مغلقة، لذا يجب تكاملها خطوة بخطوة باستخدام حلول المعادلات التفاضلية العشوائية القياسية، وهو ما قد يكون مكلفًا للغاية. يُعرَّف مسار الاحتمالية في نموذج الانتشار من خلال عملية إيتو ، ويمكن استرجاع العملية الحتمية باستخدام صيغة تدفق المعادلات التفاضلية العادية الاحتمالية. [ 1 ]

في نماذج الانتشار القائمة على التدفق، تمثل العملية الأمامية تدفقًا حتميًا على طول حقل متجهي متغير مع الزمن، بينما تمثل العملية العكسية أيضًا تدفقًا حتميًا على طول الحقل المتجهي نفسه، ولكن في الاتجاه المعاكس. كلا العمليتين هما حلول لمعادلات تفاضلية عادية . إذا كان الحقل المتجهي منتظمًا، فستكون المعادلة التفاضلية العادية منتظمة أيضًا.

بافتراض وجود توزيعينπ0{\displaystyle \pi _{0}}وπ1{\displaystyle \pi _{1}}النموذج القائم على التدفق هو حقل سرعة يعتمد على الزمنvت(x){\displaystyle v_{t}(x)}في[0،1]×Rد{\displaystyle [0,1]\times \mathbb {R} ^{d}}بحيث إذا بدأنا بأخذ عينة من نقطةxπ0{\displaystyle x\sim \pi _{0}}ودعها تتحرك وفقًا لحقل السرعة: ددتϕت(x)=vت(ϕت(x))ت[0،1]،ابتداءً من ϕ0(x)=x{\displaystyle {\frac {d}{dt}}\phi _{t}(x)=v_{t}(\phi _{t}(x))\quad t\in [0,1],\quad {\text{starting from }}\phi _{0}(x)=x} نصل في النهاية إلى نقطةx1π1{\displaystyle x_{1}\sim \pi _{1}}الحلϕت{\displaystyle \phi _{t}}تحدد المعادلة التفاضلية العادية المذكورة أعلاه مسارًا احتماليًاصت=[ϕت]8π0{\displaystyle p_{t}=[\phi _{t}]_{\#}\pi _{0}}بواسطة عامل قياس الدفع الأمامي . على وجه الخصوص،[ϕ1]8π0=π1{\displaystyle [\phi _{1}]_{\#}\pi _{0}=\pi _{1}}.

كما أن مسار الاحتمالية وحقل السرعة يحققان معادلة الاستمرارية ، بمعنى توزيع الاحتمالية: تصت+(vتصت)=0{\displaystyle \partial _{t}p_{t}+\nabla \cdot (v_{t}p_{t})=0} لإنشاء مسار احتمالي، نبدأ بإنشاء مسار احتمالي شرطيصت(x|z){\displaystyle p_{t}(x\vert z)}وحقل السرعة الشرطي المقابلvت(x|z){\displaystyle v_{t}(x\vert z)}في بعض التوزيعات الشرطيةq(z){\displaystyle q(z)}يُعد مسار الاحتمال الشرطي الغاوسي خيارًا طبيعيًا: صت(x|z)=شمال(مت(z)،ζت2أنا){\displaystyle p_{t}(x\vert z)={\mathcal {N}}\left(m_{t}(z),\zeta _{t}^{2}I\right)} حقل السرعة الشرطي الذي يتوافق مع المسار الجيوديسي بين المسار الغاوسي الشرطي هو vت(x|z)=ζتζت(x-مت(z))+مت(z){\displaystyle v_{t}(x\vert z)={\frac {\zeta _{t}'}{\zeta _{t}}}(x-m_{t}(z))+m_{t}'(z)} ثم يتم حساب مسار الاحتمالية وحقل السرعة عن طريق التهميش

صت(x)=صت(x|z)q(z)دz و vت(x)=هـq(z)[vت(x|z)صت(x|z)صت(x)]{\displaystyle p_{t}(x)=\int p_{t}(x\vert z)q(z)dz\qquad {\text{ and }}\qquad v_{t}(x)=\mathbb {E} _{q(z)}\left[{\frac {v_{t}(x\vert z)p_{t}(x\vert z)}{p_{t}(x)}}\right]}

التدفق الأمثل للنقل

تتمثل فكرة تدفق النقل الأمثل [ 41 ] في إنشاء مسار احتمالي يقلل من مقياس واسرشتين . التوزيع الذي نعتمد عليه هو تقريب لخطة النقل الأمثل بينπ0{\displaystyle \pi _{0}}وπ1{\displaystyle \pi _{1}}:z=(x0،x1){\displaystyle z=(x_{0},x_{1})}وq(z)=Γ(π0،π1){\displaystyle q(z)=\Gamma (\pi _{0},\pi _{1})}، أينΓ{\displaystyle \Gamma }تُعدّ خطة النقل المثلى هي الخطة التي يمكن تقريبها باستخدام النقل الأمثل للدفعات الصغيرة. إذا لم يكن حجم الدفعة كبيرًا، فقد يكون النقل الذي تحسبه بعيدًا جدًا عن النقل الأمثل الحقيقي.

التدفق المُقوَّم

تتمثل فكرة التدفق المُقوَّم [ 42 ] [ 43 ] في تعلم نموذج تدفق بحيث تكون السرعة ثابتة تقريبًا على طول كل مسار تدفق. وهذا مفيد، لأنه يمكننا إجراء التكامل على طول حقل متجه كهذا بخطوات قليلة جدًا. على سبيل المثال، إذا كانت معادلة تفاضلية عاديةϕت˙(x)=vت(ϕت(x)){\displaystyle {\dot {\phi _{t}}}(x)=v_{t}(\phi _{t}(x))}باتباع مسارات مستقيمة تمامًا، يصبح الأمر أبسط إلىϕت(x)=x0+تv0(x0){\displaystyle \phi _{t}(x)=x_{0}+t\cdot v_{0}(x_{0})}مما يسمح بإيجاد حلول دقيقة في خطوة واحدة. عمليًا، لا يمكننا الوصول إلى هذه الدرجة من الكمال، ولكن عندما يكون مجال التدفق قريبًا من ذلك، يمكننا اتخاذ خطوات كبيرة قليلة بدلًا من خطوات صغيرة كثيرة.

الاستيفاء الخطيالتدفق المعدلالتدفق المستقيم والمقوم

الفكرة العامة هي البدء بتوزيعينπ0{\displaystyle \pi _{0}}وπ1{\displaystyle \pi _{1}}ثم قم بإنشاء مجال التدفقϕ0={ϕت:ت[0،1]}{\displaystyle \phi ^{0}=\{\phi _{t}:t\in [0,1]\}}ثم قم بتطبيق عملية "إعادة التدفق" بشكل متكرر للحصول على حقول تدفق متتالية.ϕ1،ϕ2،...{\displaystyle \phi ^{1},\phi ^{2},\dots }كل مسار أكثر استقامة من سابقه. وعندما يصبح مجال التدفق مستقيماً بما يكفي للتطبيق، نتوقف.

بشكل عام، بالنسبة لأي عملية قابلة للتفاضل الزمنيϕت{\displaystyle \phi _{t}}،vت{\displaystyle v_{t}}يمكن تقدير ذلك عن طريق حل ما يلي: مينθ01هـxصت[vت(x،θ)-vت(x)2]دت.{\displaystyle \min _{\theta }\int _{0}^{1}\mathbb {E} _{x\sim p_{t}}\left[\lVert {v_{t}(x,\theta )-v_{t}(x)}\rVert ^{2}\right]\,\mathrm {d} t.}

في التدفق المعدل، من خلال حقن معلومات مسبقة قوية مفادها أن المسارات الوسيطة مستقيمة، يمكن تحقيق كل من الأهمية النظرية للنقل الأمثل والكفاءة الحسابية، حيث يمكن محاكاة المعادلات التفاضلية العادية ذات المسارات المستقيمة بدقة دون تجزئة زمنية.

النقل عن طريق التدفق المعدل [ 42 ]

وبشكلٍ أدق، يسعى التدفق المصحح إلى مطابقة معادلة تفاضلية عادية مع التوزيعات الهامشية للاستيفاء الخطي بين النقاط من التوزيعات.π0{\displaystyle \pi _{0}}وπ1{\displaystyle \pi _{1}}بالنظر إلى الملاحظاتx0π0{\displaystyle x_{0}\sim \pi _{0}}وx1π1{\displaystyle x_{1}\sim \pi _{1}}الاستيفاء الخطي المتعارف عليهxت=تx1+(1-ت)x0،ت[0،1]{\displaystyle x_{t}=tx_{1}+(1-t)x_{0},t\in [0,1]}ينتج عنه حالة تافهةx˙ت=x1-x0{\displaystyle {\dot {x}}_{t}=x_{1}-x_{0}}والتي لا يمكن محاكاتها سببيًا بدونx1{\displaystyle x_{1}}ولمعالجة هذا الأمر،xت{\displaystyle x_{t}}يتم "إسقاطها" في فضاء من المعادلات التفاضلية العادية القابلة للمحاكاة السببية، عن طريق تقليل خسارة المربعات الصغرى بالنسبة للاتجاهx1-x0{\displaystyle x_{1}-x_{0}}: مينθ01هـπ0،π1،صت[(x1-x0)-vت(xت)2]دت.{\displaystyle \min _{\theta }\int _{0}^{1}\mathbb {E} _{\pi _{0},\pi _{1},p_{t}}\left[\lVert {(x_{1}-x_{0})-v_{t}(x_{t})}\rVert ^{2}\right]\,\mathrm {d} t.}

زوج البيانات(x0،x1){\displaystyle (x_{0},x_{1})}يمكن أن يكون أي اقتران منπ0{\displaystyle \pi _{0}}وπ1{\displaystyle \pi _{1}}، عادةً ما تكون مستقلة (أي(x0،x1)π0×π1{\displaystyle (x_{0},x_{1})\sim \pi _{0}\times \pi _{1}}) تم الحصول عليها من خلال الجمع العشوائي للملاحظات منπ0{\displaystyle \pi _{0}}وπ1{\displaystyle \pi _{1}}تضمن هذه العملية أن تعكس المسارات بدقة خريطة الكثافة لـxت{\displaystyle x_{t}}المسارات ولكن إعادة التوجيه عند التقاطعات لضمان السببية.

عملية إعادة التدفق [ 42 ]

من السمات المميزة للتدفق المُقوَّم قدرته على " إعادة التدفق "، مما يُقوِّم مسار المعادلات التفاضلية العادية. لنرمز إلى التدفق المُقوَّم بـϕ0={ϕت:ت[0،1]}{\displaystyle \phi ^{0}=\{\phi _{t}:t\in [0,1]\}}ناتج عن(x0،x1){\displaystyle (x_{0},x_{1})}مثلϕ0=Rهـجتولow((x0،x1)){\displaystyle \phi ^{0}={\mathsf {Rectflow}}((x_{0},x_{1}))}تطبيق هذا بشكل متكررRهـجتولow(){\displaystyle {\mathsf {Rectflow}}(\cdot )}يقوم المشغل بإنشاء سلسلة من التدفقات المصححةϕك+1=Rهـجتولow((ϕ0ك(x0)،ϕ1ك(x1))){\displaystyle \phi ^{k+1}={\mathsf {Rectflow}}((\phi _{0}^{k}(x_{0}),\phi _{1}^{k}(x_{1})))}لا تقتصر عملية "إعادة التدفق" هذه على تقليل تكاليف النقل فحسب، بل تعمل أيضًا على تقويم مسارات التدفقات المُصححة، مما يجعلϕك{\displaystyle \phi ^{k}}تصبح المسارات أكثر استقامة مع زيادةك{\displaystyle k}.

يتضمن التدفق المُقوَّم امتدادًا غير خطي حيث يكون الاستيفاء الخطيxت{\displaystyle x_{t}}يتم استبدالها بأي منحنى قابل للتفاضل زمنيًا يربطx0{\displaystyle x_{0}}وx1{\displaystyle x_{1}}، مقدمة منxت=αتx1+βتx0{\displaystyle x_{t}=\alpha _{t}x_{1}+\beta _{t}x_{0}}يشمل هذا الإطار المعادلات التفاضلية العادية ذات التدفق الاحتمالي ونماذج DDIM كحالات خاصة، مع خيارات محددة لـαت{\displaystyle \alpha _{t}}وβت{\displaystyle \beta _{t}}ومع ذلك، في حالة مسارxت{\displaystyle x_{t}}إذا لم يكن مستقيماً، فإن عملية إعادة التدفق لم تعد تضمن تقليل تكاليف النقل المحدبة، كما أنها لم تعد تعمل على تقويم مساراتϕت{\displaystyle \phi _{t}}[ 42 ]

تم اكتشاف هذه الصيغ الخطية للتدفق بشكل مستقل وتكييفها من منظور مختلف لمسائل المعالجة العكسية الخاضعة للإشراف. على سبيل المثال، تقوم طريقة الانعكاس بالتكرار المباشر (InDI) بصياغة استعادة الصور من خلال تعلم معادلة تفاضلية عادية للتدفق المتبقي، والتي تعكس بشكل تكراري عملية الاستيفاء الخطي بين مدخلات متدهورة وهدف عالي الجودة لتجنب الانحدار نحو المتوسط. تُعد InDI فعالة لمجموعة متنوعة من مهام استعادة الصور. [ 44 ]

اختيار الهندسة المعمارية

هندسة الانتشار المستقر
عملية إزالة الضوضاء المستخدمة بواسطة الانتشار المستقر

نموذج الانتشار

لإنشاء الصور باستخدام DDPM، نحتاج إلى شبكة عصبية تستغرق وقتًات{\displaystyle t}وصورة مشوشةxت{\displaystyle x_{t}}ويتوقع حدوث ضوضاءϵθ(xت،ت){\displaystyle \epsilon _{\theta }(x_{t},t)}منه. بما أن التنبؤ بالضوضاء هو نفسه التنبؤ بالصورة بعد إزالة الضوضاء، فإن طرحها منxت{\displaystyle x_{t}}تميل بنى إزالة التشويش إلى العمل بشكل جيد. على سبيل المثال، تُستخدم شبكة U-Net ، التي وُجد أنها جيدة لإزالة التشويش من الصور، غالبًا لإزالة التشويش من نماذج الانتشار التي تولد الصور. [ 45 ]

في نموذج DDPM، لا يشترط أن تكون البنية الأساسية (العمود الفقري) شبكة U-Net، بل يكفي أن تتنبأ بالضوضاء بطريقة ما. على سبيل المثال، يستخدم مُحوِّل الانتشار (DiT) مُحوِّلًا للتنبؤ بالمتوسط ​​والتباين القطري للضوضاء، مع الأخذ في الاعتبار التكييف النصي والصورة المُزالة الضوضاء جزئيًا. وهو يُشابه نموذج الانتشار القياسي لإزالة الضوضاء القائم على شبكة U-Net، مع استبدال شبكة U-Net بمُحوِّل. [ 46 ] كما يُمكن تطبيق نموذج مُحوِّل مزيج الخبراء . [ 47 ]

يمكن استخدام نموذج DDPM لنمذجة توزيعات البيانات العامة، وليس فقط الصور ذات المظهر الطبيعي. على سبيل المثال، يقوم نموذج Human Motion Diffusion [ 48 ] بنمذجة مسار حركة الإنسان باستخدام DDPM. كل مسار حركة بشرية هو عبارة عن سلسلة من الوضعيات، ممثلة إما بدوران المفاصل أو بمواقعها. ويستخدم هذا النموذج شبكة Transformer لتوليد مسار أقل تشويشًا من مسار مشوش.

تكييف

لا يستطيع نموذج الانتشار الأساسي توليد الصور إلا بشكل غير مشروط من التوزيع الكامل. على سبيل المثال، نموذج انتشار مُدرَّب على ImageNet سيُنتج صورًا تُشبه صورة عشوائية من ImageNet. لتوليد صور من فئة واحدة فقط، يجب فرض شرط، ثم أخذ عينة من التوزيع الشرطي. أيًا كان الشرط المطلوب فرضه، يجب أولًا تحويل الشرط إلى متجه من الأعداد العشرية، ثم إدخاله إلى الشبكة العصبية لنموذج الانتشار الأساسي. مع ذلك، يُمكن اختيار طريقة تحويل الشرط إلى متجه.

على سبيل المثال، يفرض الانتشار المستقر شرطًا في شكل آلية انتباه متبادل ، حيث يمثل الاستعلام تمثيلًا وسيطًا للصورة في شبكة U-Net، ويمثل كل من المفتاح والقيمة متجهات الشرط. يمكن تطبيق الشرط بشكل انتقائي على أجزاء محددة من الصورة، ويمكن ضبط أنواع جديدة من الشروط بدقة على النموذج الأساسي، كما هو مستخدم في ControlNet. [ 49 ]

كمثال بسيط بشكل خاص، لنأخذ عملية ترميم الصور . الشروط هيx~{\displaystyle {\tilde {x}}}، الصورة المرجعية، وم{\displaystyle m}، قناع التعبئة . يتم فرض التكييف في كل خطوة من خطوات عملية الانتشار العكسي، عن طريق أخذ العينات أولاًx~تشمال(α¯تx~،σت2أنا){\displaystyle {\tilde {x}}_{t}\sim N\left({\sqrt {{\bar {\alpha }}_{t}}}{\tilde {x}},\sigma _{t}^{2}I\right)}، نسخة صاخبة منx~{\displaystyle {\tilde {x}}}ثم استبدالهاxت{\displaystyle x_{t}}مع(1-م)xت+مx~ت{\displaystyle (1-m)\odot x_{t}+m\odot {\tilde {x}}_{t}}، أين{\displaystyle \odot }يعني الضرب العنصري . [ 50 ] ومن التطبيقات الأخرى لآلية الانتباه المتبادل تحرير الصور من لحظة إلى أخرى. [ 51 ]

لا يقتصر التكييف على توليد صور من فئة محددة، أو وفقًا لتعليق معين (كما في تحويل النص إلى صورة). على سبيل المثال، أوضح [ 48 ] كيفية توليد حركة بشرية، مشروطة بمقطع صوتي لمشي بشري (مما يسمح بمزامنة الحركة مع الصوت)، أو فيديو لجري بشري، أو وصف نصي لحركة بشرية، وما إلى ذلك. للاطلاع على كيفية صياغة نماذج الانتشار المشروط رياضيًا، انظر ملخصًا منهجيًا في [ 52 ] .

تحسين الدقة

بما أن توليد الصورة يستغرق وقتًا طويلاً، يمكن محاولة توليد صورة صغيرة باستخدام نموذج انتشار أساسي، ثم تكبيرها باستخدام نماذج أخرى. يمكن إجراء التكبير باستخدام الشبكات التوليدية التنافسية (GAN ) [ 53 ] ، أو نماذج المحولات [ 54 ] ، أو طرق معالجة الإشارات مثل إعادة التشكيل لانكزوس .

يمكن استخدام نماذج الانتشار نفسها لإجراء عملية تكبير الصورة. يقوم نموذج الانتشار المتتالي بتجميع نماذج انتشار متعددة واحدة تلو الأخرى، على غرار نموذج GAN التدريجي . المستوى الأدنى هو نموذج انتشار قياسي يُنتج صورة بحجم 32×32 بكسل، ثم يتم تكبير الصورة بواسطة نموذج انتشار مُدرَّب خصيصًا لتكبير الصورة، وتتكرر العملية. [ 45 ]

بمزيد من التفصيل، يتم تدريب مُحسِّن الانتشار على النحو التالي: [ 45 ]

  • عينة(x0،z0،ج){\displaystyle (x_{0},z_{0},c)}، أينx0{\displaystyle x_{0}}هي الصورة عالية الدقة،z0{\displaystyle z_{0}}هي نفس الصورة ولكن بحجم مصغر وبدقة منخفضة، وج{\displaystyle c}هو الشرط، والذي يمكن أن يكون عنوان الصورة، أو فئة الصورة، وما إلى ذلك.
  • عينة من الضوضاء البيضاءϵx،ϵz{\displaystyle \epsilon _{x},\epsilon _{z}}خطوتين زمنيتينتx،تz{\displaystyle t_{x},t_{z}}. احسب النسخ المشوشة من الصور عالية الدقة ومنخفضة الدقة:{xتx=α¯تxx0+σتxϵxzتz=α¯تzz0+σتzϵz{\displaystyle {\begin{cases}x_{t_{x}}&={\sqrt {{\bar {\alpha }}_{t_{x}}}}x_{0}+\sigma _{t_{x}}\epsilon _{x}\\z_{t_{z}}&={\sqrt {{\bar {\alpha }}_{t_{z}}}}z_{0}+\sigma _{t_{z}}\epsilon _{z}\end{cases}}}.
  • درب شبكة إزالة التشويش للتنبؤϵx{\displaystyle \epsilon _{x}}منحxتx،zتz،تx،تz،ج{\displaystyle x_{t_{x}},z_{t_{z}},t_{x},t_{z},c}أي تطبيق خوارزمية التدرج الهبوطي علىθ{\displaystyle \theta }حول خسارة L2ϵθ(xتx،zتz،تx،تz،ج)-ϵx22{\displaystyle \|\epsilon _{\theta }(x_{t_{x}},z_{t_{z}},t_{x},t_{z},c)-\epsilon _{x}\|_{2}^{2}}.

أمثلة

يجمع هذا القسم بعض نماذج الانتشار البارزة، ويصف بإيجاز بنيتها.

أوبن إيه آي

تُعد سلسلة DALL-E من OpenAI نماذج انتشار للصور تعتمد على النص.

لا يُعد الإصدار الأول من DALL-E (2021) نموذج انتشار بالمعنى الحرفي، بل يستخدم بنية Transformer التي تُولّد سلسلة من الرموز تلقائيًا، ثم تُحوّل هذه السلسلة إلى صورة بواسطة مُفكِّك VAE منفصل. وقد أُصدر مع DALL-E مُصنِّف CLIP، الذي استخدمه DALL-E لترتيب الصور المُولَّدة وفقًا لمدى تطابقها مع النص.

يُعدّ GLIDE (مارس 2022) [ 55 ] نموذج انتشار يبلغ حجمه 3.5 مليار بكسل، وقد تم إصدار نسخة مصغّرة منه للعموم. [ 5 ] بعد ذلك بوقت قصير، تم إصدار DALL-E 2 (أبريل 2022). [ 56 ] يُعدّ DALL-E 2 نموذج انتشار متتالي يبلغ حجمه 3.5 مليار بكسل، ويقوم بتوليد الصور من النصوص عن طريق "عكس مُشفّر صور CLIP"، وهي التقنية التي أطلقوا عليها اسم "unCLIP".

تتضمن طريقة unCLIP أربعة نماذج: مُشفِّر صور CLIP، ومُشفِّر نصوص CLIP، ومُفكِّك صور، ونموذج "مُسبق" (قد يكون نموذج انتشار أو نموذج انحدار ذاتي). أثناء التدريب، يُدرَّب النموذج المُسبق على تحويل ترميزات صور CLIP إلى ترميزات نصوص CLIP. ويُدرَّب مُفكِّك الصور على تحويل ترميزات صور CLIP مرة أخرى إلى صور. أثناء الاستدلال، يُحوِّل مُشفِّر نصوص CLIP النص إلى متجه، ثم يُحوِّله النموذج المُسبق إلى ترميز صورة، ثم يُحوِّله مُفكِّك الصور إلى صورة.

Sora (2024–02) هو نموذج محول الانتشار (DiT).

لايتريكس

LTX هي عائلة من نماذج الذكاء الاصطناعي مفتوحة المصدر لإنشاء مقاطع الفيديو ، طورتها شركة Lightricks ، وأُطلقت لأول مرة في نوفمبر 2024. [ 57 ] تُنشئ أحدث نماذجها، LTX-2، مقاطع فيديو بناءً على طلبات المستخدم ، المشروطة بنصوص أو صور أو مقاطع فيديو أو ملفات صوتية، وهي قادرة على توليد الصوت والصورة بطريقة موحدة. [ 58 ] [ 59 ] وقد سبقتها LTX Video، التي أُطلقت في عام 2024 كأول نموذج للشركة لتحويل النصوص إلى فيديو.

استقرار الذكاء الاصطناعي

يتألف برنامج Stable Diffusion (2022–08)، الذي أصدرته شركة Stability AI، من نموذج انتشار كامن لإزالة التشويش (860 مليون مُعامل)، وشبكة VAE، ومُشفِّر نصي. تعتمد شبكة إزالة التشويش على بنية U-Net، مع وحدات انتباه متقاطع تسمح بتوليد الصور المشروط. [ 60 ] [ 23 ]

لقد غيّر نموذج الانتشار المستقر 3 (2024-03) [ 61 ] نموذج الانتشار الكامن من UNet إلى نموذج Transformer، وبالتالي فهو DiT. وهو يستخدم التدفق المصحح.

Stable Video 4D (2024–07) [ 62 ] هو نموذج انتشار كامن لمقاطع الفيديو للأجسام ثلاثية الأبعاد.

جوجل

يستخدم برنامج Imagen (2022) [ 63 ] [ 64 ] نموذج لغة T5-XXL لترميز النص المُدخل إلى متجه تضمين. وهو نموذج انتشار متتالي يتكون من ثلاثة نماذج فرعية. في الخطوة الأولى، يُزيل التشويش من الضوضاء البيضاء إلى صورة بحجم 64×64، وذلك بناءً على متجه تضمين النص. يحتوي هذا النموذج على 2 مليار مُعامل. في الخطوة الثانية، يُكبّر حجم الصورة من 64×64 إلى 256×256، وذلك بناءً على متجه التضمين. يحتوي هذا النموذج على 650 مليون مُعامل. أما الخطوة الثالثة فهي مماثلة، حيث يُكبّر حجم الصورة من 256×256 إلى 1024×1024. يحتوي هذا النموذج على 400 مليون مُعامل. جميع شبكات إزالة التشويش الثلاث هي شبكات U-Net.

إن Muse (2023–01) [ 65 ] ليس نموذج انتشار، ولكنه عبارة عن مشفر فقط Transformer يتم تدريبه على التنبؤ برموز الصور المقنعة من رموز الصور غير المقنعة.

يعتمد برنامج Imagen 2 (2023–12) أيضًا على تقنية الانتشار. ويمكنه توليد صور بناءً على مُدخل يمزج بين الصور والنصوص. لا تتوفر معلومات إضافية. [ 66 ] وينطبق الأمر نفسه على برنامج Imagen 3 (2024–05). لا تتوفر معلومات إضافية. [ 67 ]

يقوم برنامج Veo (2024) بإنشاء مقاطع فيديو عن طريق الانتشار الكامن. ويعتمد هذا الانتشار على متجه يقوم بتشفير كل من موجه نصي وموجه صورة. [ 68 ]

ميتا

يُعدّ برنامج Make-A-Video (2022) نموذجًا لنشر النصوص وتحويلها إلى فيديوهات. [ 69 ] [ 70 ]

إن CM3leon (2023) ليس نموذج انتشار، بل هو نموذج Transformer مقنّع سببيًا ذاتيًا، وله نفس بنية LLaMa -2 تقريبًا. [ 71 ] [ 72 ]

مخطط معماري لنقل الدم

يُعدّ برنامج Transfusion (2024) نموذجًا من نماذج Transformer يجمع بين توليد النصوص بالتراجع الذاتي ونشر إزالة التشويش. فعلى وجه التحديد، يقوم البرنامج بتوليد النصوص بالتراجع الذاتي (مع إخفاء السببية)، وتوليد الصور عن طريق إزالة التشويش عدة مرات على رموز الصورة (مع آلية الانتباه الشامل). [ 73 ]

فيلم Gen (2024) عبارة عن سلسلة من محولات الانتشار التي تعمل على الفضاء الكامن وعن طريق مطابقة التدفق. [ 74 ]

انظر أيضاً

للمزيد من القراءة

  • أوراق بحثية
  • تم حذف التفاصيل الرياضية من المقال.
  • دروس تعليمية
    • نكيران، بريتوم؛ برادلي، أروين. تشو، هاتي؛ أدفاني، مادو (2024). “الانتشار خطوة بخطوة: برنامج تعليمي ابتدائي”. أرخايف : 2406.08929 [ cs.LG ].
    • "إرشادات: دليل مختصر لنماذج الانتشار" . 26 مايو 2022.نظرة عامة على التوجيه باستخدام المصنفات والتوجيه بدون مصنفات، مع التركيز على التفاصيل الرياضية.
    • كاثرين هيغام، ديزموند جيه هيغام، وبيتر غريندرود: "نماذج الانتشار للذكاء الاصطناعي التوليدي: مقدمة للرياضيين التطبيقيين"، مجلة SIAM، المجلد 67، العدد 3 (2025).

مراجع

  1. 1 2 3 4 سونغ، يانغ؛ سوهل ديكستين، جاشا؛ كينغما، ديدريك ب. كومار، ابهيشيك. إرمون، ستيفانو؛ بول ، بن (2021/02/10). “النمذجة التوليدية القائمة على النتائج من خلال المعادلات التفاضلية العشوائية”. أرخايف : 2011.13456 [ cs.LG ].
  2. ^ كرويتورو، فلورينل ألين؛ هوندرو، فلاد. إيونيسكو، رادو تيودور؛ شاه، مبارك (2023). “نماذج الانتشار في الرؤية: مسح”. معاملات IEEE بشأن تحليل الأنماط والذكاء الآلي . 45 (9): 10850–10869 . أرخايف : 2209.04747 . بيب كود : 2023ITPAM..4510850C . دوى : 10.1109/TPAMI.2023.3261988 . بميد 37030794 . S2CID 252199918 .  
  3. 1 2 هو، جوناثان؛ جاين، أجاي؛ أبيل، بيتر (2020). "إزالة التشويش من نماذج الانتشار الاحتمالية" . التطورات في أنظمة معالجة المعلومات العصبية . 33. كوران أسوشيتس، إنك: 6840-6851 .
  4. ^ قو، شويانغ؛ تشن دونغ. باو، جيانمين؛ ون، فانغ؛ تشانغ، بو؛ تشن، دونغدونغ. يوان، لو؛ قوه ، باينينغ (2021). “نموذج الانتشار الكمي المتجه لتوليف النص إلى الصورة”. أرخايف : 2111.14822 [ cs.CV ].
  5. 1 2 GLIDE ، OpenAI، 22-09-2023 ، تم الاطلاع عليه بتاريخ 24-09-2023
  6. لي، ييفان؛ تشو، كون؛ تشاو، واين شين؛ وين، جي رونغ (أغسطس 2023). "نماذج الانتشار لتوليد النصوص غير التراجعية: دراسة استقصائية" . وقائع المؤتمر الدولي المشترك الثاني والثلاثين حول الذكاء الاصطناعي . كاليفورنيا: منظمة المؤتمرات الدولية المشتركة حول الذكاء الاصطناعي. الصفحات 6692-6701 . arXiv : 2303.06574 . doi : 10.24963/ijcai.2023/750 . ISBN  978-1-956792-03-4.
  7. شو، ويجي؛ هو، وينشيانغ؛ وو، فانيو؛ سينغاميدو، سرينيفاسان (2023). "DeTiME: نمذجة المواضيع المحسّنة بالانتشار باستخدام نموذج لغة-لغة قائم على المُشفّر-المُفكّك" . نتائج مؤتمر رابطة اللغويات الحاسوبية: EMNLP 2023. سترودسبيرغ، بنسلفانيا، الولايات المتحدة الأمريكية: رابطة اللغويات الحاسوبية: 9040-9057 . arXiv : 2310.15296 . doi : 10.18653/v1/2023.findings-emnlp.606 .
  8. تشانغ، هاوبنغ؛ ليو، شياو؛ تشانغ، جياوي (2023). "DiffuSum: التلخيص الاستخلاصي المُحسَّن بالتوليد باستخدام الانتشار" . نتائج مؤتمر رابطة اللغويات الحاسوبية: ACL 2023. سترودسبيرغ، بنسلفانيا، الولايات المتحدة الأمريكية: رابطة اللغويات الحاسوبية: 13089-13100 . arXiv : 2305.01735 . doi : 10.18653/v1/2023.findings-acl.828 .
  9. يانغ، دونغتشاو؛ يو، جيانوي؛ وانغ، هيلين؛ وانغ، وين؛ وينغ، تشاو؛ زو، يويشيان؛ يو، دونغ (2023). "Diffsound: نموذج الانتشار المنفصل لتوليد الصوت من النص" . معاملات IEEE/ACM في معالجة الصوت والكلام واللغة . 31 : 1720-1733 . arXiv : 2207.09983 . Bibcode : 2023ITASL..31.1720Y . doi : 10.1109/taslp.2023.3268730 . ISSN 2329-9290 . 
  10. جانر، مايكل؛ دو، ييلون؛ تيننباوم، جوشوا ب.؛ ليفين، سيرجي (2022-12-20). "التخطيط باستخدام الانتشار لتوليف السلوك المرن". arXiv : 2205.09991 [ cs.LG ].
  11. ^ تشي تشنغ. شو، زينجيا؛ فنغ، سيوان. كوزينو، إريك؛ دو، ييلون؛ بورتشفيل، بنيامين؛ تيدريك، روس؛ سونغ شوران (2024/03/14). “سياسة الانتشار: تعلم السياسة الحركية عبر نشر العمل”. أرخايف : 2303.04137 [ cs.RO ].
  12. سول-ديكستين، ياشا؛ فايس، إريك؛ ماهيسواراناثان، نيرو؛ جانجولي، سوريا (2015-06-01). "التعلم العميق غير الخاضع للإشراف باستخدام الديناميكا الحرارية غير المتوازنة" (ملف PDF) . وقائع المؤتمر الدولي الثاني والثلاثين للتعلم الآلي . 37. PMLR: 2256–2265 . arXiv : 1503.03585 .
  13. ^ هو ، جوناثان (20 يونيو 2020)، هوجوناثانهو / نشر ، استرجاعها 2024/09/07
  14. 1 2 وينغ، ليليان (2021-07-11). "ما هي نماذج الانتشار؟" . lilianweng.github.io . تم ​​الاطلاع عليه بتاريخ 2023-09-24 .
  15. "النمذجة التوليدية من خلال تقدير تدرجات توزيع البيانات | يانغ سونغ" . yang-song.net . تم الاطلاع عليه بتاريخ 24-09-2023 .
  16. 1 2 سونغ، يانغ؛ إرمون، ستيفانو (2019). "النمذجة التوليدية من خلال تقدير تدرجات توزيع البيانات" . التطورات في أنظمة معالجة المعلومات العصبية . 32. كوران أسوشيتس، إنك. arXiv : 1907.05600 .
  17. ^ سونغ يانغ. سوهل ديكستين، جاشا؛ كينغما، ديدريك ب. كومار، ابهيشيك. إرمون، ستيفانو؛ بول ، بن (2021/02/10). “النمذجة التوليدية القائمة على النتائج من خلال المعادلات التفاضلية العشوائية”. أرخايف : 2011.13456 [ cs.LG ].
  18. ermongroup/ncsn ، ermongroup، 2019 ، تم الاطلاع عليه بتاريخ 2024-09-07
  19. "مطابقة الدرجات المقطعية: منهج قابل للتطوير لتقدير الكثافة والدرجات | يانغ سونغ" . yang-song.net . تم الاطلاع عليه بتاريخ 24-09-2023 .
  20. أندرسون، برايان دي أو (مايو 1982). "نماذج معادلة الانتشار العكسي للزمن" . العمليات العشوائية وتطبيقاتها . 12 (3): 313-326 . doi : 10.1016/0304-4149(82)90051-5 . ISSN 0304-4149 . 
  21. لو، كالفن (2022). "فهم نماذج الانتشار: منظور موحد". arXiv : 2208.11970v1 [ cs.LG ].
  22. سونغ، جيامينغ؛ مينغ، تشينلين؛ إرمون، ستيفانو (3 أكتوبر 2023). "إزالة التشويش من نماذج الانتشار الضمنية". arXiv : 2010.02502 [ cs.LG ].
  23. 1 2 رومباخ، روبن؛ بلاتمان، أندرياس. لورينز، دومينيك؛ إيسر، باتريك؛ عمر ، بيورن (13 أبريل 2022). “توليف الصور عالية الدقة مع نماذج الانتشار الكامنة”. أرخايف : 2112.10752 [ cs.CV ].
  24. نيكول، ألكسندر كوين؛ داريوال، برافولا (2021-07-01). "نماذج احتمالية محسّنة لإزالة التشويش من الانتشار" . وقائع المؤتمر الدولي الثامن والثلاثين للتعلم الآلي . PMLR: 8162–8171 .
  25. ساليمانس، تيم؛ هو، جوناثان (2021-10-06). التقطير التدريجي لأخذ عينات سريعة من نماذج الانتشار . المؤتمر الدولي العاشر حول تمثيلات التعلم (ICLR 2022).
  26. لين، شانشوان؛ ليو، بينغتشن؛ لي، جياشي؛ يانغ، شياو (2024). جداول ضوضاء الانتشار الشائعة وخطوات أخذ العينات معيبة . المؤتمر الشتوي لتطبيقات رؤية الحاسوب (WACV) التابع لمعهد مهندسي الكهرباء والإلكترونيات/مؤسسة رؤية الحاسوب. الصفحات 5404-5411 . 
  27. 1 2 3 داريوال، برافولا؛ نيكول ، أليكس (2021-06-01). “نماذج الانتشار تتغلب على شبكات GAN في تركيب الصور”. أرخايف : 2105.05233 [ cs.LG ].
  28. 1 2 هو، جوناثان؛ ساليمانس، تيم (2022-07-25). "التوجيه الانتشار بدون مصنف". arXiv : 2207.12598 [ cs.LG ].
  29. تشونغ، هيونغجين؛ كيم، جيونغسول؛ بارك، جيون يونغ؛ نام، هييلين؛ يي، جونغ تشول (2024-06-12). "CFG++: توجيه بدون مصنف مقيد بالتعددية لنماذج الانتشار". arXiv : 2406.08070 [ cs.CV ].
  30. سانشيز، غيوم؛ فان، هونغلو؛ سبانغر، ألكسندر؛ ليفي، إيلاد؛ أمانامانتشي، باوان ساسانكا؛ بيدرمان، ستيلا (30-06-2023). "البقاء على الموضوع مع التوجيه الخالي من المصنفات". arXiv : 2306.17806 [ cs.CL ].
  31. أرماندبور، محمد رضا؛ صادقيان، علي؛ تشنغ، هوانغجي؛ صادقيان، أمير؛ تشو، مينغ يوان (2023-04-26). "إعادة تصور خوارزمية التوجيه السلبي: تحويل الانتشار ثنائي الأبعاد إلى ثلاثي الأبعاد، وتخفيف مشكلة يانوس وما بعدها". arXiv : 2304.04968 [ cs.CV ].
  32. ^ يانغ ، لينغ. تشانغ، شيلونج؛ سونغ يانغ. هونغ، شندا؛ شو، رونشنغ؛ تشاو، يو؛ تشانغ، وينتاو؛ كوي، بن؛ يانغ، مينغ هسوان (2022). “نماذج الانتشار: مسح شامل للطرق والتطبيقات”. أرخايف : 2206.00364 [ cs.CV ].
  33. شي، جياكسين؛ هان، كيهانغ؛ وانغ، تشي؛ دوسيت، أرنو؛ تيتسياس، ميخاليس ك. (2024). "الانتشار المقنع المبسط والمعمم للبيانات المنفصلة". arXiv : 2406.04329 [ cs.LG ].
  34. ^ كراس، تيرو. أيتالا، ميكا؛ ايلا، تيمو؛ لين ، سامولي (2022). “توضيح مساحة تصميم النماذج التوليدية القائمة على الانتشار”. أرخايف : 2206.00364v2 [ cs.CV ].
  35. ^ تساو، هانكون؛ تان، تشنغ. جاو، تشانغيانغ. شو، ييلون؛ تشن، قوانغيونغ؛ هنغ، فنغ-آن؛ لي ، ستان ز. (يوليو 2024). “مسح حول نماذج الانتشار التوليدي”. معاملات IEEE على المعرفة وهندسة البيانات . 36 (7): 2814– 2830. بيب كود : 2024ITKDE..36.2814C . دوى : 10.1109/TKDE.2024.3361474 . ردمك 1041-4347 . 
  36. شو، ييلون؛ ليو، زيمينغ؛ تيان، يونغلونغ؛ تونغ، شانغ يوان؛ تيغمارك، ماكس؛ جاكولا، تومي (2023-07-03). "PFGM++: إطلاق العنان لإمكانات النماذج التوليدية المستوحاة من الفيزياء" . وقائع المؤتمر الدولي الأربعين للتعلم الآلي . PMLR: 38566–38591 . arXiv : 2302.04265 .
  37. سونغ، يانغ؛ داريوال، برافولا؛ تشين، مارك؛ سوتسكيفر، إيليا (2023-07-03). "نماذج الاتساق" . وقائع المؤتمر الدولي الأربعين للتعلم الآلي . PMLR: 32211–32252 .
  38. دوكهورن، تيم؛ فهدات، أراش؛ كرايس، كارستن (2021-10-06). "النمذجة التوليدية القائمة على الدرجات مع انتشار لانجفين المخمد حرجًا". arXiv : 2112.07068 [ stat.ML ].
  39. ليو، زيمينغ؛ لو، دي؛ شو، ييلون؛ جاكولا، تومي؛ تيغمارك، ماكس (2023-04-05). "GenPhys: من العمليات الفيزيائية إلى النماذج التوليدية". arXiv : 2304.02637 [ cs.LG ].
  40. بانسال، أربيت؛ بورغنيا، إيتان؛ تشو، هونغ مين؛ لي، جي؛ كازيمي، حميد؛ هوانغ، فورونغ؛ غولدبلوم، ميكا؛ غيبينغ، جوناس؛ غولدشتاين، توم (15-12-2023). "الانتشار البارد: عكس تحويلات الصور العشوائية بدون ضوضاء" . التقدم في أنظمة معالجة المعلومات العصبية . 36 : 41259-41282 . arXiv : 2208.09392 .
  41. تونغ، ألكسندر؛ فاتراس، كيليان؛ مالكين، نيكولاي؛ هوغيت، غيوم؛ تشانغ، يانلي؛ ريكتور-بروكس، جاريد؛ وولف، غاي؛ بينجيو، يوشوا (2023-11-08). "تحسين وتعميم النماذج التوليدية القائمة على التدفق باستخدام النقل الأمثل للدُفعات الصغيرة" . معاملات بحوث التعلم الآلي . arXiv : 2302.00482 . ISSN 2835-8856 . 
  42. 1 2 3 4 ليو، شينغتشاو؛ غونغ، تشنغيو؛ ليو، تشيانغ (2022-09-07). "تدفق مستقيم وسريع: تعلم توليد ونقل البيانات باستخدام التدفق المصحح". arXiv : 2209.03003 [ cs.LG ].
  43. ليو، تشيانغ (2022-09-29). "التدفق المعدل: نهج الحفاظ على الحدود للنقل الأمثل". arXiv : 2209.14577 [ stat.ML ].
  44. ديلبراسيو، ماوريسيو؛ ميلانفار، بيمان (2023). "الانعكاس بالتكرار المباشر: بديل لانتشار إزالة التشويش لاستعادة الصور" . معاملات بحوث التعلم الآلي .
  45. ١ ٢ ٣ هو، جوناثان؛ ساهاريا، شيتوان؛ تشان، ويليام؛ فليت، ديفيد جيه؛ نوروزي، محمد؛ سالمانس، تيم (٢٠٢٢-٠١-٠١). "نماذج الانتشار المتتالي لتوليد صور عالية الدقة" . مجلة أبحاث تعلم الآلة . ٢٣ (١): ٤٧:٢٢٤٩–٤٧:٢٢٨١. arXiv : ٢١٠٦.١٥٢٨٢ . ISSN ١٥٣٢-٤٤٣٥ . 
  46. بيبلز، ويليام؛ شي، ساينينغ (مارس 2023). "نماذج الانتشار القابلة للتطوير باستخدام المحولات". arXiv : 2212.09748v2 [ cs.CV ].
  47. ^ فاي، زينجكونج؛ فان، مينجيوان؛ يو، تشانغتشيان؛ لي، ديبانج؛ هوانغ ، جونشي (2024/07/16). “تحجيم محولات الانتشار إلى 16 مليار معلمة”. أرخايف : 2407.11633 [ cs.CV ].
  48. 1 2 تيفيت، جاي؛ راب، سيجال؛ جوردون، بريان. شافير، يوناتان؛ كوهين أور دانيال. برمانو، أميت هـ. (2022). “نموذج انتشار الحركة البشرية”. أرخايف : 2209.14916 [ cs.CV ].
  49. تشانغ، ليفمين؛ راو، أنيي؛ أغراوالا، مانيش (2023). "إضافة التحكم الشرطي إلى نماذج انتشار النص إلى الصورة". arXiv : 2302.05543 [ cs.CV ].
  50. لوغماير، أندرياس؛ دانيلجان، مارتن؛ روميرو، أندريس؛ يو، فيشر؛ تيموفتي، رادو؛ فان غول، لوك (2022). "إعادة الرسم: ترميم الصور باستخدام نماذج احتمالية الانتشار لإزالة التشويش". arXiv : 2201.09865v4 [ cs.CV ].
  51. هيرتز، أمير؛ موكادي، رون؛ تيننباوم، جاي؛ أبرمان، كفير؛ بريتش، يائيل؛ كوهين-أور، دانيال (2022-08-02). "تحرير الصور من موجه إلى موجه مع التحكم في الانتباه المتبادل". arXiv : 2208.01626 [ cs.CV ].
  52. تشاو، تشنغ؛ لو، زيوي؛ سيولوند، ينس؛ شون، توماس (19 يونيو 2025). "أخذ العينات المشروط ضمن نماذج الانتشار التوليدي" . المعاملات الفلسفية للجمعية الملكية أ: العلوم الرياضية والفيزيائية والهندسية . 383 (2299). doi : 10.1098/rsta.2024.0329 . ISSN 1364-503X . PMC 12177524 .  
  53. وانغ، شينتاو؛ شي، ليانغبين؛ دونغ، تشاو؛ شان، يينغ (2021). "Real-ESRGAN: تدريب نموذج فائق الدقة للعمى في العالم الحقيقي باستخدام بيانات اصطناعية خالصة" (ملف PDF) . وقائع ورش عمل المؤتمر الدولي لرؤية الحاسوب (ICCV) التابع لمعهد مهندسي الكهرباء والإلكترونيات/مؤسسة رؤية الحاسوب، 2021. المؤتمر الدولي لرؤية الحاسوب. الصفحات 1905-1914 . arXiv : 2107.10833 . 
  54. ليانغ، جينغيون؛ كاو، جيتشانغ؛ صن، غولي؛ تشانغ، كاي؛ فان غول، لوك؛ تيموفتي، رادو (2021). "SwinIR: استعادة الصور باستخدام محول Swin" (ملف PDF) . وقائع ورش عمل المؤتمر الدولي لرؤية الحاسوب (ICCV) التابع لمعهد مهندسي الكهرباء والإلكترونيات (IEEE) والاتحاد الدولي لرؤية الحاسوب (CVF) . المؤتمر الدولي لرؤية الحاسوب، 2021. الصفحات 1833-1844 . arXiv : 2108.10257v1 . 
  55. نيكول، أليكس؛ داريوال، برافولا؛ راميش، أديتيا؛ شيام، براناف؛ ميشكين، باميلا؛ ماكجرو، بوب؛ سوتسكيفر، إيليا؛ تشين، مارك (2022-03-08). "GLIDE: نحو توليد وتحرير صور واقعية باستخدام نماذج الانتشار الموجهة بالنصوص". arXiv : 2112.10741 [ cs.CV ].
  56. راميش، أديتيا؛ داريوال، برافولا؛ نيكول، أليكس؛ تشو، كيسي؛ تشين، مارك (2022-04-12). "توليد الصور الهرمي المشروط بالنص باستخدام CLIP Latents". arXiv : 2204.06125 [ cs.CV ].
  57. "لايتريكس تتحدى عمالقة الذكاء الاصطناعي بمنصة مفتوحة المصدر لتحويل النصوص إلى فيديوهات" . ctech . 22-11-2024 . تاريخ الاسترجاع: 23-04-2026 .
  58. كيمبر، جوناثان (11 يناير 2026). "شركة لايتريكس تُطلق نموذج الذكاء الاصطناعي للفيديو LTX-2 مفتوح المصدر، ويتحدى سورا وفيو" . ذا ديكودر . تاريخ الاسترجاع: 23 أبريل 2026 .
  59. لايتريكس. "لايتريكس تُصدر LTX-2: أول نموذج أساسي كامل مفتوح المصدر للذكاء الاصطناعي للفيديو" . www.prnewswire.com . تاريخ الاسترجاع: 23 أبريل 2026 .
  60. العمار، جاي. "الانتشار المستقر المصور" . jalammar.github.io . تم ​​الاطلاع عليه بتاريخ 31-10-2022 .
  61. إيسر، باتريك؛ كولال، سوميث؛ بلاتمان، أندرياس؛ إنتزاري، رحيم؛ مولر، جوناس؛ سايني، هاري؛ ليفي، يام؛ لورنز، دومينيك؛ ساوير، أكسل (2024-03-05). "توسيع نطاق محولات التدفق المعدلة لتوليف الصور عالية الدقة". arXiv : 2403.03206 [ cs.CV ].
  62. شي، ييمينغ؛ ياو، تشون هان؛ فوليتي، فيكرام؛ جيانغ، هوايزو؛ جامباني، فارون (24-07-2024). "SV4D: توليد محتوى ثلاثي الأبعاد ديناميكي مع اتساق متعدد الإطارات ومتعدد العروض". arXiv : 2407.17470 [ cs.CV ].
  63. "Imagen: نماذج انتشار النص إلى الصورة" . imagen.research.google . تم الاسترجاع في 4 أبريل 2024 .
  64. ساهاريا، شيتوان؛ تشان، ويليام؛ ساكسينا، سوراب؛ لي، لالا؛ وانغ، جاي؛ دينتون، إميلي ل.؛ قاسميبور، كاميار؛ غونتيو لوبيز، رافائيل؛ كاراغول أيان، بورجو؛ ساليمانس، تيم؛ هو، جوناثان؛ فليت، ديفيد ج.؛ نوروزي، محمد (2022-12-06). "نماذج نشر واقعية للنصوص والصور مع فهم عميق للغة" . التقدم في أنظمة معالجة المعلومات العصبية . 35 : 36479-36494 . arXiv : 2205.11487 .
  65. تشانغ، هويوين؛ تشانغ، هان؛ باربر، جاريد؛ ماشينو، إيه جيه؛ ليزاما، خوسيه؛ جيانغ، لو؛ يانغ، مينغ-هسوان؛ مورفي، كيفن؛ فريمان، ويليام تي. (2023-01-02). "Muse: توليد الصور من النصوص باستخدام محولات توليدية مقنعة". arXiv : 2301.00704 [ cs.CV ].
  66. "Imagen 2 - أحدث تقنياتنا لتحويل النصوص إلى صور" . جوجل ديب مايند . تم الاطلاع عليه بتاريخ 4 أبريل 2024 .
  67. إيماجن-فريق-جوجل؛ بالدريدج، جايسون؛ باور، جاكوب؛ بوتاني، موكول؛ بريشتوفا، نيكول؛ بونر، أندرو؛ كاستريجون، لويس؛ تشان، كلفن؛ تشن، ييتشانغ (2024-12-13)، الصورة 3 ، أرخايف : 2408.07009{{citation}}له |last1=اسم عام ( مساعدة )
  68. "Veo" . جوجل ديب مايند . 14-05-2024 . تم الاسترجاع في 17-05-2024 .
  69. "تقديم Make-A-Video: نظام ذكاء اصطناعي يُنشئ مقاطع فيديو من النصوص" . ai.meta.com . تاريخ الاسترجاع: 2024-09-20 .
  70. سينغر، أوريل؛ بولياك، آدم؛ هايز، توماس؛ ين، شي؛ آن، جي؛ تشانغ، سونغيانغ؛ هو، تشييوان؛ يانغ، هاري؛ أشوال، أورون (2022-09-29). "Make-A-Video: تحويل النص إلى فيديو بدون بيانات نصية-فيديو". arXiv : 2209.14792 [ cs.CV ].
  71. "تقديم CM3leon، نموذج توليدي أكثر كفاءة وتطوراً للنصوص والصور" . ai.meta.com . تاريخ الاسترجاع: 2024-09-20 .
  72. فريق كاميليون (2024-05-16). "كاميليون: نماذج تأسيسية للاندماج المبكر متعددة الأنماط". arXiv : 2405.09818 [ cs.CL ].
  73. ^ تشو، تشونتينج؛ يو، ليلى؛ بابو آرون. تيرومالا، كوشال؛ ياسوناجا، ميتشيهيرو؛ شاميس، ليونيد؛ خان، يعقوب؛ ما، شيويزهي؛ زيتليموير ، لوك (2024/08/20). “نقل الدم: التنبؤ بالرمز التالي والصور المنتشرة باستخدام نموذج واحد متعدد الوسائط”. أرخايف : 2408.11039 [ cs.AI ].
  74. Movie Gen: A Cast of Media Foundation Models , The Movie Gen team @ Meta, October 4, 2024.