الانتشار المستقر
Stable Diffusion هو نموذج للتعلم العميق لتحويل النصوص إلى صور ، تم إصداره عام 2022 ويعتمد على تقنيات الانتشار . تُعد تقنية الذكاء الاصطناعي التوليدي هذه المنتج الرئيسي لشركة Stability AI ، وتُعتبر جزءًا من طفرة الذكاء الاصطناعي الحالية .
يُستخدم هذا البرنامج بشكل أساسي لإنشاء صور تفصيلية بناءً على أوصاف نصية، مع إمكانية تطبيقه على مهام أخرى مثل ترميم الصور ، وإزالة التفاصيل غير المرغوب فيها، وإنشاء ترجمات بين الصور بناءً على نص مُحدد . [ 3 ] وقد شارك في تطويره باحثون من مجموعة CompVis في جامعة لودفيغ ماكسيميليان في ميونخ وشركة Runway ، بدعم حاسوبي من شركة Stability وبيانات تدريبية من منظمات غير ربحية. [ 4 ] [ 5 ] [ 6 ] [ 7 ]
يُعدّ Stable Diffusion نموذج انتشار كامن ، وهو نوع من الشبكات العصبية الاصطناعية التوليدية العميقة . وقد نُشرت شفرته وأوزان نموذجه للعموم ، [ 8 ] ويمكن تشغيل نسخة مُحسّنة منه على معظم أجهزة المستهلكين المزودة بوحدة معالجة رسومية متواضعة بسعة 2.4 جيجابايت من ذاكرة الوصول العشوائي للفيديو . [ 9 ] وقد مثّل هذا تحولًا عن نماذج تحويل النصوص إلى صور الاحتكارية السابقة، مثل DALL-E و Midjourney، التي كانت متاحة فقط عبر الخدمات السحابية . [ 10 ] [ 11 ]
تطوير
نشأت خوارزمية الانتشار المستقر من مشروع يُدعى الانتشار الكامن ، [ 12 ] الذي طُوّر في ألمانيا على يد باحثين من جامعة لودفيغ ماكسيميليان في ميونخ وجامعة هايدلبرغ . انضم أربعة من المؤلفين الخمسة الأصليين (روبن رومباخ، وأندرياس بلاتمان، وباتريك إيسر، ودومينيك لورنز) لاحقًا إلى شركة Stability AI وأصدروا نسخًا لاحقة من خوارزمية الانتشار المستقر. [ 13 ]
أصدرت مجموعة CompVis في جامعة لودفيغ ماكسيميليان في ميونخ الترخيص التقني للنموذج. [ 11 ] قاد عملية التطوير باتريك إيسر من شركة Runway وروبن رومباخ من شركة CompVis، وكانا من بين الباحثين الذين ابتكروا سابقًا بنية نموذج الانتشار الكامن المستخدم في Stable Diffusion. [ 7 ] كما أشادت Stability AI بدعم كل من EleutherAI و LAION (منظمة ألمانية غير ربحية جمعت مجموعة البيانات التي دُرِّب عليها Stable Diffusion) للمشروع. [ 7 ]
تكنولوجيا


بنيان
تُدرَّب نماذج الانتشار ، التي طُرحت عام ٢٠١٥، بهدف إزالة التشويش الغاوسي المتكرر من صور التدريب، ويمكن اعتبارها سلسلة من مُشفِّرات إزالة التشويش التلقائية . ويُشتق اسم "الانتشار" من الانتشار الديناميكي الحراري ، إذ طُوِّرت هذه النماذج في البداية مستوحاةً من الديناميكا الحرارية. [ ١٤ ] [ ١٥ ]
استخدمت جميع النماذج في سلسلة الانتشار المستقر قبل SD 3 نوعًا مختلفًا من نماذج الانتشار، يسمى نموذج الانتشار الكامن (LDM) ، والذي تم تطويره في عام 2021 بواسطة مجموعة CompVis (رؤية الحاسوب والتعلم) [ 16 ] في جامعة لودفيغ ماكسيميليان في ميونخ . [ 17 ] [ 8 ]
تتكون خوارزمية الانتشار المستقر من ثلاثة أجزاء: المُشفِّر التلقائي التبايني (VAE)، وشبكة U-Net ، ومُشفِّر نصي اختياري. [ 18 ] يقوم مُشفِّر VAE بضغط الصورة من فضاء البكسل إلى فضاء كامن ذي أبعاد أصغر ، مما يُتيح التقاط معنى دلالي أكثر جوهرية للصورة. [ 17 ] يتم تطبيق ضوضاء غاوسية بشكل تكراري على التمثيل الكامن المضغوط أثناء الانتشار الأمامي. [ 18 ] تقوم وحدة U-Net، المُكوَّنة من بنية ResNet الأساسية ، بإزالة الضوضاء من مُخرَج الانتشار الأمامي عكسيًا للحصول على تمثيل كامن. أخيرًا، يُولِّد مُفكِّك VAE الصورة النهائية عن طريق تحويل التمثيل مرة أخرى إلى فضاء البكسل. [ 18 ]
يمكن ربط خطوة إزالة التشويش بمرونة بسلسلة نصية أو صورة أو أي وسيط آخر. تُعرَض بيانات الربط المُشفَّرة لشبكات U-Net لإزالة التشويش عبر آلية الانتباه المتبادل . [ 18 ] وللربط بالنص، يُستخدم مُشفِّر النصوص CLIP ViT-L/14 المُدرَّب مُسبقًا لتحويل النصوص إلى فضاء تضمين. [ 8 ] ويشير الباحثون إلى زيادة الكفاءة الحسابية للتدريب والتوليد كميزة لنماذج إزالة التشويش الخطية. [ 7 ] [ 17 ]
بفضل احتوائه على 860 مليون مُعامل في شبكة U-Net و123 مليون مُعامل في مُشفّر النصوص، يُعتبر Stable Diffusion خفيف الوزن نسبيًا وفقًا لمعايير عام 2022، وعلى عكس نماذج الانتشار الأخرى، يمكن تشغيله على وحدات معالجة الرسومات الاستهلاكية ، [ 19 ] وحتى على وحدة المعالجة المركزية فقط عند استخدام إصدار OpenVINO من Stable Diffusion. [ 20 ]
SD XL
يستخدم الإصدار XL نفس بنية LDM مثل الإصدارات السابقة، [ 21 ] باستثناء أنه أكبر: هيكل UNet أكبر، وسياق انتباه متقاطع أكبر، ومشفران نصيان بدلاً من واحد، وتم تدريبه على نسب أبعاد متعددة (وليس فقط نسبة الأبعاد المربعة مثل الإصدارات السابقة).
يتمتع برنامج SD XL Refiner، الذي تم إصداره في نفس الوقت، بنفس بنية SD XL، ولكنه تم تدريبه لإضافة تفاصيل دقيقة إلى الصور الموجودة مسبقًا عبر img2img المشروط بالنص.
SD 3.0
يُغيّر الإصدار 3.0 [ 22 ] البنية الأساسية بالكامل. فهو ليس UNet، بل مُحوّل تدفق مُصحّح ، والذي يُطبّق طريقة التدفق المُصحّح [ 23 ] [ 24 ] باستخدام مُحوّل .
تعتمد بنية المحول المستخدمة في SD 3.0 على ثلاثة مسارات: ترميز النص الأصلي، وترميز النص المُحوَّل، وترميز الصورة (في الفضاء الكامن). ويتم مزج ترميز النص المُحوَّل وترميز الصورة خلال كل وحدة من وحدات المحول.
يُطلق على هذه البنية اسم "محول الانتشار متعدد الوسائط (MMDiT)"، حيث تعني كلمة "متعدد الوسائط" أنها تمزج بين ترميز النصوص والصور داخل عملياتها. وهذا يختلف عن الإصدارات السابقة من DiT، حيث يؤثر ترميز النص على ترميز الصورة، ولكن ليس العكس.
بيانات التدريب
تم تدريب نموذج الانتشار المستقر على أزواج من الصور والتعليقات المأخوذة من مجموعة بيانات LAION-5B، وهي مجموعة بيانات متاحة للعموم مستمدة من بيانات Common Crawl التي تم جمعها من الإنترنت، حيث تم تصنيف 5 مليارات زوج من الصور والنصوص بناءً على اللغة، ثم تم تصفيتها إلى مجموعات بيانات منفصلة حسب الدقة، واحتمالية وجود علامة مائية، والتقييم الجمالي المتوقع (مثل الجودة البصرية الذاتية). [ 25 ] تم إنشاء مجموعة البيانات بواسطة LAION ، وهي منظمة ألمانية غير ربحية تتلقى تمويلًا من Stability AI. [ 25 ] [ 26 ] تم تدريب نموذج الانتشار المستقر على ثلاث مجموعات فرعية من LAION-5B: laion2B-en، وlaion-high-resolution، وlaion-aesthetics v2 5+. [ 25 ] كشف تحليلٌ أجرته جهةٌ خارجيةٌ لبيانات تدريب النموذج أن ما يقارب 47% من عينة الصور، ضمن مجموعةٍ فرعيةٍ أصغر تضم 12 مليون صورة مأخوذة من مجموعة البيانات الأصلية الأوسع نطاقًا، جاءت من 100 نطاقٍ مختلف، حيث استحوذ موقع Pinterest على 8.5% من هذه المجموعة الفرعية، يليه مواقع إلكترونية مثل WordPress و Blogspot و Flickr و DeviantArt و Wikimedia Commons . وأظهر تحقيقٌ أجرته إذاعة بافاريا (Bayerischer Rundfunk) أن مجموعات بيانات LAION، المستضافة على منصة Hugging Face، تحتوي على كمياتٍ كبيرةٍ من البيانات الخاصة والحساسة. [ 27 ]
إجراءات التدريب
تم تدريب النموذج مبدئيًا على مجموعتي البيانات الفرعيتين laion2B-en و laion-high-resolution، ثم أُجريت الجولات الأخيرة من التدريب على مجموعة البيانات الفرعية LAION-Aesthetics v2 5+، وهي مجموعة تضم 600 مليون صورة معنونة، والتي توقع نموذج LAION-Aesthetics Predictor V2 أن يُقيّمها البشر، في المتوسط، بـ 5 من 10 على الأقل عند سؤالهم عن مدى إعجابهم بها. [ 28 ] [ 25 ] [ 29 ] كما استبعدت مجموعة البيانات الفرعية LAION-Aesthetics v2 5+ الصور منخفضة الدقة والصور التي حددها نموذج LAION-5B-WatermarkDetection على أنها تحمل علامة مائية باحتمالية تزيد عن 80%. [ 25 ] بالإضافة إلى ذلك، أسقطت الجولات الأخيرة من التدريب 10% من النص المُهيأ لتحسين التوجيه الانتشار الخالي من المصنف. [ 30 ]
تم تدريب النموذج باستخدام 256 وحدة معالجة رسومية من نوع Nvidia A100 على خدمات أمازون السحابية لمدة إجمالية قدرها 150,000 ساعة معالجة رسومية، بتكلفة 600,000 دولار. [ 31 ] [ 32 ] [ 33 ]
القيود
يُعاني نموذج الانتشار المستقر من مشاكل تتعلق بتدهور الجودة وعدم الدقة في بعض الحالات. دُرِّبت الإصدارات الأولى من النموذج على مجموعة بيانات تتكون من صور بدقة 512×512 بكسل، مما يعني أن جودة الصور المُولَّدة تتدهور بشكل ملحوظ عندما تختلف مواصفات المستخدم عن الدقة "المتوقعة" 512×512 بكسل؛ [ 34 ] وقد أضاف تحديث الإصدار 2.0 من نموذج الانتشار المستقر لاحقًا إمكانية توليد صور بدقة 768×768 بكسل. [ 35 ] يتمثل تحدٍ آخر في توليد صور الأطراف البشرية نظرًا لضعف جودة بيانات الأطراف في قاعدة بيانات LAION. [ 36 ] فالنموذج غير مُدرَّب بشكل كافٍ لمحاكاة الأطراف والوجوه البشرية بسبب نقص الميزات التمثيلية في قاعدة البيانات، وقد يؤدي حث النموذج على توليد صور من هذا النوع إلى إرباكه. [ 37 ] بالإضافة إلى الأطراف البشرية، يعجز نموذج الانتشار المستقر عن توليد صور متناظرة مقروءة وبعض أشكال النصوص والطباعة الأخرى. أضاف الإصدار 1.0 من برنامج Stable Diffusion XL (SDXL)، الذي صدر في يوليو 2023، دقة عرض أصلية تبلغ 1024×1024 بكسل، وحسّن من توليد الأطراف والنصوص. [ 38 ] [ 39 ]
قد يُمثل الوصول إلى النموذج للمطورين الأفراد مشكلةً أيضًا. فلتخصيص النموذج لحالات استخدام جديدة غير مُدرجة في مجموعة البيانات، مثل توليد شخصيات الأنمي ("انتشار شخصيات الأنمي")، [ 40 ] يلزم توفير بيانات جديدة وتدريب إضافي. وقد استُخدمت تعديلات مُحسّنة من نموذج الانتشار المستقر، تم إنشاؤها من خلال إعادة تدريب إضافية، في مجموعة متنوعة من حالات الاستخدام، بدءًا من التصوير الطبي [ 41 ] وصولًا إلى الموسيقى المُولّدة خوارزميًا . [ 42 ] ومع ذلك، فإن عملية الضبط الدقيق هذه حساسة لجودة البيانات الجديدة؛ إذ إن الصور منخفضة الدقة أو ذات الدقة المختلفة عن البيانات الأصلية لا تفشل فقط في تعلم المهمة الجديدة، بل تُؤدي أيضًا إلى تدهور الأداء العام للنموذج. وحتى عند تدريب النموذج بشكل إضافي على صور عالية الجودة، يظل من الصعب على الأفراد تشغيل النماذج في الأجهزة الإلكترونية الاستهلاكية. على سبيل المثال، تتطلب عملية تدريب تقنية نشر شخصيات الوايفو ما لا يقل عن 30 جيجابايت من ذاكرة الوصول العشوائي للفيديو (VRAM) ، [ 43 ] وهو ما يتجاوز الموارد المعتادة المتوفرة في وحدات معالجة الرسومات الاستهلاكية مثل سلسلة GeForce 30 من Nvidia ، والتي تحتوي على حوالي 12 جيجابايت فقط. [ 44 ]
يُقرّ مُبتكرو نموذج الانتشار المستقر باحتمالية وجود تحيّز خوارزمي ، إذ دُرِّب النموذج في الأساس على صور مصحوبة بأوصاف إنجليزية. [ 32 ] ونتيجةً لذلك، تُعزّز الصور المُولّدة التحيّزات الاجتماعية وتُقدّم من منظور غربي، حيث يُشير المُبتكرون إلى أن النموذج يفتقر إلى بيانات من مجتمعات وثقافات أخرى. يُعطي النموذج نتائج أكثر دقةً للمُطالبات المكتوبة باللغة الإنجليزية مُقارنةً بتلك المكتوبة بلغات أخرى، وغالبًا ما تكون الثقافات الغربية أو البيضاء هي التمثيل الافتراضي. [ 32 ]
الضبط الدقيق للمستخدم النهائي
لمعالجة قصور التدريب الأولي للنموذج، يمكن للمستخدمين النهائيين اختيار إجراء تدريب إضافي لضبط مخرجات التوليد بدقة لتتوافق مع حالات استخدام أكثر تحديدًا، وهي عملية تُعرف أيضًا بالتخصيص . توجد ثلاث طرق يمكن من خلالها تطبيق الضبط الدقيق الذي يمكن للمستخدم الوصول إليه على نقطة تفتيش نموذج الانتشار المستقر:
- يمكن تدريب "التضمين" من مجموعة صور يُدخلها المستخدم، مما يسمح للنموذج بتوليد صور متشابهة بصريًا كلما استُخدم اسم التضمين في موجه التوليد. [ 45 ] تعتمد التضمينات على مفهوم "الانعكاس النصي" الذي طوره باحثون من جامعة تل أبيب عام 2022 بدعم من شركة Nvidia ، حيث تُربط التمثيلات المتجهة لرموز محددة يستخدمها مُشفّر النصوص في النموذج بكلمات زائفة جديدة. يمكن استخدام التضمينات لتقليل التحيزات داخل النموذج الأصلي، أو لمحاكاة الأنماط البصرية. [ 46 ]
- الشبكة الفائقة هي شبكة عصبية صغيرة مُدرَّبة مسبقًا تُطبَّق على نقاط مختلفة داخل شبكة عصبية أكبر، وهي تقنية ابتكرها كوروموز، مطوّر NovelAI، عام 2021، وكانت مُخصَّصة في الأصل لنماذج توليد النصوص باستخدام المحولات . تُوجِّه الشبكات الفائقة النتائج نحو اتجاه مُحدَّد، مما يسمح للنماذج القائمة على الانتشار المستقر بمحاكاة الأسلوب الفني لفنانين مُعيَّنين، حتى لو لم يتعرّف النموذج الأصلي على الفنان؛ إذ تُعالج هذه الشبكات الصورة من خلال تحديد المناطق الرئيسية المهمة مثل الشعر والعينين، ثم تُرقِّع هذه المناطق في فضاء كامن ثانوي. [ 47 ]
- دريم بوث هو نموذج توليد قائم على التعلم العميق، طوره باحثون من جوجل للأبحاث وجامعة بوسطن في عام 2022، وهو قادر على ضبط النموذج بدقة لإنتاج مخرجات دقيقة وشخصية تصور موضوعًا محددًا، وذلك بعد تدريبه باستخدام مجموعة من الصور التي تصور ذلك الموضوع. [ 48 ]
القدرات
يدعم نموذج الانتشار المستقر إمكانية إنشاء صور جديدة من الصفر باستخدام موجه نصي يصف العناصر المراد تضمينها أو حذفها من الناتج. [ 8 ] ويمكن إعادة رسم الصور الموجودة بواسطة النموذج لدمج عناصر جديدة موصوفة بواسطة موجه نصي (وهي عملية تُعرف باسم "توليف الصور الموجه" [ 49 ] ) من خلال آلية إزالة التشويش بالانتشار. [ 8 ] بالإضافة إلى ذلك، يسمح النموذج أيضًا باستخدام الموجهات لتعديل الصور الموجودة جزئيًا عبر التعبئة والتصحيح، عند استخدامه مع واجهة مستخدم مناسبة تدعم هذه الميزات، والتي تتوفر لها العديد من التطبيقات مفتوحة المصدر. [ 50 ]
يُنصح بتشغيل برنامج Stable Diffusion باستخدام ذاكرة وصول عشوائي للفيديو (VRAM) بسعة 10 جيجابايت أو أكثر، ومع ذلك، يمكن للمستخدمين الذين لديهم ذاكرة وصول عشوائي للفيديو أقل اختيار تحميل الأوزان بدقة float16 بدلاً من الدقة الافتراضية float32 لتحقيق توازن بين أداء النموذج وتقليل استخدام ذاكرة الوصول العشوائي للفيديو. [ 34 ]
تحويل النص إلى صورة
- أعلى الصفحة : لا يوجد تلميح سلبي
- المركز : "أشجار خضراء"
- أسفل : "أحجار مستديرة، صخور مستديرة"
يستهلك برنامج تحويل النص إلى صورة ضمن برنامج Stable Diffusion، والمعروف باسم "txt2img"، نصًا مُدخلًا بالإضافة إلى مجموعة متنوعة من معلمات الخيارات التي تشمل أنواع أخذ العينات، وأبعاد الصورة الناتجة، وقيم البذور. يُخرج البرنامج ملف صورة بناءً على تفسير النموذج للنص المُدخل. [ 8 ] تُوسم الصور المُولدة بعلامة مائية رقمية غير مرئية لتمكين المستخدمين من التعرف على الصورة على أنها مُولدة بواسطة Stable Diffusion، [ 8 ] مع العلم أن هذه العلامة المائية تفقد فعاليتها إذا تم تغيير حجم الصورة أو تدويرها. [ 51 ]
تتضمن كل عملية توليد لـ txt2img قيمة بذرة محددة تؤثر على الصورة الناتجة. يمكن للمستخدمين اختيار تغيير قيمة البذرة عشوائيًا لاستكشاف مخرجات مختلفة، أو استخدام نفس البذرة للحصول على نفس الصورة الناتجة عن صورة تم توليدها مسبقًا. [ 34 ] كما يمكن للمستخدمين ضبط عدد خطوات الاستدلال لأخذ العينات؛ فالقيمة الأعلى تستغرق وقتًا أطول، بينما قد تؤدي القيمة الأصغر إلى عيوب بصرية. [ 34 ] هناك خيار آخر قابل للتكوين، وهو قيمة مقياس التوجيه بدون مصنف، يسمح للمستخدم بضبط مدى تطابق الصورة الناتجة مع التعليمات. [ 30 ] قد تختار حالات الاستخدام التجريبية قيمة مقياس أقل، بينما قد تستخدم حالات الاستخدام التي تهدف إلى مخرجات أكثر تحديدًا قيمة أعلى. [ 34 ]
تُوفّر تطبيقات الواجهة الأمامية لتقنية Stable Diffusion ميزات إضافية لتحويل النص إلى صورة، مما يسمح للمستخدمين بتعديل وزن أجزاء مُحدّدة من النص المطلوب. تُمكّن علامات التأكيد المستخدمين من إضافة أو تقليل التأكيد على الكلمات المفتاحية بوضعها بين قوسين. [ 52 ] وثمة طريقة بديلة لتعديل وزن أجزاء النص المطلوب، وهي "التوجيهات السلبية". تُعدّ التوجيهات السلبية ميزة مُضمّنة في بعض تطبيقات الواجهة الأمامية، بما في ذلك خدمة DreamStudio السحابية التابعة لشركة Stability AI، وتسمح للمستخدم بتحديد التوجيهات التي يجب على النموذج تجنّبها أثناء إنشاء الصورة. قد تكون التوجيهات المُحدّدة عبارة عن ميزات غير مرغوب فيها في الصورة، والتي قد تظهر في مُخرجات الصور بسبب التوجيهات الإيجابية التي يُقدّمها المستخدم، أو بسبب طريقة تدريب النموذج في الأصل، ومن الأمثلة الشائعة على ذلك تشويه الأيدي البشرية. [ 50 ] [ 53 ]
تعديل الصورة
- اليسار : الصورة الأصلية التي تم إنشاؤها باستخدام برنامج Stable Diffusion 1.5
- على اليمين : صورة معدلة تم إنشاؤها باستخدام برنامج Stable Diffusion XL 1.0
يتضمن برنامج Stable Diffusion أيضًا برنامجًا نصيًا آخر لأخذ العينات، يُسمى "img2img"، والذي يستقبل نصًا مُدخلًا، ومسارًا لصورة موجودة، وقيمة قوة تتراوح بين 0.0 و1.0. يُخرج البرنامج صورة جديدة بناءً على الصورة الأصلية، مع تضمين العناصر المُدخلة في النص المُدخل. تُشير قيمة القوة إلى مقدار التشويش المُضاف إلى الصورة الناتجة. تُنتج قيمة القوة الأعلى تباينًا أكبر داخل الصورة، ولكنها قد تُنتج صورة غير متسقة دلاليًا مع النص المُدخل. [ 8 ]
توجد طرق مختلفة لإجراء عملية img2img. الطريقة الرئيسية هي SDEdit، [ 54 ] والتي تضيف أولاً ضوضاء إلى الصورة، ثم تزيل الضوضاء منها كالمعتاد في text2img.
تُتيح قدرة تقنية img2img على إضافة تشويش إلى الصورة الأصلية استخدامها في إخفاء هوية البيانات وتوسيعها ، حيث يتم تغيير السمات المرئية لبيانات الصورة وإخفاء هويتها. [ 55 ] وقد تكون هذه العملية مفيدة أيضًا في تكبير الصور، حيث يتم زيادة دقة الصورة، مما قد يُضيف إليها مزيدًا من التفاصيل. [ 55 ] بالإضافة إلى ذلك، تم تجربة تقنية الانتشار المستقر كأداة لضغط الصور. وبالمقارنة مع JPEG و WebP ، فإن الطرق الحديثة المستخدمة لضغط الصور في الانتشار المستقر تواجه قيودًا في الحفاظ على النصوص الصغيرة والوجوه. [ 56 ]
تُقدّم العديد من تطبيقات الواجهة الأمامية لنموذج الانتشار المستقر حالات استخدام إضافية لتعديل الصور عبر تقنية img2img. تتضمن عملية التعبئة تعديل جزء محدد من صورة موجودة، مُحدد بقناع طبقة يُحدده المستخدم ، حيث يتم ملء المساحة المُقنّعة بمحتوى مُولّد حديثًا بناءً على التوجيه المُقدّم. [ 50 ] وقد طوّرت شركة Stability AI نموذجًا مُخصصًا ومُحسّنًا خصيصًا لحالات استخدام التعبئة، وذلك بالتزامن مع إصدار Stable Diffusion 2.0. [ 35 ] في المقابل، تعمل عملية التوسيع على تمديد الصورة لتتجاوز أبعادها الأصلية، وملء المساحة الفارغة سابقًا بمحتوى مُولّد بناءً على التوجيه المُقدّم. [ 50 ]
تم تقديم نموذج موجه بالعمق، يُسمى "depth2img"، مع إصدار Stable Diffusion 2.0 في 24 نوفمبر 2022؛ يستنتج هذا النموذج عمق الصورة المدخلة، ويُنشئ صورة إخراج جديدة بناءً على كل من النص المُدخل ومعلومات العمق، مما يسمح بالحفاظ على تماسك وعمق الصورة المدخلة الأصلية في الصورة المُخرجة. [ 35 ]
شبكة التحكم
ControlNet [ 57 ] عبارة عن بنية شبكة عصبية مصممة لإدارة نماذج الانتشار من خلال دمج شروط إضافية. تقوم هذه البنية بنسخ أوزان كتل الشبكة العصبية إلى نسختين: "مُقفلة" و"قابلة للتدريب". تتعلم النسخة "القابلة للتدريب" الشرط المطلوب، بينما تحافظ النسخة "المُقفلة" على النموذج الأصلي. يضمن هذا النهج عدم المساس بسلامة نماذج الانتشار الجاهزة للاستخدام عند التدريب باستخدام مجموعات بيانات صغيرة من أزواج الصور. "الالتفاف الصفري" هو التفاف 1×1 مع تهيئة كل من الوزن والانحياز إلى الصفر. قبل التدريب، تُنتج جميع الالتفافات الصفرية مخرجات صفرية، مما يمنع أي تشويه ناتج عن ControlNet. لا يتم تدريب أي طبقة من الصفر؛ فالعملية لا تزال عبارة عن ضبط دقيق، مما يحافظ على أمان النموذج الأصلي. تُمكّن هذه الطريقة من التدريب على أجهزة صغيرة الحجم أو حتى أجهزة شخصية.
تُستخدم شبكة التحكم (ControlNet) عادةً لتعديل عملية توليد صورة بناءً على صورة مُدخلة تُحدد الخصائص المطلوبة في الصورة النهائية. تشمل أنواع صور التحديد الشائعة خريطة العمق ، والحواف، ووضعية هيكلية واحدة أو أكثر . يمكن توليد هذه المدخلات مباشرةً، ولكنها غالبًا ما تُستخلص من صور أخرى باستخدام الشبكات العصبية أو عمليات مثل كشف الحواف .
واجهات المستخدم
تُقدّم شركة Stability خدمةً لإنشاء الصور عبر الإنترنت تُسمى DreamStudio . [ 58 ] [ 59 ] كما أصدرت الشركة نسخةً مفتوحة المصدر من DreamStudio تُسمى StableStudio . [ 60 ] [ 61 ] بالإضافة إلى واجهات Stability، توجد العديد من واجهات البرامج مفتوحة المصدر التابعة لجهات خارجية، مثل AUTOMATIC1111 Stable Diffusion Web UI ، وهي الأكثر شيوعًا وتُقدّم ميزات إضافية، [ 62 ] وFooocus ، التي تهدف إلى تقليل عدد التوجيهات المطلوبة من المستخدم، [ 63 ] و ComfyUI ، التي تتميّز بواجهة مستخدم قائمة على العُقد ، وهي في الأساس لغة برمجة مرئية تُشبه العديد من تطبيقات النمذجة ثلاثية الأبعاد . [ 64 ] [ 65 ] [ 66 ]
الإصدارات
| رقم الإصدار | تاريخ الافراج عنه | حدود | ملحوظات |
|---|---|---|---|
| 1.1، 1.2، 1.3، 1.4 [ 67 ] | أغسطس 2022 | جميعها صادرة عن شركة CompVis. لا يوجد إصدار "1.0". فقد أدى الإصدار 1.1 إلى ظهور الإصدار 1.2، وأدى الإصدار 1.2 إلى ظهور الإصدارين 1.3 و1.4. [ 68 ] | |
| 1.5 [ 69 ] [ 70 ] | أكتوبر 2022 | 983 مليون | تمت تهيئتها بأوزان 1.2، وليس 1.4. تم إصدارها بواسطة RunwayML في 20 أكتوبر 2022، مع تحسينات طفيفة مقارنة بالإصدار 1.4. [ 69 ] |
| 2.0 [ 71 ] | نوفمبر 2022 | أُعيد تدريب النموذج من الصفر على مجموعة بيانات مُفلترة. [ 72 ] | |
| 2.1 [ 73 ] | ديسمبر 2022 | تمت تهيئتها بأوزان قدرها 2.0. | |
| XL 1.0 [ 74 ] [ 21 ] | يوليو 2023 | 3.5 مليار | يحتوي النموذج الأساسي XL 1.0 على 3.5 مليار مُعامل، مما يجعله أكبر بنحو 3.5 مرة من الإصدارات السابقة. [ 75 ] |
| XL Turbo [ 76 ] | نوفمبر 2023 | تم تقطيرها من XL 1.0 لتشغيلها في عدد أقل من خطوات الانتشار. [ 77 ] | |
| 3.0 [ 78 ] [ 22 ] | فبراير 2024 (معاينة مبكرة) | من 800 مليون إلى 8 مليارات | عائلة من النماذج. |
| 3.5 [ 1 ] | أكتوبر 2024 | من 2.5 مليار إلى 8 مليارات | عائلة من النماذج ذات الأحجام الكبيرة (8 مليارات معلمة)، والكبيرة التوربينية (المستخلصة من SD 3.5 الكبيرة)، والمتوسطة (2.5 مليار معلمة). |
أوراق بحثية رئيسية
- تعلم النماذج البصرية القابلة للنقل من خلال الإشراف على اللغة الطبيعية (2021). [ 79 ] تصف هذه الورقة البحثية طريقة CLIP لتدريب مشفرات النصوص، التي تحول النص إلى متجهات ذات فاصلة عائمة. تُستخدم هذه التشفيرات النصية بواسطة نموذج الانتشار لإنشاء الصور.
- SDEdit: توليف الصور وتحريرها الموجه باستخدام المعادلات التفاضلية العشوائية (2021). [ 54 ] تصف هذه الورقة البحثية برنامج SDEdit، المعروف أيضًا باسم "img2img".
- توليف الصور عالية الدقة باستخدام نماذج الانتشار الكامن (2021، تم تحديثه في 2022). [ 80 ] تصف هذه الورقة نموذج الانتشار الكامن (LDM). وهو الركيزة الأساسية لبنية الانتشار المستقر.
- التوجيه الانتشار بدون مصنف (2022). [ 30 ] تصف هذه الورقة CFG، الذي يسمح لمتجه ترميز النص بتوجيه نموذج الانتشار نحو إنشاء الصورة الموصوفة بواسطة النص.
- SDXL: تحسين نماذج الانتشار الكامن لتوليف الصور عالية الدقة (2023). [ 21 ] يصف SDXL.
- التدفق المباشر والسريع: تعلم توليد البيانات ونقلها باستخدام التدفق المصحح (2022). [ 23 ] [ 24 ] يصف التدفق المصحح، والذي يُستخدم في البنية الأساسية لـ SD 3.0.
- توسيع نطاق محولات التدفق المعدلة لتوليف الصور عالية الدقة (2024). [ 22 ] يصف SD 3.0.
تكلفة التدريب
- SD 2.0: 0.2 مليون ساعة على A100 (40 جيجابايت). [ 71 ]
تم توفير الإصدار Stable Diffusion 3.5 Large للاستخدام المؤسسي على Amazon Bedrock من Amazon Web Services . [ 81 ]
الاستخدام والجدل
لا تدّعي شركة Stable Diffusion أي حقوق على الصور المُولّدة، وتمنح المستخدمين بحرية حقوق استخدام أي صور مُولّدة من النموذج شريطة ألا يكون محتوى الصورة غير قانوني أو ضارًا بالأفراد. [ 82 ]
تم ترشيح الصور التي تم تدريب نموذج الانتشار المستقر عليها دون تدخل بشري، مما أدى إلى ظهور بعض الصور الضارة وكميات كبيرة من المعلومات الخاصة والحساسة في بيانات التدريب. [ 27 ]
أعرب العديد من الفنانين البصريين التقليديين عن قلقهم من أن الاستخدام الواسع النطاق لبرامج توليف الصور مثل Stable Diffusion قد يؤدي في النهاية إلى فقدان الفنانين البشريين، إلى جانب المصورين الفوتوغرافيين وعارضات الأزياء ومصوري السينما والممثلين، قدرتهم على المنافسة التجارية تدريجياً في مواجهة المنافسين القائمين على الذكاء الاصطناعي. [ 83 ]
يتميز برنامج Stable Diffusion بتساهله الملحوظ في أنواع المحتوى التي يُمكن للمستخدمين إنشاؤها، مثل الصور العنيفة أو ذات المحتوى الجنسي الصريح، مقارنةً بالمنتجات التجارية الأخرى القائمة على الذكاء الاصطناعي التوليدي. [ 84 ] وفي معرض رده على المخاوف من إمكانية استخدام النموذج لأغراض مسيئة، يؤكد عماد مصطفى، الرئيس التنفيذي لشركة Stability AI ، أن "المسؤولية تقع على عاتق الأفراد فيما إذا كانوا ملتزمين بالأخلاق والقانون في استخدامهم لهذه التقنية"، [ 11 ] وأن إتاحة إمكانيات Stable Diffusion للجمهور ستؤدي إلى تحقيق فائدة صافية، على الرغم من العواقب السلبية المحتملة. [ 11 ] إضافةً إلى ذلك، يرى مصطفى أن الهدف من إتاحة Stable Diffusion للجميع هو إنهاء سيطرة الشركات وهيمنتها على هذه التقنيات، والتي اقتصرت سابقًا على تطوير أنظمة ذكاء اصطناعي مغلقة لتوليد الصور. [ 11 ] [ 84 ] ويتجلى ذلك في حقيقة أنه يمكن تجاوز أي قيود يفرضها برنامج Stability AI على المحتوى الذي قد ينشئه المستخدمون بسهولة نظرًا لتوافر شفرة المصدر. [ 85 ]
أثير جدل حول الصور الواقعية ذات الطابع الجنسي لشخصيات قاصرين ، وذلك بسبب مشاركة هذه الصور التي تم إنشاؤها بواسطة Stable Diffusion على مواقع الويب مثل Pixiv . [ 86 ]
في يونيو 2024، تعرض أحد ملحقات ComfyUI ، وهي واجهة مستخدم لـ Stable Diffusion، للاختراق، حيث ادعى المخترقون أنهم استهدفوا المستخدمين الذين ارتكبوا "إحدى خطايانا"، والتي تضمنت توليد الفن بالذكاء الاصطناعي، وسرقة الأعمال الفنية ، والترويج للعملات المشفرة . [ 87 ]
التقاضي
أندرسن، ماكيرنان، وأورتيز ضد ستابيليتي إيه آي، ميدجورني، وديفيان آرت
في يناير 2023، رفعت ثلاث فنانات، هن سارة أندرسن ، وكيلي ماكيرنان ، وكارلا أورتيز، دعوى قضائية بتهمة انتهاك حقوق الطبع والنشر ضد شركات Stability AI و Midjourney و DeviantArt ، مدعيات أن هذه الشركات انتهكت حقوق ملايين الفنانين من خلال تدريب أدوات الذكاء الاصطناعي على خمسة مليارات صورة تم جمعها من الإنترنت دون موافقة الفنانين الأصليين. [ 88 ]
في يوليو 2023، مال قاضي المحكمة الجزئية الأمريكية ويليام أوريك إلى رفض معظم الدعوى التي رفعها أندرسن وماكيرنان وأورتيز، لكنه سمح لهم بتقديم شكوى جديدة، مما أتاح لهم فرصة لإعادة صياغة حججهم. [ 89 ]
صور جيتي ضد الذكاء الاصطناعي للاستقرار
في يناير 2023، رفعت شركة غيتي إيمجز دعوى قضائية ضد شركة ستابيليتي إيه آي أمام المحكمة العليا الإنجليزية، متهمةً إياها بانتهاك حقوق الملكية الفكرية الخاصة بها بشكلٍ جسيم. وتزعم غيتي إيمجز أن ستابيليتي إيه آي "جمعت" ملايين الصور من مواقع غيتي الإلكترونية دون موافقة، واستخدمت هذه الصور لتدريب وتطوير نموذجها للتعلم العميق "الانتشار المستقر". [ 90 ] [ 91 ]
تضمنت النقاط الرئيسية للدعوى القضائية ما يلي:
- أكدت شركة غيتي إيمجز أن تدريب وتطوير برنامج Stable Diffusion تضمن استخدامًا غير مصرح به لصورها، والتي تم تنزيلها على خوادم وأجهزة كمبيوتر يُحتمل وجودها في المملكة المتحدة. ومع ذلك، جادلت شركة Stability AI بأن جميع عمليات التدريب والتطوير تمت خارج المملكة المتحدة، وتحديدًا في مراكز بيانات أمريكية تديرها شركة أمازون ويب سيرفيسز. [ 92 ]
- تقدمت شركة Stability AI بطلب لإصدار حكم موجز عكسي و/أو شطب دعويين: دعوى التدريب والتطوير، ودعوى الانتهاك الثانوي لحقوق التأليف والنشر. إلا أن المحكمة العليا رفضت شطب هاتين الدعويين، مما سمح بمواصلة النظر فيهما. ويتعين على المحكمة تحديد ما إذا كان تدريب وتطوير Stable Diffusion قد تم في المملكة المتحدة، وهو أمر بالغ الأهمية لتحديد الاختصاص القضائي بموجب قانون حقوق التأليف والنشر والتصاميم وبراءات الاختراع لعام 1988 (CDPA) في المملكة المتحدة. [ 93 ]
- تمحورت دعوى الانتهاك الثانوي حول ما إذا كان برنامج Stable Diffusion المدرب مسبقًا، والمتاح في المملكة المتحدة من خلال منصات مثل GitHub وHuggingFace وDreamStudio، يشكل "مادة" بموجب المادتين 22 و23 من قانون حقوق التصميم والتصنيع والتصميم (CDPA). [ 93 ]
اعتبارًا من 4 نوفمبر 2025، خسرت شركة Getty Images إلى حد كبير الدعوى القضائية المتعلقة بمولد الصور بالذكاء الاصطناعي لصالح شركة Stability AI ، مما دفع Getty وبعض المحامين إلى المطالبة بحماية أقوى لأصحاب حقوق الطبع والنشر في بريطانيا. [ 94 ]
رخصة
على عكس نماذج مثل DALL-E ، يُتيح Stable Diffusion شفرة المصدر الخاصة به ، [ 95 ] [ 8 ] إلى جانب النموذج (الأوزان المُدرَّبة مسبقًا). قبل الإصدار الثالث من Stable Diffusion، كان يُطبَّق عليه ترخيص Creative ML OpenRAIL-M، وهو شكل من أشكال ترخيص الذكاء الاصطناعي المسؤول (RAIL). [ 96 ] يحظر هذا الترخيص حالات استخدام مُحدَّدة، بما في ذلك الجريمة ، والتشهير ، والمضايقة ، ونشر المعلومات الشخصية، واستغلال القُصَّر ، وتقديم المشورة الطبية، وإنشاء التزامات قانونية تلقائيًا، وتقديم أدلة قانونية، والتمييز ضد الأفراد أو الجماعات أو إلحاق الضرر بهم بناءً على سلوكهم الاجتماعي أو خصائصهم الشخصية أو خصائصهم أو خصائصهم المحمية قانونًا . [ 97 ] [ 98 ] يمتلك المستخدم حقوق الصور الناتجة عن النموذج، ويحق له استخدامها تجاريًا. [ 99 ]
يستخدم برنامج Stable Diffusion 3.5 رخصة Stability AI Community License المُيسّرة، بينما تحتاج المؤسسات التجارية التي تتجاوز إيراداتها مليون دولار أمريكي إلى رخصة Stability AI Enterprise License. [ 100 ] وكما هو الحال مع رخصة OpenRAIL-M، يحتفظ المستخدم بحقوق الصور الناتجة التي يُنشئها، ويحق له استخدامها تجاريًا. [ 1 ]
انظر أيضاً
مراجع
- 1 2 3 "الانتشار المستقر 3.5" . الذكاء الاصطناعي للاستقرار . تم الاسترجاع في 23 أكتوبر 2024 .
{{cite web}}: CS1 maint: deprecated archiveal service ( link ) - ↑ ريان أوكونور (23 أغسطس 2022). "كيفية تشغيل الانتشار المستقر محليًا لإنشاء الصور" . مؤرشف من الأصل في 13 أكتوبر 2023. تم الاطلاع عليه في 4 مايو 2023 .
- ↑ "Diffuse The Rest - a Hugging Face Space by huggingface" . huggingface.co . مؤرشف من الأصل في 5 سبتمبر 2022. تم الاطلاع عليه في 5 سبتمبر 2022 .
- ↑ "عرض تقديمي مُسرّب يُثير تساؤلات حول عرض شركة Stability AI التقديمي للمستثمرين في جولة التمويل الأولى" . sifted.eu . مؤرشف من الأصل بتاريخ 29 يونيو 2023. تم الاطلاع عليه بتاريخ 20 يونيو 2023 .
- ↑ "إحداث ثورة في توليد الصور بواسطة الذكاء الاصطناعي: تحويل النصوص إلى صور" . www.lmu.de. مؤرشف من الأصل في 17 سبتمبر 2022. تم الاطلاع عليه في 21 يونيو 2023 .
- ↑ مصطفى، عماد (2 نوفمبر 2022). "انتشار مستقر من ابتكار مجموعة أبحاث رؤية الآلة والتعلم (CompVis) في جامعة لودفيغ ماكسيميليان في ميونخ" . تويتر . مؤرشف من الأصل في 20 يوليو 2023. تم الاطلاع عليه في 22 يونيو 2023 .
- ١ ٢ ٣ ٤ "إعلان إطلاق تقنية الانتشار المستقر" . Stability.Ai . مؤرشف من الأصل في ٥ سبتمبر ٢٠٢٢. تم الاطلاع عليه في ٦ سبتمبر ٢٠٢٢ .
- 1 2 3 4 5 6 7 8 9 "مستودع نشر مستقر على GitHub" . CompVis - مجموعة أبحاث رؤية الآلة والتعلم، جامعة لودفيغ ماكسيميليان في ميونخ. 17 سبتمبر 2022. مؤرشف من الأصل في 18 يناير 2023. تم الاطلاع عليه في 17 سبتمبر 2022 .
- ↑ "basujindal/stable-diffusion" . GitHub . ١٦ نوفمبر ٢٠٢٢. مؤرشف من الأصل في ٢٠ مارس ٢٠٢٥. تم الاسترجاع في ٣٠ مارس ٢٠٢٥ .
- ↑ "التطبيق الجديد الرائد: إنشاء فن الذكاء الاصطناعي سيُذهل جهاز الكمبيوتر الخاص بك تمامًا" . PCWorld . مؤرشف من الأصل في 31 أغسطس 2022. تم الاطلاع عليه في 31 أغسطس 2022 .
- 1 2 3 4 5 فينسنت، جيمس (15 سبتمبر 2022). "يمكن لأي شخص استخدام مولد الفن هذا المدعوم بالذكاء الاصطناعي - هذا هو الخطر" . ذا فيرج . مؤرشف من الأصل في 21 يناير 2023. تم الاسترجاع في 30 سبتمبر 2022 .
- ↑ "CompVis/Latent-diffusion" . GitHub .
- ↑ رومباخ؛ إيسر. "توسيع نطاق محولات التدفق المعدلة لتوليف الصور عالية الدقة" (PDF) .
{{cite web}}: CS1 maint: url-status ( link ) - ↑ ديفيد، فوستر. "8. نماذج الانتشار". التعلم العميق التوليدي ( الطبعة الثانية). أورايلي.
- ^ جاشا سوهل-ديكشتاين، إريك أ. فايس، نيرو ماهيسواراناثان، سوريا جانجولي (12 مارس 2015). “التعلم العميق غير الخاضع للرقابة باستخدام الديناميكا الحرارية غير المتوازنة”. أرخايف : 1503.03585 [ cs.LG ].
{{cite arXiv}}: صيانة CS1: أسماء متعددة: قائمة المؤلفين ( رابط ) - ↑ "الصفحة الرئيسية" . مجموعة رؤية الحاسوب والتعلم . تم الاطلاع عليه في 5 سبتمبر 2024 .
- رومباخ ، بلاتمان، لورنز، إيسر، أومر (يونيو 2022). توليف الصور عالية الدقة باستخدام نماذج الانتشار الكامنة (ملف PDF) . المؤتمر الدولي للرؤية الحاسوبية والتعرف على الأنماط (CVPR). نيو أورليانز، لويزيانا. الصفحات 10684-10695 . arXiv : 2112.10752 . مؤرشف (ملف PDF) من الأصل في 20 يناير 2023. تم الاطلاع عليه في 17 سبتمبر 2022 .
- 1 2 3 4 العمار، جاي. "الانتشار المستقر المصور" . jalammar.github.io . مؤرشف من الأصل في 1 نوفمبر 2022. تم الاسترجاع في 31 أكتوبر 2022 .
- ↑ "خطوط انتشار مستقرة" . huggingface.co . مؤرشف من الأصل في 25 يونيو 2023. تم الاطلاع عليه في 22 يونيو 2023 .
- ↑ "توليد الصور من النصوص باستخدام تقنية الانتشار المستقر و OpenVINO™" . openvino.ai . Intel . تم الاطلاع عليه بتاريخ 10 فبراير 2024 .
- 1 2 3 بوديل، داستن؛ إنجلش، زيون؛ لاسي، كايل؛ بلاتمان، أندرياس؛ دوكهورن، تيم؛ مولر، جوناس؛ بينا، جو؛ رومباخ، روبن (4 يوليو 2023). "SDXL: تحسين نماذج الانتشار الكامن لتوليف الصور عالية الدقة". arXiv : 2307.01952 [ cs.CV ].
- 1 2 3 إيسر، باتريك؛ كولال، سوميث؛ بلاتمان، أندرياس؛ إنتزاري، رحيم؛ مولر، جوناس؛ سايني، هاري؛ ليفي، يام؛ لورنز، دومينيك؛ ساوير، أكسل (5 مارس 2024)، توسيع نطاق محولات التدفق المعدل لتوليف الصور عالية الدقة ، arXiv : 2403.03206
- 1 2 ليو، شينغتشاو؛ غونغ، تشنغيو؛ ليو، تشيانغ (7 سبتمبر 2022)، التدفق المستقيم والسريع: تعلم توليد ونقل البيانات باستخدام التدفق المصحح ، arXiv : 2209.03003
- 1 2 "التدفق المُقوَّم - التدفق المُقوَّم" . www.cs.utexas.edu . تم الاطلاع عليه في 6 مارس 2024 .
- 1 2 3 4 5 بايو، آندي (30 أغسطس 2022). "استكشاف 12 مليون صورة من أصل 2.3 مليار صورة استُخدمت لتدريب مُولِّد الصور في خوارزمية الانتشار المستقر" . Waxy.org . مؤرشف من الأصل في 20 يناير 2023. تم الاطلاع عليه في 2 نوفمبر 2022 .
- ↑ «هذا الفنان يهيمن على الفن المُولّد بالذكاء الاصطناعي. وهو غير راضٍ عن ذلك» . مجلة إم آي تي للتكنولوجيا . مؤرشف من الأصل في 14 يناير 2023. تم الاطلاع عليه في 2 نوفمبر 2022 .
- 1 2 برونر، كاتارينا؛ هارلان، إليسا (7 يوليو 2023). "كلنا مادة خام للذكاء الاصطناعي" . إذاعة بافاريا (BR). مؤرشف من الأصل في 12 سبتمبر 2023. تم الاسترجاع في 12 سبتمبر 2023 .
- ↑ شومان، كريستوف (2 نوفمبر 2022)، مُتنبئ درجة الجمال CLIP+MLP ، مؤرشف من الأصل في 8 يونيو 2023 ، تم استرجاعه في 2 نوفمبر 2022
- ↑ "LAION-Aesthetics | LAION" . laion.ai . مؤرشف من الأصل بتاريخ 26 أغسطس 2022. تم الاطلاع عليه بتاريخ 2 سبتمبر 2022 .
- 1 2 3 هو، جوناثان؛ ساليمانس، تيم (25 يوليو 2022). "التوجيه الانتشار بدون مصنف". arXiv : 2207.12598 [ cs.LG ].
- ↑ مصطفى، عماد (28 أغسطس 2022). "تكلفة البناء" . تويتر . مؤرشف من الأصل في 6 سبتمبر 2022. تم الاطلاع عليه في 6 سبتمبر 2022 .
- 1 2 3 "CompVis/stable-diffusion-v1-4 · Hugging Face" . huggingface.co . مؤرشف من الأصل في 11 يناير 2023. تم الاطلاع عليه في 2 نوفمبر 2022 .
- ↑ ويغرز، كايل (12 أغسطس/آب 2022). "شركة ناشئة تسعى إلى إتاحة التكنولوجيا الكامنة وراء DALL-E 2 للجميع، بغض النظر عن العواقب" . تيك كرانش . مؤرشف من الأصل في 19 يناير/كانون الثاني 2023. تم الاطلاع عليه في 2 نوفمبر/تشرين الثاني 2022 .
- 1 2 3 4 5 "توزيع مستقر باستخدام موزعات 🧨" . huggingface.co . مؤرشف من الأصل في 17 يناير 2023. تم الاطلاع عليه في 31 أكتوبر 2022 .
- 1 2 3 "إصدار الانتشار المستقر 2.0" . stability.ai . مؤرشف من الأصل في 10 ديسمبر 2022.
- ↑ "LAION" . laion.ai . مؤرشف من الأصل في 16 أكتوبر 2023. تم الاطلاع عليه في 31 أكتوبر 2022 .
- ↑ "توليد الصور باستخدام الانتشار المستقر" . مدونة بيبر سبيس . 24 أغسطس 2022. مؤرشف من الأصل في 31 أكتوبر 2022. تم الاطلاع عليه في 31 أكتوبر 2022 .
- ↑ "الإعلان عن SDXL 1.0" . Stability AI . مؤرشف من الأصل في 26 يوليو 2023. تم الاطلاع عليه في 21 أغسطس 2023 .
- ↑ إدواردز، بنج (27 يوليو 2023). "شركة Stability AI تُصدر Stable Diffusion XL، نموذجها المتطور لتوليف الصور" . Ars Technica . مؤرشف من الأصل في 21 أغسطس 2023. تم الاطلاع عليه في 21 أغسطس 2023 .
- ↑ "hakurei/waifu-diffusion · Hugging Face" . huggingface.co . مؤرشف من الأصل في 8 أكتوبر 2023. تم الاطلاع عليه في 31 أكتوبر 2022 .
- ↑ شامبون، بيير؛ بلوثجن، كريستيان؛ لانغلوتز، كورتيس ب.؛ تشودري، أكشاي (9 أكتوبر 2022). "تكييف النماذج الأساسية للرؤية واللغة المدربة مسبقًا مع مجالات التصوير الطبي". arXiv : 2210.04133 [ cs.CV ].
- ↑ سيث فورسغرين؛ هايك مارتيروس. "ريفيوجن - نشر مستقر لتوليد الموسيقى في الوقت الفعلي" . ريفيوجن . مؤرشف من الأصل في 16 ديسمبر 2022.
- ↑ ميركوريو، أنتوني (31 أكتوبر 2022)، انتشار الوايفو ، مؤرشف من الأصل في 31 أكتوبر 2022 ، تم استرجاعه في 31 أكتوبر 2022
- ↑ سميث، رايان. "إنفيديا تُطلق بهدوء بطاقة GeForce RTX 3080 بسعة 12 جيجابايت: ذاكرة وصول عشوائي أكبر، وقوة أكبر، وسعر أعلى" . www.anandtech.com . مؤرشف من الأصل في 27 أغسطس 2023. تم الاطلاع عليه في 31 أكتوبر 2022 .
- ↑ ديف جيمس (28 أكتوبر 2022). "لقد أرهقتُ بطاقة RTX 4090 لمدة 8 ساعات متواصلة في تدريب مهارة Stable Diffusion لأرسم مثل عمي هيرمان" . مجلة PC Gamer . مؤرشف من الأصل في 9 نوفمبر 2022.
- ↑ غال، رينون؛ ألالوف، يوفال؛ أتزمون، يوفال؛ باتاشنيك، أور؛ بيرمانو، أميت هـ.؛ تشيك، غال؛ كوهين-أور، دانيال (2 أغسطس 2022). "صورة تساوي كلمة واحدة: تخصيص توليد الصور من النصوص باستخدام الانعكاس النصي". arXiv : 2208.01618 [ cs.CV ].
- ^ "تحسينات NovelAI على الانتشار المستقر" . NovelAI . 11 أكتوبر 2022.
{{cite web}}: CS1 maint: deprecated archiveal service ( link ) - ^ يوكي ياماشيتا (1 سبتمبر 2022). "愛犬の合成画像を生成できるAI 文章で指示するだけでコスプレ 米Googleが開発" . شركة ITmedia Inc. (باللغة اليابانية). مؤرشفة من الأصلي في 31 أغسطس 2022.
- ^ منغ ، تشينلين. هو، يوتونغ؛ سونغ يانغ. سونغ، جيامينغ؛ وو، جياجون؛ تشو، جون يان؛ إرمون ، ستيفانو (2 أغسطس 2021). “SDEdit: تركيب الصور الموجهة وتحريرها باستخدام المعادلات التفاضلية العشوائية”. أرخايف : 2108.01073 [ cs.CV ].
- 1 2 3 4 "واجهة مستخدم ويب مستقرة للانتشار" . جيت هاب . 10 نوفمبر 2022. مؤرشف من الأصل في 20 يناير 2023. تم الاسترجاع في 27 سبتمبر 2022 .
- ↑ علامة مائية غير مرئية ، جبل شيلد، 2 نوفمبر 2022، مؤرشف من الأصل في 18 أكتوبر 2022 ، تم استرجاعه في 2 نوفمبر 2022
- ↑ "stable-diffusion-tools/emphasis at master · JohannesGaessler/stable-diffusion-tools" . GitHub . مؤرشف من الأصل في 2 أكتوبر 2022. تم الاطلاع عليه في 2 نوفمبر 2022 .
- ↑ "تحديثات برنامج Stable Diffusion v2.1 و DreamStudio من 7 إلى 22 ديسمبر" . stability.ai . مؤرشف من الأصل في 10 ديسمبر 2022.
- 1 2 منغ، تشينلين؛ هو، يوتونغ؛ سونغ يانغ. سونغ، جيامينغ؛ وو، جياجون؛ تشو، جون يان؛ إرمون ، ستيفانو (4 يناير 2022). “SDEdit: تركيب الصور الموجهة وتحريرها باستخدام المعادلات التفاضلية العشوائية”. أرخايف : 2108.01073 [ cs.CV ].
- 1 2 لوزي، لورينزو؛ سياكوهي، علي؛ ماير، بول م. كاسكو رودريجيز، خوسيه؛ بارانيوك ، ريتشارد (21 أكتوبر 2022). “بوميرانغ: أخذ العينات المحلية على مجمعات الصور باستخدام نماذج الانتشار”. أرخايف : 2210.12100 [ cs.CV ].
- ↑ بولمان، ماتياس (28 سبتمبر 2022). "ضغط الصور القائم على الانتشار المستقر" . ميديوم . مؤرشف من الأصل في 2 نوفمبر 2022. تم الاسترجاع في 2 نوفمبر 2022 .
- ↑ تشانغ، ليفمين (10 فبراير 2023). "إضافة التحكم الشرطي إلى نماذج انتشار النص إلى الصورة". arXiv : 2302.05543 [ cs.CV ].
- ↑ إدواردز، بنج (10 نوفمبر 2022). "انتشار مستقر في جيبك؟ تطبيق "ارسم الأشياء" يُتيح صور الذكاء الاصطناعي لأجهزة آيفون" . آرس تكنيكا . تم الاطلاع عليه في 10 يوليو 2024 .
- ↑ ويندلينغ، مايك (6 مارس 2024). "يمكن استخدام الذكاء الاصطناعي بسهولة لإنشاء صور انتخابية مزيفة - تقرير" . bbc.com . تم الاطلاع عليه في 10 يوليو 2024. اختبرت مجموعة CCDH، وهي مجموعة حملات، أربعًا من أكبر منصات الذكاء الاصطناعي المتاحة للجمهور: Midjourney، و
ChatGPT Plus من OpenAI، وDreamStudio من Stability.ai، وImage Creator من Microsoft.
- ↑ ويغرز، كايل (18 مايو 2023). "شركة Stability AI تُتيح برنامج تصميمها المدعوم بالذكاء الاصطناعي كمصدر مفتوح" . TechCrunch . تم الاطلاع عليه في 10 يوليو 2024 .
- ↑ ويذربيد، جيس (17 مايو 2023). "شركة Stability AI تُتيح تطبيق DreamStudio الخاص بها كمصدر مفتوح" . ذا فيرج .
- ↑ مان، توبياس (29 يونيو 2024). "دليل مبسط لتوليد الصور باستخدام الذكاء الاصطناعي المحلي مع Stable Diffusion و Automatic1111" . ذا ريجستر .
- ↑ هاشمان، ماك. "Fooocus هي أسهل طريقة لإنشاء فن الذكاء الاصطناعي على جهاز الكمبيوتر الخاص بك" . PCWorld .
- ↑ "سير عمل ComfyUI وما تحتاج إلى معرفته" . thinkdiffusion.com . ديسمبر 2023. تم الاطلاع عليه في 10 يوليو 2024 .
- ↑ "ComfyUI" . github.com . تم الاطلاع عليه في 10 يوليو 2024 .
- ↑ هوانغ، ينكاي (10 مايو 2024). محرك التركيب التلقائي الكامن (رسالة ماجستير في علوم الحاسوب). كلية دارتموث . تم الاطلاع عليه في 10 يوليو 2024 .
- ↑ "CompVis/stable-diffusion-v1-4 · Hugging Face" . huggingface.co . مؤرشف من الأصل بتاريخ 11 يناير 2023. تم الاطلاع عليه بتاريخ 17 أغسطس 2023 .
- ↑ "CompVis (CompVis)" . huggingface.co . 23 أغسطس 2023. تم الاطلاع عليه في 6 مارس 2024 .
- 1 2 "runwayml/stable-diffusion-v1-5 · Hugging Face" . huggingface.co . مؤرشف من الأصل في 21 سبتمبر 2023. تم الاطلاع عليه في 17 أغسطس 2023 .
- ↑ "stable-diffusion-v1-5/stable-diffusion-v1-5 · Hugging Face" . huggingface.co . مؤرشف من الأصل بتاريخ 26 مايو 2025. تم الاطلاع عليه بتاريخ 1 يونيو 2025 .
- 1 2 "stabilityai/stable-diffusion-2 · Hugging Face" . huggingface.co . مؤرشف من الأصل في 21 سبتمبر 2023. تم الاطلاع عليه في 17 أغسطس 2023 .
- ↑ "stabilityai/stable-diffusion-2-base · Hugging Face" . huggingface.co . تم الاطلاع عليه في 1 يناير 2024 .
- ↑ "stabilityai/stable-diffusion-2-1 · Hugging Face" . huggingface.co . مؤرشف من الأصل بتاريخ 21 سبتمبر 2023. تم الاطلاع عليه بتاريخ 17 أغسطس 2023 .
- ↑ "stabilityai/stable-diffusion-xl-base-1.0 · Hugging Face" . huggingface.co . مؤرشف من الأصل بتاريخ 8 أكتوبر 2023. تم الاطلاع عليه بتاريخ 17 أغسطس 2023 .
- ↑ "الإعلان عن SDXL 1.0" . Stability AI . تم الاطلاع عليه في 1 يناير 2024 .
- ↑ "stabilityai/sdxl-turbo · Hugging Face" . huggingface.co . تم الاطلاع عليه في 1 يناير 2024 .
- ↑ "التقطير الانتشاري التنافسي" . الذكاء الاصطناعي المستقر . تم الاسترجاع في 1 يناير 2024 .
- ↑ "الانتشار المستقر 3" . الذكاء الاصطناعي للاستقرار . تم الاسترجاع في 5 مارس 2024 .
- ↑ رادفورد، أليك؛ كيم، جونغ ووك؛ هالاسي، كريس؛ راميش، أديتيا؛ جوه، غابرييل؛ أغاروال، سانديني؛ ساستري، جيريش؛ أسكيل، أماندا؛ ميشكين، باميلا (26 فبراير 2021). "تعلم النماذج البصرية القابلة للنقل من خلال الإشراف على اللغة الطبيعية". arXiv : 2103.00020 [ cs.CV ].
- ↑ رومباخ، روبن؛ بلاتمان، أندرياس؛ لورنز، دومينيك؛ إيسر، باتريك؛ أومر، بيورن (2022). "توليف الصور عالية الدقة باستخدام نماذج الانتشار الكامنة" . وقائع مؤتمر IEEE/CVF حول رؤية الحاسوب والتعرف على الأنماط (CVPR) . الصفحات 10684-10695 . arXiv : 2112.10752 .
- ↑ كيرنر، شون مايكل (19 ديسمبر 2024). "إصدار Diffusion 3.5 المستقر يصل إلى Amazon Bedrock: ما يعنيه ذلك لسير عمل الذكاء الاصطناعي في المؤسسات" . VentureBeat . تم الاطلاع عليه بتاريخ 25 ديسمبر 2024 .
- ↑ "LICENSE.md · stabilityai/stable-diffusion-xl-base-1.0 at main" . huggingface.co . 26 يوليو 2023. تم الاطلاع عليه في 1 يناير 2024 .
- ↑ هيكيلّا، ميليسا (16 سبتمبر 2022). "هذا الفنان يهيمن على الفن المُولّد بالذكاء الاصطناعي. وهو غير راضٍ عن ذلك" . مجلة إم آي تي للتكنولوجيا . مؤرشف من الأصل في 14 يناير 2023. تم الاطلاع عليه في 26 سبتمبر 2022 .
- 1 2 ريو شيميزو (26 أغسطس 2022). "Midjourney を超えた? 無料の作画AI「 #StableDiffusion 」が「AIを民主化した」と断言できる理由" . بيزنس إنسايدر اليابان (باللغة اليابانية). مؤرشفة من الأصلي في 10 ديسمبر 2022 . تم الاسترجاع في 4 أكتوبر 2022 .
- ↑ كاي، كينريك. "الشركة الناشئة التي تقف وراء مولد الصور بالذكاء الاصطناعي، Stable Diffusion، تجري محادثات لجمع تمويل بقيمة تصل إلى مليار دولار" . فوربس . مؤرشف من الأصل في 30 سبتمبر 2023. تم الاطلاع عليه في 31 أكتوبر 2022 .
- ↑ «كشف النقاب عن تجارة غير مشروعة في صور استغلال الأطفال جنسياً باستخدام الذكاء الاصطناعي» . بي بي سي نيوز . ٢٧ يونيو ٢٠٢٣. مؤرشف من الأصل في ٢١ سبتمبر ٢٠٢٣. تم الاطلاع عليه في ٢٦ سبتمبر ٢٠٢٣ .
- ↑ مايبرغ، إيمانويل (11 يونيو 2024). "قراصنة يستهدفون مستخدمي الذكاء الاصطناعي بأداة نشر مستقرة خبيثة على غيت هاب احتجاجًا على "سرقة الأعمال الفنية"" . 404 ميديا . تم الاطلاع عليه في 14 يونيو 2024 .
- ↑ فينسنت، جيمس (16 يناير 2023). "أدوات الذكاء الاصطناعي الفنية Stable Diffusion وMidjourney مستهدفة بدعوى قضائية تتعلق بحقوق النشر" . ذا فيرج . مؤرشف من الأصل في 9 مارس 2023. تم الاطلاع عليه في 16 يناير 2023 .
- ↑ بريتين، بليك (19 يوليو/تموز 2023). "قاضٍ أمريكي يجد ثغرات في دعوى الفنانين ضد شركات الذكاء الاصطناعي" . رويترز . مؤرشف من الأصل في 6 سبتمبر/أيلول 2023. تم الاطلاع عليه في 6 أغسطس/آب 2023 .
- ↑ غوسينز، صوفيا (28 فبراير 2024). "غيتي إيمجز ضد ستابيليتي إيه آي: الآثار المترتبة على قانون حقوق النشر والترخيص في المملكة المتحدة" .
- ↑ جيل، دينيس (11 ديسمبر 2023). "جيتي إيمجز ضد ستابيليتي إيه آي: يمكن أن تصل دعاوى حقوق النشر إلى المحاكمة" .
- ↑ غوسينز، صوفيا (28 فبراير 2024). "قضية غيتي ضد ستابيليتي إيه آي تصل إلى المحاكمة في المملكة المتحدة - ما تعلمناه" .
- 1 2 هيل، شارلوت (16 فبراير 2024). "الذكاء الاصطناعي التوليدي في المحاكم: جيتي إيمجز ضد ستابيليتي إيه آي" .
- ↑ توبين، سام (4 نوفمبر 2025). "شركة غيتي إيمجز تخسر إلى حد كبير دعوى قضائية تاريخية في المملكة المتحدة بشأن مولد الصور بالذكاء الاصطناعي" .
- ↑ "إصدار عام من Stable Diffusion" . Stability.Ai . مؤرشف من الأصل في 30 أغسطس 2022. تم الاطلاع عليه في 31 أغسطس 2022 .
- ↑ "من RAIL إلى Open RAIL: بنى تراخيص RAIL" . تراخيص الذكاء الاصطناعي المسؤولة (RAIL) . ١٨ أغسطس ٢٠٢٢. مؤرشف من الأصل في ٢٧ يوليو ٢٠٢٣. تم الاطلاع عليه في ٢٠ فبراير ٢٠٢٣ .
- ↑ "سواء كنا مستعدين أم لا، فإنّ التزييف العميق للفيديوهات على نطاق واسع قادم" . صحيفة واشنطن بوست . 30 أغسطس/آب 2022. مؤرشف من الأصل في 31 أغسطس/آب 2022. تم الاطلاع عليه في 31 أغسطس/آب 2022 .
- ↑ "الترخيص - مساحة Hugging Face من CompVis" . huggingface.co . مؤرشف من الأصل في 4 سبتمبر 2022. تم الاطلاع عليه في 5 سبتمبر 2022 .
- ^ كاتسو إيشيدا (26 أغسطس 2022). ""الانتشار المستقر"" . شركة اعجاب (باللغة اليابانية). مؤرشفة من الأصلي في 14 نوفمبر 2022 . تم الاسترجاع في 4 أكتوبر 2022 .
- ↑ "رخصة المجتمع" . Stability AI . 5 يوليو 2024. تم الاطلاع عليه في 23 أكتوبر 2024 .
روابط خارجية
- عرض توضيحي للانتشار المستقر
- "مقدمة مرئية خطوة بخطوة لنماذج الانتشار. - مدونة كمال إردم" . تم الاطلاع عليها بتاريخ 31 أغسطس 2024 .
- "شبكة يو للانتشار المستقر" . شبكة يو للانتشار المستقر . تم الاطلاع عليه بتاريخ 31 أغسطس 2024 .
- شرح تفاعلي للانتشار المستقر
- "كلنا مادة خام للذكاء الاصطناعي" : دراسة حول البيانات الحساسة والخاصة في بيانات التدريب على الانتشار المستقر
- تطبيقات برمجيات التعلم العميق
- تحويل النص إلى صورة
- التعلم غير الخاضع للإشراف
- الجدل الفني
- الأعمال المتورطة في جدل الانتحال
- برامج 2022
- الذكاء الاصطناعي التوليدي
- 2022 في مجال الذكاء الاصطناعي
