نموذج تحويل النص إلى صورة

an astronaut riding a horse, by Hiroshigeنموذج تحويل النص إلى صورة ( T2I أو TTI ) هو نموذج تعلم آلي يأخذ مدخلات بلغة طبيعية وينتج صورة مطابقة لهذا الوصف.
بدأ تطوير نماذج تحويل النصوص إلى صور تدريجياً في منتصف العقد الأول من الألفية الثانية، بالتزامن مع بدايات طفرة الذكاء الاصطناعي ، نتيجةً للتقدم المحرز في الشبكات العصبية العميقة . وفي عام 2022، بدأت مخرجات أحدث نماذج تحويل النصوص إلى صور - مثل DALL -E 2 من OpenAI ، و Imagen من Google Brain ، و Stable Diffusion و Midjourney من Stability AI ، وGen-4 من Runway - تُعتبر قريبة من جودة الصور الفوتوغرافية الحقيقية والفنون المرسومة يدوياً .
تُعدّ نماذج تحويل النص إلى صورة نماذج انتشار كامنة بشكل عام ، حيث تُنفّذ عملية الانتشار في فضاء كامن مضغوط بدلاً من فضاء البكسل مباشرةً. ويُستخدم مُشفّر تلقائي (غالباً مُشفّر تلقائي تبايني ) للتحويل بين فضاء البكسل وهذا التمثيل الكامن. تستخدم هذه الأنظمة عادةً نموذج لغة أو نموذج رؤية-لغة مُدرّب مسبقاً لتحويل مُدخل النص إلى تضمين نصي، ونموذج صور توليدي قائم على الانتشار يُنتج صوراً مُشروطة بهذا التضمين. وقد تم تدريب النماذج الأكثر فعالية عموماً على كميات هائلة من بيانات الصور والنصوص المُستخرجة من الإنترنت . [ 1 ]
تاريخ
قبل ظهور التعلم العميق في العقد الثاني من القرن الحادي والعشرين، كانت محاولات بناء نماذج تحويل النصوص إلى صور تقتصر على تجميع الصور المكونة الموجودة، مثل تلك الموجودة في قاعدة بيانات الصور الجاهزة . [ 2 ] [ 3 ]
كانت المهمة العكسية، وهي وصف الصور ، أكثر قابلية للمعالجة، وقد ظهر عدد من نماذج التعلم العميق لوصف الصور قبل نماذج تحويل النص إلى صورة الأولى. [ 4 ]

A stop sign is flying in blue skies.بواسطة AlignDRAW (2015) [ 5 ]2015–2019
A stop sign is flying in blue skiesبواسطة OpenAI's DALL-E 2 (2022)، DALL-E 3 (2023)، وGPT Image 1 (2025)طُرح أول نموذج حديث لتحويل النصوص إلى صور، وهو alignDRAW، عام 2015 من قِبل باحثين من جامعة تورنتو . وقد وسّع alignDRAW بنية DRAW السابقة (التي استخدمت مُشفِّرًا تلقائيًا تباينيًا متكررًا مع آلية انتباه ) لتعتمد على تسلسلات نصية. [ 4 ] كانت الصور التي يُنتجها alignDRAW ذات دقة منخفضة (32×32 بكسل، تم الحصول عليها من خلال تغيير الحجم ) واعتُبرت "منخفضة التنوع". استطاع النموذج التعميم على كائنات غير ممثلة في بيانات التدريب (مثل حافلة مدرسية حمراء)، وتعامل بكفاءة مع عبارات جديدة مثل "إشارة توقف تحلق في سماء زرقاء"، مُظهرًا مخرجات تُشير إلى أنه لم يكن مجرد "حفظ" للبيانات من مجموعة التدريب . [ 4 ] [ 6 ]
في عام ٢٠١٦، كان ريد وأكاتا ويان وآخرون أول من استخدم الشبكات التوليدية التنافسية في مهمة تحويل النصوص إلى صور. [ ٦ ] [ ٧ ] وباستخدام نماذج مُدرَّبة على مجموعات بيانات ضيقة ومُخصصة لمجالات مُحددة، تمكنوا من توليد صور "مقبولة بصريًا" للطيور والزهور من تعليقات نصية مثل "طائر أسود بالكامل بمنقار سميك ومستدير مميز" . أما النموذج المُدرَّب على مجموعة بيانات COCO (الأشياء الشائعة في السياق) الأكثر تنوعًا، فقد أنتج صورًا "مُشجعة من بعيد..."، ولكنها افتقرت إلى التماسك في تفاصيلها. [ ٦ ] وتشمل الأنظمة اللاحقة VQGAN-CLIP، [ ٨ ] وXMC-GAN، وGauGAN2. [ ٩ ]
عقد 2020
كان نظام DALL-E من OpenAI ، وهو نظام تحويل نصي أُعلن عنه في يناير 2021، من أوائل نماذج تحويل النصوص إلى صور التي حظيت باهتمام واسع من الجمهور. [ 10 ] وفي أبريل 2022، كُشف النقاب عن نظام DALL-E 2، وهو نظام قادر على توليد صور أكثر تعقيدًا وواقعية، [ 11 ] تلاه نظام Stable Diffusion الذي طُرح للجمهور في أغسطس 2022. [ 12 ] وفي أغسطس 2022، أتاحت ميزة تخصيص النصوص في تحويل الصور تعليم النموذج مفهومًا جديدًا باستخدام مجموعة صغيرة من صور كائن جديد لم يكن مُدرجًا في مجموعة تدريب النموذج الأساسي. ويتحقق ذلك من خلال عكس النص ، أي إيجاد مصطلح نصي جديد يُطابق هذه الصور. وظهرت نماذج إضافية لتحويل النصوص إلى صور مع Adobe في مارس 2023 ومع Black Forest Labs في أغسطس 2024. [ 13 ]
على غرار نماذج تحويل النصوص إلى صور أخرى، تستطيع منصات تحويل النصوص إلى فيديو المدعومة بنماذج اللغة ، مثل Runway وMake-A-Video [ 14 ] وImagen Video [ 15 ] و Midjourney [ 16 ] وPhenaki [ 17 ] ، توليد مقاطع فيديو من نصوص و/أو نصوص/صور. [ 18 ]
الهندسة المعمارية والتدريب

تم بناء نماذج تحويل النصوص إلى صور باستخدام بنى معمارية متنوعة. يمكن تنفيذ خطوة ترميز النص باستخدام شبكة عصبية متكررة ، مثل شبكة الذاكرة طويلة المدى (LSTM)، على الرغم من أن نماذج المحولات أصبحت خيارًا أكثر شيوعًا. أما بالنسبة لخطوة توليد الصور، فقد كانت الشبكات التوليدية التنافسية الشرطية (GANs) شائعة الاستخدام في البداية. ومنذ عام 2020، أصبحت نماذج الانتشار هي الخيار الأكثر شيوعًا. فبدلاً من تدريب نموذج مباشرةً لإخراج صورة عالية الدقة بناءً على تضمين نصي، تتمثل إحدى التقنيات الشائعة في تدريب نموذج لتوليد صور منخفضة الدقة أو فضاء كامن، واستخدام نموذج أو أكثر من نماذج التعلم العميق المساعدة لتكبيرها أو فك ترميزها، وإضافة التفاصيل الدقيقة.
تُدرَّب نماذج تحويل النص إلى صورة على مجموعات بيانات ضخمة من أزواج (نص، صورة)، والتي غالبًا ما تُجمع من الإنترنت. وقد أعلنت جوجل برين، من خلال نموذج Imagen لعام 2022، عن نتائج إيجابية لاستخدام نموذج لغوي ضخم تم تدريبه بشكل منفصل على مجموعة بيانات نصية فقط (مع تثبيت أوزانه لاحقًا)، وهو ما يُعد خروجًا عن النهج القياسي السابق. [ 19 ]
مجموعات البيانات

يتطلب تدريب نموذج تحويل النص إلى صورة مجموعة بيانات من الصور المقترنة بتعليقات نصية. تُعد مجموعة بيانات COCO إحدى مجموعات البيانات الشائعة الاستخدام لهذا الغرض. أصدرتها مايكروسوفت عام 2014، وتتألف COCO من حوالي 123,000 صورة تُصوّر مجموعة متنوعة من الأشياء، مع خمسة تعليقات لكل صورة، أنشأها مُعلّقون بشريون. في الأصل، كان التركيز الرئيسي لـ COCO على التعرّف على الأشياء والمشاهد في الصور. أما مجموعتا بيانات Oxford-120 Flowers وCUB-200 Birds فهما أصغر حجمًا، إذ تحتوي كل منهما على حوالي 10,000 صورة، وتقتصران على الزهور والطيور على التوالي. يُعتبر تدريب نموذج عالي الجودة لتحويل النص إلى صورة باستخدام هاتين المجموعتين أسهل نظرًا لنطاق موضوعاتهما المحدود. [ 7 ]
تُعدّ LAION-5B واحدة من أكبر مجموعات البيانات المفتوحة لتدريب نماذج تحويل النصوص إلى صور، إذ تحتوي على أكثر من 5 مليارات زوج من الصور والنصوص. وقد أُنشئت هذه المجموعة باستخدام تقنيات استخراج البيانات من مواقع الويب والترشيح التلقائي بناءً على التشابه مع الأعمال الفنية عالية الجودة والصور الفوتوغرافية الاحترافية. ومع ذلك، وبسبب ذلك، فهي تحتوي أيضاً على محتوى مثير للجدل، مما أدى إلى نقاشات حول أخلاقيات استخدامها.
لا تقتصر بعض منصات الذكاء الاصطناعي الحديثة على توليد الصور من النصوص فحسب، بل تقوم أيضاً بإنشاء مجموعات بيانات اصطناعية لتحسين تدريب النماذج وضبطها بدقة. وتساعد مجموعات البيانات هذه على تجنب مشكلات حقوق النشر وتوسيع نطاق تنوع بيانات التدريب. [ 20 ]
تقييم الجودة
يُعدّ تقييم ومقارنة جودة نماذج تحويل النصوص إلى صور مشكلةً تنطوي على تقييم العديد من الخصائص المرغوبة. ومن بين هذه الخصائص، أن تتوافق الصور المُولّدة دلاليًا مع التعليقات النصية المستخدمة في إنشائها. وقد طُوّرت عدة طرق لتقييم هذه الخصائص، بعضها آلي والبعض الآخر يعتمد على التقييم البشري. [ 7 ]
يُعدّ مؤشر Inception Score (IS) مقياسًا خوارزميًا شائعًا لتقييم جودة الصور وتنوعها ، وهو يعتمد على توزيع التصنيفات التي يتنبأ بها نموذج تصنيف الصور Inceptionv3 المُدرَّب مسبقًا عند تطبيقه على عينة من الصور المُولَّدة بواسطة نموذج تحويل النص إلى صورة. يزداد هذا المؤشر عندما يتنبأ نموذج تصنيف الصور بتصنيف واحد باحتمالية عالية، وهو ما يهدف إلى تفضيل الصور المُولَّدة "المميزة". وهناك مقياس شائع آخر هو مسافة Fréchet Inception ، التي تُقارن توزيع الصور المُولَّدة وصور التدريب الحقيقية وفقًا للميزات المُستخرجة بواسطة إحدى الطبقات النهائية لنموذج تصنيف الصور المُدرَّب مسبقًا. [ 7 ]
التأثير والتطبيقات
يتمتع الذكاء الاصطناعي بإمكانية إحداث تحول مجتمعي ، قد يشمل تمكين الهواة من توسيع نطاق أنواع فنية متخصصة غير تجارية (مثل مشتقات السايبربانك كالسولاربانك ) ، وتوفير وسائل ترفيه مبتكرة، وتطوير نماذج أولية سريعة، [ 21 ] وزيادة إمكانية الوصول إلى صناعة الفن، [ 21 ] وتحسين الإنتاجية الفنية مقابل الجهد أو النفقات أو الوقت [ 21 ] - على سبيل المثال، من خلال إنشاء مسودات، وتعريفات للمسودات، ومكونات الصور ( التلوين ). تُستخدم الصور المُنشأة أحيانًا كرسومات تخطيطية، [ 22 ] أو تجارب منخفضة التكلفة، [ 23 ] أو كمصدر إلهام، أو كأمثلة توضيحية لأفكار في مرحلة إثبات المفهوم . قد تتعلق وظائف أو تحسينات إضافية أيضًا بالتحرير اليدوي بعد الإنشاء (أي الصقل)، مثل إجراء تعديلات لاحقة باستخدام محرر صور. [ 23 ]
يستخدم الفنانون والمصممون البصريون المحترفون الذكاء الاصطناعي التوليدي في المراحل الأولى من وضع المفاهيم (التفكير التبايني) أكثر من استخدامه في الإنتاج النهائي (التفكير التقاربي)، كما أن الممارسات التي تُنتج مخرجات رقمية أو مؤقتة (مثل تصميم واجهة المستخدم/تجربة المستخدم، والفن المفاهيمي) تُدمج هذه التقنيات بسهولة أكبر من تلك التي تُنتج أعمالًا مادية دائمة (مثل النحت، والهندسة المعمارية). [ 24 ] في المجالات المادية، غالبًا ما تحدّ المخاوف المتعلقة بالسلامة الهيكلية، وقيود المواد، و"الحوسبة الإثنية" الثقافية من دور الذكاء الاصطناعي ليقتصر على دور "التحسين التكميلي" بدلًا من كونه بديلًا للإنتاج. [ 25 ] علاوة على ذلك، تختلف المواقف تجاه تبني الذكاء الاصطناعي اختلافًا كبيرًا باختلاف المرحلة المهنية، حيث ينظر المحترفون المبتدئون إلى الذكاء الاصطناعي التوليدي على أنه امتداد عملي للأدوات الرقمية الضرورية للتنافسية في السوق، بينما يُبدي الممارسون ذوو الخبرة غالبًا شكوكًا نقدية بشأن انخفاض قيمة الخبرة المتجسدة وتطوير المهارات على المدى الطويل. [ 24 ]
قائمة نماذج تحويل النصوص إلى صور بارزة
| اسم | تاريخ الافراج عنه | مطور | رخصة |
|---|---|---|---|
| دال-إي | يناير 2021 | أوبن إيه آي | ملكية خاصة |
| دال-إي 2 | أبريل 2022 | ||
| دال-إي 3 | سبتمبر 2023 | ||
| صورة GPT 1 | مارس 2025 [ ملاحظة 1 ] | ||
| صورة GPT 1.5 | ديسمبر 2025 | ||
| صورة GPT 2 | أبريل 2026 | ||
| الرسم التخطيطي 0.1 | أغسطس 2023 | الأ يديوغرام صورة | |
| أيدوجرام 2.0 | أغسطس 2024 | ||
| أيدوجرام 3.0 | مارس 2025 | ||
| أيدوجرام 4.0 | يونيو 2026 | رخصة أباتشي | |
| صورة | أبريل 2023 | جوجل | ملكية خاصة |
| الصورة 2 | ديسمبر 2023 [ 27 ] | ||
| الصورة 3 | مايو 2024 | ||
| الصورة 4 | مايو 2025 | ||
| يراعة | مارس 2023 | شركة أدوبي | |
| منتصف الرحلة | يوليو 2022 | شركة ميدجورني | |
| هلال | مارس 2025 | شركة Reve AI | |
| الانتشار المستقر | أغسطس 2022 | استقرار الذكاء الاصطناعي | رخصة مجتمع الذكاء الاصطناعي للاستقرار [ ملاحظة 2 ] |
| تدفق | أغسطس 2024 | مختبرات الغابة السوداء | رخصة أباتشي [ ملاحظة 3 ] |
| أورورا | ديسمبر 2024 | xAI | ملكية خاصة |
| المدرج من الجيل الثاني | يونيو 2023 | شركة Runway AI | |
| المدرج من الجيل الثالث ألفا | يونيو 2024 | ||
| هياكل المدرج | نوفمبر 2024 | ||
| المدرج من الجيل الرابع | مارس 2025 | ||
| إعادة صياغة | مايو 2023 | شركة ريكرافت | |
| أورافلو | يوليو 2024 | فال | رخصة أباتشي |
| هاي دريم | أبريل 2025 | هاي دريم-الذكاء الاصطناعي | رخصة MIT |
ملاحظات توضيحية
- ↑ في البداية كان يشار إليه باسم توليد الصور GPT-4o [ 26 ]
- ↑ يمكن استخدام هذه الرخصة من قبل الأفراد والمؤسسات التي لا تتجاوز إيراداتها مليون دولار أمريكي، أما المؤسسات التي تتجاوز إيراداتها السنوية مليون دولار أمريكي، فتحتاج إلى رخصة Stability AI Enterprise. ويحتفظ المستخدمون بجميع المخرجات بغض النظر عن حجم إيراداتهم.
- ↑ بالنسبة لنموذج Schnell، يستخدم نموذج Dev ترخيصًا غير تجاري بينما نموذج Pro مملوك (متاح فقط كواجهة برمجة تطبيقات ).
انظر أيضاً
مراجع
- ↑ فينسنت، جيمس (24 مايو 2022). "جميع هذه الصور تم إنشاؤها بواسطة أحدث تقنيات الذكاء الاصطناعي لتحويل النصوص إلى صور من جوجل" . ذا فيرج . فوكس ميديا. مؤرشف من الأصل في 15 فبراير 2023. تم الاطلاع عليه في 28 مايو 2022 .
- ↑ أنييز، خورخي؛ هيريرا، جوناثان؛ تاو، هايتشنغ؛ تشو، شينغكوان (أكتوبر 2019)، مسح وتصنيف للشبكات العصبية التنافسية لتوليف الصور من النصوص ، arXiv : 1910.09399
- ↑ تشو، شياوجين؛ غولدبيرغ، أندرو ب.؛ الداوي، محمد؛ داير، تشارلز ر.؛ ستروك، برادلي (2007). "نظام توليف نصي للصور لتعزيز التواصل" (ملف PDF) . AAAI . 7 : 1590-1595 . مؤرشف (ملف PDF) من الأصل في 7 سبتمبر 2022. تم الاطلاع عليه في 7 سبتمبر 2022 .
- 1 2 3 مانسيموف، إلمان؛ باريسوتو، إميليو؛ لي با، جيمي؛ سالاخوتدينوف، روسلان (نوفمبر 2015). "توليد الصور من التعليقات باستخدام الانتباه". ICLR . arXiv : 1511.02793 .
- ↑ مانسيموف، إلمان؛ باريسوتو، إميليو؛ با، جيمي لي؛ سالاخوتدينوف، روسلان (29 فبراير 2016). "توليد الصور من التعليقات باستخدام الانتباه". المؤتمر الدولي حول تمثيلات التعلم . arXiv : 1511.02793 .
- ريد ، سكوت؛ أكاتا، زينب؛ لوغيسواران، لاجانوجين؛ شيل، بيرنت؛ لي، هونغلاك (يونيو 2016). " توليف الصور من النصوص باستخدام الخصومة التوليدية" (ملف PDF) . المؤتمر الدولي للتعلم الآلي . arXiv : 1605.05396 . مؤرشف (PDF) من الأصل في 16 مارس 2023. تم الاطلاع عليه في 7 سبتمبر 2022 .
- 1 2 3 4 فرولوف، ستانيسلاف؛ هينز، توبياس؛ راو، فيديريكو؛ هيس، يورن؛ دينجل، أندرياس (ديسمبر 2021). " توليف الصور من النصوص باستخدام أساليب الخصومة: مراجعة" . الشبكات العصبية . 144 : 187-209 . arXiv : 2101.09983 . doi : 10.1016/j.neunet.2021.07.019 . PMID 34500257. S2CID 231698782 .
- ↑ رودريغيز، خيسوس (27 سبتمبر 2022). "🌅 Edge#229: VQGAN + CLIP" . theseequence.substack.com . مؤرشف من الأصل في 4 ديسمبر 2022. تم الاطلاع عليه في 10 أكتوبر 2022 .
- ↑ رودريغيز، خيسوس (4 أكتوبر 2022). "🎆🌆 Edge#231: توليف الصور من النصوص باستخدام الشبكات التوليدية الخصومية" . thesequence.substack.com . مؤرشف من الأصل في 4 ديسمبر 2022. تم الاطلاع عليه في 10 أكتوبر 2022 .
- ↑ كولدوي، ديفين (5 يناير 2021). "يُنشئ برنامج DALL-E من OpenAI صورًا واقعية لأي شيء تطلبه منه حرفيًا" . TechCrunch . مؤرشف من الأصل في 6 يناير 2021. تم الاطلاع عليه في 7 سبتمبر 2022 .
- ↑ كولدوي، ديفين (6 أبريل 2022). "نموذج DALL-E الجديد من OpenAI يرسم أي شيء - ولكن بشكل أكبر وأفضل وأسرع من ذي قبل" . TechCrunch . مؤرشف من الأصل في 6 مايو 2023. تم الاطلاع عليه في 7 سبتمبر 2022 .
- ↑ "إصدار عام من Stable Diffusion" . Stability.Ai . مؤرشف من الأصل في 30 أغسطس 2022. تم الاطلاع عليه في 27 أكتوبر 2022 .
- ↑ إدواردز، بنج (2 أغسطس 2024). "FLUX: مولد الصور الجديد هذا بتقنية الذكاء الاصطناعي بارع بشكل غريب في إنشاء أيادي بشرية" . آرس تكنيكا . تم الاطلاع عليه في 7 مارس 2026 .
- ↑ كومار، أشيش (3 أكتوبر 2022). "ميتا إيه آي تُطلق 'اصنع فيديو': نظام ذكاء اصطناعي يُنشئ مقاطع فيديو من النصوص" . مارك تك بوست . مؤرشف من الأصل في 1 ديسمبر 2022. تم الاطلاع عليه في 3 أكتوبر 2022 .
- ↑ إدواردز، بنج (5 أكتوبر 2022). "أحدث مولد ذكاء اصطناعي من جوجل يُنشئ فيديو عالي الدقة من نصوص مُدخلة" . آرس تكنيكا . مؤرشف من الأصل في 7 فبراير 2023. تم الاطلاع عليه في 25 أكتوبر 2022 .
- ↑ رودريغيز، خيسوس (25 أكتوبر 2022). "🎨 Edge#237: ما هي رحلة المنتصف؟" . theseequence.substack.com . مؤرشف من الأصل في 4 ديسمبر 2022. تم الاطلاع عليه في 26 أكتوبر 2022 .
- ↑ "فيناكي" . phenaki.video . مؤرشف من الأصل في 7 أكتوبر 2022. تم الاطلاع عليه في 3 أكتوبر 2022 .
- ↑ إدواردز، بنج (9 سبتمبر 2022). "موقع Runway يُشوق لتقنية تحرير الفيديو باستخدام الذكاء الاصطناعي عبر النصوص المكتوبة" . آرس تكنيكا. مؤرشف من الأصل في 27 يناير 2023. تم الاطلاع عليه في 12 سبتمبر 2022 .
- ^ الصحراء، شيتوان. تشان، وليام. ساكسينا، سوراب. لي، لالا؛ وانغ، جاي. دينتون، إميلي؛ كاميار سيد قاسمي بور، سيد؛ كاراجول أيان، بورجو؛ سارة مهدوي، س.؛ جونتيجو لوبيز، رافا؛ سالمانز، تيم؛ هو جوناثان. جي فليت، ديفيد؛ نوروزي ، محمد (23 مايو 2022). “نماذج نشر النص إلى الصورة الواقعية مع الفهم العميق للغة”. أرخايف : 2205.11487 [ cs.CV ].
- ↑ مارتن (29 يناير 2025). "توليد النصوص والصور باستخدام الذكاء الاصطناعي" . نقاش .
- 1 2 3 إلغان، مايك (1 نوفمبر 2022). "كيف ستُغير 'الوسائط الاصطناعية' عالم الأعمال إلى الأبد" . كمبيوتر وورلد . مؤرشف من الأصل في 10 فبراير 2023. تم الاطلاع عليه في 9 نوفمبر 2022 .
- ↑ روز، كيفن (21 أكتوبر 2022). "الفن المُولّد بالذكاء الاصطناعي يُحدث تحولاً في العمل الإبداعي" . صحيفة نيويورك تايمز . مؤرشف من الأصل في 15 فبراير 2023. تم الاطلاع عليه في 16 نوفمبر 2022 .
- 1 2 ليسوينغ، كيف. "لماذا يشعر وادي السيليكون بهذا الحماس تجاه الرسومات الغريبة التي يرسمها الذكاء الاصطناعي؟" . سي إن بي سي. مؤرشف من الأصل في 8 فبراير 2023. تم الاطلاع عليه في 16 نوفمبر 2022 .
- 1 2 تساو، جاك؛ ليانغ، سيندي شين يي؛ نوغيس، كولير؛ وونغ، أليس (2026). "تصورات وتكامل الذكاء الاصطناعي التوليدي في الممارسات والصناعات الإبداعية: مراجعة شاملة ونموذج مفاهيمي" . الذكاء الاصطناعي والمجتمع . 41 (3): 2259-2278 . doi : 10.1007/s00146-025-02667-2 .
- ↑ رونكوروني، يو إل؛ كروس دي فالونغ، في؛ سنتوريون بولانوس، أو. (2024). "قضايا الإبداع الحسابي في التصميم التوليدي والتصنيع الرقمي للشبكات ثلاثية الأبعاد المعقدة" . المجلة الدولية للحوسبة المعمارية . 23 (2): 582-600 . doi : 10.1177/14780771241260850 .
- ↑ "تقديم تقنية توليد الصور من الدرجة الرابعة" . OpenAI . 25 مارس 2025. تم الاطلاع عليه في 27 مارس 2025 .
- ↑ "أصبحت تقنية Imagen 2 على منصة Vertex AI متاحة الآن للجميع" . مدونة جوجل كلاود . مؤرشفة من الأصل بتاريخ 21 فبراير 2024. تم الاطلاع عليها بتاريخ 2 يناير 2024 .
- تحويل النص إلى صورة
