نموذج تحويل النص إلى فيديو
يُعدّ نموذج تحويل النص إلى فيديو شكلاً من أشكال الذكاء الاصطناعي التوليدي ، حيث يستخدم وصفًا باللغة الطبيعية كمدخل لإنتاج فيديو ذي صلة بالنص المُدخل. [ 1 ] وقد كان تطوير نماذج نشر الفيديو من أهم العوامل التي ساهمت في التطورات التي شهدها العقد الحالي في مجال إنتاج مقاطع الفيديو عالية الجودة والمُعتمدة على النصوص . [ 2 ]
نماذج
توجد نماذج مختلفة، بما في ذلك نماذج مفتوحة المصدر . يُعدّ CogVideo، الذي يدعم إدخال اللغة الصينية [ 3 ]، أول نموذج لتحويل النص إلى فيديو "يحتوي على 9.4 مليار مُعامل"، وقد عُرضت نسخته التجريبية مفتوحة المصدر لأول مرة على GitHub في عام 2022. [ 4 ] في ذلك العام، أصدرت Meta Platforms نموذجًا جزئيًا لتحويل النص إلى فيديو يُسمى "Make-A-Video"، [ 5 ] [ 6 ] [ 7 ] وقدّم فريق Google Brain ( الذي أصبح لاحقًا Google DeepMind ) نموذج Imagen Video، وهو نموذج لتحويل النص إلى فيديو باستخدام شبكة U-Net ثلاثية الأبعاد . [ 8 ] [ 6 ] [ 9 ] [ 10 ] [ 11 ]
2023
في فبراير 2023، أطلقت شركة Runway الجيلين الأول والثاني من برنامجها، وهما من أوائل البرامج المتاحة تجاريًا لتحويل النصوص إلى فيديوهات والفيديوهات إلى فيديوهات، والتي يمكن للجمهور الوصول إليها عبر واجهة ويب. سمح الجيل الأول، الذي أُطلق في البداية كبرنامج لتحويل الفيديوهات إلى فيديوهات، للمستخدمين بتحويل لقطات الفيديو الموجودة باستخدام نصوص أو صور. [ 12 ] أما الجيل الثاني، الذي طُرح في مارس 2023 وأُتيح للجمهور في يونيو 2023، فقد أضاف ميزة تحويل النصوص إلى فيديوهات، مما مكّن المستخدمين من إنشاء فيديوهات من نصوص فقط. [ 13 ]
في مارس 2023، نُشرت ورقة بحثية بعنوان "VideoFusion: نماذج الانتشار المُفككة لإنتاج فيديو عالي الجودة"، تُقدم نهجًا جديدًا لإنتاج الفيديو. يُفكك نموذج VideoFusion عملية الانتشار إلى مُكونين: الضوضاء الأساسية والضوضاء المتبقية، واللذان يتشاركان بين الإطارات لضمان التماسك الزمني. وباستخدام نموذج انتشار صور مُدرب مُسبقًا كمولد أساسي، أنتج النموذج بكفاءة مقاطع فيديو عالية الجودة ومتماسكة. وقد ساهم ضبط النموذج المُدرب مُسبقًا على بيانات الفيديو في سد الفجوة بين بيانات الصور والفيديو، مما عزز قدرة النموذج على إنتاج تسلسلات فيديو واقعية ومتسقة. [ 14 ] وفي الشهر نفسه، قدمت Adobe تقنية Firefly AI كجزء من ميزاتها. [ 15 ]
2024
في يناير 2024، أعلنت جوجل عن تطوير نموذج لتحويل النصوص إلى فيديوهات باسم "لوميير"، والذي من المتوقع أن يدمج إمكانيات متقدمة لتحرير الفيديو. [ 16 ] يعمل ماتياس نيسنر ولوردس أغابيتو في شركة الذكاء الاصطناعي "سينثيسيا" على تطوير تقنيات عرض عصبي ثلاثي الأبعاد قادرة على توليد فيديوهات واقعية باستخدام تمثيلات عصبية ثنائية وثلاثية الأبعاد للشكل والمظهر والحركة، وذلك لتوليد فيديوهات قابلة للتحكم لشخصيات الأفاتار. [ 17 ] في يونيو 2024، أطلقت "لوما لابز" أداة الفيديو " دريم ماشين" . [ 18 ] [ 19 ] في الشهر نفسه، [ 20 ] وسّعت "كوايشو " نطاق نموذج "كلينغ إيه آي" لتحويل النصوص إلى فيديوهات ليشمل المستخدمين الدوليين. في يوليو 2024، أطلقت "بايت دانس"، المالكة لتطبيق "تيك توك" ، برنامج "جيمينغ إيه آي" في الصين، من خلال شركتها التابعة "فيسو تكنولوجي". [ ٢١ ] بحلول سبتمبر ٢٠٢٤، أطلقت شركة الذكاء الاصطناعي الصينية MiniMax نموذجها video-01، لتنضم بذلك إلى شركات أخرى رائدة في مجال نماذج الذكاء الاصطناعي مثل Zhipu AI و Baicuan و Moonshot AI ، مما يُسهم في تعزيز مشاركة الصين في تكنولوجيا الذكاء الاصطناعي. [ ٢٢ ] وفي ديسمبر ٢٠٢٤، أطلقت شركة Lightricks نموذج LTX Video كنموذج مفتوح المصدر. [ ٢٣ ]
2025
تشمل الأساليب البديلة لنماذج تحويل النص إلى فيديو [ 24 ] نماذج Phenaki وHour One و Colossyan من جوجل [ 3 ] ، وGen-3 Alpha من Runway [ 25 ] [ 26 ] ، و Sora من OpenAI [ 27 ] [ 28 ] . وقد ظهرت عدة نماذج إضافية لتحويل النص إلى فيديو، مثل Plug-and-Play وText2LIVE وTuneAVideo [ 29 ] . وأعلنت شركة Black Forest Labs، مطورة FLUX.1، عن أحدث نموذج لتحويل النص إلى فيديو [ 30 ] . وكانت جوجل تستعد لإطلاق أداة Veo لإنشاء مقاطع فيديو قصيرة على يوتيوب في عام 2025 [ 31 ] . وفي مايو 2025، أطلقت جوجل الإصدار الثالث من Veo، والذي تميز بقدراته المذهلة في توليد الصوت، والتي كانت تمثل قيدًا سابقًا لنماذج تحويل النص إلى فيديو. [ 32 ] في يوليو 2025، أصدرت شركة Lightricks تحديثًا لبرنامج LTX Video قادرًا على إنشاء مقاطع فيديو تصل مدتها إلى 60 ثانية، [ 33 ] [ 34 ] وفي أكتوبر 2025 أصدرت LTX-2، مع إمكانيات صوتية مدمجة. [ 35 ]
2026
في فبراير 2026، أطلقت شركة بايت دانس برنامج سيدانس 2.0 ، الذي اشتهر بواقعيته المذهلة في توليد المشاهد، والتحكم في الحركة والكاميرا، وقدرته على توليد المشاهد في 15 ثانية، [ 36 ] إلا أن البرنامج واجه انتقادات لاذعة من جمعية الفيلم السينمائي لانتهاكه حقوق الملكية الفكرية. [ 37 ] بعد مشاهدة مقطع فيديو انتشر على نطاق واسع لمشاجرة بين الممثلين براد بيت وتوم كروز ، أعلن ريت ريس ، كاتب سيناريو فيلمي ديدبول وولفرين وزومبي لاند ، على وسائل التواصل الاجتماعي: "أكره قول ذلك، لكن يبدو أن الأمر قد انتهى بالنسبة لنا"، [ 38 ] وأضاف: "في وقت قريب جدًا، سيتمكن أي شخص من الجلوس أمام جهاز كمبيوتر وإنشاء فيلم لا يمكن تمييزه عما تُنتجه هوليوود حاليًا". [ 37 ]
في يوليو 2026، أطلقت شركة ByteDance برنامج Seedance 2.5، وهو أحدث إصدار من برنامج تحويل النصوص إلى فيديوهات، حيث أصبح بإمكانه الآن إنشاء فيديوهات أصلية مدتها 30 ثانية باستخدام 50 مرجعًا متعدد الوسائط كمدخلات. وتشمل الميزات الرئيسية الأخرى فيديوهات بدقة 4K وإمكانية التحرير المحلي، فبدلاً من إعادة إنشاء مقطع كامل مدته 30 ثانية إذا كان هناك خطأ في أحد التفاصيل (مثل لون شعر الشخصية)، يمكن للمستخدمين الآن تعديل مناطق محددة داخل المشهد لتصحيحه. وهذا يمنع فقدان الأداء التمثيلي المفضل، أو تعابير الوجه، أو الإضاءة التي تم ضبطها في اللقطة الأصلية. [ 39 ] كما يتضمن Seedance 2.5 وضعًا تجريبيًا للفيديوهات الطويلة، حيث يمتد طول المقاطع إلى 3 دقائق. [ 40 ]
الهندسة المعمارية والتدريب
توجد عدة بنى معمارية استُخدمت لإنشاء نماذج تحويل النصوص إلى فيديو. وكما هو الحال في نماذج تحويل النصوص إلى صور ، يمكن تدريب هذه النماذج باستخدام الشبكات العصبية المتكررة (RNNs)، مثل شبكات الذاكرة طويلة المدى (LSTM)، والتي استُخدمت في نماذج تحويل البكسل ونماذج توليد الفيديو العشوائي، مما يُسهم في تحقيق الاتساق والواقعية على التوالي. [ 41 ] ومن البدائل لهذه النماذج نماذج المحولات. كما استُخدمت الشبكات التوليدية التنافسية (GANs) والمشفرات التلقائية المتغيرة (VAEs)، التي تُساعد في التنبؤ بحركة الإنسان [ 42 ] ، ونماذج الانتشار لتطوير جوانب توليد الصور في النموذج. [ 43 ]
تشمل مجموعات بيانات الفيديو النصية المستخدمة لتدريب النماذج، على سبيل المثال لا الحصر، WebVid-10M وHDVILA-100M وCCV وActivityNet وPanda-70M. تحتوي هذه المجموعات على ملايين مقاطع الفيديو الأصلية ذات الصلة، ومقاطع الفيديو المُولّدة، ومقاطع الفيديو المُترجمة، والمعلومات النصية التي تُساعد في تدريب النماذج لضمان دقتها. وتشمل مجموعات بيانات الفيديو النصية المستخدمة لتدريب النماذج، على سبيل المثال لا الحصر، PromptSource وDiffusionDB وVidProM. [ 44 ] [ 45 ] توفر هذه المجموعات نطاقًا واسعًا من المدخلات النصية اللازمة لتعليم النماذج كيفية تفسير مجموعة متنوعة من النصوص.
تتضمن عملية توليد الفيديو مزامنة المدخلات النصية مع إطارات الفيديو، مما يضمن التوافق والاتساق طوال التسلسل. وتتعرض هذه العملية التنبؤية لانخفاض في الجودة مع ازدياد طول الفيديو بسبب محدودية الموارد. [ 45 ] يُعد اختبار ويل سميث وهو يأكل السباغيتي معيارًا لتقييم النماذج. [ 46 ]
القيود
على الرغم من التطور السريع لنماذج تحويل النصوص إلى فيديوهات من حيث الأداء، إلا أن أحد أبرز عيوبها هو استهلاكها الكبير للموارد الحاسوبية، مما يحد من قدرتها على توفير مخرجات عالية الجودة وطويلة. إضافةً إلى ذلك، تتطلب هذه النماذج كمية كبيرة من بيانات التدريب المتخصصة لإنتاج مخرجات عالية الجودة ومتسقة، الأمر الذي يثير مشكلة إمكانية الوصول إليها. [ 43 ] [ 41 ]
علاوة على ذلك، قد تُسيء النماذج تفسير التوجيهات النصية، مما ينتج عنه مخرجات فيديو تختلف عن المعنى المقصود. قد يحدث هذا بسبب قصور في استيعاب السياق الدلالي المُضمّن في النص، مما يؤثر على قدرة النموذج على مواءمة الفيديو المُولّد مع رسالة المستخدم المقصودة. [ 43 ] [ 45 ] تُجرى حاليًا اختبارات وتحسينات على نماذج مختلفة، بما في ذلك Make-A-Video وImagen Video وPhenaki وCogVideo وGODIVA وNUWA، لتعزيز قدراتها على المواءمة وأدائها العام في توليد الفيديو من النصوص. [ 43 ]
تتمثل إحدى المشكلات الأخرى في مخرجات هذه التقنية في أن النصوص أو التفاصيل الدقيقة في مقاطع الفيديو التي يُنشئها الذكاء الاصطناعي غالباً ما تظهر مشوهة، وهي مشكلة تعاني منها أيضاً نماذج الانتشار المستقر . ومن الأمثلة على ذلك تشوه الأيدي وعدم إمكانية قراءة النصوص.
أخلاق مهنية
يثير استخدام نماذج تحويل النصوص إلى فيديوهات اعتبارات أخلاقية تتعلق بإنتاج المحتوى. إذ تمتلك هذه النماذج القدرة على إنشاء محتوى غير لائق أو غير مصرح به، بما في ذلك مواد إباحية، وعنف صريح، ومعلومات مضللة، وصور لأشخاص حقيقيين دون موافقتهم. ومن الضروري ضمان امتثال المحتوى المُولّد بواسطة الذكاء الاصطناعي للمعايير المعمول بها للاستخدام الآمن والأخلاقي، حيث قد لا يكون من السهل دائمًا تحديد المحتوى الذي تُنتجه هذه النماذج على أنه ضار أو مُضلل. ولا تزال قدرة الذكاء الاصطناعي على التعرف على المحتوى غير اللائق أو المحمي بحقوق الطبع والنشر وتصفيته تحديًا مستمرًا، وله آثار على كل من المُبدعين والجمهور. [ 44 ]
التأثيرات والتطبيقات
تُقدّم نماذج تحويل النصوص إلى فيديوهات مجموعة واسعة من التطبيقات التي قد تُفيد مجالاتٍ مُختلفة، من التعليم والترويج إلى الصناعات الإبداعية. تُسهّل هذه النماذج عملية إنشاء المحتوى لمقاطع الفيديو التدريبية، ومعاينات الأفلام، وأصول الألعاب، والعروض المرئية، مما يُسهّل إنتاج المحتوى. [ 43 ]
خلال الحرب الروسية الأوكرانية ، تم إنتاج مقاطع فيديو مزيفة باستخدام الذكاء الاصطناعي كجزء من حرب دعائية ضد أوكرانيا ، ونُشرت على وسائل التواصل الاجتماعي . تضمنت هذه المقاطع صورًا لأطفال في القوات المسلحة الأوكرانية ، وإعلانات مزيفة تستهدف الأطفال وتحثهم على التنديد بمنتقدي الحكومة الأوكرانية ، وتصريحات ملفقة منسوبة إلى الرئيس الأوكراني فولوديمير زيلينسكي حول استسلام البلاد، وغيرها. [ 47 ] [ 48 ] [ 49 ] [ 50 ] [ 51 ] [ 52 ]
أفلام
فيلم Kaur vs Kore هو أول فيلم روائي هندي تم إنتاجه باستخدام الذكاء الاصطناعي التوليدي ، ويضم دورين لشخصية الذكاء الاصطناعي التي تجسدها ساني ليون ، ومن المقرر عرضه في عام 2026. [ 53 ] [ 54 ] [ 55 ]
فيلم "شيرانجيفي هانومان - الخالد" هو فيلم هندي تم إنتاجه بالكامل باستخدام الذكاء الاصطناعي التوليدي ، من ابتكار فيجاي سوبرامانيام، ومن المقرر عرضه في دور السينما عام 2026. وقد تعرض الفيلم لانتقادات واسعة من قبل صناع السينما في بوليوود لاعتماده الكامل على الذكاء الاصطناعي، حيث اعتبروا استخدامه تهديدًا وجوديًا لمسيرتهم المهنية. [ 56 ] [ 57 ] [ 58 ]
مسلسل
مسلسل "مهابهاراتا: إيك دارمايود" هو مسلسل هندي أسطوري يُعرض عبر الإنترنت، وقد صدر في أكتوبر 2025 ويُبث على منصة JioHotstar . يُعتبر هذا المسلسل الأول من نوعه الذي تم إنشاؤه بالكامل باستخدام الذكاء الاصطناعي لتوليد الصور والرسوم المتحركة للشخصيات، ويتكون من 100 حلقة. [ 59 ] [ 60 ] [ 61 ]
كرافت (1979) هي سلسلة خيال مظلم من إنتاج الذكاء الاصطناعي للعبة ماينكرافت، صدرت في يونيو 2026، من ابتكار المستخدم LatentDiffusion باستخدام محرك Seedance 2.0 . لاقت السلسلة استحسانًا واسعًا على الإنترنت لنجاحها في تجسيد مشاعر وتجارب من لعبوا ماينكرافت لأول مرة في قالب سردي، حيث ذكر العديد من المستخدمين أن السلسلة أفضل من الفيلم الرسمي لعام 2025. [ 62 ]
مقارنة النماذج
| النموذج/المنتج | شركة | سنة الإصدار | حالة | الميزات الرئيسية | القدرات | التسعير | مدة الفيديو | اللغات المدعومة |
|---|---|---|---|---|---|---|---|---|
| سينثيسيا | سينثيسيا | 2019 | مطلق سراحه | صور رمزية مدعومة بالذكاء الاصطناعي، ودعم متعدد اللغات لأكثر من 60 لغة، وخيارات تخصيص [ 63 ] | متخصصون في تصميم صور رمزية واقعية بتقنية الذكاء الاصطناعي لتدريب الشركات والتسويق [ 63 ] | خدمة اشتراك تبدأ من حوالي 30 دولارًا شهريًا | يختلف السعر حسب نوع الاشتراك | 60+ |
| فيكسوب | فيكسوب | 2023 | تحويل النص إلى فيديو من خلال التوجيه، مع التركيز على تنسيقات سرد القصص على TikTok وYouTube لوسائل التواصل الاجتماعي [ 64 ] | يقوم بإنشاء مقاطع فيديو بالذكاء الاصطناعي (1-15 دقيقة) من مطالبات نصية؛ يتضمن ميزات التحرير والصوت [ 64 ] | قائم على الاشتراك، مع باقات متنوعة | مدة تصل إلى 15 دقيقة تقريباً | 70+ | |
| الذكاء الاصطناعي في الفيديو | فيديو | 2021 | إنشاء مقاطع الفيديو المدعومة بالذكاء الاصطناعي، ومكتبة مخزون كبيرة، وصور رمزية ناطقة بالذكاء الاصطناعي [ 63 ] | مصمم خصيصًا لمحتوى وسائل التواصل الاجتماعي باستخدام قوالب خاصة بكل منصة [ 63 ] | خطة مجانية متاحة، تبدأ الخطط المدفوعة من 16 دولارًا شهريًا | يختلف ذلك باختلاف نوع المحتوى | متعدد (غير محدد) | |
| فليكي | فليكي الذكاء الاصطناعي | 2022 | تحويل النص إلى فيديو باستخدام صور رمزية وأصوات مدعومة بالذكاء الاصطناعي، ودعم واسع للغة والصوت [ 63 ] | يدعم أكثر من 65 صورة رمزية للذكاء الاصطناعي وأكثر من 2000 صوت في 70 لغة [ 63 ] | خطة مجانية متاحة، تبدأ الخطط المدفوعة من 30 دولارًا شهريًا | يختلف السعر حسب نوع الاشتراك | 70+ | |
| المدرج من الجيل الثاني | الذكاء الاصطناعي للمدرج | 2023 | توليد الفيديو متعدد الوسائط من النصوص أو الصور أو مقاطع الفيديو [ 65 ] | صور عالية الجودة، وأنماط متنوعة مثل التنميط ولوحة القصة [ 65 ] | تجربة مجانية، خطط مدفوعة (التفاصيل غير محددة) | حتى 16 ثانية | متعدد (غير محدد) | |
| مختبرات بيكا | مختبرات بيكا | 2024 | بيتا | توليد الفيديو الديناميكي، وتخصيص الكاميرا والحركة [ 66 ] | سهل الاستخدام، ويركز على التوليد الديناميكي الطبيعي [ 66 ] | مجاني حاليًا خلال فترة النسخة التجريبية | مرن، يدعم مقاطع الفيديو الطويلة مع استمرار الإطار | |
| المدرج من الجيل الثالث ألفا | الذكاء الاصطناعي للمدرج | ألفا | دقة بصرية محسنة، وبشر واقعيون للغاية، وتحكم زمني دقيق [ 67 ] | توليد فيديو فائق الواقعية مع تحديد دقيق للإطارات الرئيسية وتخصيص على مستوى الصناعة [ 67 ] | تجربة مجانية متاحة، وأسعار مخصصة للشركات | مدة تصل إلى 10 ثوانٍ لكل مقطع، قابلة للتمديد | ||
| جوجل فيو | جوجل | مطلق سراحه | مؤثرات صوتية، وموسيقى خلفية، ومؤثرات صوتية، ومؤثرات صوتية من جوجل جيميني . فيديوهات واقعية بأسلوب سينمائي. [ 68 ] | يُمكنه إنشاء نماذج/مشاهد/مقاطع شخصيات واقعية ومفصلة للغاية، مع أداء صوتي ومؤثرات صوتية وموسيقى خلفية متناسقة. إمكانية تمديد المقاطع مع الحفاظ على استمراريتها. [ 69 ] | يختلف السعر (250 دولارًا أمريكيًا لاشتراك Google Pro/Ultra AI، بالإضافة إلى عمليات شحن رصيد الذكاء الاصطناعي الإضافية) | ثماني ثوانٍ لكل مقطع (مع ذلك، يمكن متابعة/تمديد المقاطع كمقاطع منفصلة) | ٥٠+ | |
| أوبن آي سورا | أوبن إيه آي | مغلق | فهم عميق للغة، صور سينمائية عالية الجودة، مقاطع فيديو متعددة اللقطات [ 70 ] | قادر على إنشاء مقاطع فيديو مفصلة وديناميكية ومعبرة عاطفياً؛ لا يزال قيد التطوير مع تدابير السلامة [ 70 ] | لم يتم الكشف عن الأسعار بعد. | من المتوقع أن ينتج عنها فيديوهات أطول؛ سيتم تحديد مدة الفيديو لاحقًا | متعدد (غير محدد) | |
| LTX | لايتريكس | مطلق سراحه | توليد موحد للصوت والفيديو، مع عناصر تحكم متعددة | يمكن تهيئتها وتحفيزها عبر النصوص أو الصور أو الفيديو أو الصوت. | المصادر المفتوحة [ 71 ] | يمكن تمديدها حتى 60 ثانية [ 72 ] | ||
| المدرج من الجيل الرابع | المدرج | 2025 | اتساق الشخصيات عبر المشاهد، [ 73 ] اتساق العالم، [ 74 ] التحكم بالكاميرا، محاكاة الفيزياء | يقوم بإنشاء مقاطع فيديو مدتها من 5 إلى 10 ثوانٍ بشخصيات وأشياء وبيئات متناسقة عبر لقطات متعددة [ 75 ] | اشتراك قائم على الرصيد، وهو جزء من الخطط المدفوعة | 5-10 ثوانٍ | ||
| يراعة | أدوبي | 2024 | التحرير القائم على التوجيه، وأدوات التحكم في حركة الكاميرا، ونماذج الطرف الثالث [ 76 ] | إنشاء حركة من إشارة أو إطار واحد مع فيديو مرجعي [ 76 ] | اشتراك قائم على الرصيد | حتى 5 ثوانٍ | ||
| كلينج | كوايشو | 2024 | ||||||
| سيدانس 2.5 | بايت دانس سيد | 2026 | طلب تشغيل الفيديو [ 77 ] | فهم عميق للغة، صور سينمائية عالية الجودة، فيديوهات متعددة اللقطات | اشتراك قائم على الرصيد | 30 ثانية | متعدد (غير محدد) | |
| هابي هورس 1.1 | علي بابا | طلب تشغيل الفيديو [ 78 ] | حتى 15 ثانية | |||||
انظر أيضاً
- نموذج تحويل النص إلى صورة
- هراء الذكاء الاصطناعي
- VideoPoet ، نموذج جوجل غير المُصدر، وهو سلف برنامج Lumiere
- تقنية التزييف العميق
- توليف الصور البشرية
مراجع
- ↑ تقرير مؤشر الذكاء الاصطناعي لعام 2023 (ملف PDF) (تقرير). معهد ستانفورد للذكاء الاصطناعي المتمحور حول الإنسان. صفحة 98.
تم إصدار العديد من نماذج تحويل النصوص إلى فيديو عالية الجودة، وهي أنظمة ذكاء اصطناعي قادرة على توليد مقاطع فيديو من نص مُدخل، في عام 2022.
- ^ ملنيك، أندرو. ليوبلياناك، ميشال؛ لو، كونغ؛ يان، تشي؛ رن، ويمينغ. ريتر ، هيلج (6 مايو 2024). “نماذج نشر الفيديو: مسح”. أرخايف : 2405.03150 [ cs.CV ].
- ووديكي ، بن ( 11 أغسطس 2023). "نماذج الذكاء الاصطناعي التوليدية لتحويل النصوص إلى فيديو: القائمة النهائية" . أعمال الذكاء الاصطناعي . إنفورما . تم الاسترجاع في 18 نوفمبر 2024 .
- ↑ CogVideo ، THUDM، 12 أكتوبر 2022 ، تم الاطلاع عليه في 12 أكتوبر 2022
- ↑ ديفيز، تيلي (29 سبتمبر 2022). "Make-A-Video: نموذج Meta AI الجديد لإنشاء مقاطع فيديو من النصوص" . Weights & Biases . تم الاطلاع عليه بتاريخ 12 أكتوبر 2022 .
- 1 2 مونج، جيم كلايد (3 أغسطس 2022). "هذا الذكاء الاصطناعي قادر على إنشاء فيديو من نص مكتوب" . ميديوم . تم الاطلاع عليه بتاريخ 12 أكتوبر 2022 .
- ↑ "تقنية الذكاء الاصطناعي من ميتا لإنشاء الفيديوهات من النصوص" . www.fonearena.com . تاريخ الاطلاع: ١٢ أكتوبر ٢٠٢٢ .
- ↑ "جوجل: جوجل تتحدى ميتا، وتُطلق نظام ذكاء اصطناعي خاص بها لتوليد الفيديو" . صحيفة إيكونوميك تايمز . 6 أكتوبر 2022. تاريخ الاطلاع: 12 أكتوبر 2022 .
- ↑ «لا يا ميتا، يمكننا أيضاً استخدام الذكاء الاصطناعي لتحويل النصوص إلى فيديوهات»، هذا ما قالته جوجل . ذا ريجستر . تم الاطلاع عليه بتاريخ ١٢ أكتوبر ٢٠٢٢ .
- ↑ "أوراق مع كود - شاهد، خطط، تنبأ: التخطيط المعرفي الموجه باللغة مع التنبؤ بالفيديو" . paperswithcode.com . تم الاطلاع عليه بتاريخ 12 أكتوبر 2022 .
- ↑ "أوراق مع كود - التنبؤ بالفيديو القائم على النصوص" . paperswithcode.com . تم الاطلاع عليه بتاريخ 12 أكتوبر 2022 .
- ↑ صفحة، ويل دوغلاس، هيفن أركايف. "الشركة الناشئة الأصلية وراء Stable Diffusion أطلقت ذكاءً اصطناعياً توليدياً للفيديو" . مجلة MIT Technology Review . تاريخ الاسترجاع: 17 أكتوبر 2025 .
- ↑ ويغرز، كايل (9 يونيو 2023). "يُظهر الجيل الثاني من رانوي حدود تقنية تحويل النص إلى فيديو الحالية" . تيك كرانش . تم الاطلاع عليه بتاريخ 17 أكتوبر 2025 .
- ^ لوه، تشنغ شيونغ؛ تشن، دايو؛ تشانغ، ينجيا. هوانغ، يان. وانغ، ليانغ. شين، يوجون. تشاو، ديلي؛ تشو، جينجرين؛ تان، تينيو (2023). “VideoFusion: نماذج الانتشار المتحللة لإنشاء فيديو عالي الجودة”. أرخايف : 2303.08320 [ cs.CV ].
- ↑ "أدوبي تُطلق نموذج Firefly Video وتُحسّن نماذج الصور والرسومات المتجهة والتصميم. غرفة أخبار أدوبي" . شركة أدوبي، 10 أكتوبر 2024. تاريخ الاطلاع: 18 نوفمبر 2024 .
- ↑ ييركا، بوب (26 يناير 2024). "جوجل تعلن عن تطوير لوميير، وهو مولد فيديو من الجيل التالي قائم على الذكاء الاصطناعي" . تيك إكسبلور . تم الاطلاع عليه بتاريخ 18 نوفمبر 2024 .
- ↑ "تحويل النص إلى كلام للفيديوهات" . Synthesia.io . تم الاطلاع عليه بتاريخ 17 أكتوبر 2023 .
- ↑ نونيز، مايكل (12 يونيو 2024). "شركة Luma AI تُطلق 'Dream Machine' لإنتاج فيديوهات واقعية، مما يُشعل المنافسة في مجال الذكاء الاصطناعي الإعلامي" . VentureBeat . تم الاطلاع عليه بتاريخ 18 نوفمبر 2024 .
- ↑ فينك، تشارلي. "أبل تُطلق الذكاء الاصطناعي، وميسترال تجمع 600 مليون دولار، وتقنية جديدة لتحويل النصوص إلى فيديو بالذكاء الاصطناعي" . فوربس . تم الاطلاع عليه بتاريخ 18 نوفمبر 2024 .
- ↑ فرانزن، كارل (12 يونيو 2024). "ما تحتاج معرفته عن كلينغ، مُولِّد الفيديو بالذكاء الاصطناعي المنافس لسورا والذي يُبهر المُبدعين" . فينشر بيت . تم الاطلاع عليه بتاريخ 18 نوفمبر 2024 .
- ↑ «شركة بايت دانس تنضم إلى منافسي سورا من أوبن إيه آي بإطلاق تطبيق فيديو مدعوم بالذكاء الاصطناعي» . رويترز . 6 أغسطس 2024. تاريخ الاطلاع: 18 نوفمبر 2024 .
- ↑ «أطلقت خوارزمية الذكاء الاصطناعي الصينية "تايغر" مينيمكس نموذجًا لتحويل النصوص إلى فيديوهات لمنافسة خوارزمية سورا من أوبن إيه آي» . ياهو! فاينانس . 2 سبتمبر 2024. تاريخ الاطلاع: 18 نوفمبر 2024 .
- ↑ ريكيروسو، كيلفين (15 ديسمبر 2024). "نموذج LTXV من لايتريكس يحطم الأرقام القياسية في السرعة، حيث يُنتج مقاطع فيديو بالذكاء الاصطناعي مدتها 5 ثوانٍ في 4 ثوانٍ" . إي ويك . تم الاطلاع عليه بتاريخ 24 يوليو 2025 .
- ↑ Text2Video-Zero ، Picsart AI Research (PAIR)، 12 أغسطس 2023 ، تم الاطلاع عليه في 12 أغسطس 2023
- ↑ كيمبر، جوناثان (1 يوليو 2024). "الجيل الثالث ألفا، منافس سورا في لعبة رانوي، متوفر الآن" . ذا ديكودر . تم الاطلاع عليه بتاريخ 18 نوفمبر 2024 .
- ↑ "الفيديو هو الأفق التالي للذكاء الاصطناعي التوليدي" . Bloomberg.com . 20 مارس 2023. تم الاطلاع عليه بتاريخ 18 نوفمبر 2024 .
- ↑ "OpenAI تُشوق لـ'سورا'، نموذجها الجديد للذكاء الاصطناعي لتحويل النصوص إلى فيديوهات" . أخبار NBC . 15 فبراير 2024. تاريخ الاطلاع: 18 نوفمبر 2024 .
- ↑ كيلي، كريس (25 يونيو 2024). "تويز آر أص تُنتج أول فيلم ترويجي للعلامة التجارية باستخدام أداة تحويل النص إلى فيديو من OpenAI" . ماركتينج دايف . إنفورما . تاريخ الاسترجاع: 18 نوفمبر 2024 .
- ↑ جين، جياياو؛ وو، جيان هانغ؛ شو، تشو تشنغ؛ تشانغ، هانغ؛ وانغ، ياكسين؛ يانغ، جيلونغ (4 أغسطس 2023). "تحويل النص إلى فيديو: تحسين توليد الفيديو باستخدام نماذج الانتشار وشبكة إعادة البناء". المؤتمر الدولي الثاني للحوسبة والاتصالات والإدراك وتكنولوجيا الكم (CCPQT) لعام 2023. معهد مهندسي الكهرباء والإلكترونيات ( IEEE). الصفحات 108-114 . doi : 10.1109/CCPQT60491.2023.00024 . ISBN 979-8-3503-4269-7.
- ↑ "الإعلان عن مختبرات الغابة السوداء" . مختبرات الغابة السوداء . 1 أغسطس 2024. تم الاطلاع عليه بتاريخ 18 نوفمبر 2024 .
- ↑ فورليني، إميلي دريبيلبيس (18 سبتمبر 2024). "مولد الذكاء الاصطناعي لتحويل النصوص إلى فيديوهات من جوجل veo قادم إلى فيديوهات يوتيوب القصيرة" . مجلة PC . تم الاطلاع عليه بتاريخ 18 نوفمبر 2024 .
- ↑ سوبين، جينيفر إلياس، سامانثا (20 مايو 2025). "جوجل تطلق Veo 3، مولد فيديو يعمل بالذكاء الاصطناعي ويتضمن الصوت" . سي إن بي سي . تم الاطلاع عليه بتاريخ 22 مايو 2025 .
{{cite web}}: صيانة CS1: أسماء متعددة: قائمة المؤلفين ( رابط ) - ↑ فينك، تشارلي. "فيديو LTX يكسر حاجز الـ 60 ثانية، ويعيد تعريف فيديو الذكاء الاصطناعي كوسيلة إعلامية طويلة" . فوربس . تم الاطلاع عليه بتاريخ 24 يوليو 2025 .
- ↑ "أحدث إصدار من Lightricks يتيح للمبدعين توجيه مقاطع الفيديو الطويلة المولدة بالذكاء الاصطناعي في الوقت الفعلي" . SiliconANGLE . 16 يوليو 2025. تم الاطلاع عليه بتاريخ 24 يوليو 2025 .
- ↑ شاهف، تال (23 أكتوبر 2025). "لايتريكس تكشف عن نموذج فيديو قوي يعمل بالذكاء الاصطناعي يتحدى أوبن إيه آي وجوجل" . واي نت جلوبال . تم الاطلاع عليه بتاريخ 25 أكتوبر 2025 .
- ↑ باتيستا، إدواردو (13 فبراير 2026). "نموذج الفيديو الجديد بتقنية الذكاء الاصطناعي من بايت دانس ينتشر بسرعة كبيرة بينما تسعى الصين لتحقيق نجاح مماثل لنجاح ديب سيك" . رويترز . تم الاطلاع عليه بتاريخ 14 فبراير 2026 .
- 1 2 مادوس، جين (13 فبراير 2026). "بعد انتشار فيديو الذكاء الاصطناعي لـ'توم كروز' وهو يقاتل 'براد بيت' على نطاق واسع، رابطة الأفلام السينمائية تدين انتهاكًا "ضخمًا" على منصة Seedance 2.0" .
- ^ ميلمو ، دان. بولفر ، أندرو (13 فبراير 2026). ""انتهى الأمر بالنسبة لنا": إطلاق مولد الفيديو الجديد بالذكاء الاصطناعي Seedance 2.0 يثير قلق هوليوود" – عبر صحيفة الغارديان.
- ↑ "ما هو Seedance 2.5؟ شرح نموذج الفيديو المدعوم بالذكاء الاصطناعي من الجيل التالي من ByteDance" . MindStudio . 24 يونيو 2026.
- ↑ "تستعد شركة ByteDance لإطلاق Seedance 2.5 مع مخرج فيديو بتقنية الذكاء الاصطناعي مدته 3 دقائق" . testingcatalog . 4 يوليو 2026.
- 1 2 بهاجواتكار، ريشيكا؛ باتشو، ساكيث؛ مجرب، خورشيد؛ كولكارني، أكشاي؛ شيداروار، شيتال (17 ديسمبر 2020). “مراجعة لنهج إنشاء الفيديو”. المؤتمر الدولي لعام 2020 حول الطاقة والأجهزة والتحكم والحوسبة (PICC) . IEEE. ص 1 – 5. دوى : 10.1109 / PICC51425.2020.9362485 . رقم ISBN 978-1-7281-7590-4.
- ↑ كيم، تايهون؛ كانغ، تشان هي؛ بارك، جاي هيوك؛ جيونغ، داون؛ يانغ، تشانغ هي؛ كانغ، سوك جو؛ كونغ، كيونغبو (3 يناير 2024). "توليد فيديو نصي مدرك لحركة الإنسان مع تحكم صريح بالكاميرا". مؤتمر IEEE/CVF الشتوي لعام 2024 حول تطبيقات رؤية الحاسوب (WACV) . IEEE. الصفحات 5069-5078 . doi : 10.1109/WACV57701.2024.00500 . ISBN 979-8-3503-1892-0.
- 1 2 3 4 5 سينغ، أديتي (9 مايو 2023). "دراسة استقصائية لمولدات الذكاء الاصطناعي لتحويل النصوص إلى صور وفيديوهات". المؤتمر الدولي الرابع للذكاء الاصطناعي والروبوتات والتحكم (AIRC) لعام 2023. معهد مهندسي الكهرباء والإلكترونيات ( IEEE). الصفحات 32-36 . arXiv : 2311.06329 . doi : 10.1109/AIRC57904.2023.10303174 . ISBN 979-8-3503-4824-8.
- 1 2 مياو، ييبو؛ تشو، ييفان؛ دونغ، ينبينج؛ يو، ليجيا؛ تشو، يونيو؛ جاو ، شياو شان (8 سبتمبر 2024). “T2VSafetyBench: تقييم سلامة النماذج التوليدية لتحويل النص إلى فيديو”. أرخايف : 2407.05965 [ cs.CV ].
- 1 2 3 تشانغ، جي؛ مي، كويتشي؛ وانغ، شياو؛ تشنغ، يو؛ فان، جيان بينغ (أغسطس 2018). "من النص إلى الفيديو: استغلال الدلالات متوسطة المستوى لتصنيف الفيديو على نطاق واسع". المؤتمر الدولي الرابع والعشرون للتعرف على الأنماط (ICPR) لعام 2018. معهد مهندسي الكهرباء والإلكترونيات ( IEEE). الصفحات 1695-1700 . doi : 10.1109/ICPR.2018.8545513 . ISBN 978-1-5386-3788-3.
- ↑ بلاسيدو، داني دي. "اجتاز الذكاء الاصطناعي من جوجل اختبار 'ويل سميث يأكل السباغيتي'" . فوربس . مؤرشف من الأصل في 3 يونيو 2025. تم الاطلاع عليه في 1 يونيو 2025 .
- ^ لندن، لندن (9 يونيو 2025). "تم تداول الصور التي تم إنشاؤها بواسطة الذكاء الاصطناعي لأطفال أوكرانيين يرتدون الزي العسكري عبر الإنترنت | Mythdetector.com" . تم الاسترجاع 16 يونيو 2025 .
- ↑ "إعلان مزيف عن أوكرانيا يحث الأطفال على الإبلاغ عن أقاربهم الذين يستمتعون بالموسيقى الروسية" . يورونيوز . 28 مارس 2025. تم الاطلاع عليه بتاريخ 16 يونيو 2025 .
- ↑ "صور لأطفال أوكرانيين تم إنشاؤها بواسطة الذكاء الاصطناعي" . behindthenews.ua . 26 يونيو 2024. تم الاطلاع عليه بتاريخ 16 يونيو 2025 .
- ↑ "إعلان تلفزيوني أوكراني مزيف يحث الأطفال على الإبلاغ عن أقاربهم الذين يستمعون إلى الموسيقى الروسية" .
- ↑ «قد يكون فيديو التزييف العميق لزيلينسكي مجرد غيض من فيض في حرب المعلومات، بحسب تحذيرات الخبراء» . NPR . ١٦ مارس ٢٠٢٢. تاريخ الاطلاع: ١٦ يونيو ٢٠٢٥ .
- ↑ «حرب أوكرانيا: دحض فيديو مزيف بتقنية التزييف العميق يظهر فيه زيلينسكي وهو يطلب من الأوكرانيين "إلقاء السلاح"» . سكاي نيوز . تم الاطلاع عليه بتاريخ 16 يونيو 2025 .
- ↑ "«كاور ضد كوري»: ساني ليون تستعد لأداء دورين في فيلم روائي طويل يعتمد على الذكاء الاصطناعي - تقرير . صحيفة تايمز أوف إنديا . 24 سبتمبر 2025. ISSN 0971-8257 . تاريخ الاطلاع: 26 أكتوبر 2025 .
- ↑ فرزين، سناء (24 سبتمبر 2025). "حصري: ساني ليون تُرسي معياراً جديداً بفيلمها الروائي المدعوم بالذكاء الاصطناعي 'Kaur vs KORE'"" . إنديا توداي . تم الاطلاع عليه بتاريخ 26 أكتوبر 2025 .
- ↑ "تؤدي ساني ليون دوراً مزدوجاً كإنسانة وكشخصية ذكاء اصطناعي في فيلم 'Kaur vs KORE'"" . @ mathrubhumi . 24 سبتمبر 2025 . تم الاسترجاع في 26 أكتوبر 2025 .
- ↑ شارما، مانوج (26 أكتوبر 2025). "من الملحمة الهندية ماهابهاراتا إلى هانومان: فيجاي سوبرامانيام من شبكة الفنانين الجماعيين يتحدث عن كيفية تشكيل الذكاء الاصطناعي لمستقبل الترفيه في الهند" . مجلة فورتشن إنديا . تاريخ الاسترجاع: 26 أكتوبر 2025 .
- ↑ وكالة PTI (20 أغسطس 2025). "أنوراغ كاشياب ينتقد المنتج فيجاي سوبرامانيام بسبب فيلم "شيرانجيفي هانومان" الذي تم إنشاؤه باستخدام الذكاء الاصطناعي"" . صحيفة ذا هندو . الرقم الدولي الموحد للدوريات 0971-751X . تاريخ الاسترجاع 26 أكتوبر 2025. "
- ↑ "أعلن Chiranjeevi Hanuman عن فيلم تم إنشاؤه بواسطة الذكاء الاصطناعي، ولم يكن Vikramaditya Motwane مسرورًا به:" هكذا يبدأ "" . هندوستان تايمز . 19 أغسطس 2025. تم الاطلاع عليه بتاريخ 26 أكتوبر 2025. "
- ↑ "مهابهاراتا: إيك دارمايود - عرض على منصات البث الرقمي: متى وأين يمكن مشاهدة أول مسلسل أسطوري هندي مدعوم بالذكاء الاصطناعي؟" . صحيفة إيكونوميك تايمز . 23 أكتوبر 2025. ISSN 0013-0389 . تاريخ الاطلاع: 26 أكتوبر 2025 .
- ↑ ""مع مسلسل "مهابهاراتا" بتقنية الذكاء الاصطناعي، سيتمكن المشاهدون من تجربة القصة نفسها بطريقة جديدة".صحيفة تايمز أوف إنديا . ١٨ أكتوبر ٢٠٢٥. الرقم الدولي الموحد للدوريات ٠٩٧١-٨٢٥٧ . تاريخ الاسترجاع ٢٦ أكتوبر ٢٠٢٥ .
- ↑ راماشاندران، نامان (10 أكتوبر 2025). "عرض دعائي لفيلم "مهابهاراتا" المدعوم بالذكاء الاصطناعي قبل عرضه الأول في الهند (حصري)" . مجلة فارايتي . تم الاطلاع عليه بتاريخ 26 أكتوبر 2025 .
- ↑ ديفيوجن، لاتينت (1 يونيو 2026). "كرافت (1979): الليلة الأولى" . يوتيوب . تم الاطلاع عليه في 1 يونيو 2026 .
- 1 2 3 4 5 6 "أفضل نماذج توليد الفيديو بالذكاء الاصطناعي لعام 2024" . ديب غرام . تم الاطلاع عليه بتاريخ 30 أغسطس 2024 .
- 1 2 "Vexub – مولد الذكاء الاصطناعي لتحويل النص إلى فيديو" . Vexub . تم الاطلاع عليه بتاريخ 25 يونيو 2025 .
- 1 2 "Runway Research | Gen-2: إنشاء فيديوهات جديدة باستخدام النصوص والصور ومقاطع الفيديو" . runwayml.com . تم الاطلاع عليه بتاريخ 30 أغسطس 2024 .
- 1 2 شارما، شوبهام (26 ديسمبر 2023). "منصة الذكاء الاصطناعي لتحويل النصوص إلى فيديوهات من بيكا لابز متاحة للجميع: إليك كيفية استخدامها" . فينشر بيت . تم الاطلاع عليه في 30 أغسطس 2024 .
- 1 2 "Runway Research | تقديم Gen-3 Alpha: أفق جديد لإنتاج الفيديو" . runwayml.com . تم الاطلاع عليه بتاريخ 30 أغسطس 2024 .
- ↑ "تعرّف على Flow، صناعة الأفلام المدعومة بالذكاء الاصطناعي مع Veo 3" . blogs.google.com . 20 مايو 2025. تم الاطلاع عليه في 6 يوليو 2025 .
- ↑ "Google Veo DeepMind" . google.com . تم الاطلاع عليه بتاريخ 6 يوليو 2025 .
- 1 2 "سورا | أوبن إيه آي" . openai.com . تم الاطلاع عليه بتاريخ 30 أغسطس 2024 .
- ↑ لايتريكس. "لايتريكس تُصدر LTX-2: أول نموذج أساسي كامل مفتوح المصدر للذكاء الاصطناعي للفيديو" . www.prnewswire.com . تاريخ الاطلاع: 23 أبريل 2026 .
- ↑ مينك، زاك. "فيديو الذكاء الاصطناعي يكسر حاجز الستين ثانية" . ذا رانداون إيه آي . تم الاطلاع عليه بتاريخ 23 أبريل 2026 .
- ↑ نونيز، مايكل (31 مارس 2025). "Runway Gen-4 يحل أكبر مشكلة في فيديوهات الذكاء الاصطناعي: اتساق الشخصيات عبر المشاهد" . VentureBeat . مؤرشف من الأصل في 21 يوليو 2025. تم الاطلاع عليه في 17 أكتوبر 2025 .
- ↑ "نظام الذكاء الاصطناعي الجديد من الجيل الرابع من Runway يعد بإنتاج إعلامي أكثر قابلية للتنبؤ حتى الآن | No Film School" . nofilmschool.com . تم الاطلاع عليه بتاريخ 17 أكتوبر 2025 .
- ↑ ويغرز، كايل (31 مارس 2025). "Runway تُطلق نموذجًا جديدًا ومثيرًا للإعجاب للذكاء الاصطناعي لتوليد الفيديو" . TechCrunch . تم الاطلاع عليه بتاريخ 17 أكتوبر 2025 .
- 1 2 ميهتا، إيفان (16 ديسمبر 2025). "يدعم Adobe Firefly الآن تحرير الفيديو القائم على التوجيهات، ويضيف المزيد من نماذج الجهات الخارجية" . TechCrunch . تم الاسترجاع في 7 مارس 2026 .
- ↑ ها، أنتوني (15 فبراير 2026). "هوليوود غير راضية عن مولد الفيديو الجديد Seedance 2.0" . TechCrunch . تم الاطلاع عليه في 7 مارس 2026 .
- ↑ ها، أنتوني (10 أبريل 2026). "هابي هورس من علي بابا يتصدر منصة سيدانس، ويُلقي نظرة على سباق الصين لاستقطاب المواهب في مجال الذكاء الاصطناعي" . صحيفة ساوث تشاينا مورنينج بوست . تاريخ الاسترجاع: 10 أبريل 2026 .
- هندسة الذكاء الاصطناعي
- الخوارزميات
- لغة
- معالجة اللغة الطبيعية
- فيديو
- تحويل النص إلى فيديو
