يحوّل الإصدار الجديد Gemini Omni 1.1 Flash إنشاء الفيديو بالذكاء الاصطناعي من مطالبة واحدة إلى محادثة إبداعية مستمرة. أطلقته Google في 27 أغسطس 2026، ويمكن للنموذج إنشاء فيديو من النصوص والصور، وتحرير مقطع تم رفعه أو إنشاؤه، وتمديد مشهد، والاستيفاء بين الإطارين الأول والأخير، وتحسين النتيجة عبر عدة جولات. وبالنسبة للمبدعين الذين يريدون تحرير الفيديو عبر المحادثة، فقد يكون هذا أكثر فائدة من إعادة بناء مطالبة Google Veo 3 من الصفر في كل مرة.

ليس Gemini Omni 1.1 Flash تلقائيًا أفضل نموذج لكل لقطة. لا يزال Google Veo 3 خيارًا قويًا لإنشاء فيديو سينمائي من النص إلى الفيديو أو من الصورة إلى الفيديو، مع حركة واقعية وصوت أصلي. ويصبح Omni الأنسب عندما يحتاج الفريق إلى مراجعات تفصيلية، واتساق عبر التكرارات، ومسودات منخفضة التكلفة، أو سجل تفاعل قابل للتحرير.
ما الجديد في إصدار Gemini Omni 1.1 Flash؟
تصف Google نموذج gemini-omni-1.1-flash بأنه النسخة المتاحة عمومًا من نموذجها السريع والمحادثي لإنشاء الفيديو وتحريره. يدعم الإصدار المستقر مدخلات النص والصورة والفيديو، وينتج فيديو مع صوت، ويستخدم Gemini Interactions API للحفاظ على السياق الإبداعي بين الجولات.
أهم الإضافات هي عناصر تحكم عملية للإنتاج:
- الإنشاء والتحرير بالمحادثة: واصل تحسين تفاعل فيديو محفوظ باستخدام تعليمات باللغة الطبيعية.
- التحكم في الإطارين الأول والأخير: حدّد من أين تبدأ اللقطة وإلى أين يجب أن تنتهي.
- تمديد المشهد: أضف امتدادات لمدة 10 ثوانٍ حتى إجمالي 40 ثانية مع استخدام اللقطات الأخيرة كسياق.
- وضع المسودة بدقة 360p: أنشئ النماذج الأولية للتكوينات بسرعة تصل إلى 60% أكثر وبتكلفة تعادل ثلث تكلفة إخراج 720p القياسي.
- الإخراج عالي الدقة: أنشئ أو ارفع دقة المخرجات المدعومة إلى 1080p أو 4K.
- توجيه التوقيت: صف الأفعال باستخدام تعليمات توقيت طبيعية أو رموز زمنية بسيطة.
تعرض صفحة النموذج الحالية من Google مخرجات فردية مدتها من 3 إلى 10 ثوانٍ بمعدل 24 إطارًا في الثانية، مع خيارات 360p و720p و1080p و4K. ويمكن للامتدادات بناء تسلسل أطول، لكنها لا تحول النظام إلى محرر طويل المدى بلا قيود.
كيف يتيح لك Gemini Omni 1.1 Flash تحرير الفيديو عبر المحادثة
يعمل التحرير بالمحادثة بأفضل شكل عندما يكون سلسلة من القرارات الصغيرة القابلة للاختبار. ينشئ الطلب الأول المشهد الأساسي أو يرفعه. وتشير الجولات اللاحقة إلى التفاعل السابق، بحيث يمكن للمبدع طلب تغيير واحد محدد دون إعادة شرح المشروع بالكامل.
قد تبدو محادثة عملية على هذا النحو:
- أنشئ اللقطة الأساسية: "عرض بطيء لمنتج بكاميرا محمولة باليد داخل شقة دافئة، ضوء نافذة طبيعي، وأجواء غرفة واقعية."
- صحّح عنصرًا واحدًا: "أبقِ حركة الكاميرا والمقدّم دون تغيير. استبدل الطاولة فقط بخشب بلوط فاتح."
- حسّن الأجواء: "خفف الصبغة البرتقالية واجعل ضوء النهار أكثر نعومة. حافظ على لون البشرة ولون المنتج."
- مدّد المشهد: "واصل لمدة عشر ثوانٍ. يضع المقدّم المنتج بجوار العبوة ويبتسم؛ وتستمر أجواء الغرفة."
- أنهِ بدقة أعلى: ارفع دقة المسودة المعتمدة بدلًا من دفع تكلفة كل تجربة مبكرة بالجودة النهائية.
الميزة ليست أن اللغة الطبيعية تستبدل كل أعمال التحرير الاحترافية. فالقصّات الدقيقة، والطباعة، وإدارة الألوان، ومزج الصوت، والترجمات، والمراجعة القانونية، كلها لا تزال تستفيد من محرر زمني. يقلل Gemini Omni 1.1 Flash العمل بين الفكرة الأولية والمسودة البصرية القابلة للمراجعة.
Gemini Omni 1.1 Flash مقابل Google Veo 3

تصبح المقارنة أوضح عندما تكون المعايير هي السعر، والتفاصيل، وعمق التحرير، ومرونة المدخلات، وهدف التسليم — وليس مجرد درجة واحدة لـ"الجودة".
| عامل القرار | Gemini Omni 1.1 Flash | Google Veo 3 | التوصية العملية |
|---|---|---|---|
| سير العمل الأساسي | إنشاء، تحرير، إعادة مزج، استيفاء، تمديد، وتحسين عبر محادثة محفوظة | إنشاء فيديو سينمائي من النص أو الصور مع صوت أصلي | اختر Omni للتحرير التكراري؛ واختر Veo 3 للحصول على لقطة قوية تبدأ من التوليد |
| السعر الحالي في واجهة API العامة | حوالي 0.10 دولار لكل ثانية من فيديو 720p ضمن تسعير Google Standard؛ وتُحاسَب رموز الإدخال بشكل منفصل | يستخدم Flyne AI سير عمل خاصًا به قائمًا على الرصيد عبر المزوّد، وتعتمد التكلفة الدقيقة على النسخة القابلة للاختيار والحساب | يوفّر Omni حاليًا سعرًا أوضح للمطورين بشكل عام؛ أعد التحقق من أرصدة Flyne قبل الإنتاج |
| النمذجة الأولية منخفضة التكلفة | تكلف مسودات 360p ثلث تكلفة 720p ويمكن إنشاؤها بسرعة تصل إلى 60% أكثر | يركّز سير العمل المرتبط في Flyne على التوليد السينمائي النهائي بدلًا من طبقة مسودة محادثية موثقة | يمكن لـ Omni خفض تكلفة رفض التكوينات المبكرة |
| التفاصيل واللمسة النهائية | تصحيحات بالمحادثة، الإطار الأول/الأخير، مطالبات التوقيت، إرشادات النص المقروء، وخيارات إخراج 1080p/4K | تكوين سينمائي قوي، وفيزياء واقعية، وحركة، وأجواء، ومؤثرات، وحوار | يكون Omni أفضل عندما تحتاج التفاصيل إلى مراجعة؛ ويظل Veo 3 قويًا عندما تكون الأولوية للمظهر السينمائي من التوليد الأول |
| الاتساق | سياق محفوظ متعدد الجولات وامتدادات حتى 40 ثانية | سير عمل قائم على التوليد؛ وقد تتطلب المطالبات الجديدة إعادة صياغة الملخص بشكل أكبر | Omni أكثر ملاءمة لمشهد يتطور |
| مرونة المدخلات | نصوص وصور ومدخلات فيديو قصيرة في واجهة API الحالية؛ وتعتمد القدرات متعددة الوسائط الأوسع على السطح والوضع | توليد من النص أو الصورة في صفحة Flyne المرتبطة | يقدّم Omni نموذج تفاعل تحريري أوسع |
| القيود | تقتصر مقاطع الفيديو المرفوعة للتحرير/التمديد عمومًا على 10 ثوانٍ؛ لا يوجد تحرير صوتي؛ التمديد يكون في النهاية فقط؛ وتُطبَّق قيود إقليمية وقيود الأشخاص المعروفين | ما تزال قيود المزوّد والنموذج والسلامة والمدة والحساب سارية | لا يوجد أي من النموذجين بلا قيود؛ Omni أكثر مرونة إبداعيًا، وليس أقل تنظيمًا |
لذلك يمكن أن يقدّم Gemini Omni 1.1 Flash النتيجة الأفضل عندما تعني كلمة "أفضل" تطابقًا أقرب بعد عدة مراجعات مضبوطة. وقد يظل Veo 3 يقدّم أفضل نسخة أولى لمشهد سينمائي مبني على الفيزياء وحركة الكاميرا والصوت الأصلي. ينبغي أن يقارن الاختبار المتكافئ التكلفة لكل مقطع معتمد، لا السعر لكل عملية توليد فقط.
السعر: لماذا يمكن أن يقلّل إعداد المسودات بالمحادثة من تكلفة الإنتاج
السعر المباشر لواجهة API ليس سوى جزء واحد من تكلفة الإنتاج. تعادل تسعيرة Gemini API الحالية من Google تسعير مخرجات Omni Standard بدقة 720p بنحو 0.10 دولار لكل ثانية. والأهم من ذلك، أن فئة المسودة 360p تكلف نحو ثلث تكلفة 720p. ويمكن للفريق اختبار التأطير، وترتيب الحركة، وتموضع العنصر، وإيقاع المشهد بتكلفة منخفضة قبل اختيار الإخراج عالي الدقة.
يمكن أن تقلل التعديلات بالمحادثة أيضًا من الهدر. فإذا كان المنتج والممثل ومسار الكاميرا مفيدين بالفعل، فقد تحافظ التعليمات المستهدفة على جزء أكبر من المقطع المعتمد مقارنة بإعادة التوليد الكامل. ويعتمد التوفير الفعلي على مدى التزام النموذج بالتعديل المطلوب وما إذا كان المقطع النهائي يجتاز المراجعة.
بالنسبة لمستخدمي Flyne AI، قارن متطلبات الرصيد الظاهرة لـ Gemini Omni، وGoogle Veo 3، وGoogle Veo 3.1 مباشرة قبل التوليد. يمكن أن تتغير أرصدة المزوّد، والأوضاع المختارة، والعروض الترويجية، والتوافر بشكل مستقل عن سعر قائمة Google لواجهة API.
التفاصيل والتحكم: أين يمكن أن يكون Gemini Omni أكثر دقة
يكون Gemini Omni 1.1 Flash أكثر دقة عندما تصف التعليمات كلًا من التغيير والثوابت. عبارة "اجعله أكثر سينمائية" واسعة. أما "أبقِ الممثل، ومسار الكاميرا، وتوزيع الغرفة، ولون المنتج، والصوت دون تغيير؛ واستبدل ضوء النهار فقط بمظهر بارد وغائم" فتعطي النموذج حدودًا تحريرية أوضح.
يحسّن التحكم في الإطارين الأول والأخير الانتقالات المخطط لها. يمكن أن تبدأ لقطة منتج بتفصيل نسيجي قريب وتنتهي بتكوين رئيسي معتمد. ويمكن لدراما قصيرة أن تنتقل من الشك إلى الإدراك دون إطار أخير غير مضبوط. ويمكن لمطالبات التوقيت تحديد وقت دخول شخصية، أو وقت حدوث القطع، أو وقت تغيّر الموسيقى.
يدعم النموذج أيضًا مطالبات تؤكد على التفاصيل الدقيقة، والتعبير، والتوقيت الطبيعي، وواقعية الخلفية، والنص المقروء على الشاشة. هذه توجيهات مفيدة وليست ضمانات. ولا يزال على المراجعين البشر فحص الوجوه، والأيدي، والملصقات، والشعارات، والانعكاسات، والاستمرارية، والصوت، وكل ادعاء واقعي.
حالات استخدام إنشاء الفيديو وتحريره

محتوى UGC والإعلانات الاجتماعية
ابدأ بمقطع منتج بأسلوب صانع محتوى، ثم اطلب خلفية أنظف، أو إضاءة أدفأ، أو موضعًا مختلفًا للمنتج، أو خطافًا بصريًا أقصر مع الحفاظ على المقدّم وسلوك الكاميرا. أضف التسميات التوضيحية النهائية، والادعاءات، والأسعار، وعبارات الحث على الإجراء في محرر تقليدي حيث يمكن التحقق من دقة النص.
فيديو المنتجات والتجارة الإلكترونية
حسّن لقطة عبوة، أو لقطة قريبة للخامة، أو عرضًا على الطاولة، أو مشهد فتح صندوق عبر عدة تغييرات صغيرة. يكون سير العمل بالمحادثة مفيدًا عندما تحتاج فرق العلامة التجارية إلى مقارنة البيئات أو معالجات الإضاءة دون التخلي عن حركة كاميرا تمت الموافقة عليها.
الأفلام القصيرة واستمرارية السرد
مدّد مشهدًا، أو أدخل شخصية مرجعية، أو غيّر الأجواء، أو وجّه الفعل التالي مع الحفاظ على الحركة والصوت الأخيرين كسياق. اعمل على نبضات قصيرة: دخول واحد، أو رد فعل، أو كشف، أو انتقال في كل جولة.
لوحات القصة والتصور المسبق
حوّل الرسومات أو الإطارات المرجعية إلى مفاهيم متحركة، ثم راجع التأطير والإيقاع بالمحادثة. يمكن للمخرج اختبار حركة التفاف، أو حركة dolly، أو قطع، أو انتقال إضاءة، أو تكوين نهائي قبل الالتزام بموارد الإنتاج.
المحتوى التعليمي والتدريبي
أنشئ عرضًا توضيحيًا، ثم صحّح العنصر المعروض، أو زاوية الكاميرا، أو البيئة، أو ترتيب الأفعال. ولأن اللقطات التعليمية المولدة بالذكاء الاصطناعي قد تحتوي على أخطاء، فينبغي لخبير مختص التحقق من كل خطوة وملصق وتعليمات سلامة.
توطين الحملات وتغييرات الصيغ
طوّر نسخًا بصرية لأسواق أو مواسم أو قنوات مختلفة مع الحفاظ على مشهد المنتج الأساسي. لا يدعم تحرير الصوت حاليًا في واجهة API، لذا يجب التعامل مع الدبلجة والصوت النهائي الخاص باللغة بشكل منفصل. راجع أي نص ظاهر تم توليده قبل النشر.
تمديد المشهد لمقاطع الموسيقى والأداء
مدّد مقطعًا مولدًا مع حركة وصوت متسقين، أو اطلب قطعًا إلى المشهد التالي بالشخصيات نفسها. المقاطع المرفوعة التي تحتوي على كلام موجود مسبقًا لها قيود إضافية، لذا خطط للحوار قبل افتراض إمكانية تمديده بالمحادثة.
نمط أفضل للمطالبات من أجل تحرير الفيديو بالمحادثة
استخدم طلب تحرير من خمسة أجزاء:
- الهدف: حدّد بدقة ما الذي يجب أن يتغير.
- الثوابت: اذكر الأشخاص، والأشياء، والحركة، والتكوين، والصوت التي يجب أن تبقى مستقرة.
- الاستبدال: صف العنصر الجديد، أو الإضاءة، أو البيئة، أو الفعل، أو النهاية.
- التوقيت: اذكر متى يحدث التغيير ومدى سرعة تطوره.
- قاعدة المراجعة: سمِّ نقاط الإخفاق الشائعة التي يجب فحصها بعد التوليد.
مثال:
حرّر الفيديو السابق. أبقِ هوية المقدّم، وحركة اليد، وشكل المنتج، وألوان الملصق، ومسار الكاميرا، وتوزيع الغرفة، والأجواء الحالية دون تغيير. استبدل فقط المشهد الخارجي عبر النافذة بمدينة ممطرة مساءً. يبدأ الانتقال بعد ثانيتين ويكتمل تدريجيًا بحلول الثانية السادسة. حافظ على انعكاسات واقعية ولا تضف نصًا أو شعارات أو عناصر إضافية.
غيّر متغيرًا ذا معنى واحدًا فقط في كل جولة. فهذا يجعل من الأسهل تحديد أي تعليمات حسّنت النتيجة أو أضعفتها.
حدود مهمة قبل أن تبني سير عمل
تمنح وثائق API الحالية لـ Gemini Omni المبدعين تحكمًا أوسع، لكنها توثق أيضًا حدودًا محددة:
- يجب عمومًا أن تكون مقاطع الفيديو المرفوعة للتحرير أو التمديد مدتها 10 ثوانٍ أو أقل؛
- يضيف التمديد لقطات في النهاية بدلًا من إدراجها في البداية أو الوسط؛
- تحرير الصوت غير مدعوم؛
- المراجع الصوتية المرفوعة غير مدعومة في Gemini API الحالي، رغم أن واجهات Gemini Omni الأخرى قد تتيح سير عمل أوسع متعدد الوسائط؛
- تُطبّق قيود الأشخاص المعروفين والقيود الإقليمية على بعض عمليات التحرير؛
- تحرير الفيديو المرفوع أو تمديده غير متاح حاليًا في المنطقة الاقتصادية الأوروبية وسويسرا والمملكة المتحدة، بينما قد تظل الامتدادات المولدة بالنموذج مدعومة؛
- تتضمن الفيديوهات علامات SynthID غير مرئية لإثبات المنشأ؛
- تُطبَّق فلاتر السلامة على كل من المدخلات والمخرجات.
يجب ألّا يُفهم "أكثر مرونة" أبدًا على أنه إذن بانتحال الأشخاص، أو اختلاق التأييدات، أو تجاهل حقوق النشر، أو تجاوز قواعد المنصات. استخدم وسائط مصرحًا بها، واحصل على موافقة استخدام الشبه، وافصح عن المحتوى الاصطناعي حيثما كان ذلك مطلوبًا، وأبقِ خطوة موافقة بشرية.
المزيد من أدوات الفيديو بالذكاء الاصطناعي التي تستحق الاستكشاف
- Google Veo 3.1 on Flyne AI هو البديل الأقوى عندما يريد الفريق سير عمل لنسخة Veo أحدث مع صوت أصلي، والتزام أفضل بالمطالبات، وتحكم موجّه بالمراجع.
- Google Veo 3 on Flyne AI يظل مفيدًا للتجريب السينمائي من النص إلى الفيديو ومن الصورة إلى الفيديو مع صوت أصلي.
- Gemini Omni on Flyne AI يوفر مسارًا عبر المتصفح لاستكشاف إنشاء الفيديو متعدد الوسائط ومفاهيم التحرير باللغة الطبيعية. أكّد إصدار الواجهة الخلفية المختار وعناصر التحكم الظاهرة قبل التوليد.
- Google Veo 3.1 API on Best Image AI مفيد للمطورين الذين يريدون نقطة نهاية للنص إلى الفيديو ضمن منصة API موحدة للصور والفيديو.
- VideoWeb AI يوفّر سير عمل عبر المتصفح للنص إلى الفيديو، والصورة إلى الفيديو، وUGC، وTikTok، وفيديوهات الموسيقى، والفيديو المرجعي، والفيديو إلى الفيديو.
- Hey Dream AI يجمع بين إنشاء الصور والفيديو و3D في مساحة عمل واحدة مع مدخلات خاصة بالنموذج وعناصر تحكم في المخرجات.
الأسئلة الشائعة
هل Gemini Omni 1.1 Flash إصدار جديد؟
نعم. أطلقت Google النموذج المستقر gemini-omni-1.1-flash في 27 أغسطس 2026. وهو متاح عمومًا عبر Gemini API المدفوع وواجهات الإنشاء المدعومة من Google.
هل يمكن لـ Gemini Omni 1.1 Flash تحرير فيديو موجود؟
نعم، ضمن الحدود الموثقة. تقبل واجهة API الحالية مدخلات فيديو حتى 10 ثوانٍ للتحرير والتمديد، وتدعم التغييرات باللغة الطبيعية، ويمكنها الحفاظ على تفاعل محفوظ للجولات اللاحقة.
كم تبلغ تكلفة Gemini Omni 1.1 Flash؟
تعرض Google حاليًا تكلفة الإدخال عند 1.50 دولار لكل مليون رمز نصي أو صوري أو فيديوي أو صوتي، ومخرجات الفيديو عند 17.50 دولار لكل مليون رمز. وبحسب معدل الرموز الموثق لدقة 720p، تبلغ تكلفة الإخراج نحو 0.10 دولار لكل ثانية. وقد تختلف أرصدة المزوّدين.
هل Gemini Omni 1.1 Flash أفضل من Google Veo 3؟
قد يكون أفضل للتحرير بالمحادثة، والمراجعات المضبوطة، وتمديد المشاهد، والاستيفاء بين الإطارات الرئيسية، وإعداد المسودات منخفضة التكلفة. وقد يظل Veo 3 الخيار الأفضل لتوليد نسخة أولى سينمائية بحركة واقعية وصوت أصلي.
هل يمكن لـ Gemini Omni تحرير الصوت أو الحوار؟
تحرير الصوت غير مدعوم في واجهة API الحالية. يمكن للتمديد متعدد الجولات توليد كلام في الحالات المدعومة، لكن اللقطات المرفوعة التي تحتوي على كلام لها قيود إضافية. خطط للدبلجة وأعمال الحوار النهائي بشكل منفصل.
الخلاصة
يجعل الإصدار الجديد Gemini Omni 1.1 Flash من الممكن إنشاء الفيديو وتحريره عبر المحادثة، ما قد يقلل من تكرار كتابة المطالبات ويخفض تكلفة الاستكشاف البصري. وأقوى ميزة له مقارنة بـ Google Veo 3 ليست جودة الصورة المطلقة؛ بل القدرة على التحسين، والتمديد، والاستيفاء، والحفاظ على السياق عبر حوار تحريري. استخدم Gemini Omni on Flyne AI لتجربة سهلة الوصول، وقارنه بخيارات Veo، واحكم على النماذج بناءً على التكلفة لكل مقطع معتمد.






















