Gemini Omni 1.1 Flash أم Veo 3.1؟ دليل الاختيار والتكامل
تطرح Google الآن نموذجين لإنشاء الفيديو باستخدام مفتاح API نفسه، وهما ليسا إصدارين من المنتج ذاته. Veo 3.1 هو محرك العرض السينمائي مع صوت أصلي، بينما Gemini Omni 1.1 Flash، المتاح بشكل عام منذ 27 أغسطس 2026، هو النموذج التفاعلي الذي يمكن تعديله عبر جولات متتابعة.
يعتمد الاختيار على ثلاثة أسئلة: هل تحتاج إلى صوت؟ هل ستعدّل المقطع بعد مشاهدته؟ وما طول الفيديو النهائي المطلوب؟
جدول المقارنة
| Gemini Omni 1.1 Flash | Veo 3.1 | |
|---|---|---|
| معرف النموذج | gemini-omni-1.1-flash |
veo-3.1-generate-preview (بالإضافة إلى المتغيرات السريعة والخفيفة) |
| واجهة برمجة التطبيقات | Interactions API (/v1beta/interactions) |
generateContent، عملية طويلة الأمد |
| الصوت الأصلي | لا | نعم، متاح دائمًا |
| طول المقطع الأساسي | 10 ثوانٍ | 4، 6، أو 8 ثوانٍ |
| الحد الأقصى للطول عبر التوسيع | 40 ثانية، بخطوات 10 ثوانٍ | 148 ثانية، 7 ثوانٍ في كل مرة، حتى 20 توسيعًا |
| السياق المقروء عند التوسيع | حتى 10 ثوانٍ من اللقطات السابقة | غير مذكور |
| التحرير التفاعلي | نعم، عبر previous_interaction_id
|
لا |
| الإطار الأول والأخير | نعم | نعم، عبر lastFrame
|
| الوسائط المرجعية | حتى 3 مقاطع فيديو مدة كل منها 3 ثوانٍ | حتى 3 صور مرجعية |
| الدقة | 360p، 720p، 1080p، 4K | 720p، 1080p، 4K (720p فقط عند التوسيع) |
| نسب العرض إلى الارتفاع | 16:9، 9:16 | 16:9، 9:16 |
| تكلفة 720p لكل ثانية | ~ 0.10 دولار | 0.40 دولار قياسي، 0.10 دولار سريع، 0.05 دولار خفيف |
| الفئة المجانية | لا | لا |
| علامة مائية | SynthID | SynthID |
متى تستخدم Omni 1.1 Flash؟
التعديل بعد مشاهدة النتيجة
هذه هي الميزة الفارقة. يعمل Omni عبر Interactions API، ما يسمح بإنشاء مقطع ثم إرسال جولة متابعة لتعديله:
res1 = client.interactions.create(
model="gemini-omni-1.1-flash",
input="A woman playing violin outdoors.",
)
res2 = client.interactions.create(
model="gemini-omni-1.1-flash",
previous_interaction_id=res1.id,
input="Make the violin invisible.",
)
لا تحتاج إلى إعادة تحميل الفيديو أو إعادة وصف المشهد. في Veo، كل طلب إنشاء جديد؛ وأي تعديل يتطلب إشعارًا جديدًا وفرصة إنشاء جديدة.
التجربة بتكلفة منخفضة
ينشئ Omni مقاطع 360p بسرعة أعلى قد تصل إلى 60% وبتكلفة تعادل ثلث تكلفة 720p. أما Veo فأقل دقة فيه هي 720p. عند تكرار الإشعار مرات عديدة، يصبح الفرق مهمًا؛ راجع تحليل الأسعار.
استخدام فيديوهات مرجعية
يقبل Omni حتى ثلاثة مقاطع مرجعية، مدة كل منها ثلاث ثوانٍ، ويستخدم حركتها في المشهد الجديد. يقبل Veo صورًا مرجعية فقط. لذلك تفيد مراجع الفيديو عند مطابقة الحركة أو الشخصية عبر عدة لقطات.
الحفاظ على الاتساق عند التوسيع
يقرأ Omni حتى 10 ثوانٍ من اللقطات السابقة قبل المتابعة، بينما يستخدم نموذج المعاينة ثانية واحدة نهائية. يوضح دليل توسيع المشهد إلى 40 ثانية طريقة الاستفادة من ذلك.
متى تستخدم Veo 3.1؟
الحاجة إلى الصوت
ينشئ Veo صوتًا أصليًا مع الفيديو. لا تغطي وثائق Omni إخراج الصوت من الفيديو أو الصوت في المقاطع المرجعية. إذا كان الصوت جزءًا من المنتج النهائي، راجع دليل واجهة برمجة تطبيقات Veo 3.1.
إنشاء فيديو أطول من 40 ثانية
يوسّع Veo المقطع بمقدار 7 ثوانٍ في كل مرة، حتى 20 مرة، ليصل إلى 148 ثانية. يقتصر Omni على 40 ثانية. انتبه إلى أن الفيديو الموسّع عبر Veo يخرج بدقة 720p فقط، لذا يختلف العمل على فيديو طويل عن العمل على فيديو 4K.
خفض تكلفة الثانية
تبلغ تكلفة Veo 3.1 Lite نحو 0.05 دولار لكل ثانية بدقة 720p، أي نصف تكلفة Omni، مع التخلي عن دعم 4K. يناسب ذلك الإنشاء بكميات كبيرة أو التجارب منخفضة التكلفة.
إنشاء مقاطع قصيرة
ينشئ Veo مقاطع مدتها 4 أو 6 ثوانٍ، بينما ينشئ Omni مقاطع مدتها 10 ثوانٍ. عند الحاجة إلى مقطع مدته 4 ثوانٍ، يحاسب Veo على 4 ثوانٍ، في حين يحاسب Omni على 10 ثوانٍ.
القرار في أربعة أسطر
- تحتاج إلى صوت؟ استخدم Veo 3.1.
- تحتاج إلى فيديو أطول من 40 ثانية؟ استخدم Veo 3.1.
- تحتاج إلى تعديل تفاعلي أو تجارب منخفضة التكلفة؟ استخدم Omni 1.1 Flash.
- تحتاج إلى أقل تكلفة ممكنة لكل ثانية؟ استخدم Veo 3.1 Lite.
يمكن الجمع بين النموذجين: استخدم Omni لاستكشاف اللقطة وتثبيتها تفاعليًا، ثم Veo لإنتاج النسخة النهائية مع الصوت. يشترك النموذجان في مفتاح API واحد، لذلك لا توجد تكلفة إعداد إضافية لتشغيلهما معًا.
تكاملان مختلفان
النموذجان نقطتا نهاية مختلفتان من الناحية الهيكلية:
-
Omni: طلب POST إلى
/v1beta/interactions، مع اسم النموذج في جسم الطلب. يعيد الفيديو مضمّنًا بصيغة base64 ما لم يتجاوز حجم الملف 4 ميجابايت؛ عندها يعيد URI. - Veo: عملية طويلة الأمد تحتاج إلى الاستعلام عنها (polling). تبقى الملفات التي ينشئها على خوادم Google لمدة يومين قبل حذفها.
يهم هذا الفرق عند التخطيط لتبديل النموذج لاحقًا. لا يكفي تغيير سلسلة اسم النموذج؛ إذ يجب أن تتعامل طبقة التجريد مع عملية الاستعلام ومع شكلَي الاستجابة. يشرح دليل واجهة برمجة تطبيقات Omni تفاصيل الاستجابة.
قبل بناء التكامل:
- أنشئ طلبًا محفوظًا لكل نموذج في Apidog.
- خزّن مفتاح API في متغير بيئة.
- تحقّق من شكل الاستجابة.
- اضبط مهلات انتظار أطول بكثير من الإعدادات الافتراضية.
- شغّل الإشعار نفسه عبر الطلبين المحفوظين لمقارنة النتائج.
الأسئلة الشائعة
هل Gemini Omni بديل لـ Veo؟
لا. تطرح Google النموذجين معًا، ولم يتم إيقاف Veo 3.1. إنهما أداتان مختلفتان لإنشاء الفيديو.
أيهما أرخص؟
عند دقة 720p، تبلغ تكلفة Omni نحو 0.10 دولار/ثانية، وهي مماثلة لتكلفة Veo 3.1 Fast. تبلغ تكلفة Veo 3.1 Lite نحو 0.05 دولار/ثانية، بينما تبلغ تكلفة Veo 3.1 القياسي 0.40 دولار/ثانية.
هل يمكن لأي منهما إنشاء فيديو بحوار؟
ينشئ Veo صوتًا أصليًا. لا تغطي وثائق Omni إنشاء الصوت، ولا يمكنه إضافة حوار عند توسيع فيديو تم تحميله.
هل يضع كلاهما علامة مائية؟
نعم. يطبق كلاهما SynthID، وهي علامة غير مرئية للمشاهدين وقابلة للاكتشاف برمجيًا.
ماذا عن Sora أو واجهات برمجة تطبيقات الفيديو الأخرى؟
للمقارنة خارج منتجات Google، راجع OpenAI Sora 2 وSeedance 1.0.
بأي نموذج أبدأ؟
لإنشاء نموذج أولي دون صوت، ابدأ بـ Omni بدقة 360p. إنها طريقة منخفضة التكلفة للتحقق من أن الفيديو المُنشأ يلبي احتياجك. نزّل Apidog واحفظ الطلب الأول لتجعل المقارنة قابلة للتكرار.
الخلاصة
Veo يعرض، وOmni يتفاعل. تغطي وثائق Google لإنشاء الفيديو النموذجين، لذا اختر حسب متطلبات المهمة: الصوت والطول يدفعان نحو Veo، بينما التعديل التفاعلي والتجربة منخفضة التكلفة يدفعان نحو Omni.
Top comments (0)