Google a rendu son modèle vidéo conversationnel généralement disponible le 27 août 2026. Son identifiant est gemini-omni-1.1-flash. Il remplace le point de terminaison gemini-omni-flash-preview, lancé en préversion publique le 30 juin. Si vous utilisez cette préversion, migrez avant le 30 septembre 2026 : Google désactivera alors le point de terminaison de préversion.
Essayez Apidog dès aujourd’hui
La version GA apporte quatre nouveautés importantes pour la production : extension de scène jusqu’à 40 secondes, contrôle de la première et de la dernière image, mode brouillon 360p et mise à l’échelle 4K. Cet article couvre les capacités, les limites, le coût, les environnements disponibles et la migration depuis la préversion.
Pour découvrir l’historique de la famille Omni et les raisons du développement d’un modèle vidéo orienté raisonnement, consultez Qu’est-ce que Gemini Omni ?. La suite se concentre sur la version 1.1.
Ce que fait Gemini Omni 1.1 Flash
Omni 1.1 Flash accepte du texte, des images et des vidéos en entrée, puis génère une vidéo. Il s’exécute via l’API Interactions, et non generateContent. Cette interface permet d’envoyer des requêtes de suivi dans la même interaction : vous pouvez donc modifier une vidéo générée sans la télécharger à nouveau.
Les cinq tâches prises en charge sont :
- Texte vers vidéo : générer un clip à partir d’une invite.
- Image vers vidéo : utiliser une image comme première image ou comme référence stylistique.
- Référence vers vidéo : utiliser jusqu’à trois clips de référence de trois secondes pour guider le mouvement, l’apparence et la cohérence des personnages.
- Modifier : transformer une vidéo déjà générée dans une interaction conversationnelle.
- Étendre : ajouter 10 secondes à la fin d’un clip.
L’audio des clips de référence est ignoré. Le modèle les analyse uniquement pour le mouvement et l’apparence.
Étendre une scène avec 10 secondes de contexte
La principale amélioration concerne l’extension de scène. La préversion n’analysait que la dernière seconde du clip. Cela suffisait à conserver une palette de couleurs, mais pas la continuité des personnages ou des mouvements de caméra.
Omni 1.1 analyse jusqu’à 10 secondes de contexte antérieur, ce qui améliore la cohérence visuelle et l’adhérence narrative. Vous pouvez ajouter des segments de 10 secondes, jusqu’à une durée cumulative de 40 secondes.
À retenir :
- l’extension se fait uniquement à la fin du clip ;
- vous ne pouvez pas insérer une séquence au milieu ni en ajouter au début ;
- une vidéo téléchargée est limitée à 10 secondes en entrée ;
- dans une interaction multi-tour, l’état précédent est conservé.
Le guide de l’extension de scène jusqu’à 40 secondes détaille la structure des requêtes et les points où les raccords peuvent apparaître.
Contrôler la première et la dernière image
Vous pouvez désormais fournir une image de départ, une image de fin et une invite décrivant le mouvement entre les deux. Le modèle génère la séquence intermédiaire.
Cette fonction convient notamment aux :
- orbites de caméra ;
- transitions avec zoom ;
- clips en boucle ;
- animations reliant deux états visuels précis.
Pour un produit vidéo, cette approche est plus prévisible que le texte vers vidéo seul. Deux images fixes définissent les contraintes de départ et d’arrivée ; le modèle n’a plus qu’à résoudre la transition.
Le mode brouillon 360p réduit le coût d’itération
Omni 1.1 génère des prévisualisations 360p jusqu’à 60 % plus rapidement que le 720p, pour un tiers du coût. Le flux de travail recommandé est simple :
- tester les invites en 360p ;
- sélectionner la version satisfaisante ;
- générer la sortie finale en 720p, 1080p ou 4K.
La génération vidéo étant facturée à la seconde, cette approche évite de payer le prix fort pour des essais qui seront abandonnés. La répartition complète des prix détaille le calcul par seconde.
La résolution se définit dans le format de réponse. Les sorties 1080p et 4k sont des mises à l’échelle des images générées, et non des rendus natifs.
Où utiliser Omni 1.1 Flash
Le modèle est disponible via :
- l’API Gemini dans Google AI Studio ;
- l’API Gemini Enterprise Agent Platform ;
- Google Flow, pour les abonnés AI Plus, Pro et Ultra ;
- l’application Gemini, notamment pour l’extension de scène.
Google a également annoncé des partenaires qui utilisent le modèle dans leurs produits : Adobe Firefly, Figma Weave, Runway et GMI Cloud.
Pas de niveau gratuit sur l’API
Contrairement aux modèles texte Flash, pour lesquels AI Studio propose une offre gratuite à débit limité, Omni est facturé dès la première requête. Chaque seconde de vidéo générée est payante.
Le modèle est gratuit sur YouTube Shorts et YouTube Create, mais ces produits disposent de limites distinctes. Le récapitulatif des accès gratuits compare les différentes options.
Limites à vérifier avant l’intégration
Avant de construire une fonctionnalité autour du modèle, vérifiez les points suivants :
-
Paramètres de génération limités : les instructions système,
temperature,top_p, les séquences d’arrêt et les invites négatives ne sont pas pris en charge. Pour exclure un élément, indiquez-le dans l’invite standard. - Restrictions régionales : le téléchargement et l’édition de vidéos ne sont pas disponibles dans l’Espace économique européen, en Suisse et au Royaume-Uni. L’édition d’images contenant des mineurs est également restreinte. Les vidéos générées par le modèle restent modifiables dans ces régions.
- Personnes reconnaissables : la modification de certains individus identifiables est bloquée.
- Dialogue sur une vidéo téléchargée : vous pouvez étendre silencieusement un clip téléchargé ou travailler dans une interaction multi-tour, mais vous ne pouvez pas ajouter de dialogue en étendant la vidéo d’une autre personne.
- Une seule vidéo pour le raisonnement : le modèle ne raisonne pas sur plusieurs vidéos d’entrée.
- Langues : l’anglais est entièrement pris en charge. Google indique que les autres langues ne sont pas testées.
Chaque sortie contient un filigrane SynthID invisible à l’œil nu et détectable par programmation. Tenez-en compte si votre produit revendique une provenance vérifiable.
Omni 1.1 Flash ou Veo 3.1 ?
Google propose désormais deux familles de génération vidéo accessibles avec la même clé API :
- Veo 3.1 : rendu cinématographique avec génération audio native ;
- Omni 1.1 Flash : modèle vidéo conversationnel conçu pour les interactions multi-tour et les modifications successives.
Une seconde de vidéo Omni en 720p coûte environ un quart du prix d’une seconde standard de Veo 3.1. Veo ne propose pas d’équivalent à la boucle d’édition multi-tour d’Omni.
La comparaison entre Gemini Omni 1.1 Flash et Veo 3.1 présente les cas d’utilisation adaptés à chaque modèle. Si vous utilisez déjà Veo, consultez le guide de l’API Veo 3.1 : cette version ne le déprécie pas.
Migrer depuis gemini-omni-flash-preview
Toute intégration utilisant gemini-omni-flash-preview cessera de fonctionner après le 30 septembre 2026. Dans la plupart des cas, la migration consiste à remplacer l’identifiant du modèle :
gemini-omni-flash-preview
par :
gemini-omni-1.1-flash
Vérifiez cependant les deux points suivants.
1. Résolution par défaut
Le 720p est désormais la résolution par défaut. Les options 360p et 4K sont nouvelles. Si votre application suppose une taille de sortie fixe, inspectez la réponse réelle avant de déployer.
2. Format de la réponse
Les vidéos de plus de 4 Mo sont renvoyées sous forme d’URI plutôt que dans un champ base64 intégré. Un gestionnaire qui ne lit que output_video.data peut donc sembler ne rien recevoir lorsque vous augmentez la résolution.
Pour comparer les deux versions :
- enregistrez la requête dans un client API ;
- placez l’identifiant du modèle dans une variable d’environnement ;
- exécutez la même requête avec les deux modèles ;
- comparez la résolution et le format de la réponse ;
- basculez vers la version GA après validation.
Apidog facilite ce test : conservez une requête enregistrée, changez d’environnement et comparez les réponses. Le guide de l’API Gemini Omni 1.1 Flash décrit la procédure complète.
FAQ
Quel est l’identifiant de Gemini Omni 1.1 Flash ?
gemini-omni-1.1-flash. L’identifiant de préversion supprimé le 30 septembre 2026 est gemini-omni-flash-preview.
Quand Gemini Omni 1.1 Flash est-il sorti ?
Le 27 août 2026, en disponibilité générale. La préversion avait été lancée le 30 juin 2026.
Gemini Omni 1.1 Flash est-il gratuit ?
Non. Il n’existe pas de niveau gratuit pour Omni et chaque génération est facturée. Les modèles texte, comme Gemini 3.6 Flash, disposent toujours d’une voie gratuite dans AI Studio.
Quelle est la durée maximale d’une vidéo Gemini Omni ?
Un clip initial dure 10 secondes. L’extension ajoute des segments de 10 secondes, jusqu’à un total de 40 secondes.
Gemini Omni génère-t-il de l’audio ?
La documentation couvre la sortie vidéo et précise que l’audio des clips de référence est ignoré. Veo 3.1 est le modèle avec génération audio native. Si le son est essentiel, commencez par le guide de l’API Veo 3.1.
Puis-je modifier une vidéo filmée avec mon propre appareil ?
Oui, pour une vidéo d’entrée de 10 secondes maximum, hors Espace économique européen, Suisse et Royaume-Uni. Téléchargez la vidéo avec l’API Files et transmettez son URI au modèle.
Conclusion
Omni 1.1 Flash est la première version de la famille qui semble prête pour une intégration en production. L’extension de scène améliore la continuité, les images clés rendent les transitions plus prévisibles et le mode brouillon 360p rend les itérations abordables.
Configurez une requête enregistrée avec l’identifiant GA, testez chaque résolution utilisée par votre application et migrez avant la fin septembre. Téléchargez Apidog pour conserver cette vérification dans votre workflow.
Top comments (0)