DEV Community

Cover image for Gemini Omni 1.1 Flash: Novedades del modelo de video de IA de Google
Roobia
Roobia

Posted on Originally published at apidog.com

Gemini Omni 1.1 Flash: Novedades del modelo de video de IA de Google

Google puso su modelo de video conversacional a disposición general el 27 de agosto de 2026. El ID del modelo es gemini-omni-1.1-flash y reemplaza al punto final gemini-omni-flash-preview, lanzado en vista previa pública el 30 de junio. Si utiliza la vista previa, debe migrar antes de que Google desactive ese punto final el 30 de septiembre de 2026.

Prueba Apidog hoy

El lanzamiento GA incluye cuatro capacidades que facilitan el uso del modelo en producción: extensión de escenas hasta 40 segundos, control del primer y último fotograma, un modo borrador económico en 360p y escalado a 4K. Aquí se resumen los cambios, el costo, dónde se ejecuta el modelo y sus limitaciones actuales.

Si necesitas contexto sobre la familia Omni y el motivo por el que Google creó un modelo de video centrado en el razonamiento, consulta qué es Gemini Omni. Este artículo se centra en los detalles de la versión 1.1.

Qué hace Gemini Omni 1.1 Flash

Omni 1.1 Flash recibe texto, imágenes y video, y devuelve video. Se ejecuta mediante la API de Interacciones, no generateContent. Esta API permite mantener el estado entre turnos: puedes generar un clip y después editarlo sin volver a subirlo.

El modelo admite cinco tipos de tareas:

  • Texto a video: convierte una instrucción (prompt) en un clip.
  • Imagen a video: utiliza una imagen como fotograma inicial o guía de estilo.
  • Referencia a video: acepta hasta tres clips de referencia de tres segundos para transferir movimiento, apariencia y consistencia del personaje.
  • Editar: modifica un video generado previamente dentro de la conversación.
  • Extender: añade 10 segundos al final de un clip.

El audio de los clips de referencia se ignora; el modelo solo analiza el movimiento y la apariencia.

Extensión de escenas con 10 segundos de contexto

Este es el cambio principal. La vista previa analizaba únicamente el último segundo del clip, suficiente para mantener una paleta de colores, pero no siempre la continuidad de personajes o movimientos de cámara. Podías extender un video, pero no necesariamente una toma.

Omni 1.1 analiza hasta 10 segundos de contexto y ofrece una "consistencia visual y adherencia narrativa mejoradas". Las extensiones se generan en incrementos de 10 segundos, hasta un máximo acumulado de 40 segundos.

Ten en cuenta estas restricciones:

  • Solo puedes añadir contenido al final; no es posible anteponer metraje ni insertar escenas en el medio.
  • Los videos subidos tienen un máximo de 10 segundos, salvo que permanezcan dentro de una interacción de varios turnos en la que el modelo conserve el estado anterior.

El tutorial de extensión de escenas de 40 segundos muestra la estructura de la solicitud y cómo aparecen las uniones.

Control del primer y último fotograma

Puedes proporcionar un primer fotograma, un último fotograma y un prompt que describa el movimiento entre ambos. El modelo genera el metraje que conecta las dos imágenes. Google destaca como casos de uso las órbitas de cámara, las transiciones de zoom y los clips en bucle.

Para una herramienta de producción, esta capacidad vuelve la salida más predecible. El texto a video deja todos los fotogramas abiertos a interpretación; la interpolación fija los extremos y reduce el espacio de posibles resultados.

Borradores en 360p y costos

Omni 1.1 genera previsualizaciones en 360p hasta un 60 % más rápido que en 720p y a un tercio del costo. El flujo recomendado por Google es:

  1. Iterar en 360p hasta validar el prompt.
  2. Renderizar la versión final en 720p, 1080p o 4K.

La generación de video se factura por segundo y gran parte de las iteraciones se descarta. Reducir el costo de esas pasadas permite experimentar sin racionar los intentos. Consulta el desglose completo de precios para ver el cálculo por segundo.

La resolución se define en el formato de respuesta. 1080p y 4k son escalados de los fotogramas generados, no renders nativos.

Dónde se ejecuta

Omni 1.1 Flash está disponible mediante:

  • La API de Gemini en Google AI Studio, para desarrolladores.
  • La API de la Plataforma de Agentes Empresariales de Gemini, para implementaciones empresariales.
  • Google Flow, para suscriptores de AI Plus, Pro y Ultra.
  • La aplicación Gemini, donde los suscriptores pueden usar la extensión de escenas.

Google también anunció socios que ejecutan el modelo dentro de sus propios productos: Adobe Firefly, Figma Weave, Runway y GMI Cloud.

La API no tiene capa gratuita. A diferencia de los modelos Flash de texto, donde AI Studio ofrece un carril gratuito con límite de tasa, cada segundo de salida de Omni se factura desde la primera solicitud. El modelo sí es gratuito en YouTube Shorts y YouTube Create, productos diferentes con límites distintos. El resumen de acceso gratuito detalla cada alternativa.

Limitaciones actuales

Considera estas restricciones antes de diseñar una función basada en el modelo:

  • Controles de generación: no son compatibles las instrucciones del sistema, temperature, top_p, las secuencias de detención ni las instrucciones negativas. Para excluir algo, debes indicarlo en el prompt normal.
  • Regiones: la carga y edición de videos no están disponibles en el Espacio Económico Europeo, Suiza ni el Reino Unido. Tampoco se permite editar imágenes que contengan menores. Los videos generados por el modelo sí pueden editarse en esas regiones.
  • Personas reconocibles: la edición de ciertos individuos identificables está bloqueada.
  • Diálogo en videos subidos: puedes extender un clip subido en silencio o trabajar en varios turnos, pero no añadir diálogo al extender el video de otra persona.
  • Razonamiento con video: solo procesa un video de entrada a la vez.
  • Idiomas: el inglés es el único idioma completamente compatible; Google no ha probado los demás.

Cada salida incluye una marca de agua SynthID, invisible para los espectadores y detectable mediante programación. Tenlo en cuenta si tu producto hace afirmaciones sobre procedencia.

¿Omni 1.1 Flash o Veo 3.1?

Google ofrece dos familias de generación de video con la misma clave API:

  • Veo 3.1: renderizador cinematográfico con generación de audio nativo.
  • Omni 1.1 Flash: modelo conversacional para edición y generación en varios turnos.

Un segundo de video Omni en 720p cuesta aproximadamente una cuarta parte de un segundo estándar de Veo 3.1. Veo no ofrece un equivalente al bucle de edición conversacional.

La comparación lado a lado analiza cuándo usar cada familia. Si ya tienes una integración de Veo, la guía de la API de Veo 3.1 sigue siendo válida.

Migración desde la vista previa

Todo lo que utilice gemini-omni-flash-preview dejará de funcionar después del 30 de septiembre de 2026. La migración suele consistir en cambiar la cadena del modelo, pero verifica también lo siguiente:

  • Resolución predeterminada: ahora es 720p. 360p y 4K son opciones nuevas. Si tu código espera un tamaño fijo, comprueba el resultado real.
  • Tamaño de respuesta: los videos de más de 4 MB se devuelven como una URI en lugar de base64 en línea. Si tu manejador solo lee output_video.data, una resolución mayor podría devolver datos vacíos.

La forma más segura de detectar ambos cambios es guardar la solicitud en un cliente de API y comparar las respuestas usando los dos IDs de modelo. Apidog permite colocar el ID del modelo en una variable de entorno, reutilizar una solicitud guardada, cambiar de entorno y comparar las respuestas. El tutorial de la API explica el proceso paso a paso.

Preguntas frecuentes

¿Cuál es el ID del modelo para Gemini Omni 1.1 Flash?

gemini-omni-1.1-flash. El ID de vista previa que se retirará es gemini-omni-flash-preview.

¿Cuándo salió Gemini Omni 1.1 Flash?

El 27 de agosto de 2026 como lanzamiento GA. La vista previa se lanzó el 30 de junio de 2026.

¿Es gratuito Gemini Omni 1.1 Flash?

No. Omni no tiene capa gratuita y cada generación se factura. Los modelos de texto, como Gemini 3.6 Flash, todavía tienen un carril gratuito en AI Studio.

¿Qué duración puede tener un video de Gemini Omni?

Los clips se generan en segmentos de 10 segundos. La extensión de escenas permite llegar hasta 40 segundos acumulativos, en pasos de 10 segundos.

¿Gemini Omni genera audio?

La documentación cubre la salida de video e ignora el audio de los clips de referencia. Veo 3.1 es el modelo con generación de audio nativo; consulta la guía de la API de Veo 3.1 si el sonido es importante.

¿Puedo editar un video que grabé?

Sí, con una entrada de hasta 10 segundos y fuera del EEE, Suiza y el Reino Unido. Súbelo mediante la API de Archivos y pasa la URI como entrada.

Gemini Omni 1.1 Flash incorpora tres mejoras prácticas para producción: extensión de escenas con continuidad, fotogramas clave para controlar la salida y borradores en 360p para iterar con menor costo. Conecta una solicitud guardada al ID del modelo GA, valida la respuesta en cada resolución que utilizarás y desactiva la vista previa antes de finales de septiembre. Descarga Apidog para guardar esa verificación antes de la fecha límite.

Top comments (0)