Gemini 3.6 Flash es el nuevo modelo “caballo de batalla” de Google. Estuvo disponible públicamente el 21 de julio de 2026 y reemplaza a Gemini 3.5 Flash con menor costo y mayor eficiencia de tokens. Si procesas tráfico API de alto volumen y necesitas resultados sólidos sin pagar precios de un modelo insignia, este es el nivel diseñado para ese caso de uso.
Esta guía explica qué cambió, sus especificaciones, precios, rendimiento y acceso. También incluye una forma práctica de probar la API y crear pruebas de regresión para validar el comportamiento del modelo con tus propios prompts, datos y límites de contexto.
¿Qué es Gemini 3.6 Flash?
Gemini 3.6 Flash es el modelo de rendimiento medio de la familia Gemini. Está orientado a las tareas que suelen concentrar el tráfico de producción:
- Resumen y extracción de información.
- Clasificación de contenido.
- Chat y asistentes.
- Llamadas a herramientas en varios pasos.
- Procesamiento multimodal de texto, imágenes, video, audio y PDF.
La salida del modelo es solo texto, pero puede recibir varias modalidades en una misma solicitud.
Google lanzó tres modelos el 21 de julio de 2026:
- Gemini 3.6 Flash: modelo principal para cargas de trabajo generales.
- Gemini 3.5 Flash-Lite: alternativa más económica y rápida para alto volumen.
- Gemini 3.5 Flash Cyber: modelo de seguridad restringido para gobiernos y socios de confianza.
Consulta los detalles de cada alternativa:
Ten cuidado con las ID de modelo: las versiones no son uniformes entre niveles.
gemini-3.6-flash
gemini-3.5-flash-lite
No son variantes equivalentes ni un error tipográfico. gemini-3.6-flash es el modelo principal; gemini-3.5-flash-lite es el nivel económico.
Google publicó el anuncio en el blog de Google, y la tarjeta del modelo está disponible en la página de DeepMind Flash.
Novedades frente a Gemini 3.5 Flash
El cambio principal es la eficiencia. Gemini 3.6 Flash utiliza aproximadamente un 17 % menos de tokens de salida que Gemini 3.5 Flash para completar el mismo trabajo.
En una integración de producción, esto impacta dos métricas directamente:
- Costo: los tokens de salida tienen un precio superior a los de entrada.
- Latencia: menos tokens generados suelen implicar respuestas más rápidas.
También baja el precio de salida:
| Modelo | Precio de salida por 1M de tokens |
|---|---|
| Gemini 3.5 Flash | $9.00 |
| Gemini 3.6 Flash | $7.50 |
Gemini 3.6 Flash también mejora en codificación, uso de computadoras y flujos de trabajo con herramientas. Para agentes, reducir pasos de razonamiento y llamadas a herramientas puede disminuir tanto la latencia total como el costo por ejecución.
Antes de migrar tráfico existente, compara prompts representativos, longitud de respuestas, uso de herramientas y tasa de errores. Para un análisis de las diferencias, consulta Gemini 3.6 Flash vs 3.5 Flash.
Especificaciones de Gemini 3.6 Flash
| Atributo | Gemini 3.6 Flash |
|---|---|
| ID de modelo | gemini-3.6-flash |
| Ventana de contexto de entrada | 1M tokens |
| Salida máxima | 64k tokens |
| Modalidades de entrada | Texto, imagen, video, audio, PDF |
| Salida | Solo texto |
| Precio de entrada | $1.50 por 1M de tokens |
| Precio de salida | $7.50 por 1M de tokens, incluidos los tokens de pensamiento |
| Nivel gratuito | Sí, mediante Google AI Studio, con límite de tarifa |
| Lanzamiento | 21 de julio de 2026 |
La ventana de contexto de 1M de tokens permite trabajar con documentos extensos, transcripciones largas o bases de código completas en una sola solicitud.
El límite de salida de 64k tokens aplica a una respuesta individual. Si necesitas generar contenido más largo, divide el proceso en varias llamadas y conserva el estado o los resúmenes intermedios.
Cómo se desempeña
Los benchmarks ayudan a identificar fortalezas, pero no sustituyen una evaluación con tus propios casos de uso.
Según las suites públicas reportadas por Google, Gemini 3.6 Flash obtiene:
| Benchmark | Resultado | Qué mide |
|---|---|---|
| SWE-Bench Pro | 58.7 % | Resolución de problemas reales de GitHub en repositorios de producción |
| DeepSWE v1.1 | 49 % | Ingeniería de software |
| Terminal-bench 2.1 | 78.0 % | Ejecución de comandos en un terminal real |
| OSWorld-Verified | 83.0 % | Uso de escritorio y aplicaciones |
| GDPVal-AA v2 | Elo 1421 | Tareas profesionales del mundo real |
En uso de computadoras, Gemini 3.6 Flash alcanza un 83.0 % en OSWorld-Verified, frente al 78.4 % de Gemini 3.5 Flash. Si construyes agentes que operan interfaces gráficas, esta diferencia es relevante.
El contexto largo requiere validación específica. Con 128k tokens, el modelo promedia un 91.8 % en recuperación. Cerca de la ventana completa de 1M de tokens, la recuperación puntual cae al 54.0 %.
En la práctica:
- No asumas recuperación perfecta al llenar el contexto.
- Crea pruebas con la longitud real de tus documentos.
- Inserta datos conocidos en distintas posiciones del prompt.
- Mide si el modelo recupera correctamente información al inicio, medio y final del contexto.
Precios de un vistazo
Gemini 3.6 Flash tiene los siguientes precios:
Entrada: $1.50 por 1M de tokens
Salida: $7.50 por 1M de tokens
El precio de salida incluye tokens de pensamiento. Aunque esos tokens no aparezcan en la respuesta final, cuentan para la facturación.
El almacenamiento en caché de contexto cuesta:
$0.15 por 1M de tokens
+ $1.00 por 1M de tokens por hora de almacenamiento
El caché puede ser útil si reutilizas repetidamente un prompt grande, como una base de conocimiento, documentación técnica o una especificación extensa.
Google AI Studio incluye un nivel gratuito con límite de tarifa. Está orientado a prototipos, no a tráfico de producción, y Google puede usar los datos de ese nivel para mejorar sus productos.
Más información:
Cómo acceder a Gemini 3.6 Flash
Puedes acceder al modelo desde varias superficies de Google:
-
API de Gemini mediante Google AI Studio. Obtén una clave API y llama a
gemini-3.6-flashdesde REST o un SDK. - Google Antigravity, la superficie de desarrollo de agentes de Google.
- Plataforma de Agentes Empresariales Gemini, para equipos que crean agentes gobernados.
- Aplicación Gemini, para interactuar con el modelo directamente.
Para la mayoría de los desarrolladores, la ruta principal es la API.
El flujo básico es:
- Crea una clave API en Google AI Studio.
- Configura la clave como variable de entorno.
- Envía una solicitud al endpoint de Gemini usando
gemini-3.6-flash. - Registra tokens, latencia, respuestas y errores.
- Convierte los casos críticos en pruebas de regresión.
Consulta:
Dónde encaja en la línea de productos de Google
Piensa en estos modelos como una escalera de costo y calidad:
| Modelo | Caso de uso principal |
|---|---|
| Gemini 3.5 Flash-Lite | Alto volumen, baja latencia y tareas menos complejas |
| Gemini 3.6 Flash | Tareas generales de producción, agentes y flujos con herramientas |
| Gemini 3.5 Pro | Aún no disponible públicamente |
| Gemini 4 | Anticipado, pero no lanzado |
Gemini 3.5 Flash-Lite cuesta $0.30 por millón de tokens de entrada y $2.50 por millón de tokens de salida. Google indica una velocidad aproximada de 350 tokens de salida por segundo.
Usa Flash-Lite cuando priorices costo y latencia. Usa Gemini 3.6 Flash cuando necesites respuestas más confiables, mejor rendimiento en código o mayor capacidad en tareas de agente.
Gemini 3.5 Pro todavía no está disponible al público. Google indica que continúa probándolo con socios. Google también anticipó una ejecución de preentrenamiento de Gemini 4, pero no es un modelo que puedas llamar actualmente.
Para conocer la generación anterior, revisa qué es Gemini 3.5.
Probando Gemini 3.6 Flash en Apidog
Los benchmarks reflejan resultados controlados. Para saber cómo responde el modelo a tus prompts, documentos y herramientas, necesitas enviar solicitudes reales y validar sus resultados.
Apidog permite tratar el endpoint de Gemini como cualquier otra API REST. Puedes crear solicitudes, gestionar variables, inspeccionar respuestas y automatizar pruebas.
Configuración recomendada
- Crea una solicitud
POSTpara el endpoint de la API de Gemini. - Configura el modelo como
gemini-3.6-flash. - Guarda la clave API en una variable de entorno, no en la URL ni en el cuerpo de la solicitud.
- Crea entornos separados para desarrollo, pruebas y producción.
- Envía una solicitud base y guarda una respuesta válida como referencia.
- Añade aserciones para validar el contrato de respuesta.
- Programa la ejecución de la prueba para detectar cambios.
Por ejemplo, tus validaciones deben cubrir al menos:
- Código HTTP exitoso.
- Presencia de los campos JSON que utiliza tu aplicación.
- Contenido no vacío.
- Límites de latencia aceptables.
- Ausencia de errores de seguridad o bloqueo inesperados.
- Formato de salida estructurada, si esperas JSON.
Una estrategia de regresión práctica es mantener un conjunto de prompts con distintos perfiles:
- Prompt corto de clasificación
- Prompt de extracción desde PDF
- Prompt con contexto largo
- Prompt de generación de código
- Prompt con llamada a herramienta
- Prompt que exige salida JSON
Después, compara entre versiones:
gemini-3.5-flash
gemini-3.6-flash
No evalúes solo si la solicitud devuelve 200 OK. Compara precisión, estructura, tokens de salida, tiempo de respuesta y comportamiento ante entradas difíciles.
Puedes programar la ejecución de pruebas de API para detectar cambios de esquema, latencia o resultados después de una actualización del modelo.
Apidog no ejecuta el modelo ni sustituye un framework de IA. Funciona como la capa para construir solicitudes, enviarlas y verificar que la respuesta cumpla el estándar definido por tu equipo. Descarga Apidog para configurar tu primera prueba.
Preguntas frecuentes
¿Es Gemini 3.6 Flash gratuito?
Hay un nivel gratuito a través de Google AI Studio, con límite de tarifa y orientado a prototipos. Google puede usar los datos del nivel gratuito para mejorar sus productos.
Para producción, el precio es de $1.50 por millón de tokens de entrada y $7.50 por millón de tokens de salida.
¿Es Gemini 3.6 Flash mejor que Gemini 3.5 Flash?
Para la mayoría de las cargas de trabajo, sí. Utiliza aproximadamente un 17 % menos de tokens de salida, reduce el precio de salida de $9.00 a $7.50 por millón de tokens y mejora en codificación y uso de computadoras.
En OSWorld-Verified, sube de 78.4 % a 83.0 %.
¿Ha salido Gemini 3.5 Pro?
No. Google indica que todavía prueba Gemini 3.5 Pro con socios, por lo que no existe un modelo Pro público en esta versión.
Gemini 4 fue anticipado, pero tampoco se ha lanzado.
¿Cuál es la ID del modelo?
La ID es:
gemini-3.6-flash
No la confundas con:
gemini-3.5-flash-lite
Flash-Lite es un nivel distinto y más económico.
¿Qué no puede hacer Gemini 3.6 Flash?
Gemini 3.6 Flash solo genera texto. Puede aceptar imágenes, audio, video y PDF como entrada, pero no crea esas modalidades como salida.
También debes considerar que:
- La recuperación disminuye cerca del límite de contexto de 1M de tokens.
- La recuperación puntual a máxima longitud es de alrededor del 54.0 %.
- Es un modelo de nivel medio, no un modelo insignia para razonamiento de frontera.
Gemini 3.6 Flash es una opción práctica para la mayor parte del tráfico de la API de Gemini: reduce costos, usa menos tokens de salida y mejora en tareas de agente frente a Gemini 3.5 Flash. Antes de migrar a gran escala, valida tus prompts críticos con pruebas guardadas y mide el comportamiento en tu propio entorno.


Top comments (0)