DEV Community

Cover image for ¿Qué es Gemini 3.6 Flash?
Roobia
Roobia

Posted on • Originally published at apidog.com

¿Qué es Gemini 3.6 Flash?

Gemini 3.6 Flash es el nuevo modelo “caballo de batalla” de Google. Estuvo disponible públicamente el 21 de julio de 2026 y reemplaza a Gemini 3.5 Flash con menor costo y mayor eficiencia de tokens. Si procesas tráfico API de alto volumen y necesitas resultados sólidos sin pagar precios de un modelo insignia, este es el nivel diseñado para ese caso de uso.

Prueba Apidog hoy

Esta guía explica qué cambió, sus especificaciones, precios, rendimiento y acceso. También incluye una forma práctica de probar la API y crear pruebas de regresión para validar el comportamiento del modelo con tus propios prompts, datos y límites de contexto.

¿Qué es Gemini 3.6 Flash?

Gemini 3.6 Flash es el modelo de rendimiento medio de la familia Gemini. Está orientado a las tareas que suelen concentrar el tráfico de producción:

  • Resumen y extracción de información.
  • Clasificación de contenido.
  • Chat y asistentes.
  • Llamadas a herramientas en varios pasos.
  • Procesamiento multimodal de texto, imágenes, video, audio y PDF.

La salida del modelo es solo texto, pero puede recibir varias modalidades en una misma solicitud.

Gemini 3.6 Flash

Google lanzó tres modelos el 21 de julio de 2026:

  • Gemini 3.6 Flash: modelo principal para cargas de trabajo generales.
  • Gemini 3.5 Flash-Lite: alternativa más económica y rápida para alto volumen.
  • Gemini 3.5 Flash Cyber: modelo de seguridad restringido para gobiernos y socios de confianza.

Consulta los detalles de cada alternativa:

Familia Gemini Flash

Ten cuidado con las ID de modelo: las versiones no son uniformes entre niveles.

gemini-3.6-flash
gemini-3.5-flash-lite
Enter fullscreen mode Exit fullscreen mode

No son variantes equivalentes ni un error tipográfico. gemini-3.6-flash es el modelo principal; gemini-3.5-flash-lite es el nivel económico.

Google publicó el anuncio en el blog de Google, y la tarjeta del modelo está disponible en la página de DeepMind Flash.

Novedades frente a Gemini 3.5 Flash

El cambio principal es la eficiencia. Gemini 3.6 Flash utiliza aproximadamente un 17 % menos de tokens de salida que Gemini 3.5 Flash para completar el mismo trabajo.

En una integración de producción, esto impacta dos métricas directamente:

  1. Costo: los tokens de salida tienen un precio superior a los de entrada.
  2. Latencia: menos tokens generados suelen implicar respuestas más rápidas.

También baja el precio de salida:

Modelo Precio de salida por 1M de tokens
Gemini 3.5 Flash $9.00
Gemini 3.6 Flash $7.50

Gemini 3.6 Flash también mejora en codificación, uso de computadoras y flujos de trabajo con herramientas. Para agentes, reducir pasos de razonamiento y llamadas a herramientas puede disminuir tanto la latencia total como el costo por ejecución.

Antes de migrar tráfico existente, compara prompts representativos, longitud de respuestas, uso de herramientas y tasa de errores. Para un análisis de las diferencias, consulta Gemini 3.6 Flash vs 3.5 Flash.

Especificaciones de Gemini 3.6 Flash

Atributo Gemini 3.6 Flash
ID de modelo gemini-3.6-flash
Ventana de contexto de entrada 1M tokens
Salida máxima 64k tokens
Modalidades de entrada Texto, imagen, video, audio, PDF
Salida Solo texto
Precio de entrada $1.50 por 1M de tokens
Precio de salida $7.50 por 1M de tokens, incluidos los tokens de pensamiento
Nivel gratuito Sí, mediante Google AI Studio, con límite de tarifa
Lanzamiento 21 de julio de 2026

La ventana de contexto de 1M de tokens permite trabajar con documentos extensos, transcripciones largas o bases de código completas en una sola solicitud.

El límite de salida de 64k tokens aplica a una respuesta individual. Si necesitas generar contenido más largo, divide el proceso en varias llamadas y conserva el estado o los resúmenes intermedios.

Cómo se desempeña

Los benchmarks ayudan a identificar fortalezas, pero no sustituyen una evaluación con tus propios casos de uso.

Según las suites públicas reportadas por Google, Gemini 3.6 Flash obtiene:

Benchmark Resultado Qué mide
SWE-Bench Pro 58.7 % Resolución de problemas reales de GitHub en repositorios de producción
DeepSWE v1.1 49 % Ingeniería de software
Terminal-bench 2.1 78.0 % Ejecución de comandos en un terminal real
OSWorld-Verified 83.0 % Uso de escritorio y aplicaciones
GDPVal-AA v2 Elo 1421 Tareas profesionales del mundo real

En uso de computadoras, Gemini 3.6 Flash alcanza un 83.0 % en OSWorld-Verified, frente al 78.4 % de Gemini 3.5 Flash. Si construyes agentes que operan interfaces gráficas, esta diferencia es relevante.

El contexto largo requiere validación específica. Con 128k tokens, el modelo promedia un 91.8 % en recuperación. Cerca de la ventana completa de 1M de tokens, la recuperación puntual cae al 54.0 %.

En la práctica:

  • No asumas recuperación perfecta al llenar el contexto.
  • Crea pruebas con la longitud real de tus documentos.
  • Inserta datos conocidos en distintas posiciones del prompt.
  • Mide si el modelo recupera correctamente información al inicio, medio y final del contexto.

Precios de un vistazo

Gemini 3.6 Flash tiene los siguientes precios:

Entrada: $1.50 por 1M de tokens
Salida:  $7.50 por 1M de tokens
Enter fullscreen mode Exit fullscreen mode

El precio de salida incluye tokens de pensamiento. Aunque esos tokens no aparezcan en la respuesta final, cuentan para la facturación.

El almacenamiento en caché de contexto cuesta:

$0.15 por 1M de tokens
+ $1.00 por 1M de tokens por hora de almacenamiento
Enter fullscreen mode Exit fullscreen mode

El caché puede ser útil si reutilizas repetidamente un prompt grande, como una base de conocimiento, documentación técnica o una especificación extensa.

Google AI Studio incluye un nivel gratuito con límite de tarifa. Está orientado a prototipos, no a tráfico de producción, y Google puede usar los datos de ese nivel para mejorar sus productos.

Más información:

Cómo acceder a Gemini 3.6 Flash

Puedes acceder al modelo desde varias superficies de Google:

  • API de Gemini mediante Google AI Studio. Obtén una clave API y llama a gemini-3.6-flash desde REST o un SDK.
  • Google Antigravity, la superficie de desarrollo de agentes de Google.
  • Plataforma de Agentes Empresariales Gemini, para equipos que crean agentes gobernados.
  • Aplicación Gemini, para interactuar con el modelo directamente.

Para la mayoría de los desarrolladores, la ruta principal es la API.

El flujo básico es:

  1. Crea una clave API en Google AI Studio.
  2. Configura la clave como variable de entorno.
  3. Envía una solicitud al endpoint de Gemini usando gemini-3.6-flash.
  4. Registra tokens, latencia, respuestas y errores.
  5. Convierte los casos críticos en pruebas de regresión.

Consulta:

Dónde encaja en la línea de productos de Google

Piensa en estos modelos como una escalera de costo y calidad:

Modelo Caso de uso principal
Gemini 3.5 Flash-Lite Alto volumen, baja latencia y tareas menos complejas
Gemini 3.6 Flash Tareas generales de producción, agentes y flujos con herramientas
Gemini 3.5 Pro Aún no disponible públicamente
Gemini 4 Anticipado, pero no lanzado

Gemini 3.5 Flash-Lite cuesta $0.30 por millón de tokens de entrada y $2.50 por millón de tokens de salida. Google indica una velocidad aproximada de 350 tokens de salida por segundo.

Usa Flash-Lite cuando priorices costo y latencia. Usa Gemini 3.6 Flash cuando necesites respuestas más confiables, mejor rendimiento en código o mayor capacidad en tareas de agente.

Gemini 3.5 Pro todavía no está disponible al público. Google indica que continúa probándolo con socios. Google también anticipó una ejecución de preentrenamiento de Gemini 4, pero no es un modelo que puedas llamar actualmente.

Para conocer la generación anterior, revisa qué es Gemini 3.5.

Probando Gemini 3.6 Flash en Apidog

Los benchmarks reflejan resultados controlados. Para saber cómo responde el modelo a tus prompts, documentos y herramientas, necesitas enviar solicitudes reales y validar sus resultados.

Apidog permite tratar el endpoint de Gemini como cualquier otra API REST. Puedes crear solicitudes, gestionar variables, inspeccionar respuestas y automatizar pruebas.

Configuración recomendada

  1. Crea una solicitud POST para el endpoint de la API de Gemini.
  2. Configura el modelo como gemini-3.6-flash.
  3. Guarda la clave API en una variable de entorno, no en la URL ni en el cuerpo de la solicitud.
  4. Crea entornos separados para desarrollo, pruebas y producción.
  5. Envía una solicitud base y guarda una respuesta válida como referencia.
  6. Añade aserciones para validar el contrato de respuesta.
  7. Programa la ejecución de la prueba para detectar cambios.

Por ejemplo, tus validaciones deben cubrir al menos:

  • Código HTTP exitoso.
  • Presencia de los campos JSON que utiliza tu aplicación.
  • Contenido no vacío.
  • Límites de latencia aceptables.
  • Ausencia de errores de seguridad o bloqueo inesperados.
  • Formato de salida estructurada, si esperas JSON.

Una estrategia de regresión práctica es mantener un conjunto de prompts con distintos perfiles:

- Prompt corto de clasificación
- Prompt de extracción desde PDF
- Prompt con contexto largo
- Prompt de generación de código
- Prompt con llamada a herramienta
- Prompt que exige salida JSON
Enter fullscreen mode Exit fullscreen mode

Después, compara entre versiones:

gemini-3.5-flash
gemini-3.6-flash
Enter fullscreen mode Exit fullscreen mode

No evalúes solo si la solicitud devuelve 200 OK. Compara precisión, estructura, tokens de salida, tiempo de respuesta y comportamiento ante entradas difíciles.

Puedes programar la ejecución de pruebas de API para detectar cambios de esquema, latencia o resultados después de una actualización del modelo.

Apidog no ejecuta el modelo ni sustituye un framework de IA. Funciona como la capa para construir solicitudes, enviarlas y verificar que la respuesta cumpla el estándar definido por tu equipo. Descarga Apidog para configurar tu primera prueba.

Preguntas frecuentes

¿Es Gemini 3.6 Flash gratuito?

Hay un nivel gratuito a través de Google AI Studio, con límite de tarifa y orientado a prototipos. Google puede usar los datos del nivel gratuito para mejorar sus productos.

Para producción, el precio es de $1.50 por millón de tokens de entrada y $7.50 por millón de tokens de salida.

¿Es Gemini 3.6 Flash mejor que Gemini 3.5 Flash?

Para la mayoría de las cargas de trabajo, sí. Utiliza aproximadamente un 17 % menos de tokens de salida, reduce el precio de salida de $9.00 a $7.50 por millón de tokens y mejora en codificación y uso de computadoras.

En OSWorld-Verified, sube de 78.4 % a 83.0 %.

¿Ha salido Gemini 3.5 Pro?

No. Google indica que todavía prueba Gemini 3.5 Pro con socios, por lo que no existe un modelo Pro público en esta versión.

Gemini 4 fue anticipado, pero tampoco se ha lanzado.

¿Cuál es la ID del modelo?

La ID es:

gemini-3.6-flash
Enter fullscreen mode Exit fullscreen mode

No la confundas con:

gemini-3.5-flash-lite
Enter fullscreen mode Exit fullscreen mode

Flash-Lite es un nivel distinto y más económico.

¿Qué no puede hacer Gemini 3.6 Flash?

Gemini 3.6 Flash solo genera texto. Puede aceptar imágenes, audio, video y PDF como entrada, pero no crea esas modalidades como salida.

También debes considerar que:

  • La recuperación disminuye cerca del límite de contexto de 1M de tokens.
  • La recuperación puntual a máxima longitud es de alrededor del 54.0 %.
  • Es un modelo de nivel medio, no un modelo insignia para razonamiento de frontera.

Gemini 3.6 Flash es una opción práctica para la mayor parte del tráfico de la API de Gemini: reduce costos, usa menos tokens de salida y mejora en tareas de agente frente a Gemini 3.5 Flash. Antes de migrar a gran escala, valida tus prompts críticos con pruebas guardadas y mide el comportamiento en tu propio entorno.

Top comments (0)