Google actualizó su nivel Flash el 21 de julio de 2026, y Gemini 3.5 Flash-Lite es su opción económica. Es el Gemini más barato y rápido disponible, diseñado para cargas de gran volumen y sensibles a la latencia: clasificación, extracción, respuestas cortas de chat y recuperación simple, donde el rendimiento y el costo importan más que el razonamiento profundo.
La actualización incluyó tres modelos y su nomenclatura puede resultar confusa. Este artículo explica qué es Gemini 3.5 Flash-Lite, cuándo usarlo, cuánto cuesta y cómo probar su endpoint.
¿Qué es Gemini 3.5 Flash-Lite?
Gemini 3.5 Flash-Lite es el modelo más pequeño y barato de la familia Gemini de Google. Está optimizado para velocidad y volumen, no para tareas de razonamiento complejas.
Google indica un rendimiento aproximado de 350 tokens de salida por segundo, por lo que puede responder casi de inmediato incluso bajo carga. Puedes invocarlo mediante la API de Gemini con este ID:
gemini-3.5-flash-lite
Úsalo para tareas repetitivas y de alta frecuencia, por ejemplo:
- Clasificar tickets de soporte.
- Extraer campos de documentos.
- Generar respuestas breves a partir de texto recuperado.
- Alimentar un widget de chat con requisitos estrictos de latencia.
- Etiquetar, resumir o enrutar entradas estructuradas.
Google lanzó Flash-Lite junto con otros dos modelos:
- Gemini 3.6 Flash: modelo principal.
- Gemini 3.5 Flash-Lite: opción económica y rápida.
- Gemini 3.5 Flash Cyber: modelo de seguridad restringido.
Consulta el anuncio en el blog de Google y los detalles en la página de DeepMind Flash.
Espera, ¿por qué es 3.5 y no 3.6?
El modelo principal de esta actualización es Gemini 3.6 Flash, pero Flash-Lite conservó la versión 3.5. El modelo Cyber también mantiene la etiqueta 3.5.
No es un error tipográfico: Google lanzó tres modelos el mismo día, pero con dos números de versión diferentes. La versión sigue la línea de cada modelo, no el evento de lanzamiento.
Tampoco debes confundirlo con el anterior Gemini 3.1 Flash-Lite. Aunque comparten el nombre de familia, son modelos distintos.
Si ya usabas la generación anterior, verifica siempre el ID del modelo:
gemini-3.5-flash-lite
Especificaciones y precios
Estos son los valores publicados para Gemini 3.5 Flash-Lite a través de la API de Gemini:
| Atributo | Valor |
|---|---|
| ID de modelo | gemini-3.5-flash-lite |
| Precio de entrada | $0.30 / 1M tokens |
| Precio de salida | $2.50 / 1M tokens |
| Velocidad | ~350 tokens de salida/segundo |
| Nivel gratuito | Sí, en Google AI Studio con límite de tasa |
| Caché de contexto | $0.03 / 1M tokens + $1.00 / 1M/hora de almacenamiento |
Los precios de entrada y salida son los más bajos de la línea actual de Gemini. Como referencia, Gemini 3.6 Flash cuesta $1.50 por millón de tokens de entrada y $7.50 por millón de tokens de salida.
Esto hace que Flash-Lite sea adecuado cuando procesas muchas solicitudes pequeñas. Por ejemplo, si tu aplicación clasifica millones de mensajes o extrae datos de formularios, la diferencia de costo por token puede ser significativa.
Confirma siempre los importes actuales en la documentación de precios de la API de Gemini, ya que Google puede actualizar esa página.
Cuándo usar caché de contexto
El caché de contexto es útil cuando reutilizas contenido en muchas solicitudes, como:
- Un prompt de sistema fijo.
- Un documento largo de referencia.
- Instrucciones de extracción que no cambian.
- Políticas o catálogos compartidos por muchos usuarios.
En lugar de enviar el mismo contexto completo en cada llamada, puedes almacenarlo en caché y reducir el costo de reutilización.
¿Qué tan bien funciona?
Gemini 3.5 Flash-Lite obtiene un 54% en Terminal-Bench 2.1, frente al 31% de su predecesor. Para un modelo de la categoría Lite, es una mejora relevante.
Funciona especialmente bien en estas tareas:
Clasificación
Asignar una categoría a tickets, comentarios, productos o mensajes.Extracción estructurada
Obtener nombres, fechas, importes o identificadores desde texto no estructurado.Chat breve
Responder preguntas directas con baja latencia.RAG simple
Generar respuestas basadas en uno o varios fragmentos recuperados.
Sin embargo, Flash-Lite prioriza velocidad y costo. No es la opción adecuada para:
- Codificación agencial compleja.
- Flujos con muchas llamadas a herramientas.
- Planificación de varios pasos.
- Razonamiento profundo sobre una base de código grande.
Para esos casos, considera Gemini 3.6 Flash u otro modelo de mayor capacidad.
Dónde utiliza Google Flash-Lite
Google está incorporando Flash-Lite en la Búsqueda de Google. Esto indica que el modelo está pensado para operar con un gran volumen de consultas sin comprometer la latencia ni el presupuesto.
Para una aplicación propia, las implicaciones son prácticas:
- Puede ser una buena opción para endpoints de alto tráfico.
- Es adecuado para pipelines de clasificación.
- Permite reducir el costo de operaciones simples.
- Puede mantener tiempos de respuesta bajos en widgets de chat y automatizaciones.
Flash-Lite vs. Gemini 3.6 Flash: ¿cuál elegir?
Elige Gemini 3.5 Flash-Lite cuando la tarea sea simple, frecuente y sensible a la velocidad.
Elige Gemini 3.6 Flash cuando necesites razonamiento más sólido, mejor generación de código o flujos de agente de varios pasos.
| Caso de uso | Modelo recomendado |
|---|---|
| Clasificar tickets o mensajes | Gemini 3.5 Flash-Lite |
| Extraer campos de documentos | Gemini 3.5 Flash-Lite |
| Respuestas de chat cortas | Gemini 3.5 Flash-Lite |
| RAG simple a gran escala | Gemini 3.5 Flash-Lite |
| Generación de código compleja | Gemini 3.6 Flash |
| Agentes con múltiples herramientas | Gemini 3.6 Flash |
| Planificación y razonamiento de varios pasos | Gemini 3.6 Flash |
Un patrón práctico consiste en enrutar las solicitudes según su dificultad:
Solicitud simple y frecuente
→ Gemini 3.5 Flash-Lite
Solicitud compleja o de varios pasos
→ Gemini 3.6 Flash
De esta forma, mantienes bajo el costo de la mayoría del tráfico y usas un modelo más capaz solo cuando la tarea lo justifica.
Consulta el precio de 3.6 Flash y esta comparación de Gemini 3.5 Flash-Lite vs 3.6 Flash.
Cómo acceder y probarlo
Flash-Lite se ejecuta mediante la API de Gemini. Para empezar:
- Abre Google AI Studio.
- Genera una clave API.
- Configura el modelo
gemini-3.5-flash-lite. - Envía una solicitud de prueba.
- Valida la estructura y el contenido de la respuesta.
El nivel gratuito permite probar el modelo antes de configurar facturación, aunque tiene límites de tasa. Google también puede usar datos del nivel gratuito para mejorar sus productos, por lo que debes evitar enviar información sensible con una clave gratuita.
Consulta la referencia completa en la documentación de la API de Gemini.
Prueba una solicitud y valida la respuesta
Después de confirmar que las llamadas funcionan, configura validaciones para detectar cambios en la API, respuestas incompletas o errores inesperados.
Con Apidog puedes:
- Crear una solicitud
POSTal endpoint de Gemini. - Guardar la clave API como variable de entorno.
- Evitar incluir secretos directamente en el cuerpo de la solicitud.
- Verificar códigos de estado.
- Añadir aserciones sobre los campos JSON que consume tu aplicación.
- Guardar la solicitud como prueba de regresión.
Por ejemplo, valida como mínimo que la API responda correctamente y devuelva el contenido esperado:
Estado HTTP: 200
Respuesta: contiene los campos JSON requeridos por tu aplicación
Después puedes guardar la prueba y programarla para que se ejecute. Así podrás detectar cambios en respuestas, límites o precios antes de que afecten a los usuarios.
Apidog no ejecuta el modelo ni reemplaza la API de Gemini: funciona como cliente para llamar, validar y monitorear el endpoint gemini-3.5-flash-lite junto con el resto de tu pila de API.
Preguntas frecuentes
¿Gemini 3.5 Flash-Lite es lo mismo que Gemini 3.6 Flash?
No. Son modelos diferentes de la actualización del 21 de julio de 2026. Flash-Lite es la opción rápida y económica para tareas simples de alto volumen. Gemini 3.6 Flash es el modelo principal, con mayor capacidad de razonamiento y codificación.
¿Por qué es 3.5 y no 3.6?
Google actualizó el modelo principal a 3.6, pero mantuvo Flash-Lite y el modelo Cyber en la línea 3.5. El número de versión sigue la familia del modelo, no la fecha del lanzamiento.
¿Es el antiguo Gemini 3.1 Flash-Lite?
No. Gemini 3.5 Flash-Lite es un modelo más reciente. Comprueba que uses el ID gemini-3.5-flash-lite.
¿Gemini 3.5 Flash-Lite es gratuito?
Hay un nivel gratuito en Google AI Studio con límites de tasa. Es útil para pruebas y uso ligero. Para tráfico de producción, utiliza una clave API de pago.
¿Para qué tareas es mejor Flash-Lite?
Para clasificación, extracción, respuestas de chat breves y RAG simple a gran volumen. Para codificación agencial compleja o razonamiento de varios pasos, Gemini 3.6 Flash es una mejor opción.


Top comments (0)