O Google atualizou sua camada Flash em 21 de julho de 2026, e o Gemini 3.5 Flash-Lite é a opção mais econômica da linha. É o Gemini mais barato e rápido para cargas de alto volume e sensíveis à latência, como classificação, extração, respostas curtas de chat e RAG simples, onde throughput e custo importam mais do que raciocínio profundo.
A atualização trouxe três modelos, com nomes e versões diferentes. Antes de integrar, entenda qual modelo resolve sua carga de trabalho e valide o endpoint com testes automatizados.
O que é o Gemini 3.5 Flash-Lite?
O Gemini 3.5 Flash-Lite é o menor e mais barato modelo da família Gemini do Google. Ele é otimizado para velocidade e volume, não para tarefas de raciocínio complexo. O Google estima aproximadamente 350 tokens de saída por segundo.
Use o ID abaixo na API Gemini:
gemini-3.5-flash-lite
Esse modelo é adequado para tarefas repetitivas e frequentes, por exemplo:
- Classificar tickets de suporte.
- Extrair campos estruturados de documentos.
- Responder perguntas curtas a partir de conteúdo recuperado.
- Alimentar widgets de chat com baixa latência.
- Processar grandes filas de entradas textuais.
O Flash-Lite foi lançado na atualização Flash de três modelos:
- Gemini 3.6 Flash: modelo principal.
- Gemini 3.5 Flash-Lite: opção mais rápida e econômica.
- Gemini 3.5 Flash Cyber: modelo de segurança restrito.
Veja a visão geral no blog do Google e os detalhes na página do DeepMind Flash.
Por que é 3.5 e não 3.6?
O modelo principal da atualização é o Gemini 3.6 Flash, mas o Flash-Lite permaneceu na linha 3.5. O modelo Gemini 3.5 Flash Cyber também manteve essa versão.
Isso não é erro de nomenclatura: o número acompanha a linha do modelo, não a data do lançamento. O modelo principal recebeu um salto geracional maior e foi rotulado como 3.6; as variantes Lite e Cyber continuaram como 3.5.
Também não confunda este modelo com o Gemini 3.1 Flash-Lite, da geração anterior.
Antes de publicar uma integração, valide explicitamente o ID:
gemini-3.5-flash-lite
Especificações e preços
Os preços abaixo são por milhão de tokens na API Gemini.
| Atributo | Valor |
|---|---|
| ID do modelo | gemini-3.5-flash-lite |
| Preço de entrada | US$ 0,30 / 1M tokens |
| Preço de saída | US$ 2,50 / 1M tokens |
| Velocidade | ~350 tokens de saída/segundo |
| Camada gratuita | Sim, no Google AI Studio, com limite de taxa |
| Cache de contexto | US$ 0,03 / 1M tokens + US$ 1,00 / 1M/h de armazenamento |
O custo de entrada de US$ 0,30 e o custo de saída de US$ 2,50 são as menores taxas publicadas na linha Gemini atual. Como comparação, o Gemini 3.6 Flash custa US$ 1,50 para entrada e US$ 7,50 para saída.
Para workloads com milhões de chamadas curtas, a diferença é relevante. Confirme os valores atuais na documentação de preços da API Gemini, pois o Google pode atualizar essa página.
Quando usar cache de contexto
Use cache de contexto quando você reutiliza conteúdo em várias requisições, como:
- Um prompt de sistema fixo.
- Um documento de referência extenso.
- Instruções compartilhadas por todos os usuários.
- Um catálogo, política ou base de conhecimento comum.
Você paga pelo armazenamento do contexto, mas reduz o custo das entradas reutilizadas.
Qual é o desempenho?
O Gemini 3.5 Flash-Lite marca 54% no Terminal-Bench 2.1, contra 31% do predecessor.
Na prática, ele é indicado para:
- Classificação de texto.
- Extração de dados estruturados.
- Respostas curtas de chat.
- RAG simples.
- Assistentes com alto volume de mensagens.
- Processamento em lote de conteúdo textual.
Evite usá-lo como padrão para:
- Codificação agêntica complexa.
- Cadeias longas de chamadas de ferramentas.
- Planejamento de várias etapas.
- Raciocínio profundo sobre bases de código complexas.
Para esses casos, prefira o Gemini 3.6 Flash ou um modelo maior.
Onde o Google usa o Flash-Lite
O Google está integrando o Flash-Lite ao Google Search. Isso indica que o modelo foi posicionado para tráfego em grande escala, com exigências de latência e custo por requisição.
Para aplicações próprias, as mesmas características se aplicam:
- Alto throughput.
- Respostas rápidas.
- Menor custo por chamada.
- Melhor adequação a pipelines repetitivos.
Por exemplo, um pipeline de classificação de tickets pode enviar a maior parte das mensagens ao Flash-Lite e reservar modelos maiores apenas para casos ambíguos.
Flash-Lite vs. Gemini 3.6 Flash: qual escolher?
Escolha o Flash-Lite quando a tarefa for simples, frequente e sensível à velocidade. Escolha o Gemini 3.6 Flash quando a tarefa exigir mais raciocínio, código ou execução agêntica em várias etapas.
| Cenário | Modelo recomendado |
|---|---|
| Classificação em massa | Gemini 3.5 Flash-Lite |
| Extração de campos | Gemini 3.5 Flash-Lite |
| Chat curto | Gemini 3.5 Flash-Lite |
| RAG simples | Gemini 3.5 Flash-Lite |
| Código complexo | Gemini 3.6 Flash |
| Uso de ferramentas em sequência | Gemini 3.6 Flash |
| Planejamento de múltiplas etapas | Gemini 3.6 Flash |
Um padrão prático é rotear por dificuldade:
- Envie requisições simples e frequentes ao Flash-Lite.
- Detecte casos ambíguos, longos ou que exijam múltiplas etapas.
- Encaminhe apenas esses casos para o Gemini 3.6 Flash.
- Registre latência, custo e taxa de erro por rota.
O preço do Gemini 3.6 Flash reflete essa capacidade adicional. Para uma comparação detalhada, veja Gemini 3.5 Flash-Lite vs. 3.6 Flash.
Como acessar e testar
O Flash-Lite funciona na API Gemini. Para começar:
- Acesse o Google AI Studio.
- Gere uma chave de API.
- Configure o modelo como
gemini-3.5-flash-lite. - Faça uma requisição de teste.
- Valide o código de status e os campos retornados.
A camada gratuita permite testes iniciais, mas tem limite de taxa. O Google também pode usar dados enviados na camada gratuita para melhorar seus produtos. Para dados sensíveis ou tráfego de produção, use uma chave paga.
Consulte a documentação da API Gemini para os formatos atualizados de requisição e resposta.
Checklist para testar o endpoint
Ao montar sua requisição, valide pelo menos:
- O modelo enviado é gemini-3.5-flash-lite
- A resposta HTTP indica sucesso
- O JSON contém os campos que sua aplicação consome
- O tempo de resposta atende ao seu SLO
- A saída segue o formato esperado
- Casos vazios, longos e inválidos retornam comportamento controlado
Com o Apidog, você pode configurar a requisição POST, salvar a chave de API como variável de ambiente e adicionar asserções para validar o endpoint.
Um fluxo prático no Apidog é:
- Crie uma requisição para o endpoint Gemini.
- Armazene a chave de API em uma variável de ambiente.
- Defina
gemini-3.5-flash-litecomo modelo. - Envie exemplos representativos do tráfego real.
- Adicione asserções para o status HTTP e campos JSON.
- Salve a requisição como teste de regressão.
- Agende a execução do teste.
Isso ajuda a detectar mudanças de formato, respostas quebradas ou alterações que afetem sua integração antes que elas cheguem aos usuários. O Apidog não executa o modelo nem substitui a API Gemini; ele funciona como cliente para chamar, validar e monitorar o endpoint.
FAQ
O Gemini 3.5 Flash-Lite é o mesmo que o Gemini 3.6 Flash?
Não. São modelos diferentes da atualização de 21 de julho de 2026. O Flash-Lite é voltado a tarefas simples de alto volume; o 3.6 Flash oferece raciocínio e codificação mais fortes.
Por que é 3.5 e não 3.6?
O Google usou versionamento misto. O modelo principal passou para 3.6, enquanto Flash-Lite e Flash Cyber mantiveram o rótulo 3.5.
Este é o antigo Gemini 3.1 Flash-Lite?
Não. O Gemini 3.5 Flash-Lite é um modelo mais novo. Confirme o ID gemini-3.5-flash-lite antes de integrar.
O Gemini 3.5 Flash-Lite é gratuito?
Há uma camada gratuita no Google AI Studio com limite de taxa. Ela é útil para testes e uso leve. Para produção, use uma chave de API paga.
No que o Flash-Lite é melhor?
Classificação, extração, respostas curtas de chat e RAG simples em alto volume. Para raciocínio longo, codificação agêntica ou fluxos com várias etapas, o Gemini 3.6 Flash é mais adequado.


Top comments (0)