DEV Community

Cover image for O que é Gemini 3.5 Flash-Lite?
Lucas
Lucas

Posted on • Originally published at apidog.com

O que é Gemini 3.5 Flash-Lite?

O Google atualizou sua camada Flash em 21 de julho de 2026, e o Gemini 3.5 Flash-Lite é a opção mais econômica da linha. É o Gemini mais barato e rápido para cargas de alto volume e sensíveis à latência, como classificação, extração, respostas curtas de chat e RAG simples, onde throughput e custo importam mais do que raciocínio profundo.

Experimente o Apidog hoje

A atualização trouxe três modelos, com nomes e versões diferentes. Antes de integrar, entenda qual modelo resolve sua carga de trabalho e valide o endpoint com testes automatizados.

O que é o Gemini 3.5 Flash-Lite?

O Gemini 3.5 Flash-Lite é o menor e mais barato modelo da família Gemini do Google. Ele é otimizado para velocidade e volume, não para tarefas de raciocínio complexo. O Google estima aproximadamente 350 tokens de saída por segundo.

Use o ID abaixo na API Gemini:

gemini-3.5-flash-lite
Enter fullscreen mode Exit fullscreen mode

Gemini 3.5 Flash-Lite

Esse modelo é adequado para tarefas repetitivas e frequentes, por exemplo:

  • Classificar tickets de suporte.
  • Extrair campos estruturados de documentos.
  • Responder perguntas curtas a partir de conteúdo recuperado.
  • Alimentar widgets de chat com baixa latência.
  • Processar grandes filas de entradas textuais.

Casos de uso do Gemini Flash-Lite

O Flash-Lite foi lançado na atualização Flash de três modelos:

  • Gemini 3.6 Flash: modelo principal.
  • Gemini 3.5 Flash-Lite: opção mais rápida e econômica.
  • Gemini 3.5 Flash Cyber: modelo de segurança restrito.

Veja a visão geral no blog do Google e os detalhes na página do DeepMind Flash.

Por que é 3.5 e não 3.6?

O modelo principal da atualização é o Gemini 3.6 Flash, mas o Flash-Lite permaneceu na linha 3.5. O modelo Gemini 3.5 Flash Cyber também manteve essa versão.

Isso não é erro de nomenclatura: o número acompanha a linha do modelo, não a data do lançamento. O modelo principal recebeu um salto geracional maior e foi rotulado como 3.6; as variantes Lite e Cyber continuaram como 3.5.

Também não confunda este modelo com o Gemini 3.1 Flash-Lite, da geração anterior.

Antes de publicar uma integração, valide explicitamente o ID:

gemini-3.5-flash-lite
Enter fullscreen mode Exit fullscreen mode

Especificações e preços

Os preços abaixo são por milhão de tokens na API Gemini.

Atributo Valor
ID do modelo gemini-3.5-flash-lite
Preço de entrada US$ 0,30 / 1M tokens
Preço de saída US$ 2,50 / 1M tokens
Velocidade ~350 tokens de saída/segundo
Camada gratuita Sim, no Google AI Studio, com limite de taxa
Cache de contexto US$ 0,03 / 1M tokens + US$ 1,00 / 1M/h de armazenamento

O custo de entrada de US$ 0,30 e o custo de saída de US$ 2,50 são as menores taxas publicadas na linha Gemini atual. Como comparação, o Gemini 3.6 Flash custa US$ 1,50 para entrada e US$ 7,50 para saída.

Para workloads com milhões de chamadas curtas, a diferença é relevante. Confirme os valores atuais na documentação de preços da API Gemini, pois o Google pode atualizar essa página.

Quando usar cache de contexto

Use cache de contexto quando você reutiliza conteúdo em várias requisições, como:

  • Um prompt de sistema fixo.
  • Um documento de referência extenso.
  • Instruções compartilhadas por todos os usuários.
  • Um catálogo, política ou base de conhecimento comum.

Você paga pelo armazenamento do contexto, mas reduz o custo das entradas reutilizadas.

Qual é o desempenho?

O Gemini 3.5 Flash-Lite marca 54% no Terminal-Bench 2.1, contra 31% do predecessor.

Na prática, ele é indicado para:

  • Classificação de texto.
  • Extração de dados estruturados.
  • Respostas curtas de chat.
  • RAG simples.
  • Assistentes com alto volume de mensagens.
  • Processamento em lote de conteúdo textual.

Evite usá-lo como padrão para:

  • Codificação agêntica complexa.
  • Cadeias longas de chamadas de ferramentas.
  • Planejamento de várias etapas.
  • Raciocínio profundo sobre bases de código complexas.

Para esses casos, prefira o Gemini 3.6 Flash ou um modelo maior.

Onde o Google usa o Flash-Lite

O Google está integrando o Flash-Lite ao Google Search. Isso indica que o modelo foi posicionado para tráfego em grande escala, com exigências de latência e custo por requisição.

Para aplicações próprias, as mesmas características se aplicam:

  • Alto throughput.
  • Respostas rápidas.
  • Menor custo por chamada.
  • Melhor adequação a pipelines repetitivos.

Por exemplo, um pipeline de classificação de tickets pode enviar a maior parte das mensagens ao Flash-Lite e reservar modelos maiores apenas para casos ambíguos.

Flash-Lite vs. Gemini 3.6 Flash: qual escolher?

Escolha o Flash-Lite quando a tarefa for simples, frequente e sensível à velocidade. Escolha o Gemini 3.6 Flash quando a tarefa exigir mais raciocínio, código ou execução agêntica em várias etapas.

Cenário Modelo recomendado
Classificação em massa Gemini 3.5 Flash-Lite
Extração de campos Gemini 3.5 Flash-Lite
Chat curto Gemini 3.5 Flash-Lite
RAG simples Gemini 3.5 Flash-Lite
Código complexo Gemini 3.6 Flash
Uso de ferramentas em sequência Gemini 3.6 Flash
Planejamento de múltiplas etapas Gemini 3.6 Flash

Um padrão prático é rotear por dificuldade:

  1. Envie requisições simples e frequentes ao Flash-Lite.
  2. Detecte casos ambíguos, longos ou que exijam múltiplas etapas.
  3. Encaminhe apenas esses casos para o Gemini 3.6 Flash.
  4. Registre latência, custo e taxa de erro por rota.

O preço do Gemini 3.6 Flash reflete essa capacidade adicional. Para uma comparação detalhada, veja Gemini 3.5 Flash-Lite vs. 3.6 Flash.

Como acessar e testar

O Flash-Lite funciona na API Gemini. Para começar:

  1. Acesse o Google AI Studio.
  2. Gere uma chave de API.
  3. Configure o modelo como gemini-3.5-flash-lite.
  4. Faça uma requisição de teste.
  5. Valide o código de status e os campos retornados.

A camada gratuita permite testes iniciais, mas tem limite de taxa. O Google também pode usar dados enviados na camada gratuita para melhorar seus produtos. Para dados sensíveis ou tráfego de produção, use uma chave paga.

Consulte a documentação da API Gemini para os formatos atualizados de requisição e resposta.

Checklist para testar o endpoint

Ao montar sua requisição, valide pelo menos:

- O modelo enviado é gemini-3.5-flash-lite
- A resposta HTTP indica sucesso
- O JSON contém os campos que sua aplicação consome
- O tempo de resposta atende ao seu SLO
- A saída segue o formato esperado
- Casos vazios, longos e inválidos retornam comportamento controlado
Enter fullscreen mode Exit fullscreen mode

Com o Apidog, você pode configurar a requisição POST, salvar a chave de API como variável de ambiente e adicionar asserções para validar o endpoint.

Um fluxo prático no Apidog é:

  1. Crie uma requisição para o endpoint Gemini.
  2. Armazene a chave de API em uma variável de ambiente.
  3. Defina gemini-3.5-flash-lite como modelo.
  4. Envie exemplos representativos do tráfego real.
  5. Adicione asserções para o status HTTP e campos JSON.
  6. Salve a requisição como teste de regressão.
  7. Agende a execução do teste.

Isso ajuda a detectar mudanças de formato, respostas quebradas ou alterações que afetem sua integração antes que elas cheguem aos usuários. O Apidog não executa o modelo nem substitui a API Gemini; ele funciona como cliente para chamar, validar e monitorar o endpoint.

FAQ

O Gemini 3.5 Flash-Lite é o mesmo que o Gemini 3.6 Flash?

Não. São modelos diferentes da atualização de 21 de julho de 2026. O Flash-Lite é voltado a tarefas simples de alto volume; o 3.6 Flash oferece raciocínio e codificação mais fortes.

Por que é 3.5 e não 3.6?

O Google usou versionamento misto. O modelo principal passou para 3.6, enquanto Flash-Lite e Flash Cyber mantiveram o rótulo 3.5.

Este é o antigo Gemini 3.1 Flash-Lite?

Não. O Gemini 3.5 Flash-Lite é um modelo mais novo. Confirme o ID gemini-3.5-flash-lite antes de integrar.

O Gemini 3.5 Flash-Lite é gratuito?

Há uma camada gratuita no Google AI Studio com limite de taxa. Ela é útil para testes e uso leve. Para produção, use uma chave de API paga.

No que o Flash-Lite é melhor?

Classificação, extração, respostas curtas de chat e RAG simples em alto volume. Para raciocínio longo, codificação agêntica ou fluxos com várias etapas, o Gemini 3.6 Flash é mais adequado.

Top comments (0)