Gemini 3.8 Flash vs. 3.7 Flash: o que mudou, quanto custa e quando migrar
O Google lançou o Gemini 3.8 Flash em 2 de setembro de 2026, três semanas após o Gemini 3.7 Flash e seis semanas após o 3.6 Flash. O preço inicial permanece em US$ 0,75 por milhão de tokens de entrada e US$ 3,75 por milhão de tokens de saída até 31 de dezembro, com contexto de 1 milhão de tokens e velocidade aproximadamente igual, segundo o Google. A diferença está no funcionamento: o modelo executa etapas menores de raciocínio, verifica a própria saída e chama ferramentas em loops. Isso melhora os benchmarks, mas também aumenta o consumo de tokens.
A pergunta, portanto, não é apenas “o 3.8 Flash é melhor?”. No papel, sim. O ponto é saber se a qualidade adicional compensa os tokens extras na sua carga de trabalho e se as duas alterações incompatíveis afetam o código existente.
Esta comparação reúne as diferenças de comportamento, preço, desempenho e compatibilidade. Os dados vêm do post de lançamento do Google, da página O que há de novo no Gemini 3.8 Flash e dos testes independentes da Artificial Analysis. Para a especificação completa, consulte o que é o Gemini 3.8 Flash.
O Gemini 3.7 Flash continua totalmente suportado e o Google não publicou uma data de descontinuação. A migração é opcional.
Comparativo
| Item | Gemini 3.8 Flash | Gemini 3.7 Flash |
|---|---|---|
| ID do modelo | gemini-3.8-flash |
gemini-3.7-flash |
| Lançamento | 2 de setembro de 2026 | 13 de agosto de 2026 |
| Base | Baseado no Gemini 3.7 Flash | — |
| Contexto / saída máxima | 1.048.576 / 65.536 tokens | Mesmo |
| Preço de entrada até 31 de dezembro | US$ 0,75 por milhão | US$ 0,75 por milhão |
| Preço de saída até 31 de dezembro | US$ 3,75 por milhão, com raciocínio incluído | US$ 3,75 por milhão, com raciocínio incluído |
| Preço padrão a partir de 1º de janeiro de 2027 | US$ 1,50 / US$ 7,50 | US$ 1,50 / US$ 7,50 |
| Leitura do cache de contexto | US$ 0,075 por milhão no lançamento | Mesmo |
| Processamento em lote | 50% de desconto | Mesmo |
| Níveis de raciocínio |
low, medium (padrão), high
|
low, medium, high
|
thinking_level: "minimal" |
Erro de validação | Aceito; mapeie para low
|
| Corte de conhecimento | Março de 2026 | Não reafirmado na documentação do 3.8 |
| Velocidade de saída | Aproximadamente 300 tokens/s; 302,1 medidos em high
|
Aproximadamente igual, segundo o Google |
| Índice de Inteligência da Artificial Analysis | 59 em high
|
56 em high
|
| Suporte | Atual | Totalmente suportado, sem data de descontinuação |
O que permaneceu igual
Preço e limites
Os dois modelos usam as mesmas faixas de preço:
- US$ 0,75 por milhão de tokens de entrada;
- US$ 3,75 por milhão de tokens de saída até 31 de dezembro de 2026;
- US$ 1,50 por milhão de tokens de entrada e US$ 7,50 por milhão de tokens de saída a partir de 1º de janeiro de 2027;
- US$ 0,075 por milhão de tokens para leitura do cache de contexto no lançamento;
- 50% de desconto no processamento em lote;
- 5.000 solicitações gratuitas de grounding com Google Search por mês, compartilhadas entre os modelos Gemini 3.x.
A página de preços do Gemini e a referência de especificações e preços do Gemini 3.7 Flash continuam válidas como referência.
O contexto máximo também não mudou: 1.048.576 tokens de entrada e 65.536 tokens de saída.
Modalidades e API
Ambos aceitam:
- texto;
- imagem;
- vídeo;
- áudio;
- PDF.
A saída permanece limitada a texto. Nenhum dos dois modelos gera áudio ou imagens, nem oferece a Live API.
A API de Interactions é o caminho principal para o Gemini 3.x, mas o endpoint legado generateContent continua totalmente suportado, sem data de descontinuação. Na maioria dos casos, o código do Gemini 3.7 Flash funciona após substituir o ID do modelo por gemini-3.8-flash. As exceções estão descritas na seção sobre alterações incompatíveis.
Velocidade
O Google descreve o 3.8 Flash como tendo “aproximadamente a mesma velocidade” do 3.7 Flash.
A Artificial Analysis mediu 302,1 tokens de saída por segundo em uma execução com raciocínio high. Essa é a velocidade depois que o modelo começa a escrever. O tempo até o primeiro token foi de 13,30 segundos, pois o modelo raciocina antes de responder.
O que melhorou
O Google apresenta o 3.8 Flash como “nosso modelo Flash mais inteligente”, voltado para:
- engenharia de software de longo horizonte;
- agentes autônomos;
- fluxos de trabalho empresariais complexos.
A mudança principal é comportamental. Em tarefas difíceis, o modelo executa etapas adicionais de raciocínio, divide essas etapas em passos menores, chama ferramentas iterativamente e verifica o próprio trabalho durante a execução.
Benchmarks publicados pelo Google
Na página DeepMind Flash, o Google publicou estas comparações:
| Benchmark | Gemini 3.8 Flash | Gemini 3.7 Flash | Diferença |
|---|---|---|---|
| Vals Finance Agent v2 | 61,4% | 59,0% | +2,4 |
| HLE-Verified | 54,9% | 53,6% | +1,3 |
| Harvey Legal Agent Benchmark | 10,0% | 8,8% | +1,2 |
Os ganhos são modestos, mas consistentes. Em cada linha, o 3.8 Flash também supera modelos maiores apresentados na tabela do Google, como Claude Opus 5, que marcou 58,6% no Vals Finance e 54,4% no HLE-Verified. A comparação com Claude Fable 5.1 e GPT-5.6 Sol aprofunda essa análise.
Testes independentes
A Artificial Analysis atribuiu ao Gemini 3.8 Flash:
- Índice de Inteligência 59 em
high; - 56 para o Gemini 3.7 Flash;
- 52 para o Gemini 3.6 Flash;
- 45% no τ³-Banking, benchmark de uso de ferramentas — 12 pontos acima do Gemini 3.7 Flash.
Para agentes que executam chamadas de ferramentas reais, o resultado no τ³-Banking é mais relevante do que um índice geral.
Fluxos com muitos documentos
O Google afirma que o 3.8 Flash conclui mais de três vezes mais tarefas que o 3.7 Flash em fluxos longos com muitos documentos.
Essa é uma avaliação interna, sem um harness público, portanto deve ser tratada como indicativa. Ainda assim, a afirmação é coerente com o novo design: etapas adicionais de verificação são mais úteis quando um erro inicial pode comprometer um fluxo de 40 etapas.
Codificação agêntica
No DeepSWE v1.1, o Gemini 3.7 Flash marcou 65,3%, contra 49,0% do Gemini 3.6 Flash. O Google afirma que o 3.8 Flash supera a maioria dos modelos maiores de ponta nessa categoria por uma fração do custo.
A porcentagem exata do 3.8 Flash aparece apenas nas tabelas de imagem da ficha do modelo, não no texto publicado. Por isso, não é possível apresentar um número textual confiável.
Os resultados do Gemini 3.8 Flash em SWE-Bench Pro, Terminal-bench e OSWorld também não foram publicados em texto. Se esses benchmarks forem decisivos para sua escolha, aguarde avaliações de terceiros ou execute seus próprios testes.
Segurança e resistência a injeções
O Google relata um “salto significativo” nos testes de injeção de prompt da Gray Swan, mas não publicou um número agregado.
Os deltas da ficha do modelo em relação ao 3.7 Flash são:
- segurança multilíngue: +5,4 pontos;
- segurança texto para texto: -0,4 ponto;
- recusas injustificadas: +1,1 ponto.
O último resultado indica um leve aumento nas recusas excessivas.
O custo real por tarefa
O preço por token não mudou. O custo por tarefa, sim.
O Google afirma que o modelo pode usar mais tokens em tarefas longas e complexas e que pode consumir tokens adicionais para maximizar o desempenho, principalmente nos níveis de esforço mais altos.
A Artificial Analysis mediu uma média de 48.000 tokens de saída por tarefa no Gemini 3.8 Flash — 30% a mais que no 3.7 Flash. Com o mesmo preço por token, o custo final aumenta:
| Configuração | Custo por tarefa | Tempo por tarefa |
|---|---|---|
Gemini 3.7 Flash, high
|
US$ 0,40 | 2,2 min |
Gemini 3.8 Flash, low
|
US$ 0,24 | 0,8 min |
Gemini 3.8 Flash, medium
|
US$ 0,41 | Não publicado |
Gemini 3.8 Flash, high
|
US$ 0,58 | 2,5 min |
Três conclusões são importantes:
- O Gemini 3.8 Flash em
highcusta aproximadamente 45% mais por tarefa do que o 3.7 Flash emhighe leva 14% mais tempo. - O 3.8 Flash em
medium, nível padrão, custa apenas US$ 0,01 a mais que o 3.7 Flash emhigh. - O 3.8 Flash em
lowé a opção mais barata e rápida da tabela.
Para rotas sensíveis à latência, low pode ser uma alternativa direta a manter o 3.7 Flash em high. O detalhamento de preços do Gemini 3.8 Flash ajuda a projetar esse impacto em volumes diários.
Alterações incompatíveis
Duas mudanças afetam diretamente o código que migra do Gemini 3.7 Flash.
1. thinking_level: "minimal" falha
O Gemini 3.8 Flash aceita apenas:
low
medium
high
Uma configuração com thinking_level: "minimal" retorna erro de validação. Mapeie esse valor para low:
{
"thinkingConfig": {
"thinkingLevel": "low"
}
}
Consulte o guia de níveis de raciocínio para comparar custo, latência e profundidade.
2. Resultados de funções exigem call_id e name
Na API de Interactions, todo function_result precisa conter:
-
call_id; -
name.
No endpoint legado generateContent, todo functionResponse precisa conter:
- o
idcorrespondente; -
name.
Código que envia resultados apenas com name falhará na segunda etapa de um loop de ferramentas.
Ao migrar, também revise as recomendações do guia de migração do Gemini 3.7 para o 3.8 Flash:
- mantenha
temperatureno padrão1.0; - use
thinking_levelem vez de umthinking_budgetinteiro; - descarte
candidate_count; - devolva as assinaturas de pensamento exatamente como foram recebidas.
Essas últimas recomendações não são novas no 3.8, mas uma base de código do 3.7 que as ignorava pode apresentar problemas durante a transição.
Matriz de decisão por carga de trabalho
| Carga de trabalho | Recomendação | Motivo |
|---|---|---|
| Agentes com várias etapas e chamadas de ferramentas | Atualize para medium ou high
|
+12 pontos no τ³-Banking e loops iterativos são o foco do 3.8 |
| Extração e revisão de documentos longos | Atualize | A alegação de mais de 3x tarefas concluídas mira esse formato |
| Codificação agêntica em um harness | Atualize e meça | O número textual do DeepSWE não foi publicado |
| Agentes financeiros, jurídicos e de pesquisa | Atualize | Os três benchmarks publicados pelo Google favorecem o 3.8 |
| Classificação, extração e chat de alto volume | Mantenha o 3.7 ou use o 3.8 em low
|
O custo por tarefa é a métrica principal |
| Endpoints voltados ao usuário e sensíveis à latência | Use o 3.8 em low
|
0,8 minuto por tarefa contra 2,2 minutos do 3.7 em high
|
Fluxos que usam minimal
|
Migre primeiro | O valor causa erro de validação no 3.8 |
| Pipelines em lote com orçamento preciso | Mantenha o 3.7 até reavaliar | O preço por token é igual, mas o consumo de saída aumentou 30% |
A regra geral é simples: quanto mais longa, difícil e agêntica for a tarefa, mais o design do 3.8 justifica os tokens adicionais. Em tarefas curtas e repetitivas, o nível de raciocínio — ou a permanência no 3.7 — tem maior impacto.
Teste os dois modelos no mesmo cenário do Apidog
Os números por tarefa acima foram medidos no harness da Artificial Analysis, não no seu ambiente. Antes de alterar o modelo em produção, execute os mesmos prompts nos dois modelos e compare:
- tokens de saída;
- tokens de raciocínio;
- latência;
- qualidade da resposta;
- custo por tarefa;
- campos consumidos pela sua aplicação.
O Apidog permite montar esse teste rapidamente.
1. Configure a chave e a requisição
Defina GEMINI_API_KEY como variável de ambiente em um ambiente do Apidog.
Depois, adicione uma requisição POST para:
https://generativelanguage.googleapis.com/v1beta/models/{{model}}:generateContent
Configure o cabeçalho x-goog-api-key para ler o valor da variável de ambiente.
Use model como variável de cenário. O corpo pode ser o mesmo para as duas execuções:
{
"contents": [{"parts": [{"text": "{{golden_prompt}}"}]}],
"generationConfig": {"thinkingConfig": {"thinkingLevel": "medium"}}
}
2. Crie o cenário de teste
Adicione duas etapas:
model = gemini-3.7-flashmodel = gemini-3.8-flash
Em cada etapa, crie asserções para:
usageMetadata.candidatesTokenCount
usageMetadata.thoughtsTokenCount
Defina limites compatíveis com seu orçamento e adicione uma asserção de caminho JSON para cada campo que a aplicação realmente lê.
Execute o cenário com 10 ou 20 prompts de referência. O relatório reunirá as respostas e as asserções das duas etapas, permitindo transformar o aumento de 30% observado pela Artificial Analysis em uma medição do seu próprio caso de uso.
3. Agende o teste
Depois de validar os limites, agende o cenário para detectar aumentos silenciosos no consumo de tokens após futuras atualizações do modelo. Assim, uma mudança de custo falha no teste antes de aparecer na fatura.
Veja como agendar testes de API no Apidog ou baixe o Apidog. O plano gratuito cobre este fluxo de trabalho.
Perguntas frequentes
O Gemini 3.8 Flash é mais rápido que o 3.7 Flash?
Não de forma significativa. O Google afirma que a velocidade é aproximadamente igual, e a Artificial Analysis mediu cerca de 300 tokens por segundo em high.
O tempo total por tarefa aumentou no harness da Artificial Analysis: 2,5 minutos no 3.8 Flash em high, contra 2,2 minutos no 3.7 Flash em high. Em low, o 3.8 Flash caiu para 0,8 minuto.
O Gemini 3.8 Flash custa mais que o 3.7 Flash?
Não por token. Os dois custam US$ 0,75 por milhão de tokens de entrada e US$ 3,75 por milhão de tokens de saída até 31 de dezembro de 2026. Depois, os preços passam para US$ 1,50 e US$ 7,50.
Por tarefa, sim. A Artificial Analysis mediu US$ 0,58 para o 3.8 Flash em high, contra US$ 0,40 para o 3.7 Flash em high, porque o modelo mais novo gera aproximadamente 30% mais tokens de saída.
O Google vai descontinuar o Gemini 3.7 Flash?
Não há indicação disso. O Google afirma que o 3.7 Flash continua totalmente suportado e não publicou uma data de descontinuação. Você pode permanecer nesse modelo.
O post sobre as novidades do Gemini 3.7 Flash continua sendo a referência para essa versão.
O que quebra ao mudar para o 3.8 Flash?
Duas coisas:
-
thinking_level: "minimal"retorna400 INVALID_ARGUMENT. - Cada resposta de função precisa incluir o identificador da chamada e
name:call_idna API de Interactions ouidnogenerateContentlegado.
O restante da API Gemini 3 permanece inalterado.
Como esse salto se compara ao Gemini 3.6 para o 3.7?
A mudança do 3.6 para o 3.7 foi maior nos benchmarks: o DeepSWE passou de 49,0% para 65,3%, e o índice da Artificial Analysis subiu de 52 para 56.
O avanço do 3.8 foi de três pontos no índice, acompanhado por uma mudança na forma como o modelo gasta tokens. Para entender a geração anterior, consulte Gemini 3.6 Flash vs. Gemini 3.5 Flash.
Resumo
Atualize para o Gemini 3.8 Flash se sua carga de trabalho envolver:
- agentes com várias etapas;
- uso intenso de ferramentas;
- documentos longos;
- fluxos financeiros, jurídicos ou de pesquisa.
É nesses cenários que os dados do Google e da Artificial Analysis mostram os maiores ganhos.
Mantenha o Gemini 3.7 Flash — ou use o 3.8 Flash em low — para chamadas curtas e repetitivas nas quais o custo por tarefa é mais importante que a qualidade adicional.
Independentemente da escolha:
- substitua
minimalporlow; - corrija as respostas de função para incluir o ID da chamada e
name; - execute os mesmos prompts nos dois modelos;
- monitore
candidatesTokenCountethoughtsTokenCount; - valide o custo no seu próprio ambiente antes de migrar em produção.
Fontes
- Post de lançamento do Gemini 3.8 Flash
- O que há de novo no Gemini 3.8 Flash
- O que é o Gemini 3.8 Flash
- Página de preços do Gemini
- Especificações e preços do Gemini 3.7 Flash
- Página DeepMind Flash
- Gemini 3.8 Flash vs. Claude Fable 5.1 vs. GPT-5.6 Sol
- Relatório da Artificial Analysis
- Ficha do Gemini 3.8 Flash
- Preços do Gemini 3.8 Flash
- Níveis de raciocínio do Gemini 3.8 Flash
- Guia de migração do Gemini 3.7 para o 3.8 Flash
- Apidog
- Como agendar testes de API no Apidog
- Download do Apidog
- Novidades do Gemini 3.7 Flash
- Gemini 3.6 Flash vs. Gemini 3.5 Flash
Top comments (0)