DEV Community

Cover image for Gemini 3.8 Flash vs 3.7 Flash: o que mudou e vale a pena atualizar?
Lucas
Lucas

Posted on Originally published at apidog.com

Gemini 3.8 Flash vs 3.7 Flash: o que mudou e vale a pena atualizar?

Gemini 3.8 Flash vs. 3.7 Flash: o que mudou, quanto custa e quando migrar

O Google lançou o Gemini 3.8 Flash em 2 de setembro de 2026, três semanas após o Gemini 3.7 Flash e seis semanas após o 3.6 Flash. O preço inicial permanece em US$ 0,75 por milhão de tokens de entrada e US$ 3,75 por milhão de tokens de saída até 31 de dezembro, com contexto de 1 milhão de tokens e velocidade aproximadamente igual, segundo o Google. A diferença está no funcionamento: o modelo executa etapas menores de raciocínio, verifica a própria saída e chama ferramentas em loops. Isso melhora os benchmarks, mas também aumenta o consumo de tokens.

Experimente o Apidog hoje

A pergunta, portanto, não é apenas “o 3.8 Flash é melhor?”. No papel, sim. O ponto é saber se a qualidade adicional compensa os tokens extras na sua carga de trabalho e se as duas alterações incompatíveis afetam o código existente.

Esta comparação reúne as diferenças de comportamento, preço, desempenho e compatibilidade. Os dados vêm do post de lançamento do Google, da página O que há de novo no Gemini 3.8 Flash e dos testes independentes da Artificial Analysis. Para a especificação completa, consulte o que é o Gemini 3.8 Flash.

O Gemini 3.7 Flash continua totalmente suportado e o Google não publicou uma data de descontinuação. A migração é opcional.

Comparativo

Item Gemini 3.8 Flash Gemini 3.7 Flash
ID do modelo gemini-3.8-flash gemini-3.7-flash
Lançamento 2 de setembro de 2026 13 de agosto de 2026
Base Baseado no Gemini 3.7 Flash
Contexto / saída máxima 1.048.576 / 65.536 tokens Mesmo
Preço de entrada até 31 de dezembro US$ 0,75 por milhão US$ 0,75 por milhão
Preço de saída até 31 de dezembro US$ 3,75 por milhão, com raciocínio incluído US$ 3,75 por milhão, com raciocínio incluído
Preço padrão a partir de 1º de janeiro de 2027 US$ 1,50 / US$ 7,50 US$ 1,50 / US$ 7,50
Leitura do cache de contexto US$ 0,075 por milhão no lançamento Mesmo
Processamento em lote 50% de desconto Mesmo
Níveis de raciocínio low, medium (padrão), high low, medium, high
thinking_level: "minimal" Erro de validação Aceito; mapeie para low
Corte de conhecimento Março de 2026 Não reafirmado na documentação do 3.8
Velocidade de saída Aproximadamente 300 tokens/s; 302,1 medidos em high Aproximadamente igual, segundo o Google
Índice de Inteligência da Artificial Analysis 59 em high 56 em high
Suporte Atual Totalmente suportado, sem data de descontinuação

O que permaneceu igual

Preço e limites

Os dois modelos usam as mesmas faixas de preço:

  • US$ 0,75 por milhão de tokens de entrada;
  • US$ 3,75 por milhão de tokens de saída até 31 de dezembro de 2026;
  • US$ 1,50 por milhão de tokens de entrada e US$ 7,50 por milhão de tokens de saída a partir de 1º de janeiro de 2027;
  • US$ 0,075 por milhão de tokens para leitura do cache de contexto no lançamento;
  • 50% de desconto no processamento em lote;
  • 5.000 solicitações gratuitas de grounding com Google Search por mês, compartilhadas entre os modelos Gemini 3.x.

A página de preços do Gemini e a referência de especificações e preços do Gemini 3.7 Flash continuam válidas como referência.

O contexto máximo também não mudou: 1.048.576 tokens de entrada e 65.536 tokens de saída.

Modalidades e API

Ambos aceitam:

  • texto;
  • imagem;
  • vídeo;
  • áudio;
  • PDF.

A saída permanece limitada a texto. Nenhum dos dois modelos gera áudio ou imagens, nem oferece a Live API.

A API de Interactions é o caminho principal para o Gemini 3.x, mas o endpoint legado generateContent continua totalmente suportado, sem data de descontinuação. Na maioria dos casos, o código do Gemini 3.7 Flash funciona após substituir o ID do modelo por gemini-3.8-flash. As exceções estão descritas na seção sobre alterações incompatíveis.

Velocidade

O Google descreve o 3.8 Flash como tendo “aproximadamente a mesma velocidade” do 3.7 Flash.

A Artificial Analysis mediu 302,1 tokens de saída por segundo em uma execução com raciocínio high. Essa é a velocidade depois que o modelo começa a escrever. O tempo até o primeiro token foi de 13,30 segundos, pois o modelo raciocina antes de responder.

O que melhorou

O Google apresenta o 3.8 Flash como “nosso modelo Flash mais inteligente”, voltado para:

  • engenharia de software de longo horizonte;
  • agentes autônomos;
  • fluxos de trabalho empresariais complexos.

A mudança principal é comportamental. Em tarefas difíceis, o modelo executa etapas adicionais de raciocínio, divide essas etapas em passos menores, chama ferramentas iterativamente e verifica o próprio trabalho durante a execução.

Benchmarks publicados pelo Google

Na página DeepMind Flash, o Google publicou estas comparações:

Benchmark Gemini 3.8 Flash Gemini 3.7 Flash Diferença
Vals Finance Agent v2 61,4% 59,0% +2,4
HLE-Verified 54,9% 53,6% +1,3
Harvey Legal Agent Benchmark 10,0% 8,8% +1,2

Os ganhos são modestos, mas consistentes. Em cada linha, o 3.8 Flash também supera modelos maiores apresentados na tabela do Google, como Claude Opus 5, que marcou 58,6% no Vals Finance e 54,4% no HLE-Verified. A comparação com Claude Fable 5.1 e GPT-5.6 Sol aprofunda essa análise.

Testes independentes

A Artificial Analysis atribuiu ao Gemini 3.8 Flash:

  • Índice de Inteligência 59 em high;
  • 56 para o Gemini 3.7 Flash;
  • 52 para o Gemini 3.6 Flash;
  • 45% no τ³-Banking, benchmark de uso de ferramentas — 12 pontos acima do Gemini 3.7 Flash.

Para agentes que executam chamadas de ferramentas reais, o resultado no τ³-Banking é mais relevante do que um índice geral.

Fluxos com muitos documentos

O Google afirma que o 3.8 Flash conclui mais de três vezes mais tarefas que o 3.7 Flash em fluxos longos com muitos documentos.

Essa é uma avaliação interna, sem um harness público, portanto deve ser tratada como indicativa. Ainda assim, a afirmação é coerente com o novo design: etapas adicionais de verificação são mais úteis quando um erro inicial pode comprometer um fluxo de 40 etapas.

Codificação agêntica

No DeepSWE v1.1, o Gemini 3.7 Flash marcou 65,3%, contra 49,0% do Gemini 3.6 Flash. O Google afirma que o 3.8 Flash supera a maioria dos modelos maiores de ponta nessa categoria por uma fração do custo.

A porcentagem exata do 3.8 Flash aparece apenas nas tabelas de imagem da ficha do modelo, não no texto publicado. Por isso, não é possível apresentar um número textual confiável.

Os resultados do Gemini 3.8 Flash em SWE-Bench Pro, Terminal-bench e OSWorld também não foram publicados em texto. Se esses benchmarks forem decisivos para sua escolha, aguarde avaliações de terceiros ou execute seus próprios testes.

Segurança e resistência a injeções

O Google relata um “salto significativo” nos testes de injeção de prompt da Gray Swan, mas não publicou um número agregado.

Os deltas da ficha do modelo em relação ao 3.7 Flash são:

  • segurança multilíngue: +5,4 pontos;
  • segurança texto para texto: -0,4 ponto;
  • recusas injustificadas: +1,1 ponto.

O último resultado indica um leve aumento nas recusas excessivas.

O custo real por tarefa

O preço por token não mudou. O custo por tarefa, sim.

O Google afirma que o modelo pode usar mais tokens em tarefas longas e complexas e que pode consumir tokens adicionais para maximizar o desempenho, principalmente nos níveis de esforço mais altos.

A Artificial Analysis mediu uma média de 48.000 tokens de saída por tarefa no Gemini 3.8 Flash — 30% a mais que no 3.7 Flash. Com o mesmo preço por token, o custo final aumenta:

Configuração Custo por tarefa Tempo por tarefa
Gemini 3.7 Flash, high US$ 0,40 2,2 min
Gemini 3.8 Flash, low US$ 0,24 0,8 min
Gemini 3.8 Flash, medium US$ 0,41 Não publicado
Gemini 3.8 Flash, high US$ 0,58 2,5 min

Três conclusões são importantes:

  1. O Gemini 3.8 Flash em high custa aproximadamente 45% mais por tarefa do que o 3.7 Flash em high e leva 14% mais tempo.
  2. O 3.8 Flash em medium, nível padrão, custa apenas US$ 0,01 a mais que o 3.7 Flash em high.
  3. O 3.8 Flash em low é a opção mais barata e rápida da tabela.

Para rotas sensíveis à latência, low pode ser uma alternativa direta a manter o 3.7 Flash em high. O detalhamento de preços do Gemini 3.8 Flash ajuda a projetar esse impacto em volumes diários.

Alterações incompatíveis

Duas mudanças afetam diretamente o código que migra do Gemini 3.7 Flash.

1. thinking_level: "minimal" falha

O Gemini 3.8 Flash aceita apenas:

low
medium
high
Enter fullscreen mode Exit fullscreen mode

Uma configuração com thinking_level: "minimal" retorna erro de validação. Mapeie esse valor para low:

{
  "thinkingConfig": {
    "thinkingLevel": "low"
  }
}
Enter fullscreen mode Exit fullscreen mode

Consulte o guia de níveis de raciocínio para comparar custo, latência e profundidade.

2. Resultados de funções exigem call_id e name

Na API de Interactions, todo function_result precisa conter:

  • call_id;
  • name.

No endpoint legado generateContent, todo functionResponse precisa conter:

  • o id correspondente;
  • name.

Código que envia resultados apenas com name falhará na segunda etapa de um loop de ferramentas.

Ao migrar, também revise as recomendações do guia de migração do Gemini 3.7 para o 3.8 Flash:

  • mantenha temperature no padrão 1.0;
  • use thinking_level em vez de um thinking_budget inteiro;
  • descarte candidate_count;
  • devolva as assinaturas de pensamento exatamente como foram recebidas.

Essas últimas recomendações não são novas no 3.8, mas uma base de código do 3.7 que as ignorava pode apresentar problemas durante a transição.

Matriz de decisão por carga de trabalho

Carga de trabalho Recomendação Motivo
Agentes com várias etapas e chamadas de ferramentas Atualize para medium ou high +12 pontos no τ³-Banking e loops iterativos são o foco do 3.8
Extração e revisão de documentos longos Atualize A alegação de mais de 3x tarefas concluídas mira esse formato
Codificação agêntica em um harness Atualize e meça O número textual do DeepSWE não foi publicado
Agentes financeiros, jurídicos e de pesquisa Atualize Os três benchmarks publicados pelo Google favorecem o 3.8
Classificação, extração e chat de alto volume Mantenha o 3.7 ou use o 3.8 em low O custo por tarefa é a métrica principal
Endpoints voltados ao usuário e sensíveis à latência Use o 3.8 em low 0,8 minuto por tarefa contra 2,2 minutos do 3.7 em high
Fluxos que usam minimal Migre primeiro O valor causa erro de validação no 3.8
Pipelines em lote com orçamento preciso Mantenha o 3.7 até reavaliar O preço por token é igual, mas o consumo de saída aumentou 30%

A regra geral é simples: quanto mais longa, difícil e agêntica for a tarefa, mais o design do 3.8 justifica os tokens adicionais. Em tarefas curtas e repetitivas, o nível de raciocínio — ou a permanência no 3.7 — tem maior impacto.

Teste os dois modelos no mesmo cenário do Apidog

Os números por tarefa acima foram medidos no harness da Artificial Analysis, não no seu ambiente. Antes de alterar o modelo em produção, execute os mesmos prompts nos dois modelos e compare:

  • tokens de saída;
  • tokens de raciocínio;
  • latência;
  • qualidade da resposta;
  • custo por tarefa;
  • campos consumidos pela sua aplicação.

O Apidog permite montar esse teste rapidamente.

1. Configure a chave e a requisição

Defina GEMINI_API_KEY como variável de ambiente em um ambiente do Apidog.

Depois, adicione uma requisição POST para:

https://generativelanguage.googleapis.com/v1beta/models/{{model}}:generateContent
Enter fullscreen mode Exit fullscreen mode

Configure o cabeçalho x-goog-api-key para ler o valor da variável de ambiente.

Use model como variável de cenário. O corpo pode ser o mesmo para as duas execuções:

{
  "contents": [{"parts": [{"text": "{{golden_prompt}}"}]}],
  "generationConfig": {"thinkingConfig": {"thinkingLevel": "medium"}}
}
Enter fullscreen mode Exit fullscreen mode

2. Crie o cenário de teste

Adicione duas etapas:

  1. model = gemini-3.7-flash
  2. model = gemini-3.8-flash

Em cada etapa, crie asserções para:

usageMetadata.candidatesTokenCount
usageMetadata.thoughtsTokenCount
Enter fullscreen mode Exit fullscreen mode

Defina limites compatíveis com seu orçamento e adicione uma asserção de caminho JSON para cada campo que a aplicação realmente lê.

Execute o cenário com 10 ou 20 prompts de referência. O relatório reunirá as respostas e as asserções das duas etapas, permitindo transformar o aumento de 30% observado pela Artificial Analysis em uma medição do seu próprio caso de uso.

3. Agende o teste

Depois de validar os limites, agende o cenário para detectar aumentos silenciosos no consumo de tokens após futuras atualizações do modelo. Assim, uma mudança de custo falha no teste antes de aparecer na fatura.

Veja como agendar testes de API no Apidog ou baixe o Apidog. O plano gratuito cobre este fluxo de trabalho.

Perguntas frequentes

O Gemini 3.8 Flash é mais rápido que o 3.7 Flash?

Não de forma significativa. O Google afirma que a velocidade é aproximadamente igual, e a Artificial Analysis mediu cerca de 300 tokens por segundo em high.

O tempo total por tarefa aumentou no harness da Artificial Analysis: 2,5 minutos no 3.8 Flash em high, contra 2,2 minutos no 3.7 Flash em high. Em low, o 3.8 Flash caiu para 0,8 minuto.

O Gemini 3.8 Flash custa mais que o 3.7 Flash?

Não por token. Os dois custam US$ 0,75 por milhão de tokens de entrada e US$ 3,75 por milhão de tokens de saída até 31 de dezembro de 2026. Depois, os preços passam para US$ 1,50 e US$ 7,50.

Por tarefa, sim. A Artificial Analysis mediu US$ 0,58 para o 3.8 Flash em high, contra US$ 0,40 para o 3.7 Flash em high, porque o modelo mais novo gera aproximadamente 30% mais tokens de saída.

O Google vai descontinuar o Gemini 3.7 Flash?

Não há indicação disso. O Google afirma que o 3.7 Flash continua totalmente suportado e não publicou uma data de descontinuação. Você pode permanecer nesse modelo.

O post sobre as novidades do Gemini 3.7 Flash continua sendo a referência para essa versão.

O que quebra ao mudar para o 3.8 Flash?

Duas coisas:

  1. thinking_level: "minimal" retorna 400 INVALID_ARGUMENT.
  2. Cada resposta de função precisa incluir o identificador da chamada e name: call_id na API de Interactions ou id no generateContent legado.

O restante da API Gemini 3 permanece inalterado.

Como esse salto se compara ao Gemini 3.6 para o 3.7?

A mudança do 3.6 para o 3.7 foi maior nos benchmarks: o DeepSWE passou de 49,0% para 65,3%, e o índice da Artificial Analysis subiu de 52 para 56.

O avanço do 3.8 foi de três pontos no índice, acompanhado por uma mudança na forma como o modelo gasta tokens. Para entender a geração anterior, consulte Gemini 3.6 Flash vs. Gemini 3.5 Flash.

Resumo

Atualize para o Gemini 3.8 Flash se sua carga de trabalho envolver:

  • agentes com várias etapas;
  • uso intenso de ferramentas;
  • documentos longos;
  • fluxos financeiros, jurídicos ou de pesquisa.

É nesses cenários que os dados do Google e da Artificial Analysis mostram os maiores ganhos.

Mantenha o Gemini 3.7 Flash — ou use o 3.8 Flash em low — para chamadas curtas e repetitivas nas quais o custo por tarefa é mais importante que a qualidade adicional.

Independentemente da escolha:

  1. substitua minimal por low;
  2. corrija as respostas de função para incluir o ID da chamada e name;
  3. execute os mesmos prompts nos dois modelos;
  4. monitore candidatesTokenCount e thoughtsTokenCount;
  5. valide o custo no seu próprio ambiente antes de migrar em produção.

Fontes

Top comments (0)