DEV Community

Cover image for O que é o Gemini 3.8 Flash?
Lucas
Lucas

Posted on Originally published at apidog.com

O que é o Gemini 3.8 Flash?

Gemini 3.8 Flash: mais raciocínio, o mesmo preço por token e maior custo por tarefa

O Gemini 3.8 Flash é o novo modelo da camada Flash do Google, lançado em 2 de setembro de 2026 junto com o modelo de segurança restrita Gemini 3.8 Flash Cyber. É o terceiro lançamento Flash em seis semanas, depois do Gemini 3.6 Flash em 21 de julho e do Gemini 3.7 Flash em 13 de agosto. Até 31 de dezembro de 2026, o preço introdutório permanece em US$ 0,75 por milhão de tokens de entrada e US$ 3,75 por milhão de tokens de saída. O Google o descreve como “nosso modelo Flash mais inteligente, projetado para engenharia de software de longo prazo, agentes autônomos e fluxos de trabalho empresariais complexos”.

Experimente o Apidog hoje

Imagem ilustrativa do Gemini 3.8 Flash

A principal mudança não é preço nem janela de contexto: é comportamento. O 3.8 Flash executa etapas menores de raciocínio, verifica o próprio trabalho e chama ferramentas iterativamente. Isso melhora os benchmarks de agentes, mas também aumenta o consumo de tokens por tarefa. A Artificial Analysis mediu cerca de 30% mais tokens de saída que no 3.7 Flash.

Este guia resume especificações, níveis de raciocínio, benchmarks, preços, disponibilidade, limitações, o modelo Cyber e como testar tudo no Apidog usando HTTP e JSON.

Gemini 3.8 Flash em resumo

Especificação Valor
ID do modelo da API gemini-3.8-flash
Lançamento 2 de setembro de 2026
Baseado em Gemini 3.7 Flash, conforme o cartão do modelo DeepMind
Janela de contexto 1.048.576 tokens de entrada
Saída máxima 65.536 tokens
Modalidades de entrada Texto, imagem, vídeo, áudio e PDF
Modalidades de saída Somente texto
Níveis de raciocínio low, medium (padrão) e high; minimal retorna erro
Preço introdutório, até 31/12/2026 US$ 0,75 entrada / US$ 3,75 saída por milhão de tokens
Preço padrão, a partir de 01/01/2027 US$ 1,50 entrada / US$ 7,50 saída por milhão de tokens
Cache de contexto US$ 0,075 por milhão de tokens em cache na introdução; US$ 0,15 no preço padrão
API em lote 50% de desconto: US$ 0,375 / US$ 1,875 na introdução
Corte de conhecimento Março de 2026
Disponibilidade para desenvolvedores Gemini API, Google AI Studio, Android Studio, Google Antigravity e Stitch
Disponibilidade para consumidores Aplicativo Gemini para assinantes AI Pro e Ultra, Modo AI na Pesquisa e Gemini no Google Sheets
Status do 3.7 Flash Totalmente suportado, sem data de descontinuação

Três detalhes merecem atenção:

  • medium é o nível padrão, não high, como no Gemini 3 Pro.
  • minimal retorna erro de validação; não é convertido silenciosamente para low.
  • Embora o corte de conhecimento seja março de 2026, o cartão do modelo informa que alguns domínios podem ter conhecimento limitado a janeiro de 2025.

O que é o Gemini 3.8 Flash?

Flash é a camada de produção do Google: o modelo para a maior parte do tráfego, enquanto o Pro atende aos problemas mais difíceis. O Google chama o 3.8 Flash de seu “modelo de trabalho mais inteligente até agora”. O cartão do modelo DeepMind afirma que ele é baseado no 3.7 Flash, e não em uma nova base.

Na prática, trata-se de um refinamento lançado apenas três semanas depois do 3.7 Flash, ajustado para engenharia de software de longa duração e tarefas com agentes.

A cadência recente foi:

  • Gemini 3.6 Flash: 21 de julho, US$ 1,50 / US$ 7,50.
  • Gemini 3.7 Flash: 13 de agosto, preço introdutório de US$ 0,75 / US$ 3,75.
  • Gemini 3.8 Flash: 2 de setembro, com o mesmo preço introdutório.

O Google chama isso de “terceiro lançamento Flash em seis semanas”. A Artificial Analysis conta quatro modelos Flash em menos de quatro meses porque inclui o 3.5 Flash-Lite. Não foram lançados um Gemini 3.8 Pro, Gemini 4 ou um novo Flash-Lite, e o Google não informou quando haverá uma atualização Pro.

“Trabalho mais árduo”: o que muda e quanto custa

Em tarefas complexas, o 3.8 Flash:

  • executa etapas extras de raciocínio;
  • divide o raciocínio em passos menores;
  • verifica o trabalho durante a execução;
  • chama ferramentas iterativamente;
  • pode usar mais tokens em tarefas longas, especialmente em níveis de esforço altos.

Segundo a Artificial Analysis, no Índice de Inteligência, o 3.8 Flash com raciocínio high consumiu em média 48 mil tokens de saída por tarefa — 30% mais que o 3.7 Flash. Como os preços por token não mudaram, o custo médio por tarefa subiu de US$ 0,40 para US$ 0,58, e o tempo aumentou de 2,2 para 2,5 minutos.

O nível de raciocínio é a principal alavanca:

Nível Custo médio por tarefa Tempo médio
high US$ 0,58 2,5 min
medium US$ 0,41
low US$ 0,24 0,8 min

Use:

  • low em endpoints sensíveis à latência;
  • medium em loops de agentes que precisam concluir tarefas com equilíbrio entre custo e qualidade;
  • high em tarefas complexas de engenharia, análise e uso intensivo de ferramentas.

O detalhamento de preços analisa o impacto para 1.000 tarefas de agente por dia em cada nível.

A velocidade nominal não mudou. Logan Kilpatrick, do Google, descreveu o 3.8 Flash como tendo “o mesmo preço que o 3.7 e aproximadamente a mesma velocidade”. A Artificial Analysis mediu 302,1 tokens de saída por segundo com raciocínio high. Os 13,30 segundos até o primeiro token refletem o tempo de raciocínio antes da resposta, não uma lentidão de rede.

O que dizem os benchmarks?

Os números abaixo foram publicados pelo Google na página DeepMind Flash:

Benchmark 3.8 Flash 3.7 Flash Claude Opus 5 GPT-5.6 Sol GPT-5.6 Terra Claude Sonnet 5
Agente de Finanças Vals v2 61,4% 59,0% 58,6% 53,8% 54,4% 53,9%
Benchmark de Agente Legal Harvey 10,0% 8,8% 6,7% 2,5% 0,8% 5,0%
HLE-Verificado 54,9% 53,6% 54,4% 54,5% 51,1% 31,0%

Os ganhos sobre o 3.7 Flash são de 2,4, 1,2 e 1,3 pontos percentuais. As linhas de finanças e jurídico colocam um modelo da camada Flash à frente do Opus 5 e do GPT-5.6 Sol, que custam várias vezes mais por token.

O Claude Fable 5.1, lançado no dia anterior, não aparece nas tabelas do Google. A comparação de três vias usa Opus 5 e Sonnet 5 como os resultados publicados mais próximos.

O Google também afirma que:

  • no DeepSWE v1.1, o 3.8 Flash supera a maioria dos modelos de fronteira maiores por uma fração do custo;
  • uma avaliação interna concluiu mais de três vezes o número de tarefas do Gemini 3.7 Flash em fluxos longos e com muitos documentos;
  • houve um “salto significativo” na resistência à injeção de prompt Gray Swan.

A porcentagem do DeepSWE aparece apenas nas imagens do cartão do modelo; o 3.7 Flash marcou 65,3%. Resultados de SWE-Bench Pro, Terminal-bench e OSWorld não foram publicados em texto para o 3.8 Flash.

A Artificial Analysis atribui ao 3.8 Flash high pontuação 59 no Índice de Inteligência, contra 56 do 3.7 Flash e 52 do 3.6 Flash. O resultado empata com GPT-5.6 Sol xhigh e Grok 4.6 medium, e supera GPT-5.6 Terra max, Claude Fable 5.1 medium e Muse Spark 1.2 xhigh, todos com 57.

No benchmark de uso de ferramentas τ³-Banking, o 3.8 Flash marcou 45% — 12 pontos acima do 3.7 Flash. A comparação entre 3.8 e 3.7 pondera esses ganhos contra o custo por tarefa.

Preços: iguais por token, maiores por tarefa

Item Até 31/12/2026 A partir de 01/01/2027
Entrada US$ 0,75 / 1M US$ 1,50 / 1M
Saída, incluindo raciocínio US$ 3,75 / 1M US$ 7,50 / 1M
Entrada em cache US$ 0,075 / 1M US$ 0,15 / 1M
Armazenamento em cache US$ 0,50 / 1M tokens / hora US$ 1,00 / 1M tokens / hora
Entrada / saída em lote US$ 0,375 / US$ 1,875 US$ 0,75 / US$ 3,75

Tokens de raciocínio são tokens de saída: são cobrados pela tarifa de saída e aparecem separadamente em usageMetadata.thoughtsTokenCount. Portanto, uma resposta curta em high pode custar mais que uma resposta longa em low.

O grounding na Pesquisa Google tem cobrança própria: são 5.000 requisições gratuitas por mês, compartilhadas entre os modelos Gemini 3.x; depois, o custo é de US$ 14 por 1.000 requisições.

Também existe uma camada gratuita com limite de taxa no AI Studio e na API. O Google informa que os dados da camada gratuita são usados para melhorar os produtos. Os limites por modelo aparecem no AI Studio.

Os níveis de acesso são:

  • Camada 1: ao vincular uma conta de faturamento;
  • Camada 2: após US$ 100 em gastos e três dias;
  • Camada 3: após US$ 1.000 em gastos e 30 dias.

Para trabalhos que podem esperar, a API em lote oferece 50% de desconto.

Como chamar o Gemini 3.8 Flash

Para Gemini 3.x, o Google trata a API de Interações como o caminho principal. generateContent é considerado legado, mas continua totalmente suportado e sem data de descontinuação.

Uma solicitação mínima usando Interactions API:

curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H 'Content-Type: application/json' \
  -d '{"model":"gemini-3.8-flash","input":"Explain HTTP caching in 3 sentences.","generation_config":{"thinking_level":"medium"}}'
Enter fullscreen mode Exit fullscreen mode

Conversas com várias mensagens usam previous_interaction_id, permitindo que o servidor mantenha o estado.

Para chamada de função:

  1. declare as ferramentas com um esquema JSON;
  2. receba uma etapa function_call;
  3. envie um function_result com call_id e name.

Esses dois campos são obrigatórios no 3.8 Flash. No generateContent legado, o identificador correspondente é id.

Migrando do Gemini 3.7 Flash

As mudanças são pequenas, mas podem causar erros:

  • minimal é rejeitado;
  • thinking_budget foi substituído por thinking_level;
  • candidate_count não é suportado;
  • o Google recomenda manter temperature em 1.0, pois valores menores podem causar loops ou degradação de desempenho.

Limitações

O Gemini 3.8 Flash não oferece:

  • geração de áudio;
  • API Live;
  • geração de imagens;
  • segmentação de imagens.

A saída é somente texto, embora a entrada aceite texto, imagem, vídeo, áudio e PDF.

Ele continua adequado como camada de raciocínio e chamada de ferramentas. Para texto barato e de alto rendimento sem raciocínio pesado, o Gemini 3.5 Flash-Lite permanece disponível por US$ 0,30 / US$ 2,50 por milhão de tokens.

Os recursos suportados incluem:

  • chamada de função;
  • saídas estruturadas;
  • cache de contexto;
  • execução de código;
  • grounding na Pesquisa Google e no Google Maps;
  • API em lote;
  • uso de computador em pré-visualização.

Gemini 3.8 Flash Cyber: o modelo restrito

O Gemini 3.8 Flash Cyber foi lançado no mesmo dia, mas não está disponível para inscrição pública. O acesso ocorre exclusivamente pelo Programa Fairwind, voltado a:

  • autoridades governamentais confiáveis;
  • operadores de infraestrutura crítica;
  • mantenedores de software.

O programa exige verificações de antecedentes e requisitos como MFA resistente a phishing. Não há API pública, preços públicos nem opção de auto-hospedagem. O modelo substitui o piloto limitado do 3.5 Flash Cyber.

Segundo o Google, o Cyber alcança:

  • mais de 70% de sucesso na descoberta de vulnerabilidades reais em 20 linguagens de programação;
  • 2,6 vezes mais patches corretos para vulnerabilidades do Chrome que os melhores modelos comerciais muito maiores.

Esses resultados são alegações do Google. O Programa Fairwind detalha elegibilidade e obrigações.

Testando no Apidog

Como o custo varia principalmente por tarefa, o teste importante não é apenas verificar se a chamada retorna sucesso. Meça também quantos tokens ela consome.

No Apidog:

  1. armazene GEMINI_API_KEY como variável de ambiente;
  2. salve as solicitações da Interactions API e de generateContent como endpoints;
  3. valide o status 200;
  4. valide os campos JSON usados pela aplicação;
  5. defina um limite para usageMetadata.thoughtsTokenCount;
  6. execute o mesmo prompt com low, medium e high;
  7. agende o cenário diariamente.

Assim, você mede a distribuição real de tokens dos seus prompts e detecta regressões antes que cheguem à fatura.

As respostas em streaming são renderizadas como SSE. Isso facilita a depuração de resumos de raciocínio usando includeThoughts: true. O Apidog também pode ser baixado e configurado no plano gratuito.

FAQ

O Gemini 3.8 Flash é um modelo novo ou uma atualização do 3.7 Flash?

O cartão do modelo DeepMind afirma que ele é baseado no Gemini 3.7 Flash. Trate-o como um sucessor ajustado: mantém preço, velocidade e janela de contexto, mas adiciona mais raciocínio e chamadas iterativas de ferramentas. O 3.7 Flash continua totalmente suportado e não tem data de descontinuação.

Por que ele usa mais tokens que o 3.7 Flash?

Por design. O Google afirma que o modelo pode usar mais tokens em tarefas longas e complexas, e a Artificial Analysis mediu 30% mais tokens de saída. Use medium ou low em rotas que não precisam do raciocínio adicional.

Qual é a janela de contexto?

São 1.048.576 tokens de entrada e 65.536 tokens de saída. O cache de contexto custa US$ 0,075 por milhão de tokens até 31 de dezembro de 2026.

Posso usar o Gemini 3.8 Flash no aplicativo Gemini gratuito?

A cobertura de lançamento cita o aplicativo Gemini para assinantes Google AI Pro e Ultra, não para a camada gratuita do aplicativo. Desenvolvedores podem usar a camada gratuita com limite de taxa no AI Studio e na API.

Como ele se compara ao Claude Fable 5.1?

A Artificial Analysis pontua os modelos em 59 e 57, respectivamente. O Claude Fable 5.1 custa US$ 10 / US$ 50 por milhão de tokens — cerca de 13 vezes a tarifa introdutória do 3.8 Flash tanto na entrada quanto na saída. A diferença diminui quando o cálculo considera tokens por tarefa.

Próximos passos

O Gemini 3.8 Flash é um modelo de produção que pensa por mais tempo. A troca é clara: ganhos modestos em benchmarks de agentes e 12 pontos no uso de ferramentas, com cerca de 30% mais tokens de saída em raciocínio high.

  • Se seus agentes atingem limites no 3.7 Flash, teste a migração: o preço por token é o mesmo durante o período introdutório.
  • Se sua aplicação é sensível à latência, use low ou permaneça no 3.7 Flash.
  • Meça thoughtsTokenCount nos seus próprios prompts.
  • Escolha o nível de raciocínio por rota, não como uma configuração global.
  • Use o Apidog para testar, comparar e agendar regressões de custo.

O número de tokens por tarefa — e não apenas a publicação de lançamento — deve decidir qual nível de raciocínio você usará.

Referências e guias

Top comments (0)