Gemini 3.8 Flash: mais raciocínio, o mesmo preço por token e maior custo por tarefa
O Gemini 3.8 Flash é o novo modelo da camada Flash do Google, lançado em 2 de setembro de 2026 junto com o modelo de segurança restrita Gemini 3.8 Flash Cyber. É o terceiro lançamento Flash em seis semanas, depois do Gemini 3.6 Flash em 21 de julho e do Gemini 3.7 Flash em 13 de agosto. Até 31 de dezembro de 2026, o preço introdutório permanece em US$ 0,75 por milhão de tokens de entrada e US$ 3,75 por milhão de tokens de saída. O Google o descreve como “nosso modelo Flash mais inteligente, projetado para engenharia de software de longo prazo, agentes autônomos e fluxos de trabalho empresariais complexos”.
A principal mudança não é preço nem janela de contexto: é comportamento. O 3.8 Flash executa etapas menores de raciocínio, verifica o próprio trabalho e chama ferramentas iterativamente. Isso melhora os benchmarks de agentes, mas também aumenta o consumo de tokens por tarefa. A Artificial Analysis mediu cerca de 30% mais tokens de saída que no 3.7 Flash.
Este guia resume especificações, níveis de raciocínio, benchmarks, preços, disponibilidade, limitações, o modelo Cyber e como testar tudo no Apidog usando HTTP e JSON.
Gemini 3.8 Flash em resumo
| Especificação | Valor |
|---|---|
| ID do modelo da API | gemini-3.8-flash |
| Lançamento | 2 de setembro de 2026 |
| Baseado em | Gemini 3.7 Flash, conforme o cartão do modelo DeepMind |
| Janela de contexto | 1.048.576 tokens de entrada |
| Saída máxima | 65.536 tokens |
| Modalidades de entrada | Texto, imagem, vídeo, áudio e PDF |
| Modalidades de saída | Somente texto |
| Níveis de raciocínio |
low, medium (padrão) e high; minimal retorna erro |
| Preço introdutório, até 31/12/2026 | US$ 0,75 entrada / US$ 3,75 saída por milhão de tokens |
| Preço padrão, a partir de 01/01/2027 | US$ 1,50 entrada / US$ 7,50 saída por milhão de tokens |
| Cache de contexto | US$ 0,075 por milhão de tokens em cache na introdução; US$ 0,15 no preço padrão |
| API em lote | 50% de desconto: US$ 0,375 / US$ 1,875 na introdução |
| Corte de conhecimento | Março de 2026 |
| Disponibilidade para desenvolvedores | Gemini API, Google AI Studio, Android Studio, Google Antigravity e Stitch |
| Disponibilidade para consumidores | Aplicativo Gemini para assinantes AI Pro e Ultra, Modo AI na Pesquisa e Gemini no Google Sheets |
| Status do 3.7 Flash | Totalmente suportado, sem data de descontinuação |
Três detalhes merecem atenção:
-
mediumé o nível padrão, nãohigh, como no Gemini 3 Pro. -
minimalretorna erro de validação; não é convertido silenciosamente paralow. - Embora o corte de conhecimento seja março de 2026, o cartão do modelo informa que alguns domínios podem ter conhecimento limitado a janeiro de 2025.
O que é o Gemini 3.8 Flash?
Flash é a camada de produção do Google: o modelo para a maior parte do tráfego, enquanto o Pro atende aos problemas mais difíceis. O Google chama o 3.8 Flash de seu “modelo de trabalho mais inteligente até agora”. O cartão do modelo DeepMind afirma que ele é baseado no 3.7 Flash, e não em uma nova base.
Na prática, trata-se de um refinamento lançado apenas três semanas depois do 3.7 Flash, ajustado para engenharia de software de longa duração e tarefas com agentes.
A cadência recente foi:
- Gemini 3.6 Flash: 21 de julho, US$ 1,50 / US$ 7,50.
- Gemini 3.7 Flash: 13 de agosto, preço introdutório de US$ 0,75 / US$ 3,75.
- Gemini 3.8 Flash: 2 de setembro, com o mesmo preço introdutório.
O Google chama isso de “terceiro lançamento Flash em seis semanas”. A Artificial Analysis conta quatro modelos Flash em menos de quatro meses porque inclui o 3.5 Flash-Lite. Não foram lançados um Gemini 3.8 Pro, Gemini 4 ou um novo Flash-Lite, e o Google não informou quando haverá uma atualização Pro.
“Trabalho mais árduo”: o que muda e quanto custa
Em tarefas complexas, o 3.8 Flash:
- executa etapas extras de raciocínio;
- divide o raciocínio em passos menores;
- verifica o trabalho durante a execução;
- chama ferramentas iterativamente;
- pode usar mais tokens em tarefas longas, especialmente em níveis de esforço altos.
Segundo a Artificial Analysis, no Índice de Inteligência, o 3.8 Flash com raciocínio high consumiu em média 48 mil tokens de saída por tarefa — 30% mais que o 3.7 Flash. Como os preços por token não mudaram, o custo médio por tarefa subiu de US$ 0,40 para US$ 0,58, e o tempo aumentou de 2,2 para 2,5 minutos.
O nível de raciocínio é a principal alavanca:
| Nível | Custo médio por tarefa | Tempo médio |
|---|---|---|
high |
US$ 0,58 | 2,5 min |
medium |
US$ 0,41 | — |
low |
US$ 0,24 | 0,8 min |
Use:
-
lowem endpoints sensíveis à latência; -
mediumem loops de agentes que precisam concluir tarefas com equilíbrio entre custo e qualidade; -
highem tarefas complexas de engenharia, análise e uso intensivo de ferramentas.
O detalhamento de preços analisa o impacto para 1.000 tarefas de agente por dia em cada nível.
A velocidade nominal não mudou. Logan Kilpatrick, do Google, descreveu o 3.8 Flash como tendo “o mesmo preço que o 3.7 e aproximadamente a mesma velocidade”. A Artificial Analysis mediu 302,1 tokens de saída por segundo com raciocínio high. Os 13,30 segundos até o primeiro token refletem o tempo de raciocínio antes da resposta, não uma lentidão de rede.
O que dizem os benchmarks?
Os números abaixo foram publicados pelo Google na página DeepMind Flash:
| Benchmark | 3.8 Flash | 3.7 Flash | Claude Opus 5 | GPT-5.6 Sol | GPT-5.6 Terra | Claude Sonnet 5 |
|---|---|---|---|---|---|---|
| Agente de Finanças Vals v2 | 61,4% | 59,0% | 58,6% | 53,8% | 54,4% | 53,9% |
| Benchmark de Agente Legal Harvey | 10,0% | 8,8% | 6,7% | 2,5% | 0,8% | 5,0% |
| HLE-Verificado | 54,9% | 53,6% | 54,4% | 54,5% | 51,1% | 31,0% |
Os ganhos sobre o 3.7 Flash são de 2,4, 1,2 e 1,3 pontos percentuais. As linhas de finanças e jurídico colocam um modelo da camada Flash à frente do Opus 5 e do GPT-5.6 Sol, que custam várias vezes mais por token.
O Claude Fable 5.1, lançado no dia anterior, não aparece nas tabelas do Google. A comparação de três vias usa Opus 5 e Sonnet 5 como os resultados publicados mais próximos.
O Google também afirma que:
- no DeepSWE v1.1, o 3.8 Flash supera a maioria dos modelos de fronteira maiores por uma fração do custo;
- uma avaliação interna concluiu mais de três vezes o número de tarefas do Gemini 3.7 Flash em fluxos longos e com muitos documentos;
- houve um “salto significativo” na resistência à injeção de prompt Gray Swan.
A porcentagem do DeepSWE aparece apenas nas imagens do cartão do modelo; o 3.7 Flash marcou 65,3%. Resultados de SWE-Bench Pro, Terminal-bench e OSWorld não foram publicados em texto para o 3.8 Flash.
A Artificial Analysis atribui ao 3.8 Flash high pontuação 59 no Índice de Inteligência, contra 56 do 3.7 Flash e 52 do 3.6 Flash. O resultado empata com GPT-5.6 Sol xhigh e Grok 4.6 medium, e supera GPT-5.6 Terra max, Claude Fable 5.1 medium e Muse Spark 1.2 xhigh, todos com 57.
No benchmark de uso de ferramentas τ³-Banking, o 3.8 Flash marcou 45% — 12 pontos acima do 3.7 Flash. A comparação entre 3.8 e 3.7 pondera esses ganhos contra o custo por tarefa.
Preços: iguais por token, maiores por tarefa
| Item | Até 31/12/2026 | A partir de 01/01/2027 |
|---|---|---|
| Entrada | US$ 0,75 / 1M | US$ 1,50 / 1M |
| Saída, incluindo raciocínio | US$ 3,75 / 1M | US$ 7,50 / 1M |
| Entrada em cache | US$ 0,075 / 1M | US$ 0,15 / 1M |
| Armazenamento em cache | US$ 0,50 / 1M tokens / hora | US$ 1,00 / 1M tokens / hora |
| Entrada / saída em lote | US$ 0,375 / US$ 1,875 | US$ 0,75 / US$ 3,75 |
Tokens de raciocínio são tokens de saída: são cobrados pela tarifa de saída e aparecem separadamente em usageMetadata.thoughtsTokenCount. Portanto, uma resposta curta em high pode custar mais que uma resposta longa em low.
O grounding na Pesquisa Google tem cobrança própria: são 5.000 requisições gratuitas por mês, compartilhadas entre os modelos Gemini 3.x; depois, o custo é de US$ 14 por 1.000 requisições.
Também existe uma camada gratuita com limite de taxa no AI Studio e na API. O Google informa que os dados da camada gratuita são usados para melhorar os produtos. Os limites por modelo aparecem no AI Studio.
Os níveis de acesso são:
- Camada 1: ao vincular uma conta de faturamento;
- Camada 2: após US$ 100 em gastos e três dias;
- Camada 3: após US$ 1.000 em gastos e 30 dias.
Para trabalhos que podem esperar, a API em lote oferece 50% de desconto.
Como chamar o Gemini 3.8 Flash
Para Gemini 3.x, o Google trata a API de Interações como o caminho principal. generateContent é considerado legado, mas continua totalmente suportado e sem data de descontinuação.
Uma solicitação mínima usando Interactions API:
curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H 'Content-Type: application/json' \
-d '{"model":"gemini-3.8-flash","input":"Explain HTTP caching in 3 sentences.","generation_config":{"thinking_level":"medium"}}'
Conversas com várias mensagens usam previous_interaction_id, permitindo que o servidor mantenha o estado.
Para chamada de função:
- declare as ferramentas com um esquema JSON;
- receba uma etapa
function_call; - envie um
function_resultcomcall_idename.
Esses dois campos são obrigatórios no 3.8 Flash. No generateContent legado, o identificador correspondente é id.
Migrando do Gemini 3.7 Flash
As mudanças são pequenas, mas podem causar erros:
-
minimalé rejeitado; -
thinking_budgetfoi substituído porthinking_level; -
candidate_countnão é suportado; - o Google recomenda manter
temperatureem1.0, pois valores menores podem causar loops ou degradação de desempenho.
Limitações
O Gemini 3.8 Flash não oferece:
- geração de áudio;
- API Live;
- geração de imagens;
- segmentação de imagens.
A saída é somente texto, embora a entrada aceite texto, imagem, vídeo, áudio e PDF.
Ele continua adequado como camada de raciocínio e chamada de ferramentas. Para texto barato e de alto rendimento sem raciocínio pesado, o Gemini 3.5 Flash-Lite permanece disponível por US$ 0,30 / US$ 2,50 por milhão de tokens.
Os recursos suportados incluem:
- chamada de função;
- saídas estruturadas;
- cache de contexto;
- execução de código;
- grounding na Pesquisa Google e no Google Maps;
- API em lote;
- uso de computador em pré-visualização.
Gemini 3.8 Flash Cyber: o modelo restrito
O Gemini 3.8 Flash Cyber foi lançado no mesmo dia, mas não está disponível para inscrição pública. O acesso ocorre exclusivamente pelo Programa Fairwind, voltado a:
- autoridades governamentais confiáveis;
- operadores de infraestrutura crítica;
- mantenedores de software.
O programa exige verificações de antecedentes e requisitos como MFA resistente a phishing. Não há API pública, preços públicos nem opção de auto-hospedagem. O modelo substitui o piloto limitado do 3.5 Flash Cyber.
Segundo o Google, o Cyber alcança:
- mais de 70% de sucesso na descoberta de vulnerabilidades reais em 20 linguagens de programação;
- 2,6 vezes mais patches corretos para vulnerabilidades do Chrome que os melhores modelos comerciais muito maiores.
Esses resultados são alegações do Google. O Programa Fairwind detalha elegibilidade e obrigações.
Testando no Apidog
Como o custo varia principalmente por tarefa, o teste importante não é apenas verificar se a chamada retorna sucesso. Meça também quantos tokens ela consome.
No Apidog:
- armazene
GEMINI_API_KEYcomo variável de ambiente; - salve as solicitações da Interactions API e de
generateContentcomo endpoints; - valide o status
200; - valide os campos JSON usados pela aplicação;
- defina um limite para
usageMetadata.thoughtsTokenCount; - execute o mesmo prompt com
low,mediumehigh; - agende o cenário diariamente.
Assim, você mede a distribuição real de tokens dos seus prompts e detecta regressões antes que cheguem à fatura.
As respostas em streaming são renderizadas como SSE. Isso facilita a depuração de resumos de raciocínio usando includeThoughts: true. O Apidog também pode ser baixado e configurado no plano gratuito.
FAQ
O Gemini 3.8 Flash é um modelo novo ou uma atualização do 3.7 Flash?
O cartão do modelo DeepMind afirma que ele é baseado no Gemini 3.7 Flash. Trate-o como um sucessor ajustado: mantém preço, velocidade e janela de contexto, mas adiciona mais raciocínio e chamadas iterativas de ferramentas. O 3.7 Flash continua totalmente suportado e não tem data de descontinuação.
Por que ele usa mais tokens que o 3.7 Flash?
Por design. O Google afirma que o modelo pode usar mais tokens em tarefas longas e complexas, e a Artificial Analysis mediu 30% mais tokens de saída. Use medium ou low em rotas que não precisam do raciocínio adicional.
Qual é a janela de contexto?
São 1.048.576 tokens de entrada e 65.536 tokens de saída. O cache de contexto custa US$ 0,075 por milhão de tokens até 31 de dezembro de 2026.
Posso usar o Gemini 3.8 Flash no aplicativo Gemini gratuito?
A cobertura de lançamento cita o aplicativo Gemini para assinantes Google AI Pro e Ultra, não para a camada gratuita do aplicativo. Desenvolvedores podem usar a camada gratuita com limite de taxa no AI Studio e na API.
Como ele se compara ao Claude Fable 5.1?
A Artificial Analysis pontua os modelos em 59 e 57, respectivamente. O Claude Fable 5.1 custa US$ 10 / US$ 50 por milhão de tokens — cerca de 13 vezes a tarifa introdutória do 3.8 Flash tanto na entrada quanto na saída. A diferença diminui quando o cálculo considera tokens por tarefa.
Próximos passos
O Gemini 3.8 Flash é um modelo de produção que pensa por mais tempo. A troca é clara: ganhos modestos em benchmarks de agentes e 12 pontos no uso de ferramentas, com cerca de 30% mais tokens de saída em raciocínio high.
- Se seus agentes atingem limites no 3.7 Flash, teste a migração: o preço por token é o mesmo durante o período introdutório.
- Se sua aplicação é sensível à latência, use
lowou permaneça no 3.7 Flash. - Meça
thoughtsTokenCountnos seus próprios prompts. - Escolha o nível de raciocínio por rota, não como uma configuração global.
- Use o Apidog para testar, comparar e agendar regressões de custo.
O número de tokens por tarefa — e não apenas a publicação de lançamento — deve decidir qual nível de raciocínio você usará.
Referências e guias
- Gemini 3.6 Flash
- Apidog
- Publicação de lançamento do Google
- Página do modelo
- Guia de níveis de raciocínio
- Cartão do modelo DeepMind
- Novidades do Gemini 3.7 Flash
- Relatório independente da Artificial Analysis
- Detalhamento de preços
- Página DeepMind Flash
- Comparação entre Claude Fable 5.1 e GPT-5.6 Sol
- Gemini 3.8 Flash vs. Gemini 3.7 Flash
- Página de preços
- Guia de acesso gratuito
- Guia da API em lote
- Passo a passo da API
- Guia de chamada de função
- Guia de migração do 3.7 para o 3.8 Flash
- Gemini 3.5 Flash-Lite
- Programa Fairwind
- Explicador do Gemini 3.8 Flash Cyber
- Guia para testar APIs de IA via SSE
- Baixe o Apidog
- Claude Fable 5.1

Top comments (0)