Gemini 3.8 Flash: o preço por token não mudou, mas a conta pode aumentar
O Gemini 3.8 Flash custa US$ 0,75 por milhão de tokens de entrada e US$ 3,75 por milhão de tokens de saída — a mesma taxa introdutória definida pelo Google para o 3.7 Flash. Esse preço vale até 31 de dezembro de 2026. Em 1º de janeiro de 2027, os valores dobram para US$ 1,50 e US$ 7,50. A mesma duplicação será aplicada ao 3.6 Flash e ao 3.7 Flash. Nada mudou no preço por token com o lançamento, conforme a página oficial de preços da API Gemini.
O que mudou foi a quantidade de tokens consumida. Segundo o Google, o 3.8 Flash “trabalha mais”: executa mais etapas de raciocínio, chama ferramentas iterativamente e pode usar mais tokens em tarefas longas e complexas. A Artificial Analysis mediu o efeito: seu Índice de Inteligência custou US$ 0,58 por tarefa no 3.8 Flash com raciocínio alto, contra US$ 0,40 no 3.7 Flash, com aproximadamente 30% mais tokens de saída por tarefa.
Este guia detalha os preços da API, mostra o impacto de cada nível de raciocínio e apresenta uma forma de detectar regressões de custo com testes automatizados. Para uma visão geral do modelo, consulte o que é o Gemini 3.8 Flash.
Preços do Gemini 3.8 Flash
Todos os valores abaixo são por 1 milhão de tokens na camada paga.
| Item | Introdução até 31/12/2026 | Padrão a partir de 01/01/2027 |
|---|---|---|
| Entrada: texto, imagem, vídeo, áudio e PDF | US$ 0,75 | US$ 1,50 |
| Saída, incluindo tokens de raciocínio | US$ 3,75 | US$ 7,50 |
| Leitura de cache de contexto | US$ 0,075 | US$ 0,15 |
| Armazenamento em cache por 1 milhão de tokens/hora | US$ 0,50 | US$ 1,00 |
| Entrada da API em lote, com 50% de desconto | US$ 0,375 | US$ 0,75 |
| Saída da API em lote, com 50% de desconto | US$ 1,875 | US$ 3,75 |
| Aterramento pela Pesquisa Google | 5.000 requisições gratuitas/mês; depois US$ 14 por 1.000 | Sem alteração |
| Camada gratuita | US$ 0, com limite de taxa; dados usados para melhorar produtos Google | Sem alteração |
Três pontos merecem atenção:
- O preço da saída inclui os tokens de raciocínio. Eles são cobrados a US$ 3,75, não a US$ 0,75.
- A taxa introdutória tem uma data fixa para terminar.
- O 3.6 Flash e o 3.7 Flash também dobram de preço em 1º de janeiro. Usar um modelo anterior não evita o aumento. O detalhamento de preços do 3.7 Flash apresenta as mesmas taxas em um modelo que tende a consumir menos tokens por tarefa.
Tokens de raciocínio são tokens de saída
O Gemini 3.8 Flash raciocina antes de responder, e cada token desse processo é contabilizado como saída. Em uma resposta generateContent, a API informa:
-
usageMetadata.thoughtsTokenCount: tokens de raciocínio; -
candidatesTokenCount: resposta visível; -
promptTokenCount: tokens de entrada.
Os dois tipos de tokens de saída são cobrados à mesma taxa de US$ 3,75 por milhão.
O nível de esforço é controlado por thinking_level:
-
low; -
medium; -
high.
No 3.8 Flash, o padrão é medium, e não high, como no Gemini 3 Pro. O valor minimal foi removido e retorna um erro de validação; configurações herdadas de modelos anteriores devem ser mapeadas para low.
Os níveis representam esforço relativo, não um orçamento fixo de tokens. Portanto, não é possível limitar diretamente os tokens de raciocínio como acontecia com o antigo thinking_budget. Consulte a documentação de raciocínio do Google e o guia de níveis de raciocínio do 3.8 Flash.
Exemplo de custo
Suponha uma requisição com:
- 10.000 tokens de entrada;
- 2.000 tokens de saída visíveis;
- 6.000 tokens de raciocínio.
Nas taxas introdutórias:
Entrada: 10.000 × US$ 0,75 / 1.000.000 = US$ 0,0075
Saída: (2.000 + 6.000) × US$ 3,75 / 1.000.000 = US$ 0,03
Total: US$ 0,0375 por requisição
O raciocínio representa 75% do custo de saída e 60% do custo total. A partir de 1º de janeiro, a mesma requisição custará:
US$ 0,015 + US$ 0,06 = US$ 0,075
Dizer que o 3.8 Flash tem o mesmo preço do 3.7 Flash é correto, mas incompleto: a taxa por token permaneceu igual, enquanto a quantidade de tokens pode aumentar.
Por que o custo por tarefa aumentou?
A publicação de lançamento do Google explica que, em tarefas complexas, o modelo executa etapas extras de raciocínio e chama ferramentas iterativamente para verificar o próprio trabalho.
Mais etapas significam:
- mais tokens de raciocínio;
- mais turnos em loops de agentes;
- mais chamadas de ferramentas;
- maior custo por tarefa.
A recomendação do Google é reduzir o thinking_level ou continuar usando o 3.7 Flash quando ele for suficiente.
A Artificial Analysis avaliou nove tarefas. No nível alto, o 3.8 Flash marcou 59 pontos contra 56 do 3.7 Flash e consumiu aproximadamente 48.000 tokens de saída por tarefa, um aumento de 30%.
| Configuração | Custo por tarefa | Tempo por tarefa |
|---|---|---|
| Gemini 3.8 Flash, alto | US$ 0,58 | 2,5 min |
| Gemini 3.8 Flash, médio | US$ 0,41 | Não publicado |
| Gemini 3.8 Flash, baixo | US$ 0,24 | 0,8 min |
| Gemini 3.7 Flash, alto | US$ 0,40 | 2,2 min |
A tabela pode ser interpretada de duas formas:
- contra o predecessor, o 3.8 Flash no nível alto custa 45% mais por tarefa:
0,58 / 0,40 = 1,45; - dentro do próprio 3.8 Flash, passar de alto para médio reduz o custo em 29%, e usar baixo reduz em 59%.
O nível médio custa apenas US$ 0,01 a mais que o nível alto do 3.7 Flash — uma referência útil para decidir se a atualização vale a pena. A [comparação entre o 3.7-flash?utm_source=dev.to&utm_medium=wanda&utm_content=n8n-post-automation) ajuda a avaliar essa decisão por carga de trabalho.
A Artificial Analysis também informa um preço combinado de US$ 0,58 por milhão de tokens, considerando uma proporção de entrada para saída de 3:1. A coincidência com o custo por tarefa no nível alto não significa que os valores sejam equivalentes: um é uma taxa por token; o outro depende de quantos tokens o modelo decide consumir.
Como aproveitar a taxa introdutória
“Garantir” a taxa introdutória não significa contratar um preço fixo. O Google cobra o uso com base na taxa vigente quando os tokens são consumidos. Não é possível pré-pagar o uso de 2027 com preços de 2026, e migrar para o 3.7 ou 3.6 Flash também não evita o aumento.
O que você pode fazer agora:
- Antecipar processamento em lote. Um trabalho de 100 milhões de tokens — 75 milhões de entrada e 25 milhões de saída — custa aproximadamente:
Entrada: 75 × US$ 0,375 = US$ 28,13
Saída: 25 × US$ 1,875 = US$ 46,88
Total em lote em 2026: US$ 74,99
Em janeiro, o mesmo trabalho custará US$ 149,98.
Criar uma linha de base. Registre o conjunto de avaliações e o consumo de tokens antes da mudança de preço. Assim, a fatura de janeiro terá apenas uma variável nova.
Definir o nível por rota. Não deixe todas as rotas em
mediumpor padrão. As rotas que passam nas avaliações comlowdevem usar esse nível antes de janeiro.
Se o preço for o principal critério, consulte o resumo dos provedores de API LLM mais baratos e a comparação entre Fable 5.1 e GPT-5.6 Sol.
Comparação com Flash-Lite, Claude Sonnet 5 e GPT-5.6 Luna
Valores por 1 milhão de tokens:
| Modelo | Entrada | Saída | Observações |
|---|---|---|---|
| Gemini 3.8 Flash, introdução | US$ 0,75 | US$ 3,75 | Raciocínio cobrado como saída; cache a US$ 0,075 |
| Gemini 3.8 Flash, a partir de 1º de janeiro | US$ 1,50 | US$ 7,50 | Cache a US$ 0,15 |
| Gemini 3.5 Flash-Lite | US$ 0,30 | US$ 2,50 | Aproximadamente 350 tokens/s |
| Claude Sonnet 5 | US$ 2 | US$ 10 | Permanente; aumento de 1º de setembro cancelado |
| GPT-5.6 Luna | US$ 1 | US$ 6 | — |
Durante a introdução, a entrada do 3.8 Flash custa 2,5 vezes mais que a do Flash-Lite, e a saída custa 1,5 vez mais. Em comparação com o Sonnet 5, o 3.8 Flash é cerca de 2,7 vezes mais barato tanto na entrada quanto na saída:
US$ 2 / US$ 0,75 ≈ 2,7
US$ 10 / US$ 3,75 ≈ 2,7
Ele também é mais barato que o Luna no período introdutório: US$ 0,75 contra US$ 1 na entrada e US$ 3,75 contra US$ 6 na saída.
A partir de 1º de janeiro, a situação muda. Com entrada a US$ 1,50 e saída a US$ 7,50, o 3.8 Flash ficará mais caro que o Luna nos dois casos. A diferença para o Sonnet 5 cairá para aproximadamente 1,3 vez. O Flash-Lite continuará sendo a opção mais barata.
A comparação por token é apenas metade da análise. Um modelo que usa menos tokens por resposta pode custar menos por tarefa mesmo com uma taxa nominal maior. Execute o mesmo conjunto de tarefas em cada candidato e compare as contagens de uso. O guia da API do Gemini 3.8 Flash mostra como ler usageMetadata tanto na API de Interactions quanto na API legada generateContent.
Detecte regressões de custo com asserções no Apidog
O problema mais difícil de detectar não é uma resposta incorreta. É uma resposta correta que passa a consumir 40% mais tokens após uma alteração no prompt ou no nível de raciocínio — e ninguém percebe até a fatura chegar.
Trate o consumo de tokens como trataria um código de status HTTP:
1. Armazene a chave com segurança
Crie GEMINI_API_KEY como variável de ambiente no Apidog e use {{GEMINI_API_KEY}} no cabeçalho x-goog-api-key. Dessa forma, a chave não fica armazenada diretamente na requisição.
2. Salve um prompt representativo
Crie uma requisição POST para:
https://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash:generateContent
Use um prompt realista e defina explicitamente thinkingConfig.thinkingLevel. Crie uma configuração por rota de produção.
3. Asserte os campos de uso
Adicione um script de pós-processamento para falhar quando o consumo ultrapassar a linha de base:
const usage = pm.response.json().usageMetadata;
pm.test("tokens de raciocínio dentro do orçamento", () => {
pm.expect(usage.thoughtsTokenCount).to.be.below(8000);
});
pm.test("saída visível dentro do orçamento", () => {
pm.expect(usage.candidatesTokenCount).to.be.below(2500);
});
pm.test("custo da requisição dentro do orçamento", () => {
const cost = usage.promptTokenCount * 0.75 / 1e6
+ (usage.thoughtsTokenCount + usage.candidatesTokenCount) * 3.75 / 1e6;
pm.expect(cost).to.be.below(0.05);
});
4. Agende a execução
Coloque as requisições em um cenário de teste e execute-o periodicamente. Assim, uma alteração no consumo aparece como falha no mesmo dia. O guia para agendar testes de API no Apidog explica a configuração.
Em 1º de janeiro, atualize as duas constantes de preço do script. A asserção de custo continuará acompanhando a nova fatura.
O mesmo cenário pode comparar provedores: duplique a requisição para Flash-Lite, Sonnet 5 ou Luna e compare os campos de uso lado a lado. O plano gratuito do Apidog cobre esse fluxo de trabalho. Também é possível baixar o Apidog.
Perguntas frequentes
O Gemini 3.8 Flash custa mais que o 3.7 Flash?
Por token, não. Ambos custam US$ 0,75 na entrada e US$ 3,75 na saída até 31 de dezembro. Depois, ambos passam a custar US$ 1,50 e US$ 7,50.
Por tarefa, sim. A Artificial Analysis mediu US$ 0,58 por tarefa de índice no 3.8 Flash com nível alto, contra US$ 0,40 no 3.7 Flash, porque o 3.8 Flash gera aproximadamente 30% mais tokens de saída.
Os tokens de raciocínio são cobrados separadamente?
Não. Eles são cobrados como tokens de saída e aparecem em usageMetadata.thoughtsTokenCount. O custo é de US$ 3,75 por milhão de tokens durante a introdução e US$ 7,50 depois.
O controle é indireto, por meio de thinking_level. O 3.8 Flash não oferece um orçamento fixo de tokens, e minimal retorna um erro.
Existe uma camada gratuita?
Sim. A camada gratuita do AI Studio não cobra pela entrada ou saída, mas possui limites de taxa. O Google usa dados da camada gratuita para melhorar seus produtos.
O aplicativo Gemini para consumidores oferece o 3.8 Flash apenas para assinantes dos planos AI Pro e Ultra. Consulte o guia de uso gratuito do Gemini 3.8 Flash.
O que acontece com os custos em 1º de janeiro de 2027?
As taxas de entrada, saída, leitura de cache, armazenamento em cache e processamento em lote dobram. Se o consumo por tarefa permanecer igual, a fatura também dobrará. As linhas do 3.6 Flash e do 3.7 Flash mudam na mesma data.
Qual nível de raciocínio mantém os custos baixos?
Comece pela distribuição da Artificial Analysis:
-
low: US$ 0,24 por tarefa; -
medium: US$ 0,41; -
high: US$ 0,58.
Execute suas próprias avaliações, mantenha o nível mais baixo que atingir a qualidade necessária e crie asserções para impedir mudanças silenciosas no consumo.
O que fazer esta semana
O Gemini 3.8 Flash tem preço semelhante ao 3.7 Flash, mas pode consumir tokens como um modelo maior. Trate o nível de raciocínio como uma configuração de custo:
- Defina
thinking_levelpor rota. - Mova trabalhos adequados para processamento em lote antes de 31 de dezembro.
- Registre o consumo atual de tokens.
- Crie testes automatizados com limites de raciocínio, saída e custo.
- Reavalie os provedores e preços antes de janeiro.
Assim, a duplicação de janeiro será uma mudança já conhecida e precificada — não uma surpresa na fatura.

Top comments (0)