DEV Community

Cover image for Preços Gemini 3.8 Flash: taxas de introdução, tokens de processamento e o custo real por tarefa
Lucas
Lucas

Posted on Originally published at apidog.com

Preços Gemini 3.8 Flash: taxas de introdução, tokens de processamento e o custo real por tarefa

Gemini 3.8 Flash: o preço por token não mudou, mas a conta pode aumentar

O Gemini 3.8 Flash custa US$ 0,75 por milhão de tokens de entrada e US$ 3,75 por milhão de tokens de saída — a mesma taxa introdutória definida pelo Google para o 3.7 Flash. Esse preço vale até 31 de dezembro de 2026. Em 1º de janeiro de 2027, os valores dobram para US$ 1,50 e US$ 7,50. A mesma duplicação será aplicada ao 3.6 Flash e ao 3.7 Flash. Nada mudou no preço por token com o lançamento, conforme a página oficial de preços da API Gemini.

Experimente o Apidog hoje

O que mudou foi a quantidade de tokens consumida. Segundo o Google, o 3.8 Flash “trabalha mais”: executa mais etapas de raciocínio, chama ferramentas iterativamente e pode usar mais tokens em tarefas longas e complexas. A Artificial Analysis mediu o efeito: seu Índice de Inteligência custou US$ 0,58 por tarefa no 3.8 Flash com raciocínio alto, contra US$ 0,40 no 3.7 Flash, com aproximadamente 30% mais tokens de saída por tarefa.

Gemini 3.8 Flash

Este guia detalha os preços da API, mostra o impacto de cada nível de raciocínio e apresenta uma forma de detectar regressões de custo com testes automatizados. Para uma visão geral do modelo, consulte o que é o Gemini 3.8 Flash.

Preços do Gemini 3.8 Flash

Todos os valores abaixo são por 1 milhão de tokens na camada paga.

Item Introdução até 31/12/2026 Padrão a partir de 01/01/2027
Entrada: texto, imagem, vídeo, áudio e PDF US$ 0,75 US$ 1,50
Saída, incluindo tokens de raciocínio US$ 3,75 US$ 7,50
Leitura de cache de contexto US$ 0,075 US$ 0,15
Armazenamento em cache por 1 milhão de tokens/hora US$ 0,50 US$ 1,00
Entrada da API em lote, com 50% de desconto US$ 0,375 US$ 0,75
Saída da API em lote, com 50% de desconto US$ 1,875 US$ 3,75
Aterramento pela Pesquisa Google 5.000 requisições gratuitas/mês; depois US$ 14 por 1.000 Sem alteração
Camada gratuita US$ 0, com limite de taxa; dados usados para melhorar produtos Google Sem alteração

Três pontos merecem atenção:

  1. O preço da saída inclui os tokens de raciocínio. Eles são cobrados a US$ 3,75, não a US$ 0,75.
  2. A taxa introdutória tem uma data fixa para terminar.
  3. O 3.6 Flash e o 3.7 Flash também dobram de preço em 1º de janeiro. Usar um modelo anterior não evita o aumento. O detalhamento de preços do 3.7 Flash apresenta as mesmas taxas em um modelo que tende a consumir menos tokens por tarefa.

Tokens de raciocínio são tokens de saída

O Gemini 3.8 Flash raciocina antes de responder, e cada token desse processo é contabilizado como saída. Em uma resposta generateContent, a API informa:

  • usageMetadata.thoughtsTokenCount: tokens de raciocínio;
  • candidatesTokenCount: resposta visível;
  • promptTokenCount: tokens de entrada.

Os dois tipos de tokens de saída são cobrados à mesma taxa de US$ 3,75 por milhão.

O nível de esforço é controlado por thinking_level:

  • low;
  • medium;
  • high.

No 3.8 Flash, o padrão é medium, e não high, como no Gemini 3 Pro. O valor minimal foi removido e retorna um erro de validação; configurações herdadas de modelos anteriores devem ser mapeadas para low.

Os níveis representam esforço relativo, não um orçamento fixo de tokens. Portanto, não é possível limitar diretamente os tokens de raciocínio como acontecia com o antigo thinking_budget. Consulte a documentação de raciocínio do Google e o guia de níveis de raciocínio do 3.8 Flash.

Exemplo de custo

Suponha uma requisição com:

  • 10.000 tokens de entrada;
  • 2.000 tokens de saída visíveis;
  • 6.000 tokens de raciocínio.

Nas taxas introdutórias:

Entrada: 10.000 × US$ 0,75 / 1.000.000 = US$ 0,0075
Saída: (2.000 + 6.000) × US$ 3,75 / 1.000.000 = US$ 0,03
Total: US$ 0,0375 por requisição
Enter fullscreen mode Exit fullscreen mode

O raciocínio representa 75% do custo de saída e 60% do custo total. A partir de 1º de janeiro, a mesma requisição custará:

US$ 0,015 + US$ 0,06 = US$ 0,075
Enter fullscreen mode Exit fullscreen mode

Dizer que o 3.8 Flash tem o mesmo preço do 3.7 Flash é correto, mas incompleto: a taxa por token permaneceu igual, enquanto a quantidade de tokens pode aumentar.

Por que o custo por tarefa aumentou?

A publicação de lançamento do Google explica que, em tarefas complexas, o modelo executa etapas extras de raciocínio e chama ferramentas iterativamente para verificar o próprio trabalho.

Mais etapas significam:

  • mais tokens de raciocínio;
  • mais turnos em loops de agentes;
  • mais chamadas de ferramentas;
  • maior custo por tarefa.

A recomendação do Google é reduzir o thinking_level ou continuar usando o 3.7 Flash quando ele for suficiente.

A Artificial Analysis avaliou nove tarefas. No nível alto, o 3.8 Flash marcou 59 pontos contra 56 do 3.7 Flash e consumiu aproximadamente 48.000 tokens de saída por tarefa, um aumento de 30%.

Configuração Custo por tarefa Tempo por tarefa
Gemini 3.8 Flash, alto US$ 0,58 2,5 min
Gemini 3.8 Flash, médio US$ 0,41 Não publicado
Gemini 3.8 Flash, baixo US$ 0,24 0,8 min
Gemini 3.7 Flash, alto US$ 0,40 2,2 min

A tabela pode ser interpretada de duas formas:

  • contra o predecessor, o 3.8 Flash no nível alto custa 45% mais por tarefa: 0,58 / 0,40 = 1,45;
  • dentro do próprio 3.8 Flash, passar de alto para médio reduz o custo em 29%, e usar baixo reduz em 59%.

O nível médio custa apenas US$ 0,01 a mais que o nível alto do 3.7 Flash — uma referência útil para decidir se a atualização vale a pena. A [comparação entre o 3.7-flash?utm_source=dev.to&utm_medium=wanda&utm_content=n8n-post-automation) ajuda a avaliar essa decisão por carga de trabalho.

A Artificial Analysis também informa um preço combinado de US$ 0,58 por milhão de tokens, considerando uma proporção de entrada para saída de 3:1. A coincidência com o custo por tarefa no nível alto não significa que os valores sejam equivalentes: um é uma taxa por token; o outro depende de quantos tokens o modelo decide consumir.

Como aproveitar a taxa introdutória

“Garantir” a taxa introdutória não significa contratar um preço fixo. O Google cobra o uso com base na taxa vigente quando os tokens são consumidos. Não é possível pré-pagar o uso de 2027 com preços de 2026, e migrar para o 3.7 ou 3.6 Flash também não evita o aumento.

O que você pode fazer agora:

  • Antecipar processamento em lote. Um trabalho de 100 milhões de tokens — 75 milhões de entrada e 25 milhões de saída — custa aproximadamente:
  Entrada: 75 × US$ 0,375 = US$ 28,13
  Saída: 25 × US$ 1,875 = US$ 46,88
  Total em lote em 2026: US$ 74,99
Enter fullscreen mode Exit fullscreen mode

Em janeiro, o mesmo trabalho custará US$ 149,98.

  • Criar uma linha de base. Registre o conjunto de avaliações e o consumo de tokens antes da mudança de preço. Assim, a fatura de janeiro terá apenas uma variável nova.

  • Definir o nível por rota. Não deixe todas as rotas em medium por padrão. As rotas que passam nas avaliações com low devem usar esse nível antes de janeiro.

Se o preço for o principal critério, consulte o resumo dos provedores de API LLM mais baratos e a comparação entre Fable 5.1 e GPT-5.6 Sol.

Comparação com Flash-Lite, Claude Sonnet 5 e GPT-5.6 Luna

Valores por 1 milhão de tokens:

Modelo Entrada Saída Observações
Gemini 3.8 Flash, introdução US$ 0,75 US$ 3,75 Raciocínio cobrado como saída; cache a US$ 0,075
Gemini 3.8 Flash, a partir de 1º de janeiro US$ 1,50 US$ 7,50 Cache a US$ 0,15
Gemini 3.5 Flash-Lite US$ 0,30 US$ 2,50 Aproximadamente 350 tokens/s
Claude Sonnet 5 US$ 2 US$ 10 Permanente; aumento de 1º de setembro cancelado
GPT-5.6 Luna US$ 1 US$ 6

Durante a introdução, a entrada do 3.8 Flash custa 2,5 vezes mais que a do Flash-Lite, e a saída custa 1,5 vez mais. Em comparação com o Sonnet 5, o 3.8 Flash é cerca de 2,7 vezes mais barato tanto na entrada quanto na saída:

US$ 2 / US$ 0,75 ≈ 2,7
US$ 10 / US$ 3,75 ≈ 2,7
Enter fullscreen mode Exit fullscreen mode

Ele também é mais barato que o Luna no período introdutório: US$ 0,75 contra US$ 1 na entrada e US$ 3,75 contra US$ 6 na saída.

A partir de 1º de janeiro, a situação muda. Com entrada a US$ 1,50 e saída a US$ 7,50, o 3.8 Flash ficará mais caro que o Luna nos dois casos. A diferença para o Sonnet 5 cairá para aproximadamente 1,3 vez. O Flash-Lite continuará sendo a opção mais barata.

A comparação por token é apenas metade da análise. Um modelo que usa menos tokens por resposta pode custar menos por tarefa mesmo com uma taxa nominal maior. Execute o mesmo conjunto de tarefas em cada candidato e compare as contagens de uso. O guia da API do Gemini 3.8 Flash mostra como ler usageMetadata tanto na API de Interactions quanto na API legada generateContent.

Detecte regressões de custo com asserções no Apidog

O problema mais difícil de detectar não é uma resposta incorreta. É uma resposta correta que passa a consumir 40% mais tokens após uma alteração no prompt ou no nível de raciocínio — e ninguém percebe até a fatura chegar.

Trate o consumo de tokens como trataria um código de status HTTP:

1. Armazene a chave com segurança

Crie GEMINI_API_KEY como variável de ambiente no Apidog e use {{GEMINI_API_KEY}} no cabeçalho x-goog-api-key. Dessa forma, a chave não fica armazenada diretamente na requisição.

2. Salve um prompt representativo

Crie uma requisição POST para:

https://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash:generateContent
Enter fullscreen mode Exit fullscreen mode

Use um prompt realista e defina explicitamente thinkingConfig.thinkingLevel. Crie uma configuração por rota de produção.

3. Asserte os campos de uso

Adicione um script de pós-processamento para falhar quando o consumo ultrapassar a linha de base:

const usage = pm.response.json().usageMetadata;

pm.test("tokens de raciocínio dentro do orçamento", () => {
  pm.expect(usage.thoughtsTokenCount).to.be.below(8000);
});

pm.test("saída visível dentro do orçamento", () => {
  pm.expect(usage.candidatesTokenCount).to.be.below(2500);
});

pm.test("custo da requisição dentro do orçamento", () => {
  const cost = usage.promptTokenCount * 0.75 / 1e6
    + (usage.thoughtsTokenCount + usage.candidatesTokenCount) * 3.75 / 1e6;

  pm.expect(cost).to.be.below(0.05);
});
Enter fullscreen mode Exit fullscreen mode

4. Agende a execução

Coloque as requisições em um cenário de teste e execute-o periodicamente. Assim, uma alteração no consumo aparece como falha no mesmo dia. O guia para agendar testes de API no Apidog explica a configuração.

Em 1º de janeiro, atualize as duas constantes de preço do script. A asserção de custo continuará acompanhando a nova fatura.

O mesmo cenário pode comparar provedores: duplique a requisição para Flash-Lite, Sonnet 5 ou Luna e compare os campos de uso lado a lado. O plano gratuito do Apidog cobre esse fluxo de trabalho. Também é possível baixar o Apidog.

Perguntas frequentes

O Gemini 3.8 Flash custa mais que o 3.7 Flash?

Por token, não. Ambos custam US$ 0,75 na entrada e US$ 3,75 na saída até 31 de dezembro. Depois, ambos passam a custar US$ 1,50 e US$ 7,50.

Por tarefa, sim. A Artificial Analysis mediu US$ 0,58 por tarefa de índice no 3.8 Flash com nível alto, contra US$ 0,40 no 3.7 Flash, porque o 3.8 Flash gera aproximadamente 30% mais tokens de saída.

Os tokens de raciocínio são cobrados separadamente?

Não. Eles são cobrados como tokens de saída e aparecem em usageMetadata.thoughtsTokenCount. O custo é de US$ 3,75 por milhão de tokens durante a introdução e US$ 7,50 depois.

O controle é indireto, por meio de thinking_level. O 3.8 Flash não oferece um orçamento fixo de tokens, e minimal retorna um erro.

Existe uma camada gratuita?

Sim. A camada gratuita do AI Studio não cobra pela entrada ou saída, mas possui limites de taxa. O Google usa dados da camada gratuita para melhorar seus produtos.

O aplicativo Gemini para consumidores oferece o 3.8 Flash apenas para assinantes dos planos AI Pro e Ultra. Consulte o guia de uso gratuito do Gemini 3.8 Flash.

O que acontece com os custos em 1º de janeiro de 2027?

As taxas de entrada, saída, leitura de cache, armazenamento em cache e processamento em lote dobram. Se o consumo por tarefa permanecer igual, a fatura também dobrará. As linhas do 3.6 Flash e do 3.7 Flash mudam na mesma data.

Qual nível de raciocínio mantém os custos baixos?

Comece pela distribuição da Artificial Analysis:

  • low: US$ 0,24 por tarefa;
  • medium: US$ 0,41;
  • high: US$ 0,58.

Execute suas próprias avaliações, mantenha o nível mais baixo que atingir a qualidade necessária e crie asserções para impedir mudanças silenciosas no consumo.

O que fazer esta semana

O Gemini 3.8 Flash tem preço semelhante ao 3.7 Flash, mas pode consumir tokens como um modelo maior. Trate o nível de raciocínio como uma configuração de custo:

  1. Defina thinking_level por rota.
  2. Mova trabalhos adequados para processamento em lote antes de 31 de dezembro.
  3. Registre o consumo atual de tokens.
  4. Crie testes automatizados com limites de raciocínio, saída e custo.
  5. Reavalie os provedores e preços antes de janeiro.

Assim, a duplicação de janeiro será uma mudança já conhecida e precificada — não uma surpresa na fatura.

Top comments (0)