DEV Community

Cover image for Preço Gemini 3.6 Flash: Quanto realmente custa em 2026
Lucas
Lucas

Posted on • Originally published at apidog.com

Preço Gemini 3.6 Flash: Quanto realmente custa em 2026

O Gemini 3.6 Flash custa US$1,50 por 1M de tokens de entrada e US$7,50 por 1M de tokens de saída. Ele é mais barato que o modelo que substitui. Lançada pelo Google em 21 de julho de 2026, a atualização torna a camada Flash — o motor para cargas de trabalho — mais rápida e mais econômica ao mesmo tempo.

Experimente o Apidog hoje

Este guia reúne os números necessários para estimar seu orçamento: preços por token, custos do cache de contexto, limites da camada gratuita e um exemplo de cálculo mensal. Os valores são baseados na documentação de preços da API Gemini e no anúncio de lançamento do Google. Para entender o modelo antes de calcular custos, leia o que é o Gemini 3.6 Flash.

Nota sobre as versões: o motor principal passou para a versão 3.6, enquanto a camada mais econômica continua sendo o Gemini 3.5 Flash-Lite. As versões são diferentes, mas fazem parte do mesmo lançamento.

Preços do Gemini 3.6 Flash em um piscar de olhos

Item Custo
Entrada US$1,50 por 1M de tokens
Saída, incluindo tokens de raciocínio US$7,50 por 1M de tokens
Cache de contexto: leitura de entrada em cache US$0,15 por 1M de tokens
Cache de contexto: armazenamento US$1,00 por 1M de tokens por hora
Camada gratuita Sim, via Google AI Studio, com limite de taxa

Dois detalhes afetam diretamente sua estimativa:

  1. Tokens de raciocínio fazem parte da saída. Eles são cobrados na taxa de US$7,50 por 1M de tokens; não existe uma cobrança separada.
  2. O cache tem leitura e armazenamento. A leitura de conteúdo em cache é mais barata, mas você também paga pelo armazenamento enquanto o cache permanece ativo. Ele compensa quando o mesmo prefixo de prompt é reutilizado muitas vezes.

Como se compara ao Gemini 3.5 Flash

A taxa de saída caiu de US$9,00 por 1M de tokens no Gemini 3.5 Flash para US$7,50 no Gemini 3.6 Flash: uma redução de aproximadamente 17% por token de saída.

Segundo a página do modelo DeepMind Flash, o Gemini 3.6 Flash também produz cerca de 17% menos tokens de saída para a mesma tarefa. Em fluxos de várias etapas, ele raciocina em menos etapas e realiza menos chamadas de ferramentas.

Na prática, você combina dois ganhos:

  • menor preço por token de saída;
  • menos tokens de saída por tarefa.

Para comparar os dois modelos no seu cenário, consulte a análise de preços do Gemini 3.5 Flash e o comparativo Gemini 3.6 Flash vs 3.5 Flash.

O que a camada gratuita oferece

A camada gratuita está disponível no Google AI Studio. Você pode chamar o Gemini 3.6 Flash sem cartão de crédito para prototipar e testar integrações.

Use-a com estas restrições em mente:

  • há limite de taxa;
  • ela é adequada para protótipos e testes leves, não para tráfego de produção;
  • o Google pode usar dados da camada gratuita para melhorar seus produtos.

Por isso, não envie dados sensíveis, proprietários ou de clientes pela camada gratuita. Ao migrar para produção, use uma chave paga, onde esses termos de uso de dados não se aplicam.

Veja o passo a passo em como usar o Gemini 3.6 Flash gratuitamente. Não há uma opção de uso gratuito ilimitado, então inclua a migração para o plano pago no planejamento do lançamento.

Um exemplo de custo prático

Considere um agente que lê muito e escreve pouco:

  • 2M de tokens de entrada por dia
  • 500k de tokens de saída por dia

Esse perfil é comum em assistentes que recuperam documentos, processam contexto extenso e retornam respostas curtas.

Cálculo diário

  • Entrada: 2M × US$1,50 = US$3,00
  • Saída: 500k × US$7,50 / 1M = US$3,75
  • Total diário: US$6,75
  • Total mensal em 30 dias: US$202,50

Você pode reproduzir o cálculo em código:

const inputTokens = 2_000_000;
const outputTokens = 500_000;

const inputPricePerMillion = 1.50;
const outputPricePerMillion = 7.50;

const dailyInputCost = (inputTokens / 1_000_000) * inputPricePerMillion;
const dailyOutputCost = (outputTokens / 1_000_000) * outputPricePerMillion;
const dailyCost = dailyInputCost + dailyOutputCost;
const monthlyCost = dailyCost * 30;

console.log({
  dailyInputCost,
  dailyOutputCost,
  dailyCost,
  monthlyCost,
});
Enter fullscreen mode Exit fullscreen mode

Efeito composto em relação ao 3.5 Flash

Suponha que a mesma tarefa emitisse 600k tokens de saída no Gemini 3.5 Flash. Com uma redução de aproximadamente 17%, o Gemini 3.6 Flash chegaria a cerca de 500k tokens.

Compare apenas a saída:

  • Saída no 3.5 Flash: 600k × US$9,00 / 1M = US$5,40 por dia
  • Saída no 3.6 Flash: 500k × US$7,50 / 1M = US$3,75 por dia

A economia é de:

  • US$1,65 por dia
  • US$49,50 por mês

Isso representa cerca de 31% de redução na conta de saída. O resultado é maior que os 17% isolados porque você combina uma taxa menor com menos tokens gerados.

Flash-Lite é ainda mais barato

Para tarefas simples e de alto volume, use o Gemini 3.5 Flash-Lite:

Item Custo
Entrada US$0,30 por 1M de tokens
Saída US$2,50 por 1M de tokens
Leitura de cache US$0,03 por 1M de tokens
Armazenamento de cache US$1,00 por 1M de tokens por hora

O Flash-Lite também é rápido, com cerca de 350 tokens de saída por segundo.

Na mesma carga de trabalho — 2M de tokens de entrada e 500k de saída por dia — o custo seria:

  • Entrada: 2M × US$0,30 = US$0,60
  • Saída: 500k × US$2,50 / 1M = US$1,25
  • Total diário: US$1,85
  • Total mensal em 30 dias: US$55,50

Isso equivale a aproximadamente 70% menos que o Gemini 3.6 Flash para as mesmas quantidades de tokens.

Use o Flash-Lite para:

  • classificação;
  • extração de informações;
  • roteamento;
  • respostas estruturadas curtas;
  • tarefas simples com alto volume.

Reserve o Gemini 3.6 Flash para raciocínio mais complexo e fluxos de várias etapas. Consulte o que é o Gemini 3.5 Flash-Lite e Gemini 3.5 Flash-Lite vs 3.6 Flash para definir qual modelo usar em cada rota.

Como controlar e medir seus custos

Aplique estas quatro práticas para reduzir e acompanhar gastos.

1. Armazene em cache contextos repetidos

Se cada chamada reutiliza um prompt de sistema longo ou os mesmos documentos de referência, o cache pode reduzir o custo de leitura de entrada de US$1,50 para US$0,15 por 1M de tokens.

Mas inclua o armazenamento no cálculo:

custo do cache =
  leituras em cache
  + armazenamento por hora
Enter fullscreen mode Exit fullscreen mode

O cache tende a compensar quando você reutiliza o mesmo prefixo várias vezes dentro de uma hora, e não apenas uma vez.

2. Reduza prompts e limite a saída

A saída custa cinco vezes mais que a entrada, mas prompts desnecessariamente longos também se acumulam em escala.

Faça o seguinte:

  • remova texto padrão repetitivo;
  • envie apenas documentos relevantes;
  • use limites de tokens de saída;
  • monitore respostas que crescem sem necessidade.

3. Encaminhe tarefas simples para o Flash-Lite

Evite usar um único modelo para tudo. Uma estratégia prática é separar rotas por complexidade:

classificação, extração e roteamento  -> Flash-Lite
raciocínio em várias etapas           -> Gemini 3.6 Flash
Enter fullscreen mode Exit fullscreen mode

Esse roteamento misto normalmente reduz custos sem comprometer a qualidade nas tarefas que realmente exigem mais capacidade.

4. Meça o uso real de tokens

Não dependa apenas de estimativas. Cada resposta Gemini inclui usageMetadata, que informa as contagens reais de tokens de entrada, saída e raciocínio consumidos pela solicitação.

Use esses dados para registrar custo por endpoint, prompt e versão de modelo:

function estimateCost(usageMetadata) {
  const inputTokens = usageMetadata.promptTokenCount ?? 0;
  const outputTokens = usageMetadata.candidatesTokenCount ?? 0;

  return {
    inputCost: (inputTokens / 1_000_000) * 1.5,
    outputCost: (outputTokens / 1_000_000) * 7.5,
  };
}
Enter fullscreen mode Exit fullscreen mode

No Apidog, você pode criar uma solicitação POST para a API Gemini, salvar a chave em uma variável de ambiente e testar seus prompts reais. Leia usageMetadata na resposta e adicione asserções para detectar mudanças que aumentem o consumo de tokens antes que elas cheguem à produção.

Você também pode agendar esses testes de API para detectar regressões de custo continuamente. Baixe o Apidog e aponte uma solicitação para o endpoint Gemini antes de conectar sua aplicação à produção.

FAQ

Quanto custa o Gemini 3.6 Flash por 1M de tokens?

US$1,50 para entrada e US$7,50 para saída. Leituras do cache de contexto custam US$0,15 por 1M de tokens, além de US$1,00 por 1M de tokens por hora de armazenamento.

O preço de saída inclui tokens de raciocínio?

Sim. O raciocínio realizado antes da resposta é cobrado na taxa de saída de US$7,50. Não existe uma linha de cobrança separada, mas esses tokens contam para o total de saída.

Existe realmente uma camada gratuita?

Sim, no Google AI Studio, com limite de taxa. Ela é destinada a prototipagem e testes, não à produção. Como o Google pode usar dados dessa camada para melhorar seus produtos, mantenha dados sensíveis em uma chave paga.

O Gemini 3.6 Flash é mais barato que o 3.5 Flash?

Sim. A taxa de saída caiu de US$9,00 para US$7,50 por 1M de tokens, e o modelo usa cerca de 17% menos tokens de saída para a mesma tarefa. Esses dois fatores podem reduzir a conta de saída em cerca de 31%.

Quando devo usar o Flash-Lite?

Use-o em tarefas simples e de alto volume. Com US$0,30 por 1M de tokens de entrada e US$2,50 por 1M de tokens de saída, ele é aproximadamente 70% mais barato para as mesmas contagens de tokens. Para raciocínio mais complexo, use o Gemini 3.6 Flash.

O Gemini 3.6 Flash combina uma redução de preço com menor geração de tokens. Para orçar, comece com US$1,50 por 1M de tokens de entrada e US$7,50 por 1M de tokens de saída, inclua tokens de raciocínio como saída e use cache e roteamento para Flash-Lite onde fizer sentido.

Para contexto histórico, veja a análise de custos da API Gemini 3.0. Depois, meça suas chamadas reais no Apidog para que o orçamento baseado em tokens corresponda ao que você realmente paga.

Top comments (0)