O Gemini 3.6 Flash custa US$1,50 por 1M de tokens de entrada e US$7,50 por 1M de tokens de saída. Ele é mais barato que o modelo que substitui. Lançada pelo Google em 21 de julho de 2026, a atualização torna a camada Flash — o motor para cargas de trabalho — mais rápida e mais econômica ao mesmo tempo.
Este guia reúne os números necessários para estimar seu orçamento: preços por token, custos do cache de contexto, limites da camada gratuita e um exemplo de cálculo mensal. Os valores são baseados na documentação de preços da API Gemini e no anúncio de lançamento do Google. Para entender o modelo antes de calcular custos, leia o que é o Gemini 3.6 Flash.
Nota sobre as versões: o motor principal passou para a versão 3.6, enquanto a camada mais econômica continua sendo o Gemini 3.5 Flash-Lite. As versões são diferentes, mas fazem parte do mesmo lançamento.
Preços do Gemini 3.6 Flash em um piscar de olhos
| Item | Custo |
|---|---|
| Entrada | US$1,50 por 1M de tokens |
| Saída, incluindo tokens de raciocínio | US$7,50 por 1M de tokens |
| Cache de contexto: leitura de entrada em cache | US$0,15 por 1M de tokens |
| Cache de contexto: armazenamento | US$1,00 por 1M de tokens por hora |
| Camada gratuita | Sim, via Google AI Studio, com limite de taxa |
Dois detalhes afetam diretamente sua estimativa:
- Tokens de raciocínio fazem parte da saída. Eles são cobrados na taxa de US$7,50 por 1M de tokens; não existe uma cobrança separada.
- O cache tem leitura e armazenamento. A leitura de conteúdo em cache é mais barata, mas você também paga pelo armazenamento enquanto o cache permanece ativo. Ele compensa quando o mesmo prefixo de prompt é reutilizado muitas vezes.
Como se compara ao Gemini 3.5 Flash
A taxa de saída caiu de US$9,00 por 1M de tokens no Gemini 3.5 Flash para US$7,50 no Gemini 3.6 Flash: uma redução de aproximadamente 17% por token de saída.
Segundo a página do modelo DeepMind Flash, o Gemini 3.6 Flash também produz cerca de 17% menos tokens de saída para a mesma tarefa. Em fluxos de várias etapas, ele raciocina em menos etapas e realiza menos chamadas de ferramentas.
Na prática, você combina dois ganhos:
- menor preço por token de saída;
- menos tokens de saída por tarefa.
Para comparar os dois modelos no seu cenário, consulte a análise de preços do Gemini 3.5 Flash e o comparativo Gemini 3.6 Flash vs 3.5 Flash.
O que a camada gratuita oferece
A camada gratuita está disponível no Google AI Studio. Você pode chamar o Gemini 3.6 Flash sem cartão de crédito para prototipar e testar integrações.
Use-a com estas restrições em mente:
- há limite de taxa;
- ela é adequada para protótipos e testes leves, não para tráfego de produção;
- o Google pode usar dados da camada gratuita para melhorar seus produtos.
Por isso, não envie dados sensíveis, proprietários ou de clientes pela camada gratuita. Ao migrar para produção, use uma chave paga, onde esses termos de uso de dados não se aplicam.
Veja o passo a passo em como usar o Gemini 3.6 Flash gratuitamente. Não há uma opção de uso gratuito ilimitado, então inclua a migração para o plano pago no planejamento do lançamento.
Um exemplo de custo prático
Considere um agente que lê muito e escreve pouco:
- 2M de tokens de entrada por dia
- 500k de tokens de saída por dia
Esse perfil é comum em assistentes que recuperam documentos, processam contexto extenso e retornam respostas curtas.
Cálculo diário
- Entrada:
2M × US$1,50 = US$3,00 - Saída:
500k × US$7,50 / 1M = US$3,75 - Total diário: US$6,75
- Total mensal em 30 dias: US$202,50
Você pode reproduzir o cálculo em código:
const inputTokens = 2_000_000;
const outputTokens = 500_000;
const inputPricePerMillion = 1.50;
const outputPricePerMillion = 7.50;
const dailyInputCost = (inputTokens / 1_000_000) * inputPricePerMillion;
const dailyOutputCost = (outputTokens / 1_000_000) * outputPricePerMillion;
const dailyCost = dailyInputCost + dailyOutputCost;
const monthlyCost = dailyCost * 30;
console.log({
dailyInputCost,
dailyOutputCost,
dailyCost,
monthlyCost,
});
Efeito composto em relação ao 3.5 Flash
Suponha que a mesma tarefa emitisse 600k tokens de saída no Gemini 3.5 Flash. Com uma redução de aproximadamente 17%, o Gemini 3.6 Flash chegaria a cerca de 500k tokens.
Compare apenas a saída:
- Saída no 3.5 Flash:
600k × US$9,00 / 1M = US$5,40 por dia - Saída no 3.6 Flash:
500k × US$7,50 / 1M = US$3,75 por dia
A economia é de:
- US$1,65 por dia
- US$49,50 por mês
Isso representa cerca de 31% de redução na conta de saída. O resultado é maior que os 17% isolados porque você combina uma taxa menor com menos tokens gerados.
Flash-Lite é ainda mais barato
Para tarefas simples e de alto volume, use o Gemini 3.5 Flash-Lite:
| Item | Custo |
|---|---|
| Entrada | US$0,30 por 1M de tokens |
| Saída | US$2,50 por 1M de tokens |
| Leitura de cache | US$0,03 por 1M de tokens |
| Armazenamento de cache | US$1,00 por 1M de tokens por hora |
O Flash-Lite também é rápido, com cerca de 350 tokens de saída por segundo.
Na mesma carga de trabalho — 2M de tokens de entrada e 500k de saída por dia — o custo seria:
- Entrada:
2M × US$0,30 = US$0,60 - Saída:
500k × US$2,50 / 1M = US$1,25 - Total diário: US$1,85
- Total mensal em 30 dias: US$55,50
Isso equivale a aproximadamente 70% menos que o Gemini 3.6 Flash para as mesmas quantidades de tokens.
Use o Flash-Lite para:
- classificação;
- extração de informações;
- roteamento;
- respostas estruturadas curtas;
- tarefas simples com alto volume.
Reserve o Gemini 3.6 Flash para raciocínio mais complexo e fluxos de várias etapas. Consulte o que é o Gemini 3.5 Flash-Lite e Gemini 3.5 Flash-Lite vs 3.6 Flash para definir qual modelo usar em cada rota.
Como controlar e medir seus custos
Aplique estas quatro práticas para reduzir e acompanhar gastos.
1. Armazene em cache contextos repetidos
Se cada chamada reutiliza um prompt de sistema longo ou os mesmos documentos de referência, o cache pode reduzir o custo de leitura de entrada de US$1,50 para US$0,15 por 1M de tokens.
Mas inclua o armazenamento no cálculo:
custo do cache =
leituras em cache
+ armazenamento por hora
O cache tende a compensar quando você reutiliza o mesmo prefixo várias vezes dentro de uma hora, e não apenas uma vez.
2. Reduza prompts e limite a saída
A saída custa cinco vezes mais que a entrada, mas prompts desnecessariamente longos também se acumulam em escala.
Faça o seguinte:
- remova texto padrão repetitivo;
- envie apenas documentos relevantes;
- use limites de tokens de saída;
- monitore respostas que crescem sem necessidade.
3. Encaminhe tarefas simples para o Flash-Lite
Evite usar um único modelo para tudo. Uma estratégia prática é separar rotas por complexidade:
classificação, extração e roteamento -> Flash-Lite
raciocínio em várias etapas -> Gemini 3.6 Flash
Esse roteamento misto normalmente reduz custos sem comprometer a qualidade nas tarefas que realmente exigem mais capacidade.
4. Meça o uso real de tokens
Não dependa apenas de estimativas. Cada resposta Gemini inclui usageMetadata, que informa as contagens reais de tokens de entrada, saída e raciocínio consumidos pela solicitação.
Use esses dados para registrar custo por endpoint, prompt e versão de modelo:
function estimateCost(usageMetadata) {
const inputTokens = usageMetadata.promptTokenCount ?? 0;
const outputTokens = usageMetadata.candidatesTokenCount ?? 0;
return {
inputCost: (inputTokens / 1_000_000) * 1.5,
outputCost: (outputTokens / 1_000_000) * 7.5,
};
}
No Apidog, você pode criar uma solicitação POST para a API Gemini, salvar a chave em uma variável de ambiente e testar seus prompts reais. Leia usageMetadata na resposta e adicione asserções para detectar mudanças que aumentem o consumo de tokens antes que elas cheguem à produção.
Você também pode agendar esses testes de API para detectar regressões de custo continuamente. Baixe o Apidog e aponte uma solicitação para o endpoint Gemini antes de conectar sua aplicação à produção.
FAQ
Quanto custa o Gemini 3.6 Flash por 1M de tokens?
US$1,50 para entrada e US$7,50 para saída. Leituras do cache de contexto custam US$0,15 por 1M de tokens, além de US$1,00 por 1M de tokens por hora de armazenamento.
O preço de saída inclui tokens de raciocínio?
Sim. O raciocínio realizado antes da resposta é cobrado na taxa de saída de US$7,50. Não existe uma linha de cobrança separada, mas esses tokens contam para o total de saída.
Existe realmente uma camada gratuita?
Sim, no Google AI Studio, com limite de taxa. Ela é destinada a prototipagem e testes, não à produção. Como o Google pode usar dados dessa camada para melhorar seus produtos, mantenha dados sensíveis em uma chave paga.
O Gemini 3.6 Flash é mais barato que o 3.5 Flash?
Sim. A taxa de saída caiu de US$9,00 para US$7,50 por 1M de tokens, e o modelo usa cerca de 17% menos tokens de saída para a mesma tarefa. Esses dois fatores podem reduzir a conta de saída em cerca de 31%.
Quando devo usar o Flash-Lite?
Use-o em tarefas simples e de alto volume. Com US$0,30 por 1M de tokens de entrada e US$2,50 por 1M de tokens de saída, ele é aproximadamente 70% mais barato para as mesmas contagens de tokens. Para raciocínio mais complexo, use o Gemini 3.6 Flash.
O Gemini 3.6 Flash combina uma redução de preço com menor geração de tokens. Para orçar, comece com US$1,50 por 1M de tokens de entrada e US$7,50 por 1M de tokens de saída, inclua tokens de raciocínio como saída e use cache e roteamento para Flash-Lite onde fizer sentido.
Para contexto histórico, veja a análise de custos da API Gemini 3.0. Depois, meça suas chamadas reais no Apidog para que o orçamento baseado em tokens corresponda ao que você realmente paga.
Top comments (0)