O Google lançou o Gemini 3.7 Flash em 13 de agosto de 2026, três semanas após o 3.6 Flash, e o descreve como “nosso modelo mais inteligente para tarefas pesadas”. Para planejar custos de API, o dado decisivo não está nos benchmarks: a taxa introdutória de US$ 0,75 por 1 milhão de tokens de entrada e US$ 3,75 por 1 milhão de tokens de saída expira em 31 de dezembro de 2026. Em 1º de janeiro de 2027, ambas dobram.
Isso cria um aumento programado de 2x para qualquer carga de trabalho construída com o modelo. Um chatbot que custa US$ 790 por mês agora passa a custar aproximadamente US$ 1.575 por mês em janeiro, sem mudanças no código, tráfego ou prompts.
Este guia mostra como calcular os dois níveis de custo, estimar três cargas reais e reduzir gastos antes do reajuste. Se você ainda não fez a primeira chamada, consulte o guia de início rápido da API Gemini 3.7 Flash. Depois de começar a enviar requisições, o Apidog permite inspecionar os contadores de usageMetadata retornados pela API para validar estimativas com tráfego real.
TL;DR
- Até 31 de dezembro de 2026: US$ 0,75 por 1M de tokens de entrada e US$ 3,75 por 1M de tokens de saída.
- A partir de 1º de janeiro de 2027: US$ 1,50 para entrada e US$ 7,50 para saída — exatamente 2x.
- O preço introdutório é metade do custo de lançamento do Gemini 3.6 Flash.
- O modelo aceita texto, imagem, vídeo, áudio e PDF, com janela de contexto de 1 milhão de tokens e saída máxima de 64 mil tokens.
- Um chatbot com 10.000 requisições diárias custa cerca de US$ 26,25/dia agora e US$ 52,50/dia após o reajuste.
- As principais alavancas de economia são: limitar saída, usar cache de contexto, processar jobs em lote e rotear tarefas simples para modelos menores.
Os dois níveis de preço
O Gemini 3.7 Flash foi lançado com desconto temporário, não com preço permanente.
| Nível | Período | Entrada por 1M de tokens | Saída por 1M de tokens |
|---|---|---|---|
| Introdutório | 13 de agosto de 2026 a 31 de dezembro de 2026 | US$ 0,75 | US$ 3,75 |
| Padrão | A partir de 1º de janeiro de 2027 | US$ 1,50 | US$ 7,50 |
Duas observações importam para implementação:
- O custo dobra em janeiro. Projete orçamento e alertas usando os dois valores, não apenas a taxa atual.
- Tokens de saída custam 5x mais que tokens de entrada. Limitar respostas longas geralmente economiza mais do que reduzir pequenos trechos do prompt.
As taxas acima se aplicam à API Gemini faturada com chave do AI Studio. O Vertex AI usa faturamento do Google Cloud, SKUs próprios e itens separados para recursos como cache de contexto e processamento em lote. Antes de fechar um orçamento, confirme os valores na página oficial de preços.
Como calcular o custo por endpoint
Use esta fórmula para estimar o custo de uma requisição:
custo =
(tokens_entrada / 1_000_000 × preco_entrada) +
(tokens_saida / 1_000_000 × preco_saida)
Para estimar o custo diário:
custo_diario = custo_por_requisicao × requisicoes_por_dia
E para projetar o mês:
custo_mensal = custo_diario × 30
Calcule sempre com a taxa introdutória e com a taxa padrão.
Carga de trabalho 1: chatbot de suporte
Considere:
- 10.000 solicitações por dia
- 2.000 tokens de entrada por solicitação
- 300 tokens de saída por solicitação
| Item | Tokens diários | Custo introdutório/dia | Custo padrão/dia |
|---|---|---|---|
| Entrada | 20M | US$ 15,00 | US$ 30,00 |
| Saída | 3M | US$ 11,25 | US$ 22,50 |
| Total | 23M | US$ 26,25 | US$ 52,50 |
Em 30 dias:
- Taxa introdutória: aproximadamente US$ 788/mês
- Taxa padrão: aproximadamente US$ 1.575/mês
Ação recomendada
Defina um teto de saída específico para respostas de suporte:
{
"generationConfig": {
"maxOutputTokens": 500
}
}
Uma resposta de atendimento raramente precisa de milhares de tokens. Como a saída é 5x mais cara, esse limite reduz o risco de uma geração longa aumentar a conta.
Carga de trabalho 2: pipeline de documentos PDF
O Gemini 3.7 Flash lê PDFs nativamente. O benchmark GDP.pdf passou de 22,0% no 3.6 Flash para 34,0% no 3.7 Flash, tornando extração e sumarização de documentos uma carga de trabalho relevante.
Considere:
- 500 documentos por dia
- 40.000 tokens de entrada por documento
- 1.000 tokens de saída por resumo estruturado
| Item | Tokens diários | Custo introdutório/dia | Custo padrão/dia |
|---|---|---|---|
| Entrada | 20M | US$ 15,00 | US$ 30,00 |
| Saída | 0,5M | US$ 1,88 | US$ 3,75 |
| Total | 20,5M | US$ 16,88 | US$ 33,75 |
Em 30 dias:
- Taxa introdutória: cerca de US$ 506/mês
- Taxa padrão: cerca de US$ 1.013/mês
Nesse perfil, a entrada domina o custo porque os documentos são longos e os resumos são curtos.
Ação recomendada
Para processamento que não exige resposta imediata:
- agrupe documentos em jobs;
- execute lotes em horários de menor demanda;
- avalie processamento em lote;
- use cache de contexto quando houver instruções ou documentos estáticos repetidos.
Carga de trabalho 3: loop de agente
Agentes multiplicam chamadas e acumulam contexto. Considere:
- 200 tarefas por dia;
- 12 chamadas de modelo por tarefa;
- 8.000 tokens de entrada por chamada;
- 400 tokens de saída por chamada.
| Item | Tokens diários | Custo introdutório/dia | Custo padrão/dia |
|---|---|---|---|
| Entrada | 19,2M | US$ 14,40 | US$ 28,80 |
| Saída | 0,96M | US$ 3,60 | US$ 7,20 |
| Total | 20,16M | US$ 18,00 | US$ 36,00 |
Em 30 dias:
- Taxa introdutória: US$ 540/mês
- Taxa padrão: US$ 1.080/mês
O risco aqui é o crescimento do contexto. Se uma tarefa passa de 12 para 20 chamadas, o custo aumenta 67%, mesmo que o preço por token não mude.
O limite máximo de saída de 64 mil tokens define um teto teórico por chamada de aproximadamente:
- US$ 0,24 na taxa introdutória;
- US$ 0,48 na taxa padrão.
Esse teto evita custo ilimitado por requisição, mas loops de repetição com saídas máximas ainda ficam caros rapidamente.
Como o Gemini 3.7 Flash se compara
Comparações diretas de preço entre provedores envelhecem rapidamente. Use o posicionamento como referência, não como tabela permanente.
O Gemini 3.7 Flash se posiciona como modelo para tarefas pesadas com custo menor que modelos de ponta, incluindo a linha Gemini Pro, modelos maiores da Claude e o nível principal da OpenAI. Ao mesmo tempo, apresenta benchmarks como 65,3% no DeepSWE v1.1 e Elo de 1588 no WebDev Arena.
Para migrar do 3.6 Flash, use o guia de migração do Gemini 3.6 para o 3.7 Flash. O desconto introdutório, por si só, pode justificar o teste de regressão.
Mudanças de preço não são exclusivas do Gemini. A DeepSeek também reajustou sua API, levando equipes a rever seus orçamentos de tokens. Veja o guia de aumento de preços e otimização de custos da DeepSeek.
A implicação prática é simples:
- um protótipo de US$ 3 vira US$ 6;
- um pipeline de US$ 10.000/mês vira US$ 20.000/mês.
Meça antes de o reajuste entrar em vigor.
Cinco formas de reduzir gastos com tokens
1. Limite tokens de saída por endpoint
Defina maxOutputTokens de acordo com o objetivo da rota:
{
"generationConfig": {
"maxOutputTokens": 500
}
}
Exemplos de limites práticos:
| Endpoint | Limite inicial sugerido |
|---|---|
| Classificação | 50–100 tokens |
| Resposta de suporte | Até 500 tokens |
| Resumo estruturado | 500–1.500 tokens |
| Planejamento de agente | Conforme a complexidade da tarefa |
Ajuste com base em respostas reais. O objetivo não é truncar conteúdo útil, mas impedir saídas descontroladas.
2. Armazene contexto estático em cache
Se cada requisição envia o mesmo prompt de sistema de 3.000 tokens, políticas e instruções, você paga repetidamente por conteúdo idêntico.
Use cache de contexto para conteúdo estático e verifique as regras e taxas atuais na documentação da API Gemini.
Para o chatbot do exemplo, armazenar em cache um prefixo estático de 1.500 tokens pode reduzir mais da metade do custo de entrada desse trecho repetido.
3. Use processamento em lote para jobs não interativos
Pipelines de documentos, classificações noturnas e tarefas de enriquecimento geralmente não precisam de resposta imediata.
A estratégia é:
- enfileirar os jobs;
- agrupar payloads;
- executar processamento em lote;
- aceitar maior latência em troca de custo reduzido.
4. Roteie cada tarefa para o modelo adequado
Nem toda requisição precisa do Gemini 3.7 Flash.
Use modelos menores para:
- classificação;
- roteamento;
- extração curta;
- normalização;
- validação simples de formatos.
Reserve o 3.7 Flash para tarefas que usam sua capacidade: planejamento em múltiplas etapas, depuração, fluxos com ferramentas e contexto mais complexo.
5. Prototipe no nível gratuito
Use a cota gratuita do AI Studio para validar:
- prompts;
- schemas de saída;
- limites de tokens;
- comportamento em payloads representativos.
O guia de acesso gratuito à API Gemini explica até onde vai o caminho gratuito e onde estão seus limites.
Rastreie custo por endpoint com o Apidog
Estimativas definem o orçamento; medições por requisição evitam surpresas. As respostas do Gemini incluem usageMetadata, com contagens de tokens de entrada e saída.
Um exemplo de resposta pode conter campos como:
{
"usageMetadata": {
"promptTokenCount": 2000,
"candidatesTokenCount": 300
}
}
No Apidog, configure esse fluxo:
- Salve uma requisição para cada endpoint de produção, como chat, resumo de documento e etapa de agente.
- Armazene a chave em uma variável de ambiente:
GEMINI_API_KEY
- Execute cenários com payloads realistas.
- Extraia:
usageMetadata.promptTokenCountusageMetadata.candidatesTokenCount
- Adicione asserções para impedir regressões de token.
Por exemplo, se seu endpoint de chat não deveria ultrapassar 2.500 tokens de entrada, trate isso como uma regra de teste. Uma mudança no prompt que ultrapasse o limite deve falhar antes do deploy.
O princípio é o mesmo de monitorar latência: tokens também sofrem regressão, mas a consequência aparece na fatura.
Multiplique as contagens medidas pelos dois níveis de preço deste artigo para obter custo por endpoint baseado em respostas reais. Para estruturar cenários de teste, consulte o guia de teste de API para engenheiros de QA.
FAQ
Quando o preço do Gemini 3.7 Flash dobra?
Em 1º de janeiro de 2027. A taxa introdutória de US$ 0,75 por 1 milhão de tokens de entrada e US$ 3,75 por 1 milhão de tokens de saída vale até 31 de dezembro de 2026. Depois, passa para US$ 1,50 e US$ 7,50.
O Gemini 3.7 Flash é mais barato que o Gemini 3.6 Flash?
No lançamento, sim. O preço introdutório do 3.7 Flash é metade do preço de lançamento do 3.6 Flash, enquanto o DeepSWE v1.1 passou de 49,0% para 65,3%. Para detalhes, consulte o guia de referência rápida do Gemini 3.7 Flash.
O preço introdutório se aplica ao Vertex AI?
As taxas deste artigo são da API Gemini faturada por chave do AI Studio. O Vertex AI usa faturamento do Google Cloud, SKUs próprios e termos empresariais. Confirme os valores no console de faturamento do GCP e na página oficial de preços.
O que conta como token de entrada?
Tudo o que você envia: texto, imagens, vídeo, áudio e páginas de PDF convertidos em tokens. Documentos longos e requisições com mídia são fontes comuns de surpresa no custo de entrada.
Após cada chamada, consulte usageMetadata para obter a contagem real.
Como estimar tokens antes de enviar a requisição?
Use o endpoint countTokens para medir o payload sem gerar uma resposta. Como alternativa, envie amostras representativas e leia usageMetadata.
Evite estimar apenas por intuição: tokenizadores variam entre famílias de modelos.
Onde o 3.7 Flash se encaixa na sua pilha
O Gemini 3.7 Flash combina capacidade de modelo para tarefas pesadas com uma janela de desconto cujo fim já está definido. A abordagem prática é:
- mover para o 3.7 Flash as cargas que realmente precisam dessa capacidade;
- medir tokens por endpoint durante o período introdutório;
- projetar o custo com a taxa padrão;
- limitar saída e contexto;
- migrar rotas simples para modelos menores;
- usar os dados coletados para planejar janeiro antes de a fatura chegar.
Baixe o Apidog para manter requisições Gemini, ambientes, asserções de token e verificações de custo no mesmo espaço de trabalho.
Top comments (0)