Gemini 3.7 Flash é o mais novo modelo de IA robusto do Google, lançado em 13 de agosto de 2026, três semanas após o Gemini 3.6 Flash. Ele mantém a janela de contexto de 1M de tokens e a entrada multimodal do predecessor, mas traz ganhos relevantes em benchmarks de codificação e agentes, com preço introdutório de API de US$ 0,75 por 1M de tokens de entrada. O Google o descreve como seu modelo de IA robusto mais inteligente.
A cadência de lançamento é o ponto mais relevante: o Google entregou o 3.7 Flash apenas três semanas depois do 3.6 Flash, enquanto o Gemini 3.5 Pro permanece atrasado. Na prática, isso coloca as novidades de engenharia primeiro no modelo intermediário. Os benchmarks publicados indicam esse avanço: DeepSWE sobe 16 pontos, AutomationBench quase dobra e o preço introdutório é metade da taxa de lançamento do 3.6 Flash.
Este guia reúne as mudanças, benchmarks, períodos de preço, opções de acesso e uma chamada cURL para testar o modelo. Para aprofundar a implementação, consulte o guia rápido da API Gemini 3.7 Flash. Você também pode usar o Apidog para executar seus prompts atuais contra os dois modelos antes de migrar.
Resumo
- Lançado em 13 de agosto de 2026, três semanas após o 3.6 Flash.
- ID do modelo:
gemini-3.7-flash. - Benchmarks de código e agentes melhoraram:
- DeepSWE v1.1: de 49,0% para 65,3%.
- AutomationBench: de 17,0% para 30,4%.
- WebDev Arena: de 1538 para 1588 Elo.
- Preço introdutório: US$ 0,75 por 1M de tokens de entrada e US$ 3,75 por 1M de tokens de saída.
- Preço padrão a partir de 1º de janeiro de 2027: US$ 1,50 de entrada e US$ 7,50 de saída por 1M de tokens.
- Contexto de entrada de 1M de tokens, saída de até 64k tokens e entrada multimodal.
- Disponível na API Gemini, AI Studio, aplicativo Gemini, Gemini Spark, Google Antigravity, Android Studio e Gemini Enterprise, em mais de 160 países.
O que é o Gemini 3.7 Flash
Flash é o nível intermediário da linha Gemini: mais barato e rápido que o Pro, mais capaz que o Flash-Lite e voltado a cargas de trabalho de alto volume em produção. O Gemini 3.7 Flash é o terceiro lançamento Flash da linha 3.x.
O anúncio oficial do Google posiciona o modelo principalmente para codificação e fluxos agênticos, não apenas para chat.
As especificações permanecem iguais às do 3.6 Flash:
- Contexto: 1M de tokens de entrada e até 64k tokens de saída.
- Entrada multimodal: texto, imagem, vídeo, áudio e PDF.
- Saída: texto.
- Ferramentas: chamada de função, pesquisa como ferramenta e uso de computador.
- Segurança: salvaguardas CBRN e cibernéticas atualizadas.
A mudança principal está no comportamento. O Google afirma que o 3.7 Flash depura melhor, gera código implementável com mais frequência, lida melhor com obstáculos, pede esclarecimentos em solicitações ambíguas e segue instruções com maior fidelidade.
Melhorias nos benchmarks: 3.6 vs. 3.7
| Benchmark | Gemini 3.6 Flash | Gemini 3.7 Flash | Mudança |
|---|---|---|---|
| DeepSWE v1.1 (codificação agêntica) | 49,0% | 65,3% | +16,3 pts |
| FrontierCode 1.1 Main | 34,4% | 43,6% | +9,2 pts |
| WebDev Arena (Elo) | 1538 | 1588 | +50 Elo |
| GDP.pdf (raciocínio de documentos) | 22,0% | 34,0% | +12,0 pts |
| AutomationBench (tarefas de agente) | 17,0% | 30,4% | +13,4 pts |
Outras métricas divulgadas:
- 90,7% no Harvey LAB-AA, benchmark de raciocínio jurídico.
- 97,0% na recuperação de contexto longo com 128k agulhas.
Os maiores ganhos aparecem em tarefas de várias etapas. Para workloads com ferramentas, repositórios, documentos extensos ou fluxos que exigem planejamento, o salto no AutomationBench e no DeepSWE é mais relevante do que uma melhoria isolada em respostas de chat.
A cobertura do lançamento destacou o resultado do DeepSWE. Para comparar como diferenças de benchmark afetam tarefas reais entre modelos concorrentes, consulte a comparação entre Grok 4.6, GPT 5.6 e Claude.
O que testar em codificação e agentes
Em vez de migrar diretamente, valide os pontos que o Google destaca com um conjunto de regressão próprio.
1. Depuração em múltiplos arquivos
Use bugs reais ou reproduções mínimas do seu repositório. Avalie se o modelo encontra a causa raiz, não apenas um workaround.
Você está analisando um bug em um serviço Python.
Arquivos relevantes:
- api/routes/users.py
- services/user_service.py
- repositories/user_repository.py
Sintoma:
POST /users retorna 500 apenas quando o e-mail já existe.
Identifique a causa raiz, indique o arquivo e a linha provável,
e proponha um patch mínimo com testes.
O ganho no DeepSWE é a métrica mais próxima para esse tipo de tarefa.
2. Código executável na primeira resposta
Peça uma implementação com contrato explícito: linguagem, dependências permitidas, formato de saída e testes.
Implemente uma função TypeScript `groupByStatus`.
Restrições:
- Não usar bibliotecas externas.
- Não mutar o array de entrada.
- Retornar Record<string, Item[]>.
- Inclua testes com Vitest.
- Responda somente com dois blocos de código:
1. implementação
2. testes
Depois, execute o resultado automaticamente no CI ou em um sandbox. O objetivo é medir quantas respostas passam sem edição manual.
3. Recuperação após falhas de ferramenta
Em fluxos com function calling, simule falhas de API, arquivos ausentes e respostas incompletas. Verifique se o agente adapta o plano ou repete a mesma chamada.
A ferramenta `get_customer` retornou 404 para o ID informado.
Não tente novamente com o mesmo ID.
Explique a próxima ação necessária e peça apenas o dado que falta.
O AutomationBench é especialmente relevante para esse comportamento.
4. Solicitações ambíguas
Teste se o modelo pergunta antes de assumir requisitos críticos.
Crie uma API de pagamentos para meu aplicativo.
Antes de propor a implementação, faça perguntas sobre:
- provedor de pagamento;
- moeda;
- recorrência;
- requisitos de conformidade;
- ambiente de deploy.
5. Fidelidade de formato
Inclua restrições estruturais em prompts longos:
Responda em JSON válido com este formato:
{
"risks": [{"severity": "low|medium|high", "description": "string"}],
"recommendation": "string"
}
Não inclua Markdown, comentários, campos extras ou texto fora do JSON.
Preços: metade do preço até 31 de dezembro de 2026
A API Gemini possui duas faixas de preço para o Gemini 3.7 Flash:
| Período | Entrada por 1M de tokens | Saída por 1M de tokens |
|---|---|---|
| Até 31 de dezembro de 2026 | US$ 0,75 | US$ 3,75 |
| A partir de 1º de janeiro de 2027 | US$ 1,50 | US$ 7,50 |
A taxa introdutória é metade do custo de lançamento do Gemini 3.6 Flash. Porém, o preço dobra em 1º de janeiro de 2027.
Para evitar surpresas:
- Confira a página oficial de preços antes de colocar o modelo em produção.
- Faça seu orçamento de longo prazo com a tarifa padrão de 2027.
- Registre
usageMetadataem todas as chamadas. - Separe custos de entrada, saída e chamadas de ferramentas no seu dashboard.
Para exemplos de cálculo em chatbots, processamento de documentos e loops de agentes, consulte a análise de preços do Gemini 3.7 Flash.
Onde usar o modelo
O Google disponibilizou o 3.7 Flash em mais de 160 países:
-
API Gemini: acesso direto ao modelo
gemini-3.7-flash. - Google AI Studio: playground para testar prompts.
- Aplicativo Gemini: interface de chat para consumidores.
- Gemini Spark: para assinantes AI Pro e Ultra.
- Google Antigravity: ambiente de desenvolvimento agêntico.
- Android Studio: assistência de código no IDE.
- Gemini Enterprise: oferta gerenciada para organizações.
Para workloads corporativos, também existe o caminho via Vertex AI em aiplatform.googleapis.com, com OAuth, IAM e registro de auditoria.
Por que o Flash chegou antes do Gemini 3.5 Pro
A ordem é incomum: normalmente o modelo carro-chefe chega antes das variantes intermediárias. Neste caso, o Google lançou o 3.6 Flash no fim de julho, o 3.7 Flash três semanas depois e o Gemini 3.5 Pro continua sem data.
Segundo a Axios, o Google está lançando atualizações do Flash antes do próximo carro-chefe enquanto o Pro permanece atrasado.
Para desenvolvedores, o efeito prático é simples: não trate mais o Flash como uma opção secundária. Se sua carga prioriza custo, latência e escala, é provável que o Flash seja o primeiro modelo a receber capacidades novas de agente.
Se você já usa o 3.6, consulte o guia de migração do Gemini 3.6 para o 3.7 Flash. Para muitas bases de código, a alteração começa pela troca do ID do modelo, seguida de uma rodada de regressão.
Como testar a API em cinco minutos
Primeiro, crie uma chave de API no Google AI Studio.
Depois, exporte a chave e faça uma requisição:
export GEMINI_API_KEY="AIza..."
curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.7-flash:generateContent" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"contents": [{
"parts": [{
"text": "Review this function for bugs: def dedupe(items): return list(set(items))"
}]
}],
"generationConfig": {
"temperature": 0.4,
"maxOutputTokens": 1024
}
}'
A resposta inclui:
-
candidates: respostas geradas pelo modelo. -
content.parts: texto da resposta. -
usageMetadata: contagem de tokens de entrada e saída.
Monitore usageMetadata desde o primeiro dia. Esse campo é a base para acompanhar custo por requisição, usuário, fluxo ou ambiente.
Habilitar streaming
Para receber tokens progressivamente via Server-Sent Events, substitua o endpoint:
:generateContent
por:
:streamGenerateContent?alt=sse
Exemplo:
curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.7-flash:streamGenerateContent?alt=sse" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"contents": [{
"parts": [{ "text": "Explique recursão em uma frase." }]
}]
}'
Comparar 3.6 e 3.7 de forma prática
Depois que a primeira chamada funcionar, compare os dois modelos com as mesmas entradas:
- Salve prompts reais do seu produto.
- Execute cada prompt contra
gemini-3.6-flash. - Repita contra
gemini-3.7-flash. - Registre resposta, latência, tokens de entrada, tokens de saída e resultado da validação.
- Defina critérios objetivos de aprovação, como testes passando, JSON válido ou nota humana.
No Apidog, importe a especificação da Generative Language API, associe GEMINI_API_KEY ao cabeçalho x-goog-api-key como variável de ambiente e defina o ID do modelo como variável de caminho.
Assim, você pode alternar entre gemini-3.6-flash e gemini-3.7-flash sem duplicar requisições, acompanhar respostas SSE e salvar exemplos para regressões futuras.
Perguntas frequentes
O Gemini 3.7 Flash é gratuito?
A API Gemini possui um nível gratuito no AI Studio com cota diária, adequado para prototipagem. O uso pago começa em US$ 0,75 por 1M de tokens de entrada até 31 de dezembro de 2026.
Para entender os limites, consulte o guia de acesso gratuito à API Gemini.
Qual é a diferença entre Gemini 3.6 Flash e 3.7 Flash?
As especificações principais permanecem iguais: janela de contexto, limite de saída, modalidades e suporte a ferramentas.
Os ganhos estão em codificação e agentes:
- DeepSWE: +16,3 pontos.
- AutomationBench: +13,4 pontos.
- WebDev Arena: +50 Elo.
O Google também afirma melhorias em depuração, seguimento de instruções e planejamento em várias etapas.
O Gemini 3.7 Flash substitui o Gemini 3.5 Pro?
Não. O Pro continua sendo a categoria carro-chefe para tarefas de raciocínio mais difíceis, enquanto o Gemini 3.5 Pro ainda está em desenvolvimento.
O 3.7 Flash é voltado a cargas de produção de alto volume, em que custo e latência importam junto com qualidade.
O que muda no preço em 1º de janeiro de 2027?
A tarifa introdutória termina. O preço passa para:
- US$ 1,50 por 1M de tokens de entrada.
- US$ 7,50 por 1M de tokens de saída.
Para workloads que continuarão em 2027, projete os custos com a tarifa padrão.
O Gemini 3.7 Flash processa imagens e PDFs?
Sim. Ele aceita texto, imagens, vídeos, áudio e PDFs no array contents. A saída continua sendo somente texto.
O benchmark GDP.pdf passou de 22,0% para 34,0%, o que indica uma melhoria divulgada pelo Google para compreensão de documentos.
Onde o 3.7 Flash se encaixa na sua pilha
O Gemini 3.7 Flash combina benchmarks melhores para agentes, compatibilidade com as especificações do 3.6 e uma janela de preço introdutório. Isso reduz o custo de testá-lo agora, mas não elimina a necessidade de avaliação com dados reais.
A sequência recomendada é:
- Reutilize seu conjunto de prompts atual.
- Execute-o contra
gemini-3.6-flashegemini-3.7-flash. - Compare qualidade, latência e
usageMetadata. - Valide resultados com testes automatizados ou revisão humana.
- Faça o orçamento com o preço padrão de 2027.
- Migre apenas os fluxos em que o 3.7 demonstrar ganho mensurável.
Use o Apidog para centralizar essa comparação: salve respostas do 3.6 como exemplos, reproduza as mesmas requisições no 3.7 e confirme se os ganhos de benchmark aparecem na sua carga de trabalho.

Top comments (0)