DEV Community

Cover image for Novidades do Gemini 3.7 Flash: Recursos, Benchmarks e Acesso à API
Lucas
Lucas

Posted on Originally published at apidog.com

Novidades do Gemini 3.7 Flash: Recursos, Benchmarks e Acesso à API

Gemini 3.7 Flash é o mais novo modelo de IA robusto do Google, lançado em 13 de agosto de 2026, três semanas após o Gemini 3.6 Flash. Ele mantém a janela de contexto de 1M de tokens e a entrada multimodal do predecessor, mas traz ganhos relevantes em benchmarks de codificação e agentes, com preço introdutório de API de US$ 0,75 por 1M de tokens de entrada. O Google o descreve como seu modelo de IA robusto mais inteligente.

Experimente o Apidog hoje

A cadência de lançamento é o ponto mais relevante: o Google entregou o 3.7 Flash apenas três semanas depois do 3.6 Flash, enquanto o Gemini 3.5 Pro permanece atrasado. Na prática, isso coloca as novidades de engenharia primeiro no modelo intermediário. Os benchmarks publicados indicam esse avanço: DeepSWE sobe 16 pontos, AutomationBench quase dobra e o preço introdutório é metade da taxa de lançamento do 3.6 Flash.

Este guia reúne as mudanças, benchmarks, períodos de preço, opções de acesso e uma chamada cURL para testar o modelo. Para aprofundar a implementação, consulte o guia rápido da API Gemini 3.7 Flash. Você também pode usar o Apidog para executar seus prompts atuais contra os dois modelos antes de migrar.

Resumo

  • Lançado em 13 de agosto de 2026, três semanas após o 3.6 Flash.
  • ID do modelo: gemini-3.7-flash.
  • Benchmarks de código e agentes melhoraram:
    • DeepSWE v1.1: de 49,0% para 65,3%.
    • AutomationBench: de 17,0% para 30,4%.
    • WebDev Arena: de 1538 para 1588 Elo.
  • Preço introdutório: US$ 0,75 por 1M de tokens de entrada e US$ 3,75 por 1M de tokens de saída.
  • Preço padrão a partir de 1º de janeiro de 2027: US$ 1,50 de entrada e US$ 7,50 de saída por 1M de tokens.
  • Contexto de entrada de 1M de tokens, saída de até 64k tokens e entrada multimodal.
  • Disponível na API Gemini, AI Studio, aplicativo Gemini, Gemini Spark, Google Antigravity, Android Studio e Gemini Enterprise, em mais de 160 países.

O que é o Gemini 3.7 Flash

Flash é o nível intermediário da linha Gemini: mais barato e rápido que o Pro, mais capaz que o Flash-Lite e voltado a cargas de trabalho de alto volume em produção. O Gemini 3.7 Flash é o terceiro lançamento Flash da linha 3.x.

O anúncio oficial do Google posiciona o modelo principalmente para codificação e fluxos agênticos, não apenas para chat.

Gemini 3.7 Flash

As especificações permanecem iguais às do 3.6 Flash:

  • Contexto: 1M de tokens de entrada e até 64k tokens de saída.
  • Entrada multimodal: texto, imagem, vídeo, áudio e PDF.
  • Saída: texto.
  • Ferramentas: chamada de função, pesquisa como ferramenta e uso de computador.
  • Segurança: salvaguardas CBRN e cibernéticas atualizadas.

A mudança principal está no comportamento. O Google afirma que o 3.7 Flash depura melhor, gera código implementável com mais frequência, lida melhor com obstáculos, pede esclarecimentos em solicitações ambíguas e segue instruções com maior fidelidade.

Melhorias nos benchmarks: 3.6 vs. 3.7

Benchmark Gemini 3.6 Flash Gemini 3.7 Flash Mudança
DeepSWE v1.1 (codificação agêntica) 49,0% 65,3% +16,3 pts
FrontierCode 1.1 Main 34,4% 43,6% +9,2 pts
WebDev Arena (Elo) 1538 1588 +50 Elo
GDP.pdf (raciocínio de documentos) 22,0% 34,0% +12,0 pts
AutomationBench (tarefas de agente) 17,0% 30,4% +13,4 pts

Outras métricas divulgadas:

  • 90,7% no Harvey LAB-AA, benchmark de raciocínio jurídico.
  • 97,0% na recuperação de contexto longo com 128k agulhas.

Os maiores ganhos aparecem em tarefas de várias etapas. Para workloads com ferramentas, repositórios, documentos extensos ou fluxos que exigem planejamento, o salto no AutomationBench e no DeepSWE é mais relevante do que uma melhoria isolada em respostas de chat.

A cobertura do lançamento destacou o resultado do DeepSWE. Para comparar como diferenças de benchmark afetam tarefas reais entre modelos concorrentes, consulte a comparação entre Grok 4.6, GPT 5.6 e Claude.

O que testar em codificação e agentes

Em vez de migrar diretamente, valide os pontos que o Google destaca com um conjunto de regressão próprio.

1. Depuração em múltiplos arquivos

Use bugs reais ou reproduções mínimas do seu repositório. Avalie se o modelo encontra a causa raiz, não apenas um workaround.

Você está analisando um bug em um serviço Python.

Arquivos relevantes:
- api/routes/users.py
- services/user_service.py
- repositories/user_repository.py

Sintoma:
POST /users retorna 500 apenas quando o e-mail já existe.

Identifique a causa raiz, indique o arquivo e a linha provável,
e proponha um patch mínimo com testes.
Enter fullscreen mode Exit fullscreen mode

O ganho no DeepSWE é a métrica mais próxima para esse tipo de tarefa.

2. Código executável na primeira resposta

Peça uma implementação com contrato explícito: linguagem, dependências permitidas, formato de saída e testes.

Implemente uma função TypeScript `groupByStatus`.

Restrições:
- Não usar bibliotecas externas.
- Não mutar o array de entrada.
- Retornar Record<string, Item[]>.
- Inclua testes com Vitest.
- Responda somente com dois blocos de código:
  1. implementação
  2. testes
Enter fullscreen mode Exit fullscreen mode

Depois, execute o resultado automaticamente no CI ou em um sandbox. O objetivo é medir quantas respostas passam sem edição manual.

3. Recuperação após falhas de ferramenta

Em fluxos com function calling, simule falhas de API, arquivos ausentes e respostas incompletas. Verifique se o agente adapta o plano ou repete a mesma chamada.

A ferramenta `get_customer` retornou 404 para o ID informado.
Não tente novamente com o mesmo ID.
Explique a próxima ação necessária e peça apenas o dado que falta.
Enter fullscreen mode Exit fullscreen mode

O AutomationBench é especialmente relevante para esse comportamento.

4. Solicitações ambíguas

Teste se o modelo pergunta antes de assumir requisitos críticos.

Crie uma API de pagamentos para meu aplicativo.

Antes de propor a implementação, faça perguntas sobre:
- provedor de pagamento;
- moeda;
- recorrência;
- requisitos de conformidade;
- ambiente de deploy.
Enter fullscreen mode Exit fullscreen mode

5. Fidelidade de formato

Inclua restrições estruturais em prompts longos:

Responda em JSON válido com este formato:

{
  "risks": [{"severity": "low|medium|high", "description": "string"}],
  "recommendation": "string"
}

Não inclua Markdown, comentários, campos extras ou texto fora do JSON.
Enter fullscreen mode Exit fullscreen mode

Preços: metade do preço até 31 de dezembro de 2026

A API Gemini possui duas faixas de preço para o Gemini 3.7 Flash:

Período Entrada por 1M de tokens Saída por 1M de tokens
Até 31 de dezembro de 2026 US$ 0,75 US$ 3,75
A partir de 1º de janeiro de 2027 US$ 1,50 US$ 7,50

A taxa introdutória é metade do custo de lançamento do Gemini 3.6 Flash. Porém, o preço dobra em 1º de janeiro de 2027.

Para evitar surpresas:

  1. Confira a página oficial de preços antes de colocar o modelo em produção.
  2. Faça seu orçamento de longo prazo com a tarifa padrão de 2027.
  3. Registre usageMetadata em todas as chamadas.
  4. Separe custos de entrada, saída e chamadas de ferramentas no seu dashboard.

Para exemplos de cálculo em chatbots, processamento de documentos e loops de agentes, consulte a análise de preços do Gemini 3.7 Flash.

Onde usar o modelo

O Google disponibilizou o 3.7 Flash em mais de 160 países:

  • API Gemini: acesso direto ao modelo gemini-3.7-flash.
  • Google AI Studio: playground para testar prompts.
  • Aplicativo Gemini: interface de chat para consumidores.
  • Gemini Spark: para assinantes AI Pro e Ultra.
  • Google Antigravity: ambiente de desenvolvimento agêntico.
  • Android Studio: assistência de código no IDE.
  • Gemini Enterprise: oferta gerenciada para organizações.

Para workloads corporativos, também existe o caminho via Vertex AI em aiplatform.googleapis.com, com OAuth, IAM e registro de auditoria.

Por que o Flash chegou antes do Gemini 3.5 Pro

A ordem é incomum: normalmente o modelo carro-chefe chega antes das variantes intermediárias. Neste caso, o Google lançou o 3.6 Flash no fim de julho, o 3.7 Flash três semanas depois e o Gemini 3.5 Pro continua sem data.

Segundo a Axios, o Google está lançando atualizações do Flash antes do próximo carro-chefe enquanto o Pro permanece atrasado.

Para desenvolvedores, o efeito prático é simples: não trate mais o Flash como uma opção secundária. Se sua carga prioriza custo, latência e escala, é provável que o Flash seja o primeiro modelo a receber capacidades novas de agente.

Se você já usa o 3.6, consulte o guia de migração do Gemini 3.6 para o 3.7 Flash. Para muitas bases de código, a alteração começa pela troca do ID do modelo, seguida de uma rodada de regressão.

Como testar a API em cinco minutos

Primeiro, crie uma chave de API no Google AI Studio.

Depois, exporte a chave e faça uma requisição:

export GEMINI_API_KEY="AIza..."

curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.7-flash:generateContent" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "contents": [{
      "parts": [{
        "text": "Review this function for bugs: def dedupe(items): return list(set(items))"
      }]
    }],
    "generationConfig": {
      "temperature": 0.4,
      "maxOutputTokens": 1024
    }
  }'
Enter fullscreen mode Exit fullscreen mode

A resposta inclui:

  • candidates: respostas geradas pelo modelo.
  • content.parts: texto da resposta.
  • usageMetadata: contagem de tokens de entrada e saída.

Monitore usageMetadata desde o primeiro dia. Esse campo é a base para acompanhar custo por requisição, usuário, fluxo ou ambiente.

Habilitar streaming

Para receber tokens progressivamente via Server-Sent Events, substitua o endpoint:

:generateContent
Enter fullscreen mode Exit fullscreen mode

por:

:streamGenerateContent?alt=sse
Enter fullscreen mode Exit fullscreen mode

Exemplo:

curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.7-flash:streamGenerateContent?alt=sse" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "contents": [{
      "parts": [{ "text": "Explique recursão em uma frase." }]
    }]
  }'
Enter fullscreen mode Exit fullscreen mode

Comparar 3.6 e 3.7 de forma prática

Depois que a primeira chamada funcionar, compare os dois modelos com as mesmas entradas:

  1. Salve prompts reais do seu produto.
  2. Execute cada prompt contra gemini-3.6-flash.
  3. Repita contra gemini-3.7-flash.
  4. Registre resposta, latência, tokens de entrada, tokens de saída e resultado da validação.
  5. Defina critérios objetivos de aprovação, como testes passando, JSON válido ou nota humana.

No Apidog, importe a especificação da Generative Language API, associe GEMINI_API_KEY ao cabeçalho x-goog-api-key como variável de ambiente e defina o ID do modelo como variável de caminho.

Assim, você pode alternar entre gemini-3.6-flash e gemini-3.7-flash sem duplicar requisições, acompanhar respostas SSE e salvar exemplos para regressões futuras.

Perguntas frequentes

O Gemini 3.7 Flash é gratuito?

A API Gemini possui um nível gratuito no AI Studio com cota diária, adequado para prototipagem. O uso pago começa em US$ 0,75 por 1M de tokens de entrada até 31 de dezembro de 2026.

Para entender os limites, consulte o guia de acesso gratuito à API Gemini.

Qual é a diferença entre Gemini 3.6 Flash e 3.7 Flash?

As especificações principais permanecem iguais: janela de contexto, limite de saída, modalidades e suporte a ferramentas.

Os ganhos estão em codificação e agentes:

  • DeepSWE: +16,3 pontos.
  • AutomationBench: +13,4 pontos.
  • WebDev Arena: +50 Elo.

O Google também afirma melhorias em depuração, seguimento de instruções e planejamento em várias etapas.

O Gemini 3.7 Flash substitui o Gemini 3.5 Pro?

Não. O Pro continua sendo a categoria carro-chefe para tarefas de raciocínio mais difíceis, enquanto o Gemini 3.5 Pro ainda está em desenvolvimento.

O 3.7 Flash é voltado a cargas de produção de alto volume, em que custo e latência importam junto com qualidade.

O que muda no preço em 1º de janeiro de 2027?

A tarifa introdutória termina. O preço passa para:

  • US$ 1,50 por 1M de tokens de entrada.
  • US$ 7,50 por 1M de tokens de saída.

Para workloads que continuarão em 2027, projete os custos com a tarifa padrão.

O Gemini 3.7 Flash processa imagens e PDFs?

Sim. Ele aceita texto, imagens, vídeos, áudio e PDFs no array contents. A saída continua sendo somente texto.

O benchmark GDP.pdf passou de 22,0% para 34,0%, o que indica uma melhoria divulgada pelo Google para compreensão de documentos.

Onde o 3.7 Flash se encaixa na sua pilha

O Gemini 3.7 Flash combina benchmarks melhores para agentes, compatibilidade com as especificações do 3.6 e uma janela de preço introdutório. Isso reduz o custo de testá-lo agora, mas não elimina a necessidade de avaliação com dados reais.

A sequência recomendada é:

  1. Reutilize seu conjunto de prompts atual.
  2. Execute-o contra gemini-3.6-flash e gemini-3.7-flash.
  3. Compare qualidade, latência e usageMetadata.
  4. Valide resultados com testes automatizados ou revisão humana.
  5. Faça o orçamento com o preço padrão de 2027.
  6. Migre apenas os fluxos em que o 3.7 demonstrar ganho mensurável.

Use o Apidog para centralizar essa comparação: salve respostas do 3.6 como exemplos, reproduza as mesmas requisições no 3.7 e confirme se os ganhos de benchmark aparecem na sua carga de trabalho.

Top comments (0)