Gemini 3.6 Flash é o novo modelo “burro de carga” do Google. Ele se tornou geralmente disponível em 21 de julho de 2026 e substitui o Gemini 3.5 Flash com menor custo e maior eficiência de tokens. Para tráfego de API em alto volume que exige qualidade sólida sem custo de modelo de ponta, este é o nível projetado pelo Google.
Neste guia, você verá as especificações, preços, benchmarks e formas de acesso ao modelo. Também há um fluxo prático para testar chamadas da API e criar testes de regressão antes de migrar tráfego de produção.
O que é o Gemini 3.6 Flash?
Gemini 3.6 Flash é o modelo de médio porte e alto rendimento da família Gemini. Ele é voltado para tarefas recorrentes de produção, como:
- Sumarização;
- Extração estruturada;
- Classificação;
- Chat;
- Chamadas de ferramentas em várias etapas;
- Processamento multimodal de texto, imagens, vídeo, áudio e PDFs.
A saída é somente texto, mas você pode enviar diferentes modalidades de entrada na mesma solicitação.
O Google lançou três modelos em 21 de julho de 2026:
| Modelo | Posicionamento |
|---|---|
| Gemini 3.6 Flash | Modelo principal para alto volume e qualidade equilibrada |
| Gemini 3.5 Flash-Lite | Nível mais barato e rápido para cargas simples e sensíveis à latência |
| Gemini 3.5 Flash Cyber | Modelo de segurança restrito a governos e parceiros confiáveis |
Consulte também:
Atenção ao ID do modelo
O versionamento não é uniforme entre os modelos Flash. O modelo principal avançou para 3.6, enquanto Flash-Lite e Flash Cyber permaneceram em 3.5.
Use o ID correto na integração:
gemini-3.6-flash
Não confunda com:
gemini-3.5-flash-lite
Eles representam níveis diferentes, não variações de nome.
O anúncio está no blog do Google, e o cartão do modelo está na página Gemini Flash da DeepMind.
O que mudou em relação ao Gemini 3.5 Flash
A mudança principal é eficiência.
O Gemini 3.6 Flash usa cerca de 17% menos tokens de saída para concluir o mesmo trabalho que o Gemini 3.5 Flash. Na prática, isso pode reduzir custo e latência, pois tokens de saída são mais caros e levam mais tempo para serem transmitidos.
O preço de saída também caiu:
| Modelo | Preço por 1M de tokens de saída |
|---|---|
| Gemini 3.5 Flash | US$ 9,00 |
| Gemini 3.6 Flash | US$ 7,50 |
O modelo também melhorou em:
- Codificação;
- Uso de computador;
- Fluxos agentic com várias etapas;
- Redução de chamadas de ferramentas;
- Redução de etapas de raciocínio.
Para agentes, menos loops e menos chamadas de ferramenta significam menor latência ponta a ponta e menor custo por execução.
Antes de migrar tráfego existente, compare o comportamento dos seus prompts com o guia Gemini 3.6 Flash vs 3.5 Flash.
Especificações do Gemini 3.6 Flash
| Atributo | Gemini 3.6 Flash |
|---|---|
| ID do modelo | gemini-3.6-flash |
| Janela de contexto de entrada | 1M tokens |
| Saída máxima | 64k tokens |
| Modalidades de entrada | Texto, imagem, vídeo, áudio e PDF |
| Saída | Somente texto |
| Preço de entrada | US$ 1,50 por 1M tokens |
| Preço de saída | US$ 7,50 por 1M tokens, incluindo tokens de “pensamento” |
| Nível gratuito | Sim, via Google AI Studio, com limite de taxa |
| Lançamento | 21 de julho de 2026 |
Dois limites devem orientar sua implementação:
- 1M tokens de contexto permite enviar documentos extensos, transcrições longas ou bases de código grandes em uma solicitação.
- 64k tokens de saída é o limite de uma resposta. Para saídas muito extensas, divida o trabalho em múltiplas chamadas e consolide o resultado no seu fluxo.
Como ele se comporta nos benchmarks
Benchmarks não são garantia de desempenho para seu caso de uso, mas ajudam a identificar onde o modelo é mais forte.
Codificação
| Benchmark | Resultado |
|---|---|
| SWE-Bench Pro | 58,7% |
| DeepSWE v1.1 | 49% |
| Terminal-bench 2.1 | 78,0% |
O SWE-Bench Pro avalia a resolução de problemas reais do GitHub em repositórios de produção. O Terminal-bench 2.1 mede a capacidade de executar tarefas por comandos em um terminal real.
Uso de computador
No OSWorld-Verified, o Gemini 3.6 Flash alcança 83,0%, acima dos 78,4% do Gemini 3.5 Flash.
Isso é relevante para agentes que precisam interagir com desktops, aplicativos ou interfaces reais.
Qualidade geral
O modelo registra Elo GDPVal-AA v2 de 1421. O GDPVal mede desempenho em tarefas profissionais, enquanto a pontuação Elo compara modelos em confrontos diretos: um valor maior indica mais vitórias relativas.
Contexto longo
O desempenho em contexto longo exige testes próprios:
| Cenário | Resultado |
|---|---|
| Recuperação com 128k tokens | 91,8% |
| Recuperação pontual com 1M tokens | 54,0% |
O modelo mantém bom desempenho em entradas grandes, mas não presuma recuperação perfeita ao preencher toda a janela de contexto. Se sua aplicação depende de busca precisa em documentos longos, teste no tamanho real de contexto usado em produção.
Preços em resumo
O Gemini 3.6 Flash custa:
- US$ 1,50 por 1M tokens de entrada;
- US$ 7,50 por 1M tokens de saída.
Os tokens de saída incluem tokens de “pensamento”. Portanto, o raciocínio que não aparece na resposta final ainda entra no custo.
Para cache de contexto:
- US$ 0,15 por 1M tokens;
- US$ 1,00 por 1M tokens por hora de armazenamento.
O cache é útil quando sua aplicação envia repetidamente o mesmo prompt grande, documento de referência ou contexto de sistema.
Há um nível gratuito no Google AI Studio, com limite de taxa. Como o Google pode usar dados do nível gratuito para melhorar seus produtos, use-o para prototipagem, não para tráfego sensível de produção.
Veja detalhes em:
- Como usar o Gemini 3.6 Flash gratuitamente
- Preços do Gemini 3.6 Flash
- Página de preços da API Gemini
Como acessar o Gemini 3.6 Flash
Você pode acessar o modelo por diferentes superfícies:
-
API Gemini, via Google AI Studio: gere uma chave e chame
gemini-3.6-flashde um cliente REST ou SDK. - Google Antigravity: superfície de desenvolvimento agentic do Google.
- Gemini Enterprise Agent Platform: para equipes que criam agentes governados.
- Aplicativo Gemini: para conversar diretamente com o modelo.
Para desenvolvedores, a API é normalmente o caminho principal.
Fluxo recomendado:
- Gere uma chave no Google AI Studio.
- Armazene a chave em uma variável de ambiente.
- Crie uma solicitação para o modelo
gemini-3.6-flash. - Teste prompts curtos, multimodais e de contexto longo.
- Registre custo, latência, formato de saída e taxa de sucesso.
- Execute os mesmos testes antes e depois da migração.
Consulte:
Onde o Gemini 3.6 Flash se encaixa na linha do Google
Pense nos modelos Flash como uma escala entre custo, velocidade e qualidade.
| Modelo | Quando usar |
|---|---|
| Gemini 3.5 Flash-Lite | Alto volume, baixa latência e tarefas mais simples |
| Gemini 3.6 Flash | Tarefas mais difíceis, melhor confiabilidade e workloads agentic |
| Modelos de ponta | Raciocínio genuinamente complexo, quando disponíveis |
O Gemini 3.5 Flash-Lite custa:
- US$ 0,30 por 1M tokens de entrada;
- US$ 2,50 por 1M tokens de saída;
- Aproximadamente 350 tokens de saída por segundo.
Escolha Flash-Lite para classificação, transformação simples, extração repetitiva ou workloads em que custo e velocidade sejam mais importantes que qualidade máxima. Escolha Gemini 3.6 Flash quando a tarefa exigir melhor capacidade de codificação, uso de computador ou resultados mais confiáveis.
O Gemini 3.5 Pro ainda não foi lançado publicamente. O Google informa que ele continua sendo testado com parceiros. Uma execução de pré-treinamento do Gemini 4 também foi mencionada, mas não foi lançada.
Para contexto sobre a geração anterior, veja o que é Gemini 3.5.
Testando o Gemini 3.6 Flash no Apidog
As páginas de modelos mostram números de melhor caso. Para saber como o Gemini 3.6 Flash funciona com seus prompts, seu contexto e seus critérios de qualidade, envie chamadas reais e valide as respostas.
Apidog é um cliente de API e plataforma de testes que pode tratar o endpoint Gemini como qualquer outra API REST.
Configure uma solicitação de teste
- Crie uma solicitação
POSTpara o endpoint da API Gemini. - Defina o modelo como:
gemini-3.6-flash
- Salve a chave de API em uma variável de ambiente, em vez de incluí-la diretamente na URL ou no corpo da solicitação.
- Envie a chamada e revise:
- Código de status;
- Estrutura do JSON;
- Conteúdo retornado;
- Latência;
- Uso de tokens, quando disponível.
- Adicione asserções para garantir que mudanças inesperadas falhem de forma visível.
Exemplos de verificações úteis:
- O status HTTP é bem-sucedido
- A resposta contém o campo esperado
- O texto retornado não está vazio
- O formato JSON continua compatível com o consumidor da API
- A latência fica dentro do limite definido pela aplicação
Transforme a chamada em um teste de regressão
Depois de validar uma resposta, salve a solicitação como teste de regressão. Isso permite repetir os mesmos prompts depois de alterações de modelo, atualização de integração ou ajustes no seu sistema.
Você pode programar a execução dos testes para detectar alterações em:
- Formato de resposta;
- Campos JSON;
- Latência;
- Qualidade da saída;
- Comportamento de ferramentas;
- Compatibilidade com prompts críticos.
O Apidog não executa o modelo e não substitui um framework de IA. Ele ajuda a construir, enviar, validar e monitorar as chamadas de API que sua aplicação depende.
Se quiser configurar a primeira solicitação, baixe o Apidog.
FAQ
O Gemini 3.6 Flash é gratuito?
Existe um nível gratuito pelo Google AI Studio, com limite de taxa e foco em prototipagem. O Google pode usar dados desse nível para melhorar seus produtos. Para produção, o custo é de US$ 1,50 por 1M tokens de entrada e US$ 7,50 por 1M tokens de saída.
O Gemini 3.6 Flash é melhor que o 3.5 Flash?
Para a maioria dos workloads, sim. Ele usa cerca de 17% menos tokens de saída, reduz o preço de saída de US$ 9,00 para US$ 7,50 por 1M tokens e melhora resultados em codificação e uso de computador. No OSWorld-Verified, sobe de 78,4% para 83,0%.
O Gemini 3.5 Pro foi lançado?
Não. O Google informa que continua testando o Gemini 3.5 Pro com parceiros. Não há um modelo Pro público neste lançamento.
Qual é o ID do modelo?
Use:
gemini-3.6-flash
Não confunda com gemini-3.5-flash-lite, que é o modelo Flash-Lite mais barato.
O que o Gemini 3.6 Flash não pode fazer?
Ele gera apenas texto. Embora aceite imagens, áudio, vídeo e PDFs como entrada, não gera essas modalidades como saída.
Além disso:
- A recuperação pontual cai para cerca de 54,0% no limite de 1M tokens;
- Ele é um modelo de médio porte, não um carro-chefe de ponta;
- Casos de raciocínio muito difíceis exigem validação e escolha cuidadosa do modelo.
Gemini 3.6 Flash é uma opção prática para grande parte do tráfego da API Gemini: reduz custo, usa menos tokens de saída e melhora workloads agentic em relação ao Gemini 3.5 Flash. Antes de migrar em escala, crie uma suíte de prompts representativos, execute testes de regressão e compare custo, latência e qualidade com a versão atual.


Top comments (0)