Grok 4.6 é o modelo de linguagem de fronteira da xAI, lançado em 12 de agosto de 2026. Ele se baseia no Grok 4.5 com foco em agentes de longa duração, codificação agêntica e trabalho interativo ou visual, oferecendo uma janela de contexto de 500.000 tokens a US$ 2 por milhão de tokens de entrada e US$ 6 por milhão de saída. No Índice de Inteligência da Artificial Analysis, ele atinge 61 pontos, igualando o GPT-5.6 Sol da OpenAI e ficando um ponto atrás do Claude Fable 5 da Anthropic, tornando-o o modelo mais barato atualmente na fronteira da inteligência.
Na prática, este post mostra o que mudou em relação ao Grok 4.5, como interpretar os benchmarks e como testar o modelo na sua stack de APIs. Se você trabalha com APIs de LLM, o Apidog oferece um espaço de trabalho gratuito para projetar, testar e simular chamadas de API antes de implementar um cliente próprio.
TL;DR
- Lançamento: 12 de agosto de 2026, pela xAI.
- Foco: agentes de longo horizonte, codificação multi-etapas, trabalho interativo e visual. A xAI afirma que o modelo auto-testa e verifica seu próprio trabalho com mais frequência antes de prosseguir.
- Especificações: janela de contexto de 500K e corte de conhecimento em 1º de fevereiro de 2026.
- Preços: US$ 2 / 1M de tokens de entrada e US$ 6 / 1M de saída. Uma variante mais rápida custa 2x. A primeira semana inclui o dobro de uso no Grok Build e Cursor.
- Benchmarks: Índice de Inteligência 61, empatando com GPT-5.6 Sol; saltos de 54 para 65,9 no DeepSWE e de 47,1 para 57,5 no APEX-Agents.
- Onde usar: API da xAI, Grok Build, Cursor, OpenRouter, Vercel e Cloudflare.
- Como avaliar: execute tarefas reais, compare qualidade, latência, tokens e comportamento de chamadas de ferramentas.
Grok 4.6 em um relance
| Especificação | Grok 4.6 |
|---|---|
| Desenvolvedor | xAI |
| Data de lançamento | 12 de agosto de 2026 |
| Janela de contexto | 500.000 tokens |
| Corte de conhecimento | 1º de fevereiro de 2026 |
| Preço de entrada/saída | US$ 2 / US$ 6 por 1M de tokens |
| Variante rápida | 2x preço |
| Índice de Inteligência | 61 (GPT-5.6 Sol: 61, Claude Fable 5: 62) |
| Disponibilidade | API da xAI, Cursor, Grok Build, OpenRouter, Vercel, Cloudflare |
O que realmente mudou em comparação com o Grok 4.5
O Grok 4.6 não representa uma revelação de arquitetura; a principal mudança está no treinamento. Segundo a xAI, ele passou por um período de treinamento suplementar mais longo que o Grok 4.5, com três componentes centrais:
- Dados curados e gerados por modelos, voltados para raciocínio e conceitos técnicos avançados.
- Conjuntos de dados de engenharia de alta qualidade, mantendo a ênfase em codificação iniciada com o treinamento em sessões reais de desenvolvimento.
- Otimizador e receita de treinamento aprimorados, com trajetórias de fine-tuning supervisionado regeneradas para raciocínio e domínios específicos.
Para desenvolvedores, a mudança mais relevante é a auto-verificação durante execuções agênticas longas. A xAI relata que o modelo tende a validar o próprio trabalho antes de avançar:
- executar o teste que acabou de escrever;
- reler o arquivo que acabou de editar;
- verificar uma etapa intermediária antes de assumir que a próxima ação está correta.
A xAI também relata tentativas iniciais mais fortes em projetos interativos e visuais, como dashboards, pequenos aplicativos e interfaces.
Se a abordagem de treinamento do Grok 4.5 lhe interessou, veja a análise sobre o que o treinamento com sessões do Cursor significou para desenvolvedores.
Os benchmarks: quais deltas importam
Números divulgados por fornecedores devem ser analisados com cautela. Ainda assim, os deltas entre o Grok 4.5 e o 4.6 são grandes o bastante para merecer atenção.
Os três pontos mais relevantes são:
- A lacuna em agentes diminuiu. O salto de 10,4 pontos no APEX-Agents move o Grok de “claramente atrás” para 1,7 ponto do Fable 5 Max e ligeiramente à frente do GPT-5.6 Sol Max, com 56,7%.
- A codificação em escala de repositório melhorou mais. O ganho de quase 12 pontos no DeepSWE reduz a diferença em mudanças multi-arquivo, embora o Sol Max ainda lidere esse benchmark com margem ampla.
- Métricas independentes apoiam a eficiência. A Artificial Analysis mediu custo médio de US$ 0,84 por tarefa em avaliações agênticas, o menor entre modelos de fronteira, além de Elo 1753 no GDPval-AA v2 para trabalho de conhecimento profissional.
Para interpretar os números e suas limitações, consulte a análise dos benchmarks do Grok 4.5.
Preços: a principal proposta de valor
O Grok 4.6 manteve os preços do Grok 4.5: US$ 2 por milhão de tokens de entrada e US$ 6 por milhão de tokens de saída.
| Modelo | Preço de saída / 1M tokens |
|---|---|
| Grok 4.6 | US$ 6 |
| Claude Opus 4.8 | US$ 25 |
| GPT-5.6 Sol | US$ 30 |
Isso representa uma diferença de 5x no preço de saída em relação ao GPT-5.6 Sol para um modelo que empata com ele no índice composto de inteligência.
Para workloads agênticos, avalie custo por tarefa, não apenas custo por token. Uma execução que exige correção, revisão humana ou múltiplas tentativas pode custar mais do que uma chamada inicialmente mais cara. Nesse ponto, o dado independente de custo médio de US$ 0,84 por tarefa sugere que a eficiência não é apenas preço de tabela.
A variante mais rápida custa 2x — US$ 4 por milhão de tokens de entrada e US$ 12 por milhão de saída — e é destinada a experiências interativas sensíveis à latência. Até 19 de agosto, usuários do Grok Build e Cursor recebem o dobro de uso incluído.
Onde você pode usar o Grok 4.6
Você pode testar o Grok 4.6 nos seguintes canais:
- API da xAI: via console.x.ai, com compatibilidade com OpenAI. O guia da API do Grok 4.5 se aplica diretamente; altere apenas o nome do modelo.
- Cursor: disponível como opção de modelo.
- Grok Build: o workspace agêntico da xAI, com bônus de uso 2x durante a semana de lançamento.
-
OpenRouter, Vercel e Cloudflare: opções para equipes que roteiam vários modelos por um único gateway. No OpenRouter, o identificador listado é
x-ai/grok-4.6.
Não há um lançamento separado para consumidores: este é um lançamento focado em desenvolvedores. A forma mais rápida de avaliá-lo é pela API ou por um IDE que já ofereça suporte.
Como testar a API na prática
Como a API é compatível com OpenAI, você pode iniciar uma avaliação apontando seu cliente para:
https://api.x.ai/v1
Exemplo de chamada no formato compatível com OpenAI:
curl https://api.x.ai/v1/chat/completions \
-H "Authorization: Bearer $XAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "SEU_MODELO_GROK_4_6",
"messages": [
{
"role": "user",
"content": "Explique a estratégia de teste para esta alteração e proponha os próximos passos."
}
]
}'
Para uma avaliação útil, não use apenas prompts genéricos. Monte uma suíte com cenários próximos da sua produção:
- Mudanças multi-arquivo: forneça contexto de arquivos relacionados e peça um plano de alteração.
- Correção de bugs: inclua reprodução, logs e testes existentes.
- Chamadas de ferramentas: valide se o payload gerado tem o schema esperado.
- Fluxos longos: teste tarefas que exigem planejamento, implementação, revisão e validação.
- Trabalho visual ou de UI: compare a qualidade da primeira versão gerada e a quantidade de iterações necessárias.
Registre, para cada execução:
- qualidade da resposta;
- número de tentativas;
- tokens de entrada e saída;
- latência;
- erros de schema em chamadas de função;
- necessidade de revisão ou correção manual.
Limitações e questões em aberto
Uma avaliação da semana de lançamento precisa considerar as ressalvas:
- Benchmarks são majoritariamente reportados pelo fornecedor. A Artificial Analysis publicou pontuações independentes que geralmente concordam, mas os números específicos de codificação — DeepSWE, FrontierCode e CursorBench — vêm da tabela de lançamento da xAI. Os números do Grok 4.5 se sustentaram apenas parcialmente em testes independentes; espere alguma regressão à média também aqui.
- A janela de contexto é a menor entre os modelos de fronteira citados. Os 500K tokens cobrem a maioria das cargas reais, mas GPT-5.6 Sol oferece 1,05M e Claude Fable 5 oferece 1M. Para monorepos completos ou conjuntos grandes de documentos em uma chamada, essa diferença é material.
- Sol ainda lidera nos cenários mais difíceis. O déficit de 7 pontos no DeepSWE indica que o trabalho totalmente autônomo em grandes bases de código existentes permanece mais forte no GPT-5.6 Sol Max.
- A maturidade do ecossistema está atrasada. Processamento em lote, camadas de cache de prompt e controles de uso na xAI são mais recentes que os equivalentes da OpenAI e Anthropic. A compatibilidade com OpenAI resolve grande parte da integração, mas não tudo.
Esses pontos não desqualificam o Grok 4.6. Eles ajudam a definir o posicionamento do modelo: uma opção séria de preço-desempenho para avaliar, não um padrão para adotar apenas por reputação.
O que isso significa para desenvolvedores de API
A leitura estratégica é simples: a fronteira agora tem um concorrente real em preço.
Antes deste lançamento, igualar uma saída de nível GPT-5.6 Sol significava pagar US$ 25 a US$ 30 por milhão de tokens de saída. O Grok 4.6 oferece essa faixa de desempenho por US$ 6. Em ciclos agênticos, essa diferença aparece rapidamente: um agente que faz 40 chamadas de modelo por tarefa sente imediatamente o impacto de uma diferença de 5x no preço de saída.
A compatibilidade com OpenAI reduz o custo de avaliação. Em vez de planejar um sprint de integração, você pode:
- apontar seu cliente para
https://api.x.ai/v1; - manter os mesmos cenários de teste usados com outros provedores;
- executar sua carga de trabalho real;
- comparar qualidade, custo, latência e taxa de falha;
- decidir por workload, não por benchmark isolado.
Você pode estruturar essa comparação no Apidog, mantendo requisições para GPT-5.6, Claude e Grok 4.6 lado a lado no mesmo projeto. Use ambientes separados por provedor e adicione asserções para verificar:
- estrutura e qualidade da saída;
- consumo de tokens;
- latência;
- campos obrigatórios em respostas;
- payloads de chamadas de ferramentas.
O foco do Grok 4.6 em agentes também aumenta a importância de validar chamadas de função. Se sua integração usa ferramentas, não teste apenas o texto gerado: teste os payloads, schemas e argumentos que o modelo produz.
FAQ
O que é o Grok 4.6 em uma frase?
É o modelo de fronteira da xAI de agosto de 2026, ajustado para agentes de longa duração e codificação, com janela de contexto de 500K e benchmarks de nível de fronteira a aproximadamente um quinto do preço de saída dos concorrentes.O Grok 4.6 é melhor que o GPT-5.6?
Eles empatam no Índice de Inteligência da Artificial Analysis, com 61 pontos. O GPT-5.6 Sol Max lidera em codificação em escala de repositório no DeepSWE; o Grok 4.6 melhora no APEX-Agents e custa cerca de 5x menos por token de saída.Qual é a diferença entre Grok 4.5 e 4.6?
O preço e a API permanecem os mesmos, mas o 4.6 melhora significativamente em benchmarks: +11,9 pontos no DeepSWE, +10,4 no APEX-Agents e uma nova tendência de auto-verificação durante tarefas longas.Posso experimentar o Grok 4.6 gratuitamente?
Grok Build e Cursor incluem 2x o uso durante a semana de lançamento. Os métodos do guia para usar o Grok 4.5 gratuitamente se aplicam amplamente ao 4.6.

Top comments (0)