DEV Community

Cover image for Grok 4.6: xAI iguala a GPT-5.6 Sol Max en Artificial Analysis
lu1tr0n
lu1tr0n

Posted on • Originally published at elsolitario.org

Grok 4.6: xAI iguala a GPT-5.6 Sol Max en Artificial Analysis

xAI liberó Grok 4.6 el 12 de agosto de 2026 y lo puso, por primera vez, al mismo nivel que GPT-5.6 Sol Max en el índice compuesto de Artificial Analysis: 61 puntos cada uno. El modelo llega apuntado a un problema muy concreto: sostener tareas agénticas largas, desde investigar un tema hasta construir una aplicación completa en varias iteraciones, sin perder el hilo.

Es la cuarta actualización de la familia Grok en menos de un año y la primera que xAI describe explícitamente como orientada a trabajo visual e interactivo más ambicioso, no solo a resolver problemas de código aislados.

TL;DR

  • xAI lanzó Grok 4.6 el 12 de agosto de 2026, sucesor directo de Grok 4.5.- Empata con GPT-5.6 Sol Max en el AA Intelligence Index: 61 puntos cada uno, por debajo de Fable 5 Max (62).- En CursorBench v3.2 anota 69,9%, frente al 66,7% de Grok 4.5 High.- En Terminal-Bench v3.0 saca apenas 26%, muy por debajo del 34,6% de GPT-5.6 Sol Max.- Precio: 2 USD por millón de tokens de entrada y 6 USD por millón de salida; la variante rápida cuesta el doble.- Disponible hoy en Cursor, Grok Build, la API de xAI, OpenRouter, Vercel y Cloudflare.- Primera semana con el doble de uso incluido en Grok Build y Cursor.- Entrenado con una etapa de SFT regenerada por Grok 4.5 sobre dominios STEM, ingeniería de software y trabajo de conocimiento.

Introducción a Grok 4.6

Grok 4.6 construye sobre Grok 4.5 con un enfoque particular en agentes de larga duración y trabajo interactivo y visual más ambicioso, según el anuncio oficial de xAI. La compañía lo describe como un modelo capaz de mantenerse en tareas de muchos pasos: investigar un tema, analizar información, trabajar sobre una base de código completa o convertir una idea en una aplicación funcional.

Para un desarrollador en Latinoamérica, la pregunta práctica no es si el modelo es inteligente en abstracto, sino si vale la pena migrar un flujo de trabajo agéntico (por ejemplo, un pipeline de revisión de código o un agente de investigación) de otro proveedor a Grok 4.6. Los números publicados por xAI, comparados contra rivales directos, dan una primera respuesta.
xAI apunta Grok 4.6 a tareas de muchos pasos, no a respuestas sueltas.

Qué pasó con Grok 4.6

El lanzamiento incluyó disponibilidad inmediata en Cursor y en Grok Build, la herramienta propia de xAI para construir aplicaciones con agentes. Durante la primera semana, xAI ofrece el doble de uso incluido en ambas plataformas para que los desarrolladores puedan probar el modelo sin agotar su cuota habitual.

El modelo también quedó disponible en la API de xAI y en plataformas asociadas como OpenRouter, Vercel y Cloudflare. El precio de lista es de 2 dólares por millón de tokens de entrada y 6 dólares por millón de tokens de salida; existe además una variante rápida que cuesta el doble por unidad de token.

En benchmarks, Grok 4.6 alcanza 61 puntos en el AA Intelligence Index, el mismo puntaje que GPT-5.6 Sol Max y apenas un punto por debajo de Fable 5 Max (62). El índice combina nueve benchmarks distintos, por lo que un empate en el total no implica un empate benchmark por benchmark, algo que se nota apenas se abre la tabla completa.

Contexto e historia de la familia Grok

Grok 4.5 salió meses antes con un AA Intelligence Index de 56, ocho puntos por debajo de la versión actual. La diferencia entre ambas versiones no viene de una arquitectura nueva sino de un entrenamiento distinto: xAI describe una etapa de entrenamiento suplementario más larga que la usada para Grok 4.5, con datos curados generados por modelo para razonamiento y conceptos técnicos avanzados, además de datos de ingeniería de alta calidad y un optimizador mejorado.

Esa base sirvió luego para regenerar las trayectorias de ajuste supervisado (SFT). xAI usó el propio Grok 4.5 para producir esas trayectorias a través de distintos niveles de esfuerzo de razonamiento, distintos harnesses de agente y distintos dominios (STEM, ingeniería de software, trabajo de conocimiento), filtrando con verificaciones basadas en modelo las trazas problemáticas antes de usarlas para entrenar.

El resultado se afinó después con aprendizaje reforzado (RL) sobre un rango amplio de tareas agénticas: trabajo de conocimiento, programación general y entornos específicos de dominio como optimización de kernels, desarrollo web y diseño asistido por computadora (CAD). Es la primera vez que xAI menciona explícitamente CAD como entorno de entrenamiento para un modelo Grok, lo que ayuda a explicar el salto en tareas de generación de interfaces y aplicaciones visuales de un solo intento.

Detalles técnicos y rendimiento de Grok 4.6

xAI publicó una tabla comparativa con nueve benchmarks. Estos son los resultados frente a Grok 4.5 High, GPT-5.6 Sol Max y Fable 5 Max:
BenchmarkGrok 4.6 HighGrok 4.5 HighGPT-5.6 Sol MaxFable 5 MaxAA Intelligence Index61566162GDPVal-AA v21753152617281741CursorBench v3.269,9%66,7%67,2%70,5%DeepSWE v1.165,9%54%73%70%FrontierCode v1.1 (Extended)61,3%56,6%60,6%63,6%APEX-Agents57,5%47,1%56,7%59,2%Terminal-Bench v3.026%15,7%34,6%34,1%APEX-SWE56,4%53,6%N/D58,8%AA-Briefcase1577131315021574
El patrón es consistente: Grok 4.6 mejora a Grok 4.5 en los nueve benchmarks, iguala o supera a GPT-5.6 Sol Max en la mitad de ellos, pero se queda claramente atrás en dos casos puntuales: DeepSWE v1.1 (65,9% contra 73% de GPT-5.6 Sol Max) y, sobre todo, Terminal-Bench v3.0, donde saca 26% frente al 34,6% del modelo de OpenAI y el 34,1% de Fable 5 Max.

⚠️ Ojo: Terminal-Bench v3.0 mide interacción directa con una terminal real. Si tu flujo de trabajo depende de que el agente ejecute comandos de shell de forma autónoma y confiable, Grok 4.6 hoy rinde por debajo de sus dos rivales directos en ese escenario específico.

Un detalle que xAI destaca en el anuncio: en trayectorias largas, el modelo empezó a mostrar más autoevaluación y verificación, revisando su propio trabajo antes de continuar al siguiente paso. Esto es coherente con el objetivo declarado del entrenamiento: RL sobre tareas agénticas donde el costo de un error se acumula a lo largo de muchos pasos, no en una sola respuesta.

flowchart TD
A["Idea del producto"] --> B["Grok 4.6 investiga el dominio"]
B --> C["Genera estructura y primera versión"]
C --> D["Autoevaluación: revisa su propio trabajo"]
D --> E{"¿Cumple el objetivo?"}
E -- "no" --> C
E -- "sí" --> F["Iteración con feedback del usuario"]
Enter fullscreen mode Exit fullscreen mode

Grok 4.6 gana en siete de nueve benchmarks frente a Grok 4.5.

Cómo empezar con Grok 4.6

Para probar Grok 4.6 hoy mismo hay dos caminos: la CLI de Grok Build o la API directa. La instalación de la CLI usa el mismo script en macOS y Linux; en Windows, la vía recomendada es correrlo dentro de WSL (Windows Subsystem for Linux), ya que xAI no publicó un instalador nativo para PowerShell en este lanzamiento.

# macOS y Linux (tambien dentro de WSL en Windows)
curl -fsSL https://x.ai/cli/install.sh | bash

# verificar que quedo instalado
grok --version
Enter fullscreen mode Exit fullscreen mode

Ese primer bloque solo confirma que el binario quedó en el PATH. El paso siguiente es generar una clave desde la consola de xAI y llamar al modelo directamente vía API, que es compatible con el formato de chat completions que ya usan la mayoría de los SDK:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["XAI_API_KEY"],
    base_url="https://api.x.ai/v1",
)

respuesta = client.chat.completions.create(
    model="grok-4.6",
    messages=[
        {"role": "system", "content": "Sos un agente que revisa pull requests de Python."},
        {"role": "user", "content": "Revisa este diff y senala bugs de concurrencia: "},
    ],
)

print(respuesta.model)
print(respuesta.choices[0].message.content)
Enter fullscreen mode Exit fullscreen mode

El campo respuesta.model devuelve el identificador exacto del modelo que respondió (por ejemplo grok-4.6). Es la forma más directa de confirmar que tu llamada realmente está usando la versión nueva y no cayó por defecto a Grok 4.5 en un router que no actualizaste.

💡 Tip: Si integraste Grok a través de OpenRouter, Vercel o Cloudflare, revisá el selector de modelo de cada plataforma: los tres agregaron a Grok 4.6 el mismo día del lanzamiento, pero algunos routers con alias genéricos como "grok-latest" pueden tardar en apuntar a la versión nueva.

Impacto y análisis

Lo más relevante del lanzamiento no es que Grok 4.6 gane en todo (no lo hace), sino que cierra la brecha que separaba a xAI del resto de los laboratorios de frontera en un terreno específico: agentes que sostienen contexto y ejecutan pasos durante minutos u horas, no segundos. El salto de 47,1% a 57,5% en APEX-Agents, frente al 56,7% de GPT-5.6 Sol Max, es el dato que más pesa para cualquiera que esté evaluando qué modelo poner detrás de un agente de producción.

Para el ecosistema de desarrollo en español, esto se traduce en una alternativa real a otros modelos de frontera dentro de herramientas como Cursor, sin tener que cambiar de flujo de trabajo: el mismo editor, el mismo protocolo de chat, un modelo distinto detrás. La disponibilidad simultánea en OpenRouter reduce además la fricción de probarlo desde cualquier stack existente sin renegociar contratos con xAI directamente.

La limitación honesta sigue siendo Terminal-Bench: un 26% deja a Grok 4.6 fuera de competencia frente a rivales que superan el 34% en la misma prueba. Si tu caso de uso es, por ejemplo, un agente de DevOps que ejecuta comandos de infraestructura de forma autónoma, conviene testear ese escenario puntual antes de migrar en producción, más allá de lo que diga el promedio del índice general.

Qué sigue para Grok 4.6

xAI no anunció fecha para una versión reducida o de menor costo de Grok 4.6, algo que sí hicieron rivales con variantes chicas de sus modelos de frontera. Con precios de 2 y 6 dólares por millón de tokens, Grok 4.6 queda en un rango similar al de GPT-5.6 Sol Max, lo que sugiere que la próxima disputa de precios se va a jugar en las variantes rápidas y en los descuentos por volumen de los partners (OpenRouter, Vercel, Cloudflare) más que en el modelo base.

La promoción de doble uso incluido en Cursor y Grok Build dura solo la primera semana, así que el margen para evaluar el modelo sin costo adicional en flujos reales es corto. Vale la pena aprovecharlo con un caso de uso concreto, un repositorio real y no una demo, antes de que termine.

📖 Resumen en Telegram: Ver resumen

Probalo vos: corré curl -fsSL https://x.ai/cli/install.sh | bash hoy mismo y apuntá tu primer agente de código a grok-4.6 antes de que termine la semana de uso doble en Cursor y Grok Build.

Preguntas frecuentes

¿Grok 4.6 reemplaza a Grok 4.5?

Sí, xAI lo presenta como sucesor directo. Grok 4.5 sigue disponible en algunas plataformas, pero el desarrollo activo de la compañía se concentra ahora en la línea 4.6.

¿Cuánto cuesta usar Grok 4.6 por API?

2 dólares por millón de tokens de entrada y 6 dólares por millón de tokens de salida en la variante estándar. La variante rápida cuesta el doble por token.

¿Grok 4.6 es mejor que GPT-5.6 Sol Max?

Depende del benchmark. Empatan en el AA Intelligence Index con 61 puntos cada uno, y Grok 4.6 gana en APEX-Agents y AA-Briefcase, pero GPT-5.6 Sol Max lo supera claramente en DeepSWE v1.1 y Terminal-Bench v3.0.

¿Puedo usar Grok 4.6 sin pasar por la API de xAI?

Sí. Está disponible desde el lanzamiento en OpenRouter, Vercel y Cloudflare, además de integrado nativamente en Cursor y Grok Build.

¿Qué significa que el modelo haga autoevaluación?

xAI reporta que, en tareas de muchos pasos, Grok 4.6 revisa su propio trabajo antes de continuar, un comportamiento que surge del entrenamiento con aprendizaje reforzado sobre tareas agénticas largas, no de una instrucción explícita del usuario.

¿Hace falta instalar algo para probarlo?

No necesariamente. Si ya usás Cursor, el modelo aparece directo en el selector. Para uso por línea de comandos, el instalador de Grok Build corre igual en macOS, Linux y dentro de WSL en Windows.

Referencias

  • Introducing Grok 4.6: anuncio oficial de xAI con benchmarks, precios y disponibilidad.- xAI API Docs: documentación oficial para integrar Grok 4.6 vía API.- OpenRouter: uno de los partners que sirve Grok 4.6 el mismo día del lanzamiento.- xAI (Wikipedia): contexto sobre la compañía detrás de la familia de modelos Grok.

📱 ¿Te gusta este contenido? Únete a nuestro canal de Telegram @programacion donde publicamos a diario lo más relevante de tecnología, IA y desarrollo. Resúmenes rápidos, contenido fresco todos los días.

Top comments (0)