Codex Astra, en su configuración de mayor esfuerzo (xhigh), jugó 18 partidas completas de StarCraft: Brood War contra otros modelos de lenguaje y no perdió ninguna. Es el resultado más contundente de Brood War Bench, un nuevo benchmark que mide qué tan bien juegan un videojuego de estrategia en tiempo real los agentes de IA más recientes.
El experimento enfrentó a nueve familias de modelos (entre ellas Claude Fable, Claude Opus 5, Grok 4.6 y varias variantes de Codex) en partidas completas del clásico de Blizzard de 1998. El resultado es claro: incluso el modelo que ganó todo sigue jugando a nivel principiante.
TL;DR
- Codex Astra (xhigh) ganó sus 18 partidas en Brood War Bench: 100% de victorias a $10,54 por juego.- Claude Fable terminó tercero con 15 victorias y 3 derrotas, la única IA que armó un árbol tecnológico completo.- Grok 4.6 (xhigh) generó 11.138 tokens de razonamiento en G043 sin fabricar una unidad de combate.- Solo 0,3 acciones por minuto: así de poco jugó Claude Haiku, con 0 victorias en 16 partidas.- El benchmark hace jugar a agentes de IA sobre una versión operable de StarCraft: Brood War, de 1998.- Ningún modelo superó el nivel principiante: un humano con la estrategia photon rush les ganaría a todos.- Los subagentes de Codex para economía y ejército no se coordinan: atacan unidad por unidad.- En la partida G009, Codex 5.6 Terra evacuó su último Comando Central y resistió seis minutos más tras perder su base.
Qué pasó en Brood War Bench
El proyecto nació de una idea simple. Su creador construyó una versión de Brood War que solo se puede jugar a través de agentes de IA, para probarla con amigos que apenas habían tocado StarCraft un par de veces. Les fue sorprendentemente bien, y cuando les preguntó por qué, la respuesta fue que casi no habían hecho nada: le pidieron a su agente que atacara, y este construyó un pequeño ejército y ejecutó el ataque completo por su cuenta. Esa anécdota disparó la pregunta central del proyecto: ¿hasta dónde puede llegar un agente de IA jugando Brood War completamente solo?
Brood War Bench responde con un leaderboard que enfrenta a distintos modelos y niveles de esfuerzo de razonamiento (low, medium, xhigh) en partidas completas, midiendo victorias, derrotas, acciones por minuto (APM) y costo en dólares por partida. Codex Astra en xhigh terminó primero con 18 victorias y 0 derrotas (100,0% de win rate) a un costo de $10,54 por partida. Detrás quedaron Codex Astra en medium (16-2, 88,9%) y Claude Fable (15-3, 83,3%), el modelo que más se acercó a jugar de forma normal.
Contexto e historia
StarCraft: Brood War es la expansión de 1998 del StarCraft original de Blizzard, y sigue siendo, casi tres décadas después, uno de los juegos de estrategia en tiempo real más exigentes que existen: exige gestionar economía, producción y combate en simultáneo, a menudo con cientos de acciones por minuto en la escena competitiva humana. No es casualidad que la comunidad de investigación en IA lo haya usado como referencia durante años, desde los torneos académicos con bots programados a mano hasta los sistemas de aprendizaje por refuerzo entrenados para StarCraft II.
Brood War Bench toma un enfoque distinto: en lugar de entrenar un modelo específico para el juego, usa modelos de lenguaje de propósito general (los mismos que se usan para programar o responder preguntas) y los conecta a la partida como agentes que observan el estado del juego y emiten comandos. No hay entrenamiento previo sobre Brood War: cada modelo tiene que razonar la estrategia desde cero, partida tras partida.
Detalles técnicos y rendimiento
La tabla siguiente resume el leaderboard completo en su tramo superior, ordenado por victorias:
Modelo (esfuerzo)RécordWin rateCosto/partidaAPMCodex Astra / xhigh18-0100,0%$10,5412,6Codex Astra / medium16-288,9%$15,1117,2Claude Fable15-383,3%$12,2412,6Codex Astra / low14-477,8%$21,0725,7Codex 5.6 Sol / medium13-572,2%$5,1210,1
⚠️ Ojo: más esfuerzo de razonamiento no siempre sale más barato ni rinde mejor. Codex Astra en low cuesta $21,07 por partida (más caro que en medium, $15,11) y gana menos (77,8% contra 88,9%): pensar más lento no compensa pensar peor.
Los patrones de juego revelan por qué. Codex encontró más éxito en la disrupción que en la macroeconomía: en las partidas con Protoss, mandaba un Probe cruzando el mapa para atacar trabajadores o edificios, algo que funcionaba porque los agentes rivales gastaban decenas de segundos pensando qué hacer con esa sola unidad en vez de seguir jugando. La misma familia de modelos era, en cambio, mucho más débil sosteniendo producción: retrasaba la tecnología, mandaba una o dos unidades básicas goteando hacia bases defendidas y lanzaba a sus obreros a última defensa.
Parte del problema es arquitectónico. Codex tendía a crear subagentes separados para manejar economía, producción de ejército y control de ejército, que apenas se comunicaban entre sí. El subagente de producción mandaba cada unidad nueva directo al ataque sin esperar a que el ejército alcanzara una masa crítica, uno de los errores más típicos de un jugador principiante.
Codex Astra jugó 18 partidas en Brood War Bench sin perder ninguna.
El siguiente diagrama ilustra el problema de coordinación observado en los subagentes de Codex:
flowchart TD
A["Agente principal de Codex"] --> B["Subagente de economía"]
A --> C["Subagente de producción"]
A --> D["Subagente de control de ejército"]
C --> E["Nueva unidad lista"]
E --> F["Ataque inmediato, unidad por unidad"]
D -.-> F
subgraph "Sin comunicación entre subagentes"
C
D
end
Grok 4.6 mostró el problema opuesto: pasaba el juego pensando en vez de actuando. En la partida G043, la corrida en modo xhigh generó 11.138 tokens de razonamiento pero emitió solo seis lotes de comandos en 43 minutos, y nunca llegó a fabricar una sola unidad de combate. En G003, Grok en xhigh construyó tres Marines y jamás cruzó el mapa hasta la base enemiga. En G002, Grok en medium hizo dos Zealots y tampoco llegó a cruzar. No parecen malas estrategias. Parecen fallas para mantener el ciclo de observar y actuar.
En la partida G043, Grok 4.6 emitió apenas seis lotes de comandos en 43 minutos.
Claude Fable fue, según el propio informe, el modelo por el que vale la pena hacer barra: en vez de detenerse en la primera unidad disponible, intentaba construir economía y subir en el árbol tecnológico. En la partida G007 llegó a un Lair, una Spire y produjo Mutalisks, y ganó. En G027 sumó una Robotics Facility, una Citadel of Adun, un Observatory y un Templar Archives antes de ganar. La ambición no siempre alcanzó: en G036, Fable llegó a un Factory y una Academy, pero Claude Opus 5 lo arrasó antes de que pudiera capitalizarlo.
Los números agregados a los 15 minutos de juego confirman la diferencia de enfoque. Codex Astra promedió 14,7 trabajadores vivos, 8,3 unidades de ejército y 6,2 estructuras; Claude Fable, 16,7 trabajadores, 7,6 unidades de ejército y 7,4 estructuras; Grok 4.6, apenas 7,4 trabajadores, 2 unidades de ejército y 4,5 estructuras. En investigación tecnológica completada, Codex Astra llegó a 0,3 niveles, Fable a 0,2 y Grok se quedó en 0.
Cómo probarlo
El informe completo, con filtros interactivos por modelo, esfuerzo, raza y minuto de partida, está disponible en bw.swerdlow.dev/report. Ahí se puede comparar hasta cinco modelos a la vez y ver la evolución de trabajadores, ejército, estructuras y minerales acumulados minuto a minuto.
Si querés experimentar con la misma idea que usa Brood War Bench (un modelo de lenguaje que observa un estado de juego y devuelve comandos), el patrón base es sencillo de reproducir con cualquier API de LLM con soporte de herramientas (tool use). Instalá el SDK en cualquier sistema operativo:
# Windows (PowerShell), macOS y Linux: mismo comando
pip install anthropic
Con eso alcanza para armar un bucle mínimo que reciba el estado del juego como texto y devuelva una acción:
import anthropic
client = anthropic.Anthropic()
def turno_agente(estado_juego):
respuesta = client.messages.create(
model="claude-sonnet-5",
max_tokens=512,
tools=[{
"name": "ejecutar_comando",
"description": "Ejecuta un comando de juego (construir, atacar, mover)",
"input_schema": {
"type": "object",
"properties": {
"accion": {"type": "string"},
"objetivo": {"type": "string"}
},
"required": ["accion"]
}
}],
messages=[{"role": "user", "content": estado_juego}]
)
return respuesta.content
Ese bucle (leer estado, decidir acción, ejecutar, repetir) es exactamente lo que separó a Codex Astra de Grok 4.6 en Brood War Bench: no la inteligencia del modelo en abstracto, sino cuántas veces por minuto completa el ciclo sin quedarse atascado razonando.
💡 Tip: si vas a medir tu propio agente, contá la relación entre tokens de razonamiento y comandos emitidos por minuto: es la métrica que expuso la parálisis de Grok 4.6 en Brood War Bench.
Impacto y análisis
El resultado más importante del benchmark no es que Codex Astra ganó todas sus partidas. Es que ninguno de los modelos, ni siquiera el ganador, jugó por encima del nivel de un principiante. Según el propio informe, un jugador humano ejecutando un photon rush (una apertura agresiva y muy conocida en la comunidad de StarCraft) le ganaría a cualquiera de los 19 sistemas evaluados en la tabla.
💭 Clave: el patrón se repite en casi todos los benchmarks de agentes largos: el cuello de botella no es cuánto sabe el modelo, sino si logra sostener el ciclo de observar, decidir y actuar sin trabarse pensando.
Eso matiza cualquier lectura de que la IA ya sabe jugar videojuegos de estrategia sola. Lo que muestra Brood War Bench es más específico: los modelos de lenguaje generalistas pueden ejecutar una secuencia de acciones razonable (construir, producir, atacar) pero fallan en sostener un plan durante los 15 o 20 minutos que dura una partida corta, coordinar múltiples focos de atención a la vez, o adaptarse cuando el rival cambia de estrategia.
El costo también importa para cualquiera que quiera reproducir este tipo de evaluación a escala. Los $21,07 por partida de Codex Astra en modo low, comparados con los $0,16 de Codex 5.6 Luna en xhigh, muestran una diferencia de más de 100 veces en gasto por partida entre configuraciones del mismo tipo de modelo, sin que el más caro gane siempre. Es la clase de dato que cualquier equipo evaluando agentes de IA para tareas largas debería mirar antes de asumir que más esfuerzo es sinónimo de mejor resultado.
La limitación más honesta del propio proyecto es el tamaño de la muestra: cada configuración jugó apenas entre 16 y 18 partidas, un volumen bajo para sacar conclusiones estadísticas firmes sobre qué modelo es mejor en un sentido riguroso. Sirve para detectar patrones groseros (Grok no completa el ciclo de acción, Codex encuentra cheese, Fable intenta jugar de verdad) pero no para rankear con precisión a modelos que quedan cerca entre sí.
Qué sigue
El creador del proyecto dijo que Brood War Bench está lejos de agotarse: hay mucho más que los agentes pueden aprender a hacer, y mucho más que el propio benchmark puede pedirles. Las próximas iteraciones previsibles apuntan a exigir estrategias más complejas, defensas concretas contra ataques simples y partidas más largas donde la planificación de mediano plazo pese más que la reacción inmediata.
📖 Resumen en Telegram: Ver resumen
Probalo vos: abrí el leaderboard interactivo en bw.swerdlow.dev/report y filtrá por tu modelo favorito para ver cómo se desarrolló su partida minuto a minuto.
Preguntas frecuentes
¿Qué es Brood War Bench?
Es un benchmark que hace jugar partidas completas de StarCraft: Brood War a distintos modelos de lenguaje conectados como agentes, y publica un leaderboard con victorias, derrotas, APM y costo por partida.
¿Qué modelo ganó más partidas?
Codex Astra en modo de esfuerzo xhigh, con 18 victorias y 0 derrotas (100,0% de win rate) sobre las 18 partidas jugadas.
¿Por qué Grok 4.6 tuvo tan mal desempeño?
Porque pasaba demasiado tiempo razonando entre acciones. En la partida G043 generó 11.138 tokens de razonamiento pero emitió solo seis lotes de comandos en 43 minutos, sin fabricar ninguna unidad de combate.
¿Algún modelo jugó como un jugador experto?
No. Según el propio informe, ninguno de los 19 sistemas evaluados superó el nivel de un principiante: un humano ejecutando una apertura agresiva conocida como photon rush le ganaría a cualquiera de ellos.
¿Qué significa APM en este contexto?
Acciones por minuto: cuántos comandos (construir, mover, atacar) emite el agente en promedio durante la partida. Un APM muy bajo, como el 0,3 de Claude Haiku, indica que el agente casi no actuó.
¿Cuánto cuesta correr una partida de este benchmark?
Varía mucho según el modelo y el nivel de esfuerzo: desde $0,16 por partida (Codex 5.6 Luna en xhigh) hasta $21,07 (Codex Astra en low).
Referencias
- Brood War Bench, informe completo: leaderboard interactivo, gráficos de progreso y las partidas analizadas en este artículo.- StarCraft: Brood War en Wikipedia: contexto histórico de la expansión de 1998 de Blizzard.- Documentación oficial de Anthropic: referencia de los modelos Claude usados en el benchmark.- Sitio oficial de OpenAI: desarrollador de la familia de modelos Codex evaluada en el informe.
📱 ¿Te gusta este contenido? Únete a nuestro canal de Telegram @programacion donde publicamos a diario lo más relevante de tecnología, IA y desarrollo. Resúmenes rápidos, contenido fresco todos los días.
Top comments (0)