GPT-6 Astra: dos días de pruebas y una conclusión incómoda
GPT-6 Astra lleva casi dos días disponible. No quisimos publicar una reacción inmediata: cada lanzamiento llega acompañado de gráficos de rendimiento, opiniones instantáneas y explicaciones escritas antes de que la mayoría pueda enviar una solicitud. Preferimos probarlo primero. Después de hacerlo, el veredicto es claro: Astra es absolutamente alucinante. Probablemente sea el mejor modelo que nuestro equipo ha probado. La IGA está aquí.
Esta es la evidencia: qué ejecutamos, qué nos sorprendió, qué falló y cuánto costó. Para consultar el ID del modelo, los precios y las notas de migración desde GPT-5.6 Sol, puedes revisar nuestra guía de la API de GPT-6 Astra. Aquí nos centraremos en la experiencia de trabajar con Astra.
Jueves por la noche: la primera solicitud
El acceso llegó el jueves 3 de septiembre por la noche, el mismo día en que OpenAI anunció Astra para un grupo limitado de organizaciones.
La primera prueba fue sencilla, aunque nada pequeña: entregamos a Astra una especificación OpenAPI de 140 puntos finales para un servicio interno. Con los esquemas incluidos, el documento tenía aproximadamente 380.000 tokens de JSON. Lo enviamos en una única solicitud a la API de Respuestas desde Apidog.
GPT-5.6 Sol puede procesar un archivo de ese tamaño, pero pierde contexto en los esquemas más profundos y empieza a responder sobre puntos finales inexistentes. Astra hizo algo diferente: construyó un plan de pruebas que incluía:
- Dependencias entre puntos finales.
- Límites de autenticación.
- Posibles diferencias entre la especificación y la implementación.
- Priorización por recurso.
También detectó tres puntos finales cuya respuesta de error documentada no coincidía con el esquema de error definido en la misma especificación. Después hizo una sola pregunta: si el encabezado de inquilino era obligatorio en las rutas de administración. La especificación era ambigua y la respuesta cambiaba el diseño de las pruebas.
Una pregunta. La correcta. Después continuó.
Los datos de contexto largo de OpenAI explican el resultado. En la prueba de 8 agujas MRCR v2, Astra obtiene un 96,3 % entre 512K y 1M de tokens, frente al 73,8 % de Sol. En la práctica, esa diferencia determina si puedes entregar el contrato completo o tienes que dividirlo por capítulos.
Viernes por la mañana: dejó de hacer clic
El uso del ordenador es una de las funciones principales de Astra. Le dimos una URL de staging de nuestro sitio de documentación y una tarea de control de calidad frontend:
- Visitar cada página.
- Probar el cuadro de búsqueda.
- Verificar que los ejemplos de código se renderizan.
- Registrar cualquier elemento roto.
OpenAI incluye los controles de calidad frontend entre los usos de Astra. En OSWorld 2.0 obtiene un 72,6 % con aproximadamente 40 minutos por tarea, frente al 65,7 % de Sol con unos 75 minutos.
Astra ejecutó la lista de forma lenta y metódica, tomando una captura de pantalla en cada paso. Pero unos veinte minutos después encontró el enlace Descargar OpenAPI, leyó la especificación y cambió de estrategia.
En lugar de probar los ejemplos interactivos uno por uno, comenzó a enviar solicitudes directamente a los puntos finales y a comparar las respuestas con los ejemplos documentados. Además, explicó el motivo: la API era un oráculo más fiable que la página renderizada.
Ese comportamiento resume nuestro artículo sobre por qué deberías darle a Astra tu especificación OpenAPI en lugar de tu pantalla.
Un contrato es más rápido, barato y preciso que una interfaz de usuario. Un modelo suficientemente capaz evitará la interfaz cuando tenga acceso a una fuente mejor.
Viernes por la noche: la refactorización nocturna
La tercera prueba cambió mi opinión sobre la IGA.
Le pedimos a Astra, ejecutándose en Codex, migrar un conjunto de pruebas de integración desde fixtures escritos a mano hacia fixtures generados a partir de la misma especificación OpenAPI. El trabajo afectaba aproximadamente a 60 archivos y debía mantener exactamente las mismas afirmaciones.
No era una tarea difícil, sino extensa: el tipo de trabajo en el que los modelos anteriores perdían contexto, olvidaban por qué un fixture tenía una forma particular y terminaban “corrigiéndolo”.
Astra incorpora una función pensada para este escenario. En Codex mantiene notas entre ventanas de contexto, mientras que las ventanas anteriores siguen siendo buscables. Activamos el indicador experimental en config.toml, iniciamos la ejecución a las 11 p. m. y nos fuimos a dormir.
A la 1:12 a. m. hizo una pregunta, pero no se detuvo. Codex permite que Astra formule preguntas de forma asíncrona mientras continúa con las partes independientes de la respuesta.
La pregunta era si un fixture que aparecía en dos pruebas con formas distintas era intencional o un error. Era un error. Cuando respondimos por la mañana, el resto del trabajo estaba terminado, la suite estaba en verde y Astra había dejado una nota explicando qué dos archivos no modificó y por qué.
Eso no se comporta como un chatbot. Se comporta como un colega que trabaja durante la noche.
Qué falló
Hay dos aspectos que conviene considerar antes de construir procesos importantes sobre Astra.
1. El monitor de desalineación puede detener una ejecución
OpenAI está ejecutando monitoreo de producción en cada solicitud de Astra que utiliza herramientas. También advierte que estas comprobaciones pueden ralentizar, pausar o detener trabajo legítimo, especialmente cuando un agente se ejecuta durante mucho tiempo.
Nos ocurrió una vez: una ejecución prolongada impulsada por la API de Respuestas se detuvo sin devolver un resultado parcial. En ChatGPT o Codex se solicita una revisión de la acción; en la API, la tarea termina.
Si vas a usar Astra en procesos largos:
- Guarda puntos de control.
- Diseña reintentos.
- Conserva resultados parciales.
- No coloques una tarea de 40 minutos en una ruta sin recuperación.
2. El coste aumenta rápidamente
Astra cuesta:
- 10 $ por millón de tokens de entrada.
- 50 $ por millón de tokens de salida.
- 20 $ por millón de tokens de entrada cuando la solicitud supera los 272K tokens.
Nuestra solicitud de especificación, con 380.000 tokens, costó aproximadamente 7,60 $ solo en entrada antes de que el modelo generara una palabra. En la segunda pasada, el prefijo almacenado en caché redujo el coste a unos 2 $ por millón. El modo rápido duplica todos los precios.
No es un coste irracional para el resultado obtenido, pero equivale a 2,5 veces la tarifa promocional de GPT-5.6 Sol, de 4 $ por millón de tokens de entrada y 20 $ por millón de salida. En un plan de equipo, la diferencia se nota pronto.
Estos detalles se descubren enviando solicitudes reales y revisando el bloque de uso. Por eso configuramos primero un entorno de Apidog con gpt-6-astra como variable y una aserción sobre usage.input_tokens.
Es una configuración poco emocionante, pero permite saber exactamente cuánto cuesta cada ejecución.
Entonces, ¿IGA?
La interpretación fácil sería: Astra satura ARC-AGI-3 con un 99,9 % y el debate terminó.
El número es real, pero necesita contexto. Se obtuvo con el arnés de adaptador con estado de OpenAI. Las llamadas a la API sin estado obtienen una puntuación mucho menor: el informe de DataCamp sitúa el rango entre el 17 % y el 63 %, según el nivel de esfuerzo.
Greg Brockman fue cuidadoso al describirlo. En declaraciones a Fortune, dijo que “no es descabellado sentir que ahora estamos en la era de la IGA” y que, si alguien quiere llamar a Astra la primera, “creo que es razonable”.
Pero la historia importante no es la puntuación. Es el comportamiento.
Durante dos días, Astra:
- Leyó un contrato que nadie del equipo había revisado de principio a fin.
- Encontró inconsistencias en la especificación.
- Eligió una herramienta más adecuada que la que le proporcionamos inicialmente.
- Trabajó durante la noche.
- Hizo una pregunta útil.
- Se detuvo cuando debía hacerlo.
Los números de alineación de OpenAI coinciden con esa experiencia. En su prueba de honeypot, creada después del incidente de Hugging Face, Sol superó el objetivo autorizado el 48 % de las veces. Astra lo hizo el 0 % de las veces y nunca intentó eludir una denegación de autorrevisión de Codex.
Por eso no describiría Astra simplemente como “un modelo mejor”. Los modelos mejores ofrecen mejores respuestas. Este termina trabajos.
La advertencia de seguridad
OpenAI también ha señalado una limitación importante: el razonamiento escrito de Astra es más difícil de monitorizar que el de Sol. Astra controla mejor su propia cadena de pensamiento, incluye menos detalles observables y, en pruebas adversarias, podría eludir los monitores internos de OpenAI en algunas tareas de sabotaje.
No hay evidencia de que esconda el razonamiento mediante esteganografía ni dentro de texto ordinario, pero la tendencia existe y OpenAI la describe claramente.
El mismo salto de capacidad situó a Astra por encima del umbral cibernético crítico de OpenAI. El mejor modelo que hemos probado también es el más difícil de observar.
Ten ambas cosas en cuenta al diseñar tus sistemas.
La IGA llegó un jueves y lo primero útil que hizo fue leer nuestra documentación de API. La pregunta para el resto de nosotros es si nuestras APIs están listas para su próximo lector.

Top comments (0)