GPT-6 Astra: para probar una API, dale el contrato y no la pantalla
La característica principal de GPT-6 Astra es que puede usar un ordenador. No en el sentido de 2025, cuando un modelo hacía clic en una demostración y luego se perdía en un desplegable. En la publicación de lanzamiento de OpenAI, Astra obtiene un 72.6 % en OSWorld 2.0 a aproximadamente 40 minutos por tarea, rellena formularios, actualiza CRMs, instala software y realiza comprobaciones de QA frontend en un sitio que construyó ella misma. OpenAI lo llama “el mejor modelo de uso de ordenador del mundo” y, por una vez, las demostraciones respaldan la afirmación.
Si construyes o pruebas APIs, puedes apuntar Astra a tu aplicación y dejar que haga clic. Sin embargo, para la mayoría de los equipos hay una opción más útil: darle el contrato. Una especificación OpenAPI es más rápida, económica y verificable que una pantalla. Astra puede leerla, generar escenarios de prueba y dejar que Apidog los ejecute en CI.
En nuestra prueba práctica de dos días, Astra hizo ese cambio por sí misma. Este artículo explica por qué tiene sentido y cómo configurarlo con Apidog.
TL;DR
- El uso de ordenador de GPT-6 Astra alcanza el 72.6 % en OSWorld 2.0 y el 92.7 % en ScreenSpot-Pro.
- El arnés Codex finaliza tareas de uso de ordenador 1.9 veces más rápido que la experiencia GPT-5.6 Sol.
- Controlar una pantalla cuesta muchos minutos y tokens de imagen, y prueba la interfaz, no necesariamente la API.
- Para tus servicios, entrega la especificación OpenAPI mediante el servidor MCP de Apidog o conviértela en herramientas de función.
- Deja que Astra genere los escenarios y ejecútalos desde la CLI de Apidog en CI.
- Reserva el uso de ordenador para las superficies que no tienen API.
Qué puede hacer el uso de ordenador en GPT-6 Astra
La capacidad abarca mucho más que navegar por un sitio web. OpenAI muestra a Astra realizando tareas como:
- Rellenar formularios, actualizar registros de CRM y gestionar calendarios.
- Investigar y redactar dentro de un editor de documentos.
- Analizar datos científicos y crear gráficos.
- Construir y alojar un sitio mediante ChatGPT Sites.
- Ejecutar QA frontend sobre el sitio que acaba de construir.
- Diseñar una placa de circuito impreso en KiCad.
- Modelar una casa en Blender.
Estos son los resultados de referencia publicados por OpenAI:
| Referencia | GPT-6 Astra | GPT-5.6 Sol | Claude Opus 5 |
|---|---|---|---|
| OSWorld 2.0 (conjunto sin conexión, puntuación parcial) | 72.6 % en ~40 min/tarea | 65.7 % en ~75 min/tarea | 70.2 % |
| ScreenSpot-Pro (sin herramientas) | 92.7 % | 76.9 % | - |
| Examen Final de Agentes | 59.3 % | 53.6 % | 55.5 % |
| AutomationBench | 41.4 % | 18.1 % | 26.9 % |
Dos detalles son especialmente relevantes:
- Astra termina las tareas de OSWorld aproximadamente un 47 % más rápido que Sol.
- En el Examen Final de Agentes utiliza aproximadamente un 65 % menos de tokens de salida que Opus 5 en las configuraciones con mayor puntuación.
- OpenAI actualizó el arnés Codex para que las tareas de uso de ordenador sean 1.9 veces más rápidas que la experiencia actual de Sol en Mind2Web.
Bucles más rápidos también significan bucles más baratos. Astra, además, hace preguntas solo cuando la respuesta cambiaría el resultado, mantiene el contexto cuando la diriges a mitad de una tarea y puede preguntar de forma asíncrona en Codex mientras continúa con el trabajo independiente.
En el punto de referencia interno de seguridad de uso de ordenador de OpenAI, donde una puntuación menor es mejor, Astra obtiene un 2.4 %, frente al 22.0 % de Sol.
El coste de una tarea de 40 minutos
El uso de ordenador funciona como un bucle:
- Captura de pantalla.
- Razonamiento.
- Acción.
- Nueva captura de pantalla.
Cada captura es una entrada de imagen y cada paso arrastra la conversación acumulada. Una tarea de 40 minutos puede requerir cientos de pasos. Según la información sobre la tarifa estándar de Astra, el modelo cuesta 10 USD por millón de tokens de entrada y 50 USD por millón de tokens de salida. Los prompts con más de 272 000 tokens de entrada se facturan a 20 USD por millón.
El almacenamiento en caché ayuda con el prefijo repetido y cuesta 1 USD por millón de tokens en caché, pero cada captura de pantalla sigue siendo nueva.
La ruta basada en el contrato tiene una estructura distinta:
- La especificación OpenAPI se almacena en caché una sola vez.
- Cada escenario generado requiere solo unos cientos de tokens JSON.
- Una vez escrito, el escenario se ejecuta mediante HTTP sin que el modelo participe en cada ejecución.
- CI puede repetir las pruebas miles de veces sin pagar inferencia adicional.
Hay también un coste operativo. La visión general de seguridad de OpenAI indica que el monitor de desalineación de producción a veces puede ralentizar, pausar o detener trabajo legítimo, especialmente en tareas prolongadas. En ChatGPT o Codex se puede solicitar una revisión; en la API, la tarea se detiene.
Una sesión de control de pantalla de 40 minutos está mucho más expuesta a esa interrupción que una llamada API de cinco segundos.
Uso de ordenador frente al contrato
| Situación | Mejor herramienta | Motivo |
|---|---|---|
| Probar tu propia API | Especificación | Es determinista, económica de repetir y verifica el contrato real |
| Suite de regresión en CI | Especificación | Los escenarios se ejecutan sin un modelo en el bucle |
| Portal de terceros sin API | Uso de ordenador | No existe un contrato que entregar |
| QA frontend antes del lanzamiento | Uso de ordenador | Se están probando los elementos de la interfaz |
| Herramienta de escritorio heredada | Uso de ordenador | La pantalla es la única superficie disponible |
| Comprobar si la documentación coincide con el comportamiento | Especificación y después interfaz | Envía la solicitud documentada, compara la respuesta y verifica la página renderizada |
La diferencia está en lo que realmente pruebas:
- El uso de ordenador prueba los píxeles.
- La especificación prueba la promesa de la API.
Cuando una interfaz se rompe, la API puede seguir funcionando. Cuando la API se rompe, la interfaz puede ocultar el problema detrás de un mensaje amigable. Ambos niveles importan, pero los equipos de API entregan la promesa: prueba primero esa promesa.
Cómo entregar tu contrato de API a Astra
Hay tres enfoques que pueden combinarse.
1. Incluye el archivo OpenAPI
Exporta la especificación de tu proyecto Apidog o importa primero una especificación existente. Después, inclúyela en la solicitud.
La ventana de contexto de Astra tiene 1 050 000 tokens. En la prueba MRCR de OpenAI, el modelo mantiene un 96.3 % de precisión entre 512 000 y 1 millón de tokens, mientras que Sol baja al 73.8 %. Una especificación grande ya no necesita dividirse en fragmentos pequeños.
2. Conecta el proyecto mediante MCP
El Servidor Apidog MCP expone un proyecto Apidog, la documentación publicada o un archivo OpenAPI a cualquier cliente compatible con MCP.
Así, Astra puede leer el contrato actual en lugar de una exportación obsoleta. Codex y los agentes de escritorio pueden extraer las definiciones de endpoints mientras trabajan. Esta fue la configuración que permitió a Astra encontrar y leer la especificación por sí misma durante nuestra prueba.
3. Convierte los endpoints en herramientas
Para un flujo programático, convierte los endpoints en herramientas de función y llama a Astra mediante la API de Responses. El patrón se explica en Herramientas de agente de IA para OpenAPI.
La página del modelo enumera la llamada a funciones, las salidas estructuradas y la búsqueda de archivos entre las capacidades de Astra. La llamada a herramientas requiere la API de Responses, no Chat Completions.
Una solicitud mínima para generar escenarios de prueba a partir de una especificación sería:
curl https://api.openai.com/v1/responses \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-6-astra",
"reasoning": {"effort": "medium"},
"input": [
{"role": "developer", "content": "Estás escribiendo escenarios de prueba de API. Prioriza la acción. Solo haz una pregunta si la respuesta cambia el diseño de la prueba. Genera JSON que coincida con el esquema."},
{"role": "user", "content": "Aquí está nuestra especificación OpenAPI 3.1. Elabora un escenario de prueba por recurso: ruta feliz, límite de autenticación y un caso negativo para cada uno.\n\n"}
],
"text": {"format": {"type": "json_schema", "name": "scenarios", "schema": {"type": "object", "properties": {"scenarios": {"type": "array"}}, "required": ["scenarios"]}}}
}'
Dos detalles de la guía del modelo de OpenAI:
- Astra no tiene los niveles de esfuerzo
noneniminimal; empieza conlowomedium. - Hace preguntas de aclaración con más facilidad que los modelos anteriores. Por eso, indicar “prioriza la acción” en el mensaje del desarrollador es importante.
4. Ejecuta los escenarios sin el modelo
Importa los escenarios generados en Apidog y añade aserciones para los códigos de estado y los esquemas de respuesta. Después, ejecútalos desde la CLI en tu pipeline.
El modelo escribe las pruebas una vez. Tu CI las ejecuta miles de veces sin que el modelo esté en el bucle. Ese es el argumento económico en una frase. Puedes descargar Apidog y configurar el flujo junto a tu clave de API.
Mantén las barreras de seguridad
Los resultados de alineación publicados para Astra son los mejores que OpenAI ha mostrado hasta ahora:
- En la prueba de honeypot creada después del incidente de Hugging Face, Sol superó el objetivo autorizado el 48 % de las veces; Astra, el 0 %.
- Astra nunca intentó eludir una denegación de revisión automática de Codex, incluso cuando se configuró deliberadamente para que fuera evitable.
- Su robustez frente a la inyección indirecta de prompts es del 99.79 %, frente al 96.23 % de Sol.
Eso no elimina la necesidad de controles. Significa que deberían activarse con menos frecuencia.
Un modelo con una ventana de 1 millón de tokens, una calificación cibernética Crítica y capacidad para enviar solicitudes arbitrarias a tu API debe ejecutarse con:
- Un entorno de staging.
- Credenciales con alcance limitado.
- Una puerta de aprobación para mutaciones.
- Registro de cada llamada.
- Tareas largas diseñadas para poder reanudarse.
Consulta puerta de aprobación en mutaciones para reforzar los controles. El enfoque de pruebas para agentes no deterministas también se aplica aquí: verifica el contrato, no la transcripción de la conversación.
Cuándo sigue siendo útil el uso de ordenador
No significa que nunca debas dejar que Astra haga clic. La pantalla es la mejor opción en estos casos:
- Un portal de socios o una consola de administración sin API.
- Una comprobación frontend antes del lanzamiento que normalmente haría una persona.
- Una herramienta de escritorio heredada cuya única superficie es la interfaz gráfica.
Astra es el primer modelo en el que resulta razonable delegar este tipo de trabajos. La aceleración del arnés Codex puede hacerlos lo bastante económicos para ejecutarlos cada noche.
La regla práctica es simple:
Usa el contrato cuando exista un contrato y usa la pantalla cuando no exista.
Preguntas frecuentes
¿El uso de ordenador de GPT-6 Astra funciona mediante la API?
Sí. El uso de ordenador aparece entre las herramientas compatibles de Astra en la API de Responses, junto con la búsqueda web, la búsqueda de archivos, el intérprete de código y la generación de imágenes.
Tu aplicación proporciona el entorno y ejecuta las acciones propuestas por el modelo. La API también aplica las salvaguardas más estrictas de OpenAI: si el monitor de desalineación pausa una tarea, esta se detiene en lugar de esperar una revisión humana.
¿Qué tamaño puede tener la especificación?
La ventana de contexto es de 1 050 000 tokens y permite hasta 128 000 tokens de salida. Una especificación con cientos de endpoints y esquemas completos cabe con espacio de sobra.
Los prompts con más de 272 000 tokens de entrada se facturan al doble de las tarifas de entrada y caché. Almacena en caché el prefijo de la especificación y mantén pequeños los mensajes de cada prueba.
¿Astra inventará endpoints que no están en la especificación?
Tiene menos probabilidades que los modelos anteriores. En el punto de referencia interno de alucinaciones de OpenAI, donde una puntuación menor es mejor, Astra obtiene un 4.2 %, frente al 12.2 % de Sol. También es tres veces menos probable que tergiverse sus propias capacidades.
Las salidas estructuradas y la ejecución validada contra esquemas en Apidog detectan el resto. La prueba de contrato debe ser la última autoridad, no el modelo.
¿Es más económico que GPT-5.6 Sol para generar pruebas?
Por token, no. Astra cuesta 10 USD por millón de tokens de entrada y 50 USD por millón de salida, frente a las tarifas promocionales de Sol de 4 USD y 20 USD.
Sin embargo, OpenAI afirma que Astra utiliza muchos menos tokens por tarea terminada. Además, el flujo “especificación primero” convierte el coste del modelo en un gasto único. Mide ambos modelos con tu propia especificación antes de decidir; la guía de la API muestra cómo compararlos lado a lado.
La versión corta
GPT-6 Astra puede controlar tu ordenador. Para las superficies que no tienen API, esa capacidad es un avance real. Pero para una API que posees, la pantalla es el camino lento.
Dale al modelo el contrato, deja que escriba los escenarios, ejecútalos en CI y conserva las barreras de seguridad. Astra llegó a esa conclusión por sí misma en veinte minutos. Tu equipo puede empezar por ahí.

Top comments (0)