DEV Community

Cover image for GPT-6 Astra : Préférez OpenAPI à l'accès direct à votre ordinateur
Antoine Laurent
Antoine Laurent

Posted on Originally published at apidog.com

GPT-6 Astra : Préférez OpenAPI à l'accès direct à votre ordinateur

GPT-6 Astra : donnez-lui le contrat API, pas seulement l’écran

La caractéristique principale de GPT-6 Astra est qu'il peut utiliser un ordinateur. Non pas au sens de 2025, où un modèle cliquait à travers une démo et se perdait ensuite dans un menu déroulant. Dans le billet de lancement d'OpenAI, Astra obtient un score de 72,6 % sur OSWorld 2.0 à environ 40 minutes par tâche, remplit des formulaires, met à jour des CRM, installe des logiciels et exécute des contrôles d'assurance qualité front-end sur un site qu'il a lui-même construit. OpenAI l'appelle « le meilleur modèle d'utilisation d'ordinateur au monde », et pour une fois, les démonstrations étayent cette affirmation.

Essayez Apidog dès aujourd’hui

Si vous construisez ou testez des API, cette capacité est tentante : dirigez Astra vers votre application et laissez-le cliquer. Pourtant, une spécification OpenAPI est une interface plus rapide, moins chère et plus vérifiable qu'un écran. Lors de notre test pratique de deux jours, Astra a lui-même choisi cette approche. Voici pourquoi, et comment la mettre en place avec Apidog.

GPT-6 Astra et les tests d’API avec une spécification OpenAPI

En bref

L'utilisation de l'ordinateur par GPT-6 Astra est bien réelle :

  • 72,6 % sur OSWorld 2.0 ;
  • 92,7 % sur ScreenSpot-Pro ;
  • un harnais Codex qui termine les tâches d'utilisation d'ordinateur 1,9 fois plus rapidement que l'expérience GPT-5.6 Sol.

Mais la commande par écran coûte des dizaines de minutes et de nombreux jetons d'image par tâche. Elle teste l'interface utilisateur, pas l'API.

Pour vos services :

  1. fournissez la spécification OpenAPI via le serveur Apidog MCP ou des outils de fonction ;
  2. laissez Astra écrire les scénarios de test ;
  3. exécutez-les avec l'interface CLI d'Apidog en CI ;
  4. réservez l'utilisation de l'ordinateur aux interfaces sans API.

Ce que l'utilisation d'ordinateur peut faire

Astra ne se limite pas à la navigation web. OpenAI cite notamment :

  • les formulaires en ligne, CRM et calendriers ;
  • la recherche et la rédaction dans un éditeur de documents ;
  • l'analyse de données scientifiques et la création de graphiques ;
  • la construction et l'hébergement d'un site avec ChatGPT Sites ;
  • l'assurance qualité front-end ;
  • la conception d'une carte de circuit imprimé dans KiCad ;
  • la modélisation d'une maison dans Blender.

Les chiffres ci-dessous proviennent du billet de lancement d'OpenAI :

Benchmark GPT-6 Astra GPT-5.6 Sol Claude Opus 5
OSWorld 2.0 (ensemble hors ligne, score partiel) 72,6 % à ~40 min/tâche 65,7 % à ~75 min/tâche 70,2 %
ScreenSpot-Pro (sans outils) 92,7 % 76,9 %
Examen final des agents 59,3 % 53,6 % 55,5 %
AutomationBench 41,4 % 18,1 % 26,9 %

Deux détails comptent davantage que les scores :

  • Astra termine les tâches OSWorld environ 47 % plus vite que Sol.
  • Lors du Dernier Examen des Agents, il utilise environ 65 % moins de jetons de sortie qu'Opus 5 avec les paramètres les plus performants.
  • Le harnais Codex rend les tâches d'utilisation d'ordinateur 1,9 fois plus rapides que l'expérience actuelle de Sol sur Mind2Web.

Des boucles plus rapides sont aussi des boucles moins chères.

Le comportement s'est amélioré : Astra pose des questions ciblées uniquement lorsqu'une réponse modifierait le résultat, reste orienté lorsqu'on le guide pendant la tâche et, dans Codex, peut poser des questions de manière asynchrone tout en poursuivant le travail indépendant de la réponse.

Sur le benchmark interne de sécurité d'utilisation d'ordinateur d'OpenAI, où le score le plus bas est préférable, Astra obtient 2,4 %, contre 22,0 % pour Sol.

Le coût d'une tâche de 40 minutes

L'utilisation de l'ordinateur suit une boucle répétitive :

  1. capture d'écran ;
  2. raisonnement ;
  3. action ;
  4. nouvelle capture d'écran.

Chaque capture est une entrée d'image. Chaque étape transporte l'historique de la conversation. Une tâche de 40 minutes peut donc comporter des centaines d'étapes.

Au tarif standard d'Astra, le coût est de 10 $ par million de jetons d'entrée et 50 $ par million de jetons de sortie. Au-delà de 272 000 jetons d'entrée, le tarif passe à 20 $ par million. La mise en cache aide pour le préfixe répété, à 1 $ par million de jetons mis en cache, mais les captures d'écran restent nouvelles à chaque étape.

La voie contractuelle est différente :

  • la spécification OpenAPI est un préfixe mis en cache une seule fois ;
  • chaque scénario généré représente quelques centaines de jetons JSON ;
  • une fois écrit, le scénario s'exécute via HTTP sans solliciter le modèle.

Le coût n'est pas uniquement financier. L'aperçu de sécurité d'OpenAI indique que le moniteur de désalignement de production peut parfois ralentir, suspendre ou arrêter un travail légitime, notamment lorsqu'un agent fonctionne pendant une période prolongée.

Une session de commande par écran de 40 minutes est donc plus exposée à une interruption qu'un appel API de cinq secondes. Dans l'API, une tâche arrêtée par le moniteur s'arrête réellement au lieu d'attendre une révision.

Utilisation de l'ordinateur ou contrat API ?

Situation Meilleur outil Pourquoi
Tester votre propre API La spécification Déterministe, peu coûteux à réexécuter et aligné sur le contrat réel
Suite de régression en CI La spécification Les scénarios s'exécutent sans modèle dans la boucle
Portail tiers sans API Utilisation de l'ordinateur Il n'y a pas de contrat à fournir
QA front-end avant la publication Utilisation de l'ordinateur C'est l'interface utilisateur qui est testée
Outil de bureau hérité Utilisation de l'ordinateur Seul un écran est disponible
Vérifier que la documentation correspond au comportement Spécification, puis interface utilisateur Envoyer la requête documentée, comparer la réponse, puis vérifier la page rendue

La distinction est simple : l'utilisation d'ordinateur teste les pixels, tandis que la spécification teste la promesse.

Lorsqu'un front-end tombe en panne, l'API est généralement toujours fonctionnelle. Lorsqu'une API tombe en panne, le front-end peut masquer le problème derrière une erreur conviviale. Les deux tests sont importants, mais une équipe API doit tester le contrat en premier.

Donner votre contrat API à Astra

Il existe trois façons de fournir une spécification à Astra. Elles peuvent être combinées.

1. Joindre le fichier OpenAPI

Exportez la spécification OpenAPI de votre projet Apidog, ou importez d'abord votre spécification existante dans Apidog, puis incluez-la dans la requête.

La fenêtre de contexte d'Astra contient 1 050 000 jetons. Le benchmark de récupération MRCR d'OpenAI indique une précision de 96,3 % entre 512 000 et 1 million de jetons, contre 73,8 % pour Sol. Même une grande spécification peut donc tenir dans une seule invite.

2. Connecter le projet via MCP

Le serveur Apidog MCP expose votre projet Apidog, votre documentation publiée ou un fichier OpenAPI à tout client compatible MCP.

Astra peut ainsi lire le contrat actuel plutôt qu'une exportation obsolète. Codex et les agents de bureau peuvent récupérer les définitions des points de terminaison au moment où ils en ont besoin. C'est cette configuration qui a permis à Astra de trouver et de lire la spécification de lui-même lors de notre test.

3. Transformer la spécification en outils

Pour une utilisation programmatique, convertissez les points de terminaison en outils de fonction et appelez Astra via l'API Responses. La méthode est détaillée dans OpenAPI aux outils d'agents IA.

La page du modèle Astra liste l'appel de fonction, les sorties structurées et la recherche de fichiers parmi ses fonctionnalités. L'appel d'outils nécessite l'API Responses, et non les complétions de chat.

Une requête minimale pour générer des scénarios à partir d'une spécification ressemble à ceci :

curl https://api.openai.com/v1/responses \
  -H "Authorization: Bearer $OPENAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-6-astra",
    "reasoning": {"effort": "medium"},
    "input": [
      {"role": "developer", "content": "You are writing API test scenarios. Bias towards action. Only ask a question if the answer changes the test design. Output JSON matching the schema."},
      {"role": "user", "content": "Here is our OpenAPI 3.1 spec. Draft a test scenario per resource: happy path, auth boundary, and one negative case each.\n\n<paste spec>"}
    ],
    "text": {"format": {"type": "json_schema", "name": "scenarios", "schema": {"type": "object", "properties": {"scenarios": {"type": "array"}}, "required": ["scenarios"]}}}
  }'
Enter fullscreen mode Exit fullscreen mode

Deux points du guide du modèle OpenAI sont importants :

  • Astra ne propose ni effort none ni effort minimal. Commencez par low ou medium.
  • Astra demande plus facilement des clarifications que les modèles précédents. L'instruction Bias towards action a donc un effet concret.

4. Exécuter les tests sans le modèle

Importez les scénarios dans Apidog et ajoutez des assertions sur les codes de statut et les schémas de réponse. Exécutez ensuite les tests avec l'interface CLI d'Apidog dans votre pipeline CI.

Le modèle écrit les tests une fois. Votre CI peut ensuite les exécuter mille fois sans coût de modèle. Pour installer l'outil, utilisez Télécharger Apidog.

Conserver des garde-fous

Les résultats d'alignement publiés pour Astra sont les meilleurs d'OpenAI à ce jour :

  • dans le test « honeypot » créé après l'incident Hugging Face, Sol dépassait la cible autorisée 48 % du temps, contre 0 % pour Astra ;
  • Astra n'a jamais tenté de contourner un refus d'auto-révision de Codex, même lorsque ce refus était volontairement évitable ;
  • sa robustesse à l'injection de prompt indirecte atteint 99,79 %, contre 96,23 % auparavant ;
  • son taux d'hallucination est de 4,2 %, contre 12,2 % pour Sol.

Ces résultats ne suppriment pas les garde-fous : ils signifient seulement qu'ils se déclenchent moins souvent.

Un modèle disposant d'une fenêtre de 1 million de jetons, d'une classification cybernétique Critique et de la capacité d'envoyer des requêtes arbitraires à votre API doit toujours fonctionner :

Le moniteur d'Astra peut arrêter une tâche en cours. Traitez donc toute longue exécution comme une tâche reprenable. La conception de tests pour les agents non déterministes reste valable : affirmez le contrat, pas la transcription.

Quand l'utilisation de l'ordinateur reste préférable

Ne lisez pas cet article comme « ne le laissez jamais cliquer ». L'écran est préférable dans trois cas :

  1. un portail partenaire ou une console d'administration sans API ;
  2. un contrôle front-end à effectuer avant une mise en production ;
  3. un outil de bureau hérité dont l'interface est la seule surface disponible.

Astra est le premier modèle pour lequel ces tâches valent réellement la peine d'être déléguées. L'accélération du harnais Codex les rend également assez abordables pour être exécutées chaque nuit.

La règle pratique est la suivante :

Utilisez le contrat lorsqu'un contrat existe ; utilisez l'écran lorsqu'il n'y en a pas.

FAQ

L'utilisation d'ordinateur de GPT-6 Astra fonctionne-t-elle via l'API ?

Oui. Elle figure parmi les outils pris en charge par Astra dans l'API Responses, aux côtés de la recherche web, de la recherche de fichiers, de l'interpréteur de code et de la génération d'images.

Votre application fournit l'environnement et exécute les actions proposées par le modèle. L'API applique aussi le niveau de garde-fous le plus strict d'OpenAI : une tâche mise en pause par le moniteur de désalignement s'arrête au lieu d'attendre une révision.

Quelle taille de spécification puis-je lui donner ?

La fenêtre de contexte est de 1 050 000 jetons, avec 128 000 jetons de sortie. Une spécification contenant des centaines de points de terminaison et des schémas complets tient avec de la marge.

Les invites de plus de 272 000 jetons d'entrée sont facturées deux fois les tarifs d'entrée et de cache. Mettez donc en cache le préfixe de la spécification et gardez les messages de chaque test courts.

Va-t-il halluciner des points de terminaison absents de la spécification ?

Moins que les modèles précédents. Le benchmark interne d'OpenAI affiche 4,2 % pour Astra, contre 12,2 % pour Sol. Astra est également trois fois moins susceptible de dénaturer ses propres capacités.

Les sorties structurées et l'exécution validée par schéma dans Apidog réduisent encore le problème. C'est pourquoi le test de contrat doit avoir le dernier mot, pas le modèle.

Est-ce moins cher que GPT-5.6 Sol pour générer des tests ?

Pas par jeton. Astra coûte 10 $ par million de jetons d'entrée et 50 $ par million de jetons de sortie, contre les tarifs promotionnels de 4 $ et 20 $ pour Sol.

En revanche, OpenAI affirme qu'Astra utilise beaucoup moins de jetons par tâche terminée. Avec un flux axé sur la spécification, le coût du modèle devient une dépense unique. Mesurez les résultats sur votre propre spécification avant de choisir ; le guide de l'API explique comment comparer les deux modèles.

Conclusion

GPT-6 Astra peut piloter votre ordinateur, et pour les interfaces sans API, c'est un véritable avantage. Pour l'API que vous possédez, l'écran reste le chemin lent.

Donnez le contrat au modèle, laissez-le écrire les scénarios, exécutez-les en CI et conservez des garde-fous. Astra est arrivé à cette conclusion de lui-même en vingt minutes. Votre équipe peut commencer de la même manière.

Top comments (0)