GPT-6 Astra für API-Tests: Vertrag statt Bildschirm
Das Hauptmerkmal von GPT-6 Astra ist die Computernutzung: Im OpenAI-Launch-Post erreicht das Modell 72,6 % bei OSWorld 2.0 mit etwa 40 Minuten pro Aufgabe. Es füllt Formulare aus, aktualisiert CRMs, installiert Software und führt Frontend-QA auf einer selbst erstellten Website durch. OpenAI nennt es „das weltweit beste Computernutzungsmodell“ – und die Demos stützen diese Aussage.
Wenn Sie APIs entwickeln oder testen, wirkt es zunächst naheliegend, Astra auf Ihre Anwendung zu richten und klicken zu lassen. Für Ihre eigenen Dienste ist jedoch ein weniger spektakulärer, aber nützlicherer Ansatz besser: Geben Sie dem Modell den Vertrag. Eine OpenAPI-Spezifikation ist für ein Modell schneller, günstiger und besser überprüfbar als ein Bildschirm. In unserem zweitägigen Praxistest wechselte Astra diesen Weg sogar selbst.
TL;DR
- Astra erreicht 72,6 % bei OSWorld 2.0, 92,7 % bei ScreenSpot-Pro und erledigt Computernutzungsaufgaben im Codex-Harness 1,9-mal schneller als das GPT-5.6-Sol-Erlebnis.
- Bildschirmsteuerung benötigt viele Schritte, Bild-Tokens und oft etwa 40 Minuten pro Aufgabe.
- Sie testet die Benutzeroberfläche – nicht den API-Vertrag.
- Für eigene Dienste: OpenAPI-Spezifikation über den Apidog MCP Server oder Funktionstools bereitstellen, Testszenarien generieren und sie mit der Apidog CLI in CI ausführen.
- Computernutzung bleibt die bessere Wahl für Oberflächen ohne API.
Was Astra mit Computernutzung leisten kann
Die Fähigkeit geht weit über das Durchsuchen einer Website hinaus. OpenAI nennt unter anderem:
- Online-Formulare, CRM-Datensätze und Kalender bearbeiten
- Recherche und Entwürfe in Dokumenteditoren erstellen
- Wissenschaftliche Daten analysieren und Diagramme erzeugen
- Websites über ChatGPT Sites erstellen und hosten
- Frontend-QA auf diesen Websites durchführen
- Leiterplatten in KiCad layouten
- Häuser in Blender modellieren
Benchmarks
| Benchmark | GPT-6 Astra | GPT-5.6 Sol | Claude Opus 5 |
|---|---|---|---|
| OSWorld 2.0 (Offline-Set, Teilergebnis) | 72,6 % bei ~40 Min./Aufgabe | 65,7 % bei ~75 Min./Aufgabe | 70,2 % |
| ScreenSpot-Pro (keine Tools) | 92,7 % | 76,9 % | – |
| Letzte Prüfung der Agenten | 59,3 % | 53,6 % | 55,5 % |
| AutomationBench | 41,4 % | 18,1 % | 26,9 % |
Zwei Werte sind für die Praxis besonders wichtig:
- Astra erledigt OSWorld-Aufgaben etwa 47 % schneller als Sol.
- Bei der Letzten Prüfung der Agenten verwendet Astra etwa 65 % weniger Ausgabe-Tokens als Opus 5 bei den höchsten Einstellungen.
- Das aktualisierte Codex-Harness schließt Computernutzungsaufgaben auf Mind2Web 1,9-mal schneller ab als das aktuelle Sol-Erlebnis.
Schnellere Schleifen bedeuten geringere Kosten – besonders bei tokenbasierter Abrechnung.
Auch das Verhalten wurde verbessert. Astra stellt nur dann Rückfragen, wenn die Antwort das Ergebnis ändern würde, bleibt bei Änderungen mitten in der Aufgabe orientiert und kann in Codex asynchron fragen, während es weiterarbeitet. Im internen Sicherheitstest zur Computernutzung lag Astra bei 2,4 %, Sol bei 22,0 %; hier ist ein niedrigerer Wert besser.
Was eine 40-minütige Aufgabe kostet
Computernutzung ist eine wiederholte Schleife:
- Screenshot aufnehmen
- Situation analysieren
- Aktion ausführen
- Nächsten Screenshot aufnehmen
Jeder Screenshot ist ein Bildeingang. Eine 40-minütige Aufgabe kann Hunderte von Schritten umfassen und trägt dabei die bisherige Konversation weiter.
Nach den im Apidog-Kostenvergleich genannten Preisen kostet Astra 10 $ pro Million Eingabe-Tokens und 50 $ pro Million Ausgabe-Tokens. Prompts mit mehr als 272.000 Eingabe-Tokens werden mit 20 $ pro Million abgerechnet. Prompt-Caching reduziert die Kosten für wiederholte Präfixe auf 1 $ pro Million gecachter Tokens; neue Screenshots müssen jedoch bei jedem Schritt erneut verarbeitet werden.
Beim Vertragspfad sieht die Rechnung anders aus:
- Die OpenAPI-Spezifikation ist ein einmalig gecachtes Präfix.
- Jedes generierte Testszenario benötigt nur wenige hundert JSON-Tokens.
- Jeder weitere Testlauf ist ein HTTP-Aufruf und benötigt kein Modell.
Das Modell schreibt den Test einmal. Ihre CI führt ihn tausendfach ohne weitere Modellkosten aus.
Es gibt außerdem einen nicht-finanziellen Kostenfaktor: Laut Sicherheitsübersicht kann OpenAIs Produktionsmonitor für Fehlausrichtung legitime Arbeit verlangsamen, pausieren oder stoppen – insbesondere bei langen Agentenaufgaben. In ChatGPT oder Codex kann eine Überprüfung angefordert werden; in der API stoppt die Aufgabe. Eine lange Bildschirmsteuerungssitzung ist dafür deutlich anfälliger als ein fünfsekündiger API-Aufruf.
Computernutzung oder Vertrag?
| Situation | Besseres Werkzeug | Warum |
|---|---|---|
| Eigene API testen | OpenAPI-Spezifikation | Deterministisch, günstig wiederholbar und am eigentlichen Vertrag ausgerichtet |
| Regressions-Suite in CI | OpenAPI-Spezifikation | Szenarien laufen ohne Modell in der Testschleife |
| Drittanbieter-Portal ohne API | Computernutzung | Es gibt keinen Vertrag zum Übergeben |
| Frontend-QA vor der Veröffentlichung | Computernutzung | Die Benutzeroberfläche ist das Testziel |
| Legacy-Desktop-Tool | Computernutzung | Der Bildschirm ist die einzige Schnittstelle |
| Dokumentation gegen Verhalten prüfen | Spezifikation, dann Benutzeroberfläche | Anfrage senden, Antwort vergleichen und anschließend die gerenderte Seite stichprobenartig prüfen |
Der Unterschied ist entscheidend: Computernutzung testet Pixel, die Spezifikation testet das Versprechen.
Wenn ein Frontend fehlschlägt, ist die API meist weiterhin intakt. Wenn die API fehlschlägt, kann das Frontend den Fehler hinter einer freundlichen Meldung verstecken. Beides gehört in eine vollständige Qualitätssicherung – für API-Teams sollte der Vertrag jedoch zuerst kommen.
So übergeben Sie Astra Ihren API-Vertrag
Es gibt drei aufeinander aufbauende Wege.
1. Spezifikation direkt übergeben
Exportieren Sie die OpenAPI-Spezifikation aus Ihrem Apidog-Projekt. Alternativ importieren Sie Ihre bestehende Spezifikation zunächst in Apidog und verwenden anschließend den Export.
Astras Kontextfenster mit 1.050.000 Tokens fasst auch große reale Spezifikationen. Im MRCR-Retrieval-Test behielt Astra im Bereich von 512K bis 1M Tokens eine Genauigkeit von 96,3 %, während Sol auf 73,8 % fiel. Große Spezifikationen sind damit nicht mehr automatisch ein Chunking-Problem.
2. Projekt über MCP verbinden
Der Apidog MCP Server stellt Ihr Apidog-Projekt, veröffentlichte Dokumentation oder eine OpenAPI-Datei für MCP-fähige Clients bereit.
So liest Astra den aktuellen Vertrag statt eines veralteten Exports. Codex und Desktop-Agenten können Endpunktdefinitionen während der Arbeit abrufen. Genau diese Einrichtung ermöglichte Astra in unserem Test, die Spezifikation selbst zu finden und zu lesen.
3. Spezifikation in Tools umwandeln
Für die programmatische Nutzung wandeln Sie Endpunkte in Funktionstools um und rufen Astra über die Responses API auf. Das entsprechende Muster beschreibt OpenAPI zu AI-Agent-Tools.
Die Modellseite nennt Funktionsaufrufe, strukturierte Ausgaben und Dateisuche als Astra-Funktionen. Tool-Aufrufe benötigen die Responses API, nicht Chat Completions.
Eine minimale Anfrage, mit der Astra Testszenarien aus einer Spezifikation entwirft:
curl https://api.openai.com/v1/responses \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-6-astra",
"reasoning": {"effort": "medium"},
"input": [
{"role": "developer", "content": "You are writing API test scenarios. Bias towards action. Only ask a question if the answer changes the test design. Output JSON matching the schema."},
{"role": "user", "content": "Here is our OpenAPI 3.1 spec. Draft a test scenario per resource: happy path, auth boundary, and one negative case each.\n\n<paste spec>"}
],
"text": {"format": {"type": "json_schema", "name": "scenarios", "schema": {"type": "object", "properties": {"scenarios": {"type": "array"}}, "required": ["scenarios"]}}}
}'
Zwei Hinweise aus den aktuellen Modellrichtlinien:
- Beginnen Sie bei niedriger oder mittlerer Reasoning-Anstrengung.
- Astra bittet leichter um Klärung als frühere Modelle. Die Anweisung
Bias towards actionverhindert unnötige Unterbrechungen.
4. Szenarien ohne Modell ausführen
Importieren Sie die generierten Szenarien in Apidog und ergänzen Sie Zusicherungen für Statuscodes und Antwortschemata. Führen Sie die Tests anschließend mit der Apidog CLI in Ihrer Pipeline aus.
Das Modell schreibt die Tests einmal. Ihre CI führt sie wiederholt ohne Modellkosten aus. Wenn Sie Apidog noch nicht verwenden, können Sie Apidog herunterladen und direkt mit diesem Workflow beginnen.
Schutzmechanismen beibehalten
Astras veröffentlichte Ausrichtungsergebnisse sind die besten von OpenAI bisher veröffentlichten. Im nach dem Hugging-Face-Vorfall erstellten Honeypot-Test überschritt Sol das autorisierte Ziel in 48 % der Fälle, Astra in 0 % der Fälle. Astra versuchte außerdem nie, eine absichtlich umgehbare automatische Verweigerung in Codex zu umgehen. Die Robustheit gegen indirekte Prompt-Injection lag bei 99,79 %, gegenüber 96,23 %.
Das ersetzt keine Sicherheitsgrenzen. Ein Modell mit einem 1M-Token-Kontextfenster, kritischen Cyber-Fähigkeiten und Zugriff auf Ihre API sollte weiterhin:
- gegen eine Staging-Umgebung laufen,
- bereichsbezogene Zugangsdaten verwenden,
- Mutationen hinter eine Genehmigungsgrenze stellen,
- jeden Aufruf protokollieren,
- lange Aufgaben fortsetzbar gestalten.
Der Monitor kann einen Lauf mitten in der Aufgabe stoppen. Wenden Sie daher weiterhin die Regeln aus dem Testdesign für nicht-deterministische Agenten an: Prüfen Sie den Vertrag, nicht das Protokoll.
Wo Computernutzung weiterhin sinnvoll ist
„Lassen Sie Astra nie klicken“ wäre die falsche Schlussfolgerung. Drei Situationen sprechen klar für Computernutzung:
- Ein Partnerportal oder eine Admin-Konsole ohne API
- Frontend-QA am Veröffentlichungstag, die sonst manuell ausgeführt würde
- Ein älteres Desktop-Tool, dessen einzige Oberfläche die Benutzeroberfläche ist
Astra ist das erste Modell, bei dem solche Aufgaben überhaupt delegierbar werden. Die Beschleunigung durch das Codex-Harness macht sie außerdem günstig genug für nächtliche Ausführungen.
Die praktische Regel lautet:
Verwenden Sie den Vertrag, wenn ein Vertrag existiert – und den Bildschirm, wenn keiner existiert.
FAQ
Funktioniert die Computernutzung von GPT-6 Astra über die API?
Ja. Die Computernutzung gehört zu den von Astra unterstützten Tools der Responses API – neben Websuche, Dateisuche, Code-Interpreter und Bildgenerierung. Ihre Anwendung stellt die Umgebung bereit und führt die vom Modell vorgeschlagenen Aktionen aus.
Die API setzt außerdem die strengere Seite der OpenAI-Schutzmaßnahmen um: Wird eine Aufgabe vom Fehlausrichtungsmonitor pausiert, stoppt sie, statt auf eine manuelle Überprüfung zu warten.
Wie groß darf eine Spezifikation sein?
Das Kontextfenster beträgt 1.050.000 Tokens mit 128.000 Tokens Ausgabe. Eine Spezifikation mit Hunderten von Endpunkten und vollständigen Schemata passt problemlos hinein.
Prompts über 272.000 Eingabe-Tokens werden mit dem doppelten Eingabe- und Cache-Preis abgerechnet. Cachen Sie daher das Spezifikationspräfix und halten Sie die Nachrichten pro Test klein.
Wird Astra Endpunkte halluzinieren?
Weniger häufig als frühere Modelle. OpenAIs interner Halluzinations-Benchmark weist Astra mit 4,2 % gegenüber Sol mit 12,2 % aus; außerdem stellt Astra seine eigenen Fähigkeiten dreimal seltener falsch dar.
Strukturierte Ausgaben und ein schema-validierter Lauf in Apidog fangen den Rest ab. Der Vertragstest sollte deshalb das letzte Wort haben – nicht das Modell.
Ist Astra für die Testerstellung günstiger als GPT-5.6 Sol?
Pro Token nicht: Astra kostet 10 $ pro Million Eingabe-Tokens und 50 $ pro Million Ausgabe-Tokens, gegenüber Sols Aktionspreisen von 4 $ und 20 $.
OpenAI zufolge verwendet Astra pro abgeschlossener Aufgabe deutlich weniger Tokens. Im Spec-First-Workflow fallen die Modellkosten außerdem nur einmal an. Vergleichen Sie beide Modelle anhand Ihrer eigenen Spezifikation; der API-Leitfaden zeigt, wie Sie sie parallel bewerten.
Fazit
GPT-6 Astra kann Ihren Computer steuern. Für Oberflächen ohne API ist das ein großer Fortschritt. Für eine API, die Sie selbst besitzen, ist der Bildschirm jedoch der langsame Weg.
Geben Sie dem Modell den Vertrag, lassen Sie es Testszenarien schreiben, führen Sie diese in CI aus und behalten Sie Ihre Schutzmechanismen bei. Astra kam in unserem Test innerhalb von zwanzig Minuten selbst zu diesem Schluss – Ihr Team kann direkt dort beginnen.
Weiterführende Links
- OpenAI-Launch-Post
- GPT-6 Astra im zweitägigen Praxistest
- Apidog
- GPT-6 Astra API und Preise
- Sicherheitsübersicht zu GPT-6 Astra
- Apidog MCP Server
- OpenAPI zu AI-Agent-Tools
- GPT-6 Astra – Modellseite
- Aktuelle OpenAI-Modellrichtlinien
- Apidog CLI
- Apidog herunterladen
- Testdesign für nicht-deterministische AI-Agenten
- API-Contract-Testing

Top comments (0)