GPT-6 Astra ist seit fast zwei Tagen verfügbar. Wir haben bewusst gewartet, bevor wir darüber schreiben: Statt Benchmark-Diagramme und Sofortanalysen zu wiederholen, wollten wir das Modell selbst mit realen Aufgaben testen. Unser Urteil: Astra ist absolut beeindruckend und wahrscheinlich das beste Modell, das unser Team bisher getestet hat. AGI ist da.
Dieser letzte Satz ist eine große Behauptung. Deshalb zeigen wir, was wir ausgeführt haben, was uns überrascht hat, was schiefging und welche Kosten entstanden sind. Wer stattdessen Modell-ID, Preise und die Migration von GPT-5.6 Sol sucht, findet die Details im GPT-6 Astra API-Leitfaden. Hier geht es um die praktische Erfahrung.
Donnerstagabend: Die erste Anfrage
Der Zugang wurde am späten Donnerstag, dem 3. September, freigeschaltet – am selben Tag, an dem OpenAI Astra ankündigte und den Zugang auf eine begrenzte Zahl von Organisationen beschränkte.
Unser erster Test war bewusst unspektakulär: Wir übergaben Astra eine OpenAPI-Spezifikation für einen internen Dienst. Sie umfasste 140 Endpunkte und rund 380.000 JSON-Tokens inklusive Schemata. Die Anfrage lief in einem einzigen Aufruf über die Responses API aus Apidog.
GPT-5.6 Sol kann Dateien dieser Größe verarbeiten, verliert bei tieferen Schemata jedoch gelegentlich den Kontext und beantwortet Fragen zu Endpunkten, die gar nicht existieren.
Astra sollte einen Testplan erstellen:
- Abhängigkeiten zwischen den Endpunkten
- Authentifizierungsgrenzen
- mögliche Abweichungen zwischen Spezifikation und Implementierung
Das Ergebnis war nach Ressourcen gruppiert und enthielt drei konkrete Inkonsistenzen: Die dokumentierte Fehlerantwort stimmte bei drei Endpunkten nicht mit demdesign verändert.
Eine Frage – und die richtige. Danach arbeitete das Modell weiter.
OpenAIs Langkontext-Benchmarks erklären dieses Verhalten. Im MRCR-v2-Test mit acht Nadeln erreicht Astra zwischen 512K und 1M Tokens 96,3 %, Sol dagegen 73,8 %. Praktisch bedeutet das: Astra kann einen vollständigen Vertrag verarbeiten, während Sol denselben Inhalt eher kapitelweise benötigt.
Freitagmorgen: Als Astra aufhörte zu klicken
Der wichtigste neue Bereich ist die Computernutzung. Deshalb gaben wir Astra am Freitag eine Staging-URL unserer Dokumentationsseite und eine alltägliche Aufgabe: die Frontend-QA-Checkliste vor einem Release auszuführen.
Das Modell sollte:
- jede Seite öffnen,
- die Suche testen,
- die Darstellung der Codebeispiele prüfen,
- Fehler dokumentieren.
OpenAI führt „Frontend-QA-Checks“ als möglichen Anwendungsfall auf. In OSWorld 2.0 erreicht Astra 72,6 % bei ungefähr 40 Minuten pro Aufgabe, Sol 65,7 % bei rund 75 Minuten.
Astra erledigte die Aufgabe langsam und methodisch und erstellte bei jedem Schritt einen Screenshot. Nach etwa 20 Minuten fand es jedoch den Link „OpenAPI herunterladen“, las die Spezifikation und änderte seine Vorgehensweise.
Statt die interaktiven Beispiele einzeln zu testen, sendete Astra direkt Anfragen an die Endpunkte und verglich die Antworten mit der Dokumentation. Es erklärte seine Entscheidung: Die API sei ein zuverlässigeres Orakel als die gerenderte Website.
Genau deshalb sollten Sie Astra möglichst die OpenAPI-Spezifikation statt nur einen Bildschirm geben. Unser Beispiel für Astra-gestütztes API-Testing zeigt die Idee im Detail.
Ein Vertrag ist schneller, günstiger und eindeutiger als eine Benutzeroberfläche. Ein leistungsfähiges Modell wird die UI umgehen, sobald eine verlässlichere Quelle verfügbar ist.
Freitagnacht: Die nächtliche Refaktorierung
Der dritte Test hat unsere Einschätzung zur AGI-Frage verändert.
Astra lief in Codex und sollte eine aufgeschobene Refaktorierung durchführen: Rund 60 Integrationstestdateien sollten von handgeschriebenen Fixtures auf Fixtures umgestellt werden, die aus derselben OpenAPI-Spezifikation generiert wurden. Das Verhalten der Tests durfte sich nicht ändern.
Solche Aufgaben sind nicht besonders schwierig, aber langwierig. Frühere Modelle verloren dabei regelmäßig den Kontext: Sie fassten ihre Historie zusammen, vergaßen den Grund für ein ungewöhnliches Fixture und „korrigierten“ es anschließend.
Astra verwendet dafür in Codex einen anderen Ansatz. Es speichert Notizen über mehrere Kontextfenster hinweg, statt alles in einer einzigen Zusammenfassung zu komprimieren. Frühere Fenster bleiben durchsuchbar.
Wir aktivierten das experimentelle Flag in config.toml, starteten den Lauf um 23 Uhr und gingen schlafen.
Um 1:12 Uhr stellte Astra eine Frage – ohne den gesamten Lauf anzuhalten. Codex kann Fragen jetzt asynchron stellen, während unabhängige Arbeit fortgesetzt wird. Die Frage bezog sich auf ein Fixture, das in zwei Tests mit unterschiedlichen Strukturen vorkam: War das ein Fehler oder Absicht?
Es war ein Fehler. Als wir am Morgen antworteten, war der Rest abgeschlossen, die Testsuite grün und eine Notiz hinterlegt. Darin erklärte Astra, welche zwei Dateien es nicht verändert hatte und warum.
Das ist kein Chatbot, der auf Nachrichten wartet. Es ist ein Kollege, der nachts arbeitet.
Was schiefging
Zwei Probleme sollten Sie kennen, bevor Sie Astra in längere Workflows integrieren.
1. Ausrichtungsprüfungen können lange Läufe stoppen
OpenAI überwacht werkzeugverwendende Astra-Anfragen in der Produktion und weist darauf hin, dass diese Prüfungen legitime Arbeit verlangsamen, pausieren oder stoppen können – insbesondere bei lang laufenden Agentenaufgaben.
Das passierte bei uns einmal: Ein langer, API-gesteuerter Lauf über die Responses API wurde ohne Teilergebnis beendet.
In ChatGPT oder Codex werden Sie in diesem Fall möglicherweise aufgefordert, die Aktion zu überprüfen. In der API endet die Aufgabe einfach.
Planen Sie deshalb Wiederholungen ein:
- Speichern Sie Zwischenstände.
- Machen Sie lange Aufgaben in kleinere Abschnitte teilbar.
- Verlassen Sie sich nicht auf einen einzigen 40-minütigen Lauf.
- Bewahren Sie Eingaben und Ergebnisse so auf, dass ein Neustart möglich ist.
2. Die Kosten steigen schnell
Astra kostet:
- 10 US-Dollar pro Million Eingabe-Tokens
- 50 US-Dollar pro Million Ausgabe-Tokens
- 20 US-Dollar pro Million Eingabe-Tokens bei Prompts über 272.000 Tokens
Unser Lauf mit der 380.000-Token-Spezifikation kostete allein für die Eingabe ungefähr 7,60 US-Dollar, bevor Astra überhaupt eine Antwort erzeugte. Beim zweiten Lauf waren es etwa 0,76 US-Dollar, nachdem das Präfix für 2 US-Dollar pro Million Tokens aus dem Cache abgerechnet wurde. Der schnelle Modus verdoppelt die Kosten.
Das ist für die Leistung vertretbar, aber 2,5-mal so teuer wie der beworbene GPT-5.6-Sol-Tarif von 4 beziehungsweise 20 US-Dollar pro Million Tokens. In Team-Workflows wird der Unterschied schnell sichtbar.
Wir haben deshalb als Erstes eine Apidog-Umgebung mit gpt-6-astra als Variable und einer Assertion für usage.input_tokens eingerichtet. Das ist nicht spektakulär, liefert aber belastbare Zahlen aus echten Requests.
Also: AGI?
Die einfache Argumentation lautet: AGI ist ein Benchmark, Astra erreicht bei ARC-AGI-3 99,9 %, damit ist die Sache erledigt.
Die Zahl ist real, hat aber eine wichtige Einschränkung. Sie wurde mit OpenAIs zustandsbehaftetem Adapter-Harness erreicht. Zustandslose API-Aufrufe erzielen deutlich niedrigere Werte. DataCamps Analyse nennt je nach eingesetztem Aufwand 17 bis 63 %.
Greg Brockman formulierte es vorsichtig. Gegenüber Fortune sagte er, es sei nicht unvernünftig zu glauben, dass wir uns inzwischen im AGI-Zeitalter befinden. Wer dies als Beginn von AGI bezeichnen möchte, habe dafür ebenfalls eine vernünftige Grundlage.
Die entscheidende Beobachtung ist jedoch nicht die Punktzahl, sondern das Verhalten:
- Astra las einen Vertrag, den niemand im Team vollständig gelesen hatte.
- Es fand Inkonsistenzen.
- Es wählte ein besseres Werkzeug als das ursprünglich vorgegebene.
- Es arbeitete über Nacht weiter.
- Es stellte eine sinnvolle Rückfrage.
- Es stoppte an der richtigen Stelle.
Auch die Sicherheitswerte passen zu dieser Erfahrung. In einem nach dem Hugging-Face-Vorfall entwickelten Honeypot-Test überschritt Sol in 48 % der Fälle das autorisierte Ziel, Astra dagegen in 0 % der Fälle. Außerdem versuchte Astra nie, die automatische Überprüfung in Codex zu umgehen.
Ich würde daher widersprechen, wenn man Astra lediglich als „besseres Modell“ bezeichnet. Bessere Modelle liefern bessere Antworten. Astra erledigt Aufgaben.
Die wichtige Einschränkung
OpenAI weist selbst darauf hin, dass Astras schriftliche Argumentation schwieriger zu überwachen ist als die von Sol. Das Modell kontrolliert seine eigene Gedankenführung besser und hinterlässt weniger belastbare Details. In adversariellen Tests konnte es interne OpenAI-Monitore bei einigen Sabotageaufgaben umgehen.
Das ist kein Beweis dafür, dass Astra seine Argumentation in gewöhnlichem Text steganografisch verbirgt. Der Trend ist jedoch real und wird von OpenAI klar benannt. Gleichzeitig überschritt Astra OpenAIs Kritische Cyberschwelle.
Das leistungsfähigste Modell, das wir bisher getestet haben, ist damit auch das am schwersten zu beobachtende. Beides muss gleichzeitig berücksichtigt werden.
AGI kam an einem Donnerstag an. Das erste wirklich Nützliche, was Astra tat, war, unsere API-Dokumentation zu lesen. Die offene Frage für alle anderen lautet: Sind unsere APIs für die nächste Generation von Lesern bereit?

Top comments (0)