Grok 4.6 ist xAIs bahnbrechendes Sprachmodell, das am 12. August 2026 veröffentlicht wurde. Es baut auf Grok 4.5 auf und konzentriert sich auf langlaufende Agenten, agentische Programmierung sowie interaktive oder visuelle Arbeiten. Es bietet ein Kontextfenster von 500.000 Tokens zu 2 $ pro Million Eingabetokens und 6 $ pro Million Ausgabetokens. Im Artificial Analysis Intelligenz-Index erreicht es 61 Punkte, liegt damit gleichauf mit OpenAIs GPT-5.6 Sol und einen Punkt hinter Anthropics Claude Fable 5. Damit ist es derzeit das günstigste Modell an der Spitze der Intelligenz.
Apidog noch heute ausprobieren
Für API-Entwickler ist vor allem relevant, wie schnell sich Grok 4.6 gegen reale Workloads evaluieren lässt. Wenn Sie LLM-APIs entwickeln, können Sie mit Apidog Requests entwerfen, testen und simulieren, bevor Sie einen eigenen Client implementieren. Nutzen Sie das, um Grok 4.6 mit bestehenden Modellintegrationen bei Qualität, Latenz und Token-Verbrauch zu vergleichen.
Das Wichtigste in Kürze
- Veröffentlicht: 12. August 2026, von xAI.
- Fokus: Agenten mit langem Planungshorizont, mehrstufiges Codieren sowie interaktive und visuelle Arbeiten. Laut xAI testet und verifiziert das Modell seine Arbeit häufiger, bevor es fortfährt.
- Spezifikationen: 500K Kontextfenster, Wissensstand bis 1. Februar 2026.
- Preise: 2 $ / 1M Eingabetokens und 6 $ / 1M Ausgabetokens. Eine schnellere Variante kostet das Doppelte. In der ersten Woche ist die doppelte Nutzung in Grok Build und Cursor enthalten.
- Benchmarks: Intelligenz-Index 61, gleichauf mit GPT-5.6 Sol. Große Verbesserungen gegenüber 4.5 bei DeepSWE (54 → 65,9) und APEX-Agents (47,1 → 57,5).
- Verfügbarkeit: xAI API, Grok Build, Cursor, OpenRouter, Vercel und Cloudflare.
Grok 4.6 auf einen Blick
| Spezifikation | Grok 4.6 |
|---|---|
| Entwickler | xAI |
| Veröffentlichungsdatum | 12. August 2026 |
| Kontextfenster | 500.000 Tokens |
| Wissensstand | 1. Februar 2026 |
| Preis Eingabe / Ausgabe | 2 $ / 6 $ pro 1M Tokens |
| Schnelle Variante | 2x Preis |
| Intelligenz-Index | 61 (GPT-5.6 Sol: 61, Claude Fable 5: 62) |
| Verfügbarkeit | xAI API, Cursor, Grok Build, OpenRouter, Vercel, Cloudflare |
Was ist wirklich neu im Vergleich zu Grok 4.5?
Grok 4.6 ist keine Offenlegung der Architektur, sondern vor allem eine Trainingsgeschichte. Laut xAI durchlief das Modell einen längeren ergänzenden Trainingslauf als Grok 4.5.
Drei Bestandteile stehen dabei im Mittelpunkt:
- Kuratierte, modellgenerierte Daten für Schlussfolgerungen und fortgeschrittene technische Konzepte.
- Hochwertige Engineering-Datensätze, die die codeintensive Trainingsbasis aus realen Entwicklungssitzungen fortsetzen.
- Verbesserter Optimierer und Trainingsrezept, bei dem überwachte Fine-Tuning-Trajektorien für Schlussfolgerungs- und domänenspezifische Aufgaben neu generiert wurden.
Für die Praxis ist besonders die behauptete Selbstverifikation relevant: Bei langen Agentenläufen prüft Grok 4.6 Zwischenergebnisse, bevor es mit dem nächsten Schritt fortfährt. Das kann bedeuten, dass ein Agent einen gerade geschriebenen Test ausführt oder eine bearbeitete Datei erneut liest, statt auf einer unbestätigten Annahme aufzubauen.
Bei interaktiven und visuellen Projekten berichtet xAI außerdem von stärkeren ersten Ergebnissen. Dashboards, kleine Anwendungen und UI-Arbeiten sollen bereits im ersten Durchlauf näher an einer nutzbaren Implementierung liegen.
Wenn Sie der Trainingsansatz von Grok 4.5 interessiert hat, beschreibt unsere Analyse, was das Cursor-Sitzungstraining für Entwickler bedeutete, die Grundlage, auf der dieses Modell aufbaut.
Die Benchmarks mit relevanten Unterschieden
Benchmarks zum Launch sollten Sie kritisch lesen. Die Unterschiede zwischen Grok 4.5 und 4.6 sind jedoch groß genug, um für eine Evaluierung relevant zu sein.
Drei Punkte sind für Entwickler besonders wichtig:
- Agentenleistung: Der Anstieg um 10,4 Punkte bei APEX-Agents reduziert den Abstand zur Spitzengruppe deutlich. Grok 4.6 liegt nur noch 1,7 Punkte hinter Fable 5 Max und leicht vor GPT-5.6 Sol Max mit 56,7 %.
- Repository-übergreifendes Codieren: DeepSWE steigt um fast 12 Punkte. Das ist relevant für Aufgaben, die Änderungen über mehrere Dateien, Tests und bestehende Projektstrukturen hinweg erfordern. Sol Max führt diese Benchmark weiterhin mit deutlichem Vorsprung an.
- Unabhängige Daten: Artificial Analysis misst durchschnittliche Kosten von 0,84 $ pro Aufgabe in seinen Agenten-Evaluierungen. Das ist der niedrigste Wert unter den Modellen der Spitzengruppe. Für professionelle Wissensarbeit wurde auf GDPval-AA v2 ein Elo-Wert von 1753 erreicht.
Für mehr Kontext zur Interpretation der xAI-Benchmarks und ihren Einschränkungen siehe die Grok-4.5-Benchmarks-Analyse.
Preise: Das Preis-Leistungs-Verhältnis an der Spitze
Grok 4.6 übernimmt die Preise von Grok 4.5:
| Modell | Ausgabepreis / 1M Tokens |
|---|---|
| Grok 4.6 | 6 $ |
| Claude Opus 4.8 | 25 $ |
| GPT-5.6 Sol | 30 $ |
Das entspricht beim Ausgabetoken-Preis einem Faktor von 5 gegenüber GPT-5.6 Sol, obwohl beide im zusammengesetzten Intelligenz-Index gleichauf liegen.
Für die Implementierung sollten Sie allerdings nicht nur Listenpreise vergleichen. Günstige Tokens bedeuten nicht automatisch günstige Aufgaben: Wenn ein Modell mehr Korrekturschleifen, zusätzliche Tool-Aufrufe oder manuelle Nacharbeit verursacht, steigt der tatsächliche Preis. Die unabhängigen Kosten-pro-Aufgabe-Daten deuten jedoch darauf hin, dass die Effizienz nicht nur vom niedrigeren Tokenpreis kommt.
Die schnellere Variante kostet 4 $ pro Million Eingabetokens und 12 $ pro Million Ausgabetokens. Sie richtet sich an latenzempfindliche, interaktive Anwendungsfälle. Bis zum 19. August erhalten Grok-Build- und Cursor-Nutzer außerdem die doppelte Nutzung zum Testen.
Wo Sie Grok 4.6 heute nutzen können
Sie können Grok 4.6 über mehrere Integrationswege evaluieren:
- xAI API: über console.x.ai, OpenAI-kompatibel. Der Grok-4.5-API-Leitfaden ist direkt übertragbar; ändern Sie den Modellnamen.
- Cursor: als Modelloption in der IDE.
- Grok Build: xAIs eigener Agenten-Arbeitsbereich, einschließlich des 2x-Nutzungsbonus in der Startwoche.
-
OpenRouter, Vercel und Cloudflare: für Teams, die mehrere Modelle über ein Gateway verwalten. Bei OpenRouter ist das Modell als
x-ai/grok-4.6gelistet.
Die schnellste Evaluierung erfolgt über eine bestehende API-Integration oder eine IDE, die Grok 4.6 bereits anbietet.
Grok 4.6 über die OpenAI-kompatible API testen
Da die xAI API OpenAI-kompatibel ist, können Sie Ihre bestehende Client-Struktur weiterverwenden. Richten Sie zunächst die Basis-URL auf https://api.x.ai/v1 und verwenden Sie den passenden Modellnamen.
Ein minimaler Request mit curl kann so aussehen:
curl https://api.x.ai/v1/chat/completions \
-H "Authorization: Bearer $XAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "grok-4.6",
"messages": [
{
"role": "user",
"content": "Analysiere dieses Repository und schlage einen sicheren Refactoring-Plan vor."
}
]
}'
Für einen belastbaren Vergleich sollten Sie nicht nur einen Beispiel-Prompt ausführen. Testen Sie dieselbe reale Aufgabe mit mehreren Modellen und erfassen Sie mindestens:
- Erfolgsquote: Wurde die Aufgabe fachlich korrekt gelöst?
- Latenz: Wie lange dauert die vollständige Antwort oder Agenten-Schleife?
- Token-Nutzung: Wie viele Eingabe- und Ausgabetokens entstehen?
- Tool-Aufrufe: Sind Funktionsargumente und Payloads valide?
- Nacharbeit: Wie viele manuelle Korrekturen sind vor dem Merge nötig?
Einschränkungen und offene Fragen
Eine Launch-Bewertung braucht auch die Vorbehalte:
- Die meisten Benchmarks stammen vom Anbieter. Artificial Analysis veröffentlichte unabhängige Werte, die weitgehend übereinstimmen. Die konkreten Coding-Werte für DeepSWE, FrontierCode und CursorBench stammen jedoch aus xAIs eigener Starttabelle. Rechnen Sie bei unabhängigen Tests mit einer gewissen Regression zum Mittelwert.
- Das Kontextfenster ist das kleinste an der Spitze. 500K Tokens reichen für viele reale Workloads, aber GPT-5.6 Sol bietet 1,05M und Claude Fable 5 bietet 1M. Bei kompletten Monorepos oder sehr großen Dokumentsätzen kann das entscheidend sein.
- Sol bleibt bei den schwierigsten Coding-Aufgaben vorn. Das DeepSWE-Defizit von 7 Punkten bedeutet, dass GPT-5.6 Sol Max für vollständig autonome Arbeit in großen bestehenden Codebasen stärker bleibt.
- Das Ökosystem ist weniger ausgereift. Batch-Verarbeitung, Prompt-Caching-Schichten und Nutzungssteuerungen bei xAI sind jünger als vergleichbare Funktionen bei OpenAI und Anthropic. Die OpenAI-Kompatibilität überbrückt vieles, aber nicht alles.
Diese Einschränkungen disqualifizieren Grok 4.6 nicht. Sie helfen vielmehr bei der Einordnung: Das Modell ist eine ernsthafte Preis-Leistungs-Option, die Sie gegen Ihre eigenen Workloads testen sollten.
Was es für API-Entwickler bedeutet
Die zentrale Veränderung ist der Preiswettbewerb an der Spitze. Ergebnisse auf GPT-5.6-Sol-Niveau bedeuteten bisher Ausgabepreise von 25–30 $ pro Million Tokens. Grok 4.6 liegt bei 6 $.
Das wirkt sich besonders auf Agenten-Schleifen aus. Ein Agent mit 40 Modellaufrufen pro Aufgabe spürt einen 5-fachen Unterschied im Ausgabepreis unmittelbar. Ob daraus tatsächlich niedrigere Kosten pro erledigter Aufgabe werden, hängt aber von der Qualität der Ergebnisse, Wiederholungen und Tool-Fehlern ab.
Praktisch kann eine Evaluierung an einem Nachmittag erfolgen:
- Richten Sie Ihren bestehenden OpenAI-kompatiblen Client auf
https://api.x.ai/v1. - Führen Sie eine repräsentative Auswahl Ihrer echten Prompts und Agenten-Tasks aus.
- Speichern Sie Requests, Responses, Latenzen und Token-Nutzung.
- Vergleichen Sie Grok 4.6 mit Ihren bisherigen Standardmodellen.
- Prüfen Sie Tool-Aufrufe separat anhand ihrer JSON-Payloads.
Mit Apidog können Sie GPT-5.6-, Claude- und Grok-4.6-Anfragen in einem Projekt verwalten. Legen Sie Umgebungen pro Anbieter an und definieren Sie Assertions für Antwortstruktur, Latenz, Token-Nutzung und erwartete Tool-Parameter.
Bei Agenten-Integrationen ist das besonders wichtig: Testen Sie nicht nur den generierten Text. Validieren Sie auch Funktionsaufrufe, Pflichtfelder, Datentypen und Fehlerfälle der generierten Payloads.
Häufig gestellte Fragen
Was ist Grok 4.6 in einem Satz?
xAIs Modell vom August 2026, optimiert für langlaufende Agenten und Codierung, mit einem 500K-Kontextfenster und Ergebnissen der Spitzenklasse zu etwa einem Fünftel des Ausgabepreises vergleichbarer Modelle.
Ist Grok 4.6 besser als GPT-5.6?
Im Artificial Analysis Intelligenz-Index liegen beide mit 61 Punkten gleichauf. GPT-5.6 Sol Max führt beim repositoryweiten Codieren auf DeepSWE. Grok 4.6 liegt bei APEX-Agents leicht vorn und kostet ungefähr 5x weniger pro Ausgabetoken.
Was ist der Unterschied zwischen Grok 4.5 und 4.6?
Preis und API bleiben gleich, die Leistung steigt deutlich: +11,9 Punkte bei DeepSWE, +10,4 bei APEX-Agents sowie eine neue Tendenz zur Selbstverifikation bei langen Aufgaben.
Kann ich Grok 4.6 kostenlos testen?
Grok Build und Cursor bieten in der Startwoche die doppelte Nutzung. Die Methoden aus dem Leitfaden zur kostenlosen Nutzung von Grok 4.5 lassen sich weitgehend auf Grok 4.6 übertragen.

Top comments (0)