xAI hat Grok 4.6 am 12. August 2026 ausgeliefert. Das Modell richtet sich an Entwickler, die langlebige Agenten und mehrstufige Codierungsaufgaben umsetzen: Frontier-Niveau, 2 $ pro Million Input-Token und 6 $ pro Million Output-Token. Die offiziellen Dokumente liefern Referenzmaterial, zeigen aber selten einen vollständigen API-Aufruf von der Schlüsselverwaltung bis zum Streaming. Dieser Leitfaden schließt diese Lücke.
Apidog noch heute ausprobieren
Am Ende haben Sie einen API-Schlüssel, funktionierende Requests mit curl, Python und JavaScript, Streaming-Ausgabe sowie eine reproduzierbare Testumgebung für Grok-4.6-Endpunkte. Wenn Sie Requests visuell erstellen und debuggen möchten, statt mehrere Terminalfenster zu verwalten, können Sie den Workflow mit Apidog abbilden.
TL;DR
- Erstellen Sie einen API-Schlüssel in console.x.ai, speichern Sie ihn als
XAI_API_KEYund rufen Siehttps://api.x.ai/v1/chat/completionsmitgrok-4-6auf. - Die API ist OpenAI-kompatibel. Mit den offiziellen OpenAI-SDKs müssen Sie nur
base_urlund den API-Schlüssel anpassen. - Grok 4.6 bietet ein Kontextfenster von 500.000 Token und einen Wissensstand bis zum 1. Februar 2026.
- Preis: 2 $ pro Million Input-Token und 6 $ pro Million Output-Token. Die schnelle Variante kostet das Doppelte.
- Grok 4.6 ist über die xAI API, OpenRouter, Vercel, Cloudflare, Cursor und Grok Build verfügbar.
- Sie können Requests testen, SSE-Streams inspizieren und Endpunkte für CI mit Apidog simulieren.
Womit Sie arbeiten
Bevor Sie integrieren, prüfen Sie die Spezifikationen, die Architektur und Kosten beeinflussen:
| Spezifikation | Grok 4.6 |
|---|---|
| Veröffentlichungsdatum | 12. August 2026 |
| Kontextfenster | 500.000 Token |
| Wissensstand | 1. Februar 2026 |
| Input-Preis | 2 $ / 1 Mio. Token |
| Output-Preis | 6 $ / 1 Mio. Token |
| Schnelle Variante | 2x Preis |
| API-Stil | OpenAI-kompatible REST |
| Verfügbarkeit | xAI API, OpenRouter, Vercel, Cloudflare, Cursor, Grok Build |
Die wichtigsten Verbesserungen gegenüber Grok 4.5 betreffen agentische Workloads: xAI berichtet, dass das Modell bei langen Abläufen seine eigene Arbeit häufiger überprüft und stärkere erste Entwürfe für interaktive und visuelle Projekte erstellt. In Benchmarks stieg es von 54 % auf 65,9 % bei DeepSWE v1.1 und von 47,1 % auf 57,5 % bei APEX-Agents.
Wenn Sie bereits Grok 4.5 verwenden, bleibt die Integrationsoberfläche unverändert. Lesen Sie den Grok-4.5-API-Leitfaden und ersetzen Sie anschließend nur den Modellnamen.
Schritt 1: API-Schlüssel erstellen
- Öffnen Sie console.x.ai und melden Sie sich an oder erstellen Sie ein xAI-Konto.
- Öffnen Sie in der Seitenleiste API Keys.
- Klicken Sie auf Create API key.
- Benennen Sie den Schlüssel nach seiner Umgebung, etwa
grok-devodergrok-prod. - Kopieren Sie den Schlüssel sofort. xAI zeigt ihn nur einmal an.
Speichern Sie den Schlüssel als Umgebungsvariable, nicht im Quellcode:
export XAI_API_KEY="your-key-here"
Verwenden Sie separate Schlüssel für Entwicklung und Produktion. Legen Sie keine Schlüssel in Git ab. Wenn ein Schlüssel kompromittiert wurde, widerrufen Sie ihn in der Konsole und erstellen Sie einen neuen.
Schritt 2: Ersten Request mit curl senden
Die xAI API verwendet das OpenAI-Format für Chat Completions. Starten Sie mit diesem minimalen Request:
curl https://api.x.ai/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $XAI_API_KEY" \
-d '{
"model": "grok-4-6",
"messages": [
{"role": "system", "content": "You are a concise technical assistant."},
{"role": "user", "content": "Explain idempotency in REST APIs in two sentences."}
]
}'
Eine erfolgreiche Antwort enthält:
-
choices: die generierte Assistentenantwort -
usage: Tokenverbrauch für Input und Output
Protokollieren Sie usage von Beginn an. Dieser Block ist die Grundlage für Kostenkontrolle, Budgets und spätere Optimierung.
Wenn Sie model not found erhalten, prüfen Sie die Modelle, auf die Ihr Schlüssel zugreifen kann:
curl https://api.x.ai/v1/models \
-H "Authorization: Bearer $XAI_API_KEY"
Modell-IDs können sich zwischen der nativen API und Resellern unterscheiden. OpenRouter verwendet beispielsweise
x-ai/grok-4.6.
Schritt 3: Grok 4.6 mit Python und JavaScript verwenden
Da die API OpenAI-kompatibel ist, können Sie die offiziellen OpenAI-SDKs weiterverwenden. Ändern Sie nur die Basis-URL und den API-Schlüssel.
Python
from openai import OpenAI
import os
client = OpenAI(
api_key=os.environ["XAI_API_KEY"],
base_url="https://api.x.ai/v1",
)
response = client.chat.completions.create(
model="grok-4-6",
messages=[
{"role": "system", "content": "You are a concise technical assistant."},
{"role": "user", "content": "Write a Python function that validates an email address."},
],
)
print(response.choices[0].message.content)
print(response.usage)
JavaScript / TypeScript
import OpenAI from "openai";
const client = new OpenAI({
apiKey: process.env.XAI_API_KEY,
baseURL: "https://api.x.ai/v1",
});
const response = await client.chat.completions.create({
model: "grok-4-6",
messages: [
{ role: "system", content: "You are a concise technical assistant." },
{ role: "user", content: "Write a TypeScript type guard for a User object." },
],
});
console.log(response.choices[0].message.content);
Diese Kompatibilität vereinfacht auch A/B-Tests. Wenn Sie bereits die GPT-5.6 API einsetzen, können Sie Grok 4.6 über ein Konfigurations-Flag testen:
const baseURL =
process.env.LLM_PROVIDER === "xai"
? "https://api.x.ai/v1"
: undefined;
Schritt 4: Antworten streamen
Für benutzerorientierte Features sollten Sie Streaming aktivieren. Das ist besonders sinnvoll bei langen, mehrstufigen Antworten: Nutzer sehen die Ausgabe sofort, statt auf eine vollständige 2.000-Token-Antwort zu warten.
stream = client.chat.completions.create(
model="grok-4-6",
messages=[
{
"role": "user",
"content": "Refactor this function and explain each change: ..."
}
],
stream=True,
)
for chunk in stream:
delta = chunk.choices[0].delta.content
if delta:
print(delta, end="", flush=True)
Streaming-Antworten werden als Server-Sent Events (SSE) übertragen. Beim Debugging sollten Sie insbesondere auf diese Fehlerquellen achten:
- Der Client puffert Antworten statt Chunks direkt auszugeben.
- Ein Reverse Proxy entfernt oder blockiert SSE.
- Die UI verarbeitet eingehende Chunks nicht inkrementell.
- Einzelne
data:-Zeilen werden verworfen.
Apidog kann SSE-Chunks im Antwortbereich in Echtzeit darstellen. Dadurch lässt sich schneller erkennen, ob eine Verzögerung vom Modell oder vom Client-Buffering stammt.
Schritt 5: Das 500K-Kontextfenster kontrolliert einsetzen
Ein Fenster mit 500.000 Token kann eine mittelgroße Codebasis oder mehrere hundert Seiten Dokumentation aufnehmen. Das bedeutet aber nicht, dass Sie immer den gesamten Kontext mitsenden sollten.
Beachten Sie zwei Regeln:
Input-Kosten skalieren direkt mit dem Kontext.
Bei 2 $ pro Million Input-Token kostet ein Prompt mit 500.000 Token ungefähr 1 $, bevor das Modell Output erzeugt. Bei wiederholten Anfragen über denselben Korpus sollten Sie Inhalte cachen oder selektiv abrufen, statt alles erneut zu senden.Die Position im Prompt beeinflusst die Abrufqualität.
Platzieren Sie Regeln und Systemanweisungen am Anfang. Setzen Sie die konkrete Aufgabe oder Frage ans Ende. Referenzmaterial gehört dazwischen.
Eine praxistaugliche Prompt-Struktur sieht so aus:
1. Systemanweisungen und Ausgabeformat
2. Projektkontext und Referenzmaterial
3. Relevante Codeauszüge oder Dokumente
4. Konkrete Aufgabe und Akzeptanzkriterien
Die schnelle Variante zum doppelten Preis eignet sich für latenzkritische Features wie interaktive Coding-Assistenten. Für Batch-Jobs, nächtliche Analysen und Massenklassifizierung ist die Standardstufe naheliegend. Preisdetails und Vergleiche mit GPT-5.6 und Claude finden Sie in der Grok-4.5-Preisaufschlüsselung, deren Struktur weiterhin auf 4.6 zutrifft.
Die Integration mit Apidog testen
Ein erfolgreicher curl-Request ist noch keine produktionsreife Integration. Sie benötigen versionierte Requests, getrennte Umgebungen und reproduzierbare Fehlerfälle. So richten Sie den Workflow in Apidog ein:
- Erstellen Sie ein Projekt und eine Umgebung.
- Definieren Sie
base_url = https://api.x.ai/v1. - Speichern Sie
XAI_API_KEYals Umgebungsvariable. - Legen Sie getrennte Umgebungen für Entwicklung und Produktion an.
- Erstellen Sie einen
POST-Request für/chat/completions. - Konfigurieren Sie die Authentifizierung mit
Bearer {{XAI_API_KEY}}. - Speichern Sie den Request im Teamprojekt.
Für automatisierte Tests können Sie Assertions ergänzen:
-
choices[0].message.contentdarf nicht leer sein. -
usage.total_tokensdarf Ihr Budget nicht überschreiten. - Die Antwortzeit muss innerhalb Ihres SLA bleiben.
- Der HTTP-Status muss
200sein.
Für Frontends und Agenten-Workflows ist Mocking besonders hilfreich. Agenten können das Modell dutzende Male pro Aufgabe aufrufen; Tests gegen die Live-API werden dadurch teuer und langsam. Simulieren Sie den Happy Path für CI und testen Sie die echte API separat mit kontrollierten Testfällen.
Häufige Fehler und schnelle Lösungen
| Fehler | Mögliche Ursache | Lösung |
|---|---|---|
401 Nicht autorisiert |
Fehlender oder ungültiger Authorization-Header |
Prüfen Sie das Präfix Bearer und ob XAI_API_KEY in der verwendeten Shell gesetzt ist. |
404 Modell nicht gefunden |
Falsche Modell-ID für den Anbieter | Rufen Sie /v1/models auf. Reseller verwenden andere IDs, etwa x-ai/grok-4.6 bei OpenRouter. |
429 Zu viele Anfragen |
Ratenlimit erreicht oder Kontingent erschöpft | Verwenden Sie exponentielles Backoff und prüfen Sie die Nutzung in console.x.ai. |
| Abgeschnittene Ausgabe |
max_tokens ist für eine lange Agentenantwort zu niedrig |
Erhöhen Sie das Limit. Grok 4.6 kann bei mehrstufigen Aufgaben ausführlich antworten. |
| Blockierter Stream | Client-Buffering oder Proxy entfernt SSE | Prüfen Sie stream: true, deaktivieren Sie Proxy-Buffering und testen Sie den Rohstream in Apidog. |
FAQ
Ist die Grok-4.6-API OpenAI-kompatibel?
Ja. Der Chat-Completions-Endpunkt akzeptiert dieselbe Request-Struktur. Die offiziellen OpenAI-SDKs funktionieren, wenn Sie base_url auf https://api.x.ai/v1 setzen.
Wie viel kostet die Grok-4.6-API?
2 $ pro Million Input-Token und 6 $ pro Million Output-Token. Die schnelle Variante kostet das Doppelte. Für das 500K-Kontextfenster gibt es keine separate Gebühr; Sie zahlen für die tatsächlich gesendeten Token.
Benötige ich eine neue Integration, wenn ich Grok 4.5 verwende?
Nein. Tauschen Sie den Modellnamen aus. Request-Format, Authentifizierung und Endpunkte bleiben gegenüber Grok 4.5 unverändert.
Kann ich Grok 4.6 ohne xAI-Konto verwenden?
Ja, über OpenRouter, Vercel AI Gateway oder Cloudflare mit jeweils eigener Abrechnung. Bei hohem Volumen ist die native API typischerweise der günstigste Weg.


Top comments (0)