In der Ankündigung zu DeepSeek V4-Flash vom 31. Juli steht eine strategisch relevante Aussage: Das offizielle V4-Flash „unterstützt nativ das Responses-API-Format und ist vollständig an Codex angepasst“.
Das bedeutet praktisch: Ein chinesisches Open-Weight-Labor implementiert OpenAIs aktuelles API-Format serverseitig – einschließlich der Schnittstelle, die OpenAI für Agentenprodukte wie Codex verwendet. DeepSeek nennt die Motivation selbst: „Um der Nachfrage nach Codex gerecht zu werden, unterstützt unsere API jetzt das Responses API-Format.“
In diesem Beitrag prüfen Sie die Kompatibilität, testen die wichtigsten Unterschiede und binden V4-Flash in wenigen Minuten in Codex ein. Für die grundlegende API-Einrichtung starten Sie mit dem V4-Flash Public Beta Guide.
Warum die Responses API hier wichtig ist
OpenAI positioniert die Responses API als Nachfolger von Chat Completions. Sie bündelt agentische Workloads, Argumentationselemente, integrierte Tools und semantische Streaming-Ereignisse in einer Schnittstelle.
Eine Einführung in das Format finden Sie unter So verwenden Sie die OpenAI Responses API. Entscheidend ist hier: Codex spricht dieses Format nativ.
Bisher brauchten Sie für Nicht-OpenAI-Modelle hinter einem Responses-API-Client meist einen Übersetzungsproxy. DeepSeek implementiert das Format direkt unter https://api.deepseek.com. Das bestehende OpenAI SDK kann unverändert verwendet werden:
# pip3 install openai
from openai import OpenAI
client = OpenAI(
api_key="<your DeepSeek API key>",
base_url="https://api.deepseek.com"
)
response = client.responses.create(
model="deepseek-v4-flash",
instructions="You are a helpful assistant.",
input="Hi, how are you?",
)
print(response.output_text)
Wichtig: Die Responses API funktioniert aktuell nur mit deepseek-v4-flash. DeepSeek plant Unterstützung für deepseek-v4-pro für Anfang August 2026.
Wie vollständig ist die Kompatibilität?
DeepSeek veröffentlicht eine eigene Kompatibilitätsmatrix. Prüfen Sie diese vor der Migration, besonders wenn Ihr Client Zustandsverwaltung, Hintergrundaufgaben oder spezielle Streaming-Endmarker erwartet.
Unterstützt und funktionsfähig
-
inputundinstructionsals String oder Item-Liste -
streammit vollständiger semantischer Ereignissequenz -
temperature,top_p,max_output_tokensundtop_logprobs -
toolsmitfunction- undweb_search-Typen -
tool_choice, einschließlich der Erzwingung einer bestimmten Funktion -
reasoning.effortzur Steuerung der Denktiefe
Die Websuche wird serverseitig ausgeführt.
Akzeptiert, aber ohne Wirkung
Diese Parameter erzeugen keinen Fehler, haben jedoch aktuell keine funktionale Wirkung:
-
reasoning.summary: wird akzeptiert, erzeugt aber keine Zusammenfassung -
text.verbosity: wird akzeptiert, beeinflusst die Ausgabe aber nicht -
parallel_tool_calls: wird ignoriert, weil parallele Tool-Aufrufe immer aktiv sind
Absichtlich nicht unterstützt
DeepSeek implementiert die API zustandslos. Berücksichtigen Sie das in Ihrer Anwendungslogik:
-
previous_response_idundconversationwerden nicht unterstützt. -
storewird nicht unterstützt; Antworten enthaltenstore: false. -
background,metadata,include,service_tierund Prompt-Caching-Schlüssel werden nicht unterstützt. - Kontext-Caching erfolgt stattdessen automatisch.
Senden Sie bei Multi-Turn-Interaktionen den gesamten Gesprächsverlauf als Eingabeelementliste:
response = client.responses.create(
model="deepseek-v4-flash",
input=[
{
"role": "user",
"content": "Erkläre mir den bestehenden Code."
},
{
"role": "assistant",
"content": "Welche Datei soll ich zuerst prüfen?"
},
{
"role": "user",
"content": "Beginne mit src/api.py."
}
]
)
Nicht unterstützte Parameter werden laut DeepSeek stillschweigend ignoriert. Das erleichtert die Verbindung bestehender Responses-API-Clients, kann aber Konfigurationsfehler verdecken. Validieren Sie daher das tatsächliche Verhalten Ihrer Requests.
Beachten Sie außerdem das Kontextlimit: Überschreitet eine Anfrage das Fenster von 1 Million Tokens, antwortet die API mit HTTP 400. Sie kürzt den Kontext nicht automatisch.
Streaming korrekt implementieren
Das Streaming folgt dem Responses-API-Ereignismodell: von response.created bis response.completed.
Argumentationsdeltas kommen separat als response.reasoning_text.delta. Ausgabetext wird über eigene Output-Ereignisse übertragen. Es gibt keinen data: [DONE]-Terminator.
Beenden Sie Ihren SSE-Handler daher nicht erst bei [DONE], sondern bei einem dieser Ereignisse:
response.completedresponse.incompleteresponse.failed
Ein defensives Muster sieht so aus:
stream = client.responses.create(
model="deepseek-v4-flash",
input="Analysiere diese Funktion.",
stream=True
)
for event in stream:
if event.type == "response.reasoning_text.delta":
print(event.delta, end="", flush=True)
if event.type == "response.output_text.delta":
print(event.delta, end="", flush=True)
if event.type in {
"response.completed",
"response.incomplete",
"response.failed"
}:
break
Weitere defensive Parsing-Muster finden Sie im Beitrag Streamen von API-Antworten mit Server-Sent Events.
Codex mit DeepSeek V4-Flash einrichten
Codex kommuniziert über die Responses API. Genau deshalb ist diese DeepSeek-Veröffentlichung für Coding-Agent-Workflows relevant.
Der DeepSeek-Integrationsleitfaden für Codex bietet zwei Einrichtungswege. Die Konfiguration gilt für alle Codex-Clients, die dieselbe Konfiguration verwenden, einschließlich CLI, ChatGPT Desktop-App und VS-Code-Erweiterung.
Option 1: Ein-Klick-Skript ausführen
Installieren und starten Sie Codex CLI oder die ChatGPT Desktop-App mindestens einmal. Führen Sie dann unter macOS oder Linux aus:
bash <(curl -fsSL https://cdn.deepseek.com/api-docs/codex-deepseek-setup-en.sh)
Unter Windows verwenden Sie PowerShell:
irm https://cdn.deepseek.com/api-docs/codex-deepseek-setup-en.ps1 | iex
Beim ersten Durchlauf fragt das Skript nach Ihrem DeepSeek-API-Schlüssel. Anschließend führt es laut DeepSeek diese Schritte aus:
- Es sichert
~/.codex/config.tomlnach~/.codex/backup-deepseek/. - Es schreibt einen Modellkatalog nach
~/.codex/models.json. - Es ergänzt
config.tomlum[model_providers.deepseek]. - Es erhält MCP-Server und Projektvertrauenseinstellungen.
- Es validiert die Syntax, bevor Änderungen geschrieben werden.
Sie können das Skript erneut ausführen, um Modelle zu wechseln oder die ursprüngliche Konfiguration über das Menü wiederherzustellen.
Prüfen Sie Shell-Skripte vor der Ausführung, wenn Ihre Sicherheitsrichtlinie dies verlangt. Das Skript sichert und validiert Konfigurationen, bleibt aber ein Drittanbieter-Skript mit Zugriff auf Ihre Codex-Einstellungen.
Option 2: Modellkatalog prüfen
Die vom Skript erzeugte models.json dokumentiert die vorgesehene Codex-Konfiguration:
- Kontextfenster: 1.048.576 Tokens
- Denk-Ebenen:
low,highundmax - Standard für die Denktiefe:
high - Parallele Tool-Aufrufe werden unterstützt
- Erfordert Codex Client 0.144.0 oder neuer
Aktuell funktioniert nur deepseek-v4-flash. Der Katalog enthält bereits deepseek-v4-pro für die geplante Unterstützung Anfang August.
Behauptete Agentenleistung richtig einordnen
DeepSeek begründet das Re-Post-Training von 0731 mit agentischen Coding-Workloads. Die veröffentlichten Werte lauten:
| Benchmark | Gemeldeter Wert |
|---|---|
| Terminal Bench 2.1 | 82.7 |
| Cybergym | 76.7 |
| Toolathlon verifiziert | 70.3 |
| DeepSWE | 54.4 |
DeepSeek berichtet, dass diese Werte besser als V4-Pro-Preview seien. Behandeln Sie sie jedoch als Herstellerangaben, bis unabhängige Evaluierungen vorliegen. Die Werte wurden mit DeepSeeks eigenem Harness bei maximalem Aufwand erzeugt; zwei Benchmarks aus der Ankündigung sind interne Testsets.
Die genannten Preise betragen:
- 0,14 USD pro Million Input-Tokens bei Cache Miss
- 0,0028 USD pro Million Input-Tokens bei Cache Hit
- 0,28 USD pro Million Output-Tokens
Die vollständige Kostentabelle finden Sie im Preisabschnitt des Beta-Guides. Wenn Sie Codex gegen andere Coding-Agenten vergleichen, hilft der Vergleich Claude Code vs Codex CLI.
Endpunkt testen, bevor Sie Codex Zugriff auf ein Repository geben
Testen Sie einen neuen Beta-Endpunkt, bevor Sie ihn auf ein produktives Repository loslassen. In Apidog können Sie dafür eine wiederverwendbare Testsuite anlegen.
1. Responses-Endpunkt anlegen
Erstellen Sie eine Anfrage:
POST https://api.deepseek.com/responses
Authorization: Bearer {{DEEPSEEK_API_KEY}}
Content-Type: application/json
Speichern Sie den Schlüssel als Umgebungsvariable, nicht direkt in der Anfrage.
2. Minimale Payload senden
{
"model": "deepseek-v4-flash",
"instructions": "Du bist ein hilfreicher Assistent.",
"input": "Erkläre kurz, was eine Responses API ist."
}
Prüfen Sie die Ausgabeitems. Erwartet wird unter anderem ein reasoning-Element, gefolgt von einem message-Element.
3. Streaming-Verhalten validieren
Aktivieren Sie Streaming:
{
"model": "deepseek-v4-flash",
"input": "Erkläre Streaming mit Server-Sent Events.",
"stream": true
}
Beobachten Sie die Ereignisse live. So erkennen Sie schnell, ob Ihr Client auf response.output_text.delta reagiert oder auf ein Ereignis wartet, das dieser Endpunkt nicht sendet.
4. Tool-Aufrufe testen
Fügen Sie ein Function-Tool hinzu und prüfen Sie das Format von function_call:
{
"model": "deepseek-v4-flash",
"input": "Wie ist das Wetter in Berlin?",
"tools": [
{
"type": "function",
"name": "get_weather",
"description": "Liest die aktuelle Wetterlage für eine Stadt.",
"parameters": {
"type": "object",
"properties": {
"city": {
"type": "string"
}
},
"required": ["city"]
}
}
]
}
Wenn V4-Pro im Responses-API-Endpunkt verfügbar ist, führen Sie dieselben gespeicherten Requests mit dem neuen Modellnamen erneut aus. Vergleichen Sie dabei Antwortstruktur, Streaming-Ereignisse, Tool-Aufrufe und Fehlermeldungen.
Laden Sie Apidog kostenlos herunter und speichern Sie die Requests als gemeinsame Regression-Suite in einem Projekt.
FAQ
Welche DeepSeek-Modelle funktionieren mit der Responses API?
Aktuell nur deepseek-v4-flash. Unterstützung für deepseek-v4-pro ist für Anfang August 2026 geplant.
Benötige ich ein neues SDK?
Nein. Das offizielle OpenAI SDK funktioniert weiterhin. Setzen Sie base_url auf https://api.deepseek.com und verwenden Sie client.responses.create. Die grundlegende Einrichtung beschreibt der V4-Flash Public Beta Guide.
Funktioniert Multi-Turn-Zustand wie bei OpenAI?
Nein. Die DeepSeek-Implementierung ist zustandslos. previous_response_id, conversation und store werden nicht unterstützt. Übermitteln Sie den vollständigen Verlauf bei jedem Request erneut als Input-Items.
Kann ich DeepSeek in Codex neben meinem OpenAI-Konto verwenden?
Ja. Die Einrichtung ergänzt DeepSeek als Modellanbieter. Das Skript kann zwischen Modellen wechseln und sichert die ursprüngliche Konfiguration zur Wiederherstellung.
Ist das identisch mit der Anthropic-API-Kompatibilität?
Nein, das ist eine separate Funktion. DeepSeek bietet auch einen Endpunkt im Anthropic-Format unter https://api.deepseek.com/anthropic an, der Claude-Code-Integrationen ermöglicht. Der Responses-API-Endpunkt richtet sich an OpenAI-kompatible Agenten-Tools wie Codex.
Was diese Veröffentlichung signalisiert
Wenn sich Modellqualität annähert, wird Integration zum entscheidenden Faktor. DeepSeek implementiert nicht nur ein API-Format, sondern adressiert direkt den Workflow, in dem Entwickler mit Agenten wie Codex arbeiten.
Die praktische Konsequenz: Verwenden Sie nicht nur Benchmark-Tabellen. Testen Sie V4-Flash mit Ihren Repositories, Ihren Tool-Definitionen, Ihrem Streaming-Handler und Ihrer Testsuite.
Binden Sie das Modell in Apidog ein, führen Sie vergleichbare Aufgaben gegen mehrere Modelle aus und entscheiden Sie anhand Ihrer Ergebnisse.

Top comments (0)