DEV Community

Cover image for DeepSeek-V4-Flash unterstützt jetzt Responses API und Codex: Das müssen Entwickler wissen
Emre Demir
Emre Demir

Posted on • Originally published at apidog.com

DeepSeek-V4-Flash unterstützt jetzt Responses API und Codex: Das müssen Entwickler wissen

In der Ankündigung zu DeepSeek V4-Flash vom 31. Juli steht eine strategisch relevante Aussage: Das offizielle V4-Flash „unterstützt nativ das Responses-API-Format und ist vollständig an Codex angepasst“.

Teste Apidog noch heute

Das bedeutet praktisch: Ein chinesisches Open-Weight-Labor implementiert OpenAIs aktuelles API-Format serverseitig – einschließlich der Schnittstelle, die OpenAI für Agentenprodukte wie Codex verwendet. DeepSeek nennt die Motivation selbst: „Um der Nachfrage nach Codex gerecht zu werden, unterstützt unsere API jetzt das Responses API-Format.“

In diesem Beitrag prüfen Sie die Kompatibilität, testen die wichtigsten Unterschiede und binden V4-Flash in wenigen Minuten in Codex ein. Für die grundlegende API-Einrichtung starten Sie mit dem V4-Flash Public Beta Guide.

Warum die Responses API hier wichtig ist

OpenAI positioniert die Responses API als Nachfolger von Chat Completions. Sie bündelt agentische Workloads, Argumentationselemente, integrierte Tools und semantische Streaming-Ereignisse in einer Schnittstelle.

Eine Einführung in das Format finden Sie unter So verwenden Sie die OpenAI Responses API. Entscheidend ist hier: Codex spricht dieses Format nativ.

Bisher brauchten Sie für Nicht-OpenAI-Modelle hinter einem Responses-API-Client meist einen Übersetzungsproxy. DeepSeek implementiert das Format direkt unter https://api.deepseek.com. Das bestehende OpenAI SDK kann unverändert verwendet werden:

# pip3 install openai
from openai import OpenAI

client = OpenAI(
    api_key="<your DeepSeek API key>",
    base_url="https://api.deepseek.com"
)

response = client.responses.create(
    model="deepseek-v4-flash",
    instructions="You are a helpful assistant.",
    input="Hi, how are you?",
)

print(response.output_text)
Enter fullscreen mode Exit fullscreen mode

Wichtig: Die Responses API funktioniert aktuell nur mit deepseek-v4-flash. DeepSeek plant Unterstützung für deepseek-v4-pro für Anfang August 2026.

DeepSeek V4-Flash Responses API

Wie vollständig ist die Kompatibilität?

DeepSeek veröffentlicht eine eigene Kompatibilitätsmatrix. Prüfen Sie diese vor der Migration, besonders wenn Ihr Client Zustandsverwaltung, Hintergrundaufgaben oder spezielle Streaming-Endmarker erwartet.

Unterstützt und funktionsfähig

  • input und instructions als String oder Item-Liste
  • stream mit vollständiger semantischer Ereignissequenz
  • temperature, top_p, max_output_tokens und top_logprobs
  • tools mit function- und web_search-Typen
  • tool_choice, einschließlich der Erzwingung einer bestimmten Funktion
  • reasoning.effort zur Steuerung der Denktiefe

Die Websuche wird serverseitig ausgeführt.

Akzeptiert, aber ohne Wirkung

Diese Parameter erzeugen keinen Fehler, haben jedoch aktuell keine funktionale Wirkung:

  • reasoning.summary: wird akzeptiert, erzeugt aber keine Zusammenfassung
  • text.verbosity: wird akzeptiert, beeinflusst die Ausgabe aber nicht
  • parallel_tool_calls: wird ignoriert, weil parallele Tool-Aufrufe immer aktiv sind

Absichtlich nicht unterstützt

DeepSeek implementiert die API zustandslos. Berücksichtigen Sie das in Ihrer Anwendungslogik:

  • previous_response_id und conversation werden nicht unterstützt.
  • store wird nicht unterstützt; Antworten enthalten store: false.
  • background, metadata, include, service_tier und Prompt-Caching-Schlüssel werden nicht unterstützt.
  • Kontext-Caching erfolgt stattdessen automatisch.

Senden Sie bei Multi-Turn-Interaktionen den gesamten Gesprächsverlauf als Eingabeelementliste:

response = client.responses.create(
    model="deepseek-v4-flash",
    input=[
        {
            "role": "user",
            "content": "Erkläre mir den bestehenden Code."
        },
        {
            "role": "assistant",
            "content": "Welche Datei soll ich zuerst prüfen?"
        },
        {
            "role": "user",
            "content": "Beginne mit src/api.py."
        }
    ]
)
Enter fullscreen mode Exit fullscreen mode

Nicht unterstützte Parameter werden laut DeepSeek stillschweigend ignoriert. Das erleichtert die Verbindung bestehender Responses-API-Clients, kann aber Konfigurationsfehler verdecken. Validieren Sie daher das tatsächliche Verhalten Ihrer Requests.

Beachten Sie außerdem das Kontextlimit: Überschreitet eine Anfrage das Fenster von 1 Million Tokens, antwortet die API mit HTTP 400. Sie kürzt den Kontext nicht automatisch.

Streaming korrekt implementieren

Das Streaming folgt dem Responses-API-Ereignismodell: von response.created bis response.completed.

Argumentationsdeltas kommen separat als response.reasoning_text.delta. Ausgabetext wird über eigene Output-Ereignisse übertragen. Es gibt keinen data: [DONE]-Terminator.

Beenden Sie Ihren SSE-Handler daher nicht erst bei [DONE], sondern bei einem dieser Ereignisse:

  • response.completed
  • response.incomplete
  • response.failed

Ein defensives Muster sieht so aus:

stream = client.responses.create(
    model="deepseek-v4-flash",
    input="Analysiere diese Funktion.",
    stream=True
)

for event in stream:
    if event.type == "response.reasoning_text.delta":
        print(event.delta, end="", flush=True)

    if event.type == "response.output_text.delta":
        print(event.delta, end="", flush=True)

    if event.type in {
        "response.completed",
        "response.incomplete",
        "response.failed"
    }:
        break
Enter fullscreen mode Exit fullscreen mode

Weitere defensive Parsing-Muster finden Sie im Beitrag Streamen von API-Antworten mit Server-Sent Events.

Codex mit DeepSeek V4-Flash einrichten

Codex kommuniziert über die Responses API. Genau deshalb ist diese DeepSeek-Veröffentlichung für Coding-Agent-Workflows relevant.

Der DeepSeek-Integrationsleitfaden für Codex bietet zwei Einrichtungswege. Die Konfiguration gilt für alle Codex-Clients, die dieselbe Konfiguration verwenden, einschließlich CLI, ChatGPT Desktop-App und VS-Code-Erweiterung.

Option 1: Ein-Klick-Skript ausführen

Installieren und starten Sie Codex CLI oder die ChatGPT Desktop-App mindestens einmal. Führen Sie dann unter macOS oder Linux aus:

bash <(curl -fsSL https://cdn.deepseek.com/api-docs/codex-deepseek-setup-en.sh)
Enter fullscreen mode Exit fullscreen mode

Unter Windows verwenden Sie PowerShell:

irm https://cdn.deepseek.com/api-docs/codex-deepseek-setup-en.ps1 | iex
Enter fullscreen mode Exit fullscreen mode

Beim ersten Durchlauf fragt das Skript nach Ihrem DeepSeek-API-Schlüssel. Anschließend führt es laut DeepSeek diese Schritte aus:

  1. Es sichert ~/.codex/config.toml nach ~/.codex/backup-deepseek/.
  2. Es schreibt einen Modellkatalog nach ~/.codex/models.json.
  3. Es ergänzt config.toml um [model_providers.deepseek].
  4. Es erhält MCP-Server und Projektvertrauenseinstellungen.
  5. Es validiert die Syntax, bevor Änderungen geschrieben werden.

Sie können das Skript erneut ausführen, um Modelle zu wechseln oder die ursprüngliche Konfiguration über das Menü wiederherzustellen.

Prüfen Sie Shell-Skripte vor der Ausführung, wenn Ihre Sicherheitsrichtlinie dies verlangt. Das Skript sichert und validiert Konfigurationen, bleibt aber ein Drittanbieter-Skript mit Zugriff auf Ihre Codex-Einstellungen.

Option 2: Modellkatalog prüfen

Die vom Skript erzeugte models.json dokumentiert die vorgesehene Codex-Konfiguration:

  • Kontextfenster: 1.048.576 Tokens
  • Denk-Ebenen: low, high und max
  • Standard für die Denktiefe: high
  • Parallele Tool-Aufrufe werden unterstützt
  • Erfordert Codex Client 0.144.0 oder neuer

Aktuell funktioniert nur deepseek-v4-flash. Der Katalog enthält bereits deepseek-v4-pro für die geplante Unterstützung Anfang August.

Behauptete Agentenleistung richtig einordnen

DeepSeek begründet das Re-Post-Training von 0731 mit agentischen Coding-Workloads. Die veröffentlichten Werte lauten:

Benchmark Gemeldeter Wert
Terminal Bench 2.1 82.7
Cybergym 76.7
Toolathlon verifiziert 70.3
DeepSWE 54.4

DeepSeek berichtet, dass diese Werte besser als V4-Pro-Preview seien. Behandeln Sie sie jedoch als Herstellerangaben, bis unabhängige Evaluierungen vorliegen. Die Werte wurden mit DeepSeeks eigenem Harness bei maximalem Aufwand erzeugt; zwei Benchmarks aus der Ankündigung sind interne Testsets.

Die genannten Preise betragen:

  • 0,14 USD pro Million Input-Tokens bei Cache Miss
  • 0,0028 USD pro Million Input-Tokens bei Cache Hit
  • 0,28 USD pro Million Output-Tokens

Die vollständige Kostentabelle finden Sie im Preisabschnitt des Beta-Guides. Wenn Sie Codex gegen andere Coding-Agenten vergleichen, hilft der Vergleich Claude Code vs Codex CLI.

Endpunkt testen, bevor Sie Codex Zugriff auf ein Repository geben

Testen Sie einen neuen Beta-Endpunkt, bevor Sie ihn auf ein produktives Repository loslassen. In Apidog können Sie dafür eine wiederverwendbare Testsuite anlegen.

1. Responses-Endpunkt anlegen

Erstellen Sie eine Anfrage:

POST https://api.deepseek.com/responses
Authorization: Bearer {{DEEPSEEK_API_KEY}}
Content-Type: application/json
Enter fullscreen mode Exit fullscreen mode

Speichern Sie den Schlüssel als Umgebungsvariable, nicht direkt in der Anfrage.

2. Minimale Payload senden

{
  "model": "deepseek-v4-flash",
  "instructions": "Du bist ein hilfreicher Assistent.",
  "input": "Erkläre kurz, was eine Responses API ist."
}
Enter fullscreen mode Exit fullscreen mode

Prüfen Sie die Ausgabeitems. Erwartet wird unter anderem ein reasoning-Element, gefolgt von einem message-Element.

3. Streaming-Verhalten validieren

Aktivieren Sie Streaming:

{
  "model": "deepseek-v4-flash",
  "input": "Erkläre Streaming mit Server-Sent Events.",
  "stream": true
}
Enter fullscreen mode Exit fullscreen mode

Beobachten Sie die Ereignisse live. So erkennen Sie schnell, ob Ihr Client auf response.output_text.delta reagiert oder auf ein Ereignis wartet, das dieser Endpunkt nicht sendet.

4. Tool-Aufrufe testen

Fügen Sie ein Function-Tool hinzu und prüfen Sie das Format von function_call:

{
  "model": "deepseek-v4-flash",
  "input": "Wie ist das Wetter in Berlin?",
  "tools": [
    {
      "type": "function",
      "name": "get_weather",
      "description": "Liest die aktuelle Wetterlage für eine Stadt.",
      "parameters": {
        "type": "object",
        "properties": {
          "city": {
            "type": "string"
          }
        },
        "required": ["city"]
      }
    }
  ]
}
Enter fullscreen mode Exit fullscreen mode

Wenn V4-Pro im Responses-API-Endpunkt verfügbar ist, führen Sie dieselben gespeicherten Requests mit dem neuen Modellnamen erneut aus. Vergleichen Sie dabei Antwortstruktur, Streaming-Ereignisse, Tool-Aufrufe und Fehlermeldungen.

Laden Sie Apidog kostenlos herunter und speichern Sie die Requests als gemeinsame Regression-Suite in einem Projekt.

FAQ

Welche DeepSeek-Modelle funktionieren mit der Responses API?

Aktuell nur deepseek-v4-flash. Unterstützung für deepseek-v4-pro ist für Anfang August 2026 geplant.

Benötige ich ein neues SDK?

Nein. Das offizielle OpenAI SDK funktioniert weiterhin. Setzen Sie base_url auf https://api.deepseek.com und verwenden Sie client.responses.create. Die grundlegende Einrichtung beschreibt der V4-Flash Public Beta Guide.

Funktioniert Multi-Turn-Zustand wie bei OpenAI?

Nein. Die DeepSeek-Implementierung ist zustandslos. previous_response_id, conversation und store werden nicht unterstützt. Übermitteln Sie den vollständigen Verlauf bei jedem Request erneut als Input-Items.

Kann ich DeepSeek in Codex neben meinem OpenAI-Konto verwenden?

Ja. Die Einrichtung ergänzt DeepSeek als Modellanbieter. Das Skript kann zwischen Modellen wechseln und sichert die ursprüngliche Konfiguration zur Wiederherstellung.

Ist das identisch mit der Anthropic-API-Kompatibilität?

Nein, das ist eine separate Funktion. DeepSeek bietet auch einen Endpunkt im Anthropic-Format unter https://api.deepseek.com/anthropic an, der Claude-Code-Integrationen ermöglicht. Der Responses-API-Endpunkt richtet sich an OpenAI-kompatible Agenten-Tools wie Codex.

Was diese Veröffentlichung signalisiert

Wenn sich Modellqualität annähert, wird Integration zum entscheidenden Faktor. DeepSeek implementiert nicht nur ein API-Format, sondern adressiert direkt den Workflow, in dem Entwickler mit Agenten wie Codex arbeiten.

Die praktische Konsequenz: Verwenden Sie nicht nur Benchmark-Tabellen. Testen Sie V4-Flash mit Ihren Repositories, Ihren Tool-Definitionen, Ihrem Streaming-Handler und Ihrer Testsuite.

Binden Sie das Modell in Apidog ein, führen Sie vergleichbare Aufgaben gegen mehrere Modelle aus und entscheiden Sie anhand Ihrer Ergebnisse.

Top comments (0)