DEV Community

Cover image for Wie nutzt man die DeepSeek V4 Pro 0813 API?
Emre Demir
Emre Demir

Posted on Originally published at apidog.com

Wie nutzt man die DeepSeek V4 Pro 0813 API?

DeepSeek V4 Pro hat die Vorabversion am 12. August 2026 verlassen. Der GA-Build mit der Kennzeichnung 0813 bedient nun den API-Endpunkt deepseek-v4-pro und bringt ein 1M-Token-Kontextfenster, bis zu 384K Ausgabe-Tokens sowie Eingabepreise ab 0,003625 $ pro Million Tokens bei Cache-Treffern. Wie Unite.AI berichtete, ist das Modell nach vier Monaten Preview nun DeepSeeks Flaggschiff.

Teste Apidog noch heute

Die Launch-Berichterstattung erklärt, was ausgeliefert wurde. Dieser Leitfaden zeigt, wie Sie den Endpunkt praktisch nutzen: erste Anfrage mit dem OpenAI SDK, Denkmodi und reasoning_content, Streaming, Tool-Aufrufe sowie Prompt-Caching. Für die Architektur-Grundlagen lesen Sie zuerst Was ist DeepSeek V4.

TL;DR

  • deepseek-v4-pro liefert seit dem 12. August 2026 den GA-Snapshot 0813.
  • Die API ist OpenAI-kompatibel: Setzen Sie im openai-SDK base_url="https://api.deepseek.com" und verwenden Sie model="deepseek-v4-pro".
  • Das Modell bietet 1M Kontext-Tokens, maximal 384K Ausgabe-Tokens und die Denkmodi non-think, think high und think max.
  • Bei Denkmodi enthält die Antwort zusätzlich reasoning_content.
  • Preise: 0,435 $/M Eingabe bei Cache-Fehlzugriff, 0,003625 $/M bei Cache-Treffern und 0,87 $/M Ausgabe.
  • Prompt-Caching erfolgt automatisch für wiederholte Prompt-Präfixe.
  • Testen Sie Pro und Flash getrennt und prüfen Sie SSE-Streams vor der Produktionsintegration, zum Beispiel in Apidog.

Was GA-Build 0813 für Entwickler ändert

Die Preview erschien im April 2026, DeepSeek V4 Flash im Juli 2026. Am 12. August wurde V4 Pro als allgemein verfügbarer Build 0813 veröffentlicht. Die Kennzeichnung folgt DeepSeeks Datumsstempelkonvention, ähnlich wie v3-0324 bei V3.

DeepSeek V4 Pro GA-Release

Für die Implementierung sind drei Punkte relevant:

  1. Stabiler Snapshot: Preview-Versionen können sich ändern und Evals oder Prompt-Tuning ungültig machen. Build 0813 ist ein festes Ziel, bis DeepSeek einen neuen Snapshot ankündigt.
  2. Produktions-Alias: Über die offizielle API verwenden Sie deepseek-v4-pro. Wenn Sie den Snapshot explizit adressieren müssen, listet OpenRouter deepseek/deepseek-v4-pro-0813.
  3. Vollständige API-Funktionen: Denkmodi, Funktionsaufrufe, strukturierte Ausgaben, Prompt-Caching sowie OpenAI-, Anthropic- und Responses-kompatible Formate stehen am GA-Endpunkt zur Verfügung.

V4 Pro ist ein Mixture-of-Experts-Modell mit 1,6 T Gesamtparametern und 49 B aktiven Parametern pro Token. Laut DeepSeek reduzieren Compressed Sparse Attention und Heavily Compressed Attention die Single-Token-Inferenzrechenleistung auf 27 % von V3.2 und den KV-Cache auf 10 %. Diese Reduzierung ermöglicht den 1M-Token-Kontext bei den genannten Preisen.

DeepSeek V4 Pro 0813: Spezifikationen

Spezifikation DeepSeek V4 Pro 0813
Veröffentlichung GA am 12. August 2026, Snapshot 0813
Architektur Mixture-of-Experts, 1,6 T Gesamtparameter, 49 Mrd. aktiv pro Token
Attention Compressed Sparse Attention + Heavily Compressed Attention
Inferenzkosten vs. V3.2 27 % der Single-Token-Rechenleistung, 10 % des KV-Cache
Kontextfenster 1.000.000 Tokens
Maximale Ausgabe 384K Tokens
Denkmodi non-think, think high, think max
Eingabepreis 0,435 $/M Tokens bei Cache-Fehlzugriff, 0,003625 $/M bei Cache-Treffer
Ausgabepreis 0,87 $/M Tokens
API-Formate OpenAI Chat Completions, Anthropic Messages, DeepSeek Responses
Modell-ID deepseek-v4-pro
Kleineres Modell deepseek-v4-flash: 284B gesamt / 13B aktiv, 0,14 $/M Eingabe, 0,28 $/M Ausgabe

DeepSeeks Modellkarte nennt für V4-Pro-Max unter anderem 80,6 % auf SWE-bench Verified, 67,9 % auf Terminal Bench 2.0, 90,1 % auf GPQA Diamond und 93,5 % auf LiveCodeBench. Das sind Herstellerangaben ohne unabhängige Verifizierung. Führen Sie daher vor einer Migration eigene, aufgabenspezifische Evals aus.

API-Schlüssel abrufen und erste Anfrage stellen

Die Einrichtung besteht aus vier Schritten:

  1. Erstellen Sie ein Konto auf platform.deepseek.com und laden Sie Guthaben auf. Die API ist prepaid.
  2. Öffnen Sie den Bereich für API-Schlüssel, erzeugen Sie einen Schlüssel und speichern Sie ihn sofort. Er wird nur einmal angezeigt.
  3. Exportieren Sie den Schlüssel als Umgebungsvariable.
  4. Verwenden Sie den OpenAI-kompatiblen Endpunkt.
export DEEPSEEK_API_KEY="sk-..."
Enter fullscreen mode Exit fullscreen mode

Installieren Sie das OpenAI SDK:

pip install openai
Enter fullscreen mode Exit fullscreen mode

Richten Sie den Client auf DeepSeek aus:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DEEPSEEK_API_KEY"],
    base_url="https://api.deepseek.com",
)

response = client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[
        {"role": "system", "content": "You are a concise technical assistant."},
        {
            "role": "user",
            "content": "Explain idempotency in REST APIs in two sentences.",
        },
    ],
)

print(response.choices[0].message.content)
print(response.usage)
Enter fullscreen mode Exit fullscreen mode

Sowohl https://api.deepseek.com als auch https://api.deepseek.com/v1 funktionieren als Basis-URL. Das Suffix /v1 steht für Protokollkompatibilität, nicht für eine Modellversion.

Prüfen Sie response.usage von Anfang an. Bei langen Prompts entscheidet das Verhältnis von Cache-Treffern und Cache-Fehlzugriffen direkt über die Kosten.

Für einen Smoke-Test ohne SDK genügt curl:

curl https://api.deepseek.com/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $DEEPSEEK_API_KEY" \
  -d '{
    "model": "deepseek-v4-pro",
    "messages": [
      {
        "role": "user",
        "content": "List three ways to version a REST API."
      }
    ]
  }'
Enter fullscreen mode Exit fullscreen mode

Die vollständige Parameterreferenz finden Sie in den offiziellen DeepSeek-Dokumenten. Dort sind auch der Anthropic-kompatible Endpunkt und DeepSeeks Responses API dokumentiert.

Mit den drei Denkmodi arbeiten

V4 Pro verwendet einen Endpunkt mit drei Denkbudgets:

  • non-think: Direkte Antwort ohne Denkphase. Geeignet für Klassifizierung, Extraktion, Formatierung und Zusammenfassungen.
  • think high: Das Modell denkt vor der Antwort und liefert die Denkphase über reasoning_content. Sinnvoll für Coding, Debugging und mehrstufige Analyse.
  • think max: Maximales Denkbudget. Reservieren Sie diesen Modus für besonders schwierige Aufgaben.

Die Auswahl erfolgt über reasoning_effort:

response = client.chat.completions.create(
    model="deepseek-v4-pro",
    reasoning_effort="high",  # "none" | "high" | "max"
    messages=[
        {
            "role": "user",
            "content": (
                "Our API returns 502s under load but only behind the CDN. "
                "Walk through likely causes in order of probability."
            ),
        },
    ],
)

message = response.choices[0].message

print("--- Reasoning ---")
print(message.reasoning_content)

print("--- Answer ---")
print(message.content)
Enter fullscreen mode Exit fullscreen mode

Beachten Sie dabei zwei Regeln:

  1. Senden Sie reasoning_content nicht in den Konversationsverlauf zurück. Verwenden Sie für vorherige Runden nur content.
  2. Denk-Tokens zählen als Ausgabe-Tokens und werden mit 0,87 $/M Tokens abgerechnet. think max erhöht daher Kosten und Latenz.

Wählen Sie den Modus pro Aufgabe statt pauschal immer das maximale Denkbudget zu aktivieren.

Antworten streamen

Bei bis zu 384K Ausgabe-Tokens sollten Sie für interaktive Anwendungen Streaming verwenden. Setzen Sie stream=True und behandeln Sie sowohl reasoning_content als auch normale Content-Deltas:

stream = client.chat.completions.create(
    model="deepseek-v4-pro",
    reasoning_effort="high",
    stream=True,
    messages=[
        {
            "role": "user",
            "content": (
                "Design a rate limiter for a public API. "
                "Compare token bucket and sliding window."
            ),
        },
    ],
)

for chunk in stream:
    if not chunk.choices:
        continue  # Der letzte Chunk kann nur Usage-Daten enthalten.

    delta = chunk.choices[0].delta

    if getattr(delta, "reasoning_content", None):
        print(delta.reasoning_content, end="", flush=True)
    elif delta.content:
        print(delta.content, end="", flush=True)
Enter fullscreen mode Exit fullscreen mode

Ein praktikables UI-Muster:

  1. Zeigen Sie eingehendes reasoning_content eingeklappt als „Denkt“-Status an.
  2. Wechseln Sie zur normalen Antwortdarstellung, sobald content-Deltas eintreffen.
  3. Speichern Sie Usage-Daten am Ende des Streams für Kostenmetriken.

Der Transport verwendet Server-Sent Events. Die grundlegende Implementierung erklärt der Leitfaden zu Streaming von API-Antworten mit SSE.

Tool-Aufrufe und strukturierte Ausgaben

V4 Pro unterstützt Funktionsaufrufe im OpenAI-Stil. Bestehende Agenten-Loops können daher grundsätzlich nach diesem Muster arbeiten:

  1. Definieren Sie Tools.
  2. Lesen Sie tool_calls aus der Modellantwort.
  3. Führen Sie das Tool in Ihrer Anwendung aus.
  4. Senden Sie das Tool-Ergebnis zurück.
  5. Wiederholen Sie den Ablauf bei weiteren Tool-Aufrufen.

Beispiel für eine Tool-Definition:

tools = [{
    "type": "function",
    "function": {
        "name": "get_endpoint_status",
        "description": "Check the health of an internal API endpoint",
        "parameters": {
            "type": "object",
            "properties": {
                "endpoint": {
                    "type": "string",
                    "description": "Path, e.g. /v1/orders",
                },
            },
            "required": ["endpoint"],
        },
    },
}]

response = client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[
        {
            "role": "user",
            "content": "Is /v1/orders healthy right now?",
        },
    ],
    tools=tools,
)

print(response.choices[0].message.tool_calls)
Enter fullscreen mode Exit fullscreen mode

Für garantiert parsbares JSON verwenden Sie response_format. Details zu Nachrichtenstruktur, Tool-Ergebnissen und mehrstufigen Loops finden Sie in den offiziellen DeepSeek-Dokumenten.

Prompt-Caching: Die Kostenrechnung, die Ihre Architektur beeinflusst

DeepSeek cached wiederholte Prompt-Präfixe automatisch. Sie benötigen keine Cache-Control-Header und keine TTL-Konfiguration.

Die Preisunterschiede sind erheblich:

  • Cache-Fehlzugriff: 0,435 $/M Eingabe-Tokens
  • Cache-Treffer: 0,003625 $/M Eingabe-Tokens

Das entspricht einem 120-fachen Rabatt für bereits bekannte Eingabe-Präfixe.

Angenommen, ein Coding-Agent arbeitet mit 200K Tokens Repository-Kontext und führt 50 Anfragen in einer Sitzung aus:

  • Ohne Caching: 50 × 200K Tokens × 0,435 $/M ≈ 4,35 $ Eingabekosten
  • Mit automatischem Caching: ein Fehlzugriff mit 0,087 $ plus 49 Treffer mit ungefähr 0,0007 $ pro Aufruf ≈ 0,12 $

Die gleiche Sitzung kostet damit ungefähr 35-mal weniger.

Strukturieren Sie Prompts deshalb von stabil nach dynamisch:

[System-Prompt]
[Stabile Richtlinien]
[Dokumentation]
[Repository-Kontext]
[Stabile Tool-Beschreibungen]
[Neueste Benutzernachricht]
[Zeitstempel oder Request-ID]
Enter fullscreen mode Exit fullscreen mode

Vermeiden Sie volatile Daten am Prompt-Anfang. Ein Zeitstempel im System-Prompt kann das gecachte Präfix bei jedem Aufruf ungültig machen und aus Cache-Treffern voll abgerechnete Fehlzugriffe machen.

Auch der 1M-Token-Kontext wird dadurch anders kalkulierbar:

  • 1M Tokens bei Cache-Fehlzugriff: 0,435 $
  • 1M Tokens als stabiles, gecachtes Sitzungspräfix: ungefähr ein Drittel Cent pro Aufruf

Weitere Grundlagen finden Sie in Was ist Prompt-Caching.

deepseek-v4-pro in Apidog testen

Testen Sie den Endpunkt vor der Produktionsintegration mit einem API-Client. Da DeepSeeks API OpenAI-kompatibel ist, kann Apidog die Requests ohne spezielle Anpassungen verarbeiten.

DeepSeek V4 Pro in Apidog testen

Gehen Sie dabei so vor:

  1. Curl-Befehl importieren: Fügen Sie den obigen curl-Request in Apidog ein. Header, Authentifizierung und JSON-Body werden in eine editierbare Anfrage übernommen.
  2. Pro- und Flash-Umgebungen anlegen: Speichern Sie base_url, API-Schlüssel und Modell-ID als Umgebungsvariablen. Der Wechsel zwischen deepseek-v4-pro und deepseek-v4-flash wird damit reproduzierbar.
  3. SSE-Stream prüfen: Senden Sie eine Anfrage mit "stream": true. Die Live-Zeitleiste zeigt, ob zuerst reasoning_content und danach die eigentliche Antwort eintrifft.
  4. Sammlung speichern: Bewahren Sie Testanfragen als Sammlung auf. Wenn DeepSeek einen neuen Snapshot veröffentlicht, können Sie identische Requests erneut ausführen und Verhalten vergleichen.

Prüfen Sie im Response-Viewer den usage-Block. Das ist ein schneller Weg, um Cache-Hit-Raten zu kontrollieren, während Sie die Prompt-Struktur optimieren.

Aktuelle Preise und die bevorstehende Erhöhung

Modell Eingabe: Fehlzugriff Eingabe: Cache-Treffer Ausgabe
deepseek-v4-pro 0,435 $/M 0,003625 $/M 0,87 $/M
deepseek-v4-flash 0,14 $/M 0,28 $/M

Am 6. August 2026, sechs Tage vor der GA-Veröffentlichung, warnte DeepSeek vor einer „erheblichen“ API-Preiserhöhung. Zahlen und Termin wurden nicht genannt.

Bis konkrete Preise vorliegen, sollten Sie:

  • Ihre Kosten pro Aufgabe mit echten usage-Daten messen.
  • Prompt-Präfixe stabil halten und Cache-Treffer maximieren.
  • V4 Flash als Routing-Fallback für einfache Aufgaben mit hohem Volumen einplanen.
  • V4 Pro für Agenten-Coding, Langkontext-Analysen und Denkmodus-Workloads reservieren.

Eine ausführlichere Kostenübersicht bietet der DeepSeek V4 API Preisleitfaden.

Häufig gestellte Fragen

Funktioniert mein bestehender OpenAI-SDK-Code unverändert?

Fast. Ändern Sie die base_url auf https://api.deepseek.com, verwenden Sie Ihren DeepSeek-API-Schlüssel und setzen Sie model="deepseek-v4-pro".

Chat Completions, Streaming, Tools und strukturierte Ausgaben folgen den OpenAI-Formaten. Wenn Sie bereits das Anthropic SDK verwenden, können Sie alternativ DeepSeeks Anthropic-Messages-Endpunkt nutzen.

Wann sollte ich V4 Flash statt V4 Pro verwenden?

V4 Flash mit 284B Gesamtparametern und 13B aktiven Parametern ist für Volumenaufgaben gedacht:

  • Klassifizierung
  • Extraktion
  • einfacher Chat
  • latenzsensitive Aufgaben ohne tiefes Reasoning

V4 Pro lohnt sich für Agenten-Coding, Langkontext-Analysen und Denkmodus-Aufgaben. Routen Sie nach Aufgabentyp und gemessener Qualität, nicht pauschal nach Modellpräferenz.

Kann ich V4 Pro 0813 in Cursor verwenden?

Ja. Cursor akzeptiert benutzerdefinierte OpenAI-kompatible Endpunkte. Damit lässt sich der GA-Build als benutzerdefiniertes Modell einrichten. Die konkrete Konfiguration zeigt So verwenden Sie DeepSeek V4 Pro mit Cursor.

Zusammenfassung

Für die Integration von DeepSeek V4 Pro sollten Sie vier Dinge direkt umsetzen:

  1. API-Schlüssel als Umgebungsvariable verwalten.
  2. Den OpenAI-kompatiblen Endpunkt mit deepseek-v4-pro ansprechen.
  3. Denkmodus und Streaming passend zur Aufgabe konfigurieren.
  4. Prompts so strukturieren, dass stabile Inhalte am Anfang und dynamische Inhalte am Ende stehen.

Der 120-fache Cache-Rabatt macht Prompt-Struktur zu einer Architekturentscheidung. Messen Sie usage, vergleichen Sie Pro und Flash mit reproduzierbaren Anfragen und speichern Sie eine Apidog-Sammlung für Regressionstests bei neuen Snapshots oder Preisänderungen.

Top comments (0)