DeepSeek V4 Pro hat die Vorabversion am 12. August 2026 verlassen. Der GA-Build mit der Kennzeichnung 0813 bedient nun den API-Endpunkt deepseek-v4-pro und bringt ein 1M-Token-Kontextfenster, bis zu 384K Ausgabe-Tokens sowie Eingabepreise ab 0,003625 $ pro Million Tokens bei Cache-Treffern. Wie Unite.AI berichtete, ist das Modell nach vier Monaten Preview nun DeepSeeks Flaggschiff.
Die Launch-Berichterstattung erklärt, was ausgeliefert wurde. Dieser Leitfaden zeigt, wie Sie den Endpunkt praktisch nutzen: erste Anfrage mit dem OpenAI SDK, Denkmodi und reasoning_content, Streaming, Tool-Aufrufe sowie Prompt-Caching. Für die Architektur-Grundlagen lesen Sie zuerst Was ist DeepSeek V4.
TL;DR
-
deepseek-v4-proliefert seit dem 12. August 2026 den GA-Snapshot0813. - Die API ist OpenAI-kompatibel: Setzen Sie im
openai-SDKbase_url="https://api.deepseek.com"und verwenden Siemodel="deepseek-v4-pro". - Das Modell bietet 1M Kontext-Tokens, maximal 384K Ausgabe-Tokens und die Denkmodi
non-think,think highundthink max. - Bei Denkmodi enthält die Antwort zusätzlich
reasoning_content. - Preise: 0,435 $/M Eingabe bei Cache-Fehlzugriff, 0,003625 $/M bei Cache-Treffern und 0,87 $/M Ausgabe.
- Prompt-Caching erfolgt automatisch für wiederholte Prompt-Präfixe.
- Testen Sie Pro und Flash getrennt und prüfen Sie SSE-Streams vor der Produktionsintegration, zum Beispiel in Apidog.
Was GA-Build 0813 für Entwickler ändert
Die Preview erschien im April 2026, DeepSeek V4 Flash im Juli 2026. Am 12. August wurde V4 Pro als allgemein verfügbarer Build 0813 veröffentlicht. Die Kennzeichnung folgt DeepSeeks Datumsstempelkonvention, ähnlich wie v3-0324 bei V3.
Für die Implementierung sind drei Punkte relevant:
-
Stabiler Snapshot: Preview-Versionen können sich ändern und Evals oder Prompt-Tuning ungültig machen. Build
0813ist ein festes Ziel, bis DeepSeek einen neuen Snapshot ankündigt. -
Produktions-Alias: Über die offizielle API verwenden Sie
deepseek-v4-pro. Wenn Sie den Snapshot explizit adressieren müssen, listet OpenRouterdeepseek/deepseek-v4-pro-0813. - Vollständige API-Funktionen: Denkmodi, Funktionsaufrufe, strukturierte Ausgaben, Prompt-Caching sowie OpenAI-, Anthropic- und Responses-kompatible Formate stehen am GA-Endpunkt zur Verfügung.
V4 Pro ist ein Mixture-of-Experts-Modell mit 1,6 T Gesamtparametern und 49 B aktiven Parametern pro Token. Laut DeepSeek reduzieren Compressed Sparse Attention und Heavily Compressed Attention die Single-Token-Inferenzrechenleistung auf 27 % von V3.2 und den KV-Cache auf 10 %. Diese Reduzierung ermöglicht den 1M-Token-Kontext bei den genannten Preisen.
DeepSeek V4 Pro 0813: Spezifikationen
| Spezifikation | DeepSeek V4 Pro 0813 |
|---|---|
| Veröffentlichung | GA am 12. August 2026, Snapshot 0813
|
| Architektur | Mixture-of-Experts, 1,6 T Gesamtparameter, 49 Mrd. aktiv pro Token |
| Attention | Compressed Sparse Attention + Heavily Compressed Attention |
| Inferenzkosten vs. V3.2 | 27 % der Single-Token-Rechenleistung, 10 % des KV-Cache |
| Kontextfenster | 1.000.000 Tokens |
| Maximale Ausgabe | 384K Tokens |
| Denkmodi |
non-think, think high, think max
|
| Eingabepreis | 0,435 $/M Tokens bei Cache-Fehlzugriff, 0,003625 $/M bei Cache-Treffer |
| Ausgabepreis | 0,87 $/M Tokens |
| API-Formate | OpenAI Chat Completions, Anthropic Messages, DeepSeek Responses |
| Modell-ID | deepseek-v4-pro |
| Kleineres Modell |
deepseek-v4-flash: 284B gesamt / 13B aktiv, 0,14 $/M Eingabe, 0,28 $/M Ausgabe |
DeepSeeks Modellkarte nennt für V4-Pro-Max unter anderem 80,6 % auf SWE-bench Verified, 67,9 % auf Terminal Bench 2.0, 90,1 % auf GPQA Diamond und 93,5 % auf LiveCodeBench. Das sind Herstellerangaben ohne unabhängige Verifizierung. Führen Sie daher vor einer Migration eigene, aufgabenspezifische Evals aus.
API-Schlüssel abrufen und erste Anfrage stellen
Die Einrichtung besteht aus vier Schritten:
- Erstellen Sie ein Konto auf platform.deepseek.com und laden Sie Guthaben auf. Die API ist prepaid.
- Öffnen Sie den Bereich für API-Schlüssel, erzeugen Sie einen Schlüssel und speichern Sie ihn sofort. Er wird nur einmal angezeigt.
- Exportieren Sie den Schlüssel als Umgebungsvariable.
- Verwenden Sie den OpenAI-kompatiblen Endpunkt.
export DEEPSEEK_API_KEY="sk-..."
Installieren Sie das OpenAI SDK:
pip install openai
Richten Sie den Client auf DeepSeek aus:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DEEPSEEK_API_KEY"],
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[
{"role": "system", "content": "You are a concise technical assistant."},
{
"role": "user",
"content": "Explain idempotency in REST APIs in two sentences.",
},
],
)
print(response.choices[0].message.content)
print(response.usage)
Sowohl https://api.deepseek.com als auch https://api.deepseek.com/v1 funktionieren als Basis-URL. Das Suffix /v1 steht für Protokollkompatibilität, nicht für eine Modellversion.
Prüfen Sie response.usage von Anfang an. Bei langen Prompts entscheidet das Verhältnis von Cache-Treffern und Cache-Fehlzugriffen direkt über die Kosten.
Für einen Smoke-Test ohne SDK genügt curl:
curl https://api.deepseek.com/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $DEEPSEEK_API_KEY" \
-d '{
"model": "deepseek-v4-pro",
"messages": [
{
"role": "user",
"content": "List three ways to version a REST API."
}
]
}'
Die vollständige Parameterreferenz finden Sie in den offiziellen DeepSeek-Dokumenten. Dort sind auch der Anthropic-kompatible Endpunkt und DeepSeeks Responses API dokumentiert.
Mit den drei Denkmodi arbeiten
V4 Pro verwendet einen Endpunkt mit drei Denkbudgets:
-
non-think: Direkte Antwort ohne Denkphase. Geeignet für Klassifizierung, Extraktion, Formatierung und Zusammenfassungen. -
think high: Das Modell denkt vor der Antwort und liefert die Denkphase überreasoning_content. Sinnvoll für Coding, Debugging und mehrstufige Analyse. -
think max: Maximales Denkbudget. Reservieren Sie diesen Modus für besonders schwierige Aufgaben.
Die Auswahl erfolgt über reasoning_effort:
response = client.chat.completions.create(
model="deepseek-v4-pro",
reasoning_effort="high", # "none" | "high" | "max"
messages=[
{
"role": "user",
"content": (
"Our API returns 502s under load but only behind the CDN. "
"Walk through likely causes in order of probability."
),
},
],
)
message = response.choices[0].message
print("--- Reasoning ---")
print(message.reasoning_content)
print("--- Answer ---")
print(message.content)
Beachten Sie dabei zwei Regeln:
- Senden Sie
reasoning_contentnicht in den Konversationsverlauf zurück. Verwenden Sie für vorherige Runden nurcontent. - Denk-Tokens zählen als Ausgabe-Tokens und werden mit 0,87 $/M Tokens abgerechnet.
think maxerhöht daher Kosten und Latenz.
Wählen Sie den Modus pro Aufgabe statt pauschal immer das maximale Denkbudget zu aktivieren.
Antworten streamen
Bei bis zu 384K Ausgabe-Tokens sollten Sie für interaktive Anwendungen Streaming verwenden. Setzen Sie stream=True und behandeln Sie sowohl reasoning_content als auch normale Content-Deltas:
stream = client.chat.completions.create(
model="deepseek-v4-pro",
reasoning_effort="high",
stream=True,
messages=[
{
"role": "user",
"content": (
"Design a rate limiter for a public API. "
"Compare token bucket and sliding window."
),
},
],
)
for chunk in stream:
if not chunk.choices:
continue # Der letzte Chunk kann nur Usage-Daten enthalten.
delta = chunk.choices[0].delta
if getattr(delta, "reasoning_content", None):
print(delta.reasoning_content, end="", flush=True)
elif delta.content:
print(delta.content, end="", flush=True)
Ein praktikables UI-Muster:
- Zeigen Sie eingehendes
reasoning_contenteingeklappt als „Denkt“-Status an. - Wechseln Sie zur normalen Antwortdarstellung, sobald
content-Deltas eintreffen. - Speichern Sie Usage-Daten am Ende des Streams für Kostenmetriken.
Der Transport verwendet Server-Sent Events. Die grundlegende Implementierung erklärt der Leitfaden zu Streaming von API-Antworten mit SSE.
Tool-Aufrufe und strukturierte Ausgaben
V4 Pro unterstützt Funktionsaufrufe im OpenAI-Stil. Bestehende Agenten-Loops können daher grundsätzlich nach diesem Muster arbeiten:
- Definieren Sie Tools.
- Lesen Sie
tool_callsaus der Modellantwort. - Führen Sie das Tool in Ihrer Anwendung aus.
- Senden Sie das Tool-Ergebnis zurück.
- Wiederholen Sie den Ablauf bei weiteren Tool-Aufrufen.
Beispiel für eine Tool-Definition:
tools = [{
"type": "function",
"function": {
"name": "get_endpoint_status",
"description": "Check the health of an internal API endpoint",
"parameters": {
"type": "object",
"properties": {
"endpoint": {
"type": "string",
"description": "Path, e.g. /v1/orders",
},
},
"required": ["endpoint"],
},
},
}]
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[
{
"role": "user",
"content": "Is /v1/orders healthy right now?",
},
],
tools=tools,
)
print(response.choices[0].message.tool_calls)
Für garantiert parsbares JSON verwenden Sie response_format. Details zu Nachrichtenstruktur, Tool-Ergebnissen und mehrstufigen Loops finden Sie in den offiziellen DeepSeek-Dokumenten.
Prompt-Caching: Die Kostenrechnung, die Ihre Architektur beeinflusst
DeepSeek cached wiederholte Prompt-Präfixe automatisch. Sie benötigen keine Cache-Control-Header und keine TTL-Konfiguration.
Die Preisunterschiede sind erheblich:
- Cache-Fehlzugriff: 0,435 $/M Eingabe-Tokens
- Cache-Treffer: 0,003625 $/M Eingabe-Tokens
Das entspricht einem 120-fachen Rabatt für bereits bekannte Eingabe-Präfixe.
Angenommen, ein Coding-Agent arbeitet mit 200K Tokens Repository-Kontext und führt 50 Anfragen in einer Sitzung aus:
- Ohne Caching: 50 × 200K Tokens × 0,435 $/M ≈ 4,35 $ Eingabekosten
- Mit automatischem Caching: ein Fehlzugriff mit 0,087 $ plus 49 Treffer mit ungefähr 0,0007 $ pro Aufruf ≈ 0,12 $
Die gleiche Sitzung kostet damit ungefähr 35-mal weniger.
Strukturieren Sie Prompts deshalb von stabil nach dynamisch:
[System-Prompt]
[Stabile Richtlinien]
[Dokumentation]
[Repository-Kontext]
[Stabile Tool-Beschreibungen]
[Neueste Benutzernachricht]
[Zeitstempel oder Request-ID]
Vermeiden Sie volatile Daten am Prompt-Anfang. Ein Zeitstempel im System-Prompt kann das gecachte Präfix bei jedem Aufruf ungültig machen und aus Cache-Treffern voll abgerechnete Fehlzugriffe machen.
Auch der 1M-Token-Kontext wird dadurch anders kalkulierbar:
- 1M Tokens bei Cache-Fehlzugriff: 0,435 $
- 1M Tokens als stabiles, gecachtes Sitzungspräfix: ungefähr ein Drittel Cent pro Aufruf
Weitere Grundlagen finden Sie in Was ist Prompt-Caching.
deepseek-v4-pro in Apidog testen
Testen Sie den Endpunkt vor der Produktionsintegration mit einem API-Client. Da DeepSeeks API OpenAI-kompatibel ist, kann Apidog die Requests ohne spezielle Anpassungen verarbeiten.
Gehen Sie dabei so vor:
-
Curl-Befehl importieren: Fügen Sie den obigen
curl-Request in Apidog ein. Header, Authentifizierung und JSON-Body werden in eine editierbare Anfrage übernommen. -
Pro- und Flash-Umgebungen anlegen: Speichern Sie
base_url, API-Schlüssel und Modell-ID als Umgebungsvariablen. Der Wechsel zwischendeepseek-v4-prounddeepseek-v4-flashwird damit reproduzierbar. -
SSE-Stream prüfen: Senden Sie eine Anfrage mit
"stream": true. Die Live-Zeitleiste zeigt, ob zuerstreasoning_contentund danach die eigentliche Antwort eintrifft. - Sammlung speichern: Bewahren Sie Testanfragen als Sammlung auf. Wenn DeepSeek einen neuen Snapshot veröffentlicht, können Sie identische Requests erneut ausführen und Verhalten vergleichen.
Prüfen Sie im Response-Viewer den usage-Block. Das ist ein schneller Weg, um Cache-Hit-Raten zu kontrollieren, während Sie die Prompt-Struktur optimieren.
Aktuelle Preise und die bevorstehende Erhöhung
| Modell | Eingabe: Fehlzugriff | Eingabe: Cache-Treffer | Ausgabe |
|---|---|---|---|
deepseek-v4-pro |
0,435 $/M | 0,003625 $/M | 0,87 $/M |
deepseek-v4-flash |
0,14 $/M | 0,28 $/M |
Am 6. August 2026, sechs Tage vor der GA-Veröffentlichung, warnte DeepSeek vor einer „erheblichen“ API-Preiserhöhung. Zahlen und Termin wurden nicht genannt.
Bis konkrete Preise vorliegen, sollten Sie:
- Ihre Kosten pro Aufgabe mit echten
usage-Daten messen. - Prompt-Präfixe stabil halten und Cache-Treffer maximieren.
- V4 Flash als Routing-Fallback für einfache Aufgaben mit hohem Volumen einplanen.
- V4 Pro für Agenten-Coding, Langkontext-Analysen und Denkmodus-Workloads reservieren.
Eine ausführlichere Kostenübersicht bietet der DeepSeek V4 API Preisleitfaden.
Häufig gestellte Fragen
Funktioniert mein bestehender OpenAI-SDK-Code unverändert?
Fast. Ändern Sie die base_url auf https://api.deepseek.com, verwenden Sie Ihren DeepSeek-API-Schlüssel und setzen Sie model="deepseek-v4-pro".
Chat Completions, Streaming, Tools und strukturierte Ausgaben folgen den OpenAI-Formaten. Wenn Sie bereits das Anthropic SDK verwenden, können Sie alternativ DeepSeeks Anthropic-Messages-Endpunkt nutzen.
Wann sollte ich V4 Flash statt V4 Pro verwenden?
V4 Flash mit 284B Gesamtparametern und 13B aktiven Parametern ist für Volumenaufgaben gedacht:
- Klassifizierung
- Extraktion
- einfacher Chat
- latenzsensitive Aufgaben ohne tiefes Reasoning
V4 Pro lohnt sich für Agenten-Coding, Langkontext-Analysen und Denkmodus-Aufgaben. Routen Sie nach Aufgabentyp und gemessener Qualität, nicht pauschal nach Modellpräferenz.
Kann ich V4 Pro 0813 in Cursor verwenden?
Ja. Cursor akzeptiert benutzerdefinierte OpenAI-kompatible Endpunkte. Damit lässt sich der GA-Build als benutzerdefiniertes Modell einrichten. Die konkrete Konfiguration zeigt So verwenden Sie DeepSeek V4 Pro mit Cursor.
Zusammenfassung
Für die Integration von DeepSeek V4 Pro sollten Sie vier Dinge direkt umsetzen:
- API-Schlüssel als Umgebungsvariable verwalten.
- Den OpenAI-kompatiblen Endpunkt mit
deepseek-v4-proansprechen. - Denkmodus und Streaming passend zur Aufgabe konfigurieren.
- Prompts so strukturieren, dass stabile Inhalte am Anfang und dynamische Inhalte am Ende stehen.
Der 120-fache Cache-Rabatt macht Prompt-Struktur zu einer Architekturentscheidung. Messen Sie usage, vergleichen Sie Pro und Flash mit reproduzierbaren Anfragen und speichern Sie eine Apidog-Sammlung für Regressionstests bei neuen Snapshots oder Preisänderungen.


Top comments (0)