DEV Community

Cover image for DeepSeek-V4-Flash API ist live: Offizielle Beta-Anleitung zur Nutzung der API
Emre Demir
Emre Demir

Posted on • Originally published at apidog.com

DeepSeek-V4-Flash API ist live: Offizielle Beta-Anleitung zur Nutzung der API

DeepSeek hat heute Morgen die offizielle DeepSeek-V4-Flash-API veröffentlicht. Die Ankündigung erfolgte am 31. Juli 2026. Laut Versionshinweisen verbessert das Release vor allem die Agentenfunktionen, unterstützt nativ das OpenAI-Responses-API-Format und funktioniert von Beginn an mit Codex.

Teste Apidog noch heute

Wenn Sie deepseek-v4-flash seit April verwenden, nutzten Sie bisher die Vorschauversion. Das offizielle Release heißt DeepSeek-V4-Flash-0731, aber der Modellname bleibt unverändert. Bestehende Integrationen erhalten das Upgrade daher ohne Codeänderungen.

Dieser Leitfaden zeigt die praktische Einrichtung: API-Schlüssel erstellen, ersten Request senden, Denkmodus konfigurieren, Streaming verarbeiten und Endpunkte testen. Wenn Sie die Modellfamilie noch nicht kennen, lesen Sie zuerst Was ist DeepSeek V4?.

💡 Sobald Sie einen Schlüssel haben, sollten Sie Endpunkte testen, bevor Sie sie in Ihre Anwendung integrieren. Mit Apidog können Sie DeepSeek-Requests senden, Streaming-Antworten Ereignis für Ereignis prüfen und funktionierende Requests als wiederverwendbare Tests speichern.

Was am 31. Juli tatsächlich veröffentlicht wurde

Laut dem offiziellen Änderungslog betrifft dieses Release ausschließlich die API. Die DeepSeek-App, die Web-Modelle und die V4-Pro-API bleiben unverändert.

  • DeepSeek-V4-Flash-0731 ist das offizielle Release der V4-Flash-Reihe und befindet sich über die API in der öffentlichen Beta.
  • Architektur und Modellgröße entsprechen V4-Flash-Preview. DeepSeek beschreibt das Modell als neu nachtrainiert; die Verbesserungen stammen also aus dem Training, nicht aus einem größeren Netzwerk.
  • Agenten-Benchmarks übertrafen V4-Pro-Preview. DeepSeek nennt Terminal Bench 2.1 mit 82,7, Cybergym mit 76,7, Toolathlon Verified mit 70,3 und DeepSWE mit 54,4. Das sind von DeepSeek veröffentlichte Werte, gemessen mit der eigenen Harness bei maximalem Aufwand.
  • Native Responses-API-Unterstützung und offizielle Codex-Integration sind verfügbar. Details finden Sie in DeepSeek-V4-Flash unterstützt jetzt die Responses API und Codex.
  • Die offizielle Veröffentlichung von DeepSeek-V4-Pro soll laut Änderungslog in Kürze folgen. Responses API und Codex für V4-Pro werden für Anfang August 2026 erwartet.

Die Benchmark-Aussage „übertrifft V4-Pro-Preview bei weitem“ stammt aus DeepSeeks eigener Bewertung. Außerdem sind DSBench-FullStack und DSBench-Hard interne Test-Sets. Unabhängige Ergebnisse werden erst in einigen Tagen erwartet.

DeepSeek-V4-Flash-0731 Benchmarks

Schritt 1: API-Schlüssel erstellen

Öffnen Sie die DeepSeek-Plattform, melden Sie sich an und erstellen Sie auf der API-Key-Seite einen Schlüssel. DeepSeek-Schlüssel beginnen mit sk-.

Speichern Sie den Schlüssel als Umgebungsvariable, statt ihn im Quellcode zu hinterlegen:

export DEEPSEEK_API_KEY="sk-your-key-here"
Enter fullscreen mode Exit fullscreen mode

Die API ist mit dem OpenAI- und Anthropic-Format kompatibel. Sie benötigen daher kein DeepSeek-spezifisches SDK.

Format Basis-URL
OpenAI-kompatibel https://api.deepseek.com
Anthropic-kompatibel https://api.deepseek.com/anthropic

Schritt 2: Ersten Request senden

Starten Sie mit einem einfachen curl-Request, um Schlüssel, Authentifizierung und Modellzugriff zu prüfen:

curl https://api.deepseek.com/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer ${DEEPSEEK_API_KEY}" \
  -d '{
    "model": "deepseek-v4-flash",
    "messages": [
      {"role": "system", "content": "You are a helpful assistant."},
      {"role": "user", "content": "Summarize what changed in DeepSeek-V4-Flash-0731."}
    ],
    "stream": false
  }'
Enter fullscreen mode Exit fullscreen mode

Python mit dem OpenAI SDK

# pip3 install openai
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ.get("DEEPSEEK_API_KEY"),
    base_url="https://api.deepseek.com"
)

response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[
        {"role": "system", "content": "You are a helpful assistant."},
        {
            "role": "user",
            "content": "Write a Python function that validates an email address."
        }
    ],
    stream=False
)

print(response.choices[0].message.content)
Enter fullscreen mode Exit fullscreen mode

Node.js mit dem OpenAI SDK

// npm install openai
import OpenAI from "openai";

const openai = new OpenAI({
  baseURL: "https://api.deepseek.com",
  apiKey: process.env.DEEPSEEK_API_KEY,
});

const completion = await openai.chat.completions.create({
  model: "deepseek-v4-flash",
  messages: [{ role: "user", content: "Hello!" }],
});

console.log(completion.choices[0].message.content);
Enter fullscreen mode Exit fullscreen mode

Der Modellname deepseek-v4-flash verweist jetzt auf das 0731-Release. Wenn Ihre Anwendung bereits die Vorschauversion verwendet, ist keine Migration erforderlich.

Schritt 3: Denkmodus und Denkaufwand steuern

V4-Flash unterstützt Denkmodus und Nicht-Denkmodus. Der Denkmodus ist standardmäßig aktiv. Steuern Sie ihn über thinking; die Tiefe legen Sie mit reasoning_effort fest:

response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[
        {
            "role": "user",
            "content": "Plan a database migration from MySQL to Postgres."
        }
    ],
    reasoning_effort="high",
    extra_body={"thinking": {"type": "enabled"}}
)
Enter fullscreen mode Exit fullscreen mode

Beachten Sie dabei zwei Einschränkungen:

  • temperature und top_p haben keine Wirkung, solange der Denkmodus aktiv ist.
  • FIM-Vervollständigung (Fill-in-the-Middle, weiterhin Beta) funktioniert nur im Nicht-Denkmodus.

Praktische Faustregel:

  • Nicht-Denkmodus: für latenzkritische Endpunkte wie Autovervollständigung.
  • Denkmodus mit hohem Aufwand: für Agenten-Loops, Planung und anspruchsvolles Debugging.

Schritt 4: Antworten streamen

Setzen Sie stream: true, um Server-Sent Events (SSE) zu erhalten. Wenn Sie SSE noch nicht in LLM-Anwendungen verarbeitet haben, erklärt der Leitfaden Streaming von LLM-Antworten mit Server-Sent Events das Format im Detail.

stream = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[
        {"role": "user", "content": "Explain connection pooling."}
    ],
    stream=True
)

for chunk in stream:
    if chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="")
Enter fullscreen mode Exit fullscreen mode

Preisgestaltung während der öffentlichen Beta

Laut der offiziellen Seite für Modelle und Preise bleibt V4-Flash günstig positioniert:

Artikel deepseek-v4-flash deepseek-v4-pro
Eingabe, Cache-Treffer (pro 1 Mio. Tokens) $0.0028 $0.003625
Eingabe, Cache-Fehlversuch (pro 1 Mio. Tokens) $0.14 $0.435
Ausgabe (pro 1 Mio. Tokens) $0.28 $0.87
Kontextlänge 1 Mio. Tokens 1 Mio. Tokens
Maximale Ausgabe 384K 384K
Gleichzeitigkeitslimit 2.500 500

Wichtige Punkte für die Implementierung:

  1. Caching erfolgt automatisch. Ein Cache-Treffer kostet 50-mal weniger als ein Cache-Fehlversuch. Wiederverwendete System-Prompts und langlaufende Agenten-Sitzungen profitieren besonders.
  2. Peak-/Off-Peak-Preise sind angekündigt. Die Nutzung zwischen 9:00–12:00 und 14:00–18:00 Uhr Pekinger Zeit soll zum doppelten Preis abgerechnet werden. Zum 31. Juli war dies laut Dokumentation noch nicht aktiv.
  3. Flash ist auf Parallelität ausgelegt. Das Limit von 2.500 gleichzeitigen Anfragen gegenüber 500 bei Pro ist besonders für Agenten-Flotten relevant.

Weitere Kosteninformationen, einschließlich der dauerhaften Preissenkung für V4-Pro, finden Sie in der DeepSeek-V4-API-Preisübersicht.

API in Apidog testen und debuggen

curl reicht für einen Smoke-Test. Für den Vergleich von Denkmodus und Nicht-Denkmodus oder für die Analyse von Tool-Call-Streams benötigen Sie jedoch mehr Transparenz. Diesen Workflow können Sie in etwa fünf Minuten in Apidog einrichten:

DeepSeek API in Apidog testen

  1. Projekt anlegen und Endpunkt hinzufügen.

    Erstellen Sie POST https://api.deepseek.com/chat/completions. Alternativ importieren Sie eine OpenAI-kompatible Spezifikation, um mehrere Endpunkte gleichzeitig anzulegen.

  2. API-Schlüssel als Umgebungsvariable speichern.

    Legen Sie DEEPSEEK_API_KEY in einer Apidog-Umgebung ab und verwenden Sie im Authorization-Header:

   Bearer {{DEEPSEEK_API_KEY}}
Enter fullscreen mode Exit fullscreen mode

Damit wechseln Sie zwischen Test- und Produktionsschlüssel per Dropdown.

  1. Request senden und Streaming prüfen.

    Bei Streaming-Requests rendert Apidog SSE-Ereignisse beim Eintreffen. So können Sie Reasoning- und Antwort-Deltas getrennt prüfen, statt rohe data:-Zeilen zu lesen.

  2. Varianten als Testfälle speichern.

    Speichern Sie je einen Request mit aktivem und deaktiviertem Denkmodus. Führen Sie beide nach Modell-Updates erneut aus, um Prompt-Regressionen früh zu erkennen.

Apidog kostenlos herunterladen. Der beschriebene Workflow funktioniert mit dem kostenlosen Plan.

FAQ

Muss ich meinen Code ändern, um das neue Modell zu erhalten?

Nein. deepseek-v4-flash verweist jetzt auf DeepSeek-V4-Flash-0731. Bestehende Integrationen werden automatisch aktualisiert.

Ist dies dasselbe Modell wie die DeepSeek-App?

Nein. Das Update vom 31. Juli betrifft nur die API. Die App- und Web-Modelle bleiben unverändert.

Was ist mit deepseek-chat und deepseek-reasoner passiert?

Diese älteren Modellnamen sollten am 24. Juli 2026 eingestellt werden. Verwenden Sie stattdessen deepseek-v4-flash oder deepseek-v4-pro. Der Leitfaden zur Nutzung der DeepSeek V4 API behandelt die Migration.

Kann ich DeepSeek V4-Flash kostenlos nutzen?

Die DeepSeek-API ist ein Pay-as-you-go-Dienst ohne dauerhaft kostenlosen Tarif. Cache-Treffer können Experimente jedoch sehr günstig machen. Aktuelle Optionen finden Sie unter Wie man die DeepSeek V4 API kostenlos nutzt.

Funktioniert V4-Flash mit Codex und der Responses API?

Ja. V4-Flash ist bislang das einzige DeepSeek-Modell mit Unterstützung für beides. Für V4-Pro wird die Unterstützung Anfang August 2026 erwartet. Eine vollständige Einrichtung finden Sie im Leitfaden für Responses API und Codex.

Fazit

DeepSeek-V4-Flash-0731 ist ein unauffälliges, aber relevantes Release: gleicher Modellname, gleiche Architektur und Preise, aber verbesserte Agenten-Ergebnisse in DeepSeeks eigenen Tests. Die Unterstützung für Responses API und Codex zeigt den Fokus auf Agenten-Workloads mit hoher Parallelität.

Richten Sie Ihr OpenAI SDK auf https://api.deepseek.com, testen Sie das Modell mit Ihrer eigenen Prompt-Suite und verlassen Sie sich nicht ausschließlich auf Benchmark-Tabellen. Apidog beschleunigt diesen Prozess: Speichern Sie Prompts als Testfälle, führen Sie sie bei jedem Modell-Update erneut aus und erkennen Sie stille Änderungen frühzeitig.

Top comments (0)