DEV Community

Cover image for DeepSeek-V4-Flash API公開:公式APIの使い方(パブリックベータガイド)
Akira
Akira

Posted on • Originally published at apidog.com

DeepSeek-V4-Flash API公開:公式APIの使い方(パブリックベータガイド)

今朝、DeepSeekは公式のDeepSeek-V4-Flash APIをリリースしました。発表は2026年7月31日に行われ、エージェント機能の強化、OpenAI Responses APIフォーマットへのネイティブ対応、Codex対応の3点が公開されています。

Apidogを今すぐ試す

4月以降にdeepseek-v4-flashを呼び出していた場合、それはプレビュー版でした。今回、モデルは公式版のDeepSeek-V4-Flash-0731へ昇格しましたが、モデル名は変わりません。つまり、既存コードを変更せずにアップグレードが適用されます。

この記事では、APIキーの取得、最初のリクエスト、思考モードの制御、ストリーミング、料金、テスト方法までを実装手順として説明します。DeepSeek V4ファミリーが初めての場合は、先にDeepSeek V4とは?を確認してください。

💡 APIキー取得後は、アプリケーションに組み込む前にエンドポイントを検証するのがおすすめです。Apidogなら、DeepSeek APIへリクエストを送り、ストリーミング応答をイベント単位で確認し、成功した呼び出しを再利用可能なテストとして保存できます。

7月31日にリリースされた内容

公式変更ログによると、今回のアップデート対象はAPIです。DeepSeekアプリ、Web版モデル、V4-Pro APIは変更されていません。

  • DeepSeek-V4-Flash-0731は、APIでパブリックベータ提供されているV4-Flashラインの公式リリースです。
  • V4-Flash-Previewとアーキテクチャおよびサイズは同じです。DeepSeekによると、性能向上はネットワーク拡大ではなく、再学習によるものです。
  • エージェント系ベンチマークでV4-Pro-Previewを上回ったとDeepSeekは報告しています。数値はTerminal Bench 2.1が82.7、Cybergymが76.7、Toolathlon検証済みが70.3、DeepSWEが54.4です。
  • Responses APIのネイティブサポートとCodex統合を提供します。詳細はDeepSeek-V4-FlashがResponses APIとCodexに対応を参照してください。
  • DeepSeek-V4-Proの公式リリースは、変更ログでは「まもなく追って行われる」とされています。V4-ProのResponses APIおよびCodex対応は2026年8月上旬予定です。

ベンチマーク値はDeepSeek自身が公開した評価結果です。また、DSBench-FullStackとDSBench-Hardは社内テストセットです。採用判断では、公開ベンチマークだけでなく、自分のプロンプト・ツール・データを使った評価を実施してください。

DeepSeek-V4-Flashのリリース情報

ステップ1:APIキーを取得する

DeepSeek Platformにアクセスし、サインイン後にAPIキーページからキーを作成します。キーはsk-で始まります。

キーをソースコードへ直接書き込まず、環境変数として設定してください。

export DEEPSEEK_API_KEY="sk-your-key-here"
Enter fullscreen mode Exit fullscreen mode

DeepSeek APIはOpenAIおよびAnthropicのAPIフォーマットと互換性があります。そのため、DeepSeek専用SDKは必須ではありません。

フォーマット ベースURL
OpenAI互換 https://api.deepseek.com
Anthropic互換 https://api.deepseek.com/anthropic

ステップ2:最初の呼び出しを行う

まずはcurlで疎通確認します。

curl https://api.deepseek.com/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer ${DEEPSEEK_API_KEY}" \
  -d '{
    "model": "deepseek-v4-flash",
    "messages": [
      {"role": "system", "content": "You are a helpful assistant."},
      {"role": "user", "content": "Summarize what changed in DeepSeek-V4-Flash-0731."}
    ],
    "stream": false
  }'
Enter fullscreen mode Exit fullscreen mode

正常に応答が返れば、SDKからも同じベースURLとモデル名を使用できます。

Python(OpenAI SDK)

# pip3 install openai
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ.get("DEEPSEEK_API_KEY"),
    base_url="https://api.deepseek.com"
)

response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[
        {"role": "system", "content": "You are a helpful assistant."},
        {
            "role": "user",
            "content": "Write a Python function that validates an email address."
        }
    ],
    stream=False
)

print(response.choices[0].message.content)
Enter fullscreen mode Exit fullscreen mode

Node.js(OpenAI SDK)

// npm install openai
import OpenAI from "openai";

const openai = new OpenAI({
  baseURL: "https://api.deepseek.com",
  apiKey: process.env.DEEPSEEK_API_KEY,
});

const completion = await openai.chat.completions.create({
  model: "deepseek-v4-flash",
  messages: [
    { role: "user", content: "Hello!" }
  ],
});

console.log(completion.choices[0].message.content);
Enter fullscreen mode Exit fullscreen mode

deepseek-v4-flashは0731リリースを指すため、プレビュー版に対して構築した既存の統合は新バージョンを自動的に使用します。移行作業は不要です。

ステップ3:思考モードと推論努力を制御する

V4-Flashは非思考モードと思考モードをサポートしており、思考モードがデフォルトです。

  • thinking:思考モードの有効・無効を制御
  • reasoning_effort:推論の深さを指定
response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[
        {
            "role": "user",
            "content": "Plan a database migration from MySQL to Postgres."
        }
    ],
    reasoning_effort="high",
    extra_body={
        "thinking": {
            "type": "enabled"
        }
    }
)
Enter fullscreen mode Exit fullscreen mode

設定前に、次の制約を確認してください。

  • 思考モード中はtemperaturetop_pは効果がありません。
  • FIM補完(fill-in-the-middle、ベータ版)は非思考モードでのみ使用できます。

実装では用途ごとに使い分けるとよいでしょう。

用途 推奨設定
オートコンプリート、低レイテンシ応答 思考モードを無効化
エージェントループ、複雑なデバッグ、移行計画 思考モードを有効化し、reasoning_effortを上げる

ステップ4:応答をストリーミングする

stream: trueを指定すると、APIはServer-Sent Events(SSE)で応答します。サーバー送信イベントを使用したLLM応答のストリーミングでは、SSEペイロードの形式とデバッグ方法を説明しています。

Pythonでは、各チャンクのdelta.contentを順次出力できます。

stream = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[
        {
            "role": "user",
            "content": "Explain connection pooling."
        }
    ],
    stream=True
)

for chunk in stream:
    if chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="")
Enter fullscreen mode Exit fullscreen mode

ストリーミングを採用する場合は、UI側で部分応答を描画する処理と、接続切断時の再試行方針をあらかじめ実装しておくと運用しやすくなります。

パブリックベータ期間中の料金

公式のモデルと料金ページによると、V4-Flashの料金は以下のとおりです。

項目 deepseek-v4-flash deepseek-v4-pro
入力、キャッシュヒット(100万トークンあたり) $0.0028 $0.003625
入力、キャッシュミス(100万トークンあたり) $0.14 $0.435
出力(100万トークンあたり) $0.28 $0.87
コンテキスト長 1Mトークン 1Mトークン
最大出力 384K 384K
同時実行制限 2,500 500

料金を見積もる際は、次の3点を押さえてください。

  1. コンテキストキャッシュは自動です。

    キャッシュヒットはキャッシュミスより50倍安価です。同じシステムプロンプトを繰り返し使うエージェントセッションでは、コスト削減効果が大きくなります。

  2. ピーク・オフピーク料金ポリシーがあります。

    DeepSeekは、北京時間9:00〜12:00および14:00〜18:00の利用を通常料金の2倍とする方針を発表しています。7月31日時点で、ドキュメント上の発効日は「公式発表による」とされており、まだ有効ではありません。実運用前に料金ページを確認してください。

  3. 同時実行制限はFlashの用途を示しています。

    Flashは2,500、Proは500です。高並行のエージェントワークロードを想定するなら、Flashの制限値は重要な選定要素になります。

V4ファミリーのコスト詳細とV4-Proの恒久的な値下げについては、DeepSeek V4 API料金の内訳を参照してください。

ApidogでAPIをテスト・デバッグする

curlはスモークテストには十分ですが、思考モードと非思考モードの比較、SSEイベントの検査、プロンプト回帰テストには可視化されたワークフローが便利です。

ApidogでDeepSeek APIをテストする画面

Apidogでは次の手順で検証できます。

  1. プロジェクトを作成し、エンドポイントを追加する

    POST https://api.deepseek.com/chat/completionsを追加します。OpenAI互換の仕様をインポートすれば、関連エンドポイントをまとめて追加することもできます。

  2. APIキーを環境変数に保存する

    Apidog環境にDEEPSEEK_API_KEYを設定し、Authorizationヘッダーで次のように参照します。

   Bearer {{DEEPSEEK_API_KEY}}
Enter fullscreen mode Exit fullscreen mode

テスト環境と本番環境のキーは、環境を切り替えるだけで使い分けられます。

  1. ストリーミングレスポンスを確認する

    stream: trueのリクエストでは、到着したSSEイベントを確認できます。生のdata:行だけを読む代わりに、推論内容や応答内容のデルタを個別に追跡できます。

  2. 設定別のリクエストをテストケースとして保存する

    思考モード有効・無効のリクエストをそれぞれ保存します。モデル更新時には両方を再実行し、期待した出力やツール呼び出しが維持されているかを確認してください。

Apidogを無料でダウンロードして、リクエスト検証と回帰テストを始められます。

よくある質問

新しいモデルを使うためにコード変更は必要ですか?

不要です。deepseek-v4-flashは現在DeepSeek-V4-Flash-0731を提供しており、既存の統合は自動的にアップグレードされます。

DeepSeekアプリやWeb版と同じモデルですか?

いいえ。7月31日の更新対象はAPIのみです。DeepSeekアプリおよびWeb版モデルは変更されていません。

deepseek-chatdeepseek-reasonerはどうなりましたか?

これらのレガシーモデル名は2026年7月24日に廃止予定でした。deepseek-v4-flashまたはdeepseek-v4-proを使用してください。移行手順はDeepSeek V4 APIの使用方法で確認できます。

無料で利用できますか?

DeepSeek APIは永続的な無料枠のない従量課金制です。ただし、キャッシュヒット料金により、繰り返しプロンプトを使う実験のコストは低く抑えられます。現在の選択肢はDeepSeek V4 APIを無料で利用する方法を参照してください。

V4-FlashはCodexとResponses APIで動作しますか?

はい。V4-Flashは両方に対応しています。V4-Proの対応は2026年8月上旬に予定されています。セットアップの詳細はResponses APIとCodexガイドを参照してください。

まとめ

DeepSeek-V4-Flash-0731は、モデル名・料金・アーキテクチャを維持したまま、DeepSeekの自己評価ではV4-Pro-Previewを上回るエージェント系ベンチマーク結果を報告したAPIリリースです。Responses APIとCodexのサポートも加わり、高並行なエージェントワークロードでの利用を意識したモデルといえます。

まずはAPIキーを作成し、OpenAI SDKのbase_urlhttps://api.deepseek.comへ設定してください。その後、自分のプロンプト、ツール呼び出し、出力形式を使って評価します。

Apidogでリクエストをテストケースとして保存しておけば、deepseek-v4-flashの将来の更新時にも、同じケースを再実行して挙動の変化をすぐに確認できます。

Top comments (0)