DEV Community

Cover image for Hướng dẫn sử dụng API DeepSeek V4 Pro 0813
Sebastian Petrus
Sebastian Petrus

Posted on Originally published at apidog.com

Hướng dẫn sử dụng API DeepSeek V4 Pro 0813

DeepSeek V4 Pro đã rời giai đoạn xem trước vào ngày 12 tháng 8 năm 2026. Bản dựng GA (General Availability) 0813 hiện phục vụ qua điểm cuối API deepseek-v4-pro, với cửa sổ ngữ cảnh 1 triệu token, đầu ra tối đa 384 nghìn token và giá đầu vào chỉ 0,003625 USD cho mỗi triệu token khi có lượt truy cập bộ nhớ đệm. Theo Unite.AI, sau bốn tháng preview, đây là mô hình chủ lực của DeepSeek.

Dùng thử Apidog ngay hôm nay

Bài này tập trung vào phần triển khai: gọi API đầu tiên bằng OpenAI SDK, chọn chế độ tư duy, đọc reasoning_content, streaming, tool calling và tối ưu chi phí bằng prompt caching. Nếu cần bối cảnh kiến trúc trước, hãy đọc DeepSeek V4 là gì.

Tóm tắt

  • deepseek-v4-pro hiện ánh xạ tới bản dựng GA 0813, phát hành ngày 12 tháng 8 năm 2026.
  • API tương thích OpenAI: trỏ SDK openai tới https://api.deepseek.com, rồi dùng model="deepseek-v4-pro".
  • Mô hình hỗ trợ ngữ cảnh 1 triệu token, đầu ra tối đa 384K token và ba chế độ tư duy: none, high, max.
  • Ở chế độ tư duy, phản hồi có thêm trường reasoning_content.
  • Giá đầu vào là 0,435 USD/M token khi lỗi bộ nhớ đệm và 0,003625 USD/M token khi truy cập bộ nhớ đệm; đầu ra là 0,87 USD/M token.
  • DeepSeek cảnh báo vào ngày 6 tháng 8 về một đợt tăng giá API “đáng kể” trong tương lai, nhưng chưa công bố mức giá hoặc ngày áp dụng.
  • Trước khi tích hợp, hãy kiểm tra endpoint, SSE streaming và biến môi trường Pro/Flash trong Apidog.

Bản dựng GA 0813 thay đổi gì cho nhà phát triển?

DeepSeek phát hành bản preview vào tháng 4 năm 2026, sau đó là V4 Flash vào tháng 7. Ngày 12 tháng 8, V4 Pro được phát hành GA với mã bản dựng 0813, theo quy ước đặt tên ngày tháng của DeepSeek, tương tự v3-0324.

DeepSeek V4 Pro GA

Ba thay đổi quan trọng khi chuyển sang GA:

  1. Có mục tiêu phiên bản ổn định

    Preview có thể thay đổi âm thầm, khiến benchmark, test suite hoặc prompt tuning không còn chính xác. Bản dựng 0813 là mục tiêu ổn định cho đến khi DeepSeek công bố phiên bản mới.

  2. Endpoint sản xuất đã rõ ràng

    Trên API chính thức, dùng:

   deepseek-v4-pro
Enter fullscreen mode Exit fullscreen mode

Nếu cần ghim bản dựng cụ thể thông qua nhà cung cấp khác, OpenRouter liệt kê model là deepseek/deepseek-v4-pro-0813.

  1. Đầy đủ bề mặt API Endpoint GA hỗ trợ reasoning modes, function calling, structured outputs, prompt caching và các định dạng OpenAI Chat Completions, Anthropic Messages, DeepSeek Responses API.

Về kỹ thuật, V4 Pro là mô hình mixture-of-experts với 1.6T tham số tổng cộng và 49B tham số hoạt động trên mỗi token. Mô hình dùng Compressed Sparse Attention và Heavily Compressed Attention, giảm chi phí tính toán suy luận một token xuống 27% so với V3.2 và giảm bộ nhớ đệm KV xuống 10%. Đây là yếu tố giúp ngữ cảnh 1 triệu token khả thi hơn về chi phí.

DeepSeek V4 Pro 0813: thông số nhanh

Thông số DeepSeek V4 Pro 0813
Phát hành GA ngày 12 tháng 8 năm 2026, bản dựng 0813
Kiến trúc Mixture-of-experts, 1.6T tổng tham số, 49B hoạt động/token
Attention Compressed Sparse Attention + Heavily Compressed Attention
Chi phí suy luận so với V3.2 27% tính toán một token, 10% bộ nhớ đệm KV
Cửa sổ ngữ cảnh 1.000.000 token
Đầu ra tối đa 384K token
Chế độ tư duy none, high, max
Giá đầu vào 0,435 USD/M token khi lỗi bộ nhớ đệm; 0,003625 USD/M khi truy cập bộ nhớ đệm
Giá đầu ra 0,87 USD/M token
Định dạng API OpenAI Chat Completions, Anthropic Messages, DeepSeek Responses
ID mô hình deepseek-v4-pro
Model nhỏ hơn deepseek-v4-flash, 284B tổng / 13B hoạt động

Thẻ mô hình của DeepSeek công bố SWE-bench Verified 80,6%, Terminal Bench 2.0 67,9%, GPQA Diamond 90,1% và LiveCodeBench 93,5% cho cấu hình V4-Pro-Max. Đây là số liệu do nhà cung cấp tự báo cáo, vì vậy hãy chạy benchmark theo dữ liệu và tác vụ thực tế của bạn trước khi chuyển workload quan trọng.

Lấy khóa API và gửi yêu cầu đầu tiên

1. Tạo và lưu API key

  1. Tạo tài khoản tại platform.deepseek.com.
  2. Thêm tín dụng vì API hoạt động theo cơ chế trả trước.
  3. Mở mục API Keys, tạo khóa và sao chép ngay vì khóa chỉ hiển thị một lần.
  4. Lưu khóa trong biến môi trường:
export DEEPSEEK_API_KEY="sk-..."
Enter fullscreen mode Exit fullscreen mode

Không đưa API key trực tiếp vào source code hoặc commit vào Git.

2. Cài OpenAI SDK

pip install openai
Enter fullscreen mode Exit fullscreen mode

DeepSeek hỗ trợ giao thức OpenAI Chat Completions. Bạn có thể dùng https://api.deepseek.com hoặc https://api.deepseek.com/v1 làm base_url; /v1 là lớp tương thích giao thức, không phải phiên bản model.

3. Gọi deepseek-v4-pro bằng Python

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DEEPSEEK_API_KEY"],
    base_url="https://api.deepseek.com",
)

response = client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[
        {
            "role": "system",
            "content": "You are a concise technical assistant.",
        },
        {
            "role": "user",
            "content": "Explain idempotency in REST APIs in two sentences.",
        },
    ],
)

print(response.choices[0].message.content)
print(response.usage)
Enter fullscreen mode Exit fullscreen mode

Luôn log response.usage ngay từ đầu. Khi dùng ngữ cảnh lớn, chênh lệch giữa cache hit và cache miss có thể ảnh hưởng đáng kể đến chi phí.

4. Gọi trực tiếp bằng cURL

curl https://api.deepseek.com/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $DEEPSEEK_API_KEY" \
  -d '{
    "model": "deepseek-v4-pro",
    "messages": [
      {
        "role": "user",
        "content": "List three ways to version a REST API."
      }
    ]
  }'
Enter fullscreen mode Exit fullscreen mode

Xem danh sách tham số đầy đủ trong tài liệu chính thức của DeepSeek. DeepSeek cũng cung cấp endpoint Anthropic Messages và Responses API riêng.

Làm việc với ba chế độ tư duy

V4 Pro dùng một endpoint nhưng cho phép điều chỉnh mức reasoning qua reasoning_effort.

Chế độ Giá trị API Phù hợp cho
Non-think none Phân loại, trích xuất, định dạng, tóm tắt
Think high high Viết mã, gỡ lỗi, phân tích nhiều bước
Think max max Tác vụ rất khó, cần ngân sách reasoning tối đa

Ví dụ dùng chế độ high:

response = client.chat.completions.create(
    model="deepseek-v4-pro",
    reasoning_effort="high",
    messages=[
        {
            "role": "user",
            "content": (
                "Our API returns 502s under load but only behind the CDN. "
                "Walk through likely causes in order of probability."
            ),
        },
    ],
)

message = response.choices[0].message

print("--- Reasoning ---")
print(message.reasoning_content)

print("--- Answer ---")
print(message.content)
Enter fullscreen mode Exit fullscreen mode

Lưu ý khi triển khai hội thoại nhiều lượt:

  • Không đưa reasoning_content trở lại lịch sử chat.
  • Chỉ gửi lại content từ các lượt trước.
  • Token reasoning được tính phí như token đầu ra, ở mức 0,87 USD/M token.
  • Không mặc định dùng max; hãy chọn mức reasoning theo độ khó của tác vụ.

Streaming phản hồi

Với đầu ra tối đa 384K token và reasoning có thể kéo dài, nên bật streaming cho giao diện người dùng hoặc tác vụ tương tác.

stream = client.chat.completions.create(
    model="deepseek-v4-pro",
    reasoning_effort="high",
    stream=True,
    messages=[
        {
            "role": "user",
            "content": (
                "Design a rate limiter for a public API. "
                "Compare token bucket and sliding window."
            ),
        },
    ],
)

for chunk in stream:
    if not chunk.choices:
        continue  # Chunk cuối có thể chỉ chứa usage

    delta = chunk.choices[0].delta

    if getattr(delta, "reasoning_content", None):
        print(delta.reasoning_content, end="", flush=True)
    elif delta.content:
        print(delta.content, end="", flush=True)
Enter fullscreen mode Exit fullscreen mode

Trong chế độ reasoning, delta reasoning_content thường đến trước, sau đó mới tới delta content.

Một UX thực tế:

  1. Hiển thị reasoning dưới dạng trạng thái “đang tư duy” hoặc vùng có thể thu gọn.
  2. Khi content bắt đầu xuất hiện, chuyển sang khu vực câu trả lời chính.
  3. Lưu usage và thời gian hoàn thành để so sánh độ trễ giữa highmax.

Streaming dựa trên Server-Sent Events. Xem thêm hướng dẫn truyền tải phản hồi API với SSE.

Gọi công cụ và đầu ra có cấu trúc

V4 Pro hỗ trợ function calling theo định dạng OpenAI. Nếu agent hiện tại của bạn đã dùng tools, vòng lặp cơ bản có thể giữ nguyên:

  1. Khai báo tool schema.
  2. Gửi prompt cùng tools.
  3. Đọc tool_calls.
  4. Chạy công cụ ở phía ứng dụng.
  5. Đưa kết quả tool trở lại model.
  6. Lặp lại đến khi model trả lời cuối cùng.

Ví dụ khai báo một tool:

tools = [
    {
        "type": "function",
        "function": {
            "name": "get_endpoint_status",
            "description": "Check the health of an internal API endpoint",
            "parameters": {
                "type": "object",
                "properties": {
                    "endpoint": {
                        "type": "string",
                        "description": "Path, e.g. /v1/orders",
                    }
                },
                "required": ["endpoint"],
            },
        },
    }
]

response = client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[
        {
            "role": "user",
            "content": "Is /v1/orders healthy right now?",
        }
    ],
    tools=tools,
)

print(response.choices[0].message.tool_calls)
Enter fullscreen mode Exit fullscreen mode

Khi cần JSON có thể parse được, dùng response_format theo định dạng chuẩn. Chi tiết về cấu trúc message và tool loop có trong tài liệu chính thức của DeepSeek.

Prompt caching: phần ảnh hưởng trực tiếp đến kiến trúc

DeepSeek tự động cache các tiền tố prompt lặp lại. Không cần thêm header, cấu hình TTL hoặc cờ cache riêng.

Giá đầu vào:

  • Cache miss: 0,435 USD/M token
  • Cache hit: 0,003625 USD/M token

Đây là mức chênh lệch khoảng 120 lần.

Ví dụ chi phí

Giả sử bạn xây dựng coding agent giữ 200K token ngữ cảnh repository và gửi 50 request trong một phiên.

Không có cache hiệu quả:

50 request × 200K token × 0,435 USD/M
≈ 4,35 USD
Enter fullscreen mode Exit fullscreen mode

Có tiền tố ổn định để cache:

1 cache miss: 200K × 0,435 USD/M ≈ 0,087 USD
49 cache hit: 200K × 0,003625 USD/M × 49 ≈ 0,036 USD

Tổng ≈ 0,12 USD
Enter fullscreen mode Exit fullscreen mode

Cùng workload, chi phí đầu vào giảm khoảng 35 lần.

Cách cấu trúc prompt để tăng cache hit

Đặt phần ổn định ở đầu prompt:

1. System prompt cố định
2. Tài liệu sản phẩm hoặc API docs
3. Ngữ cảnh repository
4. Quy tắc coding / policy
5. Lịch sử hội thoại ổn định
6. Tin nhắn mới nhất của người dùng
7. Dữ liệu thay đổi theo request: timestamp, request ID, trạng thái hiện tại
Enter fullscreen mode Exit fullscreen mode

Tránh chèn dữ liệu thay đổi vào đầu prompt. Ví dụ, nếu thêm timestamp vào system prompt, mọi request có thể trở thành cache miss từ vị trí đó trở đi.

Ngữ cảnh 1 triệu token vì vậy không chỉ là thông số marketing:

  • Với cache miss, 1M token đầu vào có thể tốn 0,435 USD.
  • Với một tiền tố phiên ổn định, lần đọc lại có giá khoảng một phần ba xu cho mỗi request.

Xem thêm phần nền tảng trong bài Prompt Caching là gì.

Kiểm tra deepseek-v4-pro trong Apidog

Trước khi đưa V4 Pro vào production, hãy kiểm tra request và phản hồi trong một API client. Vì DeepSeek tương thích OpenAI, Apidog có thể dùng mà không cần cấu hình adapter đặc biệt.

Kiểm tra DeepSeek V4 Pro trong Apidog

Quy trình đề xuất:

  1. Import lệnh cURL

    Dán lệnh cURL ở trên vào Apidog để tạo request có thể chỉnh sửa. Headers, authorization và request body sẽ được tách tự động.

  2. Tạo môi trường Pro và Flash

    Lưu base_url, API key và model name dưới dạng biến môi trường.

Ví dụ:

   base_url=https://api.deepseek.com
   deepseek_api_key=sk-...
   model=deepseek-v4-pro
Enter fullscreen mode Exit fullscreen mode

Tạo môi trường thứ hai với:

   model=deepseek-v4-flash
Enter fullscreen mode Exit fullscreen mode

Nhờ đó, bạn có thể chạy cùng một prompt trên Pro và Flash để đo chất lượng, latency và usage.

  1. Kiểm tra SSE streaming Gửi request có:
   {
     "stream": true
   }
Enter fullscreen mode Exit fullscreen mode

Apidog hiển thị timeline sự kiện thay vì các dòng data: thô. Đây là cách nhanh để xem reasoning xuất hiện khi nào, nội dung trả lời bắt đầu khi nào và request think max mất thời gian ở đâu.

  1. Lưu thành collection regression test Lưu các request đại diện cho workload của bạn. Khi DeepSeek cập nhật model hoặc giá, chạy lại cùng collection để phát hiện khác biệt hành vi.

Khối usage trong response là dữ liệu quan trọng để kiểm tra cache hit khi tinh chỉnh thứ tự prompt.

Giá hiện tại và đợt tăng giá sắp tới

Model Đầu vào, cache miss Đầu vào, cache hit Đầu ra
deepseek-v4-pro 0,435 USD/M 0,003625 USD/M 0,87 USD/M
deepseek-v4-flash 0,14 USD/M 0,28 USD/M

Ngày 6 tháng 8 năm 2026, DeepSeek cảnh báo về một đợt tăng giá API “đáng kể” sắp tới. Chưa có mức giá cụ thể hoặc ngày hiệu lực.

Để giảm rủi ro chi phí:

  • Đo chi phí theo từng loại tác vụ ngay từ bây giờ bằng response.usage.
  • Tăng cache hit bằng cách giữ các tiền tố prompt ổn định.
  • Dùng V4 Flash cho tác vụ khối lượng lớn và đơn giản.
  • Chỉ route sang V4 Pro khi cần reasoning, coding agent hoặc phân tích ngữ cảnh dài.

Để xem phân tích chi tiết hơn, đọc hướng dẫn định giá API DeepSeek V4.

Câu hỏi thường gặp

Mã OpenAI SDK hiện có có hoạt động mà không cần viết lại không?

Gần như có. Bạn chỉ cần:

client = OpenAI(
    api_key=os.environ["DEEPSEEK_API_KEY"],
    base_url="https://api.deepseek.com",
)
Enter fullscreen mode Exit fullscreen mode

Sau đó đổi model:

model="deepseek-v4-pro"
Enter fullscreen mode Exit fullscreen mode

Chat Completions, streaming, tools và structured outputs theo cấu trúc tương thích OpenAI. Nếu đang dùng Anthropic SDK, bạn có thể dùng endpoint Anthropic Messages của DeepSeek.

Khi nào nên dùng V4 Flash thay vì V4 Pro?

Dùng V4 Flash cho:

  • Phân loại
  • Trích xuất dữ liệu
  • Chat đơn giản
  • Tác vụ nhạy cảm latency
  • Workload khối lượng lớn không cần reasoning sâu

Dùng V4 Pro cho:

  • Coding agent
  • Gỡ lỗi phức tạp
  • Phân tích nhiều bước
  • Ngữ cảnh dài
  • Tác vụ cần reasoning_effort="high" hoặc "max"

Route theo loại tác vụ, không theo một model duy nhất.

Có thể dùng V4 Pro 0813 trong Cursor không?

Có. Cursor hỗ trợ endpoint tương thích OpenAI tùy chỉnh, vì vậy bạn có thể thêm bản dựng GA dưới dạng custom model. Xem hướng dẫn tại Cách sử dụng DeepSeek V4 Pro với Cursor.

Tóm lại

Để triển khai DeepSeek V4 Pro hiệu quả:

  1. Tạo API key và lưu trong biến môi trường.
  2. Dùng OpenAI SDK với base_url="https://api.deepseek.com".
  3. Bắt đầu với reasoning_effort="none" hoặc "high", chỉ dùng "max" khi cần.
  4. Bật streaming cho tác vụ có đầu ra dài hoặc reasoning.
  5. Đọc response.usage trên mọi request.
  6. Tối ưu thứ tự prompt để tận dụng cache hit.
  7. Giữ collection test trong Apidog để so sánh Pro, Flash và các phiên bản tiếp theo.

Top comments (0)