DeepSeek V4 Pro đã rời giai đoạn xem trước vào ngày 12 tháng 8 năm 2026. Bản dựng GA (General Availability) 0813 hiện phục vụ qua điểm cuối API deepseek-v4-pro, với cửa sổ ngữ cảnh 1 triệu token, đầu ra tối đa 384 nghìn token và giá đầu vào chỉ 0,003625 USD cho mỗi triệu token khi có lượt truy cập bộ nhớ đệm. Theo Unite.AI, sau bốn tháng preview, đây là mô hình chủ lực của DeepSeek.
Bài này tập trung vào phần triển khai: gọi API đầu tiên bằng OpenAI SDK, chọn chế độ tư duy, đọc reasoning_content, streaming, tool calling và tối ưu chi phí bằng prompt caching. Nếu cần bối cảnh kiến trúc trước, hãy đọc DeepSeek V4 là gì.
Tóm tắt
-
deepseek-v4-prohiện ánh xạ tới bản dựng GA0813, phát hành ngày 12 tháng 8 năm 2026. - API tương thích OpenAI: trỏ SDK
openaitớihttps://api.deepseek.com, rồi dùngmodel="deepseek-v4-pro". - Mô hình hỗ trợ ngữ cảnh 1 triệu token, đầu ra tối đa 384K token và ba chế độ tư duy:
none,high,max. - Ở chế độ tư duy, phản hồi có thêm trường
reasoning_content. - Giá đầu vào là 0,435 USD/M token khi lỗi bộ nhớ đệm và 0,003625 USD/M token khi truy cập bộ nhớ đệm; đầu ra là 0,87 USD/M token.
- DeepSeek cảnh báo vào ngày 6 tháng 8 về một đợt tăng giá API “đáng kể” trong tương lai, nhưng chưa công bố mức giá hoặc ngày áp dụng.
- Trước khi tích hợp, hãy kiểm tra endpoint, SSE streaming và biến môi trường Pro/Flash trong Apidog.
Bản dựng GA 0813 thay đổi gì cho nhà phát triển?
DeepSeek phát hành bản preview vào tháng 4 năm 2026, sau đó là V4 Flash vào tháng 7. Ngày 12 tháng 8, V4 Pro được phát hành GA với mã bản dựng 0813, theo quy ước đặt tên ngày tháng của DeepSeek, tương tự v3-0324.
Ba thay đổi quan trọng khi chuyển sang GA:
Có mục tiêu phiên bản ổn định
Preview có thể thay đổi âm thầm, khiến benchmark, test suite hoặc prompt tuning không còn chính xác. Bản dựng0813là mục tiêu ổn định cho đến khi DeepSeek công bố phiên bản mới.Endpoint sản xuất đã rõ ràng
Trên API chính thức, dùng:
deepseek-v4-pro
Nếu cần ghim bản dựng cụ thể thông qua nhà cung cấp khác, OpenRouter liệt kê model là deepseek/deepseek-v4-pro-0813.
- Đầy đủ bề mặt API Endpoint GA hỗ trợ reasoning modes, function calling, structured outputs, prompt caching và các định dạng OpenAI Chat Completions, Anthropic Messages, DeepSeek Responses API.
Về kỹ thuật, V4 Pro là mô hình mixture-of-experts với 1.6T tham số tổng cộng và 49B tham số hoạt động trên mỗi token. Mô hình dùng Compressed Sparse Attention và Heavily Compressed Attention, giảm chi phí tính toán suy luận một token xuống 27% so với V3.2 và giảm bộ nhớ đệm KV xuống 10%. Đây là yếu tố giúp ngữ cảnh 1 triệu token khả thi hơn về chi phí.
DeepSeek V4 Pro 0813: thông số nhanh
| Thông số | DeepSeek V4 Pro 0813 |
|---|---|
| Phát hành | GA ngày 12 tháng 8 năm 2026, bản dựng 0813
|
| Kiến trúc | Mixture-of-experts, 1.6T tổng tham số, 49B hoạt động/token |
| Attention | Compressed Sparse Attention + Heavily Compressed Attention |
| Chi phí suy luận so với V3.2 | 27% tính toán một token, 10% bộ nhớ đệm KV |
| Cửa sổ ngữ cảnh | 1.000.000 token |
| Đầu ra tối đa | 384K token |
| Chế độ tư duy |
none, high, max
|
| Giá đầu vào | 0,435 USD/M token khi lỗi bộ nhớ đệm; 0,003625 USD/M khi truy cập bộ nhớ đệm |
| Giá đầu ra | 0,87 USD/M token |
| Định dạng API | OpenAI Chat Completions, Anthropic Messages, DeepSeek Responses |
| ID mô hình | deepseek-v4-pro |
| Model nhỏ hơn |
deepseek-v4-flash, 284B tổng / 13B hoạt động |
Thẻ mô hình của DeepSeek công bố SWE-bench Verified 80,6%, Terminal Bench 2.0 67,9%, GPQA Diamond 90,1% và LiveCodeBench 93,5% cho cấu hình V4-Pro-Max. Đây là số liệu do nhà cung cấp tự báo cáo, vì vậy hãy chạy benchmark theo dữ liệu và tác vụ thực tế của bạn trước khi chuyển workload quan trọng.
Lấy khóa API và gửi yêu cầu đầu tiên
1. Tạo và lưu API key
- Tạo tài khoản tại platform.deepseek.com.
- Thêm tín dụng vì API hoạt động theo cơ chế trả trước.
- Mở mục API Keys, tạo khóa và sao chép ngay vì khóa chỉ hiển thị một lần.
- Lưu khóa trong biến môi trường:
export DEEPSEEK_API_KEY="sk-..."
Không đưa API key trực tiếp vào source code hoặc commit vào Git.
2. Cài OpenAI SDK
pip install openai
DeepSeek hỗ trợ giao thức OpenAI Chat Completions. Bạn có thể dùng https://api.deepseek.com hoặc https://api.deepseek.com/v1 làm base_url; /v1 là lớp tương thích giao thức, không phải phiên bản model.
3. Gọi deepseek-v4-pro bằng Python
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DEEPSEEK_API_KEY"],
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[
{
"role": "system",
"content": "You are a concise technical assistant.",
},
{
"role": "user",
"content": "Explain idempotency in REST APIs in two sentences.",
},
],
)
print(response.choices[0].message.content)
print(response.usage)
Luôn log response.usage ngay từ đầu. Khi dùng ngữ cảnh lớn, chênh lệch giữa cache hit và cache miss có thể ảnh hưởng đáng kể đến chi phí.
4. Gọi trực tiếp bằng cURL
curl https://api.deepseek.com/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $DEEPSEEK_API_KEY" \
-d '{
"model": "deepseek-v4-pro",
"messages": [
{
"role": "user",
"content": "List three ways to version a REST API."
}
]
}'
Xem danh sách tham số đầy đủ trong tài liệu chính thức của DeepSeek. DeepSeek cũng cung cấp endpoint Anthropic Messages và Responses API riêng.
Làm việc với ba chế độ tư duy
V4 Pro dùng một endpoint nhưng cho phép điều chỉnh mức reasoning qua reasoning_effort.
| Chế độ | Giá trị API | Phù hợp cho |
|---|---|---|
| Non-think | none |
Phân loại, trích xuất, định dạng, tóm tắt |
| Think high | high |
Viết mã, gỡ lỗi, phân tích nhiều bước |
| Think max | max |
Tác vụ rất khó, cần ngân sách reasoning tối đa |
Ví dụ dùng chế độ high:
response = client.chat.completions.create(
model="deepseek-v4-pro",
reasoning_effort="high",
messages=[
{
"role": "user",
"content": (
"Our API returns 502s under load but only behind the CDN. "
"Walk through likely causes in order of probability."
),
},
],
)
message = response.choices[0].message
print("--- Reasoning ---")
print(message.reasoning_content)
print("--- Answer ---")
print(message.content)
Lưu ý khi triển khai hội thoại nhiều lượt:
- Không đưa
reasoning_contenttrở lại lịch sử chat. - Chỉ gửi lại
contenttừ các lượt trước. - Token reasoning được tính phí như token đầu ra, ở mức 0,87 USD/M token.
- Không mặc định dùng
max; hãy chọn mức reasoning theo độ khó của tác vụ.
Streaming phản hồi
Với đầu ra tối đa 384K token và reasoning có thể kéo dài, nên bật streaming cho giao diện người dùng hoặc tác vụ tương tác.
stream = client.chat.completions.create(
model="deepseek-v4-pro",
reasoning_effort="high",
stream=True,
messages=[
{
"role": "user",
"content": (
"Design a rate limiter for a public API. "
"Compare token bucket and sliding window."
),
},
],
)
for chunk in stream:
if not chunk.choices:
continue # Chunk cuối có thể chỉ chứa usage
delta = chunk.choices[0].delta
if getattr(delta, "reasoning_content", None):
print(delta.reasoning_content, end="", flush=True)
elif delta.content:
print(delta.content, end="", flush=True)
Trong chế độ reasoning, delta reasoning_content thường đến trước, sau đó mới tới delta content.
Một UX thực tế:
- Hiển thị reasoning dưới dạng trạng thái “đang tư duy” hoặc vùng có thể thu gọn.
- Khi
contentbắt đầu xuất hiện, chuyển sang khu vực câu trả lời chính. - Lưu usage và thời gian hoàn thành để so sánh độ trễ giữa
highvàmax.
Streaming dựa trên Server-Sent Events. Xem thêm hướng dẫn truyền tải phản hồi API với SSE.
Gọi công cụ và đầu ra có cấu trúc
V4 Pro hỗ trợ function calling theo định dạng OpenAI. Nếu agent hiện tại của bạn đã dùng tools, vòng lặp cơ bản có thể giữ nguyên:
- Khai báo tool schema.
- Gửi prompt cùng
tools. - Đọc
tool_calls. - Chạy công cụ ở phía ứng dụng.
- Đưa kết quả tool trở lại model.
- Lặp lại đến khi model trả lời cuối cùng.
Ví dụ khai báo một tool:
tools = [
{
"type": "function",
"function": {
"name": "get_endpoint_status",
"description": "Check the health of an internal API endpoint",
"parameters": {
"type": "object",
"properties": {
"endpoint": {
"type": "string",
"description": "Path, e.g. /v1/orders",
}
},
"required": ["endpoint"],
},
},
}
]
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[
{
"role": "user",
"content": "Is /v1/orders healthy right now?",
}
],
tools=tools,
)
print(response.choices[0].message.tool_calls)
Khi cần JSON có thể parse được, dùng response_format theo định dạng chuẩn. Chi tiết về cấu trúc message và tool loop có trong tài liệu chính thức của DeepSeek.
Prompt caching: phần ảnh hưởng trực tiếp đến kiến trúc
DeepSeek tự động cache các tiền tố prompt lặp lại. Không cần thêm header, cấu hình TTL hoặc cờ cache riêng.
Giá đầu vào:
- Cache miss: 0,435 USD/M token
- Cache hit: 0,003625 USD/M token
Đây là mức chênh lệch khoảng 120 lần.
Ví dụ chi phí
Giả sử bạn xây dựng coding agent giữ 200K token ngữ cảnh repository và gửi 50 request trong một phiên.
Không có cache hiệu quả:
50 request × 200K token × 0,435 USD/M
≈ 4,35 USD
Có tiền tố ổn định để cache:
1 cache miss: 200K × 0,435 USD/M ≈ 0,087 USD
49 cache hit: 200K × 0,003625 USD/M × 49 ≈ 0,036 USD
Tổng ≈ 0,12 USD
Cùng workload, chi phí đầu vào giảm khoảng 35 lần.
Cách cấu trúc prompt để tăng cache hit
Đặt phần ổn định ở đầu prompt:
1. System prompt cố định
2. Tài liệu sản phẩm hoặc API docs
3. Ngữ cảnh repository
4. Quy tắc coding / policy
5. Lịch sử hội thoại ổn định
6. Tin nhắn mới nhất của người dùng
7. Dữ liệu thay đổi theo request: timestamp, request ID, trạng thái hiện tại
Tránh chèn dữ liệu thay đổi vào đầu prompt. Ví dụ, nếu thêm timestamp vào system prompt, mọi request có thể trở thành cache miss từ vị trí đó trở đi.
Ngữ cảnh 1 triệu token vì vậy không chỉ là thông số marketing:
- Với cache miss, 1M token đầu vào có thể tốn 0,435 USD.
- Với một tiền tố phiên ổn định, lần đọc lại có giá khoảng một phần ba xu cho mỗi request.
Xem thêm phần nền tảng trong bài Prompt Caching là gì.
Kiểm tra deepseek-v4-pro trong Apidog
Trước khi đưa V4 Pro vào production, hãy kiểm tra request và phản hồi trong một API client. Vì DeepSeek tương thích OpenAI, Apidog có thể dùng mà không cần cấu hình adapter đặc biệt.
Quy trình đề xuất:
Import lệnh cURL
Dán lệnh cURL ở trên vào Apidog để tạo request có thể chỉnh sửa. Headers, authorization và request body sẽ được tách tự động.Tạo môi trường Pro và Flash
Lưubase_url, API key và model name dưới dạng biến môi trường.
Ví dụ:
base_url=https://api.deepseek.com
deepseek_api_key=sk-...
model=deepseek-v4-pro
Tạo môi trường thứ hai với:
model=deepseek-v4-flash
Nhờ đó, bạn có thể chạy cùng một prompt trên Pro và Flash để đo chất lượng, latency và usage.
- Kiểm tra SSE streaming Gửi request có:
{
"stream": true
}
Apidog hiển thị timeline sự kiện thay vì các dòng data: thô. Đây là cách nhanh để xem reasoning xuất hiện khi nào, nội dung trả lời bắt đầu khi nào và request think max mất thời gian ở đâu.
- Lưu thành collection regression test Lưu các request đại diện cho workload của bạn. Khi DeepSeek cập nhật model hoặc giá, chạy lại cùng collection để phát hiện khác biệt hành vi.
Khối usage trong response là dữ liệu quan trọng để kiểm tra cache hit khi tinh chỉnh thứ tự prompt.
Giá hiện tại và đợt tăng giá sắp tới
| Model | Đầu vào, cache miss | Đầu vào, cache hit | Đầu ra |
|---|---|---|---|
deepseek-v4-pro |
0,435 USD/M | 0,003625 USD/M | 0,87 USD/M |
deepseek-v4-flash |
0,14 USD/M | — | 0,28 USD/M |
Ngày 6 tháng 8 năm 2026, DeepSeek cảnh báo về một đợt tăng giá API “đáng kể” sắp tới. Chưa có mức giá cụ thể hoặc ngày hiệu lực.
Để giảm rủi ro chi phí:
- Đo chi phí theo từng loại tác vụ ngay từ bây giờ bằng
response.usage. - Tăng cache hit bằng cách giữ các tiền tố prompt ổn định.
- Dùng V4 Flash cho tác vụ khối lượng lớn và đơn giản.
- Chỉ route sang V4 Pro khi cần reasoning, coding agent hoặc phân tích ngữ cảnh dài.
Để xem phân tích chi tiết hơn, đọc hướng dẫn định giá API DeepSeek V4.
Câu hỏi thường gặp
Mã OpenAI SDK hiện có có hoạt động mà không cần viết lại không?
Gần như có. Bạn chỉ cần:
client = OpenAI(
api_key=os.environ["DEEPSEEK_API_KEY"],
base_url="https://api.deepseek.com",
)
Sau đó đổi model:
model="deepseek-v4-pro"
Chat Completions, streaming, tools và structured outputs theo cấu trúc tương thích OpenAI. Nếu đang dùng Anthropic SDK, bạn có thể dùng endpoint Anthropic Messages của DeepSeek.
Khi nào nên dùng V4 Flash thay vì V4 Pro?
Dùng V4 Flash cho:
- Phân loại
- Trích xuất dữ liệu
- Chat đơn giản
- Tác vụ nhạy cảm latency
- Workload khối lượng lớn không cần reasoning sâu
Dùng V4 Pro cho:
- Coding agent
- Gỡ lỗi phức tạp
- Phân tích nhiều bước
- Ngữ cảnh dài
- Tác vụ cần
reasoning_effort="high"hoặc"max"
Route theo loại tác vụ, không theo một model duy nhất.
Có thể dùng V4 Pro 0813 trong Cursor không?
Có. Cursor hỗ trợ endpoint tương thích OpenAI tùy chỉnh, vì vậy bạn có thể thêm bản dựng GA dưới dạng custom model. Xem hướng dẫn tại Cách sử dụng DeepSeek V4 Pro với Cursor.
Tóm lại
Để triển khai DeepSeek V4 Pro hiệu quả:
- Tạo API key và lưu trong biến môi trường.
- Dùng OpenAI SDK với
base_url="https://api.deepseek.com". - Bắt đầu với
reasoning_effort="none"hoặc"high", chỉ dùng"max"khi cần. - Bật streaming cho tác vụ có đầu ra dài hoặc reasoning.
- Đọc
response.usagetrên mọi request. - Tối ưu thứ tự prompt để tận dụng cache hit.
- Giữ collection test trong Apidog để so sánh Pro, Flash và các phiên bản tiếp theo.


Top comments (0)