DeepSeek đã phát hành API DeepSeek-V4-Flash chính thức vào sáng nay. Thông báo được đưa ra vào ngày 31 tháng 7 năm 2026, và ghi chú phát hành làm rõ ba điểm: khả năng tác tử của mô hình đã được nâng cấp đáng kể, mô hình hỗ trợ nguyên bản định dạng Responses API của OpenAI, và hoạt động với Codex ngay từ ngày đầu tiên.
Nếu bạn đã dùng deepseek-v4-flash từ tháng 4, bạn đang dùng phiên bản xem trước. Bản phát hành này nâng cấp mô hình lên phiên bản chính thức DeepSeek-V4-Flash-0731 mà không yêu cầu thay đổi mã. Tên model vẫn là deepseek-v4-flash.
Bài viết này hướng dẫn bạn:
- Lấy API key.
- Gọi API bằng
curl, Python và Node.js. - Bật hoặc tắt chế độ tư duy.
- Streaming phản hồi SSE.
- Kiểm tra chi phí và gỡ lỗi API.
Nếu chưa quen với dòng sản phẩm này, hãy đọc DeepSeek V4 là gì? trước.
💡 Sau khi có API key, bạn nên kiểm tra endpoint trước khi tích hợp vào ứng dụng. Apidog cho phép gửi request đến DeepSeek API, xem phản hồi streaming theo từng sự kiện và lưu request hoạt động thành test case có thể tái sử dụng.
Những gì thực sự được phát hành vào ngày 31 tháng 7
Theo nhật ký thay đổi chính thức, bản phát hành này chỉ áp dụng cho API. Các model trên ứng dụng và web DeepSeek không thay đổi; API V4-Pro cũng không thay đổi.
Tóm tắt các điểm chính:
- DeepSeek-V4-Flash-0731 là bản phát hành chính thức của dòng V4-Flash và đang trong giai đoạn thử nghiệm công khai trên API.
- Kiến trúc và kích thước giống V4-Flash-Preview. DeepSeek cho biết model được huấn luyện lại, nên cải thiện đến từ quá trình huấn luyện thay vì mạng lớn hơn.
- Các benchmark tác tử vượt V4-Pro-Preview. DeepSeek công bố Terminal Bench 2.1 đạt 82.7, Cybergym đạt 76.7, Toolathlon xác minh đạt 70.3 và DeepSWE đạt 54.4. Đây là số liệu do DeepSeek tự công bố, chạy bằng bộ công cụ của họ ở mức nỗ lực tối đa.
- Hỗ trợ Responses API gốc và tích hợp Codex chính thức. Xem thêm bài DeepSeek-V4-Flash hiện hỗ trợ Responses API và Codex.
- Bản phát hành chính thức của DeepSeek-V4-Pro được ghi là “sẽ sớm ra mắt”. Hỗ trợ Responses API và Codex cho V4-Pro dự kiến vào đầu tháng 8 năm 2026.
Lưu ý: tuyên bố “vượt xa V4-Pro-Preview” dựa trên đánh giá nội bộ của DeepSeek. Hai benchmark được liệt kê, DSBench-FullStack và DSBench-Hard, cũng là bộ dữ liệu thử nghiệm nội bộ. Cần chờ thêm số liệu đánh giá độc lập.
Bước 1: Lấy API key
Truy cập Nền tảng DeepSeek, đăng nhập, sau đó tạo key tại trang API Keys. Key bắt đầu bằng sk-.
Không hard-code key trong mã nguồn. Hãy lưu dưới dạng biến môi trường:
export DEEPSEEK_API_KEY="sk-your-key-here"
DeepSeek API tương thích với định dạng API của OpenAI và Anthropic, nên bạn không cần SDK riêng cho DeepSeek.
| Định dạng | URL cơ sở |
|---|---|
| Tương thích OpenAI | https://api.deepseek.com |
| Tương thích Anthropic | https://api.deepseek.com/anthropic |
Bước 2: Thực hiện cuộc gọi đầu tiên
Kiểm tra nhanh bằng curl
curl https://api.deepseek.com/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer ${DEEPSEEK_API_KEY}" \
-d '{
"model": "deepseek-v4-flash",
"messages": [
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": "Summarize what changed in DeepSeek-V4-Flash-0731."}
],
"stream": false
}'
Nếu request thành công, phản hồi chứa nội dung tại:
choices[0].message.content
Gọi bằng OpenAI Python SDK
Cài SDK:
pip3 install openai
Sau đó trỏ base_url về DeepSeek:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ.get("DEEPSEEK_API_KEY"),
base_url="https://api.deepseek.com"
)
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[
{"role": "system", "content": "You are a helpful assistant."},
{
"role": "user",
"content": "Write a Python function that validates an email address."
}
],
stream=False
)
print(response.choices[0].message.content)
Gọi bằng Node.js
Cài package:
npm install openai
Ví dụ:
import OpenAI from "openai";
const openai = new OpenAI({
baseURL: "https://api.deepseek.com",
apiKey: process.env.DEEPSEEK_API_KEY,
});
const completion = await openai.chat.completions.create({
model: "deepseek-v4-flash",
messages: [
{ role: "user", content: "Hello!" }
],
});
console.log(completion.choices[0].message.content);
Tên model deepseek-v4-flash hiện trỏ đến bản phát hành 0731. Nếu tích hợp hiện tại của bạn đã dùng tên này từ bản preview, model sẽ tự động được nâng cấp mà không cần di chuyển mã.
Bước 3: Kiểm soát chế độ tư duy và nỗ lực suy luận
V4-Flash hỗ trợ chế độ tư duy và không tư duy. Chế độ tư duy được bật mặc định.
Bạn có thể dùng thinking để bật/tắt chế độ này, và reasoning_effort để điều chỉnh mức suy luận:
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[
{
"role": "user",
"content": "Plan a database migration from MySQL to Postgres."
}
],
reasoning_effort="high",
extra_body={
"thinking": {
"type": "enabled"
}
}
)
Các điểm cần lưu ý:
-
temperaturevàtop_pkhông có tác dụng khi chế độ tư duy đang bật. - FIM completion (điền phần giữa, hiện vẫn beta) chỉ hoạt động khi tắt chế độ tư duy.
Cách chọn cấu hình:
| Tình huống | Thiết lập khuyến nghị |
|---|---|
| Tự động hoàn thành, endpoint nhạy cảm độ trễ | Tắt tư duy |
| Lập kế hoạch nhiều bước, tác tử | Bật tư duy |
| Gỡ lỗi khó, phân tích phức tạp | Bật tư duy và dùng reasoning_effort="high"
|
Bước 4: Streaming phản hồi
Đặt stream=True để API trả phản hồi qua Server-Sent Events (SSE).
Nếu bạn chưa quen với định dạng này, hãy xem hướng dẫn truyền tải phản hồi LLM bằng các sự kiện được gửi từ máy chủ.
stream = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[
{
"role": "user",
"content": "Explain connection pooling."
}
],
stream=True
)
for chunk in stream:
if chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="")
Với streaming, hãy xử lý từng chunk thay vì đợi toàn bộ phản hồi. Đây là cách phù hợp cho chatbot, giao diện code assistant hoặc tiến trình tác tử dài.
Giá trong giai đoạn beta công khai
Theo trang Mô hình & Giá cả chính thức, V4-Flash có mức giá như sau:
| Mục | deepseek-v4-flash |
deepseek-v4-pro |
|---|---|---|
| Đầu vào, trúng cache (mỗi 1 triệu token) | $0.0028 | $0.003625 |
| Đầu vào, trượt cache (mỗi 1 triệu token) | $0.14 | $0.435 |
| Đầu ra (mỗi 1 triệu token) | $0.28 | $0.87 |
| Độ dài ngữ cảnh | 1 triệu token | 1 triệu token |
| Đầu ra tối đa | 384K | 384K |
| Giới hạn đồng thời | 2.500 | 500 |
Ba điểm thực tế cần theo dõi:
- Context caching là tự động. Một cache hit rẻ hơn cache miss hơn 50 lần. Các tác tử tái sử dụng system prompt dài sẽ hưởng lợi đáng kể.
- Giá giờ cao điểm/thấp điểm. DeepSeek công bố mức phí gấp 2 lần trong giờ cao điểm, từ 9:00–12:00 và 14:00–18:00 theo giờ Bắc Kinh. Tính đến ngày 31 tháng 7, tài liệu ghi ngày áp dụng “tùy thuộc vào thông báo chính thức”, nên chính sách này chưa hoạt động.
- Giới hạn đồng thời cao. Flash hỗ trợ 2.500 request đồng thời, so với 500 của Pro. Điều này phù hợp với khối lượng công việc tác tử lớn.
Để xem thêm chi phí trên toàn bộ dòng V4, bao gồm lịch sử giảm giá vĩnh viễn V4-Pro, hãy xem phân tích giá DeepSeek V4 API.
Kiểm tra và gỡ lỗi API trong Apidog
curl phù hợp để thử nhanh, nhưng bạn sẽ cần khả năng quan sát tốt hơn khi so sánh đầu ra giữa chế độ tư duy và không tư duy, hoặc kiểm tra streaming và tool calls.
Dưới đây là quy trình thiết lập trong khoảng năm phút với Apidog:
- Tạo project và thêm endpoint. Thêm endpoint:
POST https://api.deepseek.com/chat/completions
Bạn cũng có thể import OpenAI-compatible specification để thêm nhiều endpoint cùng lúc.
-
Lưu API key thành biến môi trường.
Tạo biến
DEEPSEEK_API_KEY, sau đó dùng trong header:
Authorization: Bearer {{DEEPSEEK_API_KEY}}
Cách này giúp chuyển giữa key test và production chỉ bằng cách đổi environment.
Gửi request và kiểm tra SSE.
Với streaming, Apidog hiển thị các sự kiện SSE khi chúng đến. Bạn có thể quan sát delta suy luận và delta nội dung riêng biệt thay vì đọc các dòngdata:thô.Lưu biến thể thành test case.
Lưu một request bật tư duy và một request tắt tư duy. Sau mỗi lần DeepSeek cập nhật model, chạy lại cả hai để kiểm tra prompt, định dạng phản hồi và hành vi streaming.
Tải Apidog miễn phí; toàn bộ quy trình trên hoạt động với gói miễn phí.
Câu hỏi thường gặp
Tôi có cần thay đổi mã để dùng model mới không?
Không. deepseek-v4-flash hiện phục vụ DeepSeek-V4-Flash-0731. Các tích hợp đang dùng tên model này sẽ tự động nhận bản nâng cấp.
Đây có phải là cùng model với ứng dụng DeepSeek không?
Không. Bản cập nhật ngày 31 tháng 7 chỉ áp dụng cho API. Model trên ứng dụng và web không thay đổi.
Điều gì xảy ra với deepseek-chat và deepseek-reasoner?
Các tên model cũ được lên lịch ngừng hoạt động vào ngày 24 tháng 7 năm 2026. Hãy dùng deepseek-v4-flash hoặc deepseek-v4-pro. Xem hướng dẫn cách sử dụng DeepSeek V4 API để biết cách di chuyển.
Tôi có thể dùng miễn phí không?
DeepSeek API tính phí theo mức sử dụng và không có gói miễn phí vĩnh viễn. Tuy nhiên, giá cache hit giúp chi phí thử nghiệm thực tế rất thấp. Xem cách sử dụng DeepSeek V4 API miễn phí để biết các tùy chọn hiện tại.
V4-Flash có hoạt động với Codex và Responses API không?
Có. V4-Flash hiện là model DeepSeek duy nhất hỗ trợ cả Codex và Responses API. Hỗ trợ V4-Pro dự kiến vào đầu tháng 8 năm 2026. Xem hướng dẫn Responses API và Codex để thiết lập đầy đủ.
Tổng kết
DeepSeek-V4-Flash-0731 là bản phát hành “thầm lặng”: cùng tên model, cùng mức giá và cùng kiến trúc, nhưng có bộ benchmark tác tử tốt hơn V4-Pro-Preview theo số liệu nội bộ của DeepSeek.
Để triển khai ngay:
- Tạo API key.
- Trỏ OpenAI SDK đến
https://api.deepseek.com. - Dùng model
deepseek-v4-flash. - Chạy prompt và test case của riêng bạn thay vì chỉ dựa vào benchmark.
- Lưu các request quan trọng trong Apidog để chạy hồi quy sau mỗi bản cập nhật model.


Top comments (0)