DeepSeek V4 Pro keluar dari tahap pratinjau pada 12 Agustus 2026. Build GA dengan cap 0813 kini tersedia melalui endpoint API deepseek-v4-pro, dengan jendela konteks 1 juta token, output maksimum 384 ribu token, serta harga input cache hit $0,003625 per juta token. Seperti yang dilaporkan Unite.AI, model yang berada dalam pratinjau selama empat bulan ini kini menjadi model unggulan DeepSeek.
Artikel ini berfokus pada implementasi: membuat request pertama memakai OpenAI SDK, memilih mode berpikir, menangani reasoning_content, streaming SSE, function calling, serta mengoptimalkan prompt caching. Untuk latar belakang arsitekturnya, baca Apa itu DeepSeek V4.
TL;DR
- Gunakan endpoint produksi
deepseek-v4-prountuk build GA0813. - API kompatibel dengan OpenAI. Arahkan SDK
openaikehttps://api.deepseek.com. - Model mendukung konteks 1 juta token, output hingga 384K token, dan mode
non-think,think high, sertathink max. - Input cache miss: $0,435/juta token. Cache hit: $0,003625/juta token. Output: $0,87/juta token.
- Susun prompt dengan prefix stabil agar cache hit tinggi.
- Uji Chat Completions dan SSE sebelum menghubungkan model ke workflow produksi.
- Simpan koleksi request dan environment Pro/Flash di Apidog.
Apa yang berubah pada build GA 0813
Pratinjau V4 dibuka pada April 2026, V4 Flash dirilis pada Juli, lalu V4 Pro masuk GA pada 12 Agustus sebagai snapshot 0813.
Bagi developer, perubahan utamanya adalah:
Snapshot lebih stabil
Build pratinjau dapat berubah dan memengaruhi hasil evaluasi atau prompt tuning. Build0813menjadi target yang tetap hingga snapshot baru diumumkan.Endpoint produksi lebih sederhana
Panggildeepseek-v4-propada API resmi. Jika perlu merujuk snapshot eksplisit, OpenRouter mencantumkannya sebagaideepseek/deepseek-v4-pro-0813.Fitur API tersedia pada endpoint GA
Mode berpikir, function calling, output terstruktur, prompt caching, serta format OpenAI, Anthropic, dan Responses tersedia pada endpoint ini.
Di balik layar, V4 Pro adalah model mixture-of-experts dengan total 1,6 triliun parameter dan 49 miliar parameter aktif per token. DeepSeek menyatakan Compressed Sparse Attention dan Heavily Compressed Attention menurunkan komputasi inferensi satu token menjadi 27% dari V3.2 serta cache KV menjadi 10%.
DeepSeek V4 Pro 0813: spesifikasi
| Spesifikasi | DeepSeek V4 Pro 0813 |
|---|---|
| Rilis | GA pada 12 Agustus 2026, snapshot 0813
|
| Arsitektur | Mixture-of-experts, total 1,6T parameter, 49B aktif per token |
| Perhatian | Compressed Sparse Attention + Heavily Compressed Attention |
| Biaya inferensi vs V3.2 | 27% komputasi satu token, 10% cache KV |
| Jendela konteks | 1.000.000 token |
| Output maksimum | 384K token |
| Mode berpikir |
non-think, think high, think max
|
| Harga input | $0,435/M cache miss, $0,003625/M cache hit |
| Harga output | $0,87/M |
| Format API | OpenAI Chat Completions, Anthropic Messages, DeepSeek Responses |
| Model ID | deepseek-v4-pro |
| Model lebih kecil |
deepseek-v4-flash, total 284B / aktif 13B |
Kartu model DeepSeek melaporkan SWE-bench Verified 80,6%, Terminal Bench 2.0 67,9%, GPQA Diamond 90,1%, dan LiveCodeBench 93,5% untuk konfigurasi V4-Pro-Max. Karena angka ini merupakan laporan vendor, lakukan evaluasi terhadap dataset dan tugas Anda sendiri sebelum memindahkan workload penting.
1. Buat API key dan kirim request pertama
Langkah setup:
- Buat akun di platform.deepseek.com dan tambahkan kredit karena API bersifat prabayar.
- Buka halaman API key, buat key baru, lalu salin segera.
- Simpan key sebagai environment variable.
export DEEPSEEK_API_KEY="sk-..."
Install SDK OpenAI:
pip install openai
DeepSeek mendukung protokol OpenAI Chat Completions. Gunakan https://api.deepseek.com atau https://api.deepseek.com/v1 sebagai base_url.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DEEPSEEK_API_KEY"],
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[
{
"role": "system",
"content": "You are a concise technical assistant.",
},
{
"role": "user",
"content": "Explain idempotency in REST APIs in two sentences.",
},
],
)
print(response.choices[0].message.content)
print(response.usage)
Selalu log response.usage. Data ini diperlukan untuk memantau token input, output, dan efektivitas cache saat workload mulai bertambah.
Untuk menguji endpoint tanpa SDK, gunakan curl:
curl https://api.deepseek.com/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $DEEPSEEK_API_KEY" \
-d '{
"model": "deepseek-v4-pro",
"messages": [
{
"role": "user",
"content": "List three ways to version a REST API."
}
]
}'
Lihat parameter lengkap pada dokumentasi resmi DeepSeek, termasuk endpoint Anthropic Messages dan DeepSeek Responses API.
2. Pilih mode berpikir sesuai tugas
V4 Pro menggunakan satu endpoint dengan tiga tingkat penalaran:
-
non-think: respons langsung untuk ekstraksi, klasifikasi, pemformatan, dan ringkasan. -
think high: penalaran sebelum jawaban. Cocok untuk coding, debugging, dan analisis multi-langkah. -
think max: anggaran penalaran maksimum untuk masalah yang benar-benar kompleks.
Gunakan parameter reasoning_effort:
response = client.chat.completions.create(
model="deepseek-v4-pro",
reasoning_effort="high", # "none" | "high" | "max"
messages=[
{
"role": "user",
"content": (
"Our API returns 502s under load but only behind the CDN. "
"Walk through likely causes in order of probability."
),
},
],
)
message = response.choices[0].message
print("--- Reasoning ---")
print(message.reasoning_content)
print("--- Answer ---")
print(message.content)
Praktik penting:
- Jangan kirim ulang
reasoning_contentke riwayat percakapan. - Untuk giliran berikutnya, kirim hanya
contentdari respons sebelumnya. - Token penalaran ditagih sebagai output token, jadi gunakan
think maxhanya jika nilai tambahnya sebanding dengan biaya dan latensi.
3. Streaming respons dengan SSE
Untuk output panjang atau mode berpikir, aktifkan streaming agar pengguna tidak menunggu hingga respons selesai seluruhnya.
stream = client.chat.completions.create(
model="deepseek-v4-pro",
reasoning_effort="high",
stream=True,
messages=[
{
"role": "user",
"content": (
"Design a rate limiter for a public API. "
"Compare token bucket and sliding window."
),
},
],
)
for chunk in stream:
if not chunk.choices:
continue # Final chunk dapat hanya berisi usage.
delta = chunk.choices[0].delta
if getattr(delta, "reasoning_content", None):
print(delta.reasoning_content, end="", flush=True)
elif delta.content:
print(delta.content, end="", flush=True)
Untuk UI:
- Render
reasoning_contentsebagai status “berpikir” yang dapat diciutkan. - Saat
contentmulai muncul, pindahkan output ke area jawaban utama. - Simpan status stream dan error agar pengguna tahu apakah koneksi terputus atau model masih memproses.
Implementasi ini menggunakan server-sent events standar. Lihat panduan streaming respons API dengan SSE untuk detail mekanismenya.
4. Gunakan function calling
V4 Pro mendukung function calling gaya OpenAI. Anda dapat memakai loop agen yang sudah ada: kirim tools, baca tool_calls, eksekusi tool, masukkan hasilnya ke messages, lalu ulangi request.
tools = [{
"type": "function",
"function": {
"name": "get_endpoint_status",
"description": "Check the health of an internal API endpoint",
"parameters": {
"type": "object",
"properties": {
"endpoint": {
"type": "string",
"description": "Path, e.g. /v1/orders",
}
},
"required": ["endpoint"],
},
},
}]
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[
{
"role": "user",
"content": "Is /v1/orders healthy right now?",
},
],
tools=tools,
)
tool_calls = response.choices[0].message.tool_calls
print(tool_calls)
Untuk production loop, validasi argumen tool sebelum dieksekusi. Jangan biarkan model langsung menjalankan query database, command shell, atau request internal tanpa authorization dan allowlist.
Gunakan response_format ketika Anda membutuhkan JSON yang dapat diurai. Detail bentuk message dan tool result tersedia di dokumentasi resmi DeepSeek.
5. Rancang prompt untuk cache hit
Prompt caching adalah salah satu faktor arsitektur paling penting pada V4 Pro.
DeepSeek melakukan cache pada prefix prompt secara otomatis. Input cache miss dihargai $0,435/juta token, sedangkan cache hit hanya $0,003625/juta token—diskon sekitar 120x.
Misalnya, agen coding membawa konteks repositori sebesar 200K token dan melakukan 50 request dalam satu sesi:
- Tanpa cache:
50 × 200K × $0,435/M ≈ $4,35 - Dengan cache: satu cache miss
≈ $0,087+ 49 cache hit≈ $0,0007per request, total≈ $0,12
Agar prefix dapat di-cache, susun message seperti ini:
[Stabil]
- System prompt
- Instruksi proyek
- Dokumentasi internal
- Konteks repositori
- Definisi tool
[Berubah setiap request]
- Pesan terbaru pengguna
- ID request
- Timestamp
- Hasil tool terbaru
Hindari menaruh timestamp, request ID, atau data dinamis pada system prompt. Perubahan di awal prompt dapat membatalkan cache prefix dan mengubah request berikutnya menjadi cache miss.
Dengan pola ini, konteks 1 juta token tidak hanya menjadi fitur demo. Cache miss untuk 1 juta token memerlukan sekitar $0,435, tetapi prefix stabil yang terkena cache biayanya sekitar sepertiga sen per request.
Baca Apa itu prompt caching untuk konsep dan strategi caching lebih lanjut.
6. Uji deepseek-v4-pro di Apidog
Sebelum mengintegrasikan endpoint ke aplikasi produksi, uji request, environment, dan stream secara terpisah. Karena API DeepSeek kompatibel dengan OpenAI, Apidog dapat digunakan tanpa konfigurasi khusus.
Langkah yang dapat dilakukan:
Impor request dari
curl
Tempel commandcurlsebelumnya ke Apidog. URL, header, autentikasi, dan request body akan menjadi request yang dapat diedit.Buat environment Pro dan Flash
Simpanbase_url, API key, dan model sebagai environment variable.
Contoh:
base_url = https://api.deepseek.com
api_key = sk-...
model = deepseek-v4-pro
Buat environment kedua dengan:
model = deepseek-v4-flash
Dengan ini, Anda dapat membandingkan hasil dan biaya Pro vs Flash menggunakan request yang sama.
Periksa SSE secara langsung
Tambahkan"stream": trueke request body. Apidog dapat membantu memeriksa urutan event dan memisahkan fasereasoning_contentdari output akhir.Simpan sebagai koleksi regresi
Saat DeepSeek merilis snapshot baru, jalankan ulang koleksi yang sama untuk membandingkan output, penggunaan token, latency, dan perilaku tool calling.
Perhatikan blok usage pada setiap respons. Ini cara cepat untuk mengecek apakah struktur prompt Anda benar-benar menghasilkan cache hit.
Harga saat ini dan kenaikan yang perlu diantisipasi
| Model | Input cache miss | Input cache hit | Output |
|---|---|---|---|
deepseek-v4-pro |
$0,435/M | $0,003625/M | $0,87/M |
deepseek-v4-flash |
$0,14/M | — | $0,28/M |
Pada 6 Agustus 2026, DeepSeek memperingatkan bahwa kenaikan harga API yang “signifikan” akan datang, tetapi tanpa angka atau tanggal efektif.
Sambil menunggu detailnya, lakukan tiga hal:
Ukur biaya aktual per tugas
Simpan datausagedari workload nyata agar Anda dapat menghitung dampak kenaikan harga dengan cepat.Maksimalkan cache hit
Pertahankan prefix stabil dan pindahkan data dinamis ke bagian akhir prompt.Gunakan Flash sebagai fallback
Gunakandeepseek-v4-flashuntuk klasifikasi, ekstraksi, chat sederhana, dan tugas bervolume tinggi. Cadangkan Pro untuk reasoning, coding agent, dan analisis konteks panjang.
Untuk detail perbandingan biaya, lihat panduan harga API DeepSeek V4.
FAQ
Apakah kode OpenAI SDK yang sudah ada akan berfungsi?
Hampir. Ubah base_url, API key, dan model:
client = OpenAI(
api_key=os.environ["DEEPSEEK_API_KEY"],
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[...],
)
Chat Completions, streaming, tools, dan structured output mengikuti format OpenAI. Jika aplikasi Anda memakai Anthropic SDK, gunakan endpoint DeepSeek Anthropic Messages.
Kapan menggunakan V4 Flash, bukan V4 Pro?
Gunakan Flash untuk tugas sederhana yang sensitif terhadap biaya dan latensi:
- Klasifikasi
- Ekstraksi data
- Ringkasan pendek
- Chat dasar
- Routing atau preprocessing
Gunakan Pro untuk:
- Coding agent
- Debugging kompleks
- Analisis multi-langkah
- Konteks panjang
- Tugas yang membutuhkan mode berpikir
Pilih berdasarkan karakteristik tugas, bukan hanya model yang lebih besar.
Bisakah V4 Pro 0813 digunakan di Cursor?
Ya. Cursor mendukung endpoint kustom yang kompatibel dengan OpenAI, sehingga Anda dapat menambahkan build GA sebagai model kustom. Lihat panduan Cara menggunakan DeepSeek V4 Pro dengan Cursor.
Ringkasan
Mulai implementasi V4 Pro dengan langkah yang dapat diukur:
- Buat API key dan kirim request Chat Completions pertama.
- Pilih
reasoning_effortberdasarkan kompleksitas tugas. - Aktifkan streaming untuk output panjang dan mode berpikir.
- Validasi function calls sebelum menjalankan tool.
- Susun prefix prompt yang stabil untuk memaksimalkan cache hit.
- Simpan request benchmark di Apidog agar Anda dapat membandingkan snapshot dan perubahan harga berikutnya.


Top comments (0)