DeepSeek merilis API resmi DeepSeek-V4-Flash pada 31 Juli 2026. Dalam pengumuman resminya, DeepSeek menyoroti peningkatan kemampuan agen, dukungan native untuk format OpenAI Responses API, serta kompatibilitas Codex sejak hari pertama.
Jika Anda sudah memakai deepseek-v4-flash sejak April, Anda sebelumnya menggunakan versi pratinjau. Rilis ini mempromosikan model tersebut menjadi DeepSeek-V4-Flash-0731 tanpa mengubah nama model. Artinya, integrasi yang sudah ada akan otomatis menggunakan versi resmi tanpa perubahan kode.
Panduan ini berfokus pada implementasi: membuat API key, mengirim request pertama, mengatur mode berpikir, menangani streaming, dan menguji endpoint. Jika Anda belum memahami keluarga modelnya, baca Apa Itu DeepSeek V4? terlebih dahulu.
💡 Setelah memiliki API key, uji endpoint sebelum menambahkannya ke aplikasi. Dengan Apidog, Anda dapat mengirim request ke DeepSeek API, memeriksa event streaming satu per satu, dan menyimpan request yang berhasil sebagai test case yang dapat digunakan kembali.
Apa yang dirilis pada 31 Juli
Menurut log perubahan resmi, rilis ini hanya berlaku untuk API. Aplikasi DeepSeek, model web, dan API V4-Pro tidak berubah.
Ringkasannya:
- DeepSeek-V4-Flash-0731 adalah rilis resmi lini V4-Flash dan tersedia dalam beta publik melalui API.
- Arsitektur dan ukuran model tetap sama seperti V4-Flash-Preview. DeepSeek menyatakan peningkatan berasal dari pelatihan pasca-pelatihan, bukan dari jaringan yang lebih besar.
- DeepSeek melaporkan skor benchmark agen yang melampaui V4-Pro-Preview: Terminal Bench 2.1
82.7, Cybergym76.7, Toolathlon terverifikasi70.3, dan DeepSWE54.4. - Model mendukung Responses API secara native dan memiliki integrasi Codex resmi. Lihat panduan DeepSeek-V4-Flash kini mendukung Responses API dan Codex.
- Rilis resmi DeepSeek-V4-Pro disebut akan menyusul. Dukungan Responses API dan Codex untuk V4-Pro diharapkan pada awal Agustus 2026.
Perlu dicatat: benchmark utama tersebut diterbitkan dan diuji oleh DeepSeek sendiri. Dua benchmark, DSBench-FullStack dan DSBench-Hard, juga merupakan kumpulan pengujian internal. Validasi mandiri dengan prompt, workload, dan test suite Anda sendiri sebelum menggunakan model di produksi.
Langkah 1: Buat API key
Buka DeepSeek Platform, masuk, lalu buat key dari halaman API Keys. Key akan diawali dengan sk-.
Jangan menulis key langsung di source code. Simpan sebagai environment variable:
export DEEPSEEK_API_KEY="sk-kunci-anda-di-sini"
DeepSeek API kompatibel dengan format OpenAI dan Anthropic, sehingga Anda dapat menggunakan SDK yang sudah ada.
| Format | Base URL |
|---|---|
| Kompatibel OpenAI | https://api.deepseek.com |
| Kompatibel Anthropic | https://api.deepseek.com/anthropic |
Langkah 2: Kirim request pertama
Mulailah dengan request curl untuk memastikan key, endpoint, dan model sudah benar:
curl https://api.deepseek.com/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer ${DEEPSEEK_API_KEY}" \
-d '{
"model": "deepseek-v4-flash",
"messages": [
{"role": "system", "content": "Anda adalah asisten yang membantu."},
{"role": "user", "content": "Ringkas apa yang berubah di DeepSeek-V4-Flash-0731."}
],
"stream": false
}'
Jika request berhasil, Anda akan menerima respons JSON dengan output model di:
choices[0].message.content
Python dengan OpenAI SDK
Install dependensi:
pip3 install openai
Gunakan base_url DeepSeek saat membuat client:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ.get("DEEPSEEK_API_KEY"),
base_url="https://api.deepseek.com"
)
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[
{"role": "system", "content": "Anda adalah asisten yang membantu."},
{
"role": "user",
"content": "Tulis fungsi Python yang memvalidasi alamat email."
}
],
stream=False
)
print(response.choices[0].message.content)
Node.js dengan OpenAI SDK
Install package:
npm install openai
Lalu buat request:
import OpenAI from "openai";
const openai = new OpenAI({
baseURL: "https://api.deepseek.com",
apiKey: process.env.DEEPSEEK_API_KEY,
});
const completion = await openai.chat.completions.create({
model: "deepseek-v4-flash",
messages: [
{ role: "user", content: "Halo!" }
],
});
console.log(completion.choices[0].message.content);
Karena deepseek-v4-flash sekarang menunjuk ke rilis DeepSeek-V4-Flash-0731, aplikasi yang sebelumnya memakai versi pratinjau tidak perlu dimigrasikan.
Langkah 3: Atur mode berpikir dan effort penalaran
V4-Flash mendukung mode berpikir dan mode tanpa berpikir. Mode berpikir aktif secara default.
Gunakan thinking untuk mengaktifkan atau menonaktifkan mode tersebut, lalu gunakan reasoning_effort untuk mengatur kedalaman penalaran:
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[
{
"role": "user",
"content": "Rencanakan migrasi database dari MySQL ke Postgres."
}
],
reasoning_effort="high",
extra_body={
"thinking": {
"type": "enabled"
}
}
)
Perhatikan dua perilaku berikut:
-
temperaturedantop_ptidak berpengaruh ketika mode berpikir aktif. - FIM (fill-in-the-middle), yang masih beta, hanya berfungsi dalam mode tanpa berpikir.
Gunakan mode tanpa berpikir untuk endpoint yang sensitif terhadap latensi, misalnya autocomplete. Untuk debugging kompleks, perencanaan, dan loop agen, pertahankan mode berpikir aktif dan tingkatkan reasoning_effort.
Langkah 4: Tangani respons streaming
Untuk menerima token secara bertahap, set stream menjadi true. API akan mengirim event menggunakan Server-Sent Events (SSE).
Jika Anda perlu memahami format SSE sebelum mengimplementasikannya, baca panduan streaming respons LLM menggunakan server-sent events.
stream = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[
{
"role": "user",
"content": "Jelaskan connection pooling."
}
],
stream=True
)
for chunk in stream:
if chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="")
Saat mengimplementasikan streaming di aplikasi, pastikan UI Anda dapat menangani delta kosong. Tidak setiap event SSE selalu membawa teks output.
Harga selama beta publik
Menurut halaman resmi Model & Harga, harga DeepSeek-V4-Flash adalah sebagai berikut:
| Item | deepseek-v4-flash |
deepseek-v4-pro |
|---|---|---|
| Input, cache hit per 1 juta token | $0.0028 | $0.003625 |
| Input, cache miss per 1 juta token | $0.14 | $0.435 |
| Output per 1 juta token | $0.28 | $0.87 |
| Panjang konteks | 1 juta token | 1 juta token |
| Output maksimum | 384K | 384K |
| Batas konkurensi | 2.500 | 500 |
Tiga hal yang perlu dipertimbangkan saat menghitung biaya:
- Context caching otomatis. Cache hit berbiaya 50 kali lebih murah daripada cache miss. Agen yang menggunakan ulang system prompt atau konteks panjang dapat memperoleh penghematan besar.
- Harga puncak dan non-puncak. DeepSeek telah mengumumkan biaya 2x pada jam puncak, yaitu pukul 09.00–12.00 dan 14.00–18.00 waktu Beijing. Per 31 Juli, tanggal efektifnya masih menunggu pengumuman resmi.
- Konkurensi tinggi untuk Flash. Batas 2.500 request bersamaan pada Flash, dibandingkan 500 pada Pro, menunjukkan bahwa model ini ditujukan untuk workload agen berskala besar.
Untuk perbandingan biaya seluruh keluarga V4, termasuk riwayat pemotongan harga permanen V4-Pro, baca rincian harga DeepSeek V4 API.
Uji dan debug API di Apidog
curl cukup untuk smoke test. Namun, saat Anda perlu membandingkan output mode berpikir dan tanpa berpikir, memeriksa header, atau memantau SSE, gunakan tool API client yang dapat menyimpan request dan environment.
Berikut alur kerja di Apidog:
- Buat project dan endpoint. Tambahkan endpoint berikut:
POST https://api.deepseek.com/chat/completions
Anda juga dapat mengimpor spesifikasi yang kompatibel dengan OpenAI untuk menambahkan endpoint sekaligus.
-
Simpan API key sebagai environment variable.
Buat variabel
DEEPSEEK_API_KEY, lalu gunakan pada header:
Authorization: Bearer {{DEEPSEEK_API_KEY}}
Dengan pendekatan ini, Anda dapat berpindah antara key pengujian dan produksi tanpa mengubah request.
Periksa respons streaming.
Saatstreamaktif, pantau event SSE yang masuk. Ini memudahkan Anda memeriksa delta respons tanpa membaca barisdata:mentah dari terminal.Simpan variasi request sebagai test case.
Simpan satu request dengan mode berpikir aktif dan satu request tanpa berpikir. Jalankan kembali keduanya setelah pembaruan model untuk memastikan prompt dan integrasi Anda tetap stabil.
Unduh Apidog secara gratis untuk menjalankan alur pengujian ini.
FAQ
Apakah saya perlu mengubah kode untuk mendapatkan model baru?
Tidak. Nama model deepseek-v4-flash sekarang melayani DeepSeek-V4-Flash-0731. Integrasi yang ada diperbarui otomatis.
Apakah ini model yang sama dengan aplikasi DeepSeek?
Tidak. Pembaruan 31 Juli hanya mencakup API. Aplikasi dan model web tidak berubah.
Apa yang terjadi pada deepseek-chat dan deepseek-reasoner?
Nama model lama tersebut dijadwalkan dihentikan pada 24 Juli 2026. Gunakan deepseek-v4-flash atau deepseek-v4-pro. Lihat panduan cara menggunakan DeepSeek V4 API untuk langkah migrasi.
Bisakah saya menggunakannya secara gratis?
DeepSeek API menggunakan model bayar sesuai pemakaian dan tidak memiliki free tier permanen. Namun, harga cache hit dapat membuat eksperimen berbiaya sangat rendah. Lihat cara menggunakan DeepSeek V4 API secara gratis untuk opsi saat ini.
Apakah V4-Flash mendukung Codex dan Responses API?
Ya. V4-Flash mendukung keduanya dan, sejauh ini, merupakan satu-satunya model DeepSeek yang melakukannya. Dukungan V4-Pro diharapkan pada awal Agustus 2026. Baca panduan Responses API dan Codex untuk implementasinya.
Intinya
DeepSeek-V4-Flash-0731 mempertahankan nama model, harga, dan arsitektur yang sama, tetapi membawa peningkatan kemampuan agen berdasarkan benchmark yang diterbitkan DeepSeek. Dukungan Responses API dan Codex juga menjadikannya relevan untuk workload agen dengan konkurensi tinggi.
Langkah praktisnya sederhana:
- Buat API key.
- Arahkan OpenAI SDK ke
https://api.deepseek.com. - Uji
deepseek-v4-flashdengan prompt dan test suite Anda sendiri. - Simpan request penting sebagai regression test agar perubahan model tidak mengejutkan aplikasi Anda.
Apidog dapat mempercepat proses tersebut: simpan request, bandingkan variasi parameter, dan jalankan ulang test case setelah pembaruan model.


Top comments (0)