DEV Community

Cover image for DeepSeek-V4-Flash API Telah Tersedia: Cara Menggunakan API Resmi (Panduan Beta Publik)
Walse
Walse

Posted on • Originally published at apidog.com

DeepSeek-V4-Flash API Telah Tersedia: Cara Menggunakan API Resmi (Panduan Beta Publik)

DeepSeek merilis API resmi DeepSeek-V4-Flash pada 31 Juli 2026. Dalam pengumuman resminya, DeepSeek menyoroti peningkatan kemampuan agen, dukungan native untuk format OpenAI Responses API, serta kompatibilitas Codex sejak hari pertama.

Coba Apidog hari ini

Jika Anda sudah memakai deepseek-v4-flash sejak April, Anda sebelumnya menggunakan versi pratinjau. Rilis ini mempromosikan model tersebut menjadi DeepSeek-V4-Flash-0731 tanpa mengubah nama model. Artinya, integrasi yang sudah ada akan otomatis menggunakan versi resmi tanpa perubahan kode.

Panduan ini berfokus pada implementasi: membuat API key, mengirim request pertama, mengatur mode berpikir, menangani streaming, dan menguji endpoint. Jika Anda belum memahami keluarga modelnya, baca Apa Itu DeepSeek V4? terlebih dahulu.

💡 Setelah memiliki API key, uji endpoint sebelum menambahkannya ke aplikasi. Dengan Apidog, Anda dapat mengirim request ke DeepSeek API, memeriksa event streaming satu per satu, dan menyimpan request yang berhasil sebagai test case yang dapat digunakan kembali.

Apa yang dirilis pada 31 Juli

Menurut log perubahan resmi, rilis ini hanya berlaku untuk API. Aplikasi DeepSeek, model web, dan API V4-Pro tidak berubah.

Ringkasannya:

  • DeepSeek-V4-Flash-0731 adalah rilis resmi lini V4-Flash dan tersedia dalam beta publik melalui API.
  • Arsitektur dan ukuran model tetap sama seperti V4-Flash-Preview. DeepSeek menyatakan peningkatan berasal dari pelatihan pasca-pelatihan, bukan dari jaringan yang lebih besar.
  • DeepSeek melaporkan skor benchmark agen yang melampaui V4-Pro-Preview: Terminal Bench 2.1 82.7, Cybergym 76.7, Toolathlon terverifikasi 70.3, dan DeepSWE 54.4.
  • Model mendukung Responses API secara native dan memiliki integrasi Codex resmi. Lihat panduan DeepSeek-V4-Flash kini mendukung Responses API dan Codex.
  • Rilis resmi DeepSeek-V4-Pro disebut akan menyusul. Dukungan Responses API dan Codex untuk V4-Pro diharapkan pada awal Agustus 2026.

Perlu dicatat: benchmark utama tersebut diterbitkan dan diuji oleh DeepSeek sendiri. Dua benchmark, DSBench-FullStack dan DSBench-Hard, juga merupakan kumpulan pengujian internal. Validasi mandiri dengan prompt, workload, dan test suite Anda sendiri sebelum menggunakan model di produksi.

Perbandingan benchmark DeepSeek-V4-Flash

Langkah 1: Buat API key

Buka DeepSeek Platform, masuk, lalu buat key dari halaman API Keys. Key akan diawali dengan sk-.

Jangan menulis key langsung di source code. Simpan sebagai environment variable:

export DEEPSEEK_API_KEY="sk-kunci-anda-di-sini"
Enter fullscreen mode Exit fullscreen mode

DeepSeek API kompatibel dengan format OpenAI dan Anthropic, sehingga Anda dapat menggunakan SDK yang sudah ada.

Format Base URL
Kompatibel OpenAI https://api.deepseek.com
Kompatibel Anthropic https://api.deepseek.com/anthropic

Langkah 2: Kirim request pertama

Mulailah dengan request curl untuk memastikan key, endpoint, dan model sudah benar:

curl https://api.deepseek.com/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer ${DEEPSEEK_API_KEY}" \
  -d '{
    "model": "deepseek-v4-flash",
    "messages": [
      {"role": "system", "content": "Anda adalah asisten yang membantu."},
      {"role": "user", "content": "Ringkas apa yang berubah di DeepSeek-V4-Flash-0731."}
    ],
    "stream": false
  }'
Enter fullscreen mode Exit fullscreen mode

Jika request berhasil, Anda akan menerima respons JSON dengan output model di:

choices[0].message.content
Enter fullscreen mode Exit fullscreen mode

Python dengan OpenAI SDK

Install dependensi:

pip3 install openai
Enter fullscreen mode Exit fullscreen mode

Gunakan base_url DeepSeek saat membuat client:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ.get("DEEPSEEK_API_KEY"),
    base_url="https://api.deepseek.com"
)

response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[
        {"role": "system", "content": "Anda adalah asisten yang membantu."},
        {
            "role": "user",
            "content": "Tulis fungsi Python yang memvalidasi alamat email."
        }
    ],
    stream=False
)

print(response.choices[0].message.content)
Enter fullscreen mode Exit fullscreen mode

Node.js dengan OpenAI SDK

Install package:

npm install openai
Enter fullscreen mode Exit fullscreen mode

Lalu buat request:

import OpenAI from "openai";

const openai = new OpenAI({
  baseURL: "https://api.deepseek.com",
  apiKey: process.env.DEEPSEEK_API_KEY,
});

const completion = await openai.chat.completions.create({
  model: "deepseek-v4-flash",
  messages: [
    { role: "user", content: "Halo!" }
  ],
});

console.log(completion.choices[0].message.content);
Enter fullscreen mode Exit fullscreen mode

Karena deepseek-v4-flash sekarang menunjuk ke rilis DeepSeek-V4-Flash-0731, aplikasi yang sebelumnya memakai versi pratinjau tidak perlu dimigrasikan.

Langkah 3: Atur mode berpikir dan effort penalaran

V4-Flash mendukung mode berpikir dan mode tanpa berpikir. Mode berpikir aktif secara default.

Gunakan thinking untuk mengaktifkan atau menonaktifkan mode tersebut, lalu gunakan reasoning_effort untuk mengatur kedalaman penalaran:

response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[
        {
            "role": "user",
            "content": "Rencanakan migrasi database dari MySQL ke Postgres."
        }
    ],
    reasoning_effort="high",
    extra_body={
        "thinking": {
            "type": "enabled"
        }
    }
)
Enter fullscreen mode Exit fullscreen mode

Perhatikan dua perilaku berikut:

  • temperature dan top_p tidak berpengaruh ketika mode berpikir aktif.
  • FIM (fill-in-the-middle), yang masih beta, hanya berfungsi dalam mode tanpa berpikir.

Gunakan mode tanpa berpikir untuk endpoint yang sensitif terhadap latensi, misalnya autocomplete. Untuk debugging kompleks, perencanaan, dan loop agen, pertahankan mode berpikir aktif dan tingkatkan reasoning_effort.

Langkah 4: Tangani respons streaming

Untuk menerima token secara bertahap, set stream menjadi true. API akan mengirim event menggunakan Server-Sent Events (SSE).

Jika Anda perlu memahami format SSE sebelum mengimplementasikannya, baca panduan streaming respons LLM menggunakan server-sent events.

stream = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[
        {
            "role": "user",
            "content": "Jelaskan connection pooling."
        }
    ],
    stream=True
)

for chunk in stream:
    if chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="")
Enter fullscreen mode Exit fullscreen mode

Saat mengimplementasikan streaming di aplikasi, pastikan UI Anda dapat menangani delta kosong. Tidak setiap event SSE selalu membawa teks output.

Harga selama beta publik

Menurut halaman resmi Model & Harga, harga DeepSeek-V4-Flash adalah sebagai berikut:

Item deepseek-v4-flash deepseek-v4-pro
Input, cache hit per 1 juta token $0.0028 $0.003625
Input, cache miss per 1 juta token $0.14 $0.435
Output per 1 juta token $0.28 $0.87
Panjang konteks 1 juta token 1 juta token
Output maksimum 384K 384K
Batas konkurensi 2.500 500

Tiga hal yang perlu dipertimbangkan saat menghitung biaya:

  1. Context caching otomatis. Cache hit berbiaya 50 kali lebih murah daripada cache miss. Agen yang menggunakan ulang system prompt atau konteks panjang dapat memperoleh penghematan besar.
  2. Harga puncak dan non-puncak. DeepSeek telah mengumumkan biaya 2x pada jam puncak, yaitu pukul 09.00–12.00 dan 14.00–18.00 waktu Beijing. Per 31 Juli, tanggal efektifnya masih menunggu pengumuman resmi.
  3. Konkurensi tinggi untuk Flash. Batas 2.500 request bersamaan pada Flash, dibandingkan 500 pada Pro, menunjukkan bahwa model ini ditujukan untuk workload agen berskala besar.

Untuk perbandingan biaya seluruh keluarga V4, termasuk riwayat pemotongan harga permanen V4-Pro, baca rincian harga DeepSeek V4 API.

Uji dan debug API di Apidog

curl cukup untuk smoke test. Namun, saat Anda perlu membandingkan output mode berpikir dan tanpa berpikir, memeriksa header, atau memantau SSE, gunakan tool API client yang dapat menyimpan request dan environment.

Berikut alur kerja di Apidog:

Menguji DeepSeek API di Apidog

  1. Buat project dan endpoint. Tambahkan endpoint berikut:
   POST https://api.deepseek.com/chat/completions
Enter fullscreen mode Exit fullscreen mode

Anda juga dapat mengimpor spesifikasi yang kompatibel dengan OpenAI untuk menambahkan endpoint sekaligus.

  1. Simpan API key sebagai environment variable. Buat variabel DEEPSEEK_API_KEY, lalu gunakan pada header:
   Authorization: Bearer {{DEEPSEEK_API_KEY}}
Enter fullscreen mode Exit fullscreen mode

Dengan pendekatan ini, Anda dapat berpindah antara key pengujian dan produksi tanpa mengubah request.

  1. Periksa respons streaming.

    Saat stream aktif, pantau event SSE yang masuk. Ini memudahkan Anda memeriksa delta respons tanpa membaca baris data: mentah dari terminal.

  2. Simpan variasi request sebagai test case.

    Simpan satu request dengan mode berpikir aktif dan satu request tanpa berpikir. Jalankan kembali keduanya setelah pembaruan model untuk memastikan prompt dan integrasi Anda tetap stabil.

Unduh Apidog secara gratis untuk menjalankan alur pengujian ini.

FAQ

Apakah saya perlu mengubah kode untuk mendapatkan model baru?

Tidak. Nama model deepseek-v4-flash sekarang melayani DeepSeek-V4-Flash-0731. Integrasi yang ada diperbarui otomatis.

Apakah ini model yang sama dengan aplikasi DeepSeek?

Tidak. Pembaruan 31 Juli hanya mencakup API. Aplikasi dan model web tidak berubah.

Apa yang terjadi pada deepseek-chat dan deepseek-reasoner?

Nama model lama tersebut dijadwalkan dihentikan pada 24 Juli 2026. Gunakan deepseek-v4-flash atau deepseek-v4-pro. Lihat panduan cara menggunakan DeepSeek V4 API untuk langkah migrasi.

Bisakah saya menggunakannya secara gratis?

DeepSeek API menggunakan model bayar sesuai pemakaian dan tidak memiliki free tier permanen. Namun, harga cache hit dapat membuat eksperimen berbiaya sangat rendah. Lihat cara menggunakan DeepSeek V4 API secara gratis untuk opsi saat ini.

Apakah V4-Flash mendukung Codex dan Responses API?

Ya. V4-Flash mendukung keduanya dan, sejauh ini, merupakan satu-satunya model DeepSeek yang melakukannya. Dukungan V4-Pro diharapkan pada awal Agustus 2026. Baca panduan Responses API dan Codex untuk implementasinya.

Intinya

DeepSeek-V4-Flash-0731 mempertahankan nama model, harga, dan arsitektur yang sama, tetapi membawa peningkatan kemampuan agen berdasarkan benchmark yang diterbitkan DeepSeek. Dukungan Responses API dan Codex juga menjadikannya relevan untuk workload agen dengan konkurensi tinggi.

Langkah praktisnya sederhana:

  1. Buat API key.
  2. Arahkan OpenAI SDK ke https://api.deepseek.com.
  3. Uji deepseek-v4-flash dengan prompt dan test suite Anda sendiri.
  4. Simpan request penting sebagai regression test agar perubahan model tidak mengejutkan aplikasi Anda.

Apidog dapat mempercepat proses tersebut: simpan request, bandingkan variasi parameter, dan jalankan ulang test case setelah pembaruan model.

Top comments (0)