DEV Community

Cover image for Cara Menggunakan DeepSeek V4 Pro 0813 API
Walse
Walse

Posted on Originally published at apidog.com

Cara Menggunakan DeepSeek V4 Pro 0813 API

DeepSeek V4 Pro keluar dari tahap pratinjau pada 12 Agustus 2026. Build GA dengan cap 0813 kini tersedia melalui endpoint API deepseek-v4-pro, dengan jendela konteks 1 juta token, output maksimum 384 ribu token, serta harga input cache hit $0,003625 per juta token. Seperti yang dilaporkan Unite.AI, model yang berada dalam pratinjau selama empat bulan ini kini menjadi model unggulan DeepSeek.

Coba Apidog hari ini

Artikel ini berfokus pada implementasi: membuat request pertama memakai OpenAI SDK, memilih mode berpikir, menangani reasoning_content, streaming SSE, function calling, serta mengoptimalkan prompt caching. Untuk latar belakang arsitekturnya, baca Apa itu DeepSeek V4.

TL;DR

  • Gunakan endpoint produksi deepseek-v4-pro untuk build GA 0813.
  • API kompatibel dengan OpenAI. Arahkan SDK openai ke https://api.deepseek.com.
  • Model mendukung konteks 1 juta token, output hingga 384K token, dan mode non-think, think high, serta think max.
  • Input cache miss: $0,435/juta token. Cache hit: $0,003625/juta token. Output: $0,87/juta token.
  • Susun prompt dengan prefix stabil agar cache hit tinggi.
  • Uji Chat Completions dan SSE sebelum menghubungkan model ke workflow produksi.
  • Simpan koleksi request dan environment Pro/Flash di Apidog.

Apa yang berubah pada build GA 0813

Pratinjau V4 dibuka pada April 2026, V4 Flash dirilis pada Juli, lalu V4 Pro masuk GA pada 12 Agustus sebagai snapshot 0813.

Bagi developer, perubahan utamanya adalah:

  1. Snapshot lebih stabil

    Build pratinjau dapat berubah dan memengaruhi hasil evaluasi atau prompt tuning. Build 0813 menjadi target yang tetap hingga snapshot baru diumumkan.

  2. Endpoint produksi lebih sederhana

    Panggil deepseek-v4-pro pada API resmi. Jika perlu merujuk snapshot eksplisit, OpenRouter mencantumkannya sebagai deepseek/deepseek-v4-pro-0813.

  3. Fitur API tersedia pada endpoint GA

    Mode berpikir, function calling, output terstruktur, prompt caching, serta format OpenAI, Anthropic, dan Responses tersedia pada endpoint ini.

Di balik layar, V4 Pro adalah model mixture-of-experts dengan total 1,6 triliun parameter dan 49 miliar parameter aktif per token. DeepSeek menyatakan Compressed Sparse Attention dan Heavily Compressed Attention menurunkan komputasi inferensi satu token menjadi 27% dari V3.2 serta cache KV menjadi 10%.

DeepSeek V4 Pro 0813: spesifikasi

Spesifikasi DeepSeek V4 Pro 0813
Rilis GA pada 12 Agustus 2026, snapshot 0813
Arsitektur Mixture-of-experts, total 1,6T parameter, 49B aktif per token
Perhatian Compressed Sparse Attention + Heavily Compressed Attention
Biaya inferensi vs V3.2 27% komputasi satu token, 10% cache KV
Jendela konteks 1.000.000 token
Output maksimum 384K token
Mode berpikir non-think, think high, think max
Harga input $0,435/M cache miss, $0,003625/M cache hit
Harga output $0,87/M
Format API OpenAI Chat Completions, Anthropic Messages, DeepSeek Responses
Model ID deepseek-v4-pro
Model lebih kecil deepseek-v4-flash, total 284B / aktif 13B

Kartu model DeepSeek melaporkan SWE-bench Verified 80,6%, Terminal Bench 2.0 67,9%, GPQA Diamond 90,1%, dan LiveCodeBench 93,5% untuk konfigurasi V4-Pro-Max. Karena angka ini merupakan laporan vendor, lakukan evaluasi terhadap dataset dan tugas Anda sendiri sebelum memindahkan workload penting.

1. Buat API key dan kirim request pertama

Langkah setup:

  1. Buat akun di platform.deepseek.com dan tambahkan kredit karena API bersifat prabayar.
  2. Buka halaman API key, buat key baru, lalu salin segera.
  3. Simpan key sebagai environment variable.
export DEEPSEEK_API_KEY="sk-..."
Enter fullscreen mode Exit fullscreen mode

Install SDK OpenAI:

pip install openai
Enter fullscreen mode Exit fullscreen mode

DeepSeek mendukung protokol OpenAI Chat Completions. Gunakan https://api.deepseek.com atau https://api.deepseek.com/v1 sebagai base_url.

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DEEPSEEK_API_KEY"],
    base_url="https://api.deepseek.com",
)

response = client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[
        {
            "role": "system",
            "content": "You are a concise technical assistant.",
        },
        {
            "role": "user",
            "content": "Explain idempotency in REST APIs in two sentences.",
        },
    ],
)

print(response.choices[0].message.content)
print(response.usage)
Enter fullscreen mode Exit fullscreen mode

Selalu log response.usage. Data ini diperlukan untuk memantau token input, output, dan efektivitas cache saat workload mulai bertambah.

Untuk menguji endpoint tanpa SDK, gunakan curl:

curl https://api.deepseek.com/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $DEEPSEEK_API_KEY" \
  -d '{
    "model": "deepseek-v4-pro",
    "messages": [
      {
        "role": "user",
        "content": "List three ways to version a REST API."
      }
    ]
  }'
Enter fullscreen mode Exit fullscreen mode

Lihat parameter lengkap pada dokumentasi resmi DeepSeek, termasuk endpoint Anthropic Messages dan DeepSeek Responses API.

2. Pilih mode berpikir sesuai tugas

V4 Pro menggunakan satu endpoint dengan tiga tingkat penalaran:

  • non-think: respons langsung untuk ekstraksi, klasifikasi, pemformatan, dan ringkasan.
  • think high: penalaran sebelum jawaban. Cocok untuk coding, debugging, dan analisis multi-langkah.
  • think max: anggaran penalaran maksimum untuk masalah yang benar-benar kompleks.

Gunakan parameter reasoning_effort:

response = client.chat.completions.create(
    model="deepseek-v4-pro",
    reasoning_effort="high",  # "none" | "high" | "max"
    messages=[
        {
            "role": "user",
            "content": (
                "Our API returns 502s under load but only behind the CDN. "
                "Walk through likely causes in order of probability."
            ),
        },
    ],
)

message = response.choices[0].message

print("--- Reasoning ---")
print(message.reasoning_content)

print("--- Answer ---")
print(message.content)
Enter fullscreen mode Exit fullscreen mode

Praktik penting:

  • Jangan kirim ulang reasoning_content ke riwayat percakapan.
  • Untuk giliran berikutnya, kirim hanya content dari respons sebelumnya.
  • Token penalaran ditagih sebagai output token, jadi gunakan think max hanya jika nilai tambahnya sebanding dengan biaya dan latensi.

3. Streaming respons dengan SSE

Untuk output panjang atau mode berpikir, aktifkan streaming agar pengguna tidak menunggu hingga respons selesai seluruhnya.

stream = client.chat.completions.create(
    model="deepseek-v4-pro",
    reasoning_effort="high",
    stream=True,
    messages=[
        {
            "role": "user",
            "content": (
                "Design a rate limiter for a public API. "
                "Compare token bucket and sliding window."
            ),
        },
    ],
)

for chunk in stream:
    if not chunk.choices:
        continue  # Final chunk dapat hanya berisi usage.

    delta = chunk.choices[0].delta

    if getattr(delta, "reasoning_content", None):
        print(delta.reasoning_content, end="", flush=True)
    elif delta.content:
        print(delta.content, end="", flush=True)
Enter fullscreen mode Exit fullscreen mode

Untuk UI:

  1. Render reasoning_content sebagai status “berpikir” yang dapat diciutkan.
  2. Saat content mulai muncul, pindahkan output ke area jawaban utama.
  3. Simpan status stream dan error agar pengguna tahu apakah koneksi terputus atau model masih memproses.

Implementasi ini menggunakan server-sent events standar. Lihat panduan streaming respons API dengan SSE untuk detail mekanismenya.

4. Gunakan function calling

V4 Pro mendukung function calling gaya OpenAI. Anda dapat memakai loop agen yang sudah ada: kirim tools, baca tool_calls, eksekusi tool, masukkan hasilnya ke messages, lalu ulangi request.

tools = [{
    "type": "function",
    "function": {
        "name": "get_endpoint_status",
        "description": "Check the health of an internal API endpoint",
        "parameters": {
            "type": "object",
            "properties": {
                "endpoint": {
                    "type": "string",
                    "description": "Path, e.g. /v1/orders",
                }
            },
            "required": ["endpoint"],
        },
    },
}]

response = client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[
        {
            "role": "user",
            "content": "Is /v1/orders healthy right now?",
        },
    ],
    tools=tools,
)

tool_calls = response.choices[0].message.tool_calls
print(tool_calls)
Enter fullscreen mode Exit fullscreen mode

Untuk production loop, validasi argumen tool sebelum dieksekusi. Jangan biarkan model langsung menjalankan query database, command shell, atau request internal tanpa authorization dan allowlist.

Gunakan response_format ketika Anda membutuhkan JSON yang dapat diurai. Detail bentuk message dan tool result tersedia di dokumentasi resmi DeepSeek.

5. Rancang prompt untuk cache hit

Prompt caching adalah salah satu faktor arsitektur paling penting pada V4 Pro.

DeepSeek melakukan cache pada prefix prompt secara otomatis. Input cache miss dihargai $0,435/juta token, sedangkan cache hit hanya $0,003625/juta token—diskon sekitar 120x.

Misalnya, agen coding membawa konteks repositori sebesar 200K token dan melakukan 50 request dalam satu sesi:

  • Tanpa cache: 50 × 200K × $0,435/M ≈ $4,35
  • Dengan cache: satu cache miss ≈ $0,087 + 49 cache hit ≈ $0,0007 per request, total ≈ $0,12

Agar prefix dapat di-cache, susun message seperti ini:

[Stabil]
- System prompt
- Instruksi proyek
- Dokumentasi internal
- Konteks repositori
- Definisi tool

[Berubah setiap request]
- Pesan terbaru pengguna
- ID request
- Timestamp
- Hasil tool terbaru
Enter fullscreen mode Exit fullscreen mode

Hindari menaruh timestamp, request ID, atau data dinamis pada system prompt. Perubahan di awal prompt dapat membatalkan cache prefix dan mengubah request berikutnya menjadi cache miss.

Dengan pola ini, konteks 1 juta token tidak hanya menjadi fitur demo. Cache miss untuk 1 juta token memerlukan sekitar $0,435, tetapi prefix stabil yang terkena cache biayanya sekitar sepertiga sen per request.

Baca Apa itu prompt caching untuk konsep dan strategi caching lebih lanjut.

6. Uji deepseek-v4-pro di Apidog

Sebelum mengintegrasikan endpoint ke aplikasi produksi, uji request, environment, dan stream secara terpisah. Karena API DeepSeek kompatibel dengan OpenAI, Apidog dapat digunakan tanpa konfigurasi khusus.

Langkah yang dapat dilakukan:

  1. Impor request dari curl

    Tempel command curl sebelumnya ke Apidog. URL, header, autentikasi, dan request body akan menjadi request yang dapat diedit.

  2. Buat environment Pro dan Flash

    Simpan base_url, API key, dan model sebagai environment variable.

Contoh:

   base_url = https://api.deepseek.com
   api_key = sk-...
   model = deepseek-v4-pro
Enter fullscreen mode Exit fullscreen mode

Buat environment kedua dengan:

   model = deepseek-v4-flash
Enter fullscreen mode Exit fullscreen mode

Dengan ini, Anda dapat membandingkan hasil dan biaya Pro vs Flash menggunakan request yang sama.

  1. Periksa SSE secara langsung

    Tambahkan "stream": true ke request body. Apidog dapat membantu memeriksa urutan event dan memisahkan fase reasoning_content dari output akhir.

  2. Simpan sebagai koleksi regresi

    Saat DeepSeek merilis snapshot baru, jalankan ulang koleksi yang sama untuk membandingkan output, penggunaan token, latency, dan perilaku tool calling.

Perhatikan blok usage pada setiap respons. Ini cara cepat untuk mengecek apakah struktur prompt Anda benar-benar menghasilkan cache hit.

Harga saat ini dan kenaikan yang perlu diantisipasi

Model Input cache miss Input cache hit Output
deepseek-v4-pro $0,435/M $0,003625/M $0,87/M
deepseek-v4-flash $0,14/M $0,28/M

Pada 6 Agustus 2026, DeepSeek memperingatkan bahwa kenaikan harga API yang “signifikan” akan datang, tetapi tanpa angka atau tanggal efektif.

Sambil menunggu detailnya, lakukan tiga hal:

  • Ukur biaya aktual per tugas

    Simpan data usage dari workload nyata agar Anda dapat menghitung dampak kenaikan harga dengan cepat.

  • Maksimalkan cache hit

    Pertahankan prefix stabil dan pindahkan data dinamis ke bagian akhir prompt.

  • Gunakan Flash sebagai fallback

    Gunakan deepseek-v4-flash untuk klasifikasi, ekstraksi, chat sederhana, dan tugas bervolume tinggi. Cadangkan Pro untuk reasoning, coding agent, dan analisis konteks panjang.

Untuk detail perbandingan biaya, lihat panduan harga API DeepSeek V4.

FAQ

Apakah kode OpenAI SDK yang sudah ada akan berfungsi?

Hampir. Ubah base_url, API key, dan model:

client = OpenAI(
    api_key=os.environ["DEEPSEEK_API_KEY"],
    base_url="https://api.deepseek.com",
)

response = client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[...],
)
Enter fullscreen mode Exit fullscreen mode

Chat Completions, streaming, tools, dan structured output mengikuti format OpenAI. Jika aplikasi Anda memakai Anthropic SDK, gunakan endpoint DeepSeek Anthropic Messages.

Kapan menggunakan V4 Flash, bukan V4 Pro?

Gunakan Flash untuk tugas sederhana yang sensitif terhadap biaya dan latensi:

  • Klasifikasi
  • Ekstraksi data
  • Ringkasan pendek
  • Chat dasar
  • Routing atau preprocessing

Gunakan Pro untuk:

  • Coding agent
  • Debugging kompleks
  • Analisis multi-langkah
  • Konteks panjang
  • Tugas yang membutuhkan mode berpikir

Pilih berdasarkan karakteristik tugas, bukan hanya model yang lebih besar.

Bisakah V4 Pro 0813 digunakan di Cursor?

Ya. Cursor mendukung endpoint kustom yang kompatibel dengan OpenAI, sehingga Anda dapat menambahkan build GA sebagai model kustom. Lihat panduan Cara menggunakan DeepSeek V4 Pro dengan Cursor.

Ringkasan

Mulai implementasi V4 Pro dengan langkah yang dapat diukur:

  1. Buat API key dan kirim request Chat Completions pertama.
  2. Pilih reasoning_effort berdasarkan kompleksitas tugas.
  3. Aktifkan streaming untuk output panjang dan mode berpikir.
  4. Validasi function calls sebelum menjalankan tool.
  5. Susun prefix prompt yang stabil untuk memaksimalkan cache hit.
  6. Simpan request benchmark di Apidog agar Anda dapat membandingkan snapshot dan perubahan harga berikutnya.

Top comments (0)