DEV Community

Cover image for Cara Menggunakan DeepSeek V4-Flash-Vision API: Panduan Input Gambar
Walse
Walse

Posted on Originally published at apidog.com

Cara Menggunakan DeepSeek V4-Flash-Vision API: Panduan Input Gambar

DeepSeek V4-Flash Vision Exp: Cara Mengirim Gambar, Menghitung Biaya, dan Mengujinya

Model DeepSeek yang paling murah kini dapat “melihat”. Pada 21 Agustus 2026, DeepSeek merilis deepseek-v4-flash-vision-exp, versi V4-Flash dengan encoder visi yang menerima gambar melalui API produksi yang sama. Harganya juga sama seperti model teks, dengan setiap gambar dihitung maksimal 384 token input. Menurut catatan rilis resmi, kemampuan teksnya setara dengan V4-Flash, sementara pemahaman gambarnya diklaim membawa performa agen multimodal mereka mendekati Opus 4.8.

Coba Apidog hari ini

Panduan ini membahas:

  • apa itu deepseek-v4-flash-vision-exp;
  • arti label Exp untuk penggunaan produksi;
  • tiga cara mengirim gambar;
  • batas ukuran dan penempatan gambar;
  • cara menghitung biaya pipeline dokumen; dan
  • cara menguji permintaan multimodal secara berulang.

Karena permintaan visi menggabungkan teks, gambar, dan data JSON, payload-nya mudah menjadi sulit dibaca. Untuk menguji variasi prompt dan gambar, lebih praktis membuat permintaan di Apidog daripada mengedit JSON secara manual di terminal.

Apa itu deepseek-v4-flash-vision-exp?

Model ini adalah V4-Flash-0731 dengan encoder gambar. DeepSeek menyatakan bahwa model ini mempertahankan kemampuan model dasar pada tugas teks, termasuk pekerjaan agen, penalaran, dan pengetahuan dunia. Artinya, Anda dapat menggunakannya sebagai pengganti V4-Flash untuk beban kerja yang juga membutuhkan input gambar.

Menurut daftar OpenRouter, model ini menggunakan arsitektur sparse mixture-of-experts dengan 13 miliar parameter aktif dari total 284 miliar.

V4-Flash merupakan lini hemat DeepSeek. Kami membahas versi teksnya dalam panduan API DeepSeek V4-Flash. Struktur harga tersebut belum berubah untuk versi visi.

DeepSeek juga mengklaim bahwa model ini mendekati Opus 4.8 pada tolok ukur agen multimodal. Perlakukan angka tersebut sebagai klaim vendor dan jalankan evaluasi pada dokumen, tangkapan layar, serta alur kerja Anda sendiri sebelum melakukan migrasi.

Meskipun menggunakan label eksperimental, model ini bukan sandbox. Model berjalan pada endpoint API produksi dengan batas laju dan SLA yang sama seperti model V4 lain, tanpa daftar tunggu atau permintaan akses khusus.

Harga: tarif Flash, termasuk gambar

Menurut halaman harga DeepSeek, tarifnya sama dengan deepseek-v4-flash:

Jenis token Non-puncak Puncak
Input, cache hit per 1 juta token $0,007 $0,014
Input, cache miss per 1 juta token $0,22 $0,44
Output per 1 juta token $0,66 $1,32

Gambar ditokenisasi hingga 384 token per gambar dan dikenakan sebagai input. Pada tarif puncak tanpa cache, satu gambar berbiaya penuh sekitar:

384 / 1.000.000 × $0,44 = $0,00016896
Enter fullscreen mode Exit fullscreen mode

Jadi, 1.000 gambar berbiaya kurang dari satu dolar.

Dua perilaku harga dari model teks tetap berlaku:

  • Tarif non-puncak adalah setengah dari tarif puncak.
  • Jam puncak berlangsung pukul 01:00–04:00 dan 06:00–10:00 UTC pada hari kerja.
  • Context caching dapat menurunkan biaya input yang dikirim berulang kali, misalnya prompt sistem yang sama untuk banyak gambar.

Halaman harga juga mencantumkan jendela konteks 1 juta token untuk lini V4. Dalam praktiknya, batas output tetap jauh lebih rendah daripada batas konteks tersebut.

Tiga cara mengirim gambar

Model ini menggunakan endpoint Chat Completions standar:

https://api.deepseek.com/chat/completions
Enter fullscreen mode Exit fullscreen mode

Format Messages dan Responses juga didukung, seperti dijelaskan dalam peluncuran API DeepSeek V4-Flash Responses.

Gambar ditempatkan di array content pada pesan user. Anda dapat mengirimnya dengan tiga cara.

1. Base64 sebaris

Encode gambar menjadi data URL. Metode ini cocok untuk permintaan satu kali dan tidak membutuhkan hosting gambar terpisah. Ukuran maksimum setiap gambar adalah 32 MiB.

import base64
from openai import OpenAI

client = OpenAI(
    [REDACTED CREDENTIAL]
    base_url="https://api.deepseek.com"
)

with open("invoice.png", "rb") as image_file:
    image_base64 = base64.b64encode(image_file.read()).decode()

response = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[
        {
            "role": "user",
            "content": [
                {
                    "type": "text",
                    "text": "Ekstrak item dan total faktur sebagai JSON."
                },
                {
                    "type": "image_url",
                    "image_url": {
                        "url": f"data:image/png;base64,{image_base64}"
                    }
                }
            ]
        }
    ]
)

print(response.choices[0].message.content)
Enter fullscreen mode Exit fullscreen mode

2. URL eksternal

Jika gambar sudah tersedia di CDN atau server publik, kirim URL-nya tanpa melakukan encoding. Panjang URL maksimum adalah 8.192 karakter.

{
  "type": "image_url",
  "image_url": {
    "url": "https://example.com/chart.png"
  }
}
Enter fullscreen mode Exit fullscreen mode

Pastikan endpoint gambar dapat dijangkau oleh API DeepSeek dan tidak memerlukan autentikasi browser.

3. Referensi API File

Unggah gambar sekali, lalu gunakan kembali ID file-nya. API File DeepSeek menerima unggahan gambar secara gratis dan mendukung ukuran hingga 64 MiB per gambar.

{
  "type": "file",
  "file": {
    "file_id": "file-api-xxxxxxxxxxxxxxxx"
  }
}
Enter fullscreen mode Exit fullscreen mode

Gunakan aturan praktis berikut:

  • Base64 untuk permintaan satu kali.
  • URL eksternal jika gambar sudah berada di CDN.
  • file_id jika alur kerja menggunakan gambar yang sama lebih dari sekali.

Mengatur parameter detail

Setiap objek gambar dapat memiliki bidang detail opsional:

{
  "type": "image_url",
  "image_url": {
    "url": "https://example.com/invoice.png",
    "detail": "high"
  }
}
Enter fullscreen mode Exit fullscreen mode

Nilai yang tersedia:

  • "low" — menurunkan skala gambar menjadi 512×512. Cocok untuk klasifikasi sederhana dan biasanya lebih cepat.
  • "high" atau "original" — mempertahankan dimensi asli. Gunakan untuk dokumen padat atau teks kecil.
  • "auto" — membiarkan API memilih pengaturan.

Secara internal, gambar dinormalisasi mendekati 800×800 untuk penghitungan token. Inilah yang memungkinkan batas penagihan tetap maksimal 384 token per gambar.

Untuk OCR pada tanda terima atau dasbor, uji "low" dan "high" pada korpus nyata. Pada harga ini, selisih biaya gambar relatif kecil, tetapi selisih akurasi dapat besar.

Batas yang perlu diketahui sebelum produksi

Batasan Nilai
Maksimal gambar per permintaan 600
Ukuran gambar base64 32 MiB
Ukuran gambar API File 64 MiB
Total badan permintaan 48 MiB
Dimensi gambar 8.192 px per sisi
Dimensi jika permintaan membawa 15+ gambar 4.096 px per sisi
Panjang URL eksternal 8.192 karakter
Penempatan gambar Hanya pesan user

Batas penempatan gambar sering menjadi penyebab error 400. Gambar pada pesan system atau assistant ditolak.

Permintaan multi-gambar didukung. Anda dapat menyisipkan beberapa gambar di antara blok teks dalam satu pesan, sehingga model dapat menangani alur seperti:

  1. membaca tangkapan layar;
  2. menalar berdasarkan hasilnya; dan
  3. memilih tindakan berikutnya.

Model ini juga mendukung tool calling bersama visi. Untuk alur agen yang lebih lengkap, lihat gambaran umum DeepSeek Harness dan panduan pemanggilan fungsi.

Apa arti label Exp?

Akhiran Exp merupakan penanda bahwa model dapat direvisi atau diganti dalam waktu singkat. Label tersebut bukan paywall, tetapi Anda tetap perlu merancang integrasi agar perubahan model tidak memutus aplikasi.

Simpan ID model di satu tempat

Jangan menulis ID model di banyak file. Gunakan satu konfigurasi atau variabel lingkungan:

DEEPSEEK_VISION_MODEL=deepseek-v4-flash-vision-exp
Enter fullscreen mode Exit fullscreen mode

Contoh penggunaan di Python:

import os

model_id = os.environ.get(
    "DEEPSEEK_VISION_MODEL",
    "deepseek-v4-flash-vision-exp"
)
Enter fullscreen mode Exit fullscreen mode

Sediakan fallback teks

Arahkan permintaan tanpa gambar ke model stabil:

model_id = (
    "deepseek-v4-flash-vision-exp"
    if contains_image
    else "deepseek-v4-flash"
)
Enter fullscreen mode Exit fullscreen mode

Karena model visi dirancang agar cocok dengan model dasar pada tugas teks, pemisahan ini menjaga lalu lintas biasa tetap menggunakan ID stabil.

Simpan snapshot evaluasi

Simpan input, output, metrik, dan versi model dari setiap pengujian. Saat model non-eksperimental tersedia, Anda dapat membandingkan hasil sebelum dan sesudah pada tugas Anda sendiri, bukan hanya pada tolok ukur vendor.

Contoh: menghitung biaya pipeline dokumen

Misalkan Anda memproses 50.000 faktur hasil pemindaian per bulan. Setiap panggilan memiliki:

  • satu gambar;
  • prompt instruksi 200 token; dan
  • output JSON sekitar 400 token.

Perkiraan biaya pada tarif puncak:

Input gambar

50.000 × 384 [REDACTED CREDENTIAL] juta token
19,2 × $0,44 = $8,45
Enter fullscreen mode Exit fullscreen mode

Input teks

Tanpa cache:

50.000 × 200 [REDACTED CREDENTIAL] juta token
10 × $0,44 = $4,40
Enter fullscreen mode Exit fullscreen mode

Jika prompt instruksi berulang dan terkena cache hit:

10 × $0,014 = $0,14
Enter fullscreen mode Exit fullscreen mode

Output

50.000 × 400 token = 20 juta token
20 × $1,32 = $26,40
Enter fullscreen mode Exit fullscreen mode

Totalnya sekitar $35–$40 per bulan pada tarif puncak tanpa memperhitungkan penghematan cache. Batch yang berjalan di luar jendela puncak dapat berbiaya sekitar setengahnya.

Output mendominasi biaya. Karena itu, optimasi utama bukan menurunkan skala gambar, melainkan memperketat format respons:

Hindari: deskripsi panjang dalam bentuk prosa.
Gunakan: JSON ringkas dengan bidang yang sudah ditentukan.
Enter fullscreen mode Exit fullscreen mode

Dengan gambar yang hanya dihitung maksimal 384 token, siklus tangkapan layar–penalaran–tindakan juga lebih layak dijalankan berulang kali dibandingkan menggunakan model multimodal premium.

Menguji permintaan multimodal di Apidog

Payload visi sulit diuji secara manual karena base64 membuat JSON tidak terbaca dan setiap perubahan detail menghasilkan badan permintaan yang hampir sama. Gunakan alur pengujian berikut.

1. Parameterisasi permintaan

Simpan satu permintaan di proyek Apidog dan jadikan bagian berikut sebagai variabel:

{{model_id}}
{{detail}}
{{image_payload}}
Enter fullscreen mode Exit fullscreen mode

Anda dapat mengganti gambar uji atau tingkat detail tanpa menulis ulang seluruh payload.

2. Encode gambar melalui skrip

Gunakan skrip pra-permintaan untuk membaca file dan menyuntikkan string base64. Dengan begitu, badan permintaan tetap mudah dibaca, sementara gambar tetap dapat dikirim sebagai data URL.

3. Validasi struktur output

Jangan hanya memeriksa apakah respons terlihat benar. Jika prompt meminta JSON, parse respons dan validasi bidang wajib seperti:

{
  "invoice_number": "...",
  "line_items": [],
  "total": 0
}
Enter fullscreen mode Exit fullscreen mode

Hasil pengujian kemudian dapat dikategorikan sebagai lulus atau gagal dan dijalankan kembali setiap kali model eksperimental direvisi.

4. Mock respons untuk frontend

Saat prompt masih berubah, gunakan mock berbasis skema untuk mengembangkan frontend tanpa melakukan panggilan API pada setiap perubahan. Setelah prompt stabil, jalankan pengujian terhadap gambar nyata.

Unduh Apidog untuk menyiapkan alur ini. Setelah permintaan tersimpan, Anda dapat menjalankan kembali evaluasi saat DeepSeek memperbarui model eksperimental.

FAQ

Apakah deepseek-v4-flash-vision-exp gratis?

Tidak. Model ini menggunakan tarif Flash untuk input dan output, dengan setiap gambar dihitung maksimal 384 token input. Penyimpanan gambar melalui DeepSeek Files gratis, tetapi token tetap dikenakan biaya ketika gambar digunakan dalam permintaan.

Apakah model ini menggantikan deepseek-v4-flash?

Tidak. Model teks tetap menjadi ID stabil. Model visi dirancang agar cocok dengan model dasar pada tugas teks, tetapi pola konservatif adalah mengarahkan hanya permintaan yang membawa gambar ke model visi.

Bisakah model ini digunakan melalui format API gaya Anthropic?

Ya. Endpoint V4 DeepSeek menerima format Chat Completions, Messages, dan Responses. Klien yang sudah menggunakan salah satu format tersebut dapat menambahkan blok gambar sesuai struktur formatnya. Panduan API V4 Pro menjelaskan mekanisme endpoint yang digunakan bersama oleh keluarga V4.

Bagaimana harganya dibandingkan API visi GPT atau Claude?

Dengan tarif input $0,22–$0,44 per 1 juta token dan batas 384 token per gambar, biayanya berada satu orde besaran di bawah banyak model multimodal premium. Pertanyaan utamanya tetap akurasi pada beban kerja Anda. Gunakan evaluasi dokumen dan skenario agen untuk mengukurnya.

Kesimpulan

deepseek-v4-flash-vision-exp menambahkan pemahaman gambar ke endpoint produksi V4-Flash tanpa mengubah model harga Flash. Anda dapat mengirim gambar melalui base64, URL eksternal, atau file_id, dengan batas ukuran dan penempatan yang perlu diperhitungkan sejak awal.

Untuk integrasi yang lebih aman:

  1. simpan ID model dalam satu konfigurasi;
  2. arahkan lalu lintas non-gambar ke model teks stabil;
  3. validasi output secara otomatis;
  4. simpan snapshot evaluasi; dan
  5. uji variasi gambar serta detail dalam Apidog.

Dengan biaya maksimal sekitar $0,00017 per gambar pada tarif puncak, model ini menarik untuk OCR, analisis dokumen, dan loop agen berbasis tangkapan layar—selama Anda tetap mengevaluasi akurasi dan kesiapan produksi secara mandiri.

Top comments (0)