DeepSeek V4-Flash Vision Exp: Cara Mengirim Gambar, Menghitung Biaya, dan Mengujinya
Model DeepSeek yang paling murah kini dapat “melihat”. Pada 21 Agustus 2026, DeepSeek merilis deepseek-v4-flash-vision-exp, versi V4-Flash dengan encoder visi yang menerima gambar melalui API produksi yang sama. Harganya juga sama seperti model teks, dengan setiap gambar dihitung maksimal 384 token input. Menurut catatan rilis resmi, kemampuan teksnya setara dengan V4-Flash, sementara pemahaman gambarnya diklaim membawa performa agen multimodal mereka mendekati Opus 4.8.
Panduan ini membahas:
- apa itu
deepseek-v4-flash-vision-exp; - arti label
Expuntuk penggunaan produksi; - tiga cara mengirim gambar;
- batas ukuran dan penempatan gambar;
- cara menghitung biaya pipeline dokumen; dan
- cara menguji permintaan multimodal secara berulang.
Karena permintaan visi menggabungkan teks, gambar, dan data JSON, payload-nya mudah menjadi sulit dibaca. Untuk menguji variasi prompt dan gambar, lebih praktis membuat permintaan di Apidog daripada mengedit JSON secara manual di terminal.
Apa itu deepseek-v4-flash-vision-exp?
Model ini adalah V4-Flash-0731 dengan encoder gambar. DeepSeek menyatakan bahwa model ini mempertahankan kemampuan model dasar pada tugas teks, termasuk pekerjaan agen, penalaran, dan pengetahuan dunia. Artinya, Anda dapat menggunakannya sebagai pengganti V4-Flash untuk beban kerja yang juga membutuhkan input gambar.
Menurut daftar OpenRouter, model ini menggunakan arsitektur sparse mixture-of-experts dengan 13 miliar parameter aktif dari total 284 miliar.
V4-Flash merupakan lini hemat DeepSeek. Kami membahas versi teksnya dalam panduan API DeepSeek V4-Flash. Struktur harga tersebut belum berubah untuk versi visi.
DeepSeek juga mengklaim bahwa model ini mendekati Opus 4.8 pada tolok ukur agen multimodal. Perlakukan angka tersebut sebagai klaim vendor dan jalankan evaluasi pada dokumen, tangkapan layar, serta alur kerja Anda sendiri sebelum melakukan migrasi.
Meskipun menggunakan label eksperimental, model ini bukan sandbox. Model berjalan pada endpoint API produksi dengan batas laju dan SLA yang sama seperti model V4 lain, tanpa daftar tunggu atau permintaan akses khusus.
Harga: tarif Flash, termasuk gambar
Menurut halaman harga DeepSeek, tarifnya sama dengan deepseek-v4-flash:
| Jenis token | Non-puncak | Puncak |
|---|---|---|
| Input, cache hit per 1 juta token | $0,007 | $0,014 |
| Input, cache miss per 1 juta token | $0,22 | $0,44 |
| Output per 1 juta token | $0,66 | $1,32 |
Gambar ditokenisasi hingga 384 token per gambar dan dikenakan sebagai input. Pada tarif puncak tanpa cache, satu gambar berbiaya penuh sekitar:
384 / 1.000.000 × $0,44 = $0,00016896
Jadi, 1.000 gambar berbiaya kurang dari satu dolar.
Dua perilaku harga dari model teks tetap berlaku:
- Tarif non-puncak adalah setengah dari tarif puncak.
- Jam puncak berlangsung pukul 01:00–04:00 dan 06:00–10:00 UTC pada hari kerja.
- Context caching dapat menurunkan biaya input yang dikirim berulang kali, misalnya prompt sistem yang sama untuk banyak gambar.
Halaman harga juga mencantumkan jendela konteks 1 juta token untuk lini V4. Dalam praktiknya, batas output tetap jauh lebih rendah daripada batas konteks tersebut.
Tiga cara mengirim gambar
Model ini menggunakan endpoint Chat Completions standar:
https://api.deepseek.com/chat/completions
Format Messages dan Responses juga didukung, seperti dijelaskan dalam peluncuran API DeepSeek V4-Flash Responses.
Gambar ditempatkan di array content pada pesan user. Anda dapat mengirimnya dengan tiga cara.
1. Base64 sebaris
Encode gambar menjadi data URL. Metode ini cocok untuk permintaan satu kali dan tidak membutuhkan hosting gambar terpisah. Ukuran maksimum setiap gambar adalah 32 MiB.
import base64
from openai import OpenAI
client = OpenAI(
[REDACTED CREDENTIAL]
base_url="https://api.deepseek.com"
)
with open("invoice.png", "rb") as image_file:
image_base64 = base64.b64encode(image_file.read()).decode()
response = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[
{
"role": "user",
"content": [
{
"type": "text",
"text": "Ekstrak item dan total faktur sebagai JSON."
},
{
"type": "image_url",
"image_url": {
"url": f"data:image/png;base64,{image_base64}"
}
}
]
}
]
)
print(response.choices[0].message.content)
2. URL eksternal
Jika gambar sudah tersedia di CDN atau server publik, kirim URL-nya tanpa melakukan encoding. Panjang URL maksimum adalah 8.192 karakter.
{
"type": "image_url",
"image_url": {
"url": "https://example.com/chart.png"
}
}
Pastikan endpoint gambar dapat dijangkau oleh API DeepSeek dan tidak memerlukan autentikasi browser.
3. Referensi API File
Unggah gambar sekali, lalu gunakan kembali ID file-nya. API File DeepSeek menerima unggahan gambar secara gratis dan mendukung ukuran hingga 64 MiB per gambar.
{
"type": "file",
"file": {
"file_id": "file-api-xxxxxxxxxxxxxxxx"
}
}
Gunakan aturan praktis berikut:
- Base64 untuk permintaan satu kali.
- URL eksternal jika gambar sudah berada di CDN.
-
file_idjika alur kerja menggunakan gambar yang sama lebih dari sekali.
Mengatur parameter detail
Setiap objek gambar dapat memiliki bidang detail opsional:
{
"type": "image_url",
"image_url": {
"url": "https://example.com/invoice.png",
"detail": "high"
}
}
Nilai yang tersedia:
-
"low"— menurunkan skala gambar menjadi 512×512. Cocok untuk klasifikasi sederhana dan biasanya lebih cepat. -
"high"atau"original"— mempertahankan dimensi asli. Gunakan untuk dokumen padat atau teks kecil. -
"auto"— membiarkan API memilih pengaturan.
Secara internal, gambar dinormalisasi mendekati 800×800 untuk penghitungan token. Inilah yang memungkinkan batas penagihan tetap maksimal 384 token per gambar.
Untuk OCR pada tanda terima atau dasbor, uji "low" dan "high" pada korpus nyata. Pada harga ini, selisih biaya gambar relatif kecil, tetapi selisih akurasi dapat besar.
Batas yang perlu diketahui sebelum produksi
| Batasan | Nilai |
|---|---|
| Maksimal gambar per permintaan | 600 |
| Ukuran gambar base64 | 32 MiB |
| Ukuran gambar API File | 64 MiB |
| Total badan permintaan | 48 MiB |
| Dimensi gambar | 8.192 px per sisi |
| Dimensi jika permintaan membawa 15+ gambar | 4.096 px per sisi |
| Panjang URL eksternal | 8.192 karakter |
| Penempatan gambar | Hanya pesan user
|
Batas penempatan gambar sering menjadi penyebab error 400. Gambar pada pesan system atau assistant ditolak.
Permintaan multi-gambar didukung. Anda dapat menyisipkan beberapa gambar di antara blok teks dalam satu pesan, sehingga model dapat menangani alur seperti:
- membaca tangkapan layar;
- menalar berdasarkan hasilnya; dan
- memilih tindakan berikutnya.
Model ini juga mendukung tool calling bersama visi. Untuk alur agen yang lebih lengkap, lihat gambaran umum DeepSeek Harness dan panduan pemanggilan fungsi.
Apa arti label Exp?
Akhiran Exp merupakan penanda bahwa model dapat direvisi atau diganti dalam waktu singkat. Label tersebut bukan paywall, tetapi Anda tetap perlu merancang integrasi agar perubahan model tidak memutus aplikasi.
Simpan ID model di satu tempat
Jangan menulis ID model di banyak file. Gunakan satu konfigurasi atau variabel lingkungan:
DEEPSEEK_VISION_MODEL=deepseek-v4-flash-vision-exp
Contoh penggunaan di Python:
import os
model_id = os.environ.get(
"DEEPSEEK_VISION_MODEL",
"deepseek-v4-flash-vision-exp"
)
Sediakan fallback teks
Arahkan permintaan tanpa gambar ke model stabil:
model_id = (
"deepseek-v4-flash-vision-exp"
if contains_image
else "deepseek-v4-flash"
)
Karena model visi dirancang agar cocok dengan model dasar pada tugas teks, pemisahan ini menjaga lalu lintas biasa tetap menggunakan ID stabil.
Simpan snapshot evaluasi
Simpan input, output, metrik, dan versi model dari setiap pengujian. Saat model non-eksperimental tersedia, Anda dapat membandingkan hasil sebelum dan sesudah pada tugas Anda sendiri, bukan hanya pada tolok ukur vendor.
Contoh: menghitung biaya pipeline dokumen
Misalkan Anda memproses 50.000 faktur hasil pemindaian per bulan. Setiap panggilan memiliki:
- satu gambar;
- prompt instruksi 200 token; dan
- output JSON sekitar 400 token.
Perkiraan biaya pada tarif puncak:
Input gambar
50.000 × 384 [REDACTED CREDENTIAL] juta token
19,2 × $0,44 = $8,45
Input teks
Tanpa cache:
50.000 × 200 [REDACTED CREDENTIAL] juta token
10 × $0,44 = $4,40
Jika prompt instruksi berulang dan terkena cache hit:
10 × $0,014 = $0,14
Output
50.000 × 400 token = 20 juta token
20 × $1,32 = $26,40
Totalnya sekitar $35–$40 per bulan pada tarif puncak tanpa memperhitungkan penghematan cache. Batch yang berjalan di luar jendela puncak dapat berbiaya sekitar setengahnya.
Output mendominasi biaya. Karena itu, optimasi utama bukan menurunkan skala gambar, melainkan memperketat format respons:
Hindari: deskripsi panjang dalam bentuk prosa.
Gunakan: JSON ringkas dengan bidang yang sudah ditentukan.
Dengan gambar yang hanya dihitung maksimal 384 token, siklus tangkapan layar–penalaran–tindakan juga lebih layak dijalankan berulang kali dibandingkan menggunakan model multimodal premium.
Menguji permintaan multimodal di Apidog
Payload visi sulit diuji secara manual karena base64 membuat JSON tidak terbaca dan setiap perubahan detail menghasilkan badan permintaan yang hampir sama. Gunakan alur pengujian berikut.
1. Parameterisasi permintaan
Simpan satu permintaan di proyek Apidog dan jadikan bagian berikut sebagai variabel:
{{model_id}}
{{detail}}
{{image_payload}}
Anda dapat mengganti gambar uji atau tingkat detail tanpa menulis ulang seluruh payload.
2. Encode gambar melalui skrip
Gunakan skrip pra-permintaan untuk membaca file dan menyuntikkan string base64. Dengan begitu, badan permintaan tetap mudah dibaca, sementara gambar tetap dapat dikirim sebagai data URL.
3. Validasi struktur output
Jangan hanya memeriksa apakah respons terlihat benar. Jika prompt meminta JSON, parse respons dan validasi bidang wajib seperti:
{
"invoice_number": "...",
"line_items": [],
"total": 0
}
Hasil pengujian kemudian dapat dikategorikan sebagai lulus atau gagal dan dijalankan kembali setiap kali model eksperimental direvisi.
4. Mock respons untuk frontend
Saat prompt masih berubah, gunakan mock berbasis skema untuk mengembangkan frontend tanpa melakukan panggilan API pada setiap perubahan. Setelah prompt stabil, jalankan pengujian terhadap gambar nyata.
Unduh Apidog untuk menyiapkan alur ini. Setelah permintaan tersimpan, Anda dapat menjalankan kembali evaluasi saat DeepSeek memperbarui model eksperimental.
FAQ
Apakah deepseek-v4-flash-vision-exp gratis?
Tidak. Model ini menggunakan tarif Flash untuk input dan output, dengan setiap gambar dihitung maksimal 384 token input. Penyimpanan gambar melalui DeepSeek Files gratis, tetapi token tetap dikenakan biaya ketika gambar digunakan dalam permintaan.
Apakah model ini menggantikan deepseek-v4-flash?
Tidak. Model teks tetap menjadi ID stabil. Model visi dirancang agar cocok dengan model dasar pada tugas teks, tetapi pola konservatif adalah mengarahkan hanya permintaan yang membawa gambar ke model visi.
Bisakah model ini digunakan melalui format API gaya Anthropic?
Ya. Endpoint V4 DeepSeek menerima format Chat Completions, Messages, dan Responses. Klien yang sudah menggunakan salah satu format tersebut dapat menambahkan blok gambar sesuai struktur formatnya. Panduan API V4 Pro menjelaskan mekanisme endpoint yang digunakan bersama oleh keluarga V4.
Bagaimana harganya dibandingkan API visi GPT atau Claude?
Dengan tarif input $0,22–$0,44 per 1 juta token dan batas 384 token per gambar, biayanya berada satu orde besaran di bawah banyak model multimodal premium. Pertanyaan utamanya tetap akurasi pada beban kerja Anda. Gunakan evaluasi dokumen dan skenario agen untuk mengukurnya.
Kesimpulan
deepseek-v4-flash-vision-exp menambahkan pemahaman gambar ke endpoint produksi V4-Flash tanpa mengubah model harga Flash. Anda dapat mengirim gambar melalui base64, URL eksternal, atau file_id, dengan batas ukuran dan penempatan yang perlu diperhitungkan sejak awal.
Untuk integrasi yang lebih aman:
- simpan ID model dalam satu konfigurasi;
- arahkan lalu lintas non-gambar ke model teks stabil;
- validasi output secara otomatis;
- simpan snapshot evaluasi; dan
- uji variasi gambar serta
detaildalam Apidog.
Dengan biaya maksimal sekitar $0,00017 per gambar pada tarif puncak, model ini menarik untuk OCR, analisis dokumen, dan loop agen berbasis tangkapan layar—selama Anda tetap mengevaluasi akurasi dan kesiapan produksi secara mandiri.
Top comments (0)