Alibaba merilis Qwen 3.8-Max pada awal Agustus 2026. Setelah promo “harga pratinjau 10%” pada Juli berakhir, harga GA kini tercantum di halaman harga resmi Model Studio: qwen3.8-max berharga $2 per 1 juta token masukan dan $6 per 1 juta token keluaran. Tarif ini berlaku datar untuk seluruh jendela konteks hingga 1 juta token.
Harga datar ini penting karena banyak model mengenakan tarif lebih tinggi saat prompt melewati ambang konteks tertentu. Dengan Qwen 3.8-Max, prompt 5.000 token maupun 900.000 token tetap menggunakan tarif masukan $2 per 1 juta token.
Artikel ini membahas cara menghitung biaya, membandingkan harga dengan model lain, memanfaatkan cache, menggunakan kuota gratis, dan mengukur penggunaan token nyata. Untuk konteks modelnya, baca apa itu Qwen 3.8 dan mengapa itu penting.
Satu catatan penting: harga daftar hanya memberikan estimasi awal. Qwen 3.8-Max secara default memakai reasoning_effort: xhigh, dan token pemikiran ditagih sebagai token keluaran. Untuk menghitung biaya dengan akurat, kirim permintaan representatif lalu ukur objek usage pada respons. Apidog dapat membantu memeriksa rincian token setiap respons saat pengujian.
Angka GA: $2 masukan, $6 keluaran, satu tingkatan
Berikut harga resmi qwen3.8-max, diverifikasi terhadap halaman harga Model Studio per 3 Agustus 2026.
| Item | Harga per 1 juta token |
|---|---|
| Masukan | $2.00 |
| Keluaran, termasuk token pemikiran | $6.00 |
| Masukan cache, cache hit | 10% dari tarif masukan |
| Pembuatan cache eksplisit | 125% dari tarif masukan |
| Tingkatan konteks | Satu tingkatan, 0 hingga 1 juta token |
| Mode pemikiran dan non-pemikiran | Ditagih dengan tarif sama |
Hal yang perlu diperhatikan:
- Tidak ada kenaikan harga untuk prompt panjang. Seluruh konteks hingga 1 juta token memakai tarif yang sama.
- Token pemikiran dihitung sebagai keluaran. Tarifnya tetap $6 per 1 juta token.
- Keluaran maksimal adalah 65.536 token per permintaan. Dengan tarif $6 per 1 juta token, biaya keluaran maksimum teoritis per respons sekitar $0,39.
Pengumuman resmi Qwen 3.8 memosisikan model ini sebagai model Alibaba paling mumpuni, dengan total 2,4T parameter dan 95B parameter aktif, konteks 1 juta token, serta masukan multimodal.
Mengapa harga datar untuk 1 juta token penting
Harga konteks bertingkat adalah pola umum di industri: tarif token meningkat setelah prompt melewati ambang konteks tertentu. Konteks panjang lebih mahal untuk dilayani, sehingga model biasanya membebankan biaya tambahan.
Alibaba juga menerapkan pola ini pada model lain. Di halaman harga Model Studio, model seperti qwen3-max dan qwen3-coder-plus memiliki tingkatan harga berdasarkan panjang konteks.
Qwen 3.8-Max berbeda. Tabel harganya hanya memiliki satu rentang:
0 < Token ≤ 1M
Implikasinya praktis untuk perencanaan biaya:
- Pipeline RAG dengan dokumen besar tidak terkena pengganda harga konteks panjang.
- Agen basis kode dapat mengirim lebih banyak konteks tanpa berpindah ke tarif token yang lebih tinggi.
- Estimasi biaya menjadi linear:
jumlah token × tarif.
Gunakan rumus berikut untuk estimasi dasar:
biaya = (token_masukan / 1_000_000 × 2)
+ (token_keluaran / 1_000_000 × 6)
Tetap masukkan token penalaran ke token_keluaran.
Lebih murah dari Qwen 3.7-Max pada harga daftar
- Qwen 3.7-Max: $2,50 masukan / $7,50 keluaran per 1 juta token
- Qwen 3.8-Max: $2 masukan / $6 keluaran per 1 juta token
Itu berarti penurunan sekitar 20% pada token masukan dan keluaran, sambil menawarkan konteks lebih besar, masukan multimodal, dan skor benchmark yang lebih baik.
Namun, ada pengecualian praktis: Qwen 3.7-Max sedang menjalankan promo 50%, sehingga tarifnya menjadi $1,25/$3,75. Selama promo berlaku, model lama lebih murah secara nominal.
Jika aplikasi Anda tidak memerlukan konteks 1 juta token, kemampuan multimodal, atau fitur agen Qwen 3.8-Max, Qwen 3.7-Max yang sedang diskon dapat menjadi opsi hemat biaya. Jangan membangun proyeksi biaya jangka panjang berdasarkan harga promosi.
Untuk opsi anggaran, Qwen 3.7-Plus tetap menjadi pilihan dengan harga $0,40/$1,60 sebelum promo 20%.
Token pemikiran ditagih sebagai keluaran
Bagian ini paling penting saat menghitung tagihan.
Qwen 3.8-Max mendukung tiga tingkat reasoning_effort:
xhigh
medium
low
Defaultnya adalah xhigh. Dalam mode ini, model dapat menghasilkan token penalaran internal sebelum mengembalikan jawaban akhir. Token tersebut ditagih sebagai token keluaran dengan tarif $6 per 1 juta token.
Artinya, jawaban yang terlihat hanya 800 token dapat memiliki biaya lebih tinggi jika model menggunakan ribuan token pemikiran.
Pilih reasoning_effort berdasarkan jenis tugas
Gunakan xhigh saat tugas benar-benar membutuhkan penalaran kompleks, misalnya:
- Analisis masalah multi-langkah
- Perencanaan agen
- Debugging kompleks
- Analisis dokumen yang saling bergantung
Gunakan medium atau low untuk tugas yang lebih deterministik:
- Klasifikasi
- Ekstraksi data
- Normalisasi format
- Pembuatan JSON
- Ringkasan sederhana
Langkah implementasi yang disarankan:
- Kelompokkan endpoint atau workflow berdasarkan jenis tugas.
- Jalankan sampel permintaan untuk setiap kelompok.
- Catat
input_tokens,output_tokens, dan token penalaran dari objekusage. - Bandingkan biaya dan kualitas pada
xhigh,medium, sertalow. - Tetapkan tingkat penalaran minimum yang tetap memenuhi kualitas aplikasi.
Caching konteks: 10% untuk cache hit, 125% untuk pembuatan
Caching konteks berguna jika aplikasi terus mengirim awalan prompt yang sama, misalnya:
- Prompt sistem panjang
- Dokumentasi produk
- Definisi tool
- Skema JSON
- Instruksi agen
Struktur biayanya:
-
Cache hit: 10% dari tarif masukan
- $0,20 per 1 juta token cached input
-
Pembuatan cache eksplisit: 125% dari tarif masukan
- $2,50 per 1 juta token
Secara sederhana, Anda membayar premi 25% sekali saat membuat cache, lalu membayar hanya 10% dari tarif masukan untuk penggunaan ulang berikutnya.
Cara menentukan apakah cache layak digunakan
Bandingkan biaya tanpa cache dan dengan cache:
Tanpa cache:
jumlah_panggilan × biaya_masukan_normal
Dengan cache:
biaya_pembuatan_cache
+ (jumlah_panggilan_cache_hit × biaya_cache_hit)
Karena pembuatan cache hanya menambah 25%, sementara cache hit menghemat 90% dari biaya masukan normal, caching umumnya mulai menguntungkan saat awalan dipakai ulang setidaknya dua kali.
Kuota gratis: 1 juta token, Singapura, 90 hari
Model Studio menyediakan kuota gratis untuk qwen3.8-max dengan batas berikut:
- Ukuran: 1 juta token
- Wilayah: hanya Singapura
- Durasi: 90 hari sejak aktivasi
Gunakan endpoint Singapura berikut:
https://dashscope-intl.aliyuncs.com/compatible-mode/v1
Kuota tidak berlaku untuk endpoint Beijing atau US-Virginia.
Perlu diingat: token pemikiran juga mengurangi kuota. Beberapa tugas berat dengan reasoning_effort: xhigh dapat menghabiskan 1 juta token lebih cepat dari perkiraan.
Untuk opsi akses tanpa biaya lainnya, lihat cara menggunakan Qwen 3.8 secara gratis.
Perbandingan harga Qwen 3.8-Max
Harga berikut adalah harga daftar per 1 juta token. Promo ditandai karena dapat berubah atau berakhir.
| Model | Masukan | Keluaran | Catatan |
|---|---|---|---|
| Qwen 3.8-Max | $2,00 | $6,00 | Datar hingga 1 juta token; cache hit 10% |
| Qwen 3.7-Max | $2,50 | $7,50 | Promo 50%: $1,25/$3,75 |
| Qwen 3.7-Plus | $0,40 | $1,60 | Sedang promo 20% |
| Kimi K3 | $3,00 | $15,00 | Cache hit $0,30 |
| Claude Opus 5 | $5,00 | $25,00 | — |
| GPT-5.6 Terra | $2,00 | $12,00 | — |
Cara membaca tabel:
- Dibanding Kimi K3: Qwen 3.8-Max lebih murah sekitar sepertiga untuk masukan dan 60% untuk keluaran. Cache hit Qwen juga lebih rendah: $0,20 dibanding $0,30. Lihat panduan API Kimi K3 untuk detail implementasi K3.
- Dibanding Claude Opus 5: Qwen lebih murah 60% untuk masukan dan 76% untuk keluaran.
- Dibanding GPT-5.6 Terra: biaya masukan sama-sama $2, tetapi keluaran Qwen setengah harga.
Harga bukan satu-satunya faktor pemilihan model. Uji kualitas model terhadap prompt, tool, format keluaran, dan dataset evaluasi aplikasi Anda sendiri.
Contoh perhitungan biaya
Contoh 1: sesi agen 50K token
Sebuah sesi agen menggunakan:
- 38.000 token masukan
- 12.000 token keluaran
Perhitungannya:
Masukan = 38.000 × $2 / 1.000.000 = $0,076
Keluaran = 12.000 × $6 / 1.000.000 = $0,072
Total = $0,148
Biaya sesi sekitar $0,15.
Jika sesi tersebut juga memakai 8.000 token penalaran pada xhigh, total token keluaran menjadi 20.000:
Keluaran = 20.000 × $6 / 1.000.000 = $0,12
Total = $0,196
Biaya naik menjadi sekitar $0,20 per sesi. Dalam contoh ini, penalaran meningkatkan biaya sekitar 33%.
Contoh 2: analisis dokumen 800K token
Anda memuat dokumen 800.000 token dan meminta ringkasan terstruktur 5.000 token.
Masukan = 800.000 × $2 / 1.000.000 = $1,60
Keluaran = 5.000 × $6 / 1.000.000 = $0,03
Total = $1,63
Total biaya sekitar $1,63 per proses.
Keunggulan harga datar terlihat jelas pada kasus ini: seluruh 800.000 token tetap memakai tarif masukan yang sama, tanpa pindah ke tingkatan konteks mahal.
Contoh 3: prompt sistem 100K token, 50 panggilan per hari
Aplikasi mengirim ulang 100.000 token prompt sistem, dokumen produk, dan definisi tool sebanyak 50 kali per hari.
Tanpa cache:
100.000 × $2 / 1.000.000 = $0,20 per panggilan
$0,20 × 50 = $10,00 per hari
Dengan cache eksplisit:
Pembuatan cache:
100.000 × $2,50 / 1.000.000 = $0,25
Cache hit:
100.000 × $0,20 / 1.000.000 = $0,02 per hit
49 cache hit:
49 × $0,02 = $0,98
Total harian:
$0,25 + $0,98 = $1,23
Totalnya sekitar $1,23 per hari, dibanding $10 tanpa cache. Penghematannya sekitar 88%.
Cara mengukur biaya berdasarkan penggunaan nyata
Jangan membuat proyeksi hanya dari panjang prompt. Token penalaran membuat biaya keluaran sulit diprediksi tanpa data.
Gunakan workflow berikut:
- Siapkan API key dan endpoint regional.
- Gunakan permintaan representatif dari aplikasi Anda.
- Jalankan setiap jenis tugas beberapa kali.
- Catat objek
usagedari setiap respons. - Pisahkan biaya masukan, keluaran, dan penalaran.
- Hitung rata-rata per jenis tugas.
- Kalikan dengan volume harian atau bulanan.
Panduan API Qwen 3.8 mencakup URL dasar regional dan protokol yang kompatibel dengan OpenAI serta Anthropic.
Di Apidog, simpan URL dasar untuk setiap wilayah sebagai environment. Kemudian:
- Kirim prompt yang sama dengan
reasoning_effortberbeda. - Periksa objek
usagepada respons. - Ulangi minimal 10 kali untuk setiap kategori tugas.
- Hitung rata-rata token dan biaya.
- Bandingkan hasilnya dengan
qwen3.7-maxatau Kimi K3 menggunakan workspace yang sama.
Unduh Apidog untuk melakukan pengujian permintaan dan mendapatkan estimasi biaya berbasis data penggunaan.
Intinya
Qwen 3.8-Max menawarkan harga $2/$6 yang agresif untuk model kelas flagship:
- Lebih murah dari harga daftar Qwen 3.7-Max.
- Biaya keluaran setengah dari GPT-5.6 Terra.
- Jauh lebih murah dari Claude Opus 5.
- Tarif tetap hingga konteks 1 juta token.
- Cache hit hanya 10% dari tarif masukan.
Dua hal yang harus dikontrol:
-
reasoning_effort: xhighdapat meningkatkan token keluaran dan biaya secara signifikan. - Promo model lain serta kuota gratis bersifat terbatas waktu.
Ukur penggunaan token nyata, pilih reasoning_effort sesuai tugas, dan gunakan caching untuk awalan prompt yang sering digunakan ulang.
Pertanyaan yang sering diajukan
Apakah Qwen 3.8 berbiaya lebih mahal untuk prompt panjang?
Tidak. Harga resmi mencantumkan satu tingkatan dari 0 hingga 1 juta token. Prompt 900.000 token tetap memakai tarif masukan $2 per 1 juta token.
Ini berbeda dari model bertingkat, termasuk beberapa model pada daftar model Model Studio, yang tarifnya meningkat sesuai panjang konteks.
Apakah token pemikiran memiliki tarif tambahan pada Qwen 3.8?
Tidak ada tarif penalaran terpisah. Mode pemikiran dan non-pemikiran memakai tarif $2/$6 yang sama.
Namun, token pemikiran dihitung sebagai token keluaran. Karena keluaran ditagih $6 per 1 juta token dan reasoning_effort default adalah xhigh, tugas penalaran berat dapat lebih mahal daripada yang terlihat dari panjang jawaban akhir.
Apakah ada cara gratis untuk mencoba Qwen 3.8?
Ya. Model Studio menyediakan kuota gratis 1 juta token selama 90 hari untuk endpoint Singapura. Qwen Chat juga menyediakan akses tanpa biaya melalui browser.
Detail kedua opsi tersebut tersedia di cara menggunakan Qwen 3.8 secara gratis.
Apakah “harga pratinjau 10%” masih tersedia?
Tidak. Promo tersebut berlaku pada periode pratinjau Juli 2026. Setelah ketersediaan umum, harga standar menjadi $2 untuk masukan dan $6 untuk keluaran per 1 juta token.
Gunakan halaman harga Model Studio sebagai sumber harga terbaru.
Top comments (0)