Alibaba merilis Qwen 3.8-Max pada awal Agustus 2026. Jika Anda sudah menjalankan qwen3.7-max di produksi, kini Anda perlu memutuskan: migrasi sekarang, tetap memakai 3.7-Max selama promo, atau turun ke model Plus untuk beban kerja rutin. Qwen 3.8-Max meningkatkan performa agen dan penelitian, menambahkan input gambar, memiliki harga daftar lebih rendah, serta menjanjikan bobot terbuka.
Keputusan ini tidak sesederhana “model baru selalu menang”. Qwen 3.7-Max sedang mendapat diskon 50% terbatas waktu sehingga, untuk saat ini, lebih murah secara absolut. Beberapa benchmark meningkat tajam, sementara yang lain hampir tidak berubah.
Untuk ringkasan model baru, baca penjelasan Qwen 3.8-Max. Untuk konteks pendahulunya, lihat apa yang ditawarkan Qwen 3.7.
Catatan metodologi: seluruh angka benchmark di bawah berasal dari tabel Alibaba dalam postingan rilis resmi Qwen 3.8. Kedua model diuji dalam evaluasi vendor yang sama, sehingga perbandingannya konsisten secara internal. Namun, verifikasi independen masih tertunda. Sebagian besar benchmark pengodean memakai harness Claude Code, dan sebagian benchmark adalah internal Qwen.
Versi singkatnya
| Apa yang berubah | Qwen 3.7-Max | Qwen 3.8-Max |
|---|---|---|
| Terminal Bench 2.1 | 74.5 | 86.6 |
| SWE-bench Pro | 60.6 | 67.7 |
| PaperBench | 64.8 | 93.0 |
| IFBench | 79.1 | 82.8 |
| GPQA Diamond | 92.4 | 92.6 |
| HLE | 41.4 | 43.6 |
| Harga daftar per 1 juta token | $2.5 masuk / $7.5 keluar | $2 masuk / $6 keluar |
| Harga saat ini | $1.25 masuk / $3.75 keluar | $2 masuk / $6 keluar |
| Input gambar | Tidak | Ya |
| Arsitektur yang diungkapkan | Tidak diungkapkan | Total 2.4T, 95B MoE aktif |
| Bobot terbuka | Tidak pernah dirilis | Dijanjikan “minggu depan” (~10 Agustus) |
| Jendela konteks | 1 juta token | 1 juta token |
Perbedaan benchmark: di mana peningkatannya nyata
Peningkatan utama Qwen 3.8-Max ada pada pekerjaan agen: tugas jangka panjang yang membutuhkan perencanaan, eksekusi, penggunaan alat, dan koreksi mandiri.
Terminal Bench 2.1: 74.5 → 86.6
Ini adalah kenaikan 12 poin untuk tugas agen berbasis terminal. Dalam tabel Alibaba, Qwen 3.8-Max juga berada di atas Claude Opus 4.8 dan Fable 5, yang masing-masing mendapat 84.6. GPT-5.6 Sol masih memimpin dengan 88.8.
Pilih 3.8-Max jika agen Anda menjalankan perintah shell, melakukan debugging berbasis terminal, atau menyelesaikan alur kerja multi-langkah di lingkungan pengembangan.
SWE-bench Pro: 60.6 → 67.7
Kenaikan 7 poin pada tugas rekayasa perangkat lunak dunia nyata. Ini peningkatan yang berarti, tetapi bukan posisi terdepan: Fable 5 mendapat 80.0 dalam tabel yang sama.
Implikasi praktis: migrasi layak diuji bila agen Anda memperbaiki bug, membuat patch, atau bekerja di repositori. Namun, jangan mengasumsikan Qwen 3.8-Max otomatis menjadi model terbaik untuk semua tugas SWE-bench.
PaperBench: 64.8 → 93.0
Ini kenaikan terbesar: 28 poin untuk reproduksi makalah penelitian AI. Dalam perbandingan Alibaba, angka ini juga mengungguli semua pesaing.
Pilih 3.8-Max jika alur kerja Anda melibatkan:
- Reproduksi eksperimen penelitian
- Analisis dokumen teknis panjang
- Penalaran ilmiah multi-langkah
- Penyusunan atau verifikasi prosedur eksperimen
IFBench: 79.1 → 82.8
Kepatuhan terhadap instruksi naik hampir 4 poin. Qwen 3.7-Max sudah kuat pada benchmark ini, sehingga 3.8-Max memperluas keunggulan yang sudah ada.
GPQA Diamond: 92.4 → 92.6
Secara praktis, hasilnya datar. Jika beban kerja Anda terutama berupa tanya-jawab pengetahuan sains tingkat lanjut, peningkatan kualitas dari migrasi hampir tidak terlihat pada benchmark ini.
HLE: 41.4 → 43.6
Humanity’s Last Exam naik 2 poin, tetapi Qwen 3.8-Max masih tertinggal dari Fable 5 (53.3) dan GPT-5.6 Sol (47.2) dalam tabel yang sama.
Pola utamanya:
- Kenaikan besar pada benchmark agen dan penelitian
- Kenaikan bertahap pada kepatuhan instruksi
- Hampir tidak ada perubahan pada benchmark pengetahuan yang sudah jenuh
- Kesenjangan tetap ada pada evaluasi penalaran paling sulit
Untuk rincian benchmark lengkap, termasuk harness dan benchmark internal, lihat analisis benchmark Qwen 3.8.
Arsitektur: angka yang akhirnya diungkapkan Alibaba
Qwen 3.8-Max adalah model mixture of experts (MoE) dengan:
- 2.4 triliun parameter total
- 95 miliar parameter aktif per *forward pass*
- Fondasi arsitektur Qwen 3.5
Rasio aktivasi sekitar 4%. Dalam praktiknya, ini penting untuk serving: komputasi aktif terutama terkait dengan 95B parameter, bukan seluruh 2.4T parameter.
Untuk Qwen 3.7-Max, Alibaba tidak pernah menerbitkan angka skala yang setara: jumlah parameter, rasio aktivasi, dan konfigurasi pakar tidak diungkapkan. Pada Qwen 3.8-Max, dokumentasi model Model Studio dan postingan rilis menjelaskan arsitekturnya, sehingga perencanaan kapasitas dan pemodelan biaya lebih mudah dilakukan.
Sebagai konteks, Kimi K3 memiliki total 2.8T parameter dengan 104B aktif. Qwen 3.8-Max lebih kecil pada kedua metrik tersebut.
Multimodal: kemampuan baru yang tidak dimiliki 3.7-Max
Qwen 3.7-Max adalah model teks. Qwen 3.8-Max menerima input gambar secara native.
Alibaba menerbitkan tabel benchmark multimodal terpisah, dengan beberapa skor utama berikut:
- MathVision: 95.2
- LogicVista: 91.9
- OSWorld-Verified: 86.1
Tidak ada kolom Qwen 3.7-Max dalam tabel itu karena model lama tidak menerima gambar.
Secara praktis, Qwen 3.8-Max dapat menyederhanakan arsitektur untuk use case seperti:
- Pemahaman tangkapan layar
- Ekstraksi informasi dari gambar dokumen
- Otomatisasi UI
- Pembacaan grafik dan diagram
- Alur kerja agen yang memerlukan teks dan gambar
Postingan rilis juga menunjukkan pemahaman dokumen panjang dan video. Namun, verifikasi dokumentasi API untuk format input dan batasan use case spesifik sebelum menerapkannya di produksi.
Harga: model baru lebih murah, kecuali saat ini
Qwen 3.8-Max diluncurkan dengan harga daftar:
- $2 input / $6 output per 1 juta token
Qwen 3.7-Max memiliki harga daftar:
- $2.5 input / $7.5 output per 1 juta token
Dengan harga daftar, Qwen 3.8-Max sekitar 20% lebih murah daripada pendahulunya.
Namun, Qwen 3.7-Max sedang memiliki promo 50% terbatas waktu:
- $1.25 input / $3.75 output per 1 juta token
Pada harga saat ini, Qwen 3.7-Max sekitar 38% lebih murah daripada Qwen 3.8-Max.
Semua tarif dapat diperiksa di halaman harga resmi Model Studio.
Dua hal yang perlu dihitung sebelum migrasi
Promo 3.7-Max dapat berakhir kapan saja.
Alibaba menyebutnya terbatas waktu dan belum menerbitkan tanggal berakhir. Jangan membuat proyeksi anggaran jangka panjang hanya berdasarkan tarif promo $1.25 / $3.75.Token thinking meningkatkan biaya efektif.
Qwen 3.8-Max secara default memakaireasoning_effort: xhigh. Token thinking ditagihkan sebagai token output, sehingga biaya aktual per permintaan dapat lebih tinggi daripada harga dasar.
Contoh payload untuk mengontrol tingkat penalaran:
{
"model": "qwen3.8-max",
"messages": [
{
"role": "user",
"content": "Analisis penyebab kegagalan build ini."
}
],
"reasoning_effort": "medium"
}
Gunakan medium atau low untuk tugas rutin jika kualitasnya tetap memenuhi standar Anda. Uji pengaruhnya terhadap kualitas, latensi, dan token output sebelum menetapkan nilai default.
Untuk perhitungan biaya, ekonomi cache, dan biaya per tugas, baca panduan harga Qwen 3.8.
Jika model Max tidak sesuai anggaran, qwen3.7-plus dengan harga $0.4 / $1.6—saat ini diskon 20%—tetap menjadi opsi nilai yang kuat. Lihat perbandingan Plus vs Max untuk menentukan kapan Plus sudah cukup.
Bobot terbuka: yang pertama untuk kelas Max
Tidak ada model kelas Qwen-Max sebelumnya yang dirilis dengan bobot terbuka. Qwen 3.7-Max tidak memilikinya, dan Alibaba tidak pernah menyatakan akan merilisnya.
Untuk Qwen 3.8-Max, postingan rilis menjanjikan bobot di Hugging Face dan ModelScope “minggu depan”, yang mengarah ke sekitar 10 Agustus 2026.
Pada saat penulisan, 3 Agustus 2026, bobot tersebut belum tersedia untuk diunduh. Perlakukan ini sebagai janji hingga rilis benar-benar tersedia.
Bahkan setelah bobot tersedia, model 2.4T parameter tetap merupakan proyek self-hosting multi-node, termasuk bila dikuantisasi. Bagi sebagian besar tim, dampak praktisnya lebih mungkin berupa:
- Pilihan hosting pihak ketiga yang lebih banyak
- Fleksibilitas pengadaan
- Pertimbangan kepatuhan
- Tekanan harga pada penyedia inference
Jika bobot terbuka adalah persyaratan pengadaan atau kepatuhan, hal ini saja dapat menjadi pembeda utama antara Qwen 3.7-Max dan Qwen 3.8-Max.
Apa yang tidak berubah
Jendela konteks: tetap 1 juta token
Kedua model mendukung jendela konteks 1 juta token. Tidak ada peningkatan konteks pada Qwen 3.8-Max.
Jalur akses: tetap sama
Kedua model tersedia melalui Alibaba Cloud Model Studio dengan endpoint yang kompatibel dengan OpenAI. Untuk penggunaan dasar, migrasi utamanya adalah mengganti ID model:
- "model": "qwen3.7-max"
+ "model": "qwen3.8-max"
Qwen 3.8-Max juga menambahkan permukaan API yang kompatibel dengan Anthropic. Anda dapat mengujinya dengan klien seperti Apidog bila tooling Anda mendukung protokol tersebut.
Kontrol penalaran: kini eksplisit
Qwen 3.8-Max mendukung parameter berikut:
reasoning_effortenable_thinkingpreserve_thinking
reasoning_effort memiliki tiga level:
-
xhighsebagai default mediumlow
Jika Anda sebelumnya mengandalkan perilaku penalaran implisit pada 3.7-Max, Qwen 3.8-Max memberi Anda kontrol yang lebih eksplisit.
Haruskah Anda upgrade? Tiga jalur keputusan
Upgrade sekarang jika
Pilih Qwen 3.8-Max sekarang jika beban kerja Anda didominasi oleh agen atau penelitian.
Alasannya:
- Terminal Bench meningkat dari 74.5 ke 86.6
- PaperBench meningkat dari 64.8 ke 93.0
- Input gambar tersedia secara native
- Harga daftar lebih rendah daripada 3.7-Max
Ini paling relevan untuk agen terminal, reproduksi pekerjaan teknis, pemrosesan screenshot, dan alur kerja multimodal.
Tetap gunakan promo 3.7-Max jika
Tetap di Qwen 3.7-Max jika beban kerja Anda lebih dekat ke Q&A, rangkuman, percakapan umum, atau tugas pengetahuan yang kualitasnya sudah memenuhi standar.
Pada GPQA Diamond, peningkatannya hanya 0.2 poin. Dengan harga promo $1.25 / $3.75, Qwen 3.7-Max saat ini adalah opsi per-token yang lebih murah dibandingkan kedua model Max.
Tetapkan pengingat untuk mengecek status promo setiap bulan. Jika promo berakhir, harga fallback yang lebih murah adalah Qwen 3.8-Max di $2 / $6, bukan Qwen 3.7-Max pada harga daftar.
Turun ke qwen3.7-plus jika
Gunakan qwen3.7-plus jika prioritas utama Anda adalah biaya dan tugas Anda rutin, misalnya:
- Klasifikasi
- Ekstraksi data terstruktur
- Transformasi teks
- Generasi berbasis template
- Ringkasan sederhana
Dengan harga \$0.4 / \$1.6, model ini 5x lebih murah daripada Qwen 3.8-Max pada token input. Untuk tugas semacam ini, kemampuan kelas Max sering kali tidak sebanding dengan biayanya.
Uji pengalihan sebelum berkomitmen
Benchmark vendor tidak dapat memprediksi perilaku model pada prompt, data, dan alur kerja produksi Anda. Cara paling murah untuk memutuskan adalah menjalankan evaluasi side-by-side.
Di Apidog, siapkan satu koleksi untuk endpoint Model Studio yang kompatibel dengan OpenAI, lalu buat dua environment yang hanya berbeda pada variabel model:
# Environment: qwen-3.7
MODEL_ID=qwen3.7-max
# Environment: qwen-3.8
MODEL_ID=qwen3.8-max
Gunakan variabel tersebut pada body request:
{
"model": "{{MODEL_ID}}",
"messages": [
{
"role": "user",
"content": "{{PROMPT_PRODUKSI}}"
}
]
}
Kemudian jalankan set permintaan yang sama terhadap kedua environment dan bandingkan:
- Kualitas output
- Keberhasilan penggunaan tool atau agen
- Latensi
- Jumlah token input dan output
- Biaya efektif per tugas
- Perilaku pada prompt panjang atau input gambar
Simpan prompt produksi yang representatif sebagai skenario pengujian. Jalankan ulang pengujian ketika Alibaba memperbarui model atau ketika harga promo berubah.
Dengan pendekatan ini, pertanyaan “apakah harus upgrade?” berubah dari debat benchmark menjadi keputusan berbasis data dari lalu lintas Anda sendiri. Unduh Apidog secara gratis untuk menjalankan perbandingan sebelum mengubah konfigurasi produksi.
FAQ
Apakah Qwen 3.8-Max lebih murah dari Qwen 3.7-Max?
Dengan harga daftar, ya: $2 / $6 dibandingkan $2.5 / $7.5 per 1 juta token.
Dengan harga saat ini, tidak. Promo 50% terbatas waktu untuk Qwen 3.7-Max membuat harganya menjadi $1.25 / $3.75, sekitar 38% lebih murah daripada Qwen 3.8-Max. Promo tersebut belum memiliki tanggal berakhir yang dipublikasikan.
Baca panduan harga Qwen 3.8 untuk rincian biaya lengkap.
Apakah saya perlu mengubah kode untuk beralih dari qwen3.7-max ke qwen3.8-max?
Untuk penggunaan dasar, tidak. Kedua model menggunakan endpoint Model Studio yang kompatibel dengan OpenAI, sehingga perubahan utama adalah ID model.
Namun, Anda sebaiknya menetapkan reasoning_effort secara eksplisit pada Qwen 3.8-Max karena default-nya adalah xhigh, dan token thinking ditagihkan sebagai output. Jika mengirim gambar, gunakan format pesan input gambar yang didukung oleh API Qwen 3.8-Max.
Apakah Qwen 3.7-Max memiliki bobot terbuka?
Tidak. Berdasarkan sejarah lini ini, Qwen 3.7-Max tidak memiliki bobot terbuka.
Qwen 3.8-Max adalah model kelas Max pertama dengan bobot terbuka yang dijanjikan, diharapkan tersedia di Hugging Face dan ModelScope sekitar 10 Agustus 2026. Per 3 Agustus 2026, bobot tersebut belum dapat diunduh.
Apakah Qwen 3.8-Max lebih baik dari Claude atau GPT sekarang?
Tergantung benchmark dan perlu diingat bahwa angka ini berasal dari Alibaba.
Dalam tabel mereka, Qwen 3.8-Max:
- Mengalahkan Opus 4.8 dan Fable 5 pada Terminal Bench 2.1
- Memimpin pada PaperBench dan IFBench
- Tertinggal dari Fable 5 pada SWE-bench Pro, 67.7 versus 80.0
- Masih tertinggal dari model terdepan pada HLE
Belum ada benchmark independen yang disertakan di sini. Uji pada workload Anda sendiri sebelum membuat keputusan produksi.

Top comments (0)