Alibaba secara resmi merilis Qwen 3.8-Max pada awal Agustus 2026. Model ini menggabungkan arsitektur Mixture-of-Experts (MoE) dengan total 2,4 triliun parameter, tetapi hanya mengaktifkan 95 miliar parameter per token. Model menawarkan konteks hingga 1 juta token, harga tetap $2 input/$6 output per 1 juta token, serta janji publikasi bobot di Hugging Face dan ModelScope dalam waktu sekitar seminggu. Ini penting karena belum ada model kelas Qwen-Max yang sebelumnya meluncurkan bobot terbuka.
Pengumuman resmi menyebut Qwen 3.8-Max sebagai Qwen paling mumpuni sejauh ini. Benchmark vendor menunjukkan hasil kuat pada tugas agen, dokumen, dan multimodal, tetapi juga menunjukkan kekalahan yang jelas pada beberapa benchmark pengkodean inti. Artikel ini membahas spesifikasi, benchmark, harga, serta cara menguji API yang kompatibel dengan OpenAI dan Anthropic menggunakan klien seperti Apidog.
Qwen 3.8-Max sekilas
| Spesifikasi | Qwen 3.8-Max |
|---|---|
| Pengembang | Alibaba (tim Qwen) |
| Rilis | Awal Agustus 2026 (GA di Model Studio, 3 Agustus) |
| Arsitektur | MoE, dibangun di atas fondasi Qwen 3.5 |
| Total parameter | 2.4T |
| Parameter aktif | 95B (~4% aktivasi) |
| Jendela konteks | 1.000.000 token |
| Output maksimal | 65.536 token |
| Modalitas | Input teks + gambar, output teks |
| Kontrol penalaran |
reasoning_effort: xhigh (standar), medium, low |
| ID model API | qwen3.8-max |
| Harga | $2 input / $6 output per 1M token, tetap di seluruh konteks penuh |
| Bobot terbuka | Dijanjikan untuk minggu berikutnya (~10 Agustus); belum dapat diunduh per awal Agustus 2026 |
| Protokol API | Kompatibel dengan OpenAI dan Anthropic |
Spesifikasi dan harga tersebut berasal dari materi rilis Alibaba serta halaman harga Model Studio.
Apa itu Qwen 3.8-Max?
Qwen 3.8-Max adalah model unggulan baru keluarga Qwen Alibaba yang dibangun di atas fondasi Qwen 3.5. Model ini menggantikan Qwen3.7-Max di lini teratas.
Menurut tabel vendor, peningkatannya terhadap Qwen3.7-Max terlihat pada beberapa benchmark:
- Terminal Bench 2.1: dari 74,5 menjadi 86,6.
- PaperBench: dari 64,8 menjadi 93,0.
Jika Anda sedang mempertimbangkan migrasi dari model sebelumnya, lihat perbandingan Qwen 3.8 vs Qwen 3.7 Max.
Karakteristik utama model ini adalah rasio parameter aktifnya. Meski memiliki total 2,4T parameter, hanya 95B parameter yang aktif pada setiap forward pass. Aktivasi sekitar 4% ini membantu Alibaba menyajikan model besar dengan harga $2/$6 per 1 juta token.
Sebagai pembanding, Kimi K3 memiliki total 2,8T parameter dengan 104B parameter aktif. Jadi, Qwen 3.8-Max lebih kecil pada total maupun parameter aktif.
Di API, Qwen 3.8-Max menerima input teks dan gambar serta menghasilkan teks. Alibaba juga mendemonstrasikan pemahaman PDF lebih dari 200 halaman dan video 100 jam melalui pendekatan yang disebut memory graph. Namun, konfigurasi API yang dipublikasikan hanya mencantumkan teks dan gambar sebagai modalitas input.
Gunakan parameter berikut untuk mengontrol penalaran:
{
"reasoning_effort": "xhigh"
}
Level yang tersedia:
-
xhigh: standar, penalaran paling intensif. -
medium: kompromi antara latensi dan kualitas. -
low: untuk respons yang lebih cepat.
Alibaba juga menyediakan enable_thinking dan preserve_thinking. Secara default, thinking dipertahankan. Perhatikan implikasi biaya: token berpikir dihitung sebagai token output, sehingga penggunaan xhigh dapat meningkatkan tagihan aktual.
Qwen kelas Max dengan bobot terbuka pertama
Alibaba telah merilis banyak model Qwen sebagai sumber terbuka, tetapi belum pernah untuk kelas Max. Qwen 3.8-Max dijanjikan akan tersedia di Hugging Face dan ModelScope “minggu depan”, kira-kira sekitar 10 Agustus 2026.
Ada dua hal yang perlu diperhatikan sebelum merencanakan self-hosting.
Bobot belum tersedia untuk diunduh.
Per awal Agustus 2026, ini masih berupa janji rilis. Kimi K3 menjadi contoh bahwa publikasi bobot dapat terjadi beberapa hari setelah peluncuran.Self-hosting model 2,4T membutuhkan infrastruktur multi-node.
Bahkan dengan kuantisasi agresif, model ini tidak realistis dijalankan pada workstation biasa. Untuk sebagian besar tim, bobot terbuka lebih mungkin berarti akses melalui penyedia hosting pihak ketiga, bukan deployment lokal.
Jika tujuan Anda adalah mencoba model tanpa membayar harga daftar, gunakan Qwen Chat atau kuota gratis Model Studio. Lihat panduan cara menggunakan Qwen 3.8 secara gratis.
Apa yang ditunjukkan benchmark, termasuk kekalahan
Alibaba membandingkan Qwen 3.8-Max dengan Claude Opus 4.8, Fable 5, GPT-5.6 Sol, dan Qwen3.7-Max.
Sebelum memakai angka ini untuk memilih model, ingat dua hal:
- Hasil benchmark dijalankan oleh vendor.
- Sebagian besar benchmark pengkodean memakai Claude Code harness untuk semua model.
- Beberapa benchmark, seperti QwenSWEBench, QwenQoderBench, CoWorkBench, dan RecreationBench, dibuat secara internal oleh Alibaba.
- Tidak ada angka independen dari outlet seperti Artificial Analysis pada saat penulisan.
Area keunggulan
PaperBench: 93,0
Mengungguli GPT-5.6 Sol (90,5), Fable 5 (88,8), dan Opus 4.8 (80,3).IFBench: 82,8
Skor tertinggi pada tabel tersebut, di atas Sol yang mencapai 72,7.Terminal Bench 2.1: 86,6
Mengalahkan Opus 4.8 dan Fable 5 yang masing-masing mencetak 84,6, tetapi masih di bawah Sol dengan 88,8.Multimodal dan dokumen
Model mencatat MathVision 95,2, LogicVista 91,9, OSWorld-Verified 86,1, serta skor OCR yang memimpin hampir seluruh tabel vendor.
Area kelemahan
SWE-bench Pro: 67,7
Di bawah Fable 5 (80,0) dan sedikit di bawah Opus 4.8 (69,2), walau masih melampaui Sol (64,6).HLE: 43,6
Di bawah Fable 5 (53,3), Sol (47,2), dan Opus 4.8 (45,7).
Ringkasnya, menurut angka Alibaba sendiri:
- Qwen 3.8-Max mengalahkan Opus 4.8 pada beberapa tugas agen.
- Fable 5 masih unggul pada sebagian besar pekerjaan pengkodean inti.
- Qwen 3.8-Max tampak kuat untuk dokumen panjang dan tugas multimodal.
- Pada GPQA Diamond, Qwen mencetak 92,6, setara dengan Fable 5 dan sedikit di bawah Sol yang mencapai 94,1.
Untuk rincian tabel, harness, dan aspek yang perlu diverifikasi secara independen, baca uraian benchmark Qwen 3.8.
Alibaba juga mendemonstrasikan sesi pengkodean otonom selama 16 hari pada repositori publik, dengan 265 commit dan 127 pull request. Demo lain mencakup reproduksi makalah serta entri kompetisi Tianchi. Perlakukan seluruhnya sebagai demonstrasi vendor, bukan evaluasi terkontrol.
Untuk fokus penggunaan coding, lihat Qwen 3.8 untuk pengkodean.
Posisi dibandingkan Kimi K3, Fable 5, dan GPT-5.6 Sol
Vs Kimi K3
Qwen 3.8-Max dan Kimi K3 adalah pembanding alami: keduanya model MoE besar dari lab Tiongkok dan sama-sama terkait dengan bobot terbuka.
| Aspek | Qwen 3.8-Max | Kimi K3 |
|---|---|---|
| Total parameter | 2.4T | 2.8T |
| Parameter aktif | 95B | 104B |
| Modalitas | Teks + gambar | Teks |
| Harga input | $2 / 1M token | $3 / 1M token |
| Harga output | $6 / 1M token | $15 / 1M token |
| Cache hit | 10% dari tarif input | $0,30 |
| Bobot | Dijanjikan | Sudah tersedia |
Belum ada evaluasi langsung yang independen. Untuk perbandingan lebih rinci, baca Qwen 3.8 vs Kimi K3. Jika belum familiar dengan model Moonshot, mulai dari apa itu Kimi K3.
Vs Fable 5
Fable 5 tetap menjadi target utama untuk pengkodean. Berdasarkan tabel Alibaba, Qwen 3.8-Max belum mengalahkannya pada benchmark inti:
- SWE-bench Pro: 67,7 vs 80,0.
- HLE: 43,6 vs 53,3.
Sebagai gantinya, Qwen menawarkan harga yang lebih rendah, konteks 1 juta token, bobot terbuka yang dijanjikan, serta hasil multimodal yang lebih kuat.
Vs GPT-5.6 Sol
GPT-5.6 Sol unggul pada:
- Terminal Bench: 88,8 vs 86,6.
- GPQA: 94,1 vs 92,6.
- HLE: 47,2 vs 43,6.
Qwen 3.8-Max unggul pada:
- PaperBench: 93,0 vs 90,5.
- IFBench: 82,8 vs 72,7.
Dari sisi harga, Qwen $2/$6 lebih murah untuk output dibandingkan $2/$12 pada GPT-5.6 Terra, sementara akses tingkat Sol masih lebih mahal.
Claude Opus 5 juga tercantum pada harga $5/$25. Untuk workload bervolume tinggi, harga Qwen dapat mengubah perhitungan biaya secara signifikan.
Harga: $2/$6 tetap di seluruh 1M token
Harga Qwen 3.8-Max adalah:
- $2 per 1 juta token input
- $6 per 1 juta token output
- Satu tingkat harga dari token pertama hingga konteks 1 juta token
- Tarif yang sama untuk mode berpikir dan tidak berpikir
Model konteks panjang biasanya menaikkan tarif ketika prompt semakin besar. Qwen 3.8-Max tidak melakukan itu.
Model ini juga diluncurkan dengan harga lebih murah dibanding harga daftar Qwen3.7-Max, yaitu $2,5/$7,5. Namun, Qwen3.7-Max saat ini memiliki promosi 50% menjadi $1,25/$3,75, sehingga masih relevan sebagai pilihan yang lebih hemat.
Untuk workload dengan awalan prompt berulang:
- Cache hit ditagih 10% dari tarif input.
- Pembuatan cache eksplisit ditagih 125%.
- Kuota gratis tersedia sebesar 1 juta token, hanya di wilayah Singapura, dan berlaku 90 hari.
Untuk contoh biaya per tugas dan dampak token berpikir, lihat panduan harga Qwen 3.8.
Cara mengakses Qwen 3.8-Max
Ada lima jalur akses utama.
1. Qwen Chat
Gunakan aplikasi konsumen Qwen Chat jika Anda ingin menguji kemampuan model tanpa menyiapkan API key. Ini adalah cara tercepat untuk mencoba prompt, dokumen, atau tugas reasoning.
2. API Alibaba Cloud Model Studio
Dapatkan kunci dari home.qwencloud.com, lalu simpan sebagai environment variable:
export DASHSCOPE_API_KEY="YOUR_API_KEY"
Gunakan model ID:
qwen3.8-max
Endpoint regional yang tersedia:
Beijing:
https://dashscope.aliyuncs.com/compatible-mode/v1
Singapura:
https://dashscope-intl.aliyuncs.com/compatible-mode/v1
AS-Virginia:
https://dashscope-us.aliyuncs.com/compatible-mode/v1
Model ini dapat dipanggil melalui endpoint yang kompatibel dengan OpenAI. Contoh curl:
curl https://dashscope-intl.aliyuncs.com/compatible-mode/v1/chat/completions \
-H "Authorization: Bearer $DASHSCOPE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-max",
"messages": [
{
"role": "user",
"content": "Jelaskan cara menerapkan rate limiting pada API Node.js."
}
],
"reasoning_effort": "medium"
}'
Halaman model Model Studio mencantumkan Qwen 3.8-Max pada daftar model yang direkomendasikan.
3. Endpoint kompatibel dengan Anthropic
Alibaba juga menyediakan endpoint yang berbicara dengan protokol Messages Anthropic:
https://dashscope-intl.aliyuncs.com/apps/anthropic
Ini berguna bila tool Anda sudah dibangun untuk ekosistem Claude. Anda dapat mengarahkan base URL dan model ke Qwen tanpa menulis ulang seluruh integrasi.
4. Harness pengkodean
Alibaba menerbitkan konfigurasi untuk:
- Claude Code
- Codex
- Qoder
- Qwen Code
- OpenClaw
Untuk Claude Code, konsep konfigurasi utamanya adalah:
export ANTHROPIC_BASE_URL="https://dashscope-intl.aliyuncs.com/apps/anthropic"
export ANTHROPIC_MODEL="qwen3.8-max"
Alibaba menggunakan Claude Code harness untuk sebagian besar benchmark pengkodeannya. Jadi, konfigurasi ini relevan jika Anda ingin menguji model dalam lingkungan yang serupa dengan evaluasi vendor.
5. Bobot terbuka
Bobot untuk Hugging Face dan ModelScope dijanjikan segera setelah peluncuran, tetapi belum dapat diunduh per awal Agustus 2026.
Untuk panduan lebih lengkap, termasuk Python dan curl, lihat panduan API Qwen 3.8.
Menguji API dual-protokol
Karena model yang sama tersedia melalui protokol kompatibel OpenAI dan Anthropic, uji keduanya menggunakan prompt, parameter, dan dataset evaluasi yang sama.
Checklist pengujian praktis:
- Simpan endpoint Beijing, Singapura, dan AS-Virginia sebagai environment terpisah.
- Kirim prompt identik melalui endpoint OpenAI-compatible dan Anthropic-compatible.
- Bandingkan output, latensi, error rate, dan konsumsi token.
- Uji
reasoning_effortpadalow,medium, danxhigh. - Jika memakai streaming, periksa apakah delta
reasoning_contentmuncul sebelum respons akhir. - Catat token reasoning sebagai bagian dari estimasi biaya output.
Di Apidog, Anda dapat menyimpan URL dasar regional sebagai environment, berpindah wilayah tanpa mengubah request, dan membandingkan endpoint OpenAI dengan endpoint Anthropic secara berdampingan. Anda juga dapat menguji qwen3.8-max, qwen3.7-max, dan kimi-k3 menggunakan prompt yang identik sebelum memindahkan workload produksi.
Unduh Apidog jika Anda ingin menguji endpoint dan menyimpan koleksi request dalam satu workspace.
Posisi Qwen 3.8-Max dalam jajaran produk
Qwen 3.8-Max berada di atas Qwen3.7-Max dan model tingkat plus.
Panduan praktis untuk memilih model:
- Gunakan Qwen 3.8-Max untuk tugas agen tingkat tinggi, dokumen panjang, dan input multimodal.
- Gunakan Qwen3.7-Max ketika promosi 50% masih aktif dan biaya menjadi prioritas.
- Gunakan model plus untuk tugas rutin dengan volume tinggi dan kebutuhan kemampuan yang lebih ringan.
Untuk peta model yang lebih lengkap, lihat panduan model Qwen terbaik.
FAQ
Apakah Qwen 3.8 sumber terbuka?
Belum, tetapi Alibaba menjanjikan bobot untuk Hugging Face dan ModelScope “minggu depan” dari peluncuran awal Agustus 2026. Jika rilis terjadi, ini akan menjadi Qwen kelas Max pertama dengan bobot terbuka.
Sampai saat itu, gunakan API atau Qwen Chat. Untuk opsi tanpa biaya, baca cara menggunakan Qwen 3.8 secara gratis.
Berapa harga Qwen 3.8-Max?
$2 per 1 juta token input dan $6 per 1 juta token output, dengan harga tetap hingga konteks 1 juta token.
Cache hit ditagih 10% dari tarif input. Token berpikir dihitung sebagai output, sehingga workload dengan reasoning_effort: "xhigh" membutuhkan anggaran lebih tinggi daripada harga stiker sederhana.
Apakah Qwen 3.8-Max lebih baik dari Kimi K3?
Belum ada evaluasi langsung yang independen. Di atas kertas, Qwen 3.8-Max lebih kecil (2,4T/95B aktif vs 2,8T/104B), mendukung input multimodal, dan lebih murah untuk output ($6 vs $15 per 1 juta token).
Keunggulan Kimi K3 saat ini adalah bobotnya sudah tersedia secara publik.
Bisakah saya menggunakan Qwen 3.8-Max di Claude Code?
Ya. Gunakan endpoint DashScope kompatibel Anthropic sebagai ANTHROPIC_BASE_URL, lalu atur:
export ANTHROPIC_MODEL="qwen3.8-max"
Alibaba juga menyediakan konfigurasi untuk Codex, Qoder, Qwen Code, dan OpenClaw.
Apa yang harus dilakukan selanjutnya
Qwen 3.8-Max adalah rilis produksi dengan ketersediaan API di tiga wilayah, harga yang dipublikasikan, benchmark vendor lengkap, dan bobot terbuka yang dijanjikan segera.
Jangan memilih model hanya dari tabel benchmark. Jalankan evaluasi pada workload Anda sendiri:
- Ambil kuota gratis.
- Siapkan endpoint OpenAI-compatible dan Anthropic-compatible.
- Buat kumpulan prompt dari kasus produksi nyata.
- Bandingkan kualitas, latensi, token output, serta biaya reasoning.
- Uji model terhadap Qwen3.7-Max atau Kimi K3 pada input yang sama.
- Periksa kembali status bobot terbuka sekitar 10 Agustus.
Mulai dari panduan pengaturan API Qwen 3.8.

Top comments (0)