Selama dua minggu, cerita Qwen 3.8 memiliki celah: pratinjau pers bulan Juli menjanjikan model kelas perintis, tetapi tanpa skor benchmark. Akibatnya, ulasan awal banyak bertumpu pada spekulasi. Pada 3 Agustus 2026, Alibaba merilis tabel benchmark lengkap untuk Qwen 3.8-Max, membandingkannya dengan Claude Opus 4.8, Fable 5, GPT-5.6 Sol, dan Qwen3.7-Max, serta tabel multimodal terpisah melawan Gemini 3.1 Pro dan GPT-5.6 Sol di pos rilis resmi.
Tabel tersebut perlu dibaca secara kritis: ada kemenangan nyata, kekalahan yang juga nyata, serta detail metodologi yang memengaruhi interpretasi hasil. Artikel ini merangkum angka penting dan menunjukkan cara memvalidasinya dengan evaluasi API Anda sendiri. Untuk parameter, harga, dan akses model, baca penjelasan Qwen 3.8-Max.
Catatan penting: semua skor berikut berasal dari tabel yang diterbitkan Alibaba sendiri, dengan catatan kaki bertanggal 3 Agustus 2026. Belum ada evaluasi independen pada saat penulisan.
Tabel benchmark utama
Berikut baris model teks utama yang dipublikasikan Alibaba. Semua benchmark menggunakan metrik “semakin tinggi semakin baik”.
| Benchmark | Qwen 3.8-Max | Claude Opus 4.8 | Fable 5 | GPT-5.6 Sol | Qwen3.7-Max |
|---|---|---|---|---|---|
| Terminal Bench 2.1 | 86.6 | 84.6 | 84.6 | 88.8 | 74.5 |
| SWE-bench Pro | 67.7 | 69.2 | 80.0 | 64.6 | 60.6 |
| PaperBench | 93.0 | 80.3 | 88.8 | 90.5 | 64.8 |
| GPQA Diamond | 92.6 | 92.0 | 92.6 | 94.1 | 92.4 |
| IFBench | 82.8 | 62.2 | 63.5 | 72.7 | 79.1 |
| HLE (Humanity’s Last Exam) | 43.6 | 45.7 | 53.3 | 47.2 | 41.4 |
Sumber: tabel benchmark yang dijalankan oleh Alibaba.
Di mana Qwen 3.8-Max unggul
PaperBench: hasil paling menonjol
Pada PaperBench, Qwen 3.8-Max memperoleh 93.0:
- GPT-5.6 Sol: 90.5
- Fable 5: 88.8
- Claude Opus 4.8: 80.3
- Qwen3.7-Max: 64.8
PaperBench menguji kemampuan model untuk mereproduksi hasil makalah penelitian. Kenaikan dari 64.8 ke 93.0 dibanding generasi sebelumnya sangat besar. Namun, karena hasil ini masih berasal dari vendor, gunakan sebagai sinyal awal—bukan bukti final—sampai ada pengujian independen.
IFBench: kepatuhan instruksi
Qwen 3.8-Max mencetak 82.8 di IFBench, unggul atas:
- GPT-5.6 Sol: 72.7
- Fable 5: 63.5
- Claude Opus 4.8: 62.2
Qwen3.7-Max juga sudah kuat pada benchmark ini dengan skor 79.1. Artinya, kepatuhan instruksi tampak sebagai kekuatan yang konsisten pada lini Qwen, bukan hanya hasil satu rilis.
Untuk developer, ini relevan bila aplikasi Anda bergantung pada output yang harus mengikuti format ketat, misalnya:
- JSON tervalidasi
- skema respons tertentu
- field wajib
- aturan tool calling
- instruksi multi-langkah
Terminal Bench 2.1: di atas Claude, di bawah GPT
Pada Terminal Bench 2.1, Qwen 3.8-Max mendapat 86.6:
- GPT-5.6 Sol: 88.8
- Qwen 3.8-Max: 86.6
- Claude Opus 4.8: 84.6
- Fable 5: 84.6
Ini bukan kemenangan mutlak karena GPT-5.6 Sol masih memimpin. Namun, Qwen berada dua poin di atas Opus 4.8 dan Fable 5 pada benchmark terminal berbasis agen.
Multimodal dan inteligensi dokumen
Dalam tabel multimodal terpisah, Alibaba melaporkan:
- MathVision: 95.2
- LogicVista: 91.9
- OSWorld-Verified: 86.1
- Memimpin hampir semua baris OCR
Perlu dicatat bahwa Opus 4.8 dan Fable 5 tidak dibandingkan langsung dalam tabel multimodal tersebut. Karena itu, kemenangan Qwen pada bagian ini harus dibaca dalam konteks lawan yang tersedia: Gemini 3.1 Pro dan GPT-5.6 Sol.
Jika Anda mengevaluasi model untuk OCR, pemahaman dokumen, atau penalaran visual, bandingkan langsung dengan workload Anda. Untuk perbandingan dengan model open-weight lain, lihat Qwen 3.8 vs Kimi K3.
Di mana Qwen 3.8-Max kalah
Alibaba juga mempublikasikan area di mana Qwen 3.8-Max tidak memimpin. Ini penting saat memilih model untuk coding agent atau tugas penalaran umum.
HLE: tertinggal jauh dari Fable 5
Pada Humanity’s Last Exam (HLE), Qwen 3.8-Max mendapat 43.6:
- Fable 5: 53.3
- GPT-5.6 Sol: 47.2
- Claude Opus 4.8: 45.7
- Qwen 3.8-Max: 43.6
Qwen memang meningkat dari Qwen3.7-Max yang mendapat 41.4, tetapi kenaikannya kecil. Pada tabel ini, HLE adalah salah satu indikator paling jelas bahwa Qwen 3.8-Max belum memimpin pada pengetahuan luas dan penalaran frontier.
SWE-bench Pro: tertinggal pada rekayasa perangkat lunak
Pada SWE-bench Pro:
- Fable 5: 80.0
- Claude Opus 4.8: 69.2
- Qwen 3.8-Max: 67.7
- GPT-5.6 Sol: 64.6
- Qwen3.7-Max: 60.6
Qwen 3.8-Max mengalami peningkatan generasi yang nyata, dari 60.6 ke 67.7. Namun, ia masih tertinggal 12.3 poin dari Fable 5 pada benchmark rekayasa perangkat lunak yang lebih sulit.
DeepSWE dan tugas agen yang kompleks
Dalam baris DeepSWE, Qwen 3.8-Max juga tertinggal dari model frontier. Polanya cukup konsisten:
- Kompetitif pada tugas agen berbasis terminal.
- Lebih lemah pada evaluasi rekayasa perangkat lunak yang mendalam.
- Kuat untuk multimodal dan inteligensi dokumen.
Ringkasnya, Qwen 3.8-Max menawarkan hasil kuat untuk harga $2 input dan $6 output per satu juta token, menurut halaman harga resmi. Namun, tabel ini tidak menunjukkan kemenangan menyeluruh pada semua kategori.
Empat detail metodologi yang perlu diperiksa
Jangan hanya membaca kolom skor. Baca juga bagaimana skor itu dibuat.
1. Semua angka dijalankan oleh vendor
Alibaba mengevaluasi model sendiri sekaligus model pesaing. Ini umum dalam peluncuran model, tetapi berarti vendor menentukan:
- versi benchmark
- strategi prompting
- parameter sampling
- kebijakan retry
- konfigurasi tool atau harness
Hal tersebut bukan otomatis berarti hasilnya salah. Namun, hasil itu tetap merupakan klaim vendor, bukan pengukuran independen.
2. Banyak benchmark coding menggunakan Claude Code
Alibaba menjalankan sebagian besar benchmark coding dengan Claude Code, yaitu harness agen Anthropic, lalu mengarahkan Qwen 3.8-Max melalui API yang kompatibel dengan Anthropic.
Ini memiliki dua implikasi:
- Semua model diuji dalam tool yang sama, sehingga pendekatannya relatif konsisten.
- Skor tersebut lebih tepat dibaca sebagai performa “Qwen di dalam harness Claude Code”, bukan performa Qwen dalam setiap setup agen yang mungkin.
Harness dapat memengaruhi performa agen beberapa poin. Jika stack Anda memakai Cursor, OpenAI SDK, framework internal, atau orchestrator lain, jangan mengasumsikan hasilnya akan identik.
3. Sejumlah benchmark dibuat oleh tim Qwen
QwenSWEBench, QwenQoderBench, CoWorkBench, dan RecreationBench dibuat oleh tim Qwen.
Benchmark internal tetap berguna karena dapat mengukur kemampuan yang tidak tertangkap benchmark publik. Namun, skor tinggi pada benchmark internal tidak memiliki bobot evidensi yang sama dengan skor tinggi pada benchmark publik seperti SWE-bench Pro.
Saat membaca tabel vendor, pisahkan benchmark ke dua kelompok:
- Benchmark publik: dapat diuji ulang oleh pihak lain.
- Benchmark internal: relevan, tetapi perlu validasi tambahan.
4. Catatan kaki Fable 5
Tabel Alibaba memuat catatan bahwa hasil Fable 5 “mungkin melibatkan fallback”.
Artinya, setidaknya satu kolom kompetitor mungkin tidak mencerminkan model yang berjalan secara konsisten tanpa fallback. Detail seperti ini dapat mengubah interpretasi hasil, terutama ketika selisih skor kecil.
Pola ini tidak unik untuk Alibaba. Anthropic, OpenAI, dan Google juga menerbitkan tabel yang dijalankan sendiri dengan pilihan metodologi masing-masing. Pola serupa juga muncul dalam analisis benchmark Kimi K3.
Intinya: tabel vendor adalah klaim yang perlu diuji, bukan ukuran final performa model.
Cara membaca tabel benchmark vendor berikutnya
Gunakan daftar periksa ini sebelum menjadikan benchmark sebagai dasar keputusan arsitektur.
Siapa yang menjalankan evaluasi?
Bedakan hasil dari vendor, lab independen, dan leaderboard komunitas.Harness dan konfigurasi apa yang dipakai?
Benchmark agen sangat sensitif terhadap tool, prompt, retry, timeout, dan strategi sampling.Apakah benchmark dibuat oleh vendor?
Benchmark internal dapat berguna, tetapi jangan samakan langsung dengan benchmark publik.Apakah ada catatan kaki?
Detail seperti fallback, versi model, atau kebijakan retry bisa mengubah kesimpulan.Benchmark apa yang tidak ditampilkan?
Ketiadaan baris tertentu bisa sama informatifnya dengan angka yang dipublikasikan. Bandingkan dengan perbandingan generasi sebelumnya lintas vendor.Apakah sudah ada sumber kedua?
Tunggu evaluasi independen sebelum mengambil keputusan besar untuk migrasi model.
Per 3 Agustus 2026, Artificial Analysis dan leaderboard komunitas belum menerbitkan hasil untuk Qwen 3.8-Max. Perbedaan antara tabel Alibaba dan hasil independen nantinya akan menjadi data yang lebih penting.
Jalankan evaluasi Anda sendiri
Cara paling praktis untuk memilih model adalah menguji prompt produksi Anda sendiri.
Qwen 3.8-Max tersedia melalui Alibaba Cloud Model Studio dengan ID model qwen3.8-max, sebagaimana tercantum pada halaman model resmi. API-nya kompatibel dengan OpenAI dan Anthropic.
Langkah 1: siapkan request baseline
Buat request yang sama untuk Qwen 3.8-Max dan model baseline Anda saat ini.
Contoh payload chat completions:
{
"model": "qwen3.8-max",
"messages": [
{
"role": "system",
"content": "Anda adalah asisten yang selalu mengembalikan JSON valid."
},
{
"role": "user",
"content": "Ekstrak nama, email, dan status dari teks berikut: ..."
}
],
"reasoning_effort": "xhigh"
}
Gunakan prompt identik saat membandingkannya dengan Qwen3.7-Max, Kimi K3, Claude, atau GPT.
Langkah 2: gunakan prompt produksi, bukan prompt demo
Kumpulkan 20–30 prompt yang mewakili traffic nyata, misalnya:
- ekstraksi data dari dokumen
- klasifikasi tiket
- pembuatan JSON terstruktur
- tool calling
- perbaikan kode
- analisis log
- ringkasan dokumen panjang
Pisahkan prompt berdasarkan use case agar Anda tahu model mana yang unggul untuk pekerjaan tertentu.
Langkah 3: tambahkan asersi yang dapat diuji
Jangan hanya membandingkan kualitas secara subjektif. Tambahkan asersi yang mencerminkan kebutuhan aplikasi Anda:
- respons adalah JSON valid
- field wajib tersedia
- nilai enum sesuai skema
- tidak ada markdown tambahan
- latensi di bawah batas yang Anda tentukan
- respons tidak kosong
- tool call memiliki parameter lengkap
Contoh asersi konseptual:
status_code == 200
response_time < 5000ms
response.body dapat di-parse sebagai JSON
response.body.customer_id tidak kosong
response.body.status termasuk ["open", "closed", "pending"]
Langkah 4: ukur biaya, latensi, dan tingkat keberhasilan
Qwen 3.8-Max menggunakan default reasoning_effort: xhigh. Karena itu, uji konfigurasi reasoning yang benar-benar akan dipakai di produksi.
Bandingkan setidaknya:
| Metrik | Yang diukur |
|---|---|
| Tingkat kelulusan | Berapa banyak test case memenuhi asersi |
| Latensi median | Waktu respons tipikal |
| Latensi p95 | Respons lambat pada kondisi buruk |
| Token input/output | Estimasi biaya |
| Validitas format | JSON, skema, tool call, atau output terstruktur |
| Kualitas domain | Akurasi terhadap label atau expected output |
Langkah 5: uji endpoint Anthropic secara terpisah
Jika Anda menggunakan endpoint yang kompatibel dengan Anthropic, uji protokol itu secara terpisah dari endpoint OpenAI-compatible. Ini relevan karena sebagian besar benchmark coding Alibaba sendiri menggunakan harness Claude Code dengan jalur kompatibilitas Anthropic.
Dengan Apidog, Anda dapat menyimpan endpoint sebagai environment, membuat skenario uji untuk setiap model, lalu membandingkan tingkat kelulusan dan waktu respons secara berdampingan. Unduh Apidog secara gratis untuk menjalankan evaluasi API berbasis workload Anda sendiri.
Pertanyaan yang sering diajukan
Apakah benchmark Qwen 3.8 sudah diverifikasi secara independen?
Belum. Per 3 Agustus 2026, angka yang tersedia berasal dari tabel Alibaba sendiri. Artificial Analysis dan leaderboard komunitas belum menilai Qwen 3.8-Max pada saat penulisan.
Apa hasil benchmark terbaik Qwen 3.8-Max?
Pada tabel teks, hasil terbaiknya adalah PaperBench dengan skor 93.0. Pada tabel multimodal, MathVision dengan 95.2 dan sejumlah hasil OCR adalah yang paling menonjol.
Di mana Qwen 3.8-Max paling jelas kalah?
Qwen 3.8-Max mendapat 43.6 pada HLE, berada di bawah Fable 5, GPT-5.6 Sol, dan Claude Opus 4.8. Pada SWE-bench Pro, skor 67.7 juga tertinggal dari Fable 5 yang mendapat 80.0.
Seberapa besar peningkatan dari Qwen3.7-Max?
Menurut tabel Alibaba:
- Terminal Bench 2.1: 74.5 → 86.6
- SWE-bench Pro: 60.6 → 67.7
- PaperBench: 64.8 → 93.0
Namun, keputusan migrasi tetap harus mempertimbangkan harga, latensi, modalitas, dan hasil pada workload Anda. Untuk pembahasan lebih lengkap, lihat perbandingan Qwen 3.8 vs Qwen 3.7.

Top comments (0)