DEV Community

Cover image for Hasil Benchmark Qwen 3.8: Mengungkap Data Alibaba dan Keterbatasannya
Walse
Walse

Posted on • Originally published at apidog.com

Hasil Benchmark Qwen 3.8: Mengungkap Data Alibaba dan Keterbatasannya

Selama dua minggu, cerita Qwen 3.8 memiliki celah: pratinjau pers bulan Juli menjanjikan model kelas perintis, tetapi tanpa skor benchmark. Akibatnya, ulasan awal banyak bertumpu pada spekulasi. Pada 3 Agustus 2026, Alibaba merilis tabel benchmark lengkap untuk Qwen 3.8-Max, membandingkannya dengan Claude Opus 4.8, Fable 5, GPT-5.6 Sol, dan Qwen3.7-Max, serta tabel multimodal terpisah melawan Gemini 3.1 Pro dan GPT-5.6 Sol di pos rilis resmi.

Coba Apidog hari ini

Tabel tersebut perlu dibaca secara kritis: ada kemenangan nyata, kekalahan yang juga nyata, serta detail metodologi yang memengaruhi interpretasi hasil. Artikel ini merangkum angka penting dan menunjukkan cara memvalidasinya dengan evaluasi API Anda sendiri. Untuk parameter, harga, dan akses model, baca penjelasan Qwen 3.8-Max.

Catatan penting: semua skor berikut berasal dari tabel yang diterbitkan Alibaba sendiri, dengan catatan kaki bertanggal 3 Agustus 2026. Belum ada evaluasi independen pada saat penulisan.

Tabel benchmark utama

Berikut baris model teks utama yang dipublikasikan Alibaba. Semua benchmark menggunakan metrik “semakin tinggi semakin baik”.

Benchmark Qwen 3.8-Max Claude Opus 4.8 Fable 5 GPT-5.6 Sol Qwen3.7-Max
Terminal Bench 2.1 86.6 84.6 84.6 88.8 74.5
SWE-bench Pro 67.7 69.2 80.0 64.6 60.6
PaperBench 93.0 80.3 88.8 90.5 64.8
GPQA Diamond 92.6 92.0 92.6 94.1 92.4
IFBench 82.8 62.2 63.5 72.7 79.1
HLE (Humanity’s Last Exam) 43.6 45.7 53.3 47.2 41.4

Sumber: tabel benchmark yang dijalankan oleh Alibaba.

Tabel benchmark Qwen 3.8-Max

Di mana Qwen 3.8-Max unggul

PaperBench: hasil paling menonjol

Pada PaperBench, Qwen 3.8-Max memperoleh 93.0:

  • GPT-5.6 Sol: 90.5
  • Fable 5: 88.8
  • Claude Opus 4.8: 80.3
  • Qwen3.7-Max: 64.8

PaperBench menguji kemampuan model untuk mereproduksi hasil makalah penelitian. Kenaikan dari 64.8 ke 93.0 dibanding generasi sebelumnya sangat besar. Namun, karena hasil ini masih berasal dari vendor, gunakan sebagai sinyal awal—bukan bukti final—sampai ada pengujian independen.

IFBench: kepatuhan instruksi

Qwen 3.8-Max mencetak 82.8 di IFBench, unggul atas:

  • GPT-5.6 Sol: 72.7
  • Fable 5: 63.5
  • Claude Opus 4.8: 62.2

Qwen3.7-Max juga sudah kuat pada benchmark ini dengan skor 79.1. Artinya, kepatuhan instruksi tampak sebagai kekuatan yang konsisten pada lini Qwen, bukan hanya hasil satu rilis.

Untuk developer, ini relevan bila aplikasi Anda bergantung pada output yang harus mengikuti format ketat, misalnya:

  • JSON tervalidasi
  • skema respons tertentu
  • field wajib
  • aturan tool calling
  • instruksi multi-langkah

Terminal Bench 2.1: di atas Claude, di bawah GPT

Pada Terminal Bench 2.1, Qwen 3.8-Max mendapat 86.6:

  • GPT-5.6 Sol: 88.8
  • Qwen 3.8-Max: 86.6
  • Claude Opus 4.8: 84.6
  • Fable 5: 84.6

Ini bukan kemenangan mutlak karena GPT-5.6 Sol masih memimpin. Namun, Qwen berada dua poin di atas Opus 4.8 dan Fable 5 pada benchmark terminal berbasis agen.

Multimodal dan inteligensi dokumen

Dalam tabel multimodal terpisah, Alibaba melaporkan:

  • MathVision: 95.2
  • LogicVista: 91.9
  • OSWorld-Verified: 86.1
  • Memimpin hampir semua baris OCR

Perlu dicatat bahwa Opus 4.8 dan Fable 5 tidak dibandingkan langsung dalam tabel multimodal tersebut. Karena itu, kemenangan Qwen pada bagian ini harus dibaca dalam konteks lawan yang tersedia: Gemini 3.1 Pro dan GPT-5.6 Sol.

Jika Anda mengevaluasi model untuk OCR, pemahaman dokumen, atau penalaran visual, bandingkan langsung dengan workload Anda. Untuk perbandingan dengan model open-weight lain, lihat Qwen 3.8 vs Kimi K3.

Di mana Qwen 3.8-Max kalah

Alibaba juga mempublikasikan area di mana Qwen 3.8-Max tidak memimpin. Ini penting saat memilih model untuk coding agent atau tugas penalaran umum.

HLE: tertinggal jauh dari Fable 5

Pada Humanity’s Last Exam (HLE), Qwen 3.8-Max mendapat 43.6:

  • Fable 5: 53.3
  • GPT-5.6 Sol: 47.2
  • Claude Opus 4.8: 45.7
  • Qwen 3.8-Max: 43.6

Qwen memang meningkat dari Qwen3.7-Max yang mendapat 41.4, tetapi kenaikannya kecil. Pada tabel ini, HLE adalah salah satu indikator paling jelas bahwa Qwen 3.8-Max belum memimpin pada pengetahuan luas dan penalaran frontier.

SWE-bench Pro: tertinggal pada rekayasa perangkat lunak

Pada SWE-bench Pro:

  • Fable 5: 80.0
  • Claude Opus 4.8: 69.2
  • Qwen 3.8-Max: 67.7
  • GPT-5.6 Sol: 64.6
  • Qwen3.7-Max: 60.6

Qwen 3.8-Max mengalami peningkatan generasi yang nyata, dari 60.6 ke 67.7. Namun, ia masih tertinggal 12.3 poin dari Fable 5 pada benchmark rekayasa perangkat lunak yang lebih sulit.

DeepSWE dan tugas agen yang kompleks

Dalam baris DeepSWE, Qwen 3.8-Max juga tertinggal dari model frontier. Polanya cukup konsisten:

  • Kompetitif pada tugas agen berbasis terminal.
  • Lebih lemah pada evaluasi rekayasa perangkat lunak yang mendalam.
  • Kuat untuk multimodal dan inteligensi dokumen.

Ringkasnya, Qwen 3.8-Max menawarkan hasil kuat untuk harga $2 input dan $6 output per satu juta token, menurut halaman harga resmi. Namun, tabel ini tidak menunjukkan kemenangan menyeluruh pada semua kategori.

Empat detail metodologi yang perlu diperiksa

Jangan hanya membaca kolom skor. Baca juga bagaimana skor itu dibuat.

1. Semua angka dijalankan oleh vendor

Alibaba mengevaluasi model sendiri sekaligus model pesaing. Ini umum dalam peluncuran model, tetapi berarti vendor menentukan:

  • versi benchmark
  • strategi prompting
  • parameter sampling
  • kebijakan retry
  • konfigurasi tool atau harness

Hal tersebut bukan otomatis berarti hasilnya salah. Namun, hasil itu tetap merupakan klaim vendor, bukan pengukuran independen.

2. Banyak benchmark coding menggunakan Claude Code

Alibaba menjalankan sebagian besar benchmark coding dengan Claude Code, yaitu harness agen Anthropic, lalu mengarahkan Qwen 3.8-Max melalui API yang kompatibel dengan Anthropic.

Ini memiliki dua implikasi:

  1. Semua model diuji dalam tool yang sama, sehingga pendekatannya relatif konsisten.
  2. Skor tersebut lebih tepat dibaca sebagai performa “Qwen di dalam harness Claude Code”, bukan performa Qwen dalam setiap setup agen yang mungkin.

Harness dapat memengaruhi performa agen beberapa poin. Jika stack Anda memakai Cursor, OpenAI SDK, framework internal, atau orchestrator lain, jangan mengasumsikan hasilnya akan identik.

3. Sejumlah benchmark dibuat oleh tim Qwen

QwenSWEBench, QwenQoderBench, CoWorkBench, dan RecreationBench dibuat oleh tim Qwen.

Benchmark internal tetap berguna karena dapat mengukur kemampuan yang tidak tertangkap benchmark publik. Namun, skor tinggi pada benchmark internal tidak memiliki bobot evidensi yang sama dengan skor tinggi pada benchmark publik seperti SWE-bench Pro.

Saat membaca tabel vendor, pisahkan benchmark ke dua kelompok:

  • Benchmark publik: dapat diuji ulang oleh pihak lain.
  • Benchmark internal: relevan, tetapi perlu validasi tambahan.

4. Catatan kaki Fable 5

Tabel Alibaba memuat catatan bahwa hasil Fable 5 “mungkin melibatkan fallback”.

Artinya, setidaknya satu kolom kompetitor mungkin tidak mencerminkan model yang berjalan secara konsisten tanpa fallback. Detail seperti ini dapat mengubah interpretasi hasil, terutama ketika selisih skor kecil.

Pola ini tidak unik untuk Alibaba. Anthropic, OpenAI, dan Google juga menerbitkan tabel yang dijalankan sendiri dengan pilihan metodologi masing-masing. Pola serupa juga muncul dalam analisis benchmark Kimi K3.

Intinya: tabel vendor adalah klaim yang perlu diuji, bukan ukuran final performa model.

Cara membaca tabel benchmark vendor berikutnya

Gunakan daftar periksa ini sebelum menjadikan benchmark sebagai dasar keputusan arsitektur.

  1. Siapa yang menjalankan evaluasi?

    Bedakan hasil dari vendor, lab independen, dan leaderboard komunitas.

  2. Harness dan konfigurasi apa yang dipakai?

    Benchmark agen sangat sensitif terhadap tool, prompt, retry, timeout, dan strategi sampling.

  3. Apakah benchmark dibuat oleh vendor?

    Benchmark internal dapat berguna, tetapi jangan samakan langsung dengan benchmark publik.

  4. Apakah ada catatan kaki?

    Detail seperti fallback, versi model, atau kebijakan retry bisa mengubah kesimpulan.

  5. Benchmark apa yang tidak ditampilkan?

    Ketiadaan baris tertentu bisa sama informatifnya dengan angka yang dipublikasikan. Bandingkan dengan perbandingan generasi sebelumnya lintas vendor.

  6. Apakah sudah ada sumber kedua?

    Tunggu evaluasi independen sebelum mengambil keputusan besar untuk migrasi model.

Per 3 Agustus 2026, Artificial Analysis dan leaderboard komunitas belum menerbitkan hasil untuk Qwen 3.8-Max. Perbedaan antara tabel Alibaba dan hasil independen nantinya akan menjadi data yang lebih penting.

Jalankan evaluasi Anda sendiri

Cara paling praktis untuk memilih model adalah menguji prompt produksi Anda sendiri.

Qwen 3.8-Max tersedia melalui Alibaba Cloud Model Studio dengan ID model qwen3.8-max, sebagaimana tercantum pada halaman model resmi. API-nya kompatibel dengan OpenAI dan Anthropic.

Langkah 1: siapkan request baseline

Buat request yang sama untuk Qwen 3.8-Max dan model baseline Anda saat ini.

Contoh payload chat completions:

{
  "model": "qwen3.8-max",
  "messages": [
    {
      "role": "system",
      "content": "Anda adalah asisten yang selalu mengembalikan JSON valid."
    },
    {
      "role": "user",
      "content": "Ekstrak nama, email, dan status dari teks berikut: ..."
    }
  ],
  "reasoning_effort": "xhigh"
}
Enter fullscreen mode Exit fullscreen mode

Gunakan prompt identik saat membandingkannya dengan Qwen3.7-Max, Kimi K3, Claude, atau GPT.

Langkah 2: gunakan prompt produksi, bukan prompt demo

Kumpulkan 20–30 prompt yang mewakili traffic nyata, misalnya:

  • ekstraksi data dari dokumen
  • klasifikasi tiket
  • pembuatan JSON terstruktur
  • tool calling
  • perbaikan kode
  • analisis log
  • ringkasan dokumen panjang

Pisahkan prompt berdasarkan use case agar Anda tahu model mana yang unggul untuk pekerjaan tertentu.

Langkah 3: tambahkan asersi yang dapat diuji

Jangan hanya membandingkan kualitas secara subjektif. Tambahkan asersi yang mencerminkan kebutuhan aplikasi Anda:

  • respons adalah JSON valid
  • field wajib tersedia
  • nilai enum sesuai skema
  • tidak ada markdown tambahan
  • latensi di bawah batas yang Anda tentukan
  • respons tidak kosong
  • tool call memiliki parameter lengkap

Contoh asersi konseptual:

status_code == 200
response_time < 5000ms
response.body dapat di-parse sebagai JSON
response.body.customer_id tidak kosong
response.body.status termasuk ["open", "closed", "pending"]
Enter fullscreen mode Exit fullscreen mode

Langkah 4: ukur biaya, latensi, dan tingkat keberhasilan

Qwen 3.8-Max menggunakan default reasoning_effort: xhigh. Karena itu, uji konfigurasi reasoning yang benar-benar akan dipakai di produksi.

Bandingkan setidaknya:

Metrik Yang diukur
Tingkat kelulusan Berapa banyak test case memenuhi asersi
Latensi median Waktu respons tipikal
Latensi p95 Respons lambat pada kondisi buruk
Token input/output Estimasi biaya
Validitas format JSON, skema, tool call, atau output terstruktur
Kualitas domain Akurasi terhadap label atau expected output

Langkah 5: uji endpoint Anthropic secara terpisah

Jika Anda menggunakan endpoint yang kompatibel dengan Anthropic, uji protokol itu secara terpisah dari endpoint OpenAI-compatible. Ini relevan karena sebagian besar benchmark coding Alibaba sendiri menggunakan harness Claude Code dengan jalur kompatibilitas Anthropic.

Dengan Apidog, Anda dapat menyimpan endpoint sebagai environment, membuat skenario uji untuk setiap model, lalu membandingkan tingkat kelulusan dan waktu respons secara berdampingan. Unduh Apidog secara gratis untuk menjalankan evaluasi API berbasis workload Anda sendiri.

Pertanyaan yang sering diajukan

Apakah benchmark Qwen 3.8 sudah diverifikasi secara independen?

Belum. Per 3 Agustus 2026, angka yang tersedia berasal dari tabel Alibaba sendiri. Artificial Analysis dan leaderboard komunitas belum menilai Qwen 3.8-Max pada saat penulisan.

Apa hasil benchmark terbaik Qwen 3.8-Max?

Pada tabel teks, hasil terbaiknya adalah PaperBench dengan skor 93.0. Pada tabel multimodal, MathVision dengan 95.2 dan sejumlah hasil OCR adalah yang paling menonjol.

Di mana Qwen 3.8-Max paling jelas kalah?

Qwen 3.8-Max mendapat 43.6 pada HLE, berada di bawah Fable 5, GPT-5.6 Sol, dan Claude Opus 4.8. Pada SWE-bench Pro, skor 67.7 juga tertinggal dari Fable 5 yang mendapat 80.0.

Seberapa besar peningkatan dari Qwen3.7-Max?

Menurut tabel Alibaba:

  • Terminal Bench 2.1: 74.5 → 86.6
  • SWE-bench Pro: 60.6 → 67.7
  • PaperBench: 64.8 → 93.0

Namun, keputusan migrasi tetap harus mempertimbangkan harga, latensi, modalitas, dan hasil pada workload Anda. Untuk pembahasan lebih lengkap, lihat perbandingan Qwen 3.8 vs Qwen 3.7.

Top comments (0)