DEV Community

Cover image for Apa Itu Qwen 3.8-Max
Walse
Walse

Posted on • Originally published at apidog.com

Apa Itu Qwen 3.8-Max

Alibaba secara resmi merilis Qwen 3.8-Max pada awal Agustus 2026. Model ini menggabungkan arsitektur Mixture-of-Experts (MoE) dengan total 2,4 triliun parameter, tetapi hanya mengaktifkan 95 miliar parameter per token. Model menawarkan konteks hingga 1 juta token, harga tetap $2 input/$6 output per 1 juta token, serta janji publikasi bobot di Hugging Face dan ModelScope dalam waktu sekitar seminggu. Ini penting karena belum ada model kelas Qwen-Max yang sebelumnya meluncurkan bobot terbuka.

Coba Apidog hari ini

Pengumuman resmi menyebut Qwen 3.8-Max sebagai Qwen paling mumpuni sejauh ini. Benchmark vendor menunjukkan hasil kuat pada tugas agen, dokumen, dan multimodal, tetapi juga menunjukkan kekalahan yang jelas pada beberapa benchmark pengkodean inti. Artikel ini membahas spesifikasi, benchmark, harga, serta cara menguji API yang kompatibel dengan OpenAI dan Anthropic menggunakan klien seperti Apidog.

Qwen 3.8-Max sekilas

Spesifikasi Qwen 3.8-Max
Pengembang Alibaba (tim Qwen)
Rilis Awal Agustus 2026 (GA di Model Studio, 3 Agustus)
Arsitektur MoE, dibangun di atas fondasi Qwen 3.5
Total parameter 2.4T
Parameter aktif 95B (~4% aktivasi)
Jendela konteks 1.000.000 token
Output maksimal 65.536 token
Modalitas Input teks + gambar, output teks
Kontrol penalaran reasoning_effort: xhigh (standar), medium, low
ID model API qwen3.8-max
Harga $2 input / $6 output per 1M token, tetap di seluruh konteks penuh
Bobot terbuka Dijanjikan untuk minggu berikutnya (~10 Agustus); belum dapat diunduh per awal Agustus 2026
Protokol API Kompatibel dengan OpenAI dan Anthropic

Spesifikasi dan harga tersebut berasal dari materi rilis Alibaba serta halaman harga Model Studio.

Apa itu Qwen 3.8-Max?

Qwen 3.8-Max adalah model unggulan baru keluarga Qwen Alibaba yang dibangun di atas fondasi Qwen 3.5. Model ini menggantikan Qwen3.7-Max di lini teratas.

Menurut tabel vendor, peningkatannya terhadap Qwen3.7-Max terlihat pada beberapa benchmark:

  • Terminal Bench 2.1: dari 74,5 menjadi 86,6.
  • PaperBench: dari 64,8 menjadi 93,0.

Jika Anda sedang mempertimbangkan migrasi dari model sebelumnya, lihat perbandingan Qwen 3.8 vs Qwen 3.7 Max.

Diagram Qwen 3.8-Max

Karakteristik utama model ini adalah rasio parameter aktifnya. Meski memiliki total 2,4T parameter, hanya 95B parameter yang aktif pada setiap forward pass. Aktivasi sekitar 4% ini membantu Alibaba menyajikan model besar dengan harga $2/$6 per 1 juta token.

Sebagai pembanding, Kimi K3 memiliki total 2,8T parameter dengan 104B parameter aktif. Jadi, Qwen 3.8-Max lebih kecil pada total maupun parameter aktif.

Di API, Qwen 3.8-Max menerima input teks dan gambar serta menghasilkan teks. Alibaba juga mendemonstrasikan pemahaman PDF lebih dari 200 halaman dan video 100 jam melalui pendekatan yang disebut memory graph. Namun, konfigurasi API yang dipublikasikan hanya mencantumkan teks dan gambar sebagai modalitas input.

Gunakan parameter berikut untuk mengontrol penalaran:

{
  "reasoning_effort": "xhigh"
}
Enter fullscreen mode Exit fullscreen mode

Level yang tersedia:

  • xhigh: standar, penalaran paling intensif.
  • medium: kompromi antara latensi dan kualitas.
  • low: untuk respons yang lebih cepat.

Alibaba juga menyediakan enable_thinking dan preserve_thinking. Secara default, thinking dipertahankan. Perhatikan implikasi biaya: token berpikir dihitung sebagai token output, sehingga penggunaan xhigh dapat meningkatkan tagihan aktual.

Qwen kelas Max dengan bobot terbuka pertama

Alibaba telah merilis banyak model Qwen sebagai sumber terbuka, tetapi belum pernah untuk kelas Max. Qwen 3.8-Max dijanjikan akan tersedia di Hugging Face dan ModelScope “minggu depan”, kira-kira sekitar 10 Agustus 2026.

Ada dua hal yang perlu diperhatikan sebelum merencanakan self-hosting.

  1. Bobot belum tersedia untuk diunduh.

    Per awal Agustus 2026, ini masih berupa janji rilis. Kimi K3 menjadi contoh bahwa publikasi bobot dapat terjadi beberapa hari setelah peluncuran.

  2. Self-hosting model 2,4T membutuhkan infrastruktur multi-node.

    Bahkan dengan kuantisasi agresif, model ini tidak realistis dijalankan pada workstation biasa. Untuk sebagian besar tim, bobot terbuka lebih mungkin berarti akses melalui penyedia hosting pihak ketiga, bukan deployment lokal.

Jika tujuan Anda adalah mencoba model tanpa membayar harga daftar, gunakan Qwen Chat atau kuota gratis Model Studio. Lihat panduan cara menggunakan Qwen 3.8 secara gratis.

Apa yang ditunjukkan benchmark, termasuk kekalahan

Alibaba membandingkan Qwen 3.8-Max dengan Claude Opus 4.8, Fable 5, GPT-5.6 Sol, dan Qwen3.7-Max.

Sebelum memakai angka ini untuk memilih model, ingat dua hal:

  • Hasil benchmark dijalankan oleh vendor.
  • Sebagian besar benchmark pengkodean memakai Claude Code harness untuk semua model.
  • Beberapa benchmark, seperti QwenSWEBench, QwenQoderBench, CoWorkBench, dan RecreationBench, dibuat secara internal oleh Alibaba.
  • Tidak ada angka independen dari outlet seperti Artificial Analysis pada saat penulisan.

Area keunggulan

  • PaperBench: 93,0

    Mengungguli GPT-5.6 Sol (90,5), Fable 5 (88,8), dan Opus 4.8 (80,3).

  • IFBench: 82,8

    Skor tertinggi pada tabel tersebut, di atas Sol yang mencapai 72,7.

  • Terminal Bench 2.1: 86,6

    Mengalahkan Opus 4.8 dan Fable 5 yang masing-masing mencetak 84,6, tetapi masih di bawah Sol dengan 88,8.

  • Multimodal dan dokumen

    Model mencatat MathVision 95,2, LogicVista 91,9, OSWorld-Verified 86,1, serta skor OCR yang memimpin hampir seluruh tabel vendor.

Area kelemahan

  • SWE-bench Pro: 67,7

    Di bawah Fable 5 (80,0) dan sedikit di bawah Opus 4.8 (69,2), walau masih melampaui Sol (64,6).

  • HLE: 43,6

    Di bawah Fable 5 (53,3), Sol (47,2), dan Opus 4.8 (45,7).

Ringkasnya, menurut angka Alibaba sendiri:

  • Qwen 3.8-Max mengalahkan Opus 4.8 pada beberapa tugas agen.
  • Fable 5 masih unggul pada sebagian besar pekerjaan pengkodean inti.
  • Qwen 3.8-Max tampak kuat untuk dokumen panjang dan tugas multimodal.
  • Pada GPQA Diamond, Qwen mencetak 92,6, setara dengan Fable 5 dan sedikit di bawah Sol yang mencapai 94,1.

Untuk rincian tabel, harness, dan aspek yang perlu diverifikasi secara independen, baca uraian benchmark Qwen 3.8.

Alibaba juga mendemonstrasikan sesi pengkodean otonom selama 16 hari pada repositori publik, dengan 265 commit dan 127 pull request. Demo lain mencakup reproduksi makalah serta entri kompetisi Tianchi. Perlakukan seluruhnya sebagai demonstrasi vendor, bukan evaluasi terkontrol.

Untuk fokus penggunaan coding, lihat Qwen 3.8 untuk pengkodean.

Posisi dibandingkan Kimi K3, Fable 5, dan GPT-5.6 Sol

Vs Kimi K3

Qwen 3.8-Max dan Kimi K3 adalah pembanding alami: keduanya model MoE besar dari lab Tiongkok dan sama-sama terkait dengan bobot terbuka.

Aspek Qwen 3.8-Max Kimi K3
Total parameter 2.4T 2.8T
Parameter aktif 95B 104B
Modalitas Teks + gambar Teks
Harga input $2 / 1M token $3 / 1M token
Harga output $6 / 1M token $15 / 1M token
Cache hit 10% dari tarif input $0,30
Bobot Dijanjikan Sudah tersedia

Belum ada evaluasi langsung yang independen. Untuk perbandingan lebih rinci, baca Qwen 3.8 vs Kimi K3. Jika belum familiar dengan model Moonshot, mulai dari apa itu Kimi K3.

Vs Fable 5

Fable 5 tetap menjadi target utama untuk pengkodean. Berdasarkan tabel Alibaba, Qwen 3.8-Max belum mengalahkannya pada benchmark inti:

  • SWE-bench Pro: 67,7 vs 80,0.
  • HLE: 43,6 vs 53,3.

Sebagai gantinya, Qwen menawarkan harga yang lebih rendah, konteks 1 juta token, bobot terbuka yang dijanjikan, serta hasil multimodal yang lebih kuat.

Vs GPT-5.6 Sol

GPT-5.6 Sol unggul pada:

  • Terminal Bench: 88,8 vs 86,6.
  • GPQA: 94,1 vs 92,6.
  • HLE: 47,2 vs 43,6.

Qwen 3.8-Max unggul pada:

  • PaperBench: 93,0 vs 90,5.
  • IFBench: 82,8 vs 72,7.

Dari sisi harga, Qwen $2/$6 lebih murah untuk output dibandingkan $2/$12 pada GPT-5.6 Terra, sementara akses tingkat Sol masih lebih mahal.

Claude Opus 5 juga tercantum pada harga $5/$25. Untuk workload bervolume tinggi, harga Qwen dapat mengubah perhitungan biaya secara signifikan.

Harga: $2/$6 tetap di seluruh 1M token

Harga Qwen 3.8-Max adalah:

  • $2 per 1 juta token input
  • $6 per 1 juta token output
  • Satu tingkat harga dari token pertama hingga konteks 1 juta token
  • Tarif yang sama untuk mode berpikir dan tidak berpikir

Model konteks panjang biasanya menaikkan tarif ketika prompt semakin besar. Qwen 3.8-Max tidak melakukan itu.

Model ini juga diluncurkan dengan harga lebih murah dibanding harga daftar Qwen3.7-Max, yaitu $2,5/$7,5. Namun, Qwen3.7-Max saat ini memiliki promosi 50% menjadi $1,25/$3,75, sehingga masih relevan sebagai pilihan yang lebih hemat.

Untuk workload dengan awalan prompt berulang:

  • Cache hit ditagih 10% dari tarif input.
  • Pembuatan cache eksplisit ditagih 125%.
  • Kuota gratis tersedia sebesar 1 juta token, hanya di wilayah Singapura, dan berlaku 90 hari.

Untuk contoh biaya per tugas dan dampak token berpikir, lihat panduan harga Qwen 3.8.

Cara mengakses Qwen 3.8-Max

Ada lima jalur akses utama.

1. Qwen Chat

Gunakan aplikasi konsumen Qwen Chat jika Anda ingin menguji kemampuan model tanpa menyiapkan API key. Ini adalah cara tercepat untuk mencoba prompt, dokumen, atau tugas reasoning.

2. API Alibaba Cloud Model Studio

Dapatkan kunci dari home.qwencloud.com, lalu simpan sebagai environment variable:

export DASHSCOPE_API_KEY="YOUR_API_KEY"
Enter fullscreen mode Exit fullscreen mode

Gunakan model ID:

qwen3.8-max
Enter fullscreen mode Exit fullscreen mode

Endpoint regional yang tersedia:

Beijing:
https://dashscope.aliyuncs.com/compatible-mode/v1

Singapura:
https://dashscope-intl.aliyuncs.com/compatible-mode/v1

AS-Virginia:
https://dashscope-us.aliyuncs.com/compatible-mode/v1
Enter fullscreen mode Exit fullscreen mode

Model ini dapat dipanggil melalui endpoint yang kompatibel dengan OpenAI. Contoh curl:

curl https://dashscope-intl.aliyuncs.com/compatible-mode/v1/chat/completions \
  -H "Authorization: Bearer $DASHSCOPE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.8-max",
    "messages": [
      {
        "role": "user",
        "content": "Jelaskan cara menerapkan rate limiting pada API Node.js."
      }
    ],
    "reasoning_effort": "medium"
  }'
Enter fullscreen mode Exit fullscreen mode

Halaman model Model Studio mencantumkan Qwen 3.8-Max pada daftar model yang direkomendasikan.

3. Endpoint kompatibel dengan Anthropic

Alibaba juga menyediakan endpoint yang berbicara dengan protokol Messages Anthropic:

https://dashscope-intl.aliyuncs.com/apps/anthropic
Enter fullscreen mode Exit fullscreen mode

Ini berguna bila tool Anda sudah dibangun untuk ekosistem Claude. Anda dapat mengarahkan base URL dan model ke Qwen tanpa menulis ulang seluruh integrasi.

4. Harness pengkodean

Alibaba menerbitkan konfigurasi untuk:

  • Claude Code
  • Codex
  • Qoder
  • Qwen Code
  • OpenClaw

Untuk Claude Code, konsep konfigurasi utamanya adalah:

export ANTHROPIC_BASE_URL="https://dashscope-intl.aliyuncs.com/apps/anthropic"
export ANTHROPIC_MODEL="qwen3.8-max"
Enter fullscreen mode Exit fullscreen mode

Alibaba menggunakan Claude Code harness untuk sebagian besar benchmark pengkodeannya. Jadi, konfigurasi ini relevan jika Anda ingin menguji model dalam lingkungan yang serupa dengan evaluasi vendor.

5. Bobot terbuka

Bobot untuk Hugging Face dan ModelScope dijanjikan segera setelah peluncuran, tetapi belum dapat diunduh per awal Agustus 2026.

Untuk panduan lebih lengkap, termasuk Python dan curl, lihat panduan API Qwen 3.8.

Menguji API dual-protokol

Karena model yang sama tersedia melalui protokol kompatibel OpenAI dan Anthropic, uji keduanya menggunakan prompt, parameter, dan dataset evaluasi yang sama.

Checklist pengujian praktis:

  1. Simpan endpoint Beijing, Singapura, dan AS-Virginia sebagai environment terpisah.
  2. Kirim prompt identik melalui endpoint OpenAI-compatible dan Anthropic-compatible.
  3. Bandingkan output, latensi, error rate, dan konsumsi token.
  4. Uji reasoning_effort pada low, medium, dan xhigh.
  5. Jika memakai streaming, periksa apakah delta reasoning_content muncul sebelum respons akhir.
  6. Catat token reasoning sebagai bagian dari estimasi biaya output.

Di Apidog, Anda dapat menyimpan URL dasar regional sebagai environment, berpindah wilayah tanpa mengubah request, dan membandingkan endpoint OpenAI dengan endpoint Anthropic secara berdampingan. Anda juga dapat menguji qwen3.8-max, qwen3.7-max, dan kimi-k3 menggunakan prompt yang identik sebelum memindahkan workload produksi.

Unduh Apidog jika Anda ingin menguji endpoint dan menyimpan koleksi request dalam satu workspace.

Posisi Qwen 3.8-Max dalam jajaran produk

Qwen 3.8-Max berada di atas Qwen3.7-Max dan model tingkat plus.

Panduan praktis untuk memilih model:

  • Gunakan Qwen 3.8-Max untuk tugas agen tingkat tinggi, dokumen panjang, dan input multimodal.
  • Gunakan Qwen3.7-Max ketika promosi 50% masih aktif dan biaya menjadi prioritas.
  • Gunakan model plus untuk tugas rutin dengan volume tinggi dan kebutuhan kemampuan yang lebih ringan.

Untuk peta model yang lebih lengkap, lihat panduan model Qwen terbaik.

FAQ

Apakah Qwen 3.8 sumber terbuka?

Belum, tetapi Alibaba menjanjikan bobot untuk Hugging Face dan ModelScope “minggu depan” dari peluncuran awal Agustus 2026. Jika rilis terjadi, ini akan menjadi Qwen kelas Max pertama dengan bobot terbuka.

Sampai saat itu, gunakan API atau Qwen Chat. Untuk opsi tanpa biaya, baca cara menggunakan Qwen 3.8 secara gratis.

Berapa harga Qwen 3.8-Max?

$2 per 1 juta token input dan $6 per 1 juta token output, dengan harga tetap hingga konteks 1 juta token.

Cache hit ditagih 10% dari tarif input. Token berpikir dihitung sebagai output, sehingga workload dengan reasoning_effort: "xhigh" membutuhkan anggaran lebih tinggi daripada harga stiker sederhana.

Apakah Qwen 3.8-Max lebih baik dari Kimi K3?

Belum ada evaluasi langsung yang independen. Di atas kertas, Qwen 3.8-Max lebih kecil (2,4T/95B aktif vs 2,8T/104B), mendukung input multimodal, dan lebih murah untuk output ($6 vs $15 per 1 juta token).

Keunggulan Kimi K3 saat ini adalah bobotnya sudah tersedia secara publik.

Bisakah saya menggunakan Qwen 3.8-Max di Claude Code?

Ya. Gunakan endpoint DashScope kompatibel Anthropic sebagai ANTHROPIC_BASE_URL, lalu atur:

export ANTHROPIC_MODEL="qwen3.8-max"
Enter fullscreen mode Exit fullscreen mode

Alibaba juga menyediakan konfigurasi untuk Codex, Qoder, Qwen Code, dan OpenClaw.

Apa yang harus dilakukan selanjutnya

Qwen 3.8-Max adalah rilis produksi dengan ketersediaan API di tiga wilayah, harga yang dipublikasikan, benchmark vendor lengkap, dan bobot terbuka yang dijanjikan segera.

Jangan memilih model hanya dari tabel benchmark. Jalankan evaluasi pada workload Anda sendiri:

  1. Ambil kuota gratis.
  2. Siapkan endpoint OpenAI-compatible dan Anthropic-compatible.
  3. Buat kumpulan prompt dari kasus produksi nyata.
  4. Bandingkan kualitas, latensi, token output, serta biaya reasoning.
  5. Uji model terhadap Qwen3.7-Max atau Kimi K3 pada input yang sama.
  6. Periksa kembali status bobot terbuka sekitar 10 Agustus.

Mulai dari panduan pengaturan API Qwen 3.8.

Top comments (0)