DEV Community

Cover image for Qwen 3.8 vs Kimi K3: Perbandingan Dua Raksasa Model AI Terbuka Tiongkok
Walse
Walse

Posted on • Originally published at apidog.com

Qwen 3.8 vs Kimi K3: Perbandingan Dua Raksasa Model AI Terbuka Tiongkok

Juli 2026 menjadi bulan persaingan dua kuda untuk model frontier berbobot terbuka, dan keduanya berasal dari Tiongkok. Moonshot AI meluncurkan Kimi K3 pada 16 Juli, lalu Alibaba memperkenalkan pratinjau Qwen 3.8-Max tiga hari kemudian dan menyediakannya secara umum pada awal Agustus. Keduanya adalah model mixture-of-experts (MoE) skala triliun parameter, dapat dipasang ke harness agen bergaya Claude Code, dan diposisikan lebih murah daripada model frontier AS.

Coba Apidog hari ini

Namun, kesamaannya berhenti di permukaan. Perbedaannya terlihat pada hal yang bisa Anda unduh hari ini, modalitas yang didukung, dan biaya penggunaan berat selama sebulan. Artikel ini membandingkan aspek yang dapat diverifikasi per 3 Agustus 2026. Untuk spesifikasi lengkap model Alibaba, mulai dari penjelasan Qwen 3.8-Max.

Catatan penting: belum ada benchmark head-to-head independen untuk Kimi K3 dan Qwen 3.8-Max. Semua angka benchmark di bawah berasal dari vendor masing-masing. Gunakan sebagai indikasi awal, bukan keputusan final.

Linimasa: siapa merilis apa, dan kapan

Urutan rilis penting karena istilah “bobot terbuka” belum berarti hal yang sama untuk kedua model.

  • Kimi K3 diluncurkan pada 16 Juli 2026. Moonshot menjanjikan bobot terbuka saat peluncuran dan merilisnya 11 hari kemudian, pada 27 Juli, di Hugging Face. Rilis MXFP4 berukuran 594 GB ini dapat diunduh, dikuantisasi, dan dijalankan di infrastruktur sendiri.
  • Qwen 3.8-Max diperkenalkan sebagai pratinjau pada 19 Juli dan tersedia secara umum di Alibaba Cloud Model Studio pada awal Agustus, menurut postingan rilis resmi Qwen. Bobotnya dijanjikan hadir di Hugging Face dan ModelScope “minggu depan”, atau sekitar 10 Agustus. Per 3 Agustus 2026, bobotnya belum tersedia untuk diunduh.

Jika self-hosting adalah persyaratan utama Anda, Kimi K3 adalah satu-satunya opsi yang benar-benar terbuka saat ini.

Parameter: dua MoE skala triliun

Kedua model menggunakan arsitektur sparse mixture-of-experts. Karena itu, total parameter tidak sama dengan parameter yang aktif untuk setiap token.

Spesifikasi Qwen 3.8-Max Kimi K3
Total parameter 2.4T 2.8T
Parameter aktif per token 95B 104B
Rasio aktivasi ~4% ~3.7%
Basis arsitektur Qwen 3.5 foundation, MoE MoE
Format bobot terbuka Dijanjikan, sekitar 10 Agustus MXFP4, 594 GB di Hugging Face

Qwen 3.8-Max lebih kecil pada total parameter maupun parameter aktif: 2.4T/95B dibanding 2.8T/104B pada K3. Ini bukan bukti bahwa Qwen otomatis lebih baik, tetapi biasanya berpengaruh pada biaya layanan.

Untuk self-hosting, ukuran K3 sebesar 594 GB pada MXFP4 sudah masuk wilayah multi-node, terutama jika Anda menambahkan KV cache untuk konteks panjang. Qwen 3.8-Max kemungkinan berada di kelas kebutuhan perangkat keras yang serupa saat bobotnya dirilis.

Praktiknya:

  1. Gunakan hosted endpoint bila Anda membutuhkan integrasi cepat.
  2. Pertimbangkan self-hosting jika kepatuhan, audit model, atau eksperimen kuantisasi menjadi kebutuhan utama.
  3. Hitung kebutuhan memori bersama KV cache, bukan hanya ukuran file bobot.

Keterbukaan: bobot tersedia vs janji rilis

Kimi K3 unggul jelas pada aspek ini hari ini.

Bobot Kimi K3 sudah publik. Anda dapat memeriksa repo, lisensi, serta file model, lalu menjalankannya sendiri. Ini membuka opsi seperti:

  • self-hosting dan inference privat;
  • kuantisasi komunitas;
  • fine-tuning;
  • audit terhadap versi model yang digunakan;
  • kepastian bahwa model yang diuji tidak diganti diam-diam oleh penyedia API.

Qwen 3.8-Max dijanjikan menjadi model kelas Qwen-Max pertama dengan bobot terbuka. Itu merupakan perubahan strategi Alibaba yang signifikan, tetapi per 3 Agustus 2026 statusnya masih model API dengan rencana rilis bobot.

Keputusan praktis: pilih Kimi K3 jika Anda harus menjalankan model lokal sekarang. Evaluasi ulang Qwen sekitar 10 Agustus setelah repo dan lisensinya tersedia.

Modalitas: Qwen menerima gambar, K3 berbasis teks

Pada modalitas, Qwen 3.8-Max memiliki keunggulan besar.

Konfigurasi resmi Qwen menyatakan:

{
  "input_modalities": ["text", "image"]
}
Enter fullscreen mode Exit fullscreen mode

Artinya, Qwen 3.8-Max menerima input teks dan gambar melalui API. Alibaba juga mendemonstrasikan pemahaman PDF panjang dan video melalui grafik memori dalam materi peluncurannya. Namun, perlakukan demo PDF dan video itu sebagai klaim blog vendor, bukan sebagai tipe input API yang sudah terdokumentasi.

Kimi K3 adalah model teks. Jika aplikasi Anda harus memahami:

  • tangkapan layar;
  • UI aplikasi;
  • dokumen hasil pemindaian;
  • gambar produk;
  • OCR atau tugas agen berbasis visi;

Anda perlu menambahkan model visi terpisah ke pipeline K3. Konsekuensinya adalah lebih banyak kode integrasi, latensi tambahan, dan titik kegagalan baru.

Untuk pengkodean atau agen yang hanya memproses teks, faktor ini tidak terlalu relevan. Untuk document intelligence atau agen penggunaan komputer, ini dapat menjadi faktor penentu.

Konteks, output, dan API

Qwen 3.8-Max menyediakan:

  • context window hingga 1.000.000 token;
  • output maksimum 65.536 token;
  • parameter reasoning_effort dengan nilai xhigh sebagai default, serta medium dan low;
  • output penalaran yang dipertahankan secara default.

Mode berpikir dan non-berpikir ditagih dengan tarif yang sama, tetapi token pemikiran tetap dihitung sebagai token output. Karena xhigh aktif secara default, perhitungkan biaya output yang lebih tinggi saat membuat estimasi.

Qwen dapat diakses melalui Alibaba Cloud Model Studio di wilayah Beijing, Singapura, dan US-Virginia. Platform ini mendukung dua gaya API:

  • endpoint kompatibel OpenAI;
  • endpoint kompatibel Anthropic.

Karena itu, Anda dapat menghubungkan Qwen ke Claude Code melalui variabel lingkungan seperti berikut:

export ANTHROPIC_BASE_URL="https://YOUR_DASHSCOPE_ANTHROPIC_ENDPOINT"
export ANTHROPIC_MODEL="qwen3.8-max"
Enter fullscreen mode Exit fullscreen mode

Lihat konfigurasi wilayah dan model di halaman model Model Studio. Jika Anda bekerja lintas wilayah, simpan setiap base URL sebagai environment terpisah di Apidog agar Anda dapat berpindah tanpa mengubah permintaan secara manual.

Kimi K3 juga mendukung protokol Anthropic dan dapat digunakan dalam harness bergaya Claude Code. Untuk detail endpoint dan batas terbaru K3, gunakan penjelasan Kimi K3, karena batas layanan dapat berubah setelah peluncuran.

Harga: Qwen lebih murah untuk output

Berikut tarif yang dipublikasikan per satu juta token:

Tarif Qwen 3.8-Max Kimi K3
Input $2.00 $3.00
Output $6.00 $15.00
Input kena cache $0.20 $0.30
Tingkatan harga Datar hingga konteks 1M Sesuai jadwal Moonshot

Menurut halaman harga Model Studio, Qwen 3.8-Max mengenakan tarif $2 untuk input dan $6 untuk output pada seluruh konteks hingga 1 juta token. Pembuatan cache eksplisit ditagih 125% dari tarif input, sedangkan cache hit ditagih 10% dari tarif input.

Qwen juga menawarkan kuota gratis 1 juta token, khusus wilayah Singapura, yang berlaku 90 hari.

Tarif Kimi K3 adalah:

  • $0,30 per juta token untuk cache hit;
  • $3 per juta token input;
  • $15 per juta token output.

Untuk memperkirakan biaya, gunakan rumus sederhana berikut:

biaya_total =
  (input_baru / 1_000_000 × tarif_input) +
  (cache_hit / 1_000_000 × tarif_cache_hit) +
  (output / 1_000_000 × tarif_output)
Enter fullscreen mode Exit fullscreen mode

Pada beban kerja dengan prompt sistem panjang dan konteks yang sering digunakan ulang, selisih cache hit cukup kecil: $0,20 untuk Qwen vs $0,30 untuk K3.

Namun, pada beban kerja yang menghasilkan banyak output—misalnya agent loops, pembuatan kode, atau penalaran panjang—Qwen lebih murah di atas kertas:

Kimi K3 output: $15 / 1M token
Qwen 3.8-Max output: $6 / 1M token
Enter fullscreen mode Exit fullscreen mode

Artinya, output K3 sekitar 2,5 kali lebih mahal dibanding Qwen.

Tetap perhatikan satu hal: reasoning_effort=xhigh di Qwen aktif secara default dan token berpikir ditagih sebagai output. Gunakan analisis harga Qwen 3.8 untuk memodelkan biaya per tugas sebelum mengunci pilihan model.

Benchmark: dua tabel vendor, tanpa wasit independen

Jangan membaca tabel benchmark vendor sebagai perbandingan langsung.

Yang tersedia:

  • Alibaba menerbitkan tabel Qwen 3.8-Max melawan Claude Opus 4.8, Fable 5, GPT-5.6 Sol, dan Qwen 3.7-Max.
  • Moonshot menerbitkan tabel Kimi K3 melawan jajaran model frontier serupa.
  • Kedua set evaluasi dijalankan oleh vendor masing-masing.

Yang belum tersedia:

  • evaluasi independen yang menempatkan Kimi K3 dan Qwen 3.8-Max dalam satu tabel;
  • harness, scaffolding, dan pengaturan sampling yang identik;
  • angka Artificial Analysis untuk Qwen 3.8-Max pada saat penulisan.

Berikut angka yang diklaim Alibaba dalam pengujian mereka sendiri:

Benchmark Qwen 3.8-Max Claude Opus 4.8 Fable 5 GPT-5.6 Sol
Terminal Bench 2.1 86.6 84.6 84.6 88.8
SWE-bench Pro 67.7 69.2 80.0 64.6
PaperBench 93.0 80.3 88.8 90.5
GPQA Diamond 92.6 92.0 92.6 94.1
HLE 43.6 45.7 53.3 47.2

Tabel Alibaba juga menunjukkan kekalahan yang jelas: Qwen 3.8-Max tertinggal dari Fable 5 pada SWE-bench Pro dan berada di bawah semua model yang terdaftar pada HLE.

Dari sisi Moonshot, tabel peluncuran K3 menyatakan bahwa K3 mengungguli Claude Opus 4.8 pada baris benchmark utama Moonshot, tetapi tetap tertinggal dari Fable 5 dan GPT-5.6 Sol secara keseluruhan. Lihat perbandingan Kimi K3 vs Claude Opus 4.8 untuk konteks dan batasan klaim tersebut.

Kesimpulan yang jujur: kedua vendor menunjukkan bahwa model mereka kompetitif untuk tugas agen. Tidak ada data independen yang cukup untuk menyatakan Kimi K3 atau Qwen 3.8-Max lebih kuat secara umum. Untuk angka Alibaba lebih lanjut, lihat analisis benchmark Qwen 3.8.

Jalankan head-to-head sendiri di Apidog

Karena belum ada wasit independen, pengujian pada beban kerja Anda sendiri lebih berguna daripada membandingkan dua tabel vendor.

Kedua model menyediakan endpoint chat completions yang kompatibel dengan OpenAI. Anda dapat mengujinya berdampingan di Apidog.

1. Buat dua environment

Buat environment terpisah:

Environment: qwen
BASE_URL=https://dashscope-endpoint-anda
MODEL=qwen3.8-max
API_KEY=...

Environment: kimi
BASE_URL=https://moonshot-endpoint-anda
MODEL=kimi-k3
API_KEY=...
Enter fullscreen mode Exit fullscreen mode

2. Gunakan satu payload yang sama

Gunakan tugas nyata dari produk atau repository Anda, bukan sekadar teka-teki umum.

{
  "model": "{{MODEL}}",
  "messages": [
    {
      "role": "system",
      "content": "Anda adalah asisten pengkodean. Jelaskan perubahan, lalu berikan patch yang minimal."
    },
    {
      "role": "user",
      "content": "Perbaiki bug validasi ini dan tambahkan pengujian regresi."
    }
  ]
}
Enter fullscreen mode Exit fullscreen mode

3. Beralih environment dan bandingkan hasil

Periksa metrik berikut untuk setiap respons:

  • status HTTP;
  • latensi;
  • jumlah token input dan output;
  • kualitas solusi;
  • kepatuhan terhadap format output;
  • kemampuan menggunakan konteks panjang;
  • perilaku streaming SSE;
  • biaya per tugas.

4. Tambahkan assertion

Ubah pengujian manual menjadi regresi yang dapat diulang:

- Status harus 200
- Latensi harus di bawah batas yang ditetapkan
- Respons harus menyertakan patch
- Respons harus menyebutkan file yang diubah
- Respons harus memenuhi schema JSON bila diperlukan
Enter fullscreen mode Exit fullscreen mode

Unduh Apidog untuk menjalankan perbandingan ini. Sepuluh prompt nyata pada kedua endpoint biasanya lebih bernilai daripada satu tabel vendor.

Kartu skor

Aspek Pemenang hari ini Catatan
Total/parameter aktif Qwen 3.8-Max Lebih ramping: 2.4T/95B vs 2.8T/104B; terutama relevan untuk biaya layanan
Bobot terbuka hari ini Kimi K3 Tersedia di Hugging Face sebagai MXFP4 594 GB
Modalitas Qwen 3.8-Max Mendukung input teks dan gambar
Jendela konteks Qwen 3.8-Max 1M token dengan output maksimum 65.536 token
Harga Qwen 3.8-Max $2/$6 vs $3/$15 per juta token input/output
Benchmark Tidak dapat ditentukan Semua tabel berasal dari vendor
Ekosistem harness Seri Keduanya mendukung endpoint kompatibel Anthropic
Rekam jejak janji bobot Kimi K3 Bobot dikirim 11 hari setelah peluncuran

Pilih yang mana, dan kapan

Pilih Kimi K3 jika:

  • Anda membutuhkan bobot model di infrastruktur sendiri minggu ini.
  • Kebutuhan kepatuhan mengharuskan model yang dapat dikunci dan diaudit.
  • Beban kerja murni teks.
  • Beban kerja sangat berat pada input yang dapat di-cache.

Pilih Qwen 3.8-Max jika:

  • Beban kerja Anda memerlukan input gambar.
  • Anda membangun agen yang menghasilkan banyak kode atau token output.
  • Anda membutuhkan konteks hingga 1 juta token.
  • Anda ingin harga input/output yang lebih rendah dan datar.

Tunggu sekitar satu minggu jika:

  • bobot terbuka adalah kriteria utama;
  • Anda ingin membandingkan lisensi dan kualitas kuantisasi setelah bobot Qwen tersedia;
  • Anda belum menjalankan evaluasi pada prompt dan data nyata aplikasi Anda.

Kesimpulannya, pengembang kini memiliki dua opsi frontier dari Tiongkok yang murah dan kompatibel dengan harness agen. Jangan memilih hanya dari tabel vendor. Uji kedua endpoint dengan tugas nyata, ukur biaya dan latensi, lalu pilih berdasarkan hasil aplikasi Anda sendiri.

FAQ

Apakah Kimi K3 lebih terbuka daripada Qwen 3.8-Max?

Hari ini, ya. Bobot Kimi K3 telah tersedia di Hugging Face sejak 27 Juli 2026 dalam format MXFP4 berukuran 594 GB. Bobot Qwen 3.8-Max dijanjikan sekitar 10 Agustus, tetapi belum dapat diunduh per 3 Agustus 2026.

Jika Alibaba memenuhi janji tersebut, keduanya akan menjadi model frontier berbobot terbuka. Saat itu, perbandingan perlu beralih ke lisensi, kualitas kuantisasi, dan dukungan komunitas. Untuk menjalankan K3 sendiri, lihat panduan K3 lokal.

Model mana yang lebih baik untuk pengkodean?

Belum ada jawaban yang dapat dibuktikan secara independen. Kedua vendor menerbitkan angka agentic coding yang kuat, tetapi evaluasinya dijalankan pada kondisi masing-masing.

Langkah yang tepat:

  1. Ambil 10–20 isu nyata dari repository Anda.
  2. Jalankan kedua model dengan prompt, alat, dan batas token yang sama.
  3. Nilai patch berdasarkan apakah pengujian lulus, bukan hanya penjelasan model.
  4. Catat latensi dan biaya per tugas selesai.

Bisakah kedua model digunakan di Claude Code?

Ya. Keduanya menyediakan endpoint kompatibel Anthropic.

Untuk Qwen 3.8-Max, arahkan ANTHROPIC_BASE_URL ke endpoint Anthropic DashScope dan gunakan:

export ANTHROPIC_MODEL="qwen3.8-max"
Enter fullscreen mode Exit fullscreen mode

Kimi K3 mendukung pola serupa melalui endpoint Moonshot. Kompatibilitas ini membuat pengujian A/B relatif mudah: gunakan harness yang sama, lalu ganti base URL dan model.

Mana yang lebih murah untuk beban kerja agen?

Berdasarkan harga daftar, Qwen 3.8-Max lebih murah:

Qwen 3.8-Max: $2 input / $6 output per 1M token
Kimi K3:      $3 input / $15 output per 1M token
Enter fullscreen mode Exit fullscreen mode

Namun, jangan hanya melihat harga stiker:

  • cache hit K3 sebesar $0,30 tetap kompetitif untuk beban kerja input berat;
  • reasoning_effort=xhigh Qwen dapat meningkatkan token output yang ditagihkan;
  • pola penggunaan agen Anda menentukan biaya sebenarnya.

Modelkan campuran input, cache hit, dan output dari lalu lintas nyata sebelum memilih model untuk produksi.

Top comments (0)