DEV Community

Cover image for Kimi K3 Benchmark: Angka Moonshot vs Tes Independen
Walse
Walse

Posted on • Originally published at apidog.com

Kimi K3 Benchmark: Angka Moonshot vs Tes Independen

Saat model baru diluncurkan, biasanya muncul dua kelompok angka yang tidak selalu sejalan: benchmark dari laboratorium pembuat model dan pengujian independen. Kimi K3, yang dikirimkan Moonshot AI pada 16 Juli 2026, adalah contoh yang jelas. Pengujian independen menunjukkan model yang sangat kuat tetapi tidak terlalu cepat. Sementara itu, Moonshot menyebutnya “tingkat terdepan” (frontier-level), namun juga mengakui bahwa K3 masih berada di bawah sistem proprietary teratas. Artikel ini memisahkan fakta terverifikasi, klaim vendor, dan metrik yang belum tersedia agar Anda dapat mengevaluasinya secara praktis.

Coba Apidog hari ini

TL;DR: posisi Kimi K3 saat ini

Menurut Artificial Analysis Intelligence Index, Kimi K3 memperoleh skor 57 dan berada di peringkat #4 dari 189 model. Ini adalah sinyal independen yang kuat bahwa kemampuan general-purpose K3 berada di kelas atas.

Namun, performa responsnya lebih lambat dibanding median model pada kelas harga yang sama:

  • Kecepatan output: sekitar 62 token/detik
  • Median kelas harga: 72,7 token/detik
  • Waktu hingga token pertama: sekitar 2 detik

Moonshot mengklaim K3 unggul pada sejumlah benchmark otomatisasi, termasuk BrowseComp, Automation Bench, dan SpreadsheetBench 2. Namun, hasil tersebut dijalankan oleh vendor, bukan direproduksi pihak ketiga.

Ringkasnya:

  • Intelijen umum: kuat dan diverifikasi independen.
  • Kecepatan: lebih lambat dari median kelasnya.
  • Benchmark tugas agenik: menjanjikan, tetapi sebagian besar masih berasal dari vendor.
  • Batas kemampuan: Moonshot sendiri menyatakan K3 masih tertinggal dari Claude Fable 5 dan GPT-5.6 Sol secara keseluruhan.

💡 Prinsip praktis: benchmark yang paling relevan adalah benchmark yang Anda jalankan pada beban kerja sendiri. Arahkan klien kompatibel OpenAI seperti Apidog ke endpoint kimi-k3, lalu ukur kualitas, latensi, dan biaya pada prompt produksi Anda.

Tiga klaim yang perlu dipisahkan

Peluncuran model sering terasa membingungkan karena tiga jenis klaim dicampur dalam satu narasi:

  1. Hasil independen
  2. Hasil benchmark vendor
  3. Batas yang diakui vendor

Untuk spesifikasi model dan harga, lihat apa itu Kimi K3. Artikel ini fokus pada cara membaca angkanya.

Ilustrasi benchmark Kimi K3

Perbandingan benchmark Kimi K3

Klaim 1: jangkar independen dari Artificial Analysis

Artificial Analysis adalah penguji pihak ketiga. Mereka membeli akses API, menjalankan evaluasi yang telah ditetapkan, lalu menerbitkan hasil tanpa input dari laboratorium pembuat model. Karena itu, metrik ini memiliki bobot paling tinggi.

Skor Artificial Analysis Kimi K3

Poin utama Kimi K3:

  • Indeks Intelijen: 57

    Skor komposit untuk penalaran, pengetahuan, dan pengkodean.

  • Peringkat: #4 dari 189 model

    Hanya tiga model yang mendapat skor lebih tinggi dalam kemampuan general-purpose saat pengukuran dilakukan.

  • Output: sekitar 62 token/detik

    Di bawah median kelas harga, yaitu 72,7 token/detik.

  • Waktu hingga token pertama: sekitar 2 detik

    Ada jeda singkat sebelum model mulai menghasilkan respons.

Interpretasinya sederhana: K3 cerdas, tetapi bukan model yang cepat.

Untuk pekerjaan batch seperti ekstraksi data atau analisis semalam, throughput yang lebih rendah mungkin tidak penting. Untuk asisten coding interaktif, tambahan waktu pada setiap completion akan terasa oleh developer.

Klaim 2: benchmark yang diterbitkan Moonshot

Moonshot menyatakan K3 memberikan “performa tingkat terdepan di seluruh rangkaian evaluasi kami” dan konsisten mengungguli model lain yang diuji.

Frasa pentingnya adalah: “rangkaian evaluasi kami.”

Vendor dapat memilih benchmark, konfigurasi, prompt, dan setup yang paling menguntungkan modelnya. Ini bukan berarti hasilnya salah, tetapi hasil tersebut sebaiknya diperlakukan sebagai indikasi, bukan kesimpulan akhir.

Klaim sekunder dari liputan peluncuran menyebut K3 memimpin pada 4 dari 8 benchmark otomatisasi dunia nyata, termasuk:

  • Automation Bench
  • SpreadsheetBench 2
  • BrowseComp

Klaim ini menarik, tetapi belum direproduksi penguji independen. Masukkan hasil seperti ini ke kategori: layak diuji, belum terkonfirmasi.

Klaim 3: batas yang diakui Moonshot

Bagian paling berguna dari peluncuran Moonshot justru adalah pengakuan keterbatasannya. Moonshot menyatakan bahwa performa keseluruhan K3 masih berada di bawah model proprietary terkuat: Claude Fable 5 dan GPT-5.6 Sol.

Pengakuan ini penting untuk menetapkan ekspektasi:

  • Untuk tugas paling sulit, Moonshot sendiri mengakui opsi proprietary masih unggul.
  • Nilai K3 bukan klaim “mengalahkan semua model”.
  • Posisi K3 adalah kualitas mendekati frontier dalam model terbuka, dengan biaya yang lebih rendah.

Untuk perbandingan langsung, baca:

Angka independen vs. angka vendor

Klaim Sumber Yang diukur Tingkat kepercayaan
Indeks Intelijen 57, peringkat #4 dari 189 Artificial Analysis Intelijen umum komposit Tinggi — pihak ketiga dan suite evaluasi tetap
Output sekitar 62 token/detik Artificial Analysis Throughput generasi Tinggi — metrik terukur dan dapat diulang
Waktu hingga token pertama sekitar 2 detik Artificial Analysis Responsivitas Tinggi — metrik terukur
“Performa tingkat terdepan di seluruh rangkaian evaluasi kami” Moonshot Campuran benchmark vendor Indikatif — ada keuntungan konfigurasi vendor
Menang di BrowseComp, Automation Bench, SpreadsheetBench 2; #2 Terminal-Bench 2.1; #3 DeepSWE Moonshot Tugas agenik Sedang — angka dipublikasikan, tetapi belum direproduksi independen
Tertinggal dari Claude Fable 5 dan GPT-5.6 Sol Moonshot Batas terhadap pemimpin proprietary Tinggi — vendor mengakui keterbatasannya sendiri
SWE-bench Verified independen Belum tersedia Pengkodean khusus Belum dipublikasikan

Pola yang perlu diperhatikan:

  • Pengujian independen mengonfirmasi intelijen umum dan kecepatan.
  • Klaim tingkat tugas, terutama otomatisasi agenik, masih bergantung pada benchmark vendor.
  • Kesenjangan ini adalah alasan utama Anda perlu menguji model pada workload sendiri.

Benchmark vendor yang dipublikasikan Moonshot

Tabel berikut adalah hasil yang diterbitkan Moonshot pada pengaturan penalaran maksimum.

Benchmark Kimi K3 Claude Fable 5 GPT-5.6 Sol Claude Opus 4.8
Terminal-Bench 2.1 88.3 84.6 88.8 84.6
DeepSWE 67.5 70.0 73.0 59.0
BrowseComp 91.2 88.0 90.4 84.3
Automation Bench 30.8 29.1 29.7 27.2
SpreadsheetBench 2 34.8 34.7 32.4 31.6

Dua hal terlihat jelas:

  1. K3 mengungguli Claude Fable 5 dan Claude Opus 4.8 pada empat dari lima benchmark di atas.
  2. Pada DeepSWE, benchmark pengkodean agenik yang paling berat di tabel ini, K3 berada di bawah GPT-5.6 Sol dan Claude Fable 5.

Hasil DeepSWE mendukung pernyataan Moonshot bahwa K3 masih tertinggal dari dua pemimpin proprietary secara keseluruhan.

Apa yang masih belum tersedia

Benchmark yang baik juga harus menjelaskan ketidakpastian. Berikut metrik publik yang belum tersedia atau belum direproduksi secara netral.

Skor pengkodean independen

Moonshot menerbitkan hasil Terminal-Bench 2.1 dan DeepSWE sendiri, tetapi belum ada skor SWE-bench Verified independen yang jelas untuk K3.

Jika Anda menemukan persentase SWE-bench untuk K3 saat ini, periksa sumbernya:

  • Apakah itu hasil Moonshot?
  • Apakah itu estimasi komunitas?
  • Apakah metodologinya dipublikasikan?
  • Apakah evaluator pihak ketiga yang menjalankannya?

Benchmark otomatisasi yang direproduksi

Kemenangan K3 pada Automation Bench, SpreadsheetBench 2, dan BrowseComp masih perlu diuji ulang pihak ketiga.

Benchmark agenik sangat sensitif terhadap:

  • Prompt sistem
  • Tool scaffolding
  • Strategi retry
  • Format tool call
  • Batas waktu eksekusi
  • Jumlah percobaan

Perbedaan kecil pada setup dapat mengubah hasil secara signifikan.

Kualitas konteks panjang pada 1 juta token

K3 memiliki jendela konteks 1 juta token. Namun, kapasitas konteks bukan jaminan bahwa model dapat mengambil informasi secara andal di seluruh panjang konteks tersebut.

Jika use case Anda melibatkan dokumen sangat panjang, uji langsung pada ukuran input yang relevan, misalnya:

  • 32K token
  • 128K token
  • 500K token
  • Mendekati 1M token

Gunakan pertanyaan dengan jawaban yang sengaja ditempatkan di bagian awal, tengah, dan akhir dokumen.

Cara membaca benchmark vendor secara praktis

Gunakan checklist berikut saat mengevaluasi setiap grafik benchmark.

  1. Siapa yang menjalankan tes?

    Hasil independen lebih kuat daripada hasil yang dilaporkan sendiri oleh vendor.

  2. Apakah benchmark, versi, dan konfigurasi disebutkan?

    “SWE-bench Verified” dapat diperiksa. “Suite coding internal kami” tidak cukup untuk direproduksi.

  3. Metrik apa yang tidak ditampilkan?

    Tiga grafik kemenangan tidak berarti model menang di semua evaluasi.

  4. Apakah vendor mengakui keterbatasan?

    Pengakuan Moonshot bahwa K3 berada di bawah Fable 5 dan Sol adalah informasi yang lebih berguna daripada klaim kemenangan umum.

  5. Apakah klaim vendor selaras dengan sumber independen?

    Jika benchmark vendor dan evaluator netral bertentangan, gunakan hasil evaluator netral sebagai dasar keputusan.

K3 cukup baik saat melewati filter ini:

  • Indeks independen mengonfirmasi kemampuan kuat.
  • Moonshot mengakui batas modelnya.
  • Area yang paling belum pasti adalah otomatisasi agenik, karena hasilnya belum banyak direproduksi pihak ketiga.

Untuk contoh pendekatan evaluasi yang sama, lihat benchmark GLM-5.2 dan GPT-5.6 vs Claude Fable 5.

Cara benchmark Kimi K3 untuk tugas Anda sendiri

Papan peringkat menjawab pertanyaan umum: “seberapa kuat model ini secara rata-rata?”

Namun, pertanyaan engineering yang sebenarnya adalah:

“Apakah model ini lebih baik untuk workload saya?”

Jawabannya membutuhkan benchmark internal yang kecil, tetap, dan dapat diulang.

1. Buat golden dataset

Kumpulkan 20 hingga 50 prompt nyata dari workload Anda, misalnya:

  • Tiket support pelanggan
  • Diff kode aktual
  • Query SQL produksi
  • Dokumen panjang yang perlu diringkas
  • Payload API yang perlu diekstrak
  • Tugas tool-calling atau automasi

Hindari hanya memakai prompt sintetis. Prompt produksi biasanya memiliki ambiguitas, format buruk, dan edge case yang tidak muncul dalam contoh buatan.

Contoh struktur dataset JSON:

[
  {
    "id": "support-001",
    "prompt": "Klasifikasikan tiket berikut dan buat respons singkat...",
    "expected_output": "Kategori: Billing"
  },
  {
    "id": "code-014",
    "prompt": "Perbaiki bug berikut tanpa mengubah API publik...",
    "expected_output": "Patch valid dan seluruh test lulus"
  }
]
Enter fullscreen mode Exit fullscreen mode

2. Tetapkan semua variabel

Jangan membandingkan model dengan konfigurasi yang berubah-ubah.

Tetapkan:

  • Model ID: kimi-k3
  • Temperature
  • System prompt
  • max_tokens
  • Tool definitions
  • Timeout
  • Retry policy
  • Region atau endpoint API

Contoh payload kompatibel OpenAI:

{
  "model": "kimi-k3",
  "temperature": 0.2,
  "max_tokens": 2048,
  "messages": [
    {
      "role": "system",
      "content": "Jawab secara ringkas, teknis, dan hanya gunakan informasi dari konteks."
    },
    {
      "role": "user",
      "content": "Analisis log berikut dan identifikasi akar masalahnya."
    }
  ]
}
Enter fullscreen mode Exit fullscreen mode

3. Ukur empat metrik untuk setiap prompt

Jangan hanya mengukur “jawabannya bagus atau tidak.” Catat setidaknya empat hal berikut.

Metrik Pertanyaan
Kualitas Apakah output menyelesaikan tugas?
Latensi Berapa waktu hingga token pertama dan waktu total respons?
Biaya Berapa token input dan output yang digunakan?
Konsistensi Apakah hasil tetap baik saat prompt dijalankan ulang?

Untuk tugas yang dapat diuji otomatis, gunakan evaluator berbasis test atau assertion.

Contoh sederhana untuk tugas ekstraksi JSON:

function evaluateExtraction(output) {
  try {
    const data = JSON.parse(output);

    return {
      validJson: true,
      hasRequiredFields: Boolean(data.name && data.email),
      score: data.name && data.email ? 1 : 0
    };
  } catch {
    return {
      validJson: false,
      hasRequiredFields: false,
      score: 0
    };
  }
}
Enter fullscreen mode Exit fullscreen mode

4. Bandingkan dengan model yang Anda gunakan sekarang

Jalankan golden dataset yang sama pada:

  • Kimi K3
  • Model produksi Anda saat ini
  • Satu atau dua alternatif yang relevan

Jangan mengganti model hanya karena posisinya tinggi di leaderboard. Ganti model jika ia menang pada metrik yang benar-benar penting bagi sistem Anda.

Contoh matriks keputusan:

Model Kualitas TTFT Total latensi Biaya Pilihan
Kimi K3 91% 2,1 dtk 8,4 dtk Rendah Batch / analisis
Model saat ini 88% 0,8 dtk 4,2 dtk Sedang Interaktif
Model proprietary 95% 1,2 dtk 6,1 dtk Tinggi Tugas sulit

Menjalankan benchmark dengan Apidog

Apidog dapat digunakan untuk menyimpan dan menjalankan ulang request benchmark Anda secara konsisten.

Alur kerja praktis:

  1. Buat koleksi LLM Benchmark.
  2. Simpan satu request untuk setiap prompt golden dataset.
  3. Gunakan environment variable untuk model, API key, dan base URL.
  4. Catat waktu respons, token usage, dan output.
  5. Duplikat request lalu tukar model ID untuk menjalankan perbandingan yang adil.

Contoh environment variable:

BASE_URL=https://your-moonshot-endpoint/v1
MODEL=kimi-k3
API_KEY={{your_api_key}}
Enter fullscreen mode Exit fullscreen mode

Contoh request:

POST {{BASE_URL}}/chat/completions
Authorization: Bearer {{API_KEY}}
Content-Type: application/json
Enter fullscreen mode Exit fullscreen mode
{
  "model": "{{MODEL}}",
  "temperature": 0.2,
  "messages": [
    {
      "role": "user",
      "content": "{{benchmark_prompt}}"
    }
  ]
}
Enter fullscreen mode Exit fullscreen mode

Dengan pendekatan ini, Anda dapat mengganti MODEL dari kimi-k3 ke model pembanding tanpa mengubah seluruh request.

Jika Anda bekerja dari editor, lihat cara menggunakan Apidog di dalam VS Code. Untuk mulai menguji endpoint secara langsung, Unduh Apidog.

Benchmark model API menggunakan Apidog

Fokus pengujian berdasarkan jenis workload

Asisten coding

Latensi sangat penting. Pada sekitar 62 token/detik, completion panjang akan terasa lebih lambat.

Uji dengan:

  • Panjang completion aktual
  • Repository atau codebase nyata
  • Test suite otomatis
  • Waktu hingga respons pertama
  • Jumlah edit yang diperlukan setelah output model

Model dengan skor general-purpose lebih rendah bisa tetap lebih baik jika responsnya jauh lebih cepat.

Ekstraksi data batch

Untuk proses batch, throughput interaktif biasanya tidak terlalu penting.

Prioritaskan:

  • Akurasi ekstraksi
  • Validitas JSON atau format terstruktur
  • Biaya per dokumen
  • Tingkat retry
  • Konsistensi antar batch

Analisis dokumen panjang

Jangan menguji hanya dengan input pendek jika produksi Anda menggunakan konteks besar.

Uji pada panjang konteks nyata dan masukkan fakta penting pada posisi berbeda dalam dokumen. Ukur apakah model tetap menemukan detail yang benar ketika konteks bertambah.

Otomatisasi agenik

Area ini paling penting untuk diuji sendiri karena banyak klaim K3 masih belum diverifikasi independen.

Buat harness kecil:

  1. Tentukan daftar tugas nyata.
  2. Berikan tools dan batas eksekusi yang sama untuk semua model.
  3. Jalankan beberapa kali.
  4. Hitung tingkat keberhasilan.
  5. Simpan trace kegagalan untuk dianalisis.

Untuk setiap tugas, ukur:

success_rate
average_steps
tool_call_errors
retry_count
time_to_complete
cost_per_success
Enter fullscreen mode Exit fullscreen mode

Anda juga dapat mengakses K3 melalui agregator jika tidak ingin mengelola kunci API langsung. OpenRouter untuk moonshotai/kimi-k3 menyediakan rute yang kompatibel dengan OpenAI.

Posisi Kimi K3 secara jujur

Kimi K3 adalah model general-purpose yang kuat dengan profil yang cukup jelas:

  • Kemampuan umum terverifikasi melalui pengujian independen.
  • Kecepatan output lebih rendah dari median kelasnya.
  • Klaim benchmark agenik vendor terlihat menjanjikan, tetapi belum cukup direproduksi.
  • Moonshot sendiri mengakui model proprietary teratas masih unggul untuk tugas paling sulit.

Jika aplikasi Anda berorientasi batch, analisis, ekstraksi, atau workload yang tidak terlalu sensitif terhadap latensi, K3 layak diuji. Jika Anda membangun pengalaman coding interaktif atau chat real-time, ukur dampak throughput dan waktu token pertama sebelum memutuskan migrasi.

Peluncuran model adalah awal dari bukti, bukan akhir. Gunakan leaderboard sebagai sinyal awal, lalu biarkan benchmark internal Anda menentukan pilihan.

Untuk mengevaluasi nilai terhadap biaya, lihat harga Kimi K3.

Pertanyaan yang sering diajukan

Berapa skor benchmark Kimi K3?

Pada Artificial Analysis Intelligence Index, Kimi K3 memperoleh skor 57 dan berada di peringkat #4 dari 189 model. Ini adalah metrik independen paling kuat yang tersedia untuk kemampuan general-purpose K3.

Apakah Kimi K3 lebih cepat dari model lain?

Tidak. Kecepatan output K3 sekitar 62 token per detik, di bawah median 72,7 token per detik untuk kelas harganya. Waktu hingga token pertama sekitar 2 detik. K3 lebih cocok untuk workload batch dan analisis daripada pengalaman interaktif yang sangat sensitif terhadap latensi.

Apakah Kimi K3 mengalahkan Claude Fable 5 atau GPT-5.6 Sol?

Tidak secara keseluruhan, menurut Moonshot sendiri. K3 unggul pada beberapa benchmark otomatisasi yang diterbitkan vendor, tetapi tetap berada di bawah Claude Fable 5 dan GPT-5.6 Sol untuk kemampuan keseluruhan dan tugas terberat.

Bagaimana cara benchmark Kimi K3 untuk use case saya?

Buat golden dataset berisi 20 hingga 50 prompt nyata. Tetapkan parameter seperti model ID, temperature, system prompt, dan token limit. Kemudian ukur kualitas, latensi, biaya, serta konsistensi terhadap model yang Anda gunakan saat ini. Dengan Apidog, Anda dapat menyimpan request sebagai koleksi, menjalankannya ulang terhadap kimi-k3 dan model lain, lalu membandingkan hasilnya secara adil.

Top comments (0)