DEV Community

Cover image for Mistral Kembali: Le Chonk Mengalahkan GPT-6 Astra dan Claude
Walse
Walse

Posted on Originally published at apidog.com

Mistral Kembali: Le Chonk Mengalahkan GPT-6 Astra dan Claude

Mistral sudah lama tidak terdengar di segmen teratas. Mistral Large 3 diluncurkan pada Desember 2025, lalu percakapan tentang model open-weight terdepan didominasi Kimi, DeepSeek, GLM, dan Qwen. Pada 6 Oktober 2026, Mistral merespons dengan Mistral Large 4: model 1 triliun parameter yang dijuluki timnya sebagai “Le Chonk”.

Coba Apidog hari ini

Klaim yang paling sering dibagikan adalah skor siber Large 4 sebesar 82%, ketika Claude Opus 5.5 dan GPT-6 Astra mencetak mendekati nol. Angka itu memang ada di halaman peluncuran Mistral, tetapi membutuhkan konteks: kedua model tertutup tersebut menolak tugas reproduksi kerentanan. Artikel ini membahas spesifikasi, harga, batasan benchmark, serta cara menguji Large 4 pada API Anda sendiri.

TL;DR

  • Apa itu: model mixture-of-experts dengan 1,05T parameter total, 49B parameter aktif, vision encoder 1,6B, input teks dan gambar, serta konteks hingga 1 juta token.
  • Cara mengakses: tersedia sebagai pratinjau publik di Mistral API dengan ID mistral-large-4.
  • Bobot model: dijanjikan tersedia “pada akhir bulan”, sekitar 27 Oktober 2026.
  • Harga: $1,36 input / $4,18 output per juta token pada harga daftar. Selama pratinjau, harga yang ditampilkan adalah $0,68 input / $2,09 output. Input cached adalah $0,07 per juta token.
  • Skor siber: 82% pada AA Cyber Index untuk reproduksi kerentanan. Opus 5.5 dan Astra mendekati nol karena menolak tugas tersebut.
  • Batas utama: pada evaluasi coding oleh manusia, Claude Opus 5 mendapat 4,22 dari 5, sementara Large 4 mendapat 3,74.

Mengapa Mistral kembali relevan

Sepanjang 2026, sebagian besar model open-weight paling kuat datang dari Tiongkok. Mistral tetap merilis produk seperti Medium 3.5, Devstral 2, dan Small 4, tetapi belum memiliki model yang benar-benar bersaing pada kelas teratas.

Large 4 mengubah posisi tersebut. Mistral mengklaim model ini “secara signifikan mengungguli model open-weight mana pun yang dikembangkan di AS atau Eropa.” Model ini dilatih dari awal menggunakan 3.800 GPU NVIDIA Grace Blackwell di pusat data Eropa milik Mistral, mendukung lebih dari 160 bahasa termasuk seluruh bahasa resmi Uni Eropa, dan hadir beberapa minggu setelah pendanaan Seri D senilai €3 miliar.

Waktunya juga penting. Large 4 hadir tidak lama setelah Reflection merilis Beam sebagai model open-weight, sehingga persaingan model terbuka AS vs. Tiongkok kini memiliki pesaing serius dari Eropa.

Memahami klaim benchmark siber

Artificial Analysis Cyber Index mencakup tugas yang meminta model mereproduksi kerentanan nyata dalam perangkat lunak open-source, lalu membuat tambalannya. Mistral melaporkan Large 4 mencapai 82%, skor tertinggi yang dilaporkan untuk model mana pun pada tes tersebut.

Namun, Mistral juga menjelaskan bahwa Claude Opus 5.5 dan GPT-6 Astra mendapat skor mendekati nol karena keduanya menolak mengerjakan tugas tersebut.

Klaim Interpretasi yang tepat
“Large 4 mengalahkan Astra dan Opus 5.5 dalam siber” Pada tes ini, model tertutup menolak menjawab. Large 4 menjawab dan sering berhasil.
“Large 4 adalah model peretas terbaik” Belum dapat disimpulkan. Penolakan adalah kebijakan model, bukan bukti keterbatasan kemampuan.
“Large 4 tidak aman” Juga belum dapat disimpulkan. Mistral melaporkan tingkat penolakan rata-rata yang lebih tinggi daripada model open-weight lain pada prompt siber dari JailbreakBench, StrongREJECT, dan AgentHarm.

Ada kemampuan teknis yang nyata di balik skor tersebut:

  • Cybench: menyelesaikan 93% dari 40 latihan capture-the-flag.
  • B3 Agent Security Benchmark: berhasil menahan 93,3% serangan.

Bagi tim keamanan, nilai praktisnya adalah kemampuan untuk menjalankan model yang dapat membantu mereproduksi dan menambal CVE pada kode internal, sambil tetap menolak banyak permintaan berbahaya. Bagi tim API, ini membuka opsi menjalankan model pada infrastruktur sendiri setelah bobot tersedia.

Benchmark lain yang dilaporkan Mistral

Selain benchmark siber, Mistral melaporkan dua hasil melawan GPT-6 Astra ketika kedua model benar-benar mencoba tugas yang sama:

Benchmark Mistral Large 4 GPT-6 Astra Catatan
Dense 200 (visual grounding) 42% 41% Keunggulan satu poin, jadi selisihnya tipis.
Finance Agent v2 (vals.ai) Unggul Tertinggal Mistral melaporkan peringkat, bukan skor.
Harvey Legal Agent Benchmark Model terbuka terbaik Terdaftar Tidak ada angka perbandingan langsung yang dipublikasikan.

Dibandingkan model open-weight lain, hasil yang dilaporkan lebih lebar:

Benchmark Mistral Large 4 Perbandingan
AutomationBench, 657 alur kerja 59,9% Mengungguli Kimi K3 dan DeepSeek V4 Pro
AA-Briefcase (knowledge work) 1.393 Elo Mengungguli DeepSeek V4 Pro
DeepSWE v1.1 (coding) 61,7% Memimpin model open-weight
SWE-Atlas-QnA 59,4% —
Terminal-Bench 4.0 28,3% —

Semua angka tersebut berasal dari model pratinjau yang dilaporkan Mistral. Belum ada lab independen yang menjalankan ulang seluruh benchmark, dan reinforcement learning dilaporkan masih dalam tahap penyelesaian saat peluncuran. Gunakan hasil ini sebagai sinyal untuk diuji, bukan keputusan produksi final.

Di mana Large 4 masih kalah

Mistral juga menerbitkan hasil evaluasi coding manusia oleh Surge AI. Dalam evaluasi lima model, Large 4 Preview berada di posisi kedua.

Model Skor coding manusia, dari 5
Claude Opus 5 4,22
Mistral Large 4 Preview 3,74
GLM-5.3 3,60
Kimi K3 3,59
GLM-5.2 3,40

Large 4 mengungguli model open-weight Tiongkok dalam evaluasi ini, tetapi masih tertinggal hampir setengah poin dari Claude Opus 5. Deskripsi Mistral bahwa Large 4 “memperkecil jarak” terhadap model coding terdepan adalah pembacaan yang tepat.

Perlu dicatat juga: materi peluncuran tidak memuat perbandingan terhadap Claude Fable 5.1 atau GPT-6 Sol. Jika ada klaim bahwa Large 4 mengalahkan model tersebut, mintalah benchmark dan metodologinya.

Spesifikasi Mistral Large 4

Spesifikasi Detail
ID model API mistral-large-4 dan alias mistral-large-4-0
Versi 26.10, pratinjau publik
Arsitektur Mixture-of-experts, instruksi hibrida + penalaran
Parameter 1,05T total, 49B aktif, vision encoder 1,6B
Jendela konteks 1 juta token
Input Teks dan gambar
Penalaran reasoning_effort: "high" atau "none"
Dukungan alat Panggilan fungsi, output terstruktur, alat agen bawaan
Endpoint /v1/chat/completions, /v1/conversations, /v1/agents, /v1/batch
Bobot Akan dibuka pada akhir Oktober 2026; lisensi belum dipublikasikan

Harga dan implikasinya untuk tim API

Halaman harga Mistral menampilkan harga pratinjau Large 4 sebesar setengah harga daftar.

Model Input / 1 juta token Output / 1 juta token Bobot terbuka
Mistral Large 4, harga pratinjau $0,68 $2,09 Ya, akhir Oktober
Mistral Large 4, harga daftar $1,36 $4,18 Ya, akhir Oktober
Claude Opus 5.5 $4,00 $20,00 Tidak
GPT-6 Astra $10,00 $50,00 Tidak

Pada harga pratinjau, biaya output Large 4 sekitar seperdua puluh empat dari Astra. Bahkan pada harga daftar, outputnya sekitar 12 kali lebih murah.

Harga input cached sebesar $0,07 per juta token juga relevan untuk agen yang terus mengirim ulang system prompt, konteks, dan definisi alat pada setiap giliran. Karena belum ada tanggal akhir diskon pratinjau, gunakan harga daftar saat membuat anggaran produksi.

Kapan sebaiknya mencoba Large 4?

Coba sekarang jika Anda:

  • Menjalankan agen atau otomatisasi knowledge-work dengan biaya model terdepan yang tinggi.
  • Membutuhkan output multibahasa untuk bahasa-bahasa Uni Eropa atau inferensi yang di-host di UE.
  • Melakukan pekerjaan keamanan defensif dan membutuhkan bantuan untuk reproduksi kerentanan yang sah.
  • Membutuhkan opsi self-hosting setelah bobot dirilis.

Tunggu jika Anda:

  • Mengutamakan kualitas coding berdasarkan evaluasi manusia; Claude masih memimpin pada metrik tersebut.
  • Membutuhkan benchmark independen yang dapat dipertahankan dalam tinjauan teknis atau kepatuhan.
  • Menjalankan Large 3 di produksi dan membutuhkan ID model berversi yang stabil.

Cara menguji Large 4 pada API Anda sendiri di Apidog

Benchmark publik tidak menggantikan evaluasi terhadap prompt, data, skema, dan API Anda sendiri. Mulailah dengan menjalankan permintaan yang identik terhadap Large 4 dan model yang saat ini Anda gunakan.

Apidog dapat membantu menyimpan, menggandakan, membandingkan, dan menguji permintaan tersebut tanpa menulis skrip tambahan.

1. Simpan permintaan dasar

Buat permintaan berikut:

POST https://api.mistral.ai/v1/chat/completions
Authorization: Bearer {{MISTRAL_API_KEY}}
Content-Type: application/json
Enter fullscreen mode Exit fullscreen mode

Gunakan variabel lingkungan untuk menyimpan MISTRAL_API_KEY, lalu kirim payload minimal:

{
  "model": "mistral-large-4",
  "messages": [
    {
      "role": "user",
      "content": "Jelaskan respons API ini dalam format JSON."
    }
  ],
  "reasoning_effort": "high"
}
Enter fullscreen mode Exit fullscreen mode

2. Gandakan permintaan untuk setiap model

Duplikat permintaan dan ubah hanya nilai model.

{
  "model": "mistral-large-4"
}
Enter fullscreen mode Exit fullscreen mode

Bandingkan dengan model produksi Anda saat ini. Periksa:

  • Status respons.
  • Latensi.
  • Ukuran respons.
  • Konsistensi output.
  • Blok usage untuk jumlah token dan estimasi biaya.

3. Tambahkan asersi untuk kasus penggunaan nyata

Jika Anda meminta output terstruktur, jadikan eksperimen sebagai tes regresi. Tambahkan pemeriksaan seperti:

  • Status HTTP 200.
  • Respons tidak kosong.
  • Properti JSON yang wajib tersedia.
  • Respons sesuai dengan JSON Schema yang diharapkan.

Contoh output terstruktur:

{
  "model": "mistral-large-4",
  "messages": [
    {
      "role": "user",
      "content": "Klasifikasikan insiden API ini."
    }
  ],
  "response_format": {
    "type": "json_object"
  }
}
Enter fullscreen mode Exit fullscreen mode

4. Jalankan ulang saat model berubah

Kelompokkan permintaan sebagai skenario pengujian. Jalankan kembali ketika Mistral memperbarui model pratinjau atau merilis bobotnya. Dengan begitu, Anda dapat mendeteksi perubahan kualitas, format, atau biaya sebelum pengguna Anda terpengaruh.

Kemampuan keamanan Large 4 membuatnya relevan sebagai peninjau kedua untuk pengujian keamanan API, misalnya ketika mereproduksi auth bypass pada lingkungan staging milik Anda sendiri. Dukungan panggilan fungsi dan output terstruktur juga memungkinkan spesifikasi OpenAPI yang dirancang di Apidog diubah menjadi definisi alat untuk agen.

Untuk contoh lengkap terkait autentikasi, penalaran, input gambar, panggilan fungsi, dan perhitungan biaya, lihat panduan API Mistral Large 4. Jika Anda sudah menggunakan model Mistral sebelumnya, dasar-dasar API Mistral AI dan panduan API Mistral Medium 3.5 masih relevan: URL dasar dan autentikasi tetap sama, sementara ID model berubah.

FAQ

Apakah Mistral Large 4 adalah open source?

Model ini adalah open-weight, bukan berarti lisensinya sudah diketahui. Mistral mengatakan bobot akan tersedia pada akhir Oktober 2026, tetapi lisensinya belum dipublikasikan. Jangan mengasumsikan lisensinya sama dengan Apache 2.0 pada Large 3.

Apakah Mistral Large 4 benar-benar mengalahkan GPT-6 Astra?

Menurut angka Mistral, Large 4 unggul pada visual grounding—42% dibanding 41%—dan Finance Agent v2. Pada benchmark kerentanan siber, Astra mendapat skor mendekati nol karena menolak tugas, sehingga hasil tersebut bukan perbandingan kemampuan yang sepenuhnya setara.

Apakah Large 4 mengalahkan Claude?

Tidak pada evaluasi coding manusia. Claude Opus 5 mendapat 4,22, sedangkan Large 4 mendapat 3,74. Claude Opus 5.5 juga menolak tugas reproduksi kerentanan pada benchmark siber.

Apa arti “Le Chonk”?

Itu adalah julukan tidak resmi dari Mistral yang merujuk pada ukuran model. Nama resminya adalah Mistral Large 4 atau ML4.

Bisakah Large 4 digunakan gratis?

Paket gratis Mistral mencakup kredit API $10 per bulan serta akses ke model terbaru melalui Le Chat dan Vibe. Pada harga pratinjau, $10 setara dengan sekitar 4,8 juta token output Large 4.

Intinya

Mistral kembali masuk percakapan model terdepan. Berdasarkan angka yang dilaporkan Mistral, Large 4 adalah model open-weight terkuat dari luar Tiongkok, memiliki biaya jauh lebih rendah daripada Astra atau Opus 5.5, dan akan dapat dijalankan pada perangkat keras sendiri setelah bobot tersedia.

Namun, klaim “mengalahkan Astra dan Claude dalam siber” perlu dibaca dalam konteks penolakan tugas oleh model tertutup. Pada coding, evaluasi manusia masih menempatkan Claude di posisi pertama.

Langkah berikutnya bukan memperdebatkan leaderboard: jalankan Large 4 terhadap API, prompt, dan skema output Anda sendiri. Uji selama harga pratinjau masih berlaku, lalu tunda keputusan produksi berisiko tinggi sampai benchmark independen dan bobot model tersedia.

Top comments (0)