Mistral sudah lama tidak terdengar di segmen teratas. Mistral Large 3 diluncurkan pada Desember 2025, lalu percakapan tentang model open-weight terdepan didominasi Kimi, DeepSeek, GLM, dan Qwen. Pada 6 Oktober 2026, Mistral merespons dengan Mistral Large 4: model 1 triliun parameter yang dijuluki timnya sebagai “Le Chonk”.
Klaim yang paling sering dibagikan adalah skor siber Large 4 sebesar 82%, ketika Claude Opus 5.5 dan GPT-6 Astra mencetak mendekati nol. Angka itu memang ada di halaman peluncuran Mistral, tetapi membutuhkan konteks: kedua model tertutup tersebut menolak tugas reproduksi kerentanan. Artikel ini membahas spesifikasi, harga, batasan benchmark, serta cara menguji Large 4 pada API Anda sendiri.
TL;DR
- Apa itu: model mixture-of-experts dengan 1,05T parameter total, 49B parameter aktif, vision encoder 1,6B, input teks dan gambar, serta konteks hingga 1 juta token.
-
Cara mengakses: tersedia sebagai pratinjau publik di Mistral API dengan ID
mistral-large-4. - Bobot model: dijanjikan tersedia “pada akhir bulan”, sekitar 27 Oktober 2026.
- Harga: $1,36 input / $4,18 output per juta token pada harga daftar. Selama pratinjau, harga yang ditampilkan adalah $0,68 input / $2,09 output. Input cached adalah $0,07 per juta token.
- Skor siber: 82% pada AA Cyber Index untuk reproduksi kerentanan. Opus 5.5 dan Astra mendekati nol karena menolak tugas tersebut.
- Batas utama: pada evaluasi coding oleh manusia, Claude Opus 5 mendapat 4,22 dari 5, sementara Large 4 mendapat 3,74.
Mengapa Mistral kembali relevan
Sepanjang 2026, sebagian besar model open-weight paling kuat datang dari Tiongkok. Mistral tetap merilis produk seperti Medium 3.5, Devstral 2, dan Small 4, tetapi belum memiliki model yang benar-benar bersaing pada kelas teratas.
Large 4 mengubah posisi tersebut. Mistral mengklaim model ini “secara signifikan mengungguli model open-weight mana pun yang dikembangkan di AS atau Eropa.” Model ini dilatih dari awal menggunakan 3.800 GPU NVIDIA Grace Blackwell di pusat data Eropa milik Mistral, mendukung lebih dari 160 bahasa termasuk seluruh bahasa resmi Uni Eropa, dan hadir beberapa minggu setelah pendanaan Seri D senilai €3 miliar.
Waktunya juga penting. Large 4 hadir tidak lama setelah Reflection merilis Beam sebagai model open-weight, sehingga persaingan model terbuka AS vs. Tiongkok kini memiliki pesaing serius dari Eropa.
Memahami klaim benchmark siber
Artificial Analysis Cyber Index mencakup tugas yang meminta model mereproduksi kerentanan nyata dalam perangkat lunak open-source, lalu membuat tambalannya. Mistral melaporkan Large 4 mencapai 82%, skor tertinggi yang dilaporkan untuk model mana pun pada tes tersebut.
Namun, Mistral juga menjelaskan bahwa Claude Opus 5.5 dan GPT-6 Astra mendapat skor mendekati nol karena keduanya menolak mengerjakan tugas tersebut.
| Klaim | Interpretasi yang tepat |
|---|---|
| “Large 4 mengalahkan Astra dan Opus 5.5 dalam siber” | Pada tes ini, model tertutup menolak menjawab. Large 4 menjawab dan sering berhasil. |
| “Large 4 adalah model peretas terbaik” | Belum dapat disimpulkan. Penolakan adalah kebijakan model, bukan bukti keterbatasan kemampuan. |
| “Large 4 tidak aman” | Juga belum dapat disimpulkan. Mistral melaporkan tingkat penolakan rata-rata yang lebih tinggi daripada model open-weight lain pada prompt siber dari JailbreakBench, StrongREJECT, dan AgentHarm. |
Ada kemampuan teknis yang nyata di balik skor tersebut:
- Cybench: menyelesaikan 93% dari 40 latihan capture-the-flag.
- B3 Agent Security Benchmark: berhasil menahan 93,3% serangan.
Bagi tim keamanan, nilai praktisnya adalah kemampuan untuk menjalankan model yang dapat membantu mereproduksi dan menambal CVE pada kode internal, sambil tetap menolak banyak permintaan berbahaya. Bagi tim API, ini membuka opsi menjalankan model pada infrastruktur sendiri setelah bobot tersedia.
Benchmark lain yang dilaporkan Mistral
Selain benchmark siber, Mistral melaporkan dua hasil melawan GPT-6 Astra ketika kedua model benar-benar mencoba tugas yang sama:
| Benchmark | Mistral Large 4 | GPT-6 Astra | Catatan |
|---|---|---|---|
| Dense 200 (visual grounding) | 42% | 41% | Keunggulan satu poin, jadi selisihnya tipis. |
| Finance Agent v2 (vals.ai) | Unggul | Tertinggal | Mistral melaporkan peringkat, bukan skor. |
| Harvey Legal Agent Benchmark | Model terbuka terbaik | Terdaftar | Tidak ada angka perbandingan langsung yang dipublikasikan. |
Dibandingkan model open-weight lain, hasil yang dilaporkan lebih lebar:
| Benchmark | Mistral Large 4 | Perbandingan |
|---|---|---|
| AutomationBench, 657 alur kerja | 59,9% | Mengungguli Kimi K3 dan DeepSeek V4 Pro |
| AA-Briefcase (knowledge work) | 1.393 Elo | Mengungguli DeepSeek V4 Pro |
| DeepSWE v1.1 (coding) | 61,7% | Memimpin model open-weight |
| SWE-Atlas-QnA | 59,4% | — |
| Terminal-Bench 4.0 | 28,3% | — |
Semua angka tersebut berasal dari model pratinjau yang dilaporkan Mistral. Belum ada lab independen yang menjalankan ulang seluruh benchmark, dan reinforcement learning dilaporkan masih dalam tahap penyelesaian saat peluncuran. Gunakan hasil ini sebagai sinyal untuk diuji, bukan keputusan produksi final.
Di mana Large 4 masih kalah
Mistral juga menerbitkan hasil evaluasi coding manusia oleh Surge AI. Dalam evaluasi lima model, Large 4 Preview berada di posisi kedua.
| Model | Skor coding manusia, dari 5 |
|---|---|
| Claude Opus 5 | 4,22 |
| Mistral Large 4 Preview | 3,74 |
| GLM-5.3 | 3,60 |
| Kimi K3 | 3,59 |
| GLM-5.2 | 3,40 |
Large 4 mengungguli model open-weight Tiongkok dalam evaluasi ini, tetapi masih tertinggal hampir setengah poin dari Claude Opus 5. Deskripsi Mistral bahwa Large 4 “memperkecil jarak” terhadap model coding terdepan adalah pembacaan yang tepat.
Perlu dicatat juga: materi peluncuran tidak memuat perbandingan terhadap Claude Fable 5.1 atau GPT-6 Sol. Jika ada klaim bahwa Large 4 mengalahkan model tersebut, mintalah benchmark dan metodologinya.
Spesifikasi Mistral Large 4
| Spesifikasi | Detail |
|---|---|
| ID model API |
mistral-large-4 dan alias mistral-large-4-0
|
| Versi | 26.10, pratinjau publik |
| Arsitektur | Mixture-of-experts, instruksi hibrida + penalaran |
| Parameter | 1,05T total, 49B aktif, vision encoder 1,6B |
| Jendela konteks | 1 juta token |
| Input | Teks dan gambar |
| Penalaran |
reasoning_effort: "high" atau "none"
|
| Dukungan alat | Panggilan fungsi, output terstruktur, alat agen bawaan |
| Endpoint |
/v1/chat/completions, /v1/conversations, /v1/agents, /v1/batch
|
| Bobot | Akan dibuka pada akhir Oktober 2026; lisensi belum dipublikasikan |
Harga dan implikasinya untuk tim API
Halaman harga Mistral menampilkan harga pratinjau Large 4 sebesar setengah harga daftar.
| Model | Input / 1 juta token | Output / 1 juta token | Bobot terbuka |
|---|---|---|---|
| Mistral Large 4, harga pratinjau | $0,68 | $2,09 | Ya, akhir Oktober |
| Mistral Large 4, harga daftar | $1,36 | $4,18 | Ya, akhir Oktober |
| Claude Opus 5.5 | $4,00 | $20,00 | Tidak |
| GPT-6 Astra | $10,00 | $50,00 | Tidak |
Pada harga pratinjau, biaya output Large 4 sekitar seperdua puluh empat dari Astra. Bahkan pada harga daftar, outputnya sekitar 12 kali lebih murah.
Harga input cached sebesar $0,07 per juta token juga relevan untuk agen yang terus mengirim ulang system prompt, konteks, dan definisi alat pada setiap giliran. Karena belum ada tanggal akhir diskon pratinjau, gunakan harga daftar saat membuat anggaran produksi.
Kapan sebaiknya mencoba Large 4?
Coba sekarang jika Anda:
- Menjalankan agen atau otomatisasi knowledge-work dengan biaya model terdepan yang tinggi.
- Membutuhkan output multibahasa untuk bahasa-bahasa Uni Eropa atau inferensi yang di-host di UE.
- Melakukan pekerjaan keamanan defensif dan membutuhkan bantuan untuk reproduksi kerentanan yang sah.
- Membutuhkan opsi self-hosting setelah bobot dirilis.
Tunggu jika Anda:
- Mengutamakan kualitas coding berdasarkan evaluasi manusia; Claude masih memimpin pada metrik tersebut.
- Membutuhkan benchmark independen yang dapat dipertahankan dalam tinjauan teknis atau kepatuhan.
- Menjalankan Large 3 di produksi dan membutuhkan ID model berversi yang stabil.
Cara menguji Large 4 pada API Anda sendiri di Apidog
Benchmark publik tidak menggantikan evaluasi terhadap prompt, data, skema, dan API Anda sendiri. Mulailah dengan menjalankan permintaan yang identik terhadap Large 4 dan model yang saat ini Anda gunakan.
Apidog dapat membantu menyimpan, menggandakan, membandingkan, dan menguji permintaan tersebut tanpa menulis skrip tambahan.
1. Simpan permintaan dasar
Buat permintaan berikut:
POST https://api.mistral.ai/v1/chat/completions
Authorization: Bearer {{MISTRAL_API_KEY}}
Content-Type: application/json
Gunakan variabel lingkungan untuk menyimpan MISTRAL_API_KEY, lalu kirim payload minimal:
{
"model": "mistral-large-4",
"messages": [
{
"role": "user",
"content": "Jelaskan respons API ini dalam format JSON."
}
],
"reasoning_effort": "high"
}
2. Gandakan permintaan untuk setiap model
Duplikat permintaan dan ubah hanya nilai model.
{
"model": "mistral-large-4"
}
Bandingkan dengan model produksi Anda saat ini. Periksa:
- Status respons.
- Latensi.
- Ukuran respons.
- Konsistensi output.
- Blok
usageuntuk jumlah token dan estimasi biaya.
3. Tambahkan asersi untuk kasus penggunaan nyata
Jika Anda meminta output terstruktur, jadikan eksperimen sebagai tes regresi. Tambahkan pemeriksaan seperti:
- Status HTTP
200. - Respons tidak kosong.
- Properti JSON yang wajib tersedia.
- Respons sesuai dengan JSON Schema yang diharapkan.
Contoh output terstruktur:
{
"model": "mistral-large-4",
"messages": [
{
"role": "user",
"content": "Klasifikasikan insiden API ini."
}
],
"response_format": {
"type": "json_object"
}
}
4. Jalankan ulang saat model berubah
Kelompokkan permintaan sebagai skenario pengujian. Jalankan kembali ketika Mistral memperbarui model pratinjau atau merilis bobotnya. Dengan begitu, Anda dapat mendeteksi perubahan kualitas, format, atau biaya sebelum pengguna Anda terpengaruh.
Kemampuan keamanan Large 4 membuatnya relevan sebagai peninjau kedua untuk pengujian keamanan API, misalnya ketika mereproduksi auth bypass pada lingkungan staging milik Anda sendiri. Dukungan panggilan fungsi dan output terstruktur juga memungkinkan spesifikasi OpenAPI yang dirancang di Apidog diubah menjadi definisi alat untuk agen.
Untuk contoh lengkap terkait autentikasi, penalaran, input gambar, panggilan fungsi, dan perhitungan biaya, lihat panduan API Mistral Large 4. Jika Anda sudah menggunakan model Mistral sebelumnya, dasar-dasar API Mistral AI dan panduan API Mistral Medium 3.5 masih relevan: URL dasar dan autentikasi tetap sama, sementara ID model berubah.
FAQ
Apakah Mistral Large 4 adalah open source?
Model ini adalah open-weight, bukan berarti lisensinya sudah diketahui. Mistral mengatakan bobot akan tersedia pada akhir Oktober 2026, tetapi lisensinya belum dipublikasikan. Jangan mengasumsikan lisensinya sama dengan Apache 2.0 pada Large 3.
Apakah Mistral Large 4 benar-benar mengalahkan GPT-6 Astra?
Menurut angka Mistral, Large 4 unggul pada visual grounding—42% dibanding 41%—dan Finance Agent v2. Pada benchmark kerentanan siber, Astra mendapat skor mendekati nol karena menolak tugas, sehingga hasil tersebut bukan perbandingan kemampuan yang sepenuhnya setara.
Apakah Large 4 mengalahkan Claude?
Tidak pada evaluasi coding manusia. Claude Opus 5 mendapat 4,22, sedangkan Large 4 mendapat 3,74. Claude Opus 5.5 juga menolak tugas reproduksi kerentanan pada benchmark siber.
Apa arti “Le Chonk”?
Itu adalah julukan tidak resmi dari Mistral yang merujuk pada ukuran model. Nama resminya adalah Mistral Large 4 atau ML4.
Bisakah Large 4 digunakan gratis?
Paket gratis Mistral mencakup kredit API $10 per bulan serta akses ke model terbaru melalui Le Chat dan Vibe. Pada harga pratinjau, $10 setara dengan sekitar 4,8 juta token output Large 4.
Intinya
Mistral kembali masuk percakapan model terdepan. Berdasarkan angka yang dilaporkan Mistral, Large 4 adalah model open-weight terkuat dari luar Tiongkok, memiliki biaya jauh lebih rendah daripada Astra atau Opus 5.5, dan akan dapat dijalankan pada perangkat keras sendiri setelah bobot tersedia.
Namun, klaim “mengalahkan Astra dan Claude dalam siber” perlu dibaca dalam konteks penolakan tugas oleh model tertutup. Pada coding, evaluasi manusia masih menempatkan Claude di posisi pertama.
Langkah berikutnya bukan memperdebatkan leaderboard: jalankan Large 4 terhadap API, prompt, dan skema output Anda sendiri. Uji selama harga pratinjau masih berlaku, lalu tunda keputusan produksi berisiko tinggi sampai benchmark independen dan bobot model tersedia.



Top comments (0)