Mistral s'était fait discret sur le segment haut de gamme. Après Mistral Large 3, lancé en décembre 2025, les discussions autour des modèles open-weight de frontière se sont surtout concentrées sur Kimi, DeepSeek, GLM et Qwen. Le 6 octobre 2026, Mistral a répondu avec Mistral Large 4, un modèle de 1 000 milliards de paramètres surnommé « Le Chonk » par l'équipe.
Essayez Apidog dès aujourd'hui
Le chiffre le plus commenté est un benchmark de cybersécurité : Large 4 y atteint 82 %, tandis que Claude Opus 5.5 et GPT-6 Astra obtiennent un score proche de zéro. Ce résultat demande toutefois du contexte : les modèles fermés refusent la tâche, plutôt que de l'échouer. Voici les spécifications, les coûts, les limites et une méthode pour le tester contre vos propres API.
En bref
- Modèle : mixture-of-experts de 1,05 T de paramètres, dont 49 milliards actifs, avec un encodeur de vision de 1,6 milliard de paramètres.
- Entrées : texte et images, avec une fenêtre de contexte de 1 million de tokens.
-
Disponibilité : API Mistral en prévisualisation publique sous l'ID
mistral-large-4. Les poids sont annoncés avant la fin octobre 2026. - Prix : 1,36 $/M tokens en entrée et 4,18 $/M en sortie au tarif catalogue ; 0,68 $/M et 2,09 $/M pendant la prévisualisation. Les entrées mises en cache coûtent 0,07 $/M.
- Cybersécurité : 82 % au test de reproduction de vulnérabilités de l'indice AA Cyber. Les scores proches de zéro d'Opus 5.5 et Astra sont liés à leurs refus.
- Codage : Large 4 obtient 3,74/5 dans une évaluation humaine, contre 4,22/5 pour Claude Opus 5.
Pourquoi le retour de Mistral est crédible
Pendant une grande partie de 2026, les modèles open-weight les plus performants venaient principalement de Chine. Mistral a publié Medium 3.5, Devstral 2 et Small 4, mais aucun ne rivalisait directement avec les modèles fermés de pointe.
Large 4 repositionne Mistral sur ce terrain. L'entreprise affirme qu'il « surpasse significativement tout modèle open-weight développé aux États-Unis ou en Europe ». Le modèle a été entraîné de zéro sur 3 800 GPU NVIDIA Grace Blackwell dans les centres de données européens de Mistral. Il couvre plus de 160 langues, dont toutes les langues officielles de l'Union européenne.
Le calendrier est également notable : Large 4 est arrivé peu après l'annonce de Beam par Reflection. La course aux modèles open-weight compte donc un troisième acteur sérieux, aux côtés des modèles américains et chinois.
Le benchmark cyber : ce qu'il mesure réellement
L'indice Cyber d'Artificial Analysis inclut un test où le modèle doit reproduire une vulnérabilité réelle dans un projet open source, puis proposer un correctif. Mistral annonce un score de 82 % pour Large 4.
La nuance est importante. Mistral précise que Claude Opus 5.5 et GPT-6 Astra obtiennent un score proche de zéro parce qu'ils refusent d'effectuer la tâche.
| Affirmation | Interprétation correcte |
|---|---|
| « Large 4 bat Astra et Opus 5.5 en cybersécurité » | Sur ce test, les modèles fermés refusent la demande. Large 4 répond et réussit souvent la reproduction. |
| « Large 4 est le meilleur modèle de piratage » | Non établi. Le refus est une décision de politique, pas une mesure directe de capacité. |
| « Large 4 est dangereux » | Non établi également. Mistral indique un taux de refus moyen élevé sur les requêtes cyber de JailbreakBench, StrongREJECT et AgentHarm, comparé aux autres modèles open-weight. |
Mistral rapporte aussi :
- 93 % sur Cybench, un ensemble de 40 exercices de capture du drapeau ;
- 93,3 % de résistance aux attaques sur le benchmark de sécurité des agents B3.
Pour une équipe sécurité, le cas d'usage pratique est défensif : reproduire une CVE dans votre propre environnement de staging, analyser un correctif ou examiner une surface d'attaque sans dépendre du filtre de politique d'un fournisseur tiers.
Performances hors cybersécurité
Les résultats les plus utiles face à GPT-6 Astra sont ceux où les deux modèles exécutent réellement la tâche.
| Benchmark | Mistral Large 4 | GPT-6 Astra | Lecture |
|---|---|---|---|
| Dense 200, ancrage visuel | 42 % | 41 % | Avantage réel, mais limité à un point. |
| Finance Agent v2 (vals.ai) | Devant | Derrière | Mistral publie le classement, pas les scores. |
| Benchmark juridique Harvey | Meilleur modèle ouvert | Listé | Aucun score de comparaison directe n'est publié. |
Face aux autres modèles open-weight, l'écart rapporté est plus marqué :
| Benchmark | Mistral Large 4 | Référence battue |
|---|---|---|
| AutomationBench, 657 workflows | 59,9 % | Kimi K3, DeepSeek V4 Pro |
| AA-Briefcase, travail de connaissance | 1 393 Elo | DeepSeek V4 Pro |
| DeepSWE v1.1, codage | 61,7 % | Leader open-weight |
| SWE-Atlas-QnA | 59,4 % | — |
| Terminal-Bench 4.0 | 28,3 % | — |
Ces chiffres proviennent de Mistral et portent sur un modèle en prévisualisation. Aucun laboratoire indépendant ne les a encore reproduits. Utilisez-les comme un signal pour lancer vos tests, pas comme un verdict de production.
Là où Large 4 reste derrière
Mistral publie aussi une comparaison où un modèle fermé conserve une avance nette. Dans une évaluation humaine de qualité de code menée par Surge AI, Large 4 Preview arrive deuxième.
| Modèle | Score humain de codage, sur 5 |
|---|---|
| Claude Opus 5 | 4,22 |
| Mistral Large 4 Preview | 3,74 |
| GLM-5.3 | 3,60 |
| Kimi K3 | 3,59 |
| GLM-5.2 | 3,40 |
Large 4 dépasse les modèles open-weight chinois inclus dans cette comparaison, mais reste à environ un demi-point de Claude Opus 5. La formulation de Mistral — « combler l'écart » avec les modèles de pointe en codage — est donc raisonnable.
Les documents de lancement ne contiennent pas de comparaison avec Claude Fable 5.1 ou GPT-6 Sol. Si vous voyez une affirmation sur ce point, demandez le benchmark, le prompt et la configuration d'inférence.
Spécifications à intégrer
| Spécification | Mistral Large 4 |
|---|---|
| ID API |
mistral-large-4, alias mistral-large-4-0
|
| Version | 26.10, prévisualisation publique |
| Architecture | Mixture-of-experts, hybride instructif + raisonnement |
| Paramètres | 1,05 T au total, 49 milliards actifs, encodeur vision de 1,6 milliard |
| Fenêtre de contexte | 1 million de tokens |
| Entrées | Texte et images |
| Raisonnement |
reasoning_effort : "high" ou "none"
|
| Outils | Appel de fonctions, sorties structurées, outils d'agent intégrés |
| Endpoints |
/v1/chat/completions, /v1/conversations, /v1/agents, /v1/batch
|
| Poids | Annoncés avant fin octobre 2026 ; licence non publiée |
Prix : calculez avec le tarif catalogue
La page de tarification Mistral affiche un tarif de prévisualisation réduit de moitié.
| Modèle | Entrée / 1M tokens | Sortie / 1M tokens | Poids ouverts |
|---|---|---|---|
| Mistral Large 4, prévisualisation | 0,68 $ | 2,09 $ | Oui, fin octobre |
| Mistral Large 4, catalogue | 1,36 $ | 4,18 $ | Oui, fin octobre |
| Claude Opus 5.5 | 4,00 $ | 20,00 $ | Non |
| GPT-6 Astra | 10,00 $ | 50,00 $ | Non |
Au tarif de prévisualisation, la sortie de Large 4 coûte environ un vingt-quatrième de celle d'Astra. Même au tarif catalogue, elle reste environ douze fois moins chère en sortie.
Le tarif des entrées mises en cache, 0,07 $/M tokens, est particulièrement pertinent pour les agents. Si vous réutilisez à chaque tour une instruction système longue, un schéma OpenAPI ou des définitions d'outils, activez et mesurez le cache dans vos tests.
Mistral n'a pas indiqué de date de fin pour la réduction de prévisualisation. Construisez donc votre budget sur le prix catalogue.
Décider si vous devez le tester
Testez Large 4 dès maintenant si :
- vous exécutez des agents ou des workflows d'automatisation et souhaitez réduire vos coûts ;
- vous avez besoin de sorties multilingues ou d'une inférence hébergée dans l'Union européenne ;
- vous réalisez des travaux de sécurité défensive et rencontrez des refus sur des scénarios légitimes de reproduction de vulnérabilités ;
- vous souhaitez évaluer un modèle que vous pourrez potentiellement auto-héberger.
Attendez avant de migrer en production si :
- la qualité de code évaluée par des humains est votre métrique principale ;
- vous devez défendre vos choix sur la base de benchmarks indépendants ;
- vous utilisez déjà Large 3 en production et avez besoin d'un ID de modèle versionné stable.
Tester Large 4 contre vos propres API avec Apidog
Les benchmarks publics ne reflètent pas nécessairement vos prompts, vos outils, vos données ou vos contraintes de latence. La méthode la plus utile consiste à exécuter le même jeu de requêtes avec Large 4 et votre modèle actuel.
Apidog permet de mettre en place ce test sans écrire de couche intermédiaire.
1. Créez la requête de base
Configurez une requête :
POST https://api.mistral.ai/v1/chat/completions
Authorization: Bearer {{MISTRAL_API_KEY}}
Content-Type: application/json
Placez la clé dans une variable d'environnement plutôt que dans la collection ou le corps de la requête.
Exemple minimal :
{
"model": "mistral-large-4",
"messages": [
{
"role": "user",
"content": "Résume cette spécification OpenAPI et identifie les opérations à risque."
}
],
"reasoning_effort": "high"
}
2. Dupliquez la requête pour chaque modèle
Clonez la requête et modifiez uniquement le champ model. Gardez identiques :
- le prompt ;
- la température et les autres paramètres ;
- les outils et les schémas de sortie ;
- les données de test.
Comparez ensuite la réponse, le statut HTTP, la latence, la taille de réponse et le bloc usage. Cela vous permet de calculer le coût réel à partir des tokens consommés, plutôt que de comparer uniquement le prix catalogue.
3. Ajoutez des assertions de régression
Pour une sortie structurée, vérifiez au minimum :
- un statut HTTP
200; - une réponse non vide ;
- la présence des champs attendus ;
- la conformité au schéma JSON ;
- l'absence de contenu interdit ou hors périmètre.
Exemple de critères à automatiser :
status == 200
choices[0].message.content != ""
response respecte le schéma attendu
usage.total_tokens > 0
Vous transformez ainsi une comparaison ponctuelle en suite de régression réutilisable.
4. Réexécutez le scénario à chaque mise à jour
Regroupez les requêtes dans un scénario de test. Relancez-le lorsque Mistral met à jour la prévisualisation ou publie les poids. Surveillez notamment :
- la variation de qualité ;
- les taux d'échec ;
- la latence p50 et p95 ;
- le volume de tokens ;
- le coût par tâche réussie.
Les fonctions d'appel et les sorties structurées de Large 4 sont adaptées aux workflows API. Vous pouvez par exemple convertir une spécification OpenAPI conçue dans Apidog en définitions d'outils utilisables par un agent.
Pour aller plus loin, consultez le guide API Mistral Large 4, qui couvre les clés, les blocs de raisonnement, les images, l'appel de fonctions et le calcul des coûts.
Pour les cas de sécurité défensive, utilisez Large 4 comme second relecteur lors de vos tests de sécurité API, par exemple pour analyser un contournement d'authentification dans une API de staging.
Si vous migrez depuis un ancien modèle Mistral, les bases de l'API Mistral AI et le guide API Mistral Medium 3.5 restent applicables : même URL de base, même authentification, nouvel ID de modèle.
FAQ
Mistral Large 4 est-il open source ?
Il est annoncé comme open-weight. Mistral prévoit de publier les poids avant fin octobre 2026. La licence n'est pas encore publiée : ne supposez pas qu'elle sera identique à l'Apache 2.0 de Large 3.
Mistral Large 4 bat-il vraiment GPT-6 Astra ?
Selon les chiffres de Mistral, oui sur l'ancrage visuel, avec 42 % contre 41 %, et sur Finance Agent v2. Sur le test de reproduction de vulnérabilités, Astra refuse la tâche : ce n'est donc pas une comparaison directe de capacité.
Bat-il Claude ?
Pas sur l'évaluation humaine de codage publiée : Claude Opus 5 obtient 4,22/5, contre 3,74/5 pour Large 4 Preview. Claude Opus 5.5 refuse également la tâche de reproduction cyber utilisée dans le benchmark mentionné plus haut.
Que signifie « Le Chonk » ?
C'est le surnom officieux donné au modèle par Mistral, en référence à sa taille. Son nom officiel est Mistral Large 4, ou ML4.
Puis-je l'utiliser gratuitement ?
Le plan gratuit de Mistral inclut 10 $ mensuels de crédits API et l'accès aux modèles récents dans Le Chat et Vibe. Au prix de prévisualisation annoncé, 10 $ correspondent à environ 4,8 millions de tokens de sortie sur Large 4.
En résumé
Mistral revient dans la conversation des modèles de pointe avec un modèle open-weight à très grande échelle, une fenêtre de contexte de 1 million de tokens et des prix API agressifs.
Le signal cyber est intéressant, mais doit être interprété correctement : les modèles fermés obtiennent un score faible parce qu'ils refusent la tâche. En codage évalué par des humains, Large 4 arrive derrière Claude Opus 5.
La décision pratique est simple : testez Large 4 sur vos propres prompts, outils et API pendant la période de prévisualisation, mesurez la qualité, la latence et le coût par tâche réussie, puis attendez des benchmarks indépendants avant une migration de production.



Top comments (0)