← Tous les articles

Mistral Large 4 : là où le modèle français rivalise déjà avec des IA américaines et chinoises

9 octobre 2026 — Emmanuel Derrien

Mistral Large 4 : là où le modèle français rivalise déjà avec des IA américaines et chinoises

Le mardi 6 octobre 2026, Mistral a ouvert la préversion publique (une version préliminaire, encore en mise au point) de Mistral Large 4. Son annonce le surnomme « le Chonk », un clin d'œil à sa taille. Pour l'Europe, c'est un vrai rendez-vous. Artificial Analysis, un évaluateur indépendant qui fait passer les mêmes tests à tous les modèles, l'a présenté dès sa sortie comme le modèle le plus intelligent conçu hors des États-Unis et de la Chine. Il ne détrône pas les leaders. Mais sur plusieurs usages qui comptent pour une entreprise, il rivalise déjà avec des modèles américains et chinois très réputés, et passe parfois devant.

De quoi parle-t-on ? D'un très gros modèle : environ 1 000 milliards de paramètres (les réglages internes appris à l'entraînement, une mesure de sa taille). Mais il n'en mobilise que 52 milliards pour chaque morceau de mot qu'il écrit, selon Mistral (49 milliards selon Artificial Analysis et une partie de la presse). Il lit le texte et l'image, répond en texte et couvre plus de 160 langues. Il a été entraîné sur 3 800 GPU NVIDIA (les puces de calcul des IA) dans les centres de données européens de Mistral. Son entraînement se poursuit : les scores peuvent encore bouger.

Où se place-t-il ? Artificial Analysis calcule un indice général à partir de dix évaluations (travail de bureau, automatisation, code, sciences, connaissances, lecture de documents). Large 4 obtient 38, 64e sur 226 modèles. En tête, Claude Opus 5.5 est à 58, devant Claude Sonnet 5.5 (56) ; le meilleur modèle d'OpenAI, GPT-6 Astra, est à 53. Le premier modèle chinois, MiMo-V2.6-Pro, est à 46. Mistral se retrouve au niveau de GPT-6 Luna (38), juste derrière DeepSeek V4.1 Flash (39). Dans le graphique qui suit, la barre de Mistral est mise en avant : plus une barre est longue, plus le score est élevé. À retenir : une vingtaine de points le séparent du premier, l'écart est réel.

Un autre classement compte pour notre souveraineté, celui des modèles à poids ouverts (les fichiers du modèle, que l'on télécharge pour le faire tourner sur ses propres serveurs). Au 9 octobre 2026, Artificial Analysis classe encore Large 4 comme propriétaire, puisque ses poids ne sont pas publiés. Une fois qu'ils le seront, il deviendrait le premier modèle ouvert conçu hors de Chine, devant tous les modèles ouverts américains, mais derrière plusieurs modèles chinois.

Là où ça devient intéressant pour vous, c'est usage par usage, sur des benchmarks (des épreuves standardisées pour comparer les modèles). D'abord la finance. Vals.ai, un évaluateur américain indépendant, fait travailler les modèles en agents (des IA qui enchaînent seules les étapes) sur des tâches d'analyste financier. Dans son classement mis à jour le 7 octobre 2026, Mistral obtient 54,68 %, 22e sur 76. Il passe de justesse devant l'américain GPT-6 Astra (53,54 %) et le chinois Kimi K3 (53,11 %), et plus nettement devant le chinois DeepSeek V4 (44,08 %). Parmi les 21 modèles qui restent devant lui, on trouve notamment Gemini 4 Argon (65,40 %, pas encore ouvert au public), Claude Opus 5.5 (58,59 %) et MiMo-V2.6-Pro (57,34 %).

Le juridique, en revanche, divise les évaluateurs. Sur le test de Harvey, éditeur américain d'IA juridique, mesuré par Vals, Mistral obtient 15,83 %, 6e sur 76. Il devance nettement GPT-6 Astra (5,42 %) et Qwen3.8 Max (10,42 %). Face à Kimi K3 (12,92 %) et Grok 4.7 (12,50 %), son avance reste de l'ordre de sa marge d'erreur, près de 3 points. Cinq modèles font mieux, dont Muse Spark de Meta et Gemini 4 Argon (19,58 %). Mais Artificial Analysis publie sa propre version de ce test, qui met à zéro toute réponse contenant une invention grave. Au 9 octobre 2026, Mistral n'y est que 10e sur 25 (3,1 %), derrière Grok 4.7 (9,4 %), GPT-6 Astra (8,6 %) et Kimi K3 (5,3 %). Partout, les scores sont bas : le test est très difficile. À noter : Harvey travaille aussi avec Mistral, tous modèles confondus.

Troisième usage, les très longs documents, un gros contrat ou un rapport annuel par exemple. Sur AA-LCR, le test d'Artificial Analysis qui fait raisonner sur des textes très longs, Mistral obtient 81 %. Il est au coude-à-coude avec les chinois GLM-5.3 et Qwen3.8 Max (80 %) et devant l'américain Grok 4.7 (77 %). Mais d'autres font mieux : Kimi K3 (89 %), MiMo (86 %), Claude Opus 5.5 (85 %), DeepSeek V4.1 Flash (84 %), GPT-6 Luna et Claude Haiku 5.5 (83 %), dont plusieurs modèles bon marché. Ce qu'il peut lire d'un seul tenant (sa fenêtre de contexte) se compte en jetons, des morceaux de mots (voir Le vocabulaire de l'IA, rubrique COMPRENDRE). C'est 1 million selon sa documentation, autour de 520 000 selon Artificial Analysis et Vals.

Quatrième usage, l'automatisation de tâches. Sur AutomationBench, un test conçu par Zapier (un éditeur américain d'outils d'automatisation) et mesuré par Artificial Analysis, Mistral obtient 60 %. Il passe un peu devant les chinois MiMo (59 %), Kimi K3 (58 %) et Qwen3.8 Max (56 %). Il devance nettement deux modèles américains bon marché, GPT-6 Luna (53 %) et Claude Haiku 5.5 (35 %). DeepSeek V4.1 Flash (69 %), Grok 4.7 (66 %) et GLM-5.3 (62 %) font mieux, comme les modèles de tête, Gemini 4 Argon (77,5 %) et Claude Opus 5.5 (70 %). Le graphique qui suit réunit ces quatre usages, avec les chiffres de Vals pour la finance et le juridique. Dans chaque case, Mistral fait face aux modèles qu'il dépasse ; en gris, comme repère, un modèle mieux placé que lui. À retenir : il n'est premier sur aucun de ces quatre usages et certaines avances tiennent à un point, mais il passe régulièrement devant des modèles très réputés.

Reste la cybersécurité. Sur CyberGym-E2E-AA, l'IA doit trouver une vraie faille dans un logiciel libre (au code public) très utilisé, la reproduire, puis la corriger. Mistral y est premier des 19 modèles testés avec 81,7 %, devant MiMo-V2.6-Pro (78,6 %) et GPT-6 Luna (77,9 %). C'est ce même résultat que Mistral met en avant dans son annonce (82 %). Il y précise que Claude Opus 5.5 et GPT-6 Astra font près de zéro, parce qu'ils refusent la tâche. Artificial Analysis note d'ailleurs, le 8 octobre 2026, que c'est le test où l'on observe le plus de refus par sécurité. The Decoder, un site d'actualité spécialisé en IA, fait la même remarque. Cette première place tient donc en partie à ces refus. Sur l'ensemble des tests de cybersécurité, Mistral obtient 50, à égalité avec GLM-5.3-Flash, derrière Grok 4.7 et MiMo (56) et GPT-6 Luna (53).

Distinguons aussi ce que Mistral affirme de ce qui est mesuré par d'autres. Ses résultats face à GPT-6 Astra en finance et en juridique viennent des tests de Vals, consultables dans ses classements publics ; en juridique, Artificial Analysis aboutit à l'inverse. Le reste de ce que Mistral annonce lui-même n'a pas été vérifié par un tiers au 9 octobre 2026. C'est le cas, par exemple, d'un léger avantage sur GPT-6 Astra pour repérer des éléments précis dans une image (42 % contre 41 %).

Le revers de la médaille, c'est d'abord le coût. Selon Artificial Analysis, une tâche de son indice coûte en moyenne 1,13 $ avec Mistral. C'est moins que Kimi K3 (2,00 $), GPT-6 Astra (3,26 $) ou Grok 4.7 (3,74 $). Mais c'est plus de quatre fois plus que les modèles ouverts chinois d'intelligence comparable, comme DeepSeek V4.1 Flash (0,27 $) ou GLM-5.3-Flash (0,25 $). GPT-6 Luna, à note égale, coûte 0,07 $. Large 4 est aussi très bavard : 200 millions de jetons produits pour passer l'indice, contre 81 millions pour un modèle typique (la médiane des modèles testés). Dans le nuage de points qui suit, chaque modèle est placé selon son intelligence et le coût d'une tâche. Le meilleur rapport qualité-prix se trouve en haut à gauche (le plus intelligent pour le moins cher), et Mistral n'est pas encore dans ce coin-là.

Autre réserve, la fiabilité. Sur AA-Omniscience, qui mesure les connaissances et pénalise les hallucinations (les réponses inventées présentées comme vraies), Mistral obtient -5, contre +46 pour Claude Opus 5.5 et +30 pour Gemini 3.8 Flash. L'échelle va de -100 à +100 : sous zéro, un modèle donne plus de réponses fausses que de réponses justes. Sur ce test, il est à égalité avec DeepSeek V4.1 Flash parmi les plus faibles des modèles comparés. Sur deux autres épreuves de niveau expert d'Artificial Analysis, CritPt et Humanity's Last Exam, il est le plus faible, hormis gpt-oss, le modèle ouvert d'OpenAI.

Comment l'essayer ? Par l'API de Mistral (le branchement qui permet à un logiciel d'appeler le modèle), en préversion sur Mistral Studio. Tarif normal : 1,36 $ par million de jetons envoyés et 4,18 $ par million de jetons produits. Au 9 octobre 2026, sa documentation l'affiche à moitié prix (0,68 $ et 2,09 $). Cette remise vaut pour les deux semaines qui suivent le lancement du 6 octobre ; la documentation n'en donne pas la date de fin exacte. En revanche, son arrivée dans Vibe, l'assistant de Mistral (l'ex-Le Chat), n'est pas confirmée officiellement.

Et ensuite ? Mistral promet les poids « d'ici la fin du mois », soit fin octobre 2026. La date du 27 octobre 2026, rapportée par la presse, ne figure pas sur ses pages officielles. La licence (les conditions d'utilisation des fichiers) n'est pas annoncée : on ne sait pas encore ce qu'une entreprise pourra en faire. Côté clients, Mistral revendique plus de 125 grandes entreprises, dont Airbus, ASML et HSBC, tous modèles confondus (page de sa levée de fonds de septembre 2026). Pour Large 4, aucun client n'est encore nommé. La fiche de Mistral, mise à jour pour Large 4, est dans Les Outils IA (rubrique COMPRENDRE).

L'avis d'Emmanuel

Je vais être franc : cette sortie me fait plaisir. Pas parce que Mistral serait devenu le meilleur modèle du monde : il ne l'est pas, et une vingtaine de points le séparent du premier. Mais parce qu'un modèle entraîné en Europe passe devant des noms américains et chinois réputés sur certains usages qui parlent aux entreprises, surtout l'automatisation et, de peu, la finance. Sur le juridique et les très longs documents, les résultats sont plus partagés selon les évaluateurs. Pour notre souveraineté, c'est un signal concret, pas un slogan.

Faut-il changer d'outil pour autant ? Ma réponse est une réponse de prudence. C'est une préversion : les scores peuvent bouger, et les poids comme la licence ne sont pas encore là. Il coûte plus cher par tâche que les modèles ouverts chinois de même niveau, et il se trompe plus souvent sur les faits que les meilleurs. Mon réflexe, que je vous livre comme une préconisation : si vous avez un cas précis (une analyse financière, l'automatisation d'une tâche répétitive, une revue de contrats), faites-le tester par votre équipe technique ou un partenaire. Par l'API, sur des documents non sensibles, face à l'outil que vous utilisez déjà. Comparez la qualité des réponses, le coût réel et le temps de relecture. Et gardez un humain pour vérifier chaque chiffre et chaque fait.

Je suivrai de près la publication des poids, promise pour la fin octobre 2026, et surtout la licence. C'est elle qui dira si vous pourrez un jour le faire tourner sur vos propres serveurs. D'ici là, une question à vous poser : sur quel usage précis de votre entreprise un modèle européen aurait-il déjà sa place ?

Sources : mistral.ai · docs.mistral.ai · artificialanalysis.ai · artificialanalysis.ai · artificialanalysis.ai · artificialanalysis.ai · artificialanalysis.ai · artificialanalysis.ai · vals.ai · vals.ai · vals.ai · techcrunch.com · the-decoder.com

Cet article est extrait de la veille IA de LessentIAl, la plateforme d'Emmanuel Derrien : l'actualité de l'intelligence artificielle filtrée, expliquée, et reliée à ce qu'elle change concrètement pour votre entreprise.

Partager sur LinkedIn Envoyer par e-mail

Journal LessentIAl · N°2

Recevez le journal en PDF

Votre adresse e-mail suffit : le journal s'ouvre juste après, ici même.