Le meilleur modèle d’IA est open source — et il tourne sur votre cluster
**Mistral Large 3**, **Llama 4 Maverick** et **DeepSeek-V3** ont atteint la parité avec les modèles fermés de référence. Voici pourquoi le monopole **GPT-5** et **Claude 4** est terminé, et ce que ça change pour vos déploiements.
Décembre 2025, Mistral AI sort Large 3, un modèle MoE de 675 milliards de paramètres sous licence Apache 2.0. Avril 2025, Meta livre Llama 4 Maverick, 400 milliards de paramètres en open-weight. Décembre 2024, le chinois DeepSeek publie V3, 671 milliards de paramètres avec un tarif API défiant toute concurrence. En juillet 2026, la question n’est plus « est-ce que l’open source rattrapera un jour les modèles fermés ? » — elle est « combien vous coûte votre dépendance à une API propriétaire ? ».
Le paysage open source en juillet 2026
Il y a dix-huit mois, un ingénieur qui proposait un LLM open source en production essuyait un refus poli. Aujourd’hui, trois modèles ont rendu cet argument caduc.
Mistral Large 3 est le plus récent des trois. Sorti le 2 décembre 2025, c’est un mixture-of-experts avec 41 milliards de paramètres actifs sur un total de 675 milliards, entraîné sur 3 000 GPU NVIDIA H200. Sous licence Apache 2.0, il est librement téléchargeable, modifiable et redéployable — y compris en usage commercial. Il occupe la 2ᵉ place du classement LMArena pour les modèles open source non-reasoning, avec un score de 85,5 % sur MMLU (8 langues) et 92 % pass@1 sur HumanEval. Son contexte de 256 000 tokens et son support natif de 40+ langues en font le modèle le plus polyvalent pour les déploiements multilingues.
Llama 4 Maverick, livré par Meta en avril 2025, oppose une approche différente : 400 milliards de paramètres en MoE multimodal natif, capable de traiter texte et images dans une même inférence. Sa variante Scout propose un contexte de 10 millions de tokens — assez pour ingérer un codebase entier en une seule requête. La licence Llama 4 Community License est plus restrictive que l’Apache 2.0, mais les poids restent gratuits et téléchargeables. Meta a annoncé en juillet 2026 que la version Behemoth — le modèle dense qui devait couronner la gamme — était officiellement abandonnée au profit d’une refonte architecturale, confirmant que l’avenir est aux MoE.
DeepSeek-V3, publié par le laboratoire chinois DeepSeek en décembre 2024, a été le déclencheur. Avec 671 milliards de paramètres pour seulement 37 milliards d’activés par token, il a prouvé qu’un MoE massif pouvait être servi à un coût ridicule : $0,27 par million de tokens en entrée, $1,10 en sortie — soit 5 à 10 fois moins cher que les API fermées de l’époque. Sa mise à jour V3-0324 de mars 2025 a encore amélioré ses capacités de raisonnement.
Le match : modèles ouverts contre modèles fermés
Comparons les forces en présence en juillet 2026 :
| Modèle | Type | Paramètres | Contexte | Licence | Prix API (input / output, par M tokens) |
|---|---|---|---|---|---|
| Mistral Large 3 | Open source | 675B (41B actifs) | 256K | Apache 2.0 | $0,50 / $1,50 |
| Llama 4 Maverick | Open-weight | 400B MoE | 1M | Llama 4 Community | Gratuit (self-host) / variable cloud |
| DeepSeek-V3 | Open-weight | 671B (37B actifs) | 128K | DeepSeek License | $0,27 / $1,10 |
| GPT-5 | Fermé | Non divulgué | 256K | Propriétaire | ~$2,50 / $10,00 |
| Claude 4 | Fermé | Non divulgué | 200K | Propriétaire | ~$3,00 / $15,00 |
Trois conclusions sautent aux yeux.
Premièrement, l’écart de performance s’est refermé. Sur MMLU, Mistral Large 3 (85,5 %) talonne GPT-5 (~87 %) et Claude 4 (~86 %). Sur HumanEval, les trois modèles ouverts dépassent 90 % — un score qui aurait été impensable il y a un an. Les modèles fermés gardent un avantage sur les tâches de raisonnement extrême (GPQA Diamond, AIME), mais c’est un avantage académique : pour les cas d’usage en entreprise — RAG, summarization, code generation, traduction — les modèles ouverts sont dans la même catégorie.
Deuxièmement, l’écart de prix est un gouffre. Servir un million de tokens via l’API de GPT-5 coûte $10, contre $1,50 chez Mistral Large 3 et $1,10 chez DeepSeek-V3. Mais le vrai game-changer, c’est le self-hosting : un Llama 4 Maverick auto-hébergé sur un cluster 8×H100 ne coûte que l’électricité et l’amortissement matériel. Pour une entreprise qui traite 100 millions de tokens par jour, la différence se chiffre en centaines de milliers de dollars par mois.
Troisièmement, la licence change tout. Apache 2.0 (Mistral Large 3) autorise la modification, la redistribution et l’usage commercial sans restriction. C’est la licence qui a fait décoller l’écosystème Linux il y a trente ans — et elle fait le même effet sur l’écosystème LLM. À côté, les licences propriétaires de Meta et DeepSeek limitent l’usage commercial au-delà d’un certain seuil de revenus. Les entreprises qui veulent du future-proof choisissent Apache 2.0.
Ce que ça change pour les entreprises
Le passage à l’open source n’est pas qu’une question de coût. Il transforme la manière dont les équipes déploient l’IA.
La souveraineté des données devient atteignable. Un Mistral Large 3 sur un cluster interne traite les documents sans jamais quitter le réseau de l’entreprise — pas de données qui transitent par une API tierce, pas de clause de data usage à négocier avec un fournisseur américain. Pour les secteurs régulés (banque, santé, défense), c’est un argument qui pèse plus lourd que le prix.
La personnalisation est déverrouillée. Un modèle Apache 2.0 se fine-tune sur les données métier sans demander l’autorisation de personne. HSBC a signé un partenariat multi-années avec Mistral AI en 2025 pour déployer des modèles custom dans l’ensemble de la banque. BNP Paribas a suivi. Le motif est clair : un modèle généraliste fine-tuné sur vos données bat un modèle fermé généraliste — et ce n’est même plus un débat.
La latence s’effondre. Un modèle self-hosté ne traverse pas Internet. Pour des applications interactives (chatbots, copilotes IDE, assistants temps réel), le gain de latence est immédiatement perceptible par l’utilisateur final.
Les limites à connaître
L’open source n’est pas magique. Trois réalités tempèrent l’enthousiasme.
Le coût d’infrastructure n’est pas nul. Faire tourner un Llama 4 Maverick demande un cluster 8×H100 ou équivalent — un investissement de $200 000 à $300 000 en cloud par an, ou un CAPEX matériel conséquent. Mistral Large 3 est plus efficient grâce à la quantification NVFP4 et au support vLLM, mais il faut toujours un nœud 8×A100 pour le servir confortablement. Les petites équipes continueront d’utiliser les API — et c’est très bien comme ça.
La maintenance n’est pas gratuite. Un modèle self-hosté, c’est du MLOps : mises à jour de poids, basculements de version, monitoring de latence, scaling horizontal. Les équipes qui n’ont pas cette compétence en interne paieront un fournisseur cloud pour l’abstraire — le coût remonte mécaniquement.
Les modèles fermés gardent une avance sur le multimodal. GPT-5 et Claude 4 traitent nativement l’audio et la vidéo, ce que ni Mistral Large 3 (texte + images uniquement) ni DeepSeek-V3 (texte seul) ne font. Llama 4 Maverick est multimodal texte+image, mais la vidéo reste une exclusivité fermée. Cet écart est réel pour les cas d’usage médias.
Le verdict
Si vous déployez un LLM en production en juillet 2026, le choix par défaut a changé.
Prenez Mistral Large 3 si vous avez besoin d’une licence permissive (Apache 2.0), d’un déploiement multilingue, ou d’une intégration fine-tunée dans un secteur régulé. C’est le meilleur compromis performance/licence/coût du marché.
Prenez Llama 4 Maverick si vous traitez de très longs contextes (codebase entiers, documents juridiques) et que la licence communautaire de Meta ne pose pas de problème pour votre cas d’usage. Son contexte de 10 millions de tokens via Scout est sans équivalent.
Prenez DeepSeek-V3 si le budget est votre critère numéro un et que votre charge est majoritairement anglophone ou chinoise. Son tarif API reste imbattable, et la version self-hostée est la plus légère des trois — elle passe sur 4×H100 en FP8.
Gardez GPT-5 ou Claude 4 si vous avez besoin du multimodal vidéo natif, ou si votre use case repose sur du raisonnement mathématique de très haut niveau (compétition, preuve formelle). Pour tout le reste, le meilleur modèle du monde n’est plus fermé. Il est téléchargeable sur Hugging Face.
Références
- Introducing Mistral 3 — Mistral AI, 2 décembre 2025
- Mistral Large 3 Model Card — Mistral AI Docs
- Mistral Large 3: An Open-Source MoE LLM Explained — IntuitionLabs, avril 2026
- Llama 4 Guide: Scout, Maverick, Behemoth — Codersera, 2026
- Meta Llama 4: The Complete Open-Source AI Model Guide — ExplainX, 2026
- Mistral AI raises $830M in debt to set up a data center near Paris — TechCrunch, 30 mars 2026
- Mistral Forge: Build your own AI — TechCrunch, 17 mars 2026
- LMArena Leaderboard