EN
en direct
IA

Le meilleur modèle d’IA est open source — et il tourne sur votre cluster

**Mistral Large 3**, **Llama 4 Maverick** et **DeepSeek-V3** ont atteint la parité avec les modèles fermés de référence. Voici pourquoi le monopole **GPT-5** et **Claude 4** est terminé, et ce que ça change pour vos déploiements.

Voûte de bibliothèque ouverte — les poids de modèles IA déferlent comme des livres dorés sur une place publique, sans gardiens

Décembre 2025, Mistral AI sort Large 3, un modèle MoE de 675 milliards de paramètres sous licence Apache 2.0. Avril 2025, Meta livre Llama 4 Maverick, 400 milliards de paramètres en open-weight. Décembre 2024, le chinois DeepSeek publie V3, 671 milliards de paramètres avec un tarif API défiant toute concurrence. En juillet 2026, la question n’est plus « est-ce que l’open source rattrapera un jour les modèles fermés ? » — elle est « combien vous coûte votre dépendance à une API propriétaire ? ».

Le paysage open source en juillet 2026

Il y a dix-huit mois, un ingénieur qui proposait un LLM open source en production essuyait un refus poli. Aujourd’hui, trois modèles ont rendu cet argument caduc.

Mistral Large 3 est le plus récent des trois. Sorti le 2 décembre 2025, c’est un mixture-of-experts avec 41 milliards de paramètres actifs sur un total de 675 milliards, entraîné sur 3 000 GPU NVIDIA H200. Sous licence Apache 2.0, il est librement téléchargeable, modifiable et redéployable — y compris en usage commercial. Il occupe la 2ᵉ place du classement LMArena pour les modèles open source non-reasoning, avec un score de 85,5 % sur MMLU (8 langues) et 92 % pass@1 sur HumanEval. Son contexte de 256 000 tokens et son support natif de 40+ langues en font le modèle le plus polyvalent pour les déploiements multilingues.

Llama 4 Maverick, livré par Meta en avril 2025, oppose une approche différente : 400 milliards de paramètres en MoE multimodal natif, capable de traiter texte et images dans une même inférence. Sa variante Scout propose un contexte de 10 millions de tokens — assez pour ingérer un codebase entier en une seule requête. La licence Llama 4 Community License est plus restrictive que l’Apache 2.0, mais les poids restent gratuits et téléchargeables. Meta a annoncé en juillet 2026 que la version Behemoth — le modèle dense qui devait couronner la gamme — était officiellement abandonnée au profit d’une refonte architecturale, confirmant que l’avenir est aux MoE.

DeepSeek-V3, publié par le laboratoire chinois DeepSeek en décembre 2024, a été le déclencheur. Avec 671 milliards de paramètres pour seulement 37 milliards d’activés par token, il a prouvé qu’un MoE massif pouvait être servi à un coût ridicule : $0,27 par million de tokens en entrée, $1,10 en sortie — soit 5 à 10 fois moins cher que les API fermées de l’époque. Sa mise à jour V3-0324 de mars 2025 a encore amélioré ses capacités de raisonnement.

Le match : modèles ouverts contre modèles fermés

Comparons les forces en présence en juillet 2026 :

ModèleTypeParamètresContexteLicencePrix API (input / output, par M tokens)
Mistral Large 3Open source675B (41B actifs)256KApache 2.0$0,50 / $1,50
Llama 4 MaverickOpen-weight400B MoE1MLlama 4 CommunityGratuit (self-host) / variable cloud
DeepSeek-V3Open-weight671B (37B actifs)128KDeepSeek License$0,27 / $1,10
GPT-5FerméNon divulgué256KPropriétaire~$2,50 / $10,00
Claude 4FerméNon divulgué200KPropriétaire~$3,00 / $15,00

Trois conclusions sautent aux yeux.

Premièrement, l’écart de performance s’est refermé. Sur MMLU, Mistral Large 3 (85,5 %) talonne GPT-5 (~87 %) et Claude 4 (~86 %). Sur HumanEval, les trois modèles ouverts dépassent 90 % — un score qui aurait été impensable il y a un an. Les modèles fermés gardent un avantage sur les tâches de raisonnement extrême (GPQA Diamond, AIME), mais c’est un avantage académique : pour les cas d’usage en entreprise — RAG, summarization, code generation, traduction — les modèles ouverts sont dans la même catégorie.

Deuxièmement, l’écart de prix est un gouffre. Servir un million de tokens via l’API de GPT-5 coûte $10, contre $1,50 chez Mistral Large 3 et $1,10 chez DeepSeek-V3. Mais le vrai game-changer, c’est le self-hosting : un Llama 4 Maverick auto-hébergé sur un cluster 8×H100 ne coûte que l’électricité et l’amortissement matériel. Pour une entreprise qui traite 100 millions de tokens par jour, la différence se chiffre en centaines de milliers de dollars par mois.

Troisièmement, la licence change tout. Apache 2.0 (Mistral Large 3) autorise la modification, la redistribution et l’usage commercial sans restriction. C’est la licence qui a fait décoller l’écosystème Linux il y a trente ans — et elle fait le même effet sur l’écosystème LLM. À côté, les licences propriétaires de Meta et DeepSeek limitent l’usage commercial au-delà d’un certain seuil de revenus. Les entreprises qui veulent du future-proof choisissent Apache 2.0.

Ce que ça change pour les entreprises

Le passage à l’open source n’est pas qu’une question de coût. Il transforme la manière dont les équipes déploient l’IA.

La souveraineté des données devient atteignable. Un Mistral Large 3 sur un cluster interne traite les documents sans jamais quitter le réseau de l’entreprise — pas de données qui transitent par une API tierce, pas de clause de data usage à négocier avec un fournisseur américain. Pour les secteurs régulés (banque, santé, défense), c’est un argument qui pèse plus lourd que le prix.

La personnalisation est déverrouillée. Un modèle Apache 2.0 se fine-tune sur les données métier sans demander l’autorisation de personne. HSBC a signé un partenariat multi-années avec Mistral AI en 2025 pour déployer des modèles custom dans l’ensemble de la banque. BNP Paribas a suivi. Le motif est clair : un modèle généraliste fine-tuné sur vos données bat un modèle fermé généraliste — et ce n’est même plus un débat.

La latence s’effondre. Un modèle self-hosté ne traverse pas Internet. Pour des applications interactives (chatbots, copilotes IDE, assistants temps réel), le gain de latence est immédiatement perceptible par l’utilisateur final.

Les limites à connaître

L’open source n’est pas magique. Trois réalités tempèrent l’enthousiasme.

Le coût d’infrastructure n’est pas nul. Faire tourner un Llama 4 Maverick demande un cluster 8×H100 ou équivalent — un investissement de $200 000 à $300 000 en cloud par an, ou un CAPEX matériel conséquent. Mistral Large 3 est plus efficient grâce à la quantification NVFP4 et au support vLLM, mais il faut toujours un nœud 8×A100 pour le servir confortablement. Les petites équipes continueront d’utiliser les API — et c’est très bien comme ça.

La maintenance n’est pas gratuite. Un modèle self-hosté, c’est du MLOps : mises à jour de poids, basculements de version, monitoring de latence, scaling horizontal. Les équipes qui n’ont pas cette compétence en interne paieront un fournisseur cloud pour l’abstraire — le coût remonte mécaniquement.

Les modèles fermés gardent une avance sur le multimodal. GPT-5 et Claude 4 traitent nativement l’audio et la vidéo, ce que ni Mistral Large 3 (texte + images uniquement) ni DeepSeek-V3 (texte seul) ne font. Llama 4 Maverick est multimodal texte+image, mais la vidéo reste une exclusivité fermée. Cet écart est réel pour les cas d’usage médias.

Le verdict

Si vous déployez un LLM en production en juillet 2026, le choix par défaut a changé.

Prenez Mistral Large 3 si vous avez besoin d’une licence permissive (Apache 2.0), d’un déploiement multilingue, ou d’une intégration fine-tunée dans un secteur régulé. C’est le meilleur compromis performance/licence/coût du marché.

Prenez Llama 4 Maverick si vous traitez de très longs contextes (codebase entiers, documents juridiques) et que la licence communautaire de Meta ne pose pas de problème pour votre cas d’usage. Son contexte de 10 millions de tokens via Scout est sans équivalent.

Prenez DeepSeek-V3 si le budget est votre critère numéro un et que votre charge est majoritairement anglophone ou chinoise. Son tarif API reste imbattable, et la version self-hostée est la plus légère des trois — elle passe sur 4×H100 en FP8.

Gardez GPT-5 ou Claude 4 si vous avez besoin du multimodal vidéo natif, ou si votre use case repose sur du raisonnement mathématique de très haut niveau (compétition, preuve formelle). Pour tout le reste, le meilleur modèle du monde n’est plus fermé. Il est téléchargeable sur Hugging Face.

Références

Le brief cyber, chaque mardi

Les failles qui comptent, les correctifs à appliquer, en dix minutes de lecture.

Pas de spam. Désinscription en un clic.
à lire ensuite

Sur le même sujet

← Retour au fil

Tapez au moins deux caractères.

naviguer ouvrir esc fermer