EN
en direct
IA

MiniCPM5-2B place un modèle ouvert de 2,5 milliards de paramètres au-dessus des modèles 4B

OpenBMB a publié MiniCPM5-2B, un modèle dense de 2,5 milliards de paramètres sous licence Apache-2.0, qui atteint 53,9 de moyenne et devance tous les modèles ouverts 4B de son comparatif, en publiant intégralement ses données d’entraînement UltraData. Si vous déployez de l’IA locale ou embarquée, ce modèle change le calcul coût-capacité.

Un petit circuit imprimé nu posé seul au centre d’une étagère de serveur vide et surdimensionnée, un minuscule composant jaune ambre allumé.

7 septembre 2026. OpenBMB publie MiniCPM5-2B, le deuxième modèle de sa série MiniCPM5, après le MiniCPM5-1B. C’est un transformeur dense de 2,5 milliards de paramètres sous licence Apache-2.0, avec un contexte de 131 072 jetons. Son score moyen de 53,9 le place non seulement en tête des modèles ouverts de sa catégorie, mais au-dessus de tous les modèles 4B de son comparatif — le plus élevé plafonne à 51,1. Pourquoi c’est important : la frontière du « petit modèle capable » vient de bouger, et OpenBMB publie en même temps les données d’entraînement qui ont servi à le construire.

Un 2B qui bat les 4B sur la moyenne

Le chiffre qui saute aux yeux est la moyenne du radar de capacités. MiniCPM5-2B atteint 53,9, contre 51,1 pour Qwen3.5-4B, 42,7 pour granite-4.2-3B, 32,6 pour Nemotron-3-Nano-4B et 28,4 pour LFM2.5-8B-A1B. Dans sa propre catégorie, l’écart est encore plus net : Qwen3.5-2B plafonne à 28,0 et Gemma-4-E2B-it à 24,6.

Cette inversion n’est pas anodine. Elle signifie qu’un modèle deux fois plus petit, en nombre de paramètres, que Qwen3.5-4B livre plus de capacité sur le spectre mesuré. L’architecture est pourtant classique — un LlamaForCausalLM standard avec 42 couches, une attention GQA de 16 têtes de requête pour 2 têtes clé-valeur, et 1,98 milliard de paramètres hors embeddings.

Le gain se concentre là où on l’attend le moins d’un petit modèle : raisonnement mathématique, code, contexte long, usage d’outils et tâches agentiques.

Le contexte : la course aux petits modèles

MiniCPM5-2B s’inscrit dans une tendance de fond : la compression de la frontière. Là où, il y a deux ans, un modèle de 2 milliards de paramètres relevait encore de la curiosité de laboratoire, il rivalise aujourd’hui avec des modèles 4B qui passaient pour la limite basse du « sérieux ». Gemma, Phi, Qwen et LFM ont tous poussé dans la même direction, et OpenBMB — l’équipe de Tsinghua à l’origine de MiniCPM — s’est spécialisée sur ce créneau depuis la première génération.

La motivation n’est pas la prouesse. Elle est économique et pratique : un modèle qui tient en moins de 2 Go une fois quantifié en 4 bits peut tourner sur un téléphone, un nano-ordinateur ou une GPU d’entrée de gamme, sans envoyer la moindre donnée vers un cloud. Pour des cas d’usage de confidentialité ou de latence, c’est la seule architecture acceptable.

Les chiffres qui comptent pour un déploiement

Pour juger un modèle, la moyenne ne suffit pas. Voici les scores bruts sur les bancs d’essai qui décident un choix de production :

  • AIME 2025 et AIME 2026 : 86,5 sur les deux — au niveau de modèles bien plus gros.
  • LiveCodeBench v6 : 69,1, devant granite-4.2-3B (58,9) et Qwen3.5-4B (56,4).
  • MATH-500 : 94,6.
  • MMLU-Pro : 70,8.
  • SWE-bench Verified : 46,4 — très au-dessus des autres modèles 2B (6,0 pour LFM2.5-2.6B).
  • NoLiMa (contexte long) : 68,1, là où les autres modèles 2B s’effondrent (0,7 pour LFM2.5-2.6B) — un niveau qui autorise le traitement de documents entiers sans troncature.

Le tableau se nuance sur les épreuves les plus dures. Sur SWE-bench Pro, MiniCPM5-2B marque 14,4, contre 28,2 pour Qwen3.5-4B ; sur Terminal-Bench v2.1, 8,6 contre 25,8. Autrement dit : sur le codage agentique en environnement réel, les modèles 4B gardent l’avantage. La supériorité du 2B se joue sur la moyenne, pas sur tous les extrêmes.

Le recul reste indispensable face aux modèles frontières. Sur HLE (Humanity’s Last Exam), MiniCPM5-2B marque 8,9, quand les modèles de tête dépassent 30. Ce n’est donc pas un modèle qui « fait tout » : c’est un modèle qui maximise la capacité par octet de mémoire. La bonne lecture n’est pas « un 2B remplace un frontière », mais « un 2B remplace un 4B ».

Ce que « on-device » change concrètement

Déployer un LLM en local ne se résume pas à « ça marche sans connexion ». Trois propriétés en découlent directement :

  • Confidentialité. Les documents sensibles — contrats, données de santé, code interne — ne quittent jamais la machine.
  • Latence. Pas d’aller-retour réseau : la génération démarre immédiatement, un critère décisif pour un agent de code interactif.
  • Coût. Une fois le matériel amorti, le coût marginal par jeton est nul, là où un appel API reste facturé au million de jetons.

MiniCPM5-2B coche ces trois cases tout en publiant ses données et ses poids sous Apache-2.0 — ce qui signifie qu’une équipe peut auditer, fine-tuner et redistribuer sans négociation juridique préalable.

La vraie nouveauté n’est pas le modèle, c’est la publication des données

Ce qui distingue cette sortie, c’est ce qui l’accompagne. OpenBMB publie sous la famille UltraData les jeux utilisés pour entraîner le modèle :

  • UltraX, le corpus de pré-entraînement web de haute qualité ;
  • UltraData-Code, avec une gestion de code en niveaux L0–L3 pour expliquer le bond en programmation ;
  • UltraData-SFT-Agent-2609, 500 000 échantillons d’entraînement d’agent ;
  • UltraData-RL-2609, plus de 80 000 tâches d’apprentissage par renforcement couvrant mathématiques, code, connaissances générales et raisonnement long.

Dans un écosystème où la plupart des laboratoires gardent leurs recettes secrètes, publier les données ET les poids sous Apache-2.0 change la donne pour l’audit et la reproductibilité. C’est un argument de confiance autant qu’un argument technique.

Un écosystème de déploiement complet

Le modèle est décliné pour tous les runtimes du marché : BF16 (version finale post-entraînée en RL + OPD), GGUF pour llama.cpp, Ollama et LM Studio, MLX pour les puces Apple Silicon, GPTQ en 4 bits, et même un modèle brouillon DSpark pour accélérer l’inférence. On peut donc le faire tourner sur un ordinateur portable, un téléphone ou un cluster local sans dépendance cloud.

Le modèle brouillon DSpark mérite une précision : il sert au décodage spéculatif, une technique où un petit modèle génère des brouillons rapides que le modèle principal valide ensuite. OpenBMB fournit ici un draft dédié plutôt que d’obliger les équipes à en entraîner un elles-mêmes, ce qui simplifie le déploiement d’une inférence accélérée.

Verdict

Si vous déployez de l’IA locale, embarquée ou privée — assistant sur appareil, agent de code hors ligne, traitement de documents sensibles — MiniCPM5-2B est désormais le point de référence de la catégorie sub-4B : capacité proche du 4B, licence Apache-2.0, données publiées, et déclinaisons prêtes pour tous les runtimes. Si votre charge exige un codage agentique intensifSWE-bench Pro, environnement terminal —, gardez un modèle 4B ou plus, car c’est là que l’écart se creuse encore. Dans les deux cas, testez sur votre banc de charge avant de basculer : la moyenne impressionnante du 2B ne remplace pas la mesure sur votre métier. Pour un fournisseur embarqué ou un déploiement privacy-first, cette combinaison est aujourd’hui le choix par défaut le plus défendable.

Enfin, la publication des données UltraData a une valeur qui dépasse ce modèle : elle fournit à la communauté une base reproductible pour étudier ce qui sépare un 2B moyen d’un 2B excellent, et un point de départ propre pour le fine-tuning. C’est une ressource rare dans un écosystème où la plupart des laboratoires gardent leurs recettes fermées.

Références

Le brief cyber, chaque mardi

Les failles qui comptent, les correctifs à appliquer, en dix minutes de lecture.

Pas de spam. Désinscription en un clic.
à lire ensuite

Sur le même sujet

NeoMME fusionne texte et images dans un unique Transformer bidirectionnel

Hcompany publie NeoMME, un encodeur multimodal multilingue de 260M à 800M paramètres qui traite texte et images dans un seul Transformer, sans tour de vision séparée. Pour la recherche de documents visuels, sa variante Retriever atteint la frontière de Pareto ViDoRe v3 avec un index 255 fois plus compact.

GitHub Copilot orchestre plusieurs modèles à la volée avec Project HydraFusion

GitHub lance HydraFusion, un aperçu de recherche qui choisit à l’exécution entre un modèle unique, une cascade ou une relecture critique pour livrer une qualité de niveau frontière au coût le plus bas. Sur TerminalBench 2.1, il gagne 4,9 points à −67 % de coût estimé face à Claude Opus 5, à essayer via /experimental dans Copilot CLI.

← Retour au fil

Tapez au moins deux caractères.

naviguer ouvrir esc fermer