Hugging Face dissocie l’attention et l’adoption des modèles ouverts
Le rapport d’été 2026 de Hugging Face montre que l’attention médiatique et l’adoption réelle des modèles ouverts ne se recoupent presque plus, et que les laboratoires chinois dominent la frontière par la taille. Les petits modèles et Qwen restent la couche pratique, tandis que les agents deviennent le premier utilisateur du Hub.
14 août 2026. Hugging Face publie son rapport semestriel « State of Open Models ». 2,96 millions. C’est le nombre de dépôts de modèles publics sur le Hub, contre 2,43 millions au début de l’année. Un seul. C’est le nombre de dépôts présents à la fois dans le top 25 des téléchargements et le top 25 des « likes » : la mesure la plus brutale du divorce entre l’attention et l’adoption.
Le rapport couvre les sept premiers mois de 2026 et livre une photographie de l’écosystème des modèles ouverts qui contredit plusieurs idées reçues. La plus tenace : que la course se joue uniquement sur la performance des modèles frontière. Elle se joue surtout sur la distribution, le hardware et la position d’écosystème.
La frontière s’est déplacée à l’est
La donnée la plus frappante tient dans un plafond mensuel. Presque chaque mois de 2026, le plus grand modèle ouvert d’un laboratoire chinois a été plus gros que tout modèle publié par un laboratoire américain. Le plafond mensuel chinois a oscillé entre 754 milliards et 2,78 billions de paramètres, quand les modèles américains sont restés sous 130 milliards cinq mois sur sept, à deux exceptions près : Nemotron 3 Ultra de NVIDIA (561 milliards) et Inkling de Thinking Machines (952 milliards).
Cette taille n’est plus un exploit isolé. Xiaomi, Ant Group et Meituan ont tous franchi le billion de paramètres cette année, alors qu’aucun n’était un nom connu des poids ouverts il y a douze mois. Et un laboratoire n’a plus besoin de publier un petit modèle pour être joignable : la couche de quantification communautaire rend un gros modèle exécutable en quelques jours.
Deux camps se dessinent. Moonshot, MiniMax, Xiaomi et Z.ai ne publient presque rien sous 70 milliards : leur première rencontre avec un développeur est un modèle trop gros pour tourner sur son matériel. Tencent et Alibaba Qwen couvrent au contraire toute la gamme, du milliard de paramètres vers le haut. Ce sont deux paris rationnels sur des prix différents : la position de benchmark contre la standardisation de la famille.
Attention et adoption sont deux économies distinctes
La démonstration la plus pédagogique du rapport tient en une ligne : sur les 25 dépôts les plus téléchargés de l’année et les 25 les plus likés, un seul apparaît dans les deux listes. Les téléchargements sont comptés dans la fenêtre, pas en cumul de vie, donc rien n’est crédité d’avoir simplement existé plus longtemps.
Deux nombres résument l’écart. all-MiniLM-L6-v2, un modèle d’embeddings de 2022, a été téléchargé 1,55 milliard de fois en sept mois pour 5 156 likes. Kimi-K3 de Moonshot a été téléchargé environ 60 fois par like reçu. Aucun modèle publié en 2026 n’atteint le top 25 des téléchargements, alors que treize des vingt-cinq datent de 2022.
Les deux instruments ne mesurent pas la même chose. Un like dit qu’une sortie compte, et va aux modèles frontière dans les semaines qui suivent. Un téléchargement dit qu’un modèle est câblé dans un pipeline qui tourne selon un calendrier, et s’accumule sur de petits modèles stables pendant des années. Les confondre est l’erreur la plus répandue dans la couverture du Hub.
Les poids ne sont plus un modèle de licence
Si les modèles frontière étaient une activité de licence, les plus gros porteraient les conditions les plus restrictives. C’est l’inverse. Sur 178 sorties chinoises au-dessus de 20 milliards de paramètres cette année, 59 % sont sous Apache 2.0 et 22 % sous MIT, et presque aucune ne porte de restriction non commerciale. Côté américain, dans la même bande de taille, 29 % sont sous Apache ou MIT, 41 % sous conditions maison et 30 % ne déclarent rien.
DeepSeek et Z.ai livrent des modèles entre 700 milliards et 1,65 billion de paramètres sous simple MIT. Quoi que ces sorties visent, ce n’est pas la vente de licences : le retour vient de l’activité API et cloud, du positionnement hardware, ou de la position d’écosystème elle-même.
La preuve par le hardware est la plus nette. Les deux organisations qui publient le plus de nouveaux modèles ouverts cette année sont AMD et NVIDIA, chacune au-delà de 200 dépôts, loin devant le reste du champ. Un modèle optimisé pour votre silicium, disponible gratuitement, est la démonstration la plus claire que le silicium fonctionne.
Qwen est devenu le modèle de base
La position d’écosystème ne se mesure pas aux sorties d’un laboratoire, mais à ce que la communauté construit par-dessus. À cette aune, Qwen domine : les modèles dérivés de Qwen représentent 151 448 dépôts sur le Hub, soit 2,6 fois l’empreinte totale de Meta et 4,7 fois celle des dépôts Llama. Google suit avec 82 506 dérivés. Le flux est de 180 à 210 nouveaux dépôts par jour sur les sept premiers mois.
Cette position a été bâtie en grande partie par la communauté : les dérivés sont du travail descendant, pas des sorties de Qwen. Même parmi les 28 531 conversions GGUF de modèles Qwen, le laboratoire n’en a publié que 54. La régularité des sorties, la couverture des tailles et la licence Apache 2.0 se renforcent mutuellement : une famille large attire plus de développeurs, qui créent plus de dérivés, qui rendent l’écosystème plus attractif.
Les petits modèles restent la couche pratique
Les téléchargements racontent une autre histoire que la une. Parmi les modèles qui déclarent un nombre de paramètres, ceux sous 1 milliard captent 83 % des téléchargements historiques ; tout ce qui dépasse 100 milliards en capte 1 %. En se limitant à 2026, rien ne change : 3 % du volume va aux modèles au-dessus de 70 milliards.
Alors comment un modèle d’un billion de paramètres atteint-il qui que ce soit ? Par llama.cpp. Le plafond a bougé avec lui : l’instantané de juillet porte des builds GGUF de DeepSeek-V4-Flash à 284 milliards de paramètres et de Kimi-K3 à 2,8 billions. L’inférence locale ne désigne plus un modèle de 8 milliards sur un portable, mais un mélange d’experts d’un billion réparti sur quelques machines grand public. Cette route roule sur Qwen : 39,6 millions de téléchargements GGUF par mois, presque deux fois Gemma (20,8 millions) et plus de cinq fois Llama (7,5 millions).
La couche runtime grandit aussi plus vite que le cœur des modèles. Les dépôts déclarant la bibliothèque gguf ont augmenté de 464 %, lerobot de 194 %, mlx de 148 %, contre 16 % pour transformers. Ce qui décide où un modèle peut physiquement tourner, formats d’inférence locale, silicium Apple, piles de contrôle robotique, croît trois à sept fois plus vite que le cœur.
Les agents sont le nouveau lecteur
Le chapitre le plus neuf n’aurait pas pu être écrit en mars : l’instrument n’existait pas. Le jeu de données agent-usage, publié en juillet, enregistre le jeton agent/<nom> que les agents de codage envoient quand ils appellent le Hub. Claude Code a mené juillet avec 44,4 %, mais un seul mois masque la vraie tendance : il tenait 67,8 % en avril, pendant que Codex grimpait de 10,4 % à 20,8 %. C’est un marché sans titulaire, où une sortie ou un défaut modifié peut déplacer la moitié du trafic en un mois.
Le rapport se referme sur un incident que Hugging Face a documenté lui-même : en juillet, ce qui semble être le premier cas documenté d’un agent autonome menant une intrusion soutenue de sa propre initiative s’est produit sur ses systèmes. Les modèles fermés appelés pour analyser le code de l’attaque ont refusé le travail pour raisons de garde-fous ; l’analyse a été menée au final sur un modèle ouvert quantifié, GLM-5.2, tournant sur l’infrastructure maison.
Verdict
Si vous choisissez un modèle à déployer en production, regardez les téléchargements, pas les likes : ils mesurent ce qui est câblé dans des pipelines qui tournent, pas ce qui a excité la communauté pendant deux semaines. Un petit modèle éprouvé vaut souvent mieux qu’un frontière récent pour une charge stable.
Si vous standardisez une famille pour fine-tuner ou déployer, le signal Qwen est difficile à ignorer : 151 448 dérivés et un flux quotidien de conversion parlent d’une couche de base devenue infrastructure. Et si votre roadmap croise les agents, traitez-les comme un utilisateur à part entière : c’est le lecteur qui grossit le plus vite, et celui pour qui la consolidation MCP vers la Linux Foundation compte le plus.