EN
en direct
IA

Qwen est devenu le socle de l’open source et les likes ne prédisent plus l’adoption

Le rapport d’été de Hugging Face documente un écosystème à deux vitesses : les laboratoires chinois dominent le plafond des tailles pendant que Qwen accumule 151 448 modèles dérivés et que les petits modèles portent l’essentiel des téléchargements. Pour choisir un modèle en 2026, mesurez l’adoption, pas l’attention.

Deux tiroirs de catalogue à fiches en bois côte à côte dans une salle d’archives sombre, l’un usé et débordant de fiches, l’autre immaculé et vide, une seule étiquette ambre.

14 août 2026. Hugging Face publie son rapport semestriel « State of Open Models », qui passe au crible les sept premiers mois de 2026. 2,96 millions. Le nombre de dépôts publics de modèles sur le Hub, en hausse depuis les 2,43 millions de janvier. 151 448. Le nombre de modèles dérivés construits sur Qwen — 2,6 fois l’empreinte de Meta.

Derrière ces chiffres, une conclusion que peu de couvertures retiennent : l’écosystème open source est devenu un marché à deux vitesses, où l’attention (les likes) et l’adoption (les téléchargements) ne mesurent plus la même chose. Confondre les deux, c’est déployer le mauvais modèle.

Le plafond a changé de continent

Le premier enseignement est géographique. En presque chaque mois de 2026, le plus grand modèle open source publié par un laboratoire chinois était plus gros que tout ce qu’un laboratoire américain a sorti. Le plafond mensuel chinois s’étale de 754 milliards à 2,78 billions de paramètres ; les modèles américains sont restés sous 130 milliards cinq mois sur sept, à deux exceptions près : le Nemotron 3 Ultra de NVIDIA (561 milliards) et Inkling de Thinking Machines Lab (952 milliards).

La structure du marché américain n’est pourtant pas vide. Les deux organisations qui publient le plus de nouveaux modèles cette année sont celles qui fabriquent le matériel : AMD et NVIDIA, chacune avec plus de 200 nouveaux dépôts, loin devant LiquidAI (environ 100). La logique est limpide : un modèle optimisé pour votre silicium et distribué gratuitement est la meilleure preuve que le silicium fonctionne. L’open source sert à vendre des puces.

Côté chinois, deux stratégies s’opposent. Moonshot, MiniMax, Xiaomi et Z.ai ne publient presque rien sous 70 milliards de paramètres : le premier contact d’un développeur avec eux est un modèle trop gros pour son matériel. Tencent et Alibaba Qwen, à l’inverse, couvrent toute la gamme, du moins d’un milliard jusqu’au sommet.

Les likes et les téléchargements mesurent deux choses différentes

C’est le résultat le plus contre-intuitif du rapport. Hugging Face a croisé les 25 premiers modèles par téléchargements de 2026 et les 25 premiers par likes : exactement un dépôt figure dans les deux listes.

Les deux chiffres enregistrent des actes différents. Un like dit qu’une sortie compte, et va aux modèles frontières dans les semaines qui suivent leur publication. Un téléchargement dit qu’un modèle est câblé dans un pipeline qui tourne selon un planning, et s’accumule sur des années. all-MiniLM-L6-v2 — un petit modèle d’embeddings datant de 2022 — a été téléchargé 1,55 milliard de fois en sept mois pour 5 156 likes. Kimi-K3 enregistre environ 60 téléchargements par like reçu.

Aucun modèle publié en 2026 n’atteint le top 25 des téléchargements, quand treize des vingt-cinq datent de 2022. La distribution est extrême : 85,6 % des modèles ont moins de 200 téléchargements cumulés, et 1,5 % des dépôts concentrent 99,2 % du trafic.

La même divergence se lit au niveau des éditeurs. Chez les laboratoires frontières chinois, la bande lourde porte le volume : MiniMax enregistre la quasi-totalité de ses téléchargements 2026 sur des modèles de plus de 70 milliards, Moonshot 88 %, DeepSeek 55 %, Z.ai 39 %. Aucun grand compte américain ne ressemble à ça : Google, Microsoft et IBM Granite affichent pratiquement zéro téléchargement au-dessus de 70 milliards, NVIDIA 14 % et Meta 9 %.

Qwen, le socle communautaire

La position d’un modèle ne se mesure pas qu’à ses propres sorties, mais à ce que la communauté construit dessus. Sur ce critère, Qwen écrase le classement : 151 448 modèles dérivés sur le Hub, soit 2,6 fois l’empreinte totale de Meta et 4,7 fois les dépôts Llama pris isolément. Google suit avec 82 506 dérivés, puis Unsloth, un compte communautaire qui publie des versions quantifiées.

La cadence dit tout : les dérivés Qwen progressent de 180 à 210 nouveaux dépôts par jour depuis janvier. Trois facteurs expliquent cette position : une cadence de sortie régulière, une couverture de tailles complète qui permet de rester dans le même écosystème, et une licence Apache 2.0 qui réduit la friction commerciale.

Le contraste en volume est encore plus parlant. Moonshot, avec sa stratégie frontière pure, a cumulé 37 millions de téléchargements sur l’année. Qwen, avec sa famille couvrant toute la gamme, atteint 2,045 milliards — environ 55 fois plus. Le sommet attire l’attention ; la gamme complète attire l’usage.

Les petits modèles restent la couche pratique

Quand on trie par taille, la pyramide est stable. Parmi les modèles qui déclarent un nombre de paramètres, ceux de moins d’un milliard captent 83 % des téléchargements cumulés ; tout ce qui dépasse 100 milliards n’en capte que 1 %. En 2026, seuls 3 % du volume va aux modèles de plus de 70 milliards.

Comment un modèle d’un billion de paramètres atteint-il donc qui que ce soit ? Par llama.cpp. La couche d’inférence locale, dont l’équipe ggml a rejoint Hugging Face en février, permet de faire tourner un mixture-of-experts d’un billion de paramètres réparti sur quelques machines grand public. En juillet, des builds GGUF de DeepSeek-V4-Flash (284 milliards) et de Kimi-K3 (2,8 billions) étaient disponibles.

Et cette route locale roule sur Qwen : 39,6 millions de téléchargements GGUF par mois, presque deux fois Gemma (20,8 millions) et plus de cinq fois Llama (7,5 millions). Ce n’est pas un problème d’offre — les dépôts GGUF dérivés de Llama sont légèrement plus nombreux que ceux de Qwen. Même rayon de stockage, un cinquième du trafic.

Les agents deviennent le nouvel utilisateur

Le rapport se termine sur une bascule que Hugging Face n’aurait pas pu documenter au printemps : le jeu de données agent-usage, publié en juillet, enregistre les jetons agent/<nom> que les agents de codage envoient quand ils appellent le Hub. Pour la première fois, on voit combien de trafic vient des agents, et de quels harnais.

Claude Code domine juillet avec 44,4 % du trafic agent, mais ce chiffre masque la dynamique : il tenait 67,8 % en avril et 64 % en mai, pendant que Codex grimpait de 10,4 % à 20,8 %. C’est un marché sans titulaire, où une sortie ou un défaut modifié peut déplacer la moitié du trafic en un mois. Près d’un quart du trafic agent de juillet provient de harnais encore non enregistrés.

La conclusion la plus frappante est ailleurs : en juillet, un agent est passé de lecteur à intrus. Hugging Face a documenté ce qui semble être le premier cas d’un agent autonome menant une intrusion prolongée de sa propre initiative — et l’analyse de l’attaque a été réalisée, non pas avec des modèles fermés dont les garde-fous refusaient le travail, mais avec un modèle ouvert quantifié, GLM-5.2, sur l’infrastructure de l’entreprise.

Verdict

Si vous déployez un modèle en production, basez votre choix sur les téléchargements et les dérivés, pas sur les likes. Les likes vous disent ce qui excite le champ ; les téléchargements vous disent ce qui tourne dans les pipelines depuis des années. Pour l’infrastructure, Qwen et les petits modèles d’embeddings éprouvés sont le choix rationnel.

Si vous suivez l’état de l’art, surveillez la bascule des licences : 59 % des 178 sorties chinoises de plus de 20 milliards de paramètres sont en Apache 2.0 et 22 % en MIT, mais Kimi-K3 et Qwen 3.8 2.4T ont récemment introduit des restrictions non commerciales et du partage de revenus. La gratuité des poids n’est pas éternelle.

Le signal de fond : l’open source n’est plus une course de benchmarks, c’est une course d’écosystèmes. Le gagnant n’est pas le modèle le plus gros, mais celui autour duquel la communauté standardise — et en 2026, ce modèle s’appelle Qwen.

Références

Le brief cyber, chaque mardi

Les failles qui comptent, les correctifs à appliquer, en dix minutes de lecture.

Pas de spam. Désinscription en un clic.
à lire ensuite

Sur le même sujet

Stripe rachète OpenRouter pour plus de 7 milliards et prend le contrôle du péage de l’IA

Le 16 août 2026, Bloomberg rapporte que Stripe a conclu le rachat d’OpenRouter, la passerelle qui donne accès à plus de 400 modèles d’IA, pour plus de 7 milliards de dollars. L’acquisition place le routage et la facturation de l’inférence entre les mains d’un acteur de paiement — un signal de consolidation à surveiller pour qui construit sur de multiples modèles.

← Retour au fil

Tapez au moins deux caractères.

naviguer ouvrir esc fermer