Tencent publie Hy4 preview, un modèle ouvert de 770 milliards de paramètres orienté code et finance
Le 28 août 2026, Tencent a déposé Hy4 preview sur Hugging Face : un modèle mixture-of-experts de 770 milliards de paramètres, dont 49 milliards seulement s’activent par requête, taillé pour l’ingénierie logicielle, la recherche et la finance. Ce n’est pas la taille qui compte, c’est le signal qu’un poids ouvert sert désormais de canal de distribution.
28 août 2026. Tencent dépose Hy4 preview sur Hugging Face, en accès ouvert. Avril 2026. Le groupe avait lancé Hunyuan 3.0, sa première grande sortie depuis le recrutement de l’ex-chercheur d’OpenAI Yao Shunyu. 28 août 2026, encore. Reuters confirme que le modèle sera intégré aux produits CodeBuddy et WorkBuddy. En six mois, le géant chinois a changé de registre : il ne vend plus seulement des modèles, il distribue des poids ouverts pour équiper ses propres outils.
Ce que Hy4 preview met sur la table
Hy4 preview est un large language model à architecture mixture-of-experts (MoE) de 770 milliards de paramètres au total. Le chiffre impressionne, mais il faut lire la seconde ligne : seuls 49 milliards de paramètres environ s’activent pour une requête donnée. C’est la différence entre la capacité théorique du modèle et son coût réel d’inférence — et c’est elle qui compte en production.
Le positionnement est explicite dans l’annonce : le modèle vise trois usages — l’ingénierie logicielle, la recherche et l’analyse financière. Ce n’est pas un généraliste conversationnel de plus. C’est un modèle orienté tâches professionnelles, pensé pour être branché sur des flux de travail concrets : générer et corriger du code, synthétiser de la documentation scientifique, traiter des données financières.
Le communiqué reconnaît aussi deux limites assumées : le modèle « peut parfois prendre plus de temps que nécessaire sur des questions complexes » et « peut sur-vérifier ses propres réponses ». Dit autrement, Tencent prévient que la preview privilégie la prudence à la vitesse — un comportement cohérent pour des usages où une erreur coûte cher, mais qui doit être calibré avant toute intégration.
Pourquoi « 770 milliards, 49 milliards actifs » change le calcul
Le ratio 770/49 est la vraie information de l’annonce. Un modèle dense de 770 milliards de paramètres serait hors de portée de la plupart des infrastructures d’inférence. Un MoE ne calcule qu’une fraction de ses experts à chaque token : on obtient une partie de la capacité d’un très grand modèle pour une fraction de son coût par requête. C’est le même choix d’architecture que les poids ouverts récents des laboratoires chinois — une convergence qui n’a rien d’anecdotique.
Pour un opérateur, cela se traduit concrètement : la facture d’inférence dépend du nombre de paramètres actifs, pas du nombre total. Un modèle de 770 milliards avec 49 milliards d’actifs est plus proche, en coût de service, d’un modèle de quelques dizaines de milliards que d’un monolithe de 700 milliards. Le poids total pèse surtout sur le stockage et la mémoire nécessaire pour charger le modèle, pas sur chaque token généré.
La conséquence est stratégique. Publier des poids ouverts de cette taille n’a d’intérêt que si quelqu’un peut réellement les faire tourner. En ciblant l’ingénierie logicielle et la finance — des marchés où l’inférence est payante et l’intégration produit est la norme — Tencent publie un modèle que ses clients peuvent auto-héberger ou faire tourner via ses services, sans dépendre d’une API fermée.
Les poids ouverts comme canal de distribution
L’intégration annoncée avec CodeBuddy et WorkBuddy révèle la stratégie. CodeBuddy est l’assistant de développement de Tencent, WorkBuddy son outil de productivité d’entreprise. Publier Hy4 preview en poids ouverts n’est pas un acte philanthropique : c’est un moyen de faire adopter le modèle comme standard, puis de monétiser l’orchestration, l’hébergement et les intégrations produits autour de lui.
C’est un renversement par rapport au modèle API fermée qui a dominé la première génération. Quand les poids sont ouverts, le coût marginal de distribution tombe à zéro : n’importe qui peut déployer Hy4 preview sur son infrastructure, ce qui crée de l’adoption sans effort commercial. La valeur se déplace vers l’amont — les données, le fine-tuning, le déploiement — là où Tencent a déjà une plateforme cloud et des produits d’entreprise.
Pour les équipes qui évaluent des modèles, la question n’est donc plus seulement « quel modèle est le meilleur sur un benchmark », mais « quel modèle puis-je faire tourner moi-même, auditer, et intégrer sans dépendance d’API ». Un poids ouvert de 770 milliards change la réponse par rapport à un API équivalente en performance mais fermée.
Ce qu’il faut pour le faire tourner
Publier 770 milliards de paramètres ne suffit pas : encore faut-il que quelqu’un puisse charger le modèle. En précision bf16, les poids pèsent de l’ordre de 1,5 To — trop pour une seule carte, même haut de gamme. Servir Hy4 preview demande donc soit un nœud multi-GPU dont la mémoire agrégée suffit, soit une quantification (int8, voire int4) qui réduit l’empreinte au prix d’une légère dégradation de qualité.
L’architecture MoE aide ici plus qu’un modèle dense de même taille. Seuls 49 milliards de paramètres étant actifs par token, le coût d’inférence reste abordable une fois les poids chargés en mémoire. C’est ce qui distingue un MoE de 770 milliards d’un monolithe de même masse : le coût de chargement se paie une fois, le coût par requête reste proportionnel aux paramètres actifs.
Le précédent est établi. DeepSeek-V3, puis les modèles Qwen, ont montré qu’un MoE à poids ouverts, correctement quantifié, peut tourner sur du matériel de laboratoire — pas seulement dans un datacenter. Hy4 preview s’inscrit dans cette lignée, avec un positionnement plus net sur le code et la finance. La question pratique pour qui évalue devient : avez-vous le matériel pour le charger, ou passerez-vous par l’API d’un cloud — auquel cas l’avantage des poids ouverts se réduit à la portabilité et à l’auditabilité. Le support au premier jour dans les moteurs d’inférence compte aussi : une architecture MoE neuve ne vaut que ce que vaut le support de vLLM ou de SGLang derrière elle, et les versions preview accusent souvent du retard.
Pour un SRE qui dimensionne, retenez l’ordre de grandeur : un nœud à 8 GPU de 80 Go chacun suffit largement pour servir une version quantifiée, tandis qu’une version bf16 exige davantage de mémoire que la plupart des parcs. Ce calcul — et non le nombre de paramètres affiché — détermine si le modèle entre dans votre infrastructure.
Verdict
Si vous évaluez Hy4 preview pour du code ou de la finance, commencez par mesurer les deux axes qui comptent : la qualité sur vos propres tâches, et le coût d’inférence réel avec 49 milliards de paramètres actifs. La promesse MoE ne vaut que si votre pile — vLLM, SGLang ou équivalent — gère bien le modèle, et si la tendance à sur-vérifier ne ralentit pas vos flux.
Si vous gérez une stratégie de modèles, enregistrez ce signal : les poids ouverts de très grande taille deviennent un canal de distribution à part entière, pas une exception. Intégrez dans vos critères la capacité à auto-héberger un modèle de cette classe, et ne comparez plus les modèles uniquement sur un leaderboard — comparez-les sur le coût complet de possession, du chargement des poids à la latence de production.
Références
- China’s Tencent releases new open-source AI model for coding, research tasks — Reuters, 28 août 2026
- Tencent releases new open-source AI model for coding, research tasks — AsiaOne (fil Reuters), 28 août 2026
- Tencent Hy3 / Hy4 preview: New 770B open AI model for coding — Tech Insider, 2026
- Open Source AI News August 2026: Model Releases — Skycrumbs, août 2026