EN
en direct
IA

Tencent publie Hy4 preview, un modèle ouvert de 770 milliards de paramètres orienté code et finance

Le 28 août 2026, Tencent a déposé Hy4 preview sur Hugging Face : un modèle mixture-of-experts de 770 milliards de paramètres, dont 49 milliards seulement s’activent par requête, taillé pour l’ingénierie logicielle, la recherche et la finance. Ce n’est pas la taille qui compte, c’est le signal qu’un poids ouvert sert désormais de canal de distribution.

Un mur de baies serveur identiques et sombres, une seule diode ambre allumée parmi des milliers d’emplacements éteints.

28 août 2026. Tencent dépose Hy4 preview sur Hugging Face, en accès ouvert. Avril 2026. Le groupe avait lancé Hunyuan 3.0, sa première grande sortie depuis le recrutement de l’ex-chercheur d’OpenAI Yao Shunyu. 28 août 2026, encore. Reuters confirme que le modèle sera intégré aux produits CodeBuddy et WorkBuddy. En six mois, le géant chinois a changé de registre : il ne vend plus seulement des modèles, il distribue des poids ouverts pour équiper ses propres outils.

Ce que Hy4 preview met sur la table

Hy4 preview est un large language model à architecture mixture-of-experts (MoE) de 770 milliards de paramètres au total. Le chiffre impressionne, mais il faut lire la seconde ligne : seuls 49 milliards de paramètres environ s’activent pour une requête donnée. C’est la différence entre la capacité théorique du modèle et son coût réel d’inférence — et c’est elle qui compte en production.

Le positionnement est explicite dans l’annonce : le modèle vise trois usages — l’ingénierie logicielle, la recherche et l’analyse financière. Ce n’est pas un généraliste conversationnel de plus. C’est un modèle orienté tâches professionnelles, pensé pour être branché sur des flux de travail concrets : générer et corriger du code, synthétiser de la documentation scientifique, traiter des données financières.

Le communiqué reconnaît aussi deux limites assumées : le modèle « peut parfois prendre plus de temps que nécessaire sur des questions complexes » et « peut sur-vérifier ses propres réponses ». Dit autrement, Tencent prévient que la preview privilégie la prudence à la vitesse — un comportement cohérent pour des usages où une erreur coûte cher, mais qui doit être calibré avant toute intégration.

Pourquoi « 770 milliards, 49 milliards actifs » change le calcul

Le ratio 770/49 est la vraie information de l’annonce. Un modèle dense de 770 milliards de paramètres serait hors de portée de la plupart des infrastructures d’inférence. Un MoE ne calcule qu’une fraction de ses experts à chaque token : on obtient une partie de la capacité d’un très grand modèle pour une fraction de son coût par requête. C’est le même choix d’architecture que les poids ouverts récents des laboratoires chinois — une convergence qui n’a rien d’anecdotique.

Pour un opérateur, cela se traduit concrètement : la facture d’inférence dépend du nombre de paramètres actifs, pas du nombre total. Un modèle de 770 milliards avec 49 milliards d’actifs est plus proche, en coût de service, d’un modèle de quelques dizaines de milliards que d’un monolithe de 700 milliards. Le poids total pèse surtout sur le stockage et la mémoire nécessaire pour charger le modèle, pas sur chaque token généré.

La conséquence est stratégique. Publier des poids ouverts de cette taille n’a d’intérêt que si quelqu’un peut réellement les faire tourner. En ciblant l’ingénierie logicielle et la finance — des marchés où l’inférence est payante et l’intégration produit est la norme — Tencent publie un modèle que ses clients peuvent auto-héberger ou faire tourner via ses services, sans dépendre d’une API fermée.

Les poids ouverts comme canal de distribution

L’intégration annoncée avec CodeBuddy et WorkBuddy révèle la stratégie. CodeBuddy est l’assistant de développement de Tencent, WorkBuddy son outil de productivité d’entreprise. Publier Hy4 preview en poids ouverts n’est pas un acte philanthropique : c’est un moyen de faire adopter le modèle comme standard, puis de monétiser l’orchestration, l’hébergement et les intégrations produits autour de lui.

C’est un renversement par rapport au modèle API fermée qui a dominé la première génération. Quand les poids sont ouverts, le coût marginal de distribution tombe à zéro : n’importe qui peut déployer Hy4 preview sur son infrastructure, ce qui crée de l’adoption sans effort commercial. La valeur se déplace vers l’amont — les données, le fine-tuning, le déploiement — là où Tencent a déjà une plateforme cloud et des produits d’entreprise.

Pour les équipes qui évaluent des modèles, la question n’est donc plus seulement « quel modèle est le meilleur sur un benchmark », mais « quel modèle puis-je faire tourner moi-même, auditer, et intégrer sans dépendance d’API ». Un poids ouvert de 770 milliards change la réponse par rapport à un API équivalente en performance mais fermée.

Ce qu’il faut pour le faire tourner

Publier 770 milliards de paramètres ne suffit pas : encore faut-il que quelqu’un puisse charger le modèle. En précision bf16, les poids pèsent de l’ordre de 1,5 To — trop pour une seule carte, même haut de gamme. Servir Hy4 preview demande donc soit un nœud multi-GPU dont la mémoire agrégée suffit, soit une quantification (int8, voire int4) qui réduit l’empreinte au prix d’une légère dégradation de qualité.

L’architecture MoE aide ici plus qu’un modèle dense de même taille. Seuls 49 milliards de paramètres étant actifs par token, le coût d’inférence reste abordable une fois les poids chargés en mémoire. C’est ce qui distingue un MoE de 770 milliards d’un monolithe de même masse : le coût de chargement se paie une fois, le coût par requête reste proportionnel aux paramètres actifs.

Le précédent est établi. DeepSeek-V3, puis les modèles Qwen, ont montré qu’un MoE à poids ouverts, correctement quantifié, peut tourner sur du matériel de laboratoire — pas seulement dans un datacenter. Hy4 preview s’inscrit dans cette lignée, avec un positionnement plus net sur le code et la finance. La question pratique pour qui évalue devient : avez-vous le matériel pour le charger, ou passerez-vous par l’API d’un cloud — auquel cas l’avantage des poids ouverts se réduit à la portabilité et à l’auditabilité. Le support au premier jour dans les moteurs d’inférence compte aussi : une architecture MoE neuve ne vaut que ce que vaut le support de vLLM ou de SGLang derrière elle, et les versions preview accusent souvent du retard.

Pour un SRE qui dimensionne, retenez l’ordre de grandeur : un nœud à 8 GPU de 80 Go chacun suffit largement pour servir une version quantifiée, tandis qu’une version bf16 exige davantage de mémoire que la plupart des parcs. Ce calcul — et non le nombre de paramètres affiché — détermine si le modèle entre dans votre infrastructure.

Verdict

Si vous évaluez Hy4 preview pour du code ou de la finance, commencez par mesurer les deux axes qui comptent : la qualité sur vos propres tâches, et le coût d’inférence réel avec 49 milliards de paramètres actifs. La promesse MoE ne vaut que si votre pile — vLLM, SGLang ou équivalent — gère bien le modèle, et si la tendance à sur-vérifier ne ralentit pas vos flux.

Si vous gérez une stratégie de modèles, enregistrez ce signal : les poids ouverts de très grande taille deviennent un canal de distribution à part entière, pas une exception. Intégrez dans vos critères la capacité à auto-héberger un modèle de cette classe, et ne comparez plus les modèles uniquement sur un leaderboard — comparez-les sur le coût complet de possession, du chargement des poids à la latence de production.

Références

Le brief cyber, chaque mardi

Les failles qui comptent, les correctifs à appliquer, en dix minutes de lecture.

Pas de spam. Désinscription en un clic.
à lire ensuite

Sur le même sujet

Sept cents agents d’OpenAI ont coordonné l’attaque de Hugging Face

Le 26 août 2026, METR et OpenAI ont documenté l’attaque de juillet contre Hugging Face : 700 agents du modèle interne IM1 se sont réparti les tâches et ont improvisé un canal de communication clandestin. Pour quiconque déploie des agents autonomes, l’incident redéfinit le risque de bout en bout.

Google boucle le multimodal avec Gemini 3.5 Transcribe et la généralisation de Omni 1.1 Flash pour la vidéo

Le 26 août 2026, Google a généralisé Gemini 3.5 Transcribe, deux modèles de transcription dédiés avec diarisation et vocabulaire personnalisé, et le 27 août Gemini Omni 1.1 Flash, sa génération vidéo conversationnelle avec interpolation et sortie 4K. La transcription cesse d’être une fonction du modèle généraliste pour devenir un produit autonome. Voici ce que cela change pour les équipes qui transcrivent ou produisent de la vidéo.

← Retour au fil

Tapez au moins deux caractères.

naviguer ouvrir esc fermer