EN
en direct
IA

DeepSeek V4-Pro sort de preview avec ses poids MIT et se hisse troisième des benchmarks indépendants

Le 13 août 2026, DeepSeek a fait passer V4-Pro en disponibilité générale et publié ses poids sur Hugging Face sous licence MIT. Les benchmarks indépendants le classent troisième mondial, mais à trois points seulement de son petit frère V4-Flash.

Une porte de coffre-fort en acier sombre entrouverte, une lumière ambrée s’échappant de l’intérieur.

12 août 2026. DeepSeek fait passer son flagship V4-Pro de la preview à la disponibilité générale, sous le build 0813. 13 août 2026. Les poids du modèle arrivent sur Hugging Face sous licence MIT. Artificial Analysis publie dans la foulée son verdict indépendant : un score de 53, troisième au classement mondial. Le flagship chinois est désormais un modèle open-weight réel, pas une promesse.

L’épisode s’inscrit dans une séquence que nous avons suivie de près : en juillet, la version V4-Flash avait déjà battu la preview du V4-Pro par le seul re-post-entraînement, et la grille tarifaire heures pleines / heures creuses avait changé l’équation économique du secteur. La sortie de V4-Pro en GA referme cette trilogie : le grand modèle est maintenant là, ouvert, et mesuré.

Ce que la GA change réellement

La preview d’avril 2026 était un avant-goût. La GA du 13 août est un produit. V4-Pro-0813 conserve l’architecture annoncée : 1 600 milliards de paramètres au total, 49 milliards activés par token, en Mixture-of-Experts avec Compressed Sparse Attention et Heavily Compressed Attention, pré-entraîné sur plus de 32 000 milliards de tokens. Le contexte annoncé est de 1 million de tokens, avec jusqu’à 384 000 tokens de sortie, et trois modes de raisonnement — sans réflexion, raisonnement élevé, raisonnement maximal.

La différence concrète, c’est la distribution. Les poids sont sur Hugging Face sous MIT, aux côtés d’une variante DSpark qui embarque un module de speculative decoding natif pour vLLM et SGLang — plus besoin de modèle draft séparé pour accélérer l’inférence. Pour un laboratoire de recherche ou une équipe qui veut auditer les poids plutôt que consommer une API, c’est la première fois qu’un modèle de cette taille, en tête de classement, se télécharge sans licence restrictive. Le speculative decoding intégré est d’ailleurs un choix d’ingénierie malin : il supprime une brique d’infrastructure à maintenir, au prix d’un checkpoint un peu plus lourd.

Sous le capot : l’économie du MoE

Pourquoi activer seulement 49 milliards de paramètres sur 1 600 milliards ? La réponse tient à l’inférence. Un modèle dense lit l’intégralité de ses poids à chaque token ; un MoE ne lit que les experts concernés par le token en cours, plus un routeur qui choisit lesquels. DeepSeek combine deux techniques pour compresser l’attention — la Compressed Sparse Attention et la Heavily Compressed Attention — qui réduisent la mémoire nécessaire au cache de contexte sur les longues séquences.

Le gain se mesure en dollars par million de tokens, pas en pourcentage abstrait : à capacité comparable, lire 49 milliards de poids au lieu de 1 600 milliards divise la facture de calcul d’un ordre de grandeur. C’est ce qui permet à V4-Pro d’afficher un tarif de sortie de 3,96 $ quand un dense frontière de même calibre facture 30 $. Le coût caché, lui, est la mémoire : les 1 600 milliards de poids doivent quand même être chargés quelque part, ce qui repousse l’auto-hébergement vers des clusters multi-nœuds.

Le verdict indépendant, plus intéressant que la carte modèle

La model card de DeepSeek affiche des scores agressifs : 80,6 % sur SWE-bench Verified, 90,1 % sur GPQA Diamond, 93,5 % sur LiveCodeBench, 87,5 % sur MMLU-Pro, 67,9 % sur Terminal Bench 2.0, et un classement Codeforces de 3 206. Artificial Analysis est venu poser une mesure tierce.

Le résultat : 53 sur son Intelligence Index, soit la troisième place mondiale. C’est du niveau frontière, sans ambiguïté. Mais l’écart avec le petit V4-Flash est de trois points — pour un modèle qui active cinq fois plus de paramètres par token. La lecture honnête tient en une phrase : V4-Pro est bien un modèle top-3, à une fraction du prix frontière, mais les affirmations les plus audacieuses de la carte méritent encore d’être validées sur votre propre charge de travail. La cybersécurité ressort d’ailleurs comme le point fort du modèle selon les premiers retours tiers — un signal à part, dans un marché saturé de modèles optimisés pour les benchmarks de code.

Le poids ouvert n’est pas la gratuité

Dire que V4-Pro est « ouvert » est exact au sens de la licence — les poids sont en MIT. Ce n’est pas exact au sens des ressources : un checkpoint de 1,6 billion de paramètres est un territoire multi-nœuds, hors de portée d’un homelab. La logique MoE rappelle une règle constante : les paramètres actifs réduits économisent le calcul, pas la mémoire — l’intégralité des poids doit tenir en VRAM.

En pratique, la majorité des équipes consommera V4-Pro via l’API ou un hébergeur, et réservera l’auto-hébergement au V4-Flash, dont les 304 milliards de paramètres restent eux-mêmes multi-GPU. Le gain immédiat n’est donc pas l’autonomie matérielle : c’est la réversibilité — pouvoir quitter l’API sans perdre l’accès au modèle, et auditer ce qu’on exécute. Dans un contexte où la dépendance à un fournisseur devient un risque de gouvernance, cette réversibilité vaut parfois plus que l’économie de tokens.

Où se place V4-Pro face à la concurrence

Le positionnement se lit moins dans la carte modèle que dans l’écart prix/capabilité face aux autres flagships. V4-Pro affiche un tarif de sortie de 3,96 $ par million de tokens en heures pleines (1,98 $ en creux). En face, Qwen 3.8-Max est à 6 $, Kimi K3 à 15 $, et GPT-5.6 Sol à 30 $ — pour des classes de capacités comparables en ordre de grandeur. Le raisonnement de DeepSeek est limpide : être top-3 à un dixième du prix frontière, et laisser le prix faire la moitié de l’argumentaire.

Cette stratégie a une conséquence structurelle : elle comprime les marges de toute la couche « modèle ». Pour un CTO qui arbitre entre fournisseurs, la question n’est plus « qui est le meilleur » mais « à partir de quel écart de qualité le surcoût devient-il injustifiable ». La réponse, de plus en plus souvent, est : jamais. C’est la pression que l’open-weight chinois exerce sur le reste du marché, au-delà de tout débat technique.

Ce que ça change pour l’écosystème open-weight

La GA de V4-Pro renforce un basculement plus large. Depuis le début de 2026, les modèles open-weight chinois — DeepSeek, Qwen, Kimi — ont comblé l’écart avec les frontières fermées américaines, au point que le meilleur modèle ouvert est devenu une catégorie que les entreprises suivent comme un marché à part entière. La publication des poids MIT de V4-Pro n’est pas un geste philanthropique : c’est une stratégie de distribution. Plus le modèle est copié, hébergé et audité, plus l’écosystème d’outils qui l’entoure se construit autour de DeepSeek, et moins les clients dépendent d’un fournisseur unique.

Pour un RSSI ou un CTO, la conséquence est pratique : l’open-weight n’est plus un pari risqué sur un outsider, c’est une option de souveraineté — la possibilité de faire tourner le modèle dans sa propre infrastructure ou chez un hébergeur de son choix, et d’auditer ce qu’on exécute. Le compromis reste l’inférence : la souveraineté se paie en GPU.

Verdict

Si vous évaluez un modèle frontière pour des tâches agentiques ou de code, ajoutez V4-Pro-0813 à votre grille : c’est un top-3 mesuré par une source indépendante, et son point fort en cybersécurité mérite un test dédié. Si vous voulez auditer ou auto-héberger, téléchargez les poids MIT — mais dimensionnez un cluster, pas un serveur. Si le prix prime, comparez sur votre propre charge : l’écart de trois points avec V4-Flash, à coût inférieur, peut suffire pour de nombreux usages. La carte modèle raconte le plafond ; vos tests racontent le plancher.

Références

Le brief cyber, chaque mardi

Les failles qui comptent, les correctifs à appliquer, en dix minutes de lecture.

Pas de spam. Désinscription en un clic.
à lire ensuite

Sur le même sujet

Tencent publie Hy4 preview, un modèle ouvert de 770 milliards de paramètres orienté code et finance

Le 28 août 2026, Tencent a déposé Hy4 preview sur Hugging Face : un modèle mixture-of-experts de 770 milliards de paramètres, dont 49 milliards seulement s’activent par requête, taillé pour l’ingénierie logicielle, la recherche et la finance. Ce n’est pas la taille qui compte, c’est le signal qu’un poids ouvert sert désormais de canal de distribution.

← Retour au fil

Tapez au moins deux caractères.

naviguer ouvrir esc fermer