EN
en direct
IA

DeepSeek bat son propre flagship sans changer un seul paramètre — l’ère du post-entraînement

Le 31 juillet 2026, DeepSeek a mis à jour son modèle V4 Flash par simple re-post-entraînement, sans modifier l’architecture. Résultat : le petit modèle à 13 Md de paramètres actifs surpasse désormais le V4 Pro sur neuf benchmarks de code.

Une petite plume de phénix brillant d’un éclat ambré sur un établi, à côté d’une plume plus grande mais éteinte.

Le 31 juillet 2026, DeepSeek a publié la version officielle de V4 Flash, sous le build 0731. L’architecture n’a pas changé. Le nombre de paramètres non plus : 284 milliards au total, 13 milliards activés par token en Mixture-of-Experts. La seule différence avec la preview d’avril est un re-post-entraînement complet.

Le résultat est une démonstration contre-intuitive : le petit modèle bat le grand — le V4 Flash 0731 surpasse le V4 Pro Preview (le flagship de DeepSeek, plus gros et deux à trois fois plus cher) sur neuf benchmarks de code et d’agents publiés par DeepSeek lui-même. Sans toucher à l’architecture, sans ajouter de paramètres, sans augmenter le prix. Juste en ré-entraînant la couche de post-training.

Les chiffres qui racontent l’histoire

DeepSeek a publié les scores sur neuf benchmarks. Voici les écarts les plus parlants :

  • Terminal-Bench 2.1 (benchmark de codage agentique en terminal) : Flash 0731 à 82,7, contre 72,1 pour V4 Pro Preview — un écart de 10,6 points
  • DeepSWE 1.1 (résolution de bugs logiciels) : Flash 0731 à 54,4, contre environ 7,3 pour la preview d’avril — un bond de près de 8× en quatre mois par simple re-post-entraînement
  • SWE-bench Verified : Flash 0731 à 70,2, contre 80,6 pour V4 Pro Preview sur ce benchmark spécifique — le seul où Pro garde l’avantage

Le tarif, lui, n’a pas bougé : 0,14 $ par million de tokens en entrée, 0,28 $ en sortie. À titre de comparaison, GPT-5.6 Sol coûte 5 $/30 $ et Claude Opus 5 coûte 5 $/25 $. Le Flash 0731 est littéralement 30 à 100 fois moins cher que les modèles frontière fermés, pour des performances de code qui s’en rapprochent à moins de 10 points sur les benchmarks agentiques.

La bascule a été silencieuse côté utilisateur : toute application appelant l’endpoint deepseek-v4-flash a reçu le modèle mis à jour automatiquement, sans changement de code. Une migration zéro-effort qui contraste avec les cycles de déploiement des modèles propriétaires.

Ce que ce résultat dit de l’état de l’art

Le bond de V4 Flash 0731 n’est pas un exploit isolé. Il valide une hypothèse qui circule dans les labos depuis mi-2025 : le post-entraînement est le nouveau levier de performance, et il est structurellement moins cher que le pré-entraînement.

Recontextualisons. Le pré-entraînement d’un modèle de ~300 Md de paramètres coûte des dizaines de millions de dollars en calcul et nécessite des clusters de plusieurs milliers de GPU pendant des semaines. Le post-entraînement — fine-tuning supervisé, RLHF, optimisation par préférences — opère sur un modèle déjà entraîné et consomme une fraction de ce budget. DeepSeek vient de démontrer qu’un post-entraînement bien exécuté peut produire un gain de performance supérieur à celui d’un modèle plus gros entraîné de zéro.

Si cette tendance se confirme, elle redistribue les cartes entre les labos fermés (OpenAI, Anthropic, Google) et les labos open-weight (DeepSeek, Meta, Mistral, Alibaba). Les premiers misent sur des modèles toujours plus gros — GPT-5.6, Claude Opus 5, Gemini 3.6 — à des coûts d’entraînement qui suivent une courbe exponentielle. Les seconds peuvent désormais concentrer leurs ressources sur le post-entraînement de modèles existants, en itérant plus vite et pour beaucoup moins cher.

Le contexte compétitif d’août 2026

Le classement de l’Artificial Analysis Intelligence Index au 9 août 2026 place Claude Opus 5 en tête (60,7), suivi de Claude Fable 5 (59,9) et GPT-5.6 Sol (58,9). DeepSeek V4 n’est pas encore indexé dans ce classement composite — une situation partagée avec Kimi K3 (Moonshot AI), GLM-5.2 (Zhipu) et Qwen3.8 Max (Alibaba), tous sortis trop récemment pour accumuler le volume d’évaluation indépendante nécessaire.

Mais une chose est déjà claire : l’écart entre les modèles américains et chinois s’est réduit à moins de 10 points sur les benchmarks agentiques et de code. Kimi K3, un modèle open-weight de 2,8 billions de paramètres publié par Moonshot AI le 27 juillet, bat Claude Opus 4.8 et GPT-5.5 sur plusieurs benchmarks à un tiers du coût. GLM-5.2 et Qwen3.8 Max complètent un peloton open-weight chinois qui n’existait tout simplement pas il y a douze mois.

Le Nasdaq a brièvement réagi à la sortie de Kimi K3 fin juillet, signe que les marchés commencent à intégrer la fin du monopole américain sur les modèles frontière.

Ce que DeepSeek prépare pour la suite

L’équipe DeepSeek a confirmé que la version officielle de V4 Pro est en préparation — « coming ASAP » selon leurs termes. Le V4 Pro Preview actuel, toujours basé sur le build d’avril, n’a pas encore bénéficié du même traitement de re-post-entraînement que Flash.

Si DeepSeek applique la même recette à Pro, les chiffres actuels du V4 Pro Preview — 80,6 % sur SWE-bench Verified, un score Codeforces de 3 206 — doivent être lus comme un plancher, pas comme un plafond. Un V4 Pro officiel avec le même niveau d’optimisation post-entraînement que Flash 0731 pourrait potentiellement rivaliser avec le trio de tête fermé.

Cette perspective est d’autant plus crédible que le post-entraînement de Flash a été réalisé sans aucune modification architecturale. Si la même approche fonctionne sur Pro, DeepSeek pourrait livrer un modèle compétitif avec le top 3 mondial pour un coût d’inférence qui reste 10 à 50 fois inférieur aux modèles fermés.

Verdict : ce qui change pour les équipes qui construisent sur des LLM

Le V4 Flash 0731 n’est pas le modèle le plus performant du marché — les modèles frontière d’Anthropic et OpenAI gardent l’avantage sur les benchmarks composites. Mais il est probablement le modèle le plus important de l’été 2026 pour une raison structurelle : il abaisse le coût de la performance agentique à un niveau où elle devient accessible par défaut, pas par exception.

Pour une équipe qui construit un produit basé sur un LLM, voici le verdict conditionnel :

  • Si vous développez un agent de code : testez V4 Flash 0731 cette semaine. À 0,28 $ le million de tokens en sortie, le coût d’inférence n’est plus un facteur limitant pour l’itération. Vous pouvez vous permettre 10× plus d’appels qu’avec GPT-5.6.
  • Si vous avez besoin du top 1 % en raisonnement : restez sur Claude Opus 5 ou GPT-5.6 Sol. L’écart existe encore sur GPQA Diamond et MMLU-Pro.
  • Si vous construisez un pipeline multi-modèle : combinez V4 Flash 0731 pour les tâches agentiques (code, outils, navigation) et un modèle frontière pour les tâches de raisonnement critique — le rapport performance/coût de cette architecture est désormais imbattable.

L’ère du post-entraînement comme levier principal de performance est ouverte. Le V4 Flash 0731 en est la première démonstration publique convaincante, mais ce ne sera pas la dernière.

Références

Le brief cyber, chaque mardi

Les failles qui comptent, les correctifs à appliquer, en dix minutes de lecture.

Pas de spam. Désinscription en un clic.
à lire ensuite

Sur le même sujet

← Retour au fil

Tapez au moins deux caractères.

naviguer ouvrir esc fermer