DeepSeek V4.1 Flash divise par quatre la mémoire KV et pousse V4 Pro vers la retraite
Le 10 septembre 2026, DeepSeek publie V4.1 Flash, un modèle multimodal open source qui réduit de quatre fois la mémoire du cache KV et fait baisser les prix de l’API de 11 à 57 % ; les requêtes V4 Pro seront basculées vers Flash dès le 14 septembre. Re-benchmarkez vos charges avant cette date.
10 septembre 2026. DeepSeek publie formellement V4.1 Flash, et ce n’est pas une simple mise à jour de vitesse. Le nouveau modèle remplace d’un coup deux modèles existants — V4 Flash et V4 Flash Vision Exp — intègre la compréhension d’image nativement dans l’architecture de base, et annonce la retraite progressive de V4 Pro, dont les requêtes seront basculées vers Flash à partir du 14 septembre 2026 à 04 h 00 UTC. Le message est clair : le produit se resserre autour d’un seul modèle, et la bataille se joue désormais sur la mémoire et le coût.
Un modèle multimodal, plus grand mais plus économe
V4.1 Flash est un mélange d’experts (MoE) multimodal. D’après l’analyse technique de MarkTechPost, il repose sur 552 milliards de paramètres de backbone, auxquels s’ajoutent 196 milliards de paramètres « Engram », pour une fenêtre de contexte d’un million de tokens. Il n’active que 8 milliards de paramètres par token au préremplissage et 16 milliards au décodage — c’est ce rapport entre taille totale et activation qui rend le coût par token agressif.
La nouveauté structurante est ailleurs : le modèle divise par quatre la mémoire du cache KV. TechTimes détaille les quatre techniques à l’œuvre — CED split, CSA2, la quantification FP4 du cache et l’élimination SWA. Concrètement, pour un agent à long contexte, la mémoire nécessaire au suivi de l’état tombe d’un facteur quatre, ce qui abaisse directement le coût d’hébergement et la latence des tâches agentiques longues.
Des prix en baisse, et une gamme qui se replie
Le communiqué transmis aux utilisateurs de l’API — relayé par TechNode — confirme la stratégie tarifaire : les prix de la série Flash baissent de 11 à 57 % selon le type de token. C’est un signal de compression des coûts plus qu’une guerre des prix frontale : DeepSeek ne baisse pas seulement le tarif, il réduit aussi la ressource (la mémoire KV) qui rendait les longues sessions chères.
La retraite de V4 Pro est l’autre moitié du message. À partir du 14 septembre, les requêtes adressées à V4 Pro seront routées vers Flash. Digital Applied note que les résultats favorisent Flash sur de nombreuses tâches agentiques, mais que Pro conserve l’avantage sur quelques-unes. La fenêtre jusqu’au 14 septembre sert donc précisément à comparer sur son propre workload avant le basculement automatique.
Ce que ça change pour les équipes
Pour une équipe qui tourne des agents à long contexte — recherche multi-fichiers, revue de code sur un dépôt entier, analyse de logs massifs — la division par quatre du cache KV est la métrique qui compte le plus. Elle change le calcul économique : ce qui était un coût d’hébergement GPU croissant avec la longueur de session devient plus linéaire, et la fenêtre d’un million de tokens devient réellement exploitable en production.
Le second point est stratégique. DeepSeek collapse sa gamme — un seul modèle Flash multimodal remplace trois entrées — et bascule ses utilisateurs Pro vers ce modèle. C’est un pari d’efficacité opérationnelle : moins de modèles à maintenir, un seul à optimiser, et un prix qui reflète la réduction de mémoire obtenue. Pour les utilisateurs, la conséquence est concrète : il faut re-tester ses charges avant le basculement, pas découvrir la différence en production.
Quatre leviers pour compresser la mémoire KV
La division par quatre du cache KV mérite qu’on s’y arrête, car c’est elle qui change le coût des agents longs. TechTimes détaille les quatre mécanismes combinés par V4.1 Flash.
- CED split (Cross-Entropy Distribution split) répartit différemment la représentation interne pour réduire la redondance du cache.
- CSA2 (Cross-layer attention reuse) réutilise l’attention entre couches, évitant de stocker des états identiques à plusieurs profondeurs.
- La quantification FP4 du cache compresse chaque valeur de clé et de valeur en quatre bits, divisant l’empreinte mémoire par rapport au FP8 ou au FP16.
- L’élimination SWA (sliding-window attention) supprime les fenêtres glissantes redondantes qui dupliquaient des états.
L’effet combiné est ce qui rend une fenêtre d’un million de tokens économiquement tenable. Pour un agent qui lit un dépôt entier ou des logs massifs, la mémoire de suivi d’état cesse de croître linéairement avec la longueur de la session — c’est précisément le goulot que DeepSeek a choisi d’attaquer, et c’est un choix de positionnement plus net qu’une simple baisse de prix.
Un modèle open source, et une comparaison assumée
V4.1 Flash est publié en open source — un point relevé par Neowin — et DeepSeek l’accompagne d’une comparaison sur 19 benchmarks publiée avec l’annonce. La communication technique est assumée : l’éditeur ne se contente pas de baisser les prix, il documente où le modèle gagne et où V4 Pro conserve l’avantage.
Digital Applied résume l’équilibre : les résultats favorisent Flash sur de nombreuses tâches agentiques, mais Pro reste devant sur quelques cas précis. C’est une honnêteté rare dans le secteur, et c’est précisément ce qui rend la fenêtre jusqu’au 14 septembre utile : elle n’est pas un délai de migration, mais un délai de benchmark comparatif sur ses propres charges.
Le sous-texte : une guerre de la ressource
Au-delà du modèle, V4.1 Flash raconte une tendance de fond. Les laboratoires d’IA ne rivalisent plus seulement sur la qualité des réponses, mais sur l’économie des tokens : coût d’inférence, empreinte mémoire du contexte, prix des sessions longues. DeepSeek attaque ce terrain avec une quantification FP4 du cache et une réutilisation d’attention inter-couches — des optimisations qui réduisent la facture GPU plus qu’un benchmark ne saurait le montrer.
Le retrait de V4 Pro s’inscrit dans la même logique : entretenir une gamme coûte cher, et concentrer les efforts sur un modèle multimodal unique permet de répercuter les gains d’efficacité en prix. C’est un mouvement que d’autres laboratoires suivent, chacun à sa manière, mais DeepSeek le rend ici explicite : la mémoire par token est devenue une métrique de premier plan.
Verdict
V4.1 Flash marque un déplacement du terrain de la compétition des modèles. On ne compare plus seulement les benchmarks, mais la mémoire par token et le coût de la session longue — c’est là que DeepSeek attaque, avec une réduction de quatre fois du cache KV et une gamme rationalisée autour d’un seul modèle multimodal.
Si vous exploitez des agents à long contexte, la division par quatre du cache KV et la baisse de prix de l’API font de V4.1 Flash un candidat immédiat à évaluer — re-benchmarkez vos tâches agentiques, où Flash domine souvent, mais gardez un œil sur les cas où V4 Pro reste supérieur. Si vous êtes encore sur V4 Pro, vous avez jusqu’au 14 septembre 2026 à 04 h 00 UTC pour comparer avant le routage automatique : testez vos workloads réels maintenant, pas après le basculement. Si vous lisez le marché, retenez que la course se joue désormais sur la ressource (mémoire KV) et le coût, pas sur le seul nombre de paramètres.
Références
- TechNode — DeepSeek formally launches V4.1 Flash, routes V4 Pro requests to Flash, 10 septembre 2026
- MarkTechPost — DeepSeek AI Released DeepSeek-V4.1-Flash with 1M Context, FP4 KV Cache, and Cross-Layer Attention Reuse, 10 septembre 2026
- TechTimes — DeepSeek V4.1-Flash Cuts Agent Memory Costs Fourfold With New Architecture, 10 septembre 2026
- Digital Applied — DeepSeek V4.1 Flash: Benchmarks, Prices and Pro Cutoff