EN
en direct
IA

Cognition muscle Devin avec SWE-2, un modèle de code post-entraîné sur le Kimi K3 ouvert

Cognition a sorti le 10 septembre SWE-2, un modèle d’agent de codage post-entraîné depuis Kimi K3, la base ouverte de 2,8 trillions de paramètres de Moonshot AI. Il approche Fable 5.1 sur les benchmarks de code à un coût annoncé 64 % inférieur, mais s’effondre sur Terminal-Bench 4 — le signal que les gains ne se généralisent pas au test le plus dur.

Une seule lampe de travail ambre allumée au-dessus d’un établi vide, dans une rangée d’établis identiques et sombres.

10 septembre 2026. Cognition publie SWE-2, le modèle qui pilote désormais son agent Devin, avec un argument qui n’est pas la puissance brute : il atteint 50,0 % sur FrontierCode 1.1 Main, à moins d’un point de Fable 5.1 (50,9 %), pour un coût annoncé 64 % inférieur. Le modèle est fermé — pas d’API, pas de poids, uniquement Devin Desktop, CLI, Web et Fusion. Sa base, elle, est ouverte : c’est Kimi K3, le modèle à 2,8 trillions de paramètres de Moonshot AI. Le post-entraînement sur une base ouverte devient la façon la plus crédible de fabriquer un agent de code au prix du marché.

La recette : une base ouverte, une spécialisation par renforcement

SWE-2 n’est pas un pré-entraînement ex nihilo. C’est Kimi K3, déjà massivement entraîné par renforcement pour le codage agentique, retravaillé par Cognition avec son propre objectif. La base est un MoE de 2,8 trillions de paramètres104 milliards actifs par token, 896 experts dont 16 activés, 93 couches (69 en Kimi Delta Attention, 24 en Gated MLA), un encodeur visuel MoonViT-V2 de 401 millions de paramètres, un vocabulaire de 160 000 jetons et une fenêtre de 1 million de jetons.

Cognition n’a pas inventé la base : il l’a louée au prix d’un modèle ouvert, puis a dépensé son budget là où se joue la différenciation — le post-entraînement. Le résultat, revendiqué par l’éditeur, est un gain de 5 à 6 points sur de nombreux benchmarks par rapport à Kimi K3, ce qui déplace toute la courbe coût/performance du modèle d’origine.

Cette architecture a une conséquence directe pour l’écosystème : Kimi K3 est disponible en poids ouverts sur Hugging Face sous licence Kimi K3 License. Vous ne pouvez pas obtenir SWE-2, mais vous pouvez obtenir sa base. Le fossé entre les deux — ce que Cognition ajoute — c’est précisément la valeur que l’entreprise vend.

Un renforcement qui punit le coût

La contribution méthodologique de Cognition tient en une fonction de récompense : R = S − λₑ · C, où S vaut 0 ou 1 selon la réussite de l’essai, C est le coût de l’essai (mélange d’inférence en dollars et de temps), et λₑ est un coefficient de pénalité ajusté sur la pente locale de la frontière de Pareto de la base, pour chaque niveau d’effort.

La nouveauté tient moins à la formule qu’à ce qu’elle permet : un seul run d’entraînement couvre les trois niveaux d’effort (medium, high, max), au lieu de trois checkpoints séparés. Un λ élevé pousse vers des essais plus courts et moins chers ; un λ faible laisse le modèle dépenser plus de calcul pour traquer la justesse. Cognition affirme avoir ainsi « passé le RL au régime multi-trillions de paramètres pour la première fois ».

Le tout est étayé par du détail d’ingénierie : un triplement des environnements RL, des noyaux NVFP4/FP8 avec entraînement conscient de la quantification, un décodage spéculatif DSpark avec un modèle de brouillon entraîné en ligne, et un vérificateur durci par un volant récursif — les checkpoints de SWE-2 servent eux-mêmes à stresser les vérificateurs qui notent les essais.

Les chiffres, et l’écart qui dérange

Les benchmarks publiés par Cognition montrent un modèle qui bat son prédécesseur SWE-1.7 sur les quatre épreuves, et qui se place face aux frontières du marché.

BenchmarkSWE-2Kimi K3Grok 4.6Fable 5.1GPT-6 Astra
FrontierCode 1.1 Main50,0 %44,2 %48,0 %50,9 %53,3 %
DeepSWE 1.173,0 %68,5 %67,5 %67,4 %74,1 %
Terminal-Bench 2.192,8 %88,3 %88,4 %91,4 %89,9 %
Terminal-Bench 427,3 %21,5 %20,3 %55,8 %57,9 %

La ligne Terminal-Bench 4 casse le récit. Sur cette révision plus récente et moins saturée du benchmark, SWE-2 plafonne à 27,3 %, loin derrière Fable 5.1 (55,8 %) et GPT-6 Astra (57,9 %). Tous les modèles chutent sur cette épreuve plus dure, mais pas de la même façon : les modèles frontières conservent environ la moitié de leur score, tandis que SWE-2, Kimi K3 et Grok 4.6 en perdent les deux tiers. C’est le signe classique d’un gain qui reflète un ajustement à des distributions d’entraînement connues plutôt qu’une généralisation réelle.

Le point qui fâche le plus les ingénieurs : Terminal-Bench 4 n’était pas dans la boucle d’entraînement de SWE-2, contrairement aux tâches de type FrontierCode et Terminal-Bench 2.1. Cognition publie les quatre benchmarks côte à côte — y compris celui où son modèle décroche — ce qui est à son honneur, mais la conclusion ne change pas.

L’efficacité, vraie, se lit dans les étapes

Ce qui est solide, c’est le gain d’efficacité sur son propre prédécesseur. Sur FrontierCode 1.1 Main, SWE-2 en effort medium dépasse SWE-1.7 avec 58 % de tours en moins et 81 % de coût en moins en moyenne. La première édition de code réelle arrive à un pas médian de 18, contre 48 pour SWE-1.7.

La cause est une exploration focalisée : un modèle plus intelligent juge quelles parties du code comptent vraiment pour la tâche, et commence à implémenter plus tôt. Cognition documente aussi des comportements de fond — meilleure couverture de tests, davantage de débrouillardise dans les limites fixées par l’utilisateur, et une discipline de vérification qui re-dérive les conclusions plutôt que de réaffirmer.

C’est la vraie nature de la valeur de SWE-2 : pas un nouveau plafond de capacité, mais un meilleur rapport entre le résultat et ce qu’il coûte, pour une classe de tâches donnée.

Fermé en surface, ouvert en sous-sol

SWE-2 illustre une bascule plus large que la seule annonce de Cognition. Pendant deux ans, la question « open ou fermé ? » s’est jouée au niveau des modèles généralistes. En 2026, elle se joue au niveau des agents spécialisés : la base est ouverte, la spécialisation est fermée.

Le schéma est désormais établi. Kimi K3 est publié en poids ouverts par Moonshot AI ; Cognition le post-entraîne en SWE-2 et le vend fermé, sans API ni poids, uniquement dans Devin. La valeur ne se situe plus dans le pré-entraînement — un pré-entraînement de 2,8 trillions de paramètres est devenu un intrant qu’on loue — mais dans la recette de post-entraînement : la fonction de récompense, les environnements RL, le vérificateur durci.

Pour un laboratoire qui ne veut pas dépenser des centaines de millions en pré-entraînement, c’est une excellente nouvelle. Pour un client qui veut auditer ce qui tourne sur son code, c’en est une plus mitigée : la base est inspectable, l’agent ne l’est pas. Le compromis n’est plus « ouvert contre fermé », il est « base ouverte, agent fermé » — et c’est probablement le modèle économique dominant des agents de code pour les années qui viennent.

Verdict

SWE-2 ne bat pas les modèles frontières sur le benchmark le plus dur, et il n’a pas à le faire : son argument est le rapport coût/performance. Il le tient sur les benchmarks saturés, et le perd sur celui qui compte pour juger la généralisation.

Si vous utilisez déjà Devin, l’évaluation est directe : SWE-2 est un gain clair sur SWE-1.7 — moins de tours, moins cher, meilleur partout. Faites tourner votre propre suite de tâches avant de croire les 50,0 % sur FrontierCode.

Si vous choisissez un agent de codage ce trimestre, ne tranchez pas sur FrontierCode ou Terminal-Bench 2.1 seuls : vérifiez Terminal-Bench 4 — la seule épreuve du tableau qui sépare encore les modèles — et vos propres dépôts. Et gardez un œil sur le signal de fond : le post-entraînement sur une base ouverte comme Kimi K3 est en train de devenir le raccourci standard vers un agent de code compétitif, fermé en surface, ouvert en sous-sol.

Références

Le brief cyber, chaque mardi

Les failles qui comptent, les correctifs à appliquer, en dix minutes de lecture.

Pas de spam. Désinscription en un clic.
à lire ensuite

Sur le même sujet

Cohere publie North Small Translate en open weights, mais verrouille l’usage commercial

Cohere publie North Small Translate 1.0, un modèle de traduction à 218 milliards de paramètres dont les poids sont téléchargeables sous licence CC BY-NC 4.0, mais pas exploitables en production sans contrat commercial. L’épisode confirme une bascule : les poids ouverts ne riment plus avec licence ouverte.

DeepSeek V4.1 Flash divise par quatre la mémoire KV et pousse V4 Pro vers la retraite

Le 10 septembre 2026, DeepSeek publie V4.1 Flash, un modèle multimodal open source qui réduit de quatre fois la mémoire du cache KV et fait baisser les prix de l’API de 11 à 57 % ; les requêtes V4 Pro seront basculées vers Flash dès le 14 septembre. Re-benchmarkez vos charges avant cette date.

← Retour au fil

Tapez au moins deux caractères.

naviguer ouvrir esc fermer