Qwen3.8-Max-0902 gagne 22 points sur CodeArena sans changer de modèle
Le 2 septembre 2026, Alibaba publie Qwen3.8-Max-0902, un snapshot post-entraîné du Qwen3.8-Max qui monte à 1 691 sur CodeArena sans toucher au socle de 2 400 milliards de paramètres. Les équipes qui évaluent des agents de code doivent suivre une cadence de snapshots datés, pas des lancements de modèles.
2 septembre 2026. Alibaba publie Qwen3.8-Max-0902, un snapshot post-entraîné de son modèle phare Qwen3.8-Max. 22 points. C’est le gain annoncé sur le score front-end de CodeArena, qui passe à 1 691 et place le modèle en tête du classement. 2 400 milliards de paramètres. C’est le socle, inchangé. Pourquoi c’est important : la frontière de l’IA ne progresse plus uniquement par de nouveaux modèles, mais par des versions datées d’un même modèle qu’on ré-entraîne. Celui qui suit les lancements et ignore les snapshots évalue avec un temps de retard.
Un snapshot, pas un nouveau modèle
Il faut d’abord dissiper l’ambiguïté du nom. Qwen3.8-Max-0902 n’est pas un modèle neuf : c’est une mise à jour de Qwen3.8-Max, livrée un mois plus tôt, que Alibaba a continué d’entraîner en post-entraînement sur des données de programmation et de tâches collaboratives dites « Cowork ». L’architecture n’a pas bougé — toujours un MoE de 2 400 milliards de paramètres totaux pour environ 95 milliards de paramètres actifs, un contexte de 1 million de tokens et une sortie maximale de 131 000 tokens.
La preuve que c’est un snapshot plutôt qu’un lancement tient à l’alias officiel : qwen3.8-max-0902 correspond à qwen3.8-max-2026-09-02. Le nom porte la date, comme un tag de version logicielle. QwenCloud expose une page de modèle dédiée et un nom d’API distinct, ce qui en fait un artefact évaluable séparément — mais dont les poids ne sont pas publiés. On est face à un raffinement distribué par l’API, pas face à une nouvelle release open source.
Les gains se concentrent sur le code et l’autonomie
Ce qui rend ce snapshot notable, c’est l’ampleur relative des progrès sur les tâches d’ingénierie. Alibaba publie un tableau comparant 0902 à la version d’origine, et les sauts les plus marquants sont là où le modèle partait de bas :
- Terminal-Bench 3.0 : de 11,3 à 29,0 — un quasi-triplement sur l’usage réel d’un terminal.
- ProgramBench : de 10,5 à 28,0.
- QwenSWEBench V2 : de 55,1 à 70,0.
- DeepSWE 1.1 : de 56,6 à 69,3.
- NL2Repo-Bench : de 55,9 à 64,9.
- JobBench : de 53,4 à 64,0.
- SWE-Marathon : de 39,1 à 44,8, et MLS-Bench-Lite de 41,0 à 50,1.
Sur le volet multimodal, Alibaba annonce 82,7 sur MMMU-Pro, 78,3 sur ERQA, 80,2 en ClawEval-MM Pass@3 et 93,8 sur BabyVision avec interpréteur de code. Le score de CodeArena, lui, grimpe de 22 points à 1 691, une première place revendiquée par Alibaba.
La réserve méthodologique reste la même que pour tout benchmark : ces chiffres sont des scores constructeur, obtenus avec des harnais différents — Claude Code, mini-SWE-agent ou un interpréteur interne. Ils ne se comparent pas terme à terme avec ceux d’un autre fournisseur. Ce qui se compare, c’est le delta interne entre 0902 et son prédécesseur, et ce delta est réel.
Pourquoi le snapshot daté remplace le lancement
L’existence même de Qwen3.8-Max-0902 signale un changement de rythme dans la course aux modèles. Historiquement, un laboratoire annonçait un modèle, puis le suivant plusieurs mois plus tard. Ici, le gain de 22 points sur CodeArena — et surtout le triplement sur Terminal-Bench — arrive en un mois, sans nouvelle architecture, par le seul post-entraînement. Le cycle « pré-entraînement → post-entraînement → mise en production » s’est compacté au point que la version devient un flux continu.
Pour un RSSI ou un responsable plateforme, la conséquence est concrète : le planning d’évaluation ne peut plus se caler sur les seuls lancements médiatisés. Un fournisseur peut améliorer silencieusement un modèle entre deux annonces, et votre benchmark maison tourne alors contre une version déjà dépassée. Suivre la cadence des snapshots datés — et re-piner l’alias d’API à chaque rafraîchissement — devient une discipline opérationnelle, pas une option.
Ce que cela change pour qui consomme l’API
Qwen3.8-Max-0902 est disponible via QwenCloud sous le nom qwen3.8-max-0902. La tarification reste identique à celle de la version d’origine : 2 dollars par million de tokens en entrée, 6 dollars en sortie, avec un cache explicite facturé 2,50 dollars à l’écriture et 0,17 dollar à la lecture, et un cache implicite à 0,25 dollar. Autrement dit, le surcroît de performance en programmation n’a pas de surcoût : il suffit de basculer le nom de modèle.
from openai import OpenAI
client = OpenAI(
base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",
api_key="DASHSCOPE_API_KEY",
)
# Bascule vers le snapshot post-entraîné : alias daté, même tarif
resp = client.chat.completions.create(
model="qwen3.8-max-0902",
messages=[{"role": "user", "content": "Refactorise ce module et ajoute les tests."}],
) La bascule est triviale pour qui utilise déjà Qwen3.8-Max : on change le nom de modèle et on rejoue la suite de régression. C’est précisément le type de changement que les équipes devraient automatiser — un job de benchmark rejoué sur chaque alias daté, avec un seuil de régression à ne pas franchir avant de mettre à jour le modèle en production.
La limite structurelle : pas de poids ouverts
Il faut être net sur ce que ce snapshot n’est pas. Qwen3.8-Max-0902 n’est pas une release open source : DataLearner le classe comme « non open source », sans poids pré-entraînés publiés, et précise qu’il ne faut pas confondre la page d’API avec les poids du Qwen3.8-2.4T-A95B. L’auto-hébergeur qui veut faire tourner un modèle de cette classe localement n’a rien à déployer ici.
C’est un contraste assumé avec les sorties open weight qui ont rythmé l’été — DeepSeek V4-Pro en disponibilité générale, ou le palier Qwen3.8-27B à poids ouverts. Le choix de Alibaba est clair : le sommet de gamme reste verrouillé derrière l’API, et seuls les modèles d’un cran en dessous sont libérés. Pour une équipe, cela déplace la question de la souveraineté : soit on accepte la dépendance à QwenCloud pour le meilleur score de code, soit on sacrifie quelques points sur CodeArena pour garder ses poids.
Le long-horizon : ce que « Cowork » désigne vraiment
Derrière le terme « Cowork », Alibaba désigne un usage précis : faire travailler le modèle sur des tâches qui dépassent l’horizon d’une session de chat. Le billet de lancement de Qwen3.8-Max en donne une illustration concrète — sur une exécution autonome de plus de dix jours, le modèle construit un harnais auto-évolutif, collecte les demandes de la communauté, répartit les tickets, génère le code, le vérifie et se répare tout seul. C’est cette capacité de longue durée, plus que le score de chat, que le post-entraînement de 0902 a renforcée.
Pour une équipe d’ingénierie, la conséquence est directe : les métriques qui comptaient hier — MMLU, HumanEval, un benchmark de chat — ne mesurent plus ce qui se joue. Les gains de 0902 sur Terminal-Bench 3.0 (de 11,3 à 29,0) ou ProgramBench (de 10,5 à 28,0) concernent l’usage d’un terminal et l’écriture de programmes complets, pas la génération d’un extrait de code isolé. Évaluer un agent de code exige désormais des scénarios de longue durée, avec accès à un vrai environnement, pas un échantillon de réponses.
Une course qui se densifie
Le rythme s’accélère d’autant que la concurrence chinoise se densifie : DeepSeek a passé V4-Pro en disponibilité générale fin août, Zhipu aligne GLM-5.3, et Moonshot pousse Kimi K3. Dans ce peloton, le choix de Alibaba de verrouiller son sommet de gamme derrière l’API tout en libérant les paliers inférieurs en open weight trace une ligne stratégique claire — et force les équipes à arbitrer entre score et souveraineté à chaque snapshot.
Verdict
Si vous consommez déjà l’API Qwen pour des agents de code, basculez sur qwen3.8-max-0902 : même prix, meilleur code, changement limité à un nom de modèle et à une revalidation de vos jeux de test. Ne laissez pas l’ancien alias tourner en production par inertie.
Si vous hébergez vos modèles, ce snapshot ne vous apporte rien de déployable : les poids ne sont pas publiés. Restez sur les paliers ouverts — DeepSeek V4-Pro, Qwen3.8-27B — et traitez la montée de CodeArena comme un signal de ce que le post-entraînement peut encore produire, pas comme un artefact à installer.
Si vous pilotez l’évaluation, rejouez vos benchmarks sur chaque alias daté de vos fournisseurs, et non à chaque communiqué. La frontière avance désormais en continu, et le classement d’un modèle n’est fiable qu’à la date de sa dernière mesure.