EN
en direct
IA

Qwen3.8-27B livre un modèle multimodal de 27 milliards de paramètres sous Apache 2.0

Le 14 août 2026, l’équipe Qwen d’Alibaba publie Qwen3.8-27B, un modèle dense de 27 milliards de paramètres, multimodal et sous licence Apache 2.0, qui devance des modèles plus gros sur le codage agentique. Pour une équipe qui héberge ses modèles, c’est un candidat sérieux au remplacement des API propriétaires sur les tâches de développement.

Une série de poids de calibration en laiton sur un établi, l’un d’eux sans son sceau de sécurité et légèrement écarté du rang.

14 août 2026. L’équipe Qwen d’Alibaba publie Qwen3.8-27B, un modèle dense de 27 milliards de paramètres, multimodal, sous licence Apache 2.0 — onze jours seulement après Qwen3.8-Max. Sur les benchmarks de codage agentique, il devance des modèles sensiblement plus gros, y compris Opus 4.6 Max sur SWE-bench Pro.

Pour une équipe qui héberge ses propres modèles, ce n’est pas une ligne dans un tracker de sorties. C’est la question concrète de savoir si un modèle de 27 milliards — de la taille qu’on fait tourner sur un seul GPU haut de gamme ou un petit cluster — peut remplacer une API propriétaire pour les tâches d’ingénierie logicielle. La réponse, cette fois, penche du côté de l’open source.

Un modèle dense, pas un mélange d’experts

Le choix d’architecture est le premier signal. Qwen3.8-27B est un modèle dense — pas un MoE comme le Max — bâti sur une base Qwen3.5 et affiné avec une architecture hybride inhabituelle : des blocs de Gated DeltaNet, une forme d’attention linéaire, alternent avec des blocs d’attention gated classique. Résumé en chiffres : 64 couches, une dimension cachée de 5 120, un vocabulaire de 248 320 jetons, et un entraînement avec prédiction multi-jetons (MTP).

L’intérêt pratique n’est pas la fiche technique, c’est le positionnement. Le 27B vient occuper la tranche moyenne : trop gros pour un portable, assez petit pour tenir sur un GPU unique haut de gamme ou une configuration multi-GPU modeste, sans l’infrastructure distribuée qu’exigent les modèles 70B ou 100B+. C’est exactement la tranche où une équipe d’ingénierie peut se permettre de l’héberger en propre.

Le modèle est nativement vision-langage : il comprend images et vidéos, des schémas STEM aux documents, jusqu’aux vidéos d’une heure. Et il embarque un contrôle de réflexion flexible — le mode de pensée est activé par défaut, désactivable par requête, avec une profondeur de raisonnement réglable via reasoning_effort et la conservation du contexte de raisonnement via preserve_thinking. La fenêtre de contexte native est de 262 144 jetons, extensible à 1 million.

Dense contre MoE, et pourquoi ça change l’hébergement

Le 27B n’est pas un simple rétrécissement du Max : c’est un choix d’architecture opposé. Qwen3.8-Max est un mélange d’experts — des centaines de milliards de paramètres au total, dont seule une fraction est activée à chaque jeton. Le 27B est dense : ses 27 milliards de paramètres sont tous sollicités à chaque inférence.

La conséquence pratique est directe. Un MoE exige de garder l’intégralité des experts en mémoire, même si une inférence n’en active qu’une poignée — d’où des machines multi-GPU et une mémoire qui déborde vite. Un dense de 27 milliards tient, lui, dans une enveloppe prévisible : environ 54 Go de VRAM en fp16, ou une vingtaine de giga-octets en quantification 4 bits, ce qui le rend serviable sur un seul GPU de 24 Go. C’est la différence entre « héberger soi-même » et « louer du cloud ».

Le choix de l’attention hybride va dans le même sens. Les blocs Gated DeltaNet — une attention linéaire — coûtent moins cher en mémoire à mesure que la fenêtre de contexte s’allonge, là où l’attention quadratique classique explose. C’est ce qui rend crédible une fenêtre native de 262 144 jetons sur du matériel raisonnable.

Les benchmarks où il écrase la concurrence

Le tableau de benchmarks publié par Qwen est sans ambiguïté sur un point : sur le codage agentique, le 27B ne se contente pas de suivre, il mène.

Sur SWE-bench Pro — la référence des tâches de développement en conditions réelles — Qwen3.8-27B atteint 61,7, contre 53,5 pour Qwen3.6-27B et 53,4 pour Opus 4.6 Max. Sur DeepSWE 1.1, l’écart est spectaculaire : 42,2 contre 13,3 pour son prédécesseur direct. Et sur le benchmark maison QwenSWEBench, il grimpe à 79,0.

La même avance se retrouve sur les tâches agentiques multimodales : 84,3 sur OSWorld-Verified (manipulation d’ordinateur), 64,8 sur WebArena-Verified (navigation), 81,9 sur AndroidWorld (mobile). Sur LiveCodeBench v6, le codage compétitif, il culmine à 90,3.

Le tableau n’est pas uniformément glorieux, et il faut le dire pour être honnête. Sur le raisonnement de frontièreGPQA Diamond à 89,2 et surtout HLE à 30,8 contre 40,0 pour Opus 4.6 Max — le 27B reste derrière les modèles de pointe. C’est un modèle qui excelle à faire, pas à résoudre les problèmes de recherche les plus durs. Pour un usage d’ingénierie logicielle, c’est précisément le bon profil.

Une réserve saine s’impose malgré tout. Plusieurs de ces scores — QwenSWEBench, CoWorkBench, RecreationBench — proviennent de benchmarks maison de Qwen, évalués avec le harness Claude Code. Ils sont utiles pour situer le modèle dans sa famille, mais ils ne remplacent pas une mesure sur votre propre code. Les scores SWE-bench Pro et LiveCodeBench, évalués sur des références publiques, sont plus directement comparables à ceux de la concurrence.

Ce que ça change pour qui héberge

La licence change la donne autant que les chiffres. Apache 2.0 autorise l’usage commercial sans redevance, la modification, la redistribution, et n’impose pas de publier les changements. Pour une entreprise qui veut la propriété complète de son infrastructure d’inférence — pas de dépendance à une API, pas de verrouillage fournisseur, pas de fuite de code vers un tiers — c’est la condition de départ.

Le déploiement est déjà câblé. Les poids sont sur Hugging Face, et les recettes de serving sont prêtes pour SGLang, vLLM et TokenSpeed. La version hébergée sur Qwen Cloud — avec 1 million de jetons de contexte par défaut et des outils intégrés — est annoncée « prochainement », mais le point fort du 27B est justement qu’on n’a pas besoin d’attendre un cloud : on peut le servir soi-même.

Un exemple concret de déploiement avec vLLM, qui illustre la promesse du modèle :

bash
vllm serve Qwen/Qwen3.8-27B \
  --max-model-len 262144 \
  --enable-prefix-caching

La commande lance un endpoint compatible OpenAI sur le modèle, prêt à être branché sur un agent de codage comme Claude Code ou un harness d’évaluation maison. La fenêtre de 262 144 jetons couvre largement le contexte d’une session de développement complète.

Pour un déploiement plus léger, la voie quantifiée est déjà balisée : 301 variantes quantifiées sont référencées sur Hugging Face, compatibles llama.cpp, Ollama, LM Studio ou Jan. Un GGUF en 4 bits fait tenir le modèle dans une vingtaine de giga-octets, de quoi tourner sur une carte grand public — au prix d’une dégradation légère qu’il faut mesurer sur vos propres tâches avant de la déployer en production.

Verdict

Qwen3.8-27B n’est pas un modèle de frontière, et il ne prétend pas l’être. C’est un modèle de travail — et c’est ce qui le rend intéressant.

Si vous hébergez un agent de codage en propre et que vous cherchez à couper la dépendance à une API, c’est le modèle dense open source le plus crédible du moment : 61,7 sur SWE-bench Pro avec des poids Apache 2.0 qui tiennent sur un GPU unique, c’est un rapport capacité/coût difficile à battre.

Si vous avez besoin de raisonnement de frontière — recherche, mathématiques avancées, benchmarks type HLE — restez sur un modèle plus gros ou une API propriétaire : le 27B n’est pas bâti pour ça, et ses scores le disent.

Si vous évaluez un remplacement progressif, la bonne méthode est de faire tourner le 27B en parallèle de votre stack actuelle sur une semaine de vraies tâches de développement, et de mesurer le taux de complétion — pas les scores de benchmarks. C’est là, sur le terrain, que la question « open source ou API » se tranche réellement.

Références

Le brief cyber, chaque mardi

Les failles qui comptent, les correctifs à appliquer, en dix minutes de lecture.

Pas de spam. Désinscription en un clic.
à lire ensuite

Sur le même sujet

GLM-5.3 double sa capacité d’exploitation par le seul post-entraînement

Le 14 août 2026, Z.ai publie GLM-5.3, un modèle à poids ouverts dont la capacité cyber a doublé par le seul post-entraînement, sans changer de modèle de base. Les poids sortent dans deux semaines — anticipez ce que cela change pour vos équipes offensives et défensives.

L’IA arme une faille zero-click Zoom en moins de 24 heures

Le 11 août 2026, Zoom corrige CVE-2026-53413, une faille zero-click que l’éditeur A Security a découverte et armée en moins de 24 heures avec moins de 20 prompts d’IA publiques. La barrière qui réservait le développement d’exploits aux États-nations vient de tomber, et elle ne reviendra pas.

← Retour au fil

Tapez au moins deux caractères.

naviguer ouvrir esc fermer