EN
en direct
IA

Qwen3.8-Flash-Next préfigure l’architecture Qwen4 avec l’attention sparse et un embedding N-gram déportable

Le 27 août 2026, Alibaba a publié les poids ouverts de Qwen3.8-Flash-Next, un modèle de 125 milliards de paramètres qui n’en active que 6 milliards par token. C’est l’aperçu public de l’architecture Qwen4, fondée sur l’attention sparse et une table d’embeddings N-gram déportable en RAM ou sur SSD.

Un circuit imprimé dense sous une lumière froide, une seule piste de cuivre éclairée d’ambre parmi des milliers de pistes sombres.

27 août 2026. Alibaba publie les poids ouverts de Qwen3.8-Flash-Next, un modèle de 125 milliards de paramètres auquel s’ajoute une table d’embeddings N-gram de 51 milliards, pour seulement 6 milliards de paramètres actifs par token. L’annonce tient en une phrase pour les initiés : c’est la première mise à disposition publique de l’architecture Qwen4, via l’attention sparse et une table d’embeddings N-gram que l’on peut déporter en RAM lente ou sur SSD.

La publication ne vient pas de nulle part. Qwen avait ouvert le mois avec Qwen3.8-Max, un flagship de 2,4 billions de paramètres dont les poids ont suivi sous huit jours. Flash-Next en est le versant inverse : un modèle volontairement compact en activations, taillé pour les équipes qui raisonnent en coût d’inférence plutôt qu’en score de benchmark. Le nom — Flash-Next — annonce d’ailleurs la couleur : c’est la préfiguration de Qwen4, pas une variante de plus de la génération 3.8.

L’architecture Qwen4 en deux idées

Qwen résume sa prochaine génération à deux mécanismes. Le premier est Qwen Sparse Attention (QSA) : les couches d’attention pleine sont remplacées par une attention sparse, qui ne calcule les interactions que sur un sous-ensemble de positions au lieu de la matrice complète. Le second est une table d’embeddings N-gram à faible bande passante, qui stocke des représentations précalculées de séquences de tokens et peut vivre hors de la VRAM — en mémoire système, voire sur SSD.

La combinaison produit un effet immédiatement lisible dans les chiffres. Qwen3.8-Flash-Next affiche 125 milliards de paramètres totaux, plus 51 milliards pour la table N-gram, mais n’active que 6 milliards de paramètres par token. Le coût d’entraînement revendiqué est d’environ un neuvième de celui de Qwen3.7-Plus. Autrement dit, on conserve la capacité d’un grand modèle tout en ne payant l’inférence que pour une fraction de ses poids.

Les scores, à lire avec prudence

Qwen communique des résultats auto-déclarés : 58,7 sur DeepSWE et 62,5 sur SWE-bench Pro. Ce sont des scores de code solides, dans la fourchette haute des modèles ouverts — mais ils ne sont pas encore confirmés par une mesure indépendante type Artificial Analysis, comme ce fut le cas pour DeepSeek V4-Pro. La règle Ettayeb s’applique : la model card raconte le plafond, vos tests racontent le plancher.

Le point intéressant n’est d’ailleurs pas le score brut, mais le rapport capacité/coût. Un modèle qui active 6 milliards de paramètres sur 176 milliards stockés se positionne sur le même créneau que les MoE (Mixture-of-Experts) — activer peu, stocker beaucoup — mais y arrive par une voie différente : pas de routeur d’experts, mais une attention sparse et une table N-gram externe. Si la technique tient ses promesses à l’échelle, elle concurrence directement la logique MoE de DeepSeek ou de Mixtral, sans en partager la complexité de routage.

Ce que « déportable en RAM » change pour l’auto-hébergement

C’est l’argument le plus concret pour un SRE ou un homelab. Dans un modèle dense classique, la totalité des poids doit tenir en VRAM pour une inférence fluide. Ici, la table d’embeddings N-gram51 milliards de paramètres — est conçue pour être déportée en mémoire système ou sur SSD, car elle est sollicitée à faible bande passante. Résultat théorique : on peut faire tourner un modèle de 176 milliards de paramètres sur une machine dont la VRAM ne couvre que la partie active.

La réalité reste à valider. 125 milliards de poids « normaux » en bf16, c’est déjà de l’ordre de 250 Go avant tout overhead — un territoire multi-GPU, pas un serveur de salon. Le gain de la déportation N-gram ne rend pas le modèle mono-carte ; il réduit la facture mémoire et laisse entrevoir des déploiements plus économes. Pour l’instant, l’essentiel des équipes consommera Flash-Next via une API ou un hébergeur, et réservera l’auto-hébergement aux versions compactes de la future Qwen4.

La stratégie derrière la préview

Publier un modèle qui « préfigure » une architecture est un choix éditorial autant que technique. Qwen teste deux choses à la fois : la réception de l’attention sparse par la communauté open-weight, et la robustesse d’une table N-gram déportable en conditions réelles. En sortant Flash-Next sous licence ouverte, l’équipe transforme les utilisateurs précoces en banc d’essai — et construit, modèle après modèle, l’écosystème d’outils autour de Qwen4 avant même son lancement officiel.

Cette stratégie s’inscrit dans un basculement plus large que nous documentons depuis le début de 2026 : les laboratoires chinois — DeepSeek, Qwen, Kimi — publient désormais leurs poids ouverts comme levier de distribution, et l’attention sparse devient un champ de bataille à part entière. DeepSeek V4-Pro compresse l’attention avec sa Compressed Sparse Attention et sa Heavily Compressed Attention ; Qwen riposte avec QSA et les embeddings N-gram. Le débat n’est plus « ouvert ou fermé », mais « quelle variante d’attention sparse gagne en inférence ».

Pourquoi l’attention sparse arrive maintenant

L’attention pleine a un coût quadratique en longueur de séquence : chaque token regarde tous les autres, ce qui fait exploser le cache mémoire sur les contextes longs. L’attention sparse casse cette dépendance en ne calculant qu’un sous-ensemble d’interactions, sélectionnées par des motifs fixes ou appris. DeepSeek l’a popularisée avec sa Compressed Sparse Attention ; Qwen généralise l’idée avec QSA et la complète par une table d’embeddings N-gram qui capture les motifs courts hors du réseau principal.

L’économie se lit dans le rapport entre paramètres stockés et paramètres actifs. Un modèle dense de 125 milliards de paramètres active ses 125 milliards à chaque token ; Flash-Next n’en active que 6 milliards. La facture de calcul chute d’autant, tandis que la table N-gram — volumineuse mais peu sollicitée — vit en RAM lente ou sur SSD. C’est le même raisonnement qui a fait le succès des MoE, obtenu ici sans routeur d’experts.

À l’échelle du marché, l’enjeu dépasse Flash-Next. Si QSA et les tables N-gram déportables deviennent la norme de Qwen4, la course à la taille des paramètres cède la place à une course à l’efficacité d’activation. Pour les équipes qui paient au token, c’est une bonne nouvelle : la capacité utile progresse sans que la facture d’inférence suive la même pente — et c’est précisément le signal que les acheteurs de GPU et les équipes MLOps doivent surveiller dans les prochains mois.

Reste la question de l’accès. Les poids de Flash-Next sont ouverts, ce qui permet d’auditer l’architecture au lieu d’en lire le papier. Pour un laboratoire ou une équipe de recherche, c’est une occasion rare de mesurer QSA sur sa propre charge avant l’arrivée de Qwen4 — et de préparer ses déploiements en connaissance de cause plutôt que sur la foi d’un communiqué.

Verdict

Si vous évaluez un modèle de code open-weight, ajoutez Qwen3.8-Flash-Next à votre grille — mais traitez les scores auto-déclarés comme une hypothèse à vérifier sur votre propre charge, pas comme un acquis.

Si vous optimisez le coût d’inférence, suivez l’architecture de près : 6 milliards de paramètres actifs sur 176 milliards stockés, avec une table déportable, c’est le signal le plus crédible que la prochaine génération Qwen4 visera d’abord l’efficacité, ensuite le score.

Si vous auto-hébergez, n’achetez pas de matériel sur cette annonce : la déportation N-gram réduit la facture mémoire, elle ne la supprime pas. Attendez la GA de Qwen4 et les benchmarks indépendants avant de dimensionner quoi que ce soit.

Références

Le brief cyber, chaque mardi

Les failles qui comptent, les correctifs à appliquer, en dix minutes de lecture.

Pas de spam. Désinscription en un clic.
à lire ensuite

Sur le même sujet

Tencent publie Hy4 preview, un modèle ouvert de 770 milliards de paramètres orienté code et finance

Le 28 août 2026, Tencent a déposé Hy4 preview sur Hugging Face : un modèle mixture-of-experts de 770 milliards de paramètres, dont 49 milliards seulement s’activent par requête, taillé pour l’ingénierie logicielle, la recherche et la finance. Ce n’est pas la taille qui compte, c’est le signal qu’un poids ouvert sert désormais de canal de distribution.

← Retour au fil

Tapez au moins deux caractères.

naviguer ouvrir esc fermer