Qwen3.8-Flash-Next préfigure l’architecture Qwen4 avec l’attention sparse et un embedding N-gram déportable
Le 27 août 2026, Alibaba a publié les poids ouverts de Qwen3.8-Flash-Next, un modèle de 125 milliards de paramètres qui n’en active que 6 milliards par token. C’est l’aperçu public de l’architecture Qwen4, fondée sur l’attention sparse et une table d’embeddings N-gram déportable en RAM ou sur SSD.