Qwen3.8-Flash-Next est un modèle à poids ouverts qu'Alibaba a lancé le 26 août 2026, présenté explicitement comme un aperçu d'architecture pour la future famille Qwen4, et non comme une mise à jour de taille classique de la gamme Qwen3.8. Il associe un socle de 125 milliards de paramètres à un module de prédiction multi-tokens (MTP) de 4 milliards de paramètres et un budget de 6 milliards de paramètres actifs par token, avec une attention hybride linéaire/complète pour rester rapide sur de longs contextes.
Son chiffre phare est la longueur de contexte : 262 144 tokens nativement, extensible à 1 000 000 via YaRN, une option qu'il faut activer explicitement et qui n'est pas le comportement par défaut. Cela représente environ 750 000 mots en une seule fenêtre continue, utile pour quiconque traite une revue de littérature entière ou un ensemble de sources de la taille d'un livre en un seul passage.
Ce n'est pas Apache 2.0. Les poids sont diffusés sous la Qwen Community License 1.0, une licence plus restrictive que les conditions Apache 2.0 de Qwen3.8-27B. Plusieurs articles publiés tôt laissent entendre que les deux modèles partagent la même licence ; ce n'est pas le cas. Vérifiez les conditions avant tout usage commercial.
Vous ne pourrez presque certainement pas le faire tourner chez vous. Les propres recommandations d'Unsloth situent l'empreinte minimale viable à environ 75 Go de RAM et VRAM combinées, même en quantification 1-bit, soit un Mac Studio haut de gamme ou une station de travail multi-GPU, pas une seule carte grand public.

Ce qui a réellement été lancé, et pourquoi Alibaba parle d'un « aperçu »
Qwen3.8-Flash-Next est un modèle à mixture d'experts creuse (sparse MoE) : un socle de 125 milliards de paramètres routé à travers 512 experts (10 actifs plus 1 partagé par token, chacun de dimension 640), associé à une table d'embeddings N-gram de 51 milliards de paramètres et à un module de prédiction multi-tokens (MTP) de 4 milliards de paramètres, pour 6 milliards de paramètres réellement actifs calculés par token à travers 48 couches. La propre fiche modèle d'Hugging Face annonce un total de 180 milliards de paramètres pour l'ensemble ; certaines documentations de frameworks de serving citent plutôt 176 milliards pour le socle plus la table d'embeddings seuls, en comptant le module MTP séparément, donc ne soyez pas surpris de voir les deux chiffres selon la source. Alibaba positionne le modèle comme un aperçu précoce de l'architecture de Qwen4, diffusé en poids totalement ouverts bien avant la famille Qwen4 finalisée, plutôt que comme un successeur numéroté de Qwen3.8-27B (le modèle plus petit, sous licence Apache, couvert par ce site le 17 août). Les deux modèles partagent un tokenizer et une tour de vision, ainsi que le même contexte de base de 262 144 tokens, mais ils répondent à des questions différentes : Qwen3.8-27B est le choix « petit modèle que vous pouvez réellement faire tourner en local », tandis que Flash-Next est la démonstration d'architecture « jusqu'où peut aller un modèle immense et efficace ». Traiter les deux comme la même sortie, ce que fait une partie de la couverture précoce, sous-estime ce qui distingue chacun.
La table N-gram : pas seulement « plus de paramètres »
La table d'embeddings N-gram de 51 milliards de paramètres est l'élément de cette sortie le plus susceptible d'être réduit à « c'est plus gros » dans une couverture superficielle, et cela sous-estime ce qu'elle fait réellement. C'est une table de correspondance adressée de manière déterministe, indexée par des n-grammes de tokens locaux, et non une couche de mixture d'experts apprise qui route via un réseau de gating. Comme les adresses de la table sont connues avant même que la passe avant ne s'exécute, la tranche pertinente peut être préchargée depuis une RAM hôte ordinaire ou un stockage SSD pendant que le reste du modèle calcule encore, ajoutant une latence quasi nulle. Elle se comporte davantage comme un très grand dictionnaire de phrases mis en cache à côté du réseau que comme du calcul MoE supplémentaire, ce qui explique aussi pourquoi elle n'est pas comptée dans le chiffre de 6 milliards de paramètres actifs. Pour l'attention, Qwen a associé cela à une conception hybride : trois couches Gated DeltaNet (attention linéaire) pour une couche d'attention complète, plus Qwen Sparse Attention, ce qui, selon les propres benchmarks d'Alibaba, permettrait un préremplissage 7,6 à 10,2 fois plus rapide et un décodage 4,9 à 6,6 fois plus rapide au contexte complet de 1M de tokens. Ces chiffres viennent de Qwen et n'ont pas été reproduits indépendamment ; considérez donc ce multiplicateur comme indicatif plutôt qu'établi.
Bien comprendre le contexte de 1M de tokens
Le contexte natif du modèle est de 262 144 tokens ; atteindre le plafond annoncé de 1 000 000 de tokens nécessite d'activer explicitement le scaling YaRN statique, ce qui ne se produit pas automatiquement du simple fait que les poids le supportent. C'est une étape facile à manquer si vous récupérez une configuration par défaut depuis Hugging Face ou une build communautaire quantifiée sans vérifier les paramètres de scaling. Si votre installation affiche le chiffre plus petit de 262K, c'est un comportement attendu, pas un téléchargement corrompu.

Licence et accès : où se situe la confusion
Qwen3.8-Flash-Next est diffusé sous la Qwen Community License 1.0, et non sous la licence Apache 2.0 qui couvre Qwen3.8-27B. La couverture de The Decoder sur cette sortie laisse entendre une parité de licence ouverte entre les deux modèles ; ce n'est pas exact, et c'est le seul fait de cette sortie qui mérite le plus d'être vérifié par vous-même auprès du fichier LICENSE du dépôt sur GitHub avant de construire quoi que ce soit de commercial dessus. La propre annonce de Qwen présente spécifiquement cette sortie comme un aperçu destiné à la recherche et aux tests communautaires, ce qui correspond à la licence plus restrictive : Alibaba veut des retours sur l'architecture, pas nécessairement une réutilisation commerciale sans restriction pour l'instant.
- Hugging Face :
Qwen/Qwen3.8-Flash-Next, plus des quantifications communautaires FP8, NVFP4 et GGUF signées Unsloth et d'autres. - ModelScope, le propre hub de modèles d'Alibaba, héberge les mêmes poids en miroir.
- API QwenCloud, des points d'accès compatibles OpenAI et Anthropic, facturés autour de 0,16 $ par million de tokens en entrée et 0,47 $ par million de tokens en sortie, selon la couverture de The Decoder sur l'annonce tarifaire de Qwen.
- Frameworks de serving : vLLM et SGLang disposent de recettes dès le premier jour ; le support llama.cpp existe sous forme de pull request non fusionnée (#27742) plutôt que d'une version taguée, attendez-vous donc à des aspérités si vous travaillez spécifiquement avec llama.cpp.
Pouvez-vous réellement le faire tourner vous-même ?
En pratique, seulement si vous disposez d'un matériel sérieux. Les propres recommandations de quantification d'Unsloth situent le plancher à environ 75 Go de RAM et VRAM combinées, même en quantification agressive 1-bit, ce qui signifie en pratique un Mac Studio de 96 Go ou plus, une station de travail multi-GPU, ou une instance cloud conçue pour cela, pas un seul GPU grand public. Si cela vous exclut, l'API QwenCloud est la voie pratique pour réellement utiliser le modèle plutôt que de simplement en lire la description.
L'angle que personne d'autre ne couvre : ce que signifient 1M de tokens pour le travail de recherche
Une fenêtre de contexte de 1M de tokens représente environ 750 000 mots en un seul passage continu, de quoi contenir une revue de littérature complète, un manuscrit de la taille d'un livre, ou un vaste ensemble de sources multi-documents comme un unique bloc de texte que le modèle lit d'un seul tenant. C'est une approche véritablement différente de la façon dont Gemini Notebook gère un grand ensemble de sources : son forfait Pro autorise 300 sources par notebook et 500 000 mots par source individuelle, mais il ne charge pas chaque source dans une seule fenêtre de contexte à chaque requête. Il indexe les sources et récupère les passages pertinents pour chaque question, ce qui explique pourquoi la qualité des réponses tient bon même avec des centaines de sources chargées. Un modèle comme Flash-Next, qui lit tout en continu, peut repérer des connexions inter-documents que la récupération manque parfois ; un outil basé sur la récupération comme Gemini Notebook reste rapide et cohérent à une échelle (des centaines de documents longs) qu'il serait impraticable de faire tenir dans une seule fenêtre de contexte, même de 1M de tokens. Aucune approche n'est strictement meilleure : le contexte continu convient à un ensemble de documents borné et étroitement lié que l'on veut lire de bout en bout, tandis que la récupération convient à une bibliothèque vaste et faiblement liée que l'on interroge morceau par morceau. Si vous hésitez entre héberger vous-même un modèle ouvert à long contexte et utiliser un outil ancré dans des sources, c'est là le véritable arbitrage, pas une simple comparaison de nombre de tokens.
Les gens demandent aussi
La table N-gram de 51 milliards de paramètres fait-elle partie du calcul actif du modèle ?
Non. C'est une table de correspondance non paramétrique, adressée de manière déterministe, qui peut être préchargée depuis la RAM ou un SSD avant la passe avant, ajoutant une latence quasi nulle. Elle se situe en dehors du chiffre de 6 milliards de paramètres actifs qui décrit le calcul réel par token du modèle.
Puis-je faire tourner Qwen3.8-Flash-Next sur un seul GPU grand public ?
Non. Les propres recommandations d'Unsloth situent l'empreinte minimale viable à environ 75 Go de RAM et VRAM combinées, même en quantification 1-bit, ce qui signifie en pratique un Mac Studio haut de gamme ou une configuration multi-GPU. L'API QwenCloud est l'option pratique sans ce matériel.
Qwen3.8-Flash-Next est-il open source sous Apache 2.0, comme Qwen3.8-27B ?
Non, et c'est le fait le plus souvent confondu au sujet de cette sortie. Qwen3.8-Flash-Next utilise la Qwen Community License 1.0, une licence plus restrictive que les conditions Apache 2.0 de Qwen3.8-27B. Vérifiez les conditions auprès du fichier LICENSE du dépôt avant tout usage commercial.
Est-ce que j'obtiens automatiquement le contexte complet de 1 000 000 de tokens ?
Non. Le contexte natif du modèle est de 262 144 tokens. Atteindre 1 000 000 de tokens nécessite d'activer explicitement le scaling YaRN statique dans votre configuration d'inférence ; ce n'est pas activé par défaut.
Pourquoi Alibaba qualifie-t-il d'« aperçu » un modèle entièrement à poids ouverts ?
Parce qu'il est explicitement présenté comme un aperçu précoce de l'architecture prévue pour la future famille Qwen4, diffusé en poids ouverts avant cette sortie plutôt que comme une mise à jour numérotée classique de la gamme Qwen3.8 existante.