Le modèle phare actuel est Qwen3.8-Max, plus précisément le rafraîchissement « -0902 » livré par Alibaba le 2 septembre 2026 : 2 400 milliards de paramètres au total, une architecture à mélange d'experts parcimonieux, une fenêtre de contexte d'un million de tokens, et 2,00 $ par million de tokens en entrée / 6,00 $ par million de tokens en sortie sur OpenRouter.
Il est fermé, accessible uniquement via API. Alibaba n'a pas publié les poids de Qwen3.8-Max. Ce qu'elle a publié séparément sous ce même nom « 3.8 », c'est un checkpoint réduit, texte uniquement (sous licence personnalisée restrictive, pas Apache) et un modèle dense de 27B sans rapport (gratuit, Apache 2.0) : trois produits différents, un seul nom partagé qui prête à confusion.
« Qwen3-Max » (sans « .8 », sans version à point) est un modèle différent, plus ancien et abandonné, sorti en septembre 2025, avec plus de 1 000 milliards de paramètres, que le propre successeur d'Alibaba rend obsolète. Au moins un comparateur de benchmarks indépendant continue de le lister comme point de comparaison actif, ce qui explique en grande partie la persistance de cette confusion.
Le chiffre de paramètres actifs que l'on voit partout (« ~95 milliards actifs ») n'est pas confirmé par Alibaba. C'est une estimation de source secondaire largement reprise. Alibaba a communiqué le total de 2 400 milliards, mais pas le nombre de paramètres actifs.
La chronologie, parce que personne d'autre ne l'a présentée ainsi
L'équipe Qwen d'Alibaba a livré, au cours de l'année écoulée, cinq produits aux noms distincts combinant « Qwen3 » et « Max » sous une forme ou une autre. Lu de gauche à droite, le nommage a l'air incrémental. Il ne l'est pas : ce sont des modèles différents, avec des capacités différentes, des licences différentes, et dans deux cas, des pages tarifaires d'entreprises différentes qui ne s'accordent même pas sur le prix du même modèle.
Date Release What it is
------------------------------------------------------------------------
Sept 2025 Qwen3-Max-Preview, then >1T params, MoE, closed,
Qwen3-Max (stable, Sept 23-24) API/Qwen Chat only.
Now discontinued.
Jan 2026 Qwen3-Max-Thinking Reasoning-mode variant
of the same Max line,
not a separate model
family. Closed.
Jul 19, 2026 Qwen3.8-Max (preview) 2.4T params announced
at WAIC Shanghai.
Aug 3, 2026 Qwen3.8-Max (GA) Full release: 1M
context, $2/$6 per
1M tokens. Closed.
Aug 12-13, 2026 Qwen3.8-2.4T-A95B Same base architecture,
text-only, reduced.
Open weights, but
restrictive custom
license (not Apache).
Aug 13-14, 2026 Qwen3.8-27B Unrelated dense model,
27B params, genuinely
open, Apache 2.0,
runs on one GPU.
Sept 2, 2026 Qwen3.8-Max-0902 Post-training refresh
of the Aug 3 build.
Same price/specs,
stronger coding and
agent benchmarks.Le modèle auquel vous pensez presque certainement en cherchant « qwen3 max » aujourd'hui est la dernière ligne : Qwen3.8-Max-0902, disponible sur OpenRouter depuis le 3 septembre 2026. Tout ce qui précède dans le tableau est soit abandonné, soit un mode plutôt qu'un modèle distinct, soit un produit totalement différent qui partage simplement un nom.
Pourquoi la confusion est réelle, pas seulement de l'écriture négligée
Nous avons vérifié Artificial Analysis, l'un des comparateurs de benchmarks indépendants les plus cités, et sa fiche modèle « Qwen3 Max » suit le modèle original de septembre 2025, pas Qwen3.8-Max. Cette page indique qu'Alibaba n'a jamais communiqué de nombre de paramètres pour ce modèle, le marque comme déprécié avec un benchmarking interrompu sauf à une longueur d'entrée de 10 000 tokens, et affiche un tarif de 1,20 $ par million de tokens en entrée et 6,00 $ par million de tokens en sortie. La fiche d'OpenRouter pour ce même modèle nominal indique plutôt 0,78 $ en entrée et 3,90 $ en sortie, un vrai désaccord non résolu entre deux sources actives sur le prix d'un modèle que tout le monde considère pourtant comme obsolète. Au moment de la rédaction, Artificial Analysis n'avait pas encore publié de score indépendant pour Qwen3.8-Max lui-même, ce qui signifie que la plupart des chiffres de benchmark qui circulent pour le modèle actuel remontent aux tableaux publiés par Alibaba elle-même, et non à une vérification tierce.
Cet écart s'est manifesté publiquement quelques heures à peine après la mise à jour d'un classement par un agrégateur. Un fil Hacker News discutant du classement de Qwen3.8-Max comme « meilleur modèle global selon l'indice agentique » a surpris le fournisseur de benchmark en train de changer son modèle de notation en plein cycle, faisant passer le score de Qwen de 55,4 à 58,4, avant qu'un modèle rival (Claude Opus) ne reprenne la tête dans le même cycle d'actualité. Les commentateurs ont pointé directement cette volatilité : une position de classement changeant significativement « en quelques secondes » malgré une description de benchmark identique en dessous. Si vous choisissez un modèle sur la base d'une seule capture d'écran de classement, ce fil rappelle utilement que la capture peut être périmée avant même que vous ayez fini de la lire.
Ce qu'est réellement Qwen3.8-Max
Le modèle phare actuel est un modèle à mélange d'experts parcimonieux comptant 2 400 milliards de paramètres au total. Le chiffre couramment cité de « ~95 milliards de paramètres actifs » apparaît dans presque toutes les sources secondaires couvrant ce modèle, mais ce n'est pas un chiffre confirmé par Alibaba dans sa propre annonce ; traitez-le comme une estimation largement reprise plutôt que comme une spécification officielle. Il est multimodal, acceptant du texte, des images et de la vidéo en entrée, et Alibaba le positionne autour du codage, du développement full-stack, de l'analyse de données et du travail de bureau en général, en revendiquant des améliorations par rapport à la génération précédente Qwen3.7-Max sur ces tâches spécifiques.
La fenêtre de contexte va jusqu'à 1 million de tokens (environ 991 000 utilisables en entrée une fois le budget de sortie pris en compte), avec jusqu'à 131 072 tokens disponibles pour une seule complétion. Sur la fiche en ligne d'OpenRouter, il est facturé 2,00 $ par million de tokens en entrée et 6,00 $ par million de tokens en sortie, avec un tarif de cache de 0,25 $ par million pour une lecture de cache et 2,50 $ par million pour une écriture de cache de 5 minutes. Il est accessible via l'interface Qwen Chat d'Alibaba, l'API DashScope, OpenRouter, et l'intégration à l'IDE Qoder. Une affirmation indépendante distincte, trouvée dans une seule source et non corroborée ailleurs, prétend que le modèle prend en charge un contexte natif de 262 144 tokens extensible à 1 010 000 ; nous ne pouvons pas confirmer cette formulation précise et considérons le chiffre plus simple « jusqu'à 1M » comme le plus sûr à répéter.
À poids ouverts ou non ? Cela dépend de quel « Qwen3.8 » on parle
C'est le point de confusion le plus lourd de conséquences, car la réponse honnête se divise en trois selon le produit exact que l'on regarde :
- Qwen3.8-Max lui-même, le modèle phare multimodal complet avec sa fenêtre de contexte d'1M de tokens, celui que l'on atteint via Qwen Chat, l'API ou OpenRouter, est fermé. Alibaba n'a pas publié ses poids, et la couverture de son annonce en aperçu de juillet 2026 le décrivait sans ambiguïté comme propriétaire, accessible uniquement via API, sans aucune sortie téléchargeable prévue.
- Qwen3.8-2.4T-A95B, publié séparément vers le 12-13 août 2026, partage la même architecture de base mais est texte uniquement, abandonne le contexte natif d'1M de tokens et l'entrée vision, et Alibaba a bien publié ses poids, mais sous une licence personnalisée, pas Apache 2.0 ni une autre licence approuvée par l'OSI. Cette licence exigerait, selon plusieurs sources, un accord commercial payant une fois qu'un déploiement franchit certains seuils de revenus ou d'utilisateurs (les chiffres cités incluent 50 millions de dollars/an de revenus MaaS, ou 100 millions d'utilisateurs actifs mensuels / 20 millions de dollars de revenus mensuels). Une rumeur a circulé après la sortie selon laquelle la licence comportait aussi des restrictions territoriales de téléchargement aux États-Unis, dans l'UE, au Royaume-Uni et en Corée du Sud ; le texte de licence publié sur Hugging Face ne contient aucune clause territoriale de ce type, il faut donc considérer cette affirmation précise comme démentie plutôt que la répéter comme un fait. Ce n'est pas le même produit que Qwen3.8-Max, même si le nom se recoupe presque entièrement.
- Qwen3.8-27B, publié la même semaine environ (13-14 août 2026), est un modèle dense bien plus petit, à 27 milliards de paramètres, réellement ouvert sous Apache 2.0, et assez léger pour tourner sur un seul GPU grand public. C'est une ligne de modèles entièrement distincte de la famille Max ; le « 3.8 » de son nom est la seule chose qu'il partage avec le modèle phare. Notre propre guide sur Qwen3.8-27B détaille ce qu'il peut et ne peut pas faire si c'est une inférence locale, auto-hébergée, que vous recherchez réellement.
Pour le dire simplement : si vous avez cherché « Qwen3.8-Max est-il open source » en espérant faire tourner le modèle phare en local, la réponse est non. Si un titre vous a dit que Qwen avait publié les poids de « Qwen3.8 », il faisait très probablement référence au checkpoint plus petit 2.4T-A95B ou au modèle 27B sans rapport, pas au produit Max complet que les gens désignent en disant « Qwen3.8-Max ». Notre couverture de Qwen3.8-Flash-Next traite d'une troisième sortie à poids ouverts, distincte, de la même famille, avec sa propre architecture d'embedding non paramétrique à contexte d'1M de tokens, une conception réellement différente de la lignée Max comme du modèle 27B, malgré le nom de génération partagé.
Comment il se positionne, avec cette réserve : la plupart de ces chiffres sont autodéclarés
Le benchmarking indépendant et tiers de Qwen3.8-Max spécifiquement reste maigre pour l'instant. La plupart des chiffres de comparaison qui circulent, y compris les affirmations d'Alibaba elle-même selon lesquelles il bat GPT-5.6 Sol Max et Claude Fable 5 sur des tâches agentiques d'utilisation d'ordinateur, remontent aux tableaux publiés par Alibaba elle-même plutôt qu'à un tiers neutre faisant tourner le même test sur chaque modèle. Un point de données utile, quoique restreint : une discussion Hacker News citait des chiffres indépendants de coût par tâche plaçant Qwen à environ 1,13 $ par tâche contre environ 1,80 $ pour Claude Opus sur un travail agentique comparable, un véritable écart d'efficacité si ce résultat se reproduit, mais tiré de la méthodologie d'une seule source plutôt que d'un large consensus. Alors que les chiffres de benchmark de Gemini sont décrits par au moins un comparateur comme audités indépendamment, ceux de Qwen sont décrits par cette même source comme autodéclarés. Cette asymétrie compte si vous prenez une décision d'achat sur la base d'un tableau comparatif : vérifiez si les chiffres de Qwen dans ce tableau viennent d'Alibaba ou du même laboratoire qui a fait tourner tous les autres modèles de la ligne.
Où cela se situe si vous ne suivez pas les benchmarks de modèles de près
Si votre cas d'usage réel consiste à résumer ou discuter avec des documents que vous possédez déjà plutôt qu'à choisir un modèle de codage de pointe, Qwen3.8-Max ne se positionne pas vraiment sur ce terrain : il n'existe aucun produit d'ancrage documentaire construit autour de lui comme le font Gemini Notebook ou ChatPDF, et son contexte d'1M de tokens est un chiffre de capacité brute, pas un système de citation et de récupération. Si vous l'évaluez parce que vous choisissez entre des modèles de pointe hébergés pour du codage ou du travail agentique, la liste de contrôle pratique est la suivante : vérifiez que vous comparez bien le tarif du rafraîchissement -0902 et non celui de l'ancien Qwen3-Max déprécié (les deux ont des prix différents sur au moins un comparateur), déterminez si vous avez besoin du modèle phare fermé accessible par API ou si le modèle à poids ouverts 27B vous conviendrait en réalité tout aussi bien, et revérifiez le tarif actuel directement sur la page DashScope d'Alibaba ou une fiche OpenRouter en ligne plutôt que sur un article de blog statique, puisque cette famille de modèles précise a changé de nom et de prix deux fois en moins de douze mois.
L'accès lui-même se divise selon les mêmes lignes que la licence. Atteindre Qwen3.8-Max via l'application Qwen Chat d'Alibaba ou via l'API DashScope nécessite un compte Alibaba Cloud et, pour l'API, une configuration de facturation selon les tarifs par token indiqués plus haut. OpenRouter est la voie la plus simple si vous l'utilisez déjà pour d'autres modèles : il liste Qwen3.8-Max comme un modèle à fournisseur unique (Alibaba Cloud International uniquement, sans routage de secours), donc une panne ou une limite de débit du côté d'Alibaba n'a nulle part où basculer, contrairement à certaines fiches multi-fournisseurs sur la même plateforme. Si vous voulez réellement faire tourner quelque chose vous-même plutôt que d'appeler une API, rappelez-vous que Qwen3.8-Max n'est pas une option : les voies à poids ouverts de cette famille sont le checkpoint Qwen3.8-2.4T-A95B à licence restrictive ou le modèle réellement ouvert Qwen3.8-27B, et seul le modèle 27B tient raisonnablement sur le matériel que possèdent la plupart des particuliers ou petites équipes.
Questions fréquentes
Qu'est-ce que Qwen3.8-Max ?
Le modèle phare actuel d'Alibaba : un modèle à mélange d'experts parcimonieux de 2 400 milliards de paramètres avec une fenêtre de contexte d'1 million de tokens, sorti le 3 août 2026 et rafraîchi sous le nom « Qwen3.8-Max-0902 » le 2 septembre 2026. Il est fermé et accessible uniquement via API, facturé 2,00 $ par million de tokens en entrée et 6,00 $ par million de tokens en sortie sur OpenRouter.
Qwen3.8-Max est-il le même modèle que Qwen3-Max ?
Non. Qwen3-Max (sans « .8 ») est un modèle plus ancien et abandonné, sorti en septembre 2025, avec plus de 1 000 milliards de paramètres. Qwen3.8-Max est son successeur de 2026, avec plus du double du nombre de paramètres et une fenêtre de contexte bien plus large. Au moins un comparateur de benchmarks continue de lister l'ancien modèle séparément, ce qui est une source fréquente de confusion.
Qwen3.8-Max est-il open source ?
Le modèle phare complet Qwen3.8-Max n'est pas à poids ouverts ; il est fermé et accessible uniquement via l'API d'Alibaba, Qwen Chat, et des plateformes tierces comme OpenRouter. Un checkpoint apparenté mais différent, réduit et texte uniquement (Qwen3.8-2.4T-A95B), a été publié avec des poids ouverts sous une licence personnalisée restrictive, et un modèle séparé et plus petit de 27B (Qwen3.8-27B) a été publié sous une licence Apache 2.0 réellement ouverte. Ce sont trois produits différents malgré le nom « 3.8 » partagé.
Combien coûte Qwen3.8-Max ?
2,00 $ par million de tokens en entrée et 6,00 $ par million de tokens en sortie, selon la fiche en ligne d'OpenRouter pour la version actuelle « -0902 », en date de septembre 2026. L'ancien Qwen3-Max, abandonné, avait un tarif différent et signalé de façon incohérente selon les sources ; ne réutilisez pas un prix trouvé pour ce modèle-là.
Qu'est-ce que Qwen3-Max-Thinking ?
Une variante axée sur le raisonnement de la lignée originale Qwen3-Max, sortie vers janvier 2026. Tout indique qu'il s'agit d'un mode ou d'un checkpoint au sein de la même lignée Max (activable via un paramètre d'API) plutôt que d'une architecture de modèle entièrement distincte, même si la couverture n'est pas totalement cohérente sur ce point. Il reste fermé, accessible uniquement via API et Qwen Chat.