O carro-chefe atual é o Qwen3.8-Max, especificamente a atualização "-0902" que a Alibaba lançou em 2 de setembro de 2026: 2,4 trilhões de parâmetros totais, um design esparso de mistura de especialistas (MoE), uma janela de contexto de 1 milhão de tokens, e $2,00 por milhão de tokens de entrada / $6,00 por milhão de tokens de saída na OpenRouter.
Ele é fechado, disponível só via API. A Alibaba não liberou os pesos do Qwen3.8-Max. O que ela liberou sob o mesmo nome "3.8", separadamente, foi um checkpoint reduzido, só de texto (sob uma licença personalizada restritiva, não Apache) e um modelo denso de 27B sem relação com o flagship (gratuito, Apache 2.0): três produtos diferentes, um nome compartilhado que confunde.
"Qwen3-Max" (sem o ".8", sem essa versão com ponto) é um modelo diferente, mais antigo e descontinuado, de setembro de 2025, com mais de 1 trilhão de parâmetros, que o próprio sucessor da Alibaba tornou obsoleto. Pelo menos um rastreador independente de benchmarks ainda o lista como ponto de comparação ativo, e é exatamente assim que a confusão se perpetua.
O número de parâmetros ativos que você vai ver em todo lugar ("~95B ativos") não foi confirmado pela Alibaba. É uma estimativa de fonte secundária amplamente repetida. A Alibaba divulgou o total de 2,4T, mas não a contagem de parâmetros ativos.
A linha do tempo, porque ninguém mais organizou assim
A equipe Qwen da Alibaba lançou cinco produtos com nomes distintos, todos carregando "Qwen3" e "Max" em alguma combinação, ao longo do último ano. Lendo da esquerda para a direita, os nomes parecem incrementais. Não são: são modelos diferentes, com capacidades diferentes, licenças diferentes e, em dois casos, páginas de preços de empresas diferentes discordando sobre quanto custa o mesmo modelo.
Date Release What it is
------------------------------------------------------------------------
Sept 2025 Qwen3-Max-Preview, then >1T params, MoE, closed,
Qwen3-Max (stable, Sept 23-24) API/Qwen Chat only.
Now discontinued.
Jan 2026 Qwen3-Max-Thinking Reasoning-mode variant
of the same Max line,
not a separate model
family. Closed.
Jul 19, 2026 Qwen3.8-Max (preview) 2.4T params announced
at WAIC Shanghai.
Aug 3, 2026 Qwen3.8-Max (GA) Full release: 1M
context, $2/$6 per
1M tokens. Closed.
Aug 12-13, 2026 Qwen3.8-2.4T-A95B Same base architecture,
text-only, reduced.
Open weights, but
restrictive custom
license (not Apache).
Aug 13-14, 2026 Qwen3.8-27B Unrelated dense model,
27B params, genuinely
open, Apache 2.0,
runs on one GPU.
Sept 2, 2026 Qwen3.8-Max-0902 Post-training refresh
of the Aug 3 build.
Same price/specs,
stronger coding and
agent benchmarks.O modelo que você quase certamente tem em mente ao pesquisar "qwen3 max" hoje é a última linha: Qwen3.8-Max-0902, disponível na OpenRouter desde 3 de setembro de 2026. Tudo o que vem antes dele na tabela está descontinuado, é um modo em vez de um modelo separado, ou é um produto totalmente diferente que por acaso compartilha o nome.
Por que a confusão é real, e não só descuido de redação
Conferimos o Artificial Analysis, um dos rastreadores independentes de benchmark mais citados, e a página do modelo "Qwen3 Max" nele rastreia o modelo original, de setembro de 2025, não o Qwen3.8-Max. Essa página afirma que a Alibaba nunca divulgou uma contagem de parâmetros para aquele modelo, o marca como descontinuado com os benchmarks interrompidos exceto num comprimento de entrada de 10.000 tokens, e lista o preço em $1,20 por milhão de tokens de entrada e $6,00 por milhão de tokens de saída. A própria listagem da OpenRouter para o mesmo modelo nominal mostra, em vez disso, $0,78 de entrada e $3,90 de saída, um conflito real e não resolvido entre duas fontes ativas sobre o preço do modelo que todo mundo concorda estar obsoleto agora. No momento em que este texto foi escrito, o Artificial Analysis ainda não havia publicado uma pontuação independente para o próprio Qwen3.8-Max, o que significa que a maioria dos números de benchmark que circulam para o modelo atual remete às próprias tabelas publicadas pela Alibaba, não a uma verificação de terceiros.
Essa lacuna apareceu publicamente horas depois da atualização de ranking de um agregador. Uma discussão no Hacker News sobre o Qwen3.8-Max sendo classificado como "melhor modelo geral pelo índice agêntico" flagrou o provedor do benchmark trocando seu modelo de avaliação no meio do ciclo, com a pontuação do Qwen mudando de 55,4 para 58,4 e um modelo rival (Claude Opus) ultrapassando-o de novo dentro do mesmo ciclo de notícias. Os comentaristas apontaram a volatilidade diretamente: uma posição no ranking mudando de forma significativa "em poucos segundos", apesar de uma descrição de benchmark idêntica por baixo dela. Se você está escolhendo um modelo com base numa única captura de tela de ranking, essa discussão é um lembrete útil de que a captura pode ficar desatualizada antes mesmo de você terminar de lê-la.
O que o Qwen3.8-Max realmente é
O atual carro-chefe é um modelo esparso de mistura de especialistas com 2,4 trilhões de parâmetros totais. O número comumente citado de "~95 bilhões de parâmetros ativos" aparece em praticamente toda fonte secundária que cobre esse modelo, mas não é um número que a Alibaba confirmou em seu próprio anúncio; trate-o como uma estimativa amplamente repetida, não como uma especificação. Ele é multimodal, aceitando entrada de texto, imagem e vídeo, e a Alibaba o posiciona em torno de codificação, desenvolvimento full-stack, análise de dados e trabalho de escritório em geral, alegando melhorias em relação à geração anterior, o Qwen3.7-Max, nessas tarefas específicas.
A janela de contexto vai até 1 milhão de tokens (cerca de 991.000 utilizáveis para entrada depois de descontar o orçamento de saída), com até 131.072 tokens disponíveis para uma única conclusão. Na listagem ativa da OpenRouter, o preço é de $2,00 por milhão de tokens de entrada e $6,00 por milhão de tokens de saída, com preços de cache de $0,25 por milhão para leitura de cache e $2,50 por milhão para gravação de cache de 5 minutos. Ele está disponível pela própria interface Qwen Chat da Alibaba, pela API DashScope, pela OpenRouter e pela integração com o IDE Qoder. Existe uma alegação independente separada, encontrada em apenas uma fonte e não corroborada em outro lugar, de que o modelo suporta um contexto nativo de 262.144 tokens extensível a 1.010.000; não conseguimos confirmar esse enquadramento específico e trataríamos o número mais simples de "até 1M" como a opção mais segura para repetir.
Peso aberto ou não? Depende de qual "Qwen3.8" você está falando
Esse é o ponto de confusão mais relevante de todos, porque a resposta honesta se divide em três, dependendo exatamente de qual produto você está olhando:
- O próprio Qwen3.8-Max, o flagship multimodal completo com a janela de contexto de 1M, o que você acessa pelo Qwen Chat, pela API ou pela OpenRouter, é fechado. A Alibaba não liberou seus pesos, e a cobertura do anúncio de prévia de julho de 2026 o descreveu claramente como proprietário, acessível só por API, sem nenhum lançamento para download planejado.
- O Qwen3.8-2.4T-A95B, lançado separadamente por volta de 12-13 de agosto de 2026, compartilha a mesma arquitetura base, mas é só de texto, abre mão do contexto nativo de 1M e da entrada de visão, e nesse caso a Alibaba liberou os pesos, mas sob uma licença personalizada, não a Apache 2.0 nem outra licença aprovada pela OSI. Essa licença supostamente exige um acordo comercial pago assim que uma implantação ultrapassa certos limites de receita ou de usuários (os números citados incluem $50 milhões/ano em receita de MaaS, ou 100 milhões de usuários ativos mensais / $20 milhões em receita mensal). Um boato circulou depois do lançamento de que a licença também trazia restrições territoriais de download nos EUA, UE, Reino Unido e Coreia do Sul; o texto da licença publicado no Hugging Face não contém essa cláusula territorial, então trate essa alegação específica como desmentida em vez de repeti-la como fato. Esse não é o mesmo produto que o Qwen3.8-Max, mesmo que o nome se sobreponha quase completamente.
- O Qwen3.8-27B, lançado na mesma semana (13-14 de agosto de 2026), é um modelo denso muito menor, de 27 bilhões de parâmetros, genuinamente aberto sob Apache 2.0, e pequeno o suficiente para rodar numa única GPU de consumo. É uma linha de modelo totalmente separada da família Max; o "3.8" no nome é a única coisa que ele compartilha com o flagship. Nosso próprio guia do Qwen3.8-27B cobre o que ele consegue e não consegue fazer, caso o que você realmente queira seja inferência local e autogerenciada.
Dito sem rodeios: se você pesquisou "o Qwen3.8-Max é open source" na esperança de rodar o flagship localmente, a resposta é não. Se uma manchete disse que a Qwen liberou os pesos do "Qwen3.8", muito provavelmente estava se referindo ao checkpoint menor 2.4T-A95B ou ao modelo 27B sem relação direta, não ao produto Max completo que as pessoas têm em mente ao dizer "Qwen3.8-Max". Nossa cobertura do Qwen3.8-Flash-Next trata de um terceiro lançamento de peso aberto, separado, da mesma família, com sua própria arquitetura de embeddings não paramétrica de contexto de 1M, um design genuinamente diferente tanto da linha Max quanto do modelo 27B, apesar do nome geracional sobreposto.
Como ele se compara, com a ressalva de que a maior parte disso é autorreportada
A avaliação independente e de terceiros especificamente sobre o Qwen3.8-Max ainda é escassa. A maioria dos números de comparação em circulação, incluindo as próprias alegações da Alibaba de que ele supera o GPT-5.6 Sol Max e o Claude Fable 5 em tarefas agênticas de uso de computador, remete às próprias tabelas publicadas pela Alibaba, e não a um terceiro neutro rodando o mesmo teste em todos os modelos. Um dado útil, ainda que limitado: uma discussão no Hacker News citou números independentes de custo por tarefa, colocando o Qwen em cerca de $1,13 por tarefa contra cerca de $1,80 do Claude Opus para trabalho agêntico comparável, uma diferença de eficiência real se ela se confirmar, mas extraída da metodologia de uma única fonte, não de um consenso amplo. Enquanto os números de benchmark do Gemini são descritos por pelo menos um rastreador como auditados de forma independente, os do Qwen são descritos pela mesma fonte como autorreportados. Essa assimetria importa se você está tomando uma decisão de compra com base num gráfico comparativo: verifique se os números do Qwen no gráfico vieram da Alibaba ou do mesmo laboratório que rodou todos os outros modelos na mesma linha.
Onde isso se encaixa se você não vive de benchmarks de modelos
Se o seu caso de uso real é resumir documentos que você já tem ou conversar sobre eles, em vez de escolher um modelo de codificação de ponta, o Qwen3.8-Max não está realmente competindo nessa categoria: ele não tem nenhum produto de ancoragem em documentos construído ao redor dele, como o Gemini Notebook ou o ChatPDF têm, e seu contexto de 1M de tokens é um número bruto de capacidade, não um sistema de citação e recuperação. Se você está avaliando o modelo porque está escolhendo entre modelos hospedados de ponta para codificação ou trabalho agêntico, a lista prática é: confirme que você está calculando o preço da atualização -0902, e não do Qwen3-Max original já descontinuado (os dois têm preços diferentes em pelo menos um rastreador), confirme se você precisa do flagship fechado via API ou se seria melhor atendido pelo modelo de peso aberto 27B, e reverifique o preço atual direto na página do DashScope da própria Alibaba ou numa listagem ativa da OpenRouter, em vez de num post de blog estático, já que essa família específica de modelos mudou de nome e de preço duas vezes em menos de doze meses.
O próprio acesso se divide nas mesmas linhas do licenciamento. Chegar ao Qwen3.8-Max pelo app Qwen Chat da Alibaba ou pela API DashScope exige uma conta na Alibaba Cloud e, no caso da API, uma configuração de cobrança contra os preços por token descritos acima. A OpenRouter é o caminho mais simples se você já a usa para outros modelos: ela lista o Qwen3.8-Max como um modelo de provedor único (só Alibaba Cloud International, sem roteamento de contingência), então uma queda ou um limite de taxa do lado da Alibaba não tem para onde migrar, ao contrário de algumas listagens multiprovedor na mesma plataforma. Se você realmente quer rodar algo por conta própria em vez de chamar uma API, lembre-se de que o Qwen3.8-Max não é uma opção: os caminhos de peso aberto dessa família são o checkpoint Qwen3.8-2.4T-A95B, de licença restritiva, ou o Qwen3.8-27B, genuinamente aberto, e só o modelo 27B realmente cabe no hardware que a maioria das pessoas ou pequenas equipes possui.
Perguntas frequentes
O que é o Qwen3.8-Max?
O atual modelo de IA carro-chefe da Alibaba: um modelo esparso de mistura de especialistas com 2,4 trilhões de parâmetros e uma janela de contexto de 1 milhão de tokens, lançado em 3 de agosto de 2026 e atualizado como "Qwen3.8-Max-0902" em 2 de setembro de 2026. É fechado e disponível só via API, com preço de $2,00 por milhão de tokens de entrada e $6,00 por milhão de tokens de saída na OpenRouter.
O Qwen3.8-Max é o mesmo que o Qwen3-Max?
Não. O Qwen3-Max (sem o ".8") é um modelo mais antigo e descontinuado, de setembro de 2025, com mais de 1 trilhão de parâmetros. O Qwen3.8-Max é seu sucessor de 2026, com mais do dobro de parâmetros e uma janela de contexto muito maior. Pelo menos um rastreador de benchmarks ainda lista o modelo antigo separadamente, o que é uma fonte comum de confusão.
O Qwen3.8-Max é open source?
O flagship completo Qwen3.8-Max não tem peso aberto; é fechado e está disponível só pela API da Alibaba, pelo Qwen Chat e por plataformas de terceiros como a OpenRouter. Um checkpoint relacionado, mas diferente, reduzido e só de texto (Qwen3.8-2.4T-A95B), foi lançado com pesos abertos sob uma licença personalizada restritiva, e um modelo separado e menor, de 27B (Qwen3.8-27B), foi lançado sob uma licença Apache 2.0 genuinamente aberta. São três produtos diferentes, apesar do nome "3.8" compartilhado.
Quanto custa o Qwen3.8-Max?
$2,00 por milhão de tokens de entrada e $6,00 por milhão de tokens de saída, segundo a listagem ativa da OpenRouter para a versão atual "-0902", em setembro de 2026. O Qwen3-Max mais antigo e descontinuado tinha um preço diferente, e reportado de forma inconsistente, então não reaproveite um preço que você encontrar para aquele modelo.
O que é o Qwen3-Max-Thinking?
Uma variante focada em raciocínio da linha original Qwen3-Max, lançada por volta de janeiro de 2026. As evidências sugerem que é um modo ou checkpoint dentro da mesma linhagem Max (ativado por um parâmetro de API), e não uma arquitetura de modelo totalmente separada, embora a cobertura não seja totalmente consistente nesse ponto. Continua fechado, disponível só via API e Qwen Chat.