Todas las guías
Noticias9 min de lectura · actualizado 27 ago 2026

Qwen3.8-Flash-Next: un modelo de pesos abiertos de 1M de tokens, y el detalle de licencia que casi nadie está cubriendo

El equipo Qwen de Alibaba lanzó Qwen3.8-Flash-Next el 26 de agosto de 2026, un modelo de pesos abiertos construido alrededor de una ventana de contexto de 1M de tokens y una novedosa tabla de embeddings no paramétrica. Es un adelanto arquitectónico genuino de Qwen4, no solo un nivel de tamaño más. Esto es lo que realmente es, lo que cuesta, si puedes ejecutarlo tú mismo, y un detalle de licencia que varios medios han publicado mal.

Respuesta rápida

Qwen3.8-Flash-Next es un modelo de pesos abiertos que Alibaba lanzó el 26 de agosto de 2026, planteado como un adelanto arquitectónico explícito de la próxima familia Qwen4, no como una actualización de tamaño rutinaria de la línea Qwen3.8. Combina una base de 125.000 millones de parámetros con un módulo de predicción multi-token de 4.000 millones y un presupuesto de 6.000 millones de parámetros activos por token, usando atención híbrida lineal/completa para mantenerse rápido incluso con contexto largo.

Su cifra estrella es la longitud de contexto: 262.144 tokens de forma nativa, ampliable hasta 1.000.000 mediante YaRN, que hay que activar explícitamente y no viene por defecto. Son aproximadamente 750.000 palabras en una sola ventana continua, útil para quien procese una revisión bibliográfica completa o un montón de fuentes del tamaño de un libro de una sola vez.

No tiene licencia Apache 2.0. Los pesos se publican bajo la Qwen Community License 1.0, una licencia más restrictiva que los términos Apache 2.0 de Qwen3.8-27B. Varias coberturas iniciales dan a entender que ambos modelos comparten licencia; no es así. Comprueba los términos antes de cualquier uso comercial.

Casi con toda seguridad no puedes ejecutar esto en casa. La propia guía de Unsloth sitúa el mínimo viable en unos 75 GB de RAM y VRAM combinadas incluso con cuantización de 1 bit, lo que en la práctica equivale a un Mac Studio de gama alta o una estación de trabajo multi-GPU, no una sola tarjeta de consumo.

El README del repositorio de GitHub de Qwen3.8-Flash-Next, que lo describe como un adelanto temprano de la arquitectura usada en Qwen4
QwenLM/Qwen3.8-Flash-Next en GitHub, comprobado el 27 de agosto de 2026.

Qué se lanzó exactamente, y por qué Alibaba lo llama un "adelanto"

Qwen3.8-Flash-Next es un modelo disperso de mezcla de expertos: una base de 125.000 millones de parámetros enrutada a través de 512 expertos (10 activos más 1 compartido por token, cada experto de 640 dimensiones), combinada con una tabla de embeddings N-gram de 51.000 millones de parámetros y un módulo de predicción multi-token (MTP) de 4.000 millones, lo que da 6.000 millones de parámetros activos realmente calculados por token a lo largo de 48 capas. La propia ficha del modelo en Hugging Face indica un total de 180.000 millones de parámetros para el paquete completo; parte de la documentación de los frameworks de servicio, en cambio, cita 176.000 millones solo para la base más la tabla de embeddings, contando el módulo MTP por separado, así que no te sorprendas si ves ambas cifras según la fuente. Alibaba posiciona el modelo como un primer vistazo a la arquitectura de Qwen4, publicado como pesos abiertos completos bastante antes de que llegue la familia Qwen4 terminada, en lugar de como un sucesor numerado de Qwen3.8-27B (el modelo más pequeño, con licencia Apache, que este sitio cubrió el 17 de agosto). Los dos modelos comparten tokenizador y torre de visión, y el mismo contexto base de 262.144 tokens, pero responden a preguntas distintas: Qwen3.8-27B es la opción de "modelo pequeño que de verdad puedes ejecutar en local", y Flash-Next es la demostración arquitectónica de "hasta dónde puede llegar un modelo enorme y eficiente". Tratarlos como el mismo lanzamiento, como hace parte de la cobertura inicial, resta importancia a lo que distingue a cada uno.

La tabla N-gram: no es solo "más parámetros"

La tabla de embeddings N-gram de 51.000 millones de parámetros es la parte de este lanzamiento con más probabilidades de quedar aplanada a un "es más grande" en la cobertura informal, y eso subestima lo que en realidad hace. Es una tabla de consulta con direccionamiento determinista, indexada por n-gramas locales de tokens, no una capa de mezcla de expertos aprendida que se enruta a través de una red de compuertas. Como las direcciones de la tabla se conocen antes incluso de que se ejecute el paso hacia delante, el fragmento relevante se puede precargar desde la RAM del host o el almacenamiento SSD normales mientras el resto del modelo sigue calculando, añadiendo una latencia extra cercana a cero. Se comporta más como un diccionario de frases muy grande en caché junto a la red que como cómputo adicional de MoE, que es también la razón por la que no cuenta dentro de la cifra de 6.000 millones de parámetros activos. Para la atención, Qwen combinó esto con un diseño híbrido: tres capas Gated DeltaNet (atención lineal) por cada capa de atención completa, más Qwen Sparse Attention, que según los propios benchmarks de Alibaba ofrece un prefill entre 7,6 y 10,2 veces más rápido y una decodificación entre 4,9 y 6,6 veces más rápida con el contexto completo de 1M de tokens. Esas cifras son de Qwen, no reproducidas de forma independiente, así que trata el multiplicador como orientativo y no como algo asentado.

Cómo conseguir bien el contexto de 1M de tokens

El contexto nativo del modelo es de 262.144 tokens; alcanzar el techo anunciado de 1.000.000 de tokens exige activar explícitamente el escalado YaRN estático, no ocurre automáticamente solo porque los pesos lo admitan. Es un paso fácil de pasar por alto si partes de una configuración por defecto de Hugging Face o de una compilación cuantizada de la comunidad sin revisar los ajustes de escalado. Si tu configuración muestra la cifra menor de 262K, es el comportamiento esperado, no una descarga rota.

La ficha del modelo de Qwen3.8-Flash-Next en Hugging Face, mostrando la etiqueta de licencia qwen-community-1.0, un tamaño de 180.000 millones de parámetros y el tipo de tensor BF16
Ficha del modelo de Qwen3.8-Flash-Next, huggingface.co, comprobado el 27 de agosto de 2026.

Licencia y acceso: dónde está la confusión

Qwen3.8-Flash-Next se publica bajo la Qwen Community License 1.0, no bajo la licencia Apache 2.0 que cubre a Qwen3.8-27B. La cobertura del lanzamiento de The Decoder da a entender una paridad de licencias abiertas entre ambos modelos; no es exacto, y es el hecho aislado de este lanzamiento que más merece la pena comprobar tú mismo contra el propio archivo LICENSE del repositorio en GitHub antes de construir nada comercial encima. La propia entrada del anuncio de Qwen enmarca el lanzamiento específicamente como un adelanto de investigación y prueba comunitaria, lo que encaja con la licencia más restrictiva: Alibaba quiere comentarios sobre la arquitectura, no necesariamente reutilización comercial sin restricciones todavía.

  • Hugging Face: Qwen/Qwen3.8-Flash-Next, además de cuantizaciones comunitarias en FP8, NVFP4 y GGUF de Unsloth y otros.
  • ModelScope, el propio hub de modelos de Alibaba, refleja los mismos pesos.
  • API de QwenCloud, con endpoints compatibles con OpenAI y Anthropic, con un precio aproximado de 0,16 $ por millón de tokens de entrada y 0,47 $ por millón de tokens de salida, según la cobertura de The Decoder sobre la propia entrada de precios de Qwen.
  • Frameworks de servicio: vLLM y SGLang tienen recetas desde el primer día; el soporte de llama.cpp existe como una pull request sin fusionar (#27742) en lugar de como una versión etiquetada, así que espera asperezas si construyes específicamente sobre llama.cpp.

¿Puedes ejecutar esto tú mismo de verdad?

En la práctica, solo si tienes hardware serio. La propia guía de cuantización de Unsloth sitúa el mínimo en unos 75 GB de RAM y VRAM combinadas incluso con una cuantización agresiva de 1 bit, lo que en la práctica significa un Mac Studio de 96 GB o más, una estación de trabajo multi-GPU, o una instancia en la nube pensada para ello, no una sola GPU de consumo. Si eso te descarta, la API de QwenCloud es el camino práctico para usar realmente el modelo en lugar de solo leer sobre él.

El ángulo que nadie más está cubriendo: qué significa 1M de tokens para el trabajo de investigación

Una ventana de contexto de 1M de tokens equivale aproximadamente a 750.000 palabras en una sola pasada continua, suficiente para mantener una revisión bibliográfica completa, un manuscrito del tamaño de un libro, o un gran montón de fuentes multidocumento como un único bloque de texto que el modelo lee todo de una vez. Es un planteamiento genuinamente distinto de cómo maneja Gemini Notebook un gran montón de fuentes: su nivel Pro permite 300 fuentes por cuaderno y 500.000 palabras por fuente individual, pero no carga todas las fuentes en una sola ventana de contexto por cada consulta. Indexa las fuentes y recupera los pasajes relevantes para cada pregunta, que es por lo que la calidad de las respuestas se mantiene incluso con cientos de fuentes cargadas. Un modelo como Flash-Next, que lee todo de forma continua, puede detectar conexiones entre documentos que a veces se le escapan a la recuperación; una herramienta basada en recuperación como Gemini Notebook se mantiene rápida y coherente a una escala (cientos de documentos largos) que sería poco práctico meter en cualquier ventana de contexto única, sean o no 1M de tokens. Ninguno de los dos planteamientos es estrictamente mejor: el contexto continuo encaja con un conjunto de documentos acotado y estrechamente relacionado que quieres leer de principio a fin, mientras que la recuperación encaja con una biblioteca extensa y poco relacionada que consultas pieza por pieza. Si estás eligiendo entre alojar tú mismo un modelo abierto de contexto largo o usar una herramienta basada en fuentes, esa es la disyuntiva real, no solo una comparación de recuento de tokens.

Preguntas frecuentes

¿Forma parte la tabla N-gram de 51.000 millones de parámetros del cómputo activo del modelo?

No. Es una tabla de consulta no paramétrica y de direccionamiento determinista que se puede precargar desde RAM o SSD antes del paso hacia delante, añadiendo una latencia extra cercana a cero. Queda fuera de la cifra de 6.000 millones de parámetros activos que describe el cómputo real por token del modelo.

¿Puedo ejecutar Qwen3.8-Flash-Next en una sola GPU de consumo?

No. La propia guía de Unsloth sitúa el mínimo viable en unos 75 GB de RAM y VRAM combinadas incluso con cuantización de 1 bit, lo que en la práctica significa un Mac Studio de gama alta o una configuración multi-GPU. La API de QwenCloud es la opción práctica si no tienes ese hardware.

¿Es Qwen3.8-Flash-Next de código abierto bajo Apache 2.0, como Qwen3.8-27B?

No, y este es el dato que más se confunde sobre el lanzamiento. Qwen3.8-Flash-Next usa la Qwen Community License 1.0, una licencia más restrictiva que los términos Apache 2.0 de Qwen3.8-27B. Confirma los términos contra el propio archivo LICENSE del repositorio antes de cualquier uso comercial.

¿Obtengo automáticamente el contexto completo de 1.000.000 de tokens?

No. El contexto nativo del modelo es de 262.144 tokens. Alcanzar 1.000.000 de tokens exige activar explícitamente el escalado YaRN estático en tu configuración de inferencia; no viene activado por defecto.

¿Por qué llama Alibaba "adelanto" a un modelo de pesos completamente abiertos?

Porque se posiciona explícitamente como un primer vistazo a la arquitectura prevista para la familia completa de Qwen4, publicado como pesos abiertos antes de ese lanzamiento en lugar de como una actualización numerada estándar de la línea Qwen3.8 existente.

Seguir leyendo