Alibaba liberó los pesos de Qwen3.8-Flash-Next como vista previa de la arquitectura Qwen4, para que los desarrolladores puedan experimentar y evaluarla. Es un modelo multimodal de mezcla de expertos con 176.000 millones de parámetros totales, de los cuales 51.000 millones corresponden a parámetros de incrustación de n-gramas, y que activa 6.000 millones de parámetros por token. Su ventana de contexto nativa es de 262.144 tokens, extensible a un millón con YaRN.

NVIDIA entregó soporte funcional de día cero a través de SGLang, vLLM y NVIDIA TensorRT LLM, además de validación sobre el GB300 NVL72 para inferencia y recetas de post-entrenamiento con NVIDIA NeMo AutoModel y NVIDIA NeMo RL.

¿Qué problema resuelve la arquitectura híbrida?

Qwen3.8-Flash-Next está diseñado para aplicaciones de alto volumen e intensivas en contexto, como la programación con agentes, el procesamiento de documentos y los flujos de trabajo con herramientas. A medida que el contexto crece, el cómputo de atención y la memoria de la caché KV se convierten en cuellos de botella. El modelo ataca ambos con una arquitectura híbrida que combina Gated DeltaNet (GDN) y Qwen Sparse Attention (QSA).

Tres de cada cuatro capas usan GDN para comprimir de forma continua el contexto histórico en un estado recurrente de tamaño fijo, lo que elimina el crecimiento de la caché KV a medida que las secuencias se alargan. La capa restante emplea QSA para hacer recuperación precisa a lo largo de todo el contexto.

Los enfoques previos de atención dispersa dependen de indexadores a nivel de token, que se vuelven cada vez más caros en cómputo conforme crece la longitud del contexto. QSA agrega la secuencia en microbloques, estima su importancia a nivel de bloque y selecciona solo las regiones más relevantes. Eso recorta la atención, el cómputo y la sobrecarga de indexado dentro de cada capa, un diseño que calza bien con arquitecturas que alternan capas GDN y QSA.

Los benchmarks publicados por Alibaba sugieren que QSA mejora la eficiencia de las cargas de un millón de tokens. Comparado con la atención completa, su kernel de atención entregó aceleraciones de hasta 7,6 veces durante el prellenado y 4,9 veces durante la decodificación. En una prueba de servicio en línea con uso intensivo de caché, con contexto de un millón de tokens y una tasa de aciertos de caché de prefijo del 90%, Qwen3.8-Flash-Next alcanzó 8,6 veces el rendimiento de prellenado de Qwen3.7-Plus.

Figura 1. Esquema de Qwen3.8-Flash-Next con tres capas GDN y una capa QSA con mezcla de expertos, para reducir memoria y cómputo en inferencia de contexto grande
Figura 1. Esquema de Qwen3.8-Flash-Next con tres capas GDN y una capa QSA con mezcla de expertos, para reducir memoria y cómputo en inferencia de contexto grande

Las cifras del modelo de un vistazo

ParámetroValor
Parámetros totales176.000 millones (51.000 millones de incrustación de n-gramas)
Parámetros activos por token6.000 millones
Contexto nativo262.144 tokens
Contexto extendido con YaRN1.000.000 de tokens
Proporción de capas3 GDN por cada 1 QSA
Aceleración de prellenado frente a atención completahasta 7,6 veces
Aceleración de decodificación frente a atención completahasta 4,9 veces

¿Cuánto rinde sobre el GB300 NVL72?

El GB300 NVL72 tiene una arquitectura a escala de rack que integra 72 GPU NVIDIA Blackwell Ultra en una sola plataforma. Su dominio NVLink de 72 GPU permite comunicación de todos contra todos a 130 TB/s, lo que elimina los cuellos de botella que aparecen cuando el tráfico entre expertos debe cruzar redes convencionales.

Sobre esa plataforma, Qwen3.8-Flash-Next entrega más de 16.000 tokens por segundo por GPU y más de 200 tokens por segundo por usuario, cifras que permiten experimentar con aplicaciones de programación con agentes a alto rendimiento y baja latencia.

Figura 2. Curva de Pareto que muestra a Qwen3.8-Flash-Next superando los 16.000 tokens por segundo por GPU sobre NVIDIA GB300 NVL72
Figura 2. Curva de Pareto que muestra a Qwen3.8-Flash-Next superando los 16.000 tokens por segundo por GPU sobre NVIDIA GB300 NVL72

Más allá del despliegue a escala de rack, el modelo también corre en hardware local de NVIDIA: DGX Station, clusters DGX Spark y estaciones de trabajo con cuatro GPU RTX PRO 6000 Blackwell Workstation Edition. Un equipo puede prototipar y evaluar flujos de programación con agentes en hardware local y escalar el mismo modelo al GB300 NVL72 para producción.

¿Cómo se ajusta y con qué motor se sirve?

Para casos de uso específicos, el modelo se puede afinar con NVIDIA NeMo AutoModel, una biblioteca de fine-tuning nativa de PyTorch con soporte de día cero para checkpoints de Hugging Face. Permite entrenar directamente sobre los checkpoints existentes, sin conversión de modelo, con soporte de SFT completo o de LoRA para ahorrar memoria. Un paso más allá está el aprendizaje por refuerzo con las recetas de NeMo RL.

Del lado de la inferencia, SGLang, vLLM y TokenSpeed publican recetas abiertas para quienes necesitan más control sobre el rendimiento en la plataforma acelerada de NVIDIA.

¿Dónde se prueba?

El modelo está disponible en QwenCloud, y los pesos se descargan desde Hugging Face o ModelScope.