Alibaba liberó los pesos de Qwen3.8-Flash-Next como anticipo de la arquitectura Qwen4, para que los desarrolladores puedan experimentar con ella y evaluarla. Se trata de un modelo multimodal de mezcla de expertos (MoE) con un modelo principal de 125.000 millones de parámetros, complementado por 51.000 millones adicionales en embeddings de N-gramas, y con 6.000 millones de parámetros activados por token. Su ventana de contexto nativa es de 262.144 tokens, extensible hasta 1 millón mediante YaRN.
NVIDIA entrega soporte funcional desde el día cero a través de SGLang, vLLM y NVIDIA TensorRT LLM, con validación sobre NVIDIA GB300 NVL72 para inferencia y recetas de post entrenamiento provenientes de NVIDIA NeMo AutoModel y NVIDIA NeMo RL.
¿Qué resuelve la arquitectura híbrida?
Qwen3.8-Flash-Next está diseñado para aplicaciones de alto volumen e intensivas en contexto, como la programación con agentes, el procesamiento de documentos y los flujos de trabajo guiados por herramientas. A medida que el contexto crece, el cómputo de atención y la memoria de la caché KV se transforman en cuellos de botella. El modelo ataca ambos con una arquitectura híbrida que combina Gated DeltaNet (GDN) y Qwen Sparse Attention (QSA). Tres de cada cuatro capas usan GDN para comprimir de forma continua el contexto histórico en un estado recurrente de tamaño fijo, lo que elimina el crecimiento de la caché KV cuando las secuencias se alargan. La capa restante usa QSA para una recuperación precisa a lo largo de todo el contexto.
Los enfoques previos de atención dispersa dependen de indexadores a nivel de token que se vuelven cada vez más caros en cómputo a medida que el contexto se extiende. QSA agrega la secuencia en micro bloques, estima su importancia a nivel de bloque y selecciona solo las regiones más relevantes. Eso recorta la atención, el cómputo y la sobrecarga de indexación dentro de cada capa, un diseño que calza bien con arquitecturas que alternan capas GDN y QSA.
| Componente | Proporción de capas | Función |
|---|---|---|
| Gated DeltaNet (GDN) | 3 de cada 4 | Comprime el historial en un estado recurrente fijo, sin crecimiento de caché KV |
| Qwen Sparse Attention (QSA) | 1 de cada 4 | Recuperación precisa por micro bloques sobre el contexto completo |
Los benchmarks publicados por Alibaba sugieren que QSA puede mejorar la eficiencia de las cargas de trabajo de 1 millón de tokens. Comparado con atención completa, su kernel de atención alcanzó aceleraciones de hasta 7,6 veces durante el prefill y 4,9 veces durante el decoding. En una prueba de servicio en línea con uso intensivo de caché, con contexto de 1 millón de tokens y una tasa de acierto de caché de prefijo del 90%, Qwen3.8-Flash-Next logró 8,6 veces el rendimiento de prefill de Qwen3.7-Plus.

¿Cuánto rinde sobre la NVIDIA GB300 NVL72?
La GB300 NVL72 tiene una arquitectura a escala de rack que integra 72 GPU NVIDIA Blackwell Ultra en una sola plataforma. Su amplio dominio NVLink de 72 GPU permite comunicación todos contra todos a 130 TB/s, lo que elimina los cuellos de botella que aparecen cuando el tráfico entre expertos debe cruzar redes convencionales. Ejecutado sobre NVIDIA GB300 NVL72, el modelo entrega más de 16.000 tokens por segundo por GPU y sobre 200 tokens por segundo por usuario, cifras que permiten experimentar con aplicaciones de programación con agentes a alto rendimiento y baja latencia.

Más allá del despliegue a escala de rack, Qwen3.8-Flash-Next también corre sobre hardware NVIDIA local, incluidas la NVIDIA DGX Station, los clústeres NVIDIA DGX Spark y estaciones de trabajo con cuatro GPU NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition. Los desarrolladores pueden prototipar y evaluar flujos de programación con agentes en hardware local y luego escalar el mismo modelo a GB300 NVL72 para el servicio en producción.
Cuánta memoria pide de verdad
La ficha técnica no lo dice de forma directa, pero la aritmética es simple y conviene tenerla a la vista antes de planificar una compra. Los 125.000 millones de parámetros del modelo principal más los 51.000 millones de los embeddings de N-gramas suman unos 176.000 millones de parámetros. A un byte por parámetro en FP8, eso son alrededor de 176 GB solo de pesos, sin contar la caché KV ni la activación. Esa cifra explica por qué el camino local que propone NVIDIA pasa por una estación de trabajo de cuatro GPU profesionales y no por una tarjeta de escritorio suelta.
Para un equipo en Chile o el resto de la región, la lectura práctica es que el rack GB300 NVL72 es infraestructura de proveedor de nube, no de sala de servidores propia. La vía realista para probar el modelo es la API alojada o el arriendo de capacidad GPU por hora, y recién después evaluar hardware local si el volumen lo justifica. La ventaja del formato MoE juega a favor en ese cálculo: aunque el modelo pesa 176.000 millones de parámetros, solo activa 6.000 millones por token, así que el costo de cómputo por consulta es mucho menor que el que sugiere su tamaño total.
Post entrenamiento y motores de inferencia
Los desarrolladores pueden ajustar el modelo para casos de uso específicos usando NVIDIA NeMo AutoModel, una biblioteca de fine-tuning nativa de PyTorch con soporte de checkpoints de Hugging Face desde el día cero. Permite entrenar directamente sobre checkpoints existentes sin conversión del modelo, con soporte para SFT completo o fine-tuning eficiente en memoria vía LoRA. También es posible dar un paso más y aplicar aprendizaje por refuerzo con las recetas de NeMo RL.
NVIDIA soporta múltiples stacks de inferencia para cubrir necesidades distintas. SGLang, vLLM y TokenSpeed entregan recetas de inferencia de código abierto para quienes requieren mayor control sobre el rendimiento en la plataforma acelerada por NVIDIA.
Cómo empezar
El modelo se puede probar desde QwenCloud. Los pesos están disponibles para descarga en Hugging Face y en ModelScope.




