El equipo Qwen de Alibaba liberó Qwen3.8-Flash-Next, un modelo multimodal de mezcla de expertos (Mixture-of-Experts) y pesos abiertos, construido con el costo por token como criterio de diseño. El punto de control combina un cuerpo de 125B con una tabla de embeddings N-grama de 51B y un módulo de predicción multi-token de 4B. Solo 6B de parámetros se activan por token.

El equipo lo posiciona como un anticipo temprano de la arquitectura que sostendrá a Qwen4, el mismo papel que Qwen3-Next cumplió para Qwen3.5. Cuatro cambios cargan con el lanzamiento: un híbrido de Gated DeltaNet y Qwen Sparse Attention, el Gated Residual, el N-gram Embedding y el optimizador Muon. Según el equipo de Qwen, el costo de entrenamiento fue de aproximadamente un noveno del de Qwen3.7-Plus.

¿Qué es lo realmente nuevo?

Cuatro decisiones de arquitectura explican el modelo, que suma 180B en disco:

  • Atención híbrida (GDN + QSA): tres de cada cuatro capas usan Gated DeltaNet, una capa de atención lineal que comprime el historial en un estado recurrente de tamaño fijo. La cuarta capa corre Qwen Sparse Attention (QSA), que usa un indexador liviano para seleccionar contexto con granularidad de micro-bloque en lugar de por token. La disposición es de 12 × (3 × GDN, 1 × QSA) a lo largo de 48 capas, con un presupuesto QSA de 512 bloques o 2.048 tokens.
  • Gated Residual: el flujo residual se abre en 4 ramas paralelas, con una compuerta de lectura elemento a elemento y una compuerta de escritura escalar por rama, con rango de cuello de botella 320.
  • N-gram Embedding: una tabla de bigramas y trigramas de 20.000.000 de entradas en la capa 2 agrega capacidad mediante búsquedas deterministas. Puede descargarse a la memoria del anfitrión con prefetch asincrónico, aunque esa descarga por ahora solo funciona en dispositivos NVIDIA.
  • Receta de entrenamiento: el optimizador Muon se aplica junto a AdamW sobre categorías específicas de pesos, se eliminó el calentamiento del tamaño de lote y se reajustaron las leyes de escalamiento.

La capa de mezcla de expertos lleva 512 expertos, de los que se activan 10 enrutados más 1 compartido, con dimensión intermedia de experto 640.

¿Se puede desplegar en un equipo propio?

Sí, pero no en una estación de trabajo. El punto de control FP8 pesa 172,78 GiB y el BF16 llega a 335,28 GiB. Según las recetas de vLLM, TP2 es la configuración FP8 mínima validada sobre GB300 y TP4 es la recomendada. En un nodo de 8 × H200 corresponde usar TEP8, porque TP8 a secas es incompatible con los bloques de cuantización de ancho 128 del punto de control.

Ese es el matiz que conviene tener claro antes de planificar hardware: la activación dispersa recorta el cómputo, no el almacenamiento. Un modelo que activa 6B por token sigue exigiendo alojar los 180B completos.

Resultados en las pruebas estándar

Qwen reporta 58,7 en DeepSWE 1.1, 62,5 en SWE-bench Pro, 81,0 en SWE-bench Multilingual y 91,9 en LiveCodeBench v6. En tareas con agentes anota 73,9 en CoWorkBench, 55,7 en JobBench y 73,5 en Toolathlon Verified. Entre los resultados multimodales aparecen 84,5 en AndroidWorld, 76,6 en LVBench, 88,5 en RealWorldQA y 95,7 en MathVision con intérprete de código.

El modelo no lidera en todas partes. Claude Opus 4.6 (Max) se queda con HLE al marcar 40,0 frente al 35,9 de Qwen, y DeepSeek-V4-Flash-0731 encabeza NL2Repo-Bench con 54,2 contra 48,1. El razonamiento de frontera sigue siendo la brecha.

Eficiencia y contexto

MétricaValor reportado
Costo de entrenamiento~1/9 del de Qwen3.7-Plus
Aceleración de prefill (QSA, 1M tokens)7,6× según el anuncio; 10,2× según los recetarios
Aceleración de decodificación4,9× según el anuncio; 6,6× según los recetarios
Rendimiento de prefill vs Qwen3.7-Plus8,6× con 90% de aciertos de caché de prefijo
Contexto nativo262.144 tokens
Contexto extendido con YaRN1.000.000 de tokens

Las cifras de aceleración provienen del anuncio del equipo, del recetario de SGLang y de las recetas de vLLM. Conviene tratar el rango como dato del proveedor mientras no exista medición independiente.

Cómo se ejecuta

El modelo se sirve a través de vLLM, SGLang, TokenSpeed, transformers serve y llama.cpp para las cuantizaciones GGUF. El ajuste fino está soportado vía Unsloth, Swift y LLaMA-Factory. Ya alimenta el modo "Standard" de QwenWork y funciona con Qwen Code.

El modo de razonamiento viene activado por defecto, con reasoning_effort en xhigh, medium o low. Qwen recomienda temperatura 1,0 y top_p 0,95 para el modo de razonamiento, y temperatura 0,7 con top_p 0,80 para el modo de instrucción.

Un detalle que conviene revisar antes de cualquier uso comercial: la licencia es qwen-community-1.0, no Apache-2.0. Para equipos de la región que evalúan alojar el modelo por su cuenta, la combinación de esa licencia y el requisito de un nodo multi-GPU hace que en la práctica la vía realista siga siendo el consumo por API, salvo que ya exista infraestructura propia de ese porte.

Los detalles completos están en la página de GitHub y en la ficha del modelo en Hugging Face.