El equipo Qwen de Alibaba presentó Qwen3.8-Flash-Next, un modelo multimodal de mezcla de expertos que funciona como adelanto de la arquitectura de Qwen4. La meta declarada es igualar a modelos bastante más grandes con una fracción del costo de entrenamiento.

El modelo suma 125.000 millones de parámetros totales, pero activa solo 6.000 millones por token. Incluye además 51.000 millones de parámetros en una capa nueva de incrustación de n-gramas, una de las innovaciones de arquitectura previstas para Qwen4. Esa capa guarda grupos de palabras frecuentes como entradas independientes, en una especie de diccionario de frases, y puede residir en la memoria RAM del sistema en vez de la memoria de la tarjeta gráfica, con un costo adicional "relativamente bajo", según el equipo.

¿Qué hace distinta la capa de n-gramas?

La capa alimenta información a nivel de frase al inicio de la red. Aporta 51.000 millones de parámetros, es decir cerca del 41% del total del modelo, pero al correr en RAM convencional no compite por el recurso caro, que es la memoria de la GPU. En la práctica, el peso que hay que alojar en el acelerador es mucho menor de lo que sugiere la cifra de 125.000 millones.

El modelo admite de forma nativa una ventana de contexto de 262.144 tokens y puede escalar hasta un millón usando YaRN. El informe técnico está publicado en GitHub, y los pesos se ofrecen tanto en Hugging Face como en ModelScope. La versión de producción se distribuye como Qwen3.8-Flash a través de QwenCloud, con un precio de 0,16 dólares por millón de tokens de entrada y 0,47 dólares por millón de tokens de salida.

Un noveno del costo de entrenamiento

Qwen3.8-Flash-Next entrega mejores resultados que Qwen3.7-Plus con aproximadamente un noveno del costo de entrenamiento, de acuerdo con el equipo de Qwen, y las mayores ganancias aparecen en programación y tareas de oficina. Para dimensionar la diferencia: Qwen3.7-Plus tiene 397.000 millones de parámetros con 17.000 millones activados por token, casi el triple del recuento activo de Flash-Next.

Los propios resultados publicados por Alibaba enfrentan al modelo con DeepSeek-V4-Flash, de 284.000 millones de parámetros y 13.000 millones activados, y con Claude Opus 4.6 en su versión Max de Anthropic. Pese a que ambos son bastante más grandes o más caros, Flash-Next lidera en la mayoría de las tareas evaluadas.

El modelo parece afinado para las pruebas de programación agéntica, que exigen a una inteligencia artificial encontrar y corregir errores de forma autónoma en proyectos de software reales. Flash-Next anotó 58,7 en DeepSWE y 62,5 en SWE-bench Pro, por sobre DeepSeek-V4-Flash y Claude Opus 4.6.

La brecha en tareas de oficina y productividad es todavía más ancha. Flash-Next llegó a 73,9 en CoWorkBench mientras DeepSeek-V4-Flash se quedó en 45,1. En JobBench, una prueba de flujos de trabajo profesionales, anotó 55,7, casi el doble que Qwen3.7-Plus con 27,6. En razonamiento científico (GPQA Diamond: 91,7) y programación competitiva (LiveCodeBench v6: 91,9) los modelos quedan parejos.

PruebaFlash-NextQwen3.8-27BQwen3.7-PlusDeepSeek-V4-FlashClaude Opus 4.6
Parámetros totales125.000 M27.000 M397.000 M284.000 Msin dato
Parámetros activos6.000 M27.000 M17.000 M13.000 Msin dato
DeepSWE 1.158,742,216,554,4sin dato
SWE-bench Pro62,561,755,856,053,4
SWE-bench Multilingual81,073,875,8sin dato77,5
NL2Repo-Bench48,142,341,154,247,6
CoWorkBench73,970,765,145,168,2
JobBench55,733,427,641,336,6
IFBench81,379,579,179,262,5
GPQA Diamond91,789,290,390,891,3
HLE35,930,834,733,840,0
LiveCodeBench v691,990,389,690,688,8

Claude Opus 4.6 solo queda por delante en Humanity's Last Exam, una prueba construida en torno a problemas multidisciplinarios de dificultad extrema, aunque conviene anotar que se trata de un modelo de Anthropic ya algo antiguo, de febrero de 2026. Como siempre, los puntajes de las pruebas y el desempeño en el mundo real pueden diferir.

¿Cuánta presión mete el precio?

Alibaba había presentado Qwen3.8-Max como su modelo insignia recién a comienzos de agosto, para competir con Claude Opus 4.8, Gemini 3.1 Pro y GPT-5.6 Sol. Flash-Next rinde apenas por debajo de ese buque insignia, pero cuesta cerca de una doceava parte, con una brecha de precio de aproximadamente 12 veces tanto en entrada como en salida.

Precio por millón de tokensQwen3.8-MaxQwen3.8-Flash-Next
Entrada2,00 dólares0,16 dólares
Salida6,00 dólares0,47 dólares

Esa política de precios sigue apretando a OpenAI y Anthropic. Qwen3.8-27B también viene ganando popularidad porque corre de forma local y rinde bien por casi nada, siempre que se tenga el equipo para moverlo. OpenAI respondió hace poco con descuentos fuertes en su nueva línea GPT-5.6. Es una buena noticia para quien paga la cuenta, y una mala para el crecimiento acelerado de ingresos que los proveedores de inteligencia artificial necesitan para sostener el relato de la inversión.

Para un equipo pequeño en Chile o el resto de la región, la aritmética es directa: procesar un millón de tokens de entrada y medio millón de salida cuesta cerca de 0,40 dólares con Flash-Next, contra unos 5 dólares con el modelo insignia de la misma casa. Y como los pesos están publicados, la alternativa de correrlo en infraestructura propia también está sobre la mesa.