Serve Qwen3.8-2.4T-A95B, a 2.4T-Parameter Model, with Configurable Reasoning on NVIDIA GB300 NVL72

Alibaba ha liberado los pesos abiertos para Qwen3.8-2.4T-A95B (Qwen3.8-Max), su modelo de pesos abiertos más grande hasta la fecha, acercando capacidades de frontera al ecosistema open-source. El modelo cuenta con 2.4 billones (T) de parámetros totales, con 95 mil millones (B) activados por token. Utiliza una arquitectura de mezcla de expertos (MoE) de grano fino con un híbrido de atención completa y lineal, una ventana de contexto de hasta un millón de tokens y una longitud de salida de hasta 128K, diseñado para cargas de trabajo de razonamiento y agentes exigentes.

Desplegar un modelo de pesos abiertos de 2.4T parámetros requiere computación acelerada a escala de centro de datos. La inferencia a esta escala depende de un diseño conjunto extremo entre chips, arquitectura de sistemas y software. NVIDIA está colaborando con el ecosistema de código abierto para llevar este modelo a despliegues multinodo mediante kernels optimizados, runtimes de inferencia y recetas de servicio distribuidas.

Sin necesidad de ajuste adicional, el modelo alcanza un rendimiento superior a 4K tokens por segundo por GPU y más de 350 tokens por segundo por usuario en sistemas NVIDIA GB300 NVL72 utilizando precisión FP8 desde el primer día. Se esperan optimizaciones adicionales, incluyendo precisión NVFP4, para ofrecer mayores ganancias de rendimiento con el tiempo.

Innovaciones arquitectónicas para inferencia de contexto largo

Qwen3.8-2.4T-A95B está construido para las cargas de trabajo de agentes más complejas, como programación, análisis de documentos a gran escala y flujos de trabajo multietapa de larga duración. A diferencia de los modelos centrados en chat que envían un prompt único y reciben una respuesta única, las aplicaciones de agentes acumulan instrucciones del sistema, salidas de herramientas, documentos recuperados, código, registros y trazas de razonamiento a través de un flujo de trabajo. A medida que el contexto crece, la atención, la computación y la memoria caché KV se convierten en las limitaciones principales.

La arquitectura híbrida de atención completa y lineal aborda esto, alternando entre ambas. En las capas de atención completa, cada token atiende a todos los demás, mientras que en las capas de atención lineal, la creciente caché KV es reemplazada por un estado recurrente acotado. Qwen3.8-2.4T-A95B mantiene tanto la computación como la memoria acotadas a medida que el contexto escala hasta un millón de tokens.

El MoE de grano fino hace que el conteo de 2.4T parámetros sea práctico de servir. En lugar de un pequeño número de expertos grandes, la capacidad se distribuye en una población mayor de expertos más pequeños, mejorando la especialización y la eficiencia de enrutamiento por unidad de cómputo activado. Un router entrenado activa solo los expertos necesarios por token, por lo que los costos de servicio siguen a los parámetros activos y no a los 2.4T parámetros totales, entregando capacidad de escala de frontera a una fracción del costo de un modelo denso comparable.

Los controles de razonamiento integrados (bajo/alto/x-alto) permiten a los desarrolladores configurar la profundidad de inferencia por solicitud, intercambiando cómputo por calidad de razonamiento según la tarea: aumentar para razonamiento multietapa complejo o disminuir para procesamiento de documentos de alto rendimiento.

Diagrama de arquitectura que muestra las redes delta de puerta lineal de Qwen3.8-2.4T-A95B combinadas con atención completa y MoE de grano fino
Diagrama de arquitectura que muestra las redes delta de puerta lineal de Qwen3.8-2.4T-A95B combinadas con atención completa y MoE de grano fino

La arquitectura del modelo integra capas de atención híbridas con un sistema de enrutamiento MoE que permite gestionar eficientemente los 2.4 billones de parámetros durante la inferencia en tiempo real.

Rendimiento optimizado de Qwen3.8-2.4T-A95B en GB300 NVL72

El GB300 NVL72 presenta una arquitectura a escala de rack que integra 72 GPUs NVIDIA Blackwell Ultra en una sola plataforma. Su gran dominio NVIDIA NVLink de 72 GPUs permite una comunicación eficiente todo-a-todos a 130 TB/s, eliminando los cuellos de botella que aparecen cuando el tráfico de expertos debe cruzar redes tradicionales estándar.

De forma nativa, Qwen3.8-2.4T-A95B ejecutándose en NVIDIA Blackwell GB300 NVL72 entrega más de 4K tokens por segundo por GPU y más de 350 tokens por segundo por usuario, permitiendo a las factorías de IA ejecutar modelos de grandes parámetros en producción con alto rendimiento y baja latencia.

Curva de Pareto que ilustra el rendimiento de Qwen3.8-2.4T-A95B alcanzando más de 4K tokens por segundo por GPU en el sistema NVIDIA GB300 NVL72
Curva de Pareto que ilustra el rendimiento de Qwen3.8-2.4T-A95B alcanzando más de 4K tokens por segundo por GPU en el sistema NVIDIA GB300 NVL72

Este gráfico muestra cómo el sistema escala el rendimiento de inferencia, permitiendo sostener altas tasas de tokens incluso con los parámetros masivos del modelo Qwen.

Post-entrenamiento y rutas de servicio para Qwen3.8-2.4T-A95B

NVIDIA soporta múltiples stacks de inferencia para satisfacer diversas necesidades de los desarrolladores. SGLang, vLLM y NVIDIA Dynamo proporcionan recetas de inferencia de código abierto para desarrolladores que requieren mayor control sobre el rendimiento en la plataforma acelerada por NVIDIA.

También está disponible para desplegar mediante un NVIDIA NIM libre de modelo, un contenedor de inferencia único que sirve cualquier modelo soportado. Descargue los pesos del modelo y despliegue desde el primer día para servir checkpoints ajustados y escalar a producción.

Los desarrolladores pueden realizar post-entrenamiento del modelo para casos de uso específicos de dominio utilizando NVIDIA NeMo AutoModel, una librería de ajuste fino nativa de PyTorch con soporte de checkpoint de Hugging Face desde el día uno. Entrene directamente sobre checkpoints existentes sin conversión de modelo, con soporte para SFT completo o ajuste fino LoRA eficiente en memoria.

¿Cómo empezar con Qwen3.8-2.4T-A95B?

Descargue los pesos del modelo Qwen3.8-2.4T-A95B desde Hugging Face o ModelScope y despliegue con un NVIDIA NIM libre de modelo desde NVIDIA NGC.

Vía NVIDIA Developer.