El proyecto LLM-Scaler de Intel, nacido de su iniciativa Project Battlematrix, busca simplificar la ejecución de IA generativa sobre las tarjetas gráficas Arc (Pro) de la serie B usando vLLM, ComfyUI, SGLang y otros programas populares del rubro, todo empaquetado en un stack preconfigurado sobre Docker. Esta semana llegaron dos versiones nuevas que suman soporte de modelos el mismo día de su lanzamiento, además de otras mejoras.

¿Qué trae la versión de vLLM?

Lo más destacado de LLM-Scaler-vLLM beta 0.21.0-b3, publicada el lunes, fue entregar soporte el mismo día para el nuevo modelo Muse Glimmer 30B de Meta. El modelo corre con cuantización FP8 en línea sobre tarjetas como la Arc Pro B70, es decir, sin necesidad de un punto de control precuantizado aparte.

La misma versión agrega soporte de DFlash para Muse-Glimmer-30B y para Qwen3.6-27B. También mejora el tiempo hasta el primer token en Gemma-4-31B y en Gemma-4-26B-A4B-it, y suma correcciones varias sobre esta actualización del stack de vLLM para gráficas Intel.

¿Qué trae la versión de Omni?

LLM-Scaler-Omni beta 0.2.0-b1 se liberó el mismo día del anuncio. Este contenedor Docker actualiza a la pila ComfyUI 0.31 sobre XPU, agrega soporte para generación local de video con MiniMax H3 y habilita Wan Animate 2 en las Arc Pro B70 y B60.

La cobertura de modelos optimizados también se amplía con Wan 2.2 14B T2V Turbo, LTX-2, Z-Image / Lumina y Krea2. A eso se suma soporte gestionado de GGUF Q4_1 y una integración fijada de ComfyUI-GGUF-XPU.

Las dos versiones, lado a lado

LLM-Scaler-vLLM 0.21.0-b3LLM-Scaler-Omni 0.2.0-b1
FocoModelos de lenguajeImagen y video
Novedad principalMuse Glimmer 30B con FP8 en líneaComfyUI 0.31 sobre XPU
Modelos sumadosQwen3.6-27B con DFlashMiniMax H3, Wan Animate 2, Wan 2.2 14B T2V Turbo, LTX-2, Z-Image / Lumina, Krea2
OptimizaciónMejor tiempo al primer token en Gemma-4-31B y Gemma-4-26B-A4B-itGGUF Q4_1 gestionado
Hardware citadoArc Pro B70Arc Pro B70 y B60

¿Por qué importa el soporte el mismo día?

El detalle temporal es la señal real. Que un stack alternativo a CUDA incorpore un modelo de 30 mil millones de parámetros en la misma jornada de su publicación implica que la brecha de disponibilidad entre el ecosistema dominante y el resto se está midiendo en horas y no en meses, que era la norma hasta hace poco.

Para quien arma inferencia local fuera de los grandes centros de datos, incluido el escenario latinoamericano donde el acceso a hardware de IA de gama alta es caro e intermitente, esa distancia importa más que el rendimiento bruto: define si una tarjeta profesional de escritorio sirve para el modelo del mes o queda esperando un port. El formato en contenedor Docker apunta a lo mismo, evitar que la instalación de controladores y dependencias sea la barrera de entrada.