Meta vuelve al ecosistema open source con Muse Glimmer, un modelo denso de pesos abiertos con 30.000 millones de parámetros y una ventana de contexto superior a 120.000 tokens, construido específicamente para trabajo agéntico de IA en local.

Optimizado para correr sobre plataformas NVIDIA de edge, escritorio y estación de trabajo, Muse Glimmer entrega 20.000 tokens por segundo en una sola GPU, lo que permite que agentes siempre activos procesen datos localmente y ejecuten flujos de varios pasos.

¿Por qué un modelo pensado para agentes y no para chat?

La mayoría de los modelos de lenguaje están optimizados para conversación, priorizando interacciones de un solo turno y un tiempo bajo hasta el primer token. Las cargas agénticas exigen otra cosa. Un agente que arma la estructura de un proyecto de software, revisa documentación o mantiene una base de conocimiento puede encadenar varias llamadas a herramientas dentro de una misma sesión, con un nivel de confiabilidad, consistencia, coherencia de contexto largo y rendimiento sostenido para el que los modelos orientados al chat no fueron diseñados.

Muse Glimmer usa una arquitectura densa que activa todos los parámetros por cada token que procesa, sin enrutamiento, sin selección de expertos y sin varianza entre las rutas de cada token. Por eso rinde bien en tareas agénticas que exigen seguimiento fiable de instrucciones, coherencia en contextos largos, latencia predecible y menos modos de falla.

Figura 1. Vista general de la arquitectura densa de Muse Glimmer comparada con la arquitectura MoE
Figura 1. Vista general de la arquitectura densa de Muse Glimmer comparada con la arquitectura MoE

Privacidad por diseño en hardware local

Los flujos agénticos que tocan archivos personales, comunicaciones, credenciales y documentos propietarios necesitan inferencia que nunca abandone la máquina. Muse Glimmer busca ese equilibrio: es lo bastante grande para razonamiento complejo de varios pasos, pero lo bastante chico para caber en la VRAM de una sola GPU NVIDIA, sin necesidad de fragmentar el modelo, descargar cómputo a la CPU ni recurrir a endpoints externos.

La arquitectura Tensor Core de NVIDIA acelera exactamente ese patrón de cómputo, habilitando inferencia agéntica en tiempo real completamente en el dispositivo y a contexto completo.

  • NVIDIA GeForce RTX 5090: combina 32 GB de VRAM con Tensor Cores de quinta generación, lo que lleva Muse Glimmer a los equipos de desarrollo locales, mantiene el código propietario en la máquina y elimina el costo por token de inferencia. Ficha oficial en nvidia.com.
  • NVIDIA DGX Spark: lleva rendimiento de estación de trabajo y pipelines agénticos empresariales a un sistema compacto. NVLink entrega acceso de alta velocidad a memoria y los contenedores NVIDIA NIM reducen el despliegue local a un solo comando.
  • NVIDIA DGX Station: acerca cómputo Blackwell Ultra a escala de rack para entornos empresariales on-premise, pensado en equipos que operan bajo mandatos de aislamiento físico o marcos de cumplimiento donde la inferencia en la nube no es opción.
  • NVIDIA Jetson: extiende la inferencia local al borde, habilitando robótica, automatización industrial y sistemas embebidos donde el aislamiento de red es requisito duro y cada decisión debe ocurrir en el punto de acción.

¿Cuánto rinde sobre Blackwell Ultra?

Sobre NVIDIA Blackwell Ultra, Muse Glimmer supera los 20.000 tokens por segundo por GPU con precisión BF16/NVF4. La curva de rendimiento contra interactividad muestra que la arquitectura densa de 30.000 millones de parámetros sostiene alta concurrencia sin el sobrecosto de enrutamiento de los modelos de mezcla de expertos.

Una sola Blackwell Ultra maneja el modelo completo en VRAM con holgura para búferes grandes de caché KV, lo que la hace apta para el alto rendimiento y la baja latencia que exige correr agentes siempre activos sobre infraestructura propia.

Figura 2. Rendimiento de Muse Glimmer sobre NVIDIA Blackwell Ultra con precisión BF16
Figura 2. Rendimiento de Muse Glimmer sobre NVIDIA Blackwell Ultra con precisión BF16

Cómo se compara con las alternativas de pesos abiertos

AspectoMuse Glimmer 30BModelos MoE equivalentes
ArquitecturaDensa, activa 100% de los parámetrosActiva un subconjunto por token
ContextoSobre 120K tokensVariable, típicamente 128K
LatenciaPredecible, sin varianza de ruteoSujeta al enrutador de expertos
VRAM mínimaCabe en una GPU de 32 GBSuele requerir fragmentación

Para dimensionar el costo de entrada en Chile: una GeForce RTX 5090 se mueve en torno a los 3.000 dólares en retail internacional, lo que con IVA e internación local supera con holgura los 3 millones de pesos. Un Jetson Orin Nano Super, en cambio, parte cerca de los 249 dólares, aunque su memoria limita el tamaño de modelo que se puede cargar sin cuantización agresiva. Para la mayoría de los talleres y laboratorios universitarios de la región, la ruta realista pasa por cuantizar el modelo o compartir una estación de trabajo, no por una GPU por escritorio.

Ajuste fino y construcción de casos agénticos

Es posible ejecutar NVIDIA NemoClaw en un entorno OpenShell seguro para crear asistentes personales de larga duración orientados a generación de código, soporte autónomo y tareas similares.

Figura 3. Muse Glimmer corriendo localmente con el arnés de agentes NemoClaw en un entorno controlado, servido por vLLM sobre DGX Spark
Figura 3. Muse Glimmer corriendo localmente con el arnés de agentes NemoClaw en un entorno controlado, servido por vLLM sobre DGX Spark

Quienes desarrollan pueden post-entrenar el modelo con NVIDIA NeMo AutoModel, una biblioteca de ajuste fino con soporte nativo para checkpoints de Hugging Face que no exige conversión de modelo.

Habilita SFT completo y ajuste con LoRA de fábrica, optimizado para experimentación rápida sobre GPUs NVIDIA, incluida DGX Spark. También admite aprendizaje por refuerzo con NeMo RL, con recetas de ejemplo y curvas de validación de precisión de referencia.

¿Cómo se despliega y dónde se descarga?

NVIDIA soporta varias pilas de inferencia según la necesidad. SGLang y vLLM entregan recetas de inferencia de código abierto para quienes requieren control fino sobre el rendimiento en la plataforma acelerada.

También está disponible como contenedor NVIDIA NIM descargable, preconstruido y optimizado, que autoselecciona la configuración de ejecución y el esquema de servicio.

Los pesos se descargan desde HuggingFace y el modelo se puede probar en build.nvidia.com.