Los agentes de IA de larga duración gastan la mayor parte de su tiempo en ejecución de alto volumen: llamadas a herramientas, validación de resultados y delegación en subagentes. Usar un modelo de razonamiento de frontera en cada uno de esos pasos agrega costo y latencia sin agregar inteligencia donde hace falta.

NVIDIA Nemotron 3.5 Lightning es un modelo abierto de 30.000 millones de parámetros con arquitectura mixture-of-experts (MoE) y 3.000 millones de parámetros activos, construido justamente para esa capa de ejecución. Está diseñado para entornos de agentes como OpenClaw y Hermes Agent, todos soportados por NVIDIA NemoClaw, el stack abierto de seguridad y gestión para agentes que operan de forma permanente.

La familia de modelos abiertos Nemotron funciona como una biblioteca de software: cada versión mejora precisión y velocidad. Y a medida que los modelos evolucionan, madura también el enrutamiento y la orquestación entre ellos.

Eso importa porque los desarrolladores construyen cada vez más sobre un sistema de modelos en vez de uno solo. Los modelos de frontera como Nemotron 3 Ultra se hacen cargo de la orquestación y la planificación compleja, mientras los modelos chicos y eficientes absorben la ejecución de alto volumen.

¿Por qué Lightning sirve para agentes largos?

Nemotron 3.5 Lightning es un modelo abierto y personalizable de 30.000 millones de parámetros MoE con 3.000 millones activos. Los MoE son rápidos porque un enrutador envía cada token a unos pocos de sus muchos expertos, así que solo una fracción de los parámetros se ejecuta por token. Eso entrega la capacidad de un modelo denso mucho más grande al costo de cómputo de uno pequeño.

Es el miembro más chico de la familia Nemotron 3 y llega con varias técnicas ya probadas en sus hermanos mayores:

  • Decodificación especulativa: la predicción multi-token se incorporó durante el entrenamiento, igual que en Nemotron 3 Super y Nemotron 3 Ultra. Lightning suma además DFlash y DSpark para optimizar la inferencia en distintos escenarios de servicio.
  • Entrenamiento optimizado por entorno: el modelo fue entrenado para los entornos de agentes más usados, lo que permite llamadas más precisas y menor latencia en tareas repetitivas.

El resultado es un modelo pensado para volúmenes altos de llamadas y baja latencia, en un tamaño que corre tanto en una NVIDIA DGX Spark como en un centro de datos.

Personalización desde el primer día

Los modelos se ganan su lugar en un sistema de agentes cuando se adaptan al trabajo concreto. Y los modelos de clase Lightning son altamente personalizables: los modelos chicos se ajustan más rápido, más barato y sobre hardware bastante más modesto que sus contrapartes grandes.

Como en cada lanzamiento abierto de Nemotron, los pesos, los datos de entrenamiento y las recetas se liberan de la forma más permisiva posible bajo OpenMDW-1.1, de modo que se puede:

El lanzamiento incluye Nemotron-RL Agentic Terminal Pivot, un conjunto de datos abierto de aprendizaje por refuerzo agéntico usado para entrenar parte de las capacidades de programación.

Enrutar el trabajo con NeMo Switchyard

Mientras los modelos de frontera se llevan los titulares, modelos como Lightning se ganan las medallas en la trinchera. Son los que resuelven un git pull, validan la salida de una herramienta, dan formato a resultados y ejecutan las llamadas rutinarias que dominan el presupuesto de tokens de cualquier agente de larga duración.

El enrutamiento y la orquestación de modelos hacen esa división del trabajo más accesible, y ahora están disponibles a través de NVIDIA NeMo Switchyard. Switchyard puede exponer a Lightning como destino de enrutamiento junto a otros modelos abiertos y cerrados, para que cada solicitud aterrice en el modelo más capaz y eficiente que pueda resolverla. La planificación sube hacia el modelo de frontera, la ejecución baja hacia Lightning.

¿Cómo rinde frente a sus competidores?

Según NVIDIA, Nemotron 3.5 Lightning lidera la frontera de Pareto entre precisión y velocidad en el Artificial Analysis Intelligence Index, un índice que combina nueve evaluaciones de tareas agénticas, programación, razonamiento científico e inteligencia general.

Nemotron 3.5 Lightning define la frontera de Pareto entre precisión y velocidad para modelos abiertos pequeños
Nemotron 3.5 Lightning define la frontera de Pareto entre precisión y velocidad para modelos abiertos pequeños

La eficiencia de un agente no se mide en tokens por segundo, sino en qué tan rápido completa trabajo útil. En PinchBench, Lightning llega a 86% de precisión y completa 10.000 tareas un 30% más rápido que Qwen3.6 35B con precisión comparable.

MétricaNemotron 3.5 LightningReferencia del anuncio
Parámetros totales30.000 millonesNemotron 3 Ultra queda como modelo de frontera
Parámetros activos por token3.000 millones (10% del total)Costo de cómputo de un modelo chico
Precisión en PinchBench86%Qwen3.6 35B, precisión similar
Velocidad en 10.000 tareas30% más rápidoQwen3.6 35B como comparación
Velocidad de salidaHasta 4 vecesModelos de tamaño similar
LicenciaOpenMDW-1.1 (pesos, datos y recetas)Uso comercial permitido
Nemotron 3.5 Lightning lidera la frontera de eficiencia al completar tareas agénticas hasta 30% más rápido
Nemotron 3.5 Lightning lidera la frontera de eficiencia al completar tareas agénticas hasta 30% más rápido

¿Cómo consigue velocidad sin perder precisión?

La respuesta está en dos frentes: decodificación especulativa y cuantización.

Decodificación especulativa

El modelo puede generar varios tokens a la vez mediante decodificación especulativa, un proceso en que un modelo borrador propone tokens que luego se revisan de forma eficiente. Lightning pasó por una etapa dedicada de preentrenamiento para incorporar la predicción multi-token, igual que Nemotron 3 Super y Ultra, y después por una fase adicional que mejoró su precisión.

Además se entregan dos modelos borradores: DSpark, recomendado para cargas en DGX Spark y para baja concurrencia en centro de datos, y DFlash, que puede rendir mejor en otros escenarios. La predicción multi-token conviene en concurrencia media a alta, con longitudes de borrador que se acortan a medida que la concurrencia sube.

Cuantización

Lightning se distribuye con un checkpoint NVFP4 además del BF16, con los mismos kernels especializados que ya usa Nemotron 3 Ultra sobre GPU NVIDIA Blackwell, Hopper y Ampere. El mismo archivo sirve igual de bien en un centro de datos que en un escritorio con DGX Spark.

¿Se puede correr localmente en Chile?

Este es el punto que más interesa a quien no quiere pagar por token. A 4 bits por parámetro, un modelo de 30.000 millones en NVFP4 ocupa del orden de 15 GB de pesos, lo que lo deja dentro del presupuesto de memoria de una GeForce RTX 5090 de 32 GB y bastante lejos de las configuraciones multi-GPU que exigen los modelos de frontera. NVIDIA menciona explícitamente NVIDIA Jetson, GeForce RTX 5090 y DGX Spark como plataformas locales, y trabajó con equipos como EXO Labs para medir el rendimiento en DGX Spark.

Nemotron 3.5 Lightning en la frontera de Pareto para modelos abiertos pequeños en el ranking local de EXO Labs
Nemotron 3.5 Lightning en la frontera de Pareto para modelos abiertos pequeños en el ranking local de EXO Labs

Para un equipo en Chile o la región, la combinación de licencia permisiva y ejecución on-premise significa que el costo del agente deja de ser una variable atada al dólar y al consumo: pasa a ser una inversión única en hardware. Se puede correr con el conjunto estándar de herramientas del ecosistema, incluyendo LM Studio, llama.cpp, Ollama y Unsloth, sin depender de una API externa ni de disponibilidad regional.

Ecosistema de socios

Nemotron 3.5 Lightning llega respaldado por un ecosistema en crecimiento de socios en entornos de agentes, personalización, despliegue e inferencia.