A medida que la inteligencia artificial evoluciona de simples chatbots a agentes autónomos, los modelos abiertos responden a la demanda del mercado por un control total sobre dónde se ejecuta la IA, cómo se despliega y cómo evoluciona con el tiempo.
Hoy, NVIDIA expande su familia de modelos Nemotron con Nemotron 3.5 Lightning, el modelo de mayor eficiencia en su clase para cargas de trabajo de agentes IA de ejecución prolongada. Este lanzamiento sucede al Nemotron 3 Nano y refleja el compromiso de NVIDIA con la mejora continua de modelos abiertos para lograr mayor precisión y velocidad.
Diseñado para tareas especializadas dentro de sistemas multi-agente más grandes, Nemotron 3.5 Lightning es un modelo de mixture-of-experts con 30 mil millones de parámetros, ayudando a crear aplicaciones agentic más inteligentes y eficientes.
Además, NVIDIA lanza NeMo Switchyard, una biblioteca de código abierto para enrutamiento inteligente dentro de herramientas de agentes populares. Las empresas pueden usarla para construir un router basado en sus necesidades específicas. Al desplegarse, NeMo Switchyard puede dirigir inteligentemente cada solicitud al modelo más capaz y adecuado para la tarea sin necesidad de que los desarrolladores reescriban sus aplicaciones.
En conjunto, Nemotron 3.5 Lightning y NeMo Switchyard ofrecen un mayor control sobre cómo se despliega la IA, dónde se ejecuta y qué tan eficientemente opera, ya sea en computadores personales, estaciones de trabajo, centros de datos o la nube.

El despliegue de este modelo permite a las organizaciones adaptar sus arquitecturas de IA según las demandas de procesamiento específicas de cada caso de uso industrial o académico.
¿Por qué los agentes siempre activos necesitan un sistema de modelos?
Los sistemas agentic modernos, conocidos como agentes siempre activos, operan cada vez más como sistemas de modelos, o ensambles de modelos, donde cada unidad está especializada en tareas distintas.
Los modelos abiertos NVIDIA Nemotron están diseñados específicamente para esta arquitectura. Un modelo de razonamiento de frontera como Nemotron 3 Ultra o GPT-5.6 puede planificar y orquestar un flujo de trabajo, mientras que modelos especializados más pequeños, como Nemotron 3.5 Lightning, pueden realizar tareas dirigidas como revisión de código, uso de herramientas, monitoreo de alertas de seguridad y respuesta a consultas de facturación.
¿Cómo potencia Nemotron 3.5 Lightning las tareas especializadas de alto volumen?
NVIDIA Nemotron 3.5 Lightning es un modelo abierto totalmente personalizable construido para tareas de alto volumen que alimentan agentes de funcionamiento continuo. Fue desarrollado con aportes de la Coalición Nemotron, cuyos miembros proporcionaron metodologías de evaluación, software de inferencia y conjuntos de datos para ayudar a avanzar el modelo.
El modelo ofrece una velocidad de salida hasta 4 veces más rápida, lo que resulta en una finalización de tareas agentic un 30% más veloz en comparación con otros modelos de su clase. Al ser abierto y personalizable, Nemotron 3.5 Lightning puede ser fácilmente post-entrenado con NVIDIA NeMo utilizando los datos, herramientas y flujos de trabajo propios de una organización para mejorar la precisión en tareas especializadas.

La comparativa presentada arriba muestra la eficiencia operativa del nuevo modelo en entornos de alta carga de trabajo, superando métricas previas en latencia y throughput.
Líderes en IA de diversas industrias están personalizando Nemotron 3.5 Lightning para sus cargas de trabajo, incluyendo CrowdStrike para ciberseguridad, Harvey con Trajectory para servicios legales y CodeRabbit con Baseten para revisión de código, ayudando a mejorar la precisión en tareas específicas de dominio. Adicionalmente, Lila Sciences está ayudando a mejorar las capacidades de razonamiento para tareas científicas, y Fastino Labs reporta precisiones líderes en desarrollo de software, finanzas y salud.

La adopción de este modelo por parte de empresas globales demuestra la versatilidad de la arquitectura para resolver problemas complejos en sectores críticos.
Nemotron 3.5 Lightning también otorga a las organizaciones control sobre la privacidad y el despliegue. Puede ejecutarse en sistemas locales de IA, incluyendo NVIDIA RTX PCs, NVIDIA DGX Spark, NVIDIA DGX Station y NVIDIA Jetson, ayudando a los usuarios a maximizar sus inversiones en infraestructura existente, o escalar a través de dispositivos de edge AI, estaciones de trabajo NVIDIA RTX PRO, centros de datos y entornos en la nube. Nemotron 3.5 Lightning puede correr localmente para tareas de gran volumen que requieren respuestas rápidas.
Además, como con cada lanzamiento de Nemotron, NVIDIA publica gran parte de los datos de entrenamiento y técnicas permitidas por la licencia, lo que permite la trazabilidad, auditoría y entrenamiento de otros modelos. Junto a Lightning, NVIDIA lanza Nemotron-RL-Agentic-Terminal-Pivot, un dataset de aprendizaje por refuerzo para agentes utilizado para post-entrenar capacidades de programación.
¿Cómo lograr aplicaciones de IA más eficientes con el enrutamiento de modelos?
Algunos modelos son mejores para programar, otros para razonar o para tareas ligeras, mientras que otros están optimizados para ejecutarse localmente con mayor privacidad. Si los clientes dependen de un único modelo por defecto, corren el riesgo de gastar de más o perder calidad; si gestionan el enrutamiento manualmente, se convierte en un trabajo de integración que puede ralentizar el despliegue.
NVIDIA NeMo Switchyard es una biblioteca de enrutamiento de modelos de código abierto para agentes IA. La tecnología dirige los prompts al modelo más capaz y eficiente para cada paso de un flujo de trabajo de forma automática, basándose en necesidades específicas. Los desarrolladores pueden ajustar el router con diferentes algoritmos para priorizar calidad, latencia o costos. En un sistema de modelos, las empresas pueden crear agentes IA potentes con mejores tokenomics.
Los benchmarks internos muestran que NeMo Switchyard mantiene una precisión de nivel frontera mientras reduce el costo de finalización de tareas a casi un tercio del modelo Opus 4.8 por sí solo.

El gráfico anterior evidencia la ventaja económica de implementar un sistema de enrutamiento dinámico en lugar de utilizar un modelo monolítico para todas las operaciones.
NVIDIA trabaja con socios en todo el ecosistema de IA para llevar el enrutamiento inteligente de modelos a las herramientas y plataformas que los desarrolladores ya utilizan:
- Boomi: Evaluó Switchyard en cinco capacidades de enrutamiento, logrando un 100% de precisión en enrutamiento por dominio, enviando el 59% del tráfico a un modelo ajustado 5 veces más rápido y reduciendo la latencia en turnos posteriores en un 21%.
- Cadence: Mejoró la eficiencia en un 9.9% utilizando el ChipStack AI Super Agent para verificación formal.
- Classmethod: Ejecuta cargas de trabajo opencode y Fireworks usando NeMo Switchyard internamente, con pruebas iniciales que muestran una reducción de costos del 27% manteniendo la calidad.
- Cognition: Integró NVIDIA NeMo Switchyard para optimizar sus flujos de trabajo internos de agentes de software.
Vía NVIDIA Blog.




