NVIDIA PAIR: Router virtual para potenciar el cómputo en red local
Esta nota fue publicada originalmente en el sitio web de NVIDIA. Se reproduce aquí con autorización de NVIDIA.
Distribuye tareas locales de IA para aliviar cuellos de botella en entornos multi-agente, con soporte para Ollama y LM Studio, sin requerir cambios en los agentes o sistemas de control.
Los agentes de IA están aprendiendo a realizar más funciones trabajando en conjunto. Un agente principal puede dividir una tarea compleja en trabajos más pequeños y asignar esas tareas a subagentes especializados. Además, los usuarios están comenzando a ejecutar múltiples sesiones de agentes al mismo tiempo. Los flujos de trabajo multi-agente para completar tareas complejas son cada vez más frecuentes.
Este enfoque de búsqueda en anchura puede mejorar la velocidad de finalización de tareas y elevar la calidad de las respuestas, pero también puede saturar el sistema cuando muchas solicitudes se envían a la GPU simultáneamente.
NVIDIA Personal AI Router (PAIR) aprovecha tu hardware local para aliviar este cuello de botella en agentes y subagentes. PAIR dirige cada solicitud de inferencia independiente a un sistema disponible en la red doméstica. Funciona con servicios de inferencia locales conocidos, incluyendo Ollama y LM Studio, por lo que los usuarios pueden expandir el cómputo disponible para un agente sin rediseñar el agente mismo. No es necesario realizar cambios en el arnés del agente.
La versión beta de NVIDIA PAIR está disponible para sistemas Windows, macOS y Linux compatibles a través de interfaces gráficas y de terminal. Soporta sistemas equipados con GPUs NVIDIA GeForce RTX Serie 20 y superiores, GPUs de estación de trabajo NVIDIA RTX PRO (arquitectura Turing y superior), así como NVIDIA DGX Spark y silicio Apple M4 o superior.
La imagen superior ilustra cómo PAIR intercede entre el agente y los motores de inferencia locales para balancear la carga de trabajo entre distintas máquinas conectadas en la misma red.
¿Qué es NVIDIA PAIR?
NVIDIA PAIR es un router de inferencia virtual que maximiza el cómputo de IA en tu hogar. No es un nuevo motor de inferencia. Ollama o LM Studio siguen ejecutando el modelo en una máquina seleccionada. PAIR descubre los sistemas participantes, rastrea si cada sistema está listo para una solicitud, programa trabajos independientes y devuelve cada respuesta a la aplicación que la originó.
Los agentes pueden enviar una solicitud a través de la interfaz local familiar que esperan. PAIR recibe la solicitud mediante su proxy, identifica los requisitos de su motor y modelo, y selecciona un nodo elegible. Ese nodo ejecuta la solicitud de principio a fin y envía la respuesta de vuelta a través de PAIR. El agente sigue viendo una sola conexión mientras PAIR maneja la colocación detrás de él. Sus características incluyen:
- Sin nueva API: PAIR actúa como proxy de las interfaces compatibles de Ollama y LM Studio en lugar de exigir que cada arnés de agente se integre con una nueva API de clúster.
- Clientes elásticos: Los sistemas compatibles pueden contribuir con capacidad cuando están disponibles y retirarse cuando sea necesario, como al apagar o hibernar el equipo.
- Control local: PAIR está diseñado para mantener los prompts, datos y el tráfico de inferencia dentro de la red local existente del usuario.

El diagrama anterior muestra el flujo de datos: el agente envía una petición al router PAIR, que luego la deriva al nodo con mayor disponibilidad de recursos en la red.
¿Cómo resuelve PAIR el problema de inferencia local multi-agente?
Consideremos a un usuario avanzado de IA ejecutando un agente local en un PC principal con NVIDIA RTX. El agente recibe una tarea de investigación, programación u organización personal y la divide entre varios subagentes. Cada trabajador explora una parte limitada del problema mientras otros trabajadores verifican la evidencia o ensamblan el resultado.
Desde la perspectiva del usuario, esto es una sola tarea. En la capa de inferencia, puede convertirse en docenas de llamadas independientes al modelo. Si cada llamada apunta a un solo motor local, compiten por los mismos espacios de ejecución. La cola crece y el PC principal permanece ocupado, aunque una estación de trabajo RTX PRO, una laptop o un DGX Spark en otra parte de la red podrían tener capacidad compatible disponible.
PAIR permite que la capa de inferencia se amplíe junto con el agente. Algunas solicitudes de subagentes pueden ejecutarse en el PC principal mientras otras corren en nodos emparejados adicionales. Cuando la carga de trabajo tiene suficiente trabajo independiente, utilizar más sistemas listos puede reducir las esperas y mejorar el tiempo de finalización de extremo a extremo.
Esto permite mantener el PC principal enfocado en juegos intensivos en gráficos, creación de contenido u otro trabajo interactivo, mientras se distribuye la inferencia a otros nodos.
Esta es una concurrencia a nivel de carga de trabajo. PAIR no hace que una sola solicitud de inferencia se ejecute a través de varias GPUs. Cada solicitud se asigna a un nodo elegible y permanece allí durante todo su ciclo de vida.
Aprovechando la elasticidad de los clústeres de IA domésticos
Un clúster de IA doméstico no es un centro de datos en miniatura. Los clústeres dedicados suelen construirse alrededor de sistemas que permanecen encendidos, configurados constantemente y disponibles de forma continua. El hardware doméstico es dinámico. Un PC gamer puede ocuparse jugando. Una laptop puede entrar en modo suspensión, cerrarse o salir de la red. Una estación de trabajo puede tener el modelo solicitado mientras que otra máquina no. Un motor de inferencia puede detenerse, o el usuario puede reclamar una GPU para una aplicación en primer plano.
PAIR está diseñado alrededor de esas condiciones cambiantes. Puede descubrir sistemas locales con mDNS, emparejar dispositivos compatibles en la red privada y mantener una vista en vivo de qué nodos pueden aceptar trabajo nuevo. Los nodos cliente pueden unirse al grupo disponible cuando están listos y retirarse cuando sea necesario sin convertir el hogar en una instalación de inferencia dedicada y siempre encendida.
Para cada nueva solicitud, PAIR considera varios factores, incluyendo:
- Si un nodo emparejado está en línea y listo.
- Si un motor de inferencia compatible está habilitado.
- Si el modelo exacto solicitado está presente.
- La carga de trabajo actual del nodo y motor, incluyendo trabajos activos.
- La utilización existente de la GPU (si hay una aplicación o herramienta intensiva en gráficos ejecutándose).
PAIR no depende de que todos los sistemas sean idénticos o estén permanentemente disponibles. Programa las solicitudes de inferencia y gestiona el clúster en función de cómo se utilizan los sistemas en la vida cotidiana.
Demo: Escenario de cinco subagentes con Hermes
Esta demostración presenta PAIR con Hermes Desktop, que crea la carga de trabajo de los subagentes, y Ollama, que ejecuta el modelo en cada nodo seleccionado. La tarea solicita a Hermes analizar una bandeja de entrada doméstica sintética y producir un plan confiable de "Reinicio Dominical": qué debe suceder esta noche, esta semana, más tarde o nada en absoluto, con evidencia para cada conclusión material.
Para la ejecución con cinco subagentes, Hermes crea cinco especialistas para revisar partes independientes de la evidencia, reconciliar conflictos y devolver un plan consolidado. Hermes posee la descomposición, delegación y síntesis. PAIR posee el enrutamiento de inferencia. Ollama ejecuta cada solicitud en el nodo que PAIR selecciona.
Video 1. Mira cómo NVIDIA PAIR distribuye la inferencia entre cinco subagentes orquestados por Hermes
youtube:1h49m21s_placeholder_id
Usando Qwen 3.6 35B A3B en una laptop NVIDIA RTX Spark, la misma carga de trabajo de cinco subagentes tardó 18 minutos en completarse en promedio. En comparación, un clúster PAIR de tres dispositivos que contenía una laptop RTX Spark, un DGX Spark y una RTX 5090 tardó 8 minutos y 48 segundos en completarse en promedio. Tenga en cuenta que esta es una demostración no oficial y específica de la configuración, no un benchmark general ni una promesa de escalado lineal.

La gráfica anterior muestra la reducción significativa en el tiempo de procesamiento al pasar de un solo nodo a una configuración distribuida mediante PAIR. Demostración no oficial y específica de la configuración. Los resultados dependen del paralelismo de la carga de trabajo, el modelo, la configuración del motor, el hardware, la red y la disponibilidad de los nodos.
Vía Edge AI and Vision Alliance.




