Los agentes de inteligencia artificial están aprendiendo a hacer más trabajando en conjunto. Un agente principal puede dividir una tarea compleja en trabajos más pequeños y asignarlos a subagentes especializados. A eso se suma que cada vez más usuarios ejecutan varias sesiones de agentes al mismo tiempo.
Ese enfoque en amplitud mejora la velocidad y la calidad de las respuestas, pero también puede atascar el sistema cuando muchas peticiones llegan a la GPU en simultáneo.
NVIDIA Personal AI Router (PAIR) usa el hardware local para aliviar ese cuello de botella. PAIR enruta cada petición de inferencia independiente hacia un equipo disponible en la red doméstica. Funciona con servicios de inferencia local ya conocidos, como Ollama y LM Studio, de modo que se amplía el cómputo disponible para un agente sin rediseñarlo. No hace falta modificar el entorno del agente.
La beta de NVIDIA PAIR está disponible para sistemas compatibles con Windows, macOS y Linux, con interfaz gráfica y de terminal. Soporta equipos con GPU NVIDIA GeForce RTX Serie 20 y posteriores, GPU de estación de trabajo NVIDIA RTX PRO (arquitectura Turing y posteriores), además de NVIDIA DGX Spark y silicio Apple M4 o superior.

¿Qué es exactamente NVIDIA PAIR?
NVIDIA PAIR es un router virtual de inferencia que maximiza el cómputo de IA disponible en la casa. No es un motor de inferencia nuevo: Ollama o LM Studio siguen siendo quienes ejecutan el modelo en la máquina elegida. PAIR descubre los equipos participantes, registra si cada uno está listo para recibir una petición, agenda los trabajos independientes y devuelve cada respuesta a la aplicación que la originó.
Los agentes pueden enviar la petición por la misma interfaz local que ya esperan. PAIR la recibe a través de su proxy, identifica qué motor y qué modelo requiere, y selecciona un nodo elegible. Ese nodo ejecuta la petición de principio a fin y devuelve la respuesta por PAIR. El agente sigue viendo una sola conexión mientras PAIR maneja la ubicación detrás. Entre sus características:
- Sin API nueva: PAIR hace de proxy de las interfaces compatibles de Ollama y LM Studio, en lugar de pedirle a cada entorno de agente que se integre con una API de clúster distinta.
- Clientes elásticos: los equipos compatibles aportan capacidad cuando está disponible y se retiran cuando se necesita, por ejemplo al apagarse o hibernar.
- Control local: PAIR está diseñado para mantener las instrucciones, los datos y el tráfico de inferencia dentro de la red local existente.

¿Qué problema resuelve en la práctica?
Imagine a un usuario avanzado corriendo un agente local en un PC principal con NVIDIA RTX. El agente recibe una tarea de investigación, programación u organización personal y la divide entre varios subagentes. Cada trabajador explora una parte acotada del problema mientras otros verifican evidencia o arman el resultado.
Desde la perspectiva del usuario esto es una sola tarea. En la capa de inferencia pueden ser docenas de llamadas independientes al modelo. Si todas apuntan a un único motor local, compiten por las mismas ranuras de ejecución. La fila crece y el PC principal queda ocupado aunque una estación de trabajo RTX PRO, un notebook o un DGX Spark en otro punto de la red tengan capacidad compatible libre.
PAIR permite que la capa de inferencia se ensanche junto con el agente. Algunas peticiones de subagentes corren en el PC principal mientras otras van a nodos emparejados. Cuando la carga tiene suficiente trabajo independiente, usar más equipos listos reduce la espera en fila y mejora el tiempo total de finalización. También deja al PC principal libre para juegos, creación de contenido u otro trabajo interactivo.
Esto es concurrencia a nivel de carga de trabajo. PAIR no hace que una misma petición de inferencia corra repartida entre varias GPU: cada petición se asigna a un nodo elegible y permanece ahí durante toda su vida.
La elasticidad de un clúster casero
Un clúster doméstico de IA no es un centro de datos en miniatura. Los clústeres dedicados se construyen en torno a equipos que permanecen encendidos, con configuración consistente y disponibilidad continua. El hardware de una casa es dinámico: un PC gamer se ocupa con un juego, un notebook se duerme o sale de la red, una estación de trabajo tiene el modelo pedido y otra máquina no.
PAIR está diseñado para esas condiciones cambiantes. Descubre los sistemas locales mediante mDNS, empareja los dispositivos soportados en la red privada y mantiene una vista en vivo de qué nodos pueden aceptar trabajo nuevo. Para cada petición considera varios factores:
- Si un nodo emparejado está en línea y listo
- Si tiene habilitado un motor de inferencia soportado
- Si el modelo solicitado está presente
- La carga actual del nodo y del motor, incluidos los trabajos activos
- El uso de GPU existente, es decir, si hay una aplicación gráfica exigente en ejecución
La demostración: cinco subagentes con Hermes
La demostración usa PAIR junto a Hermes Desktop, que genera la carga de subagentes, y Ollama, que ejecuta el modelo en cada nodo seleccionado. La tarea consiste en analizar una bandeja de entrada doméstica sintética y producir un plan confiable, con evidencia para cada conclusión relevante.
Para la corrida de cinco subagentes, Hermes crea cinco especialistas que revisan partes independientes de la evidencia, resuelven conflictos y devuelven un plan consolidado.
Con Qwen 3.6 35B A3B sobre un solo notebook NVIDIA RTX Spark, esa carga de cinco subagentes tardó 18 minutos en promedio. Un clúster PAIR de tres dispositivos, compuesto por un notebook RTX Spark, un DGX Spark y una RTX 5090, la completó en 8 minutos y 48 segundos promedio. NVIDIA advierte que se trata de una demostración no oficial y atada a esa configuración, no de un benchmark general ni de una promesa de escalamiento lineal.

La vista de trabajos de PAIR es la fuente de verdad sobre dónde corrió cada inferencia. El conteo de agentes de Hermes y el de trabajos de PAIR son mediciones distintas, porque un agente puede generar varias peticiones al modelo.
¿Cómo funciona por dentro?
Descubrimiento en la red local. Una vez instalado PAIR en cada sistema compatible con Windows, macOS o Linux, usa descubrimiento de red local (mDNS) para encontrar equipos cercanos de forma automática. También se puede agregar un nodo por dirección IP. El usuario aprueba una solicitud de emparejamiento segura para crear el conjunto de nodos de confianza. Toda comunicación entre nodos queda bloqueada hasta establecer la conexión segura y el emparejamiento; después se protege con mTLS y certificados generados.
Preparación de motores y modelos. Cada nodo participante ejecuta un motor de inferencia local soportado: Ollama o LM Studio. PAIR puede ayudar a instalar el motor e iniciar descargas de modelos en los equipos emparejados. Un nodo se vuelve elegible solo cuando el motor requerido está habilitado y el modelo exacto está disponible ahí. Los modelos no tienen que ser idénticos en todos los nodos: cargar la misma etiqueta en más equipos simplemente le da al agendador un conjunto elegible más grande.
Proxy de la interfaz local. La aplicación envía una petición compatible con Ollama o con LM Studio al endpoint local que PAIR intermedia, tomando el puerto por defecto que usan esos servicios. Si el agente usa otro puerto, se configura en los ajustes del motor de PAIR. PAIR inspecciona los requisitos de motor y modelo y los pasa al router. Esa separación es central en el diseño: el agente decide qué trabajo pedir, PAIR decide dónde debe correr.

Selección del nodo y retorno de la respuesta. El agendador filtra los sistemas emparejados según disponibilidad, estado del motor, presencia del modelo pedido y carga de trabajos. Elige un nodo elegible y el router de PAIR en ese equipo entrega la petición al motor local. Llamadas independientes de otros subagentes pueden asignarse a otros nodos listos al mismo tiempo. Las vistas de trabajos y métricas muestran qué nodo atendió cada petición.
¿Qué cargas de trabajo ganan más?
PAIR resulta más útil en cargas que exponen varias peticiones independientes al mismo tiempo, como las aplicaciones multiagente y las herramientas de IA local concurrentes. En esos casos permite repartir trabajos independientes entre los equipos listos de la red, reducir la espera cuando varias peticiones quedarían tras un único motor local, mejorar el tiempo de finalización de una carga suficientemente paralela y liberar el PC principal para jugar, crear o cualquier otra tarea interactiva.




