Los flujos de trabajo multi-agente han transformado la forma en que entendemos la inferencia local. Un agente principal descompone una tarea y genera subagentes; lo que parecía una única solicitud de usuario se convierte en docenas de llamadas independientes a modelos. Si estas llamadas se dirigen a un solo motor local, compiten por los mismos espacios de ejecución, aumentando la cola de espera mientras otros equipos, computadores o sistemas DGX Spark en la misma red permanecen inactivos.

NVIDIA Personal AI Router (PAIR) apunta directamente a ese cuello de botella. Anunciado esta semana, PAIR es un router de inferencia virtual que descubre máquinas compatibles en una red doméstica y programa las solicitudes de inferencia de forma distribuida. Es importante aclarar que no es un nuevo motor de inferencia: Ollama o LM Studio siguen ejecutando el modelo en el nodo que PAIR seleccione.

¿Es desplegable? Sí. PAIR se lanza hoy como beta pública (v0.1.1) con instaladores firmados para Windows, macOS y Linux, y su código fuente completo está disponible en GitHub bajo licencia Apache 2.0. Funciona íntegramente en la red local, requiriendo internet solo para la descarga inicial de modelos.

No requiere nueva API

La decisión de diseño más relevante es que PAIR no introduce una API de clúster. Actúa como proxy de las interfaces compatibles con Ollama y LM Studio que los agentes ya utilizan, tomando el puerto predeterminado de cada motor. Si un agente escucha en otro lugar, el puerto del proxy es configurable en los ajustes de PAIR. El repositorio también expone endpoints proxy compatibles con OpenAI.

Como consecuencia, los agentes existentes no necesitan cambios. El agente decide qué trabajo solicitar y PAIR decide dónde se ejecuta.

Descubrimiento, emparejamiento y transporte

PAIR utiliza mDNS para encontrar sistemas cercanos de forma automática. Un nodo puede añadirse manualmente mediante dirección IP si el descubrimiento falla. La confianza se establece mediante un PIN de seis dígitos que se muestra en la máquina anfitriona y se ingresa en la invitada. Todo tráfico entre nodos emparejados está bloqueado hasta que se completa el proceso y, posteriormente, se asegura mediante mTLS con certificados generados.

Cada nodo ejecuta Ollama o LM Studio. PAIR puede instalar un motor y comenzar la descarga de modelos en sistemas emparejados, eliminando gran parte del trabajo de configuración entre máquinas.

¿Cómo elige el programador el nodo adecuado?

Un nodo solo es elegible para una solicitud cuando el motor requerido está habilitado y el modelo específico está presente. Los modelos no necesitan ser idénticos en todo el clúster; diferentes sistemas pueden alojar modelos distintos y PAIR enruta según la ubicación de estos. Cargar el mismo modelo en más nodos simplemente amplía el grupo de disponibilidad.

Para cada solicitud, el planificador evalúa cinco señales: si el nodo está en línea, si el motor compatible está habilitado, si el modelo exacto está presente, la carga de trabajo actual del nodo y la utilización de la GPU.

Esta es una concurrencia a nivel de carga de trabajo y el límite es explícito. PAIR asigna cada solicitud a un nodo elegible, donde permanece durante toda su ejecución. No combina VRAM, no fusiona GPUs en un solo acelerador ni fragmenta una única solicitud entre máquinas.

Los resultados de la demostración

La demostración de NVIDIA utiliza PAIR junto a Hermes Desktop, creando una carga de trabajo de cinco subagentes sobre una bandeja de entrada doméstica sintética. Ollama ejecuta el modelo Qwen 3.6 35B A3B en cada nodo seleccionado.

En un laptop RTX Spark, el flujo de trabajo tomó un promedio de 18 minutos. En un clúster PAIR de tres dispositivos compuesto por un laptop RTX Spark, un DGX Spark y una RTX 5090, el tiempo promedio fue de 8 minutos y 48 segundos.

Hardware soportado y requisitos

PAIR soporta GPUs GeForce RTX serie 20 y posteriores, GPUs de estación de trabajo RTX PRO desde arquitectura Turing en adelante, DGX Spark y chips Apple M4 o versiones posteriores. Los nodos Windows, Linux y macOS pueden emparejarse entre sí en arquitecturas x64 y arm64, aunque Windows sobre ARM se considera experimental. Las configuraciones validadas requieren al menos 8 GB de RAM y se recomiendan 20 GB de espacio en disco. Otras distribuciones de Linux requieren compilación desde el código fuente.

Conclusiones clave

  • PAIR enruta cada solicitud independiente a un solo nodo; no combina VRAM ni fragmenta modelos.
  • Actúa como proxy de endpoints de Ollama y LM Studio, por lo que los agentes no requieren modificaciones.
  • La elegibilidad depende de la disponibilidad del nodo, el motor, la presencia del modelo, la carga de trabajo y el uso de GPU.
  • La demo de cinco subagentes de NVIDIA redujo el tiempo de 18 minutos a 8:48 al usar tres dispositivos.
  • Bajo licencia Apache 2.0 y en fase beta, la política de programación actual no considera la temperatura de la GPU ni la clase de hardware.

Consulte la página de producto de NVIDIA PAIR, el Blog Técnico de NVIDIA, el repositorio de GitHub, el Playbook y las FAQ.

Vía MarkTechPost.