La inteligencia de frontera se está mudando al computador de escritorio. En IFA 2026, NVIDIA, Microsoft y sus socios presentaron un conjunto de anuncios que apuntan a lo mismo: bajar la barrera de entrada para correr agentes de forma local, sin enviar datos a la nube. A eso se suman los nuevos computadores compactos con Windows NVIDIA RTX Spark, que llegan en octubre.

El paquete anunciado incluye soporte simplificado para GPU de NVIDIA en Hermes Agent, OpenClaw y Perplexity Portable Computer, inferencia local hasta 1,9 veces más rápida mediante nuevas optimizaciones de llama.cpp y vLLM, y la herramienta NVIDIA PAIR, que reparte las solicitudes de inferencia entre los computadores de una misma red doméstica.

¿Por qué costaba tanto correr un agente local?

Hasta ahora, poner en marcha un agente con modelos locales exigía un trabajo previo poco amable: elegir el modelo, encontrar un servidor de inferencia compatible, ajustar la cuantización y mantener todo actualizado. Esa fricción es la que NVIDIA dice estar eliminando en los sistemas RTX y DGX.

Tres de las aplicaciones de agentes más usadas ofrecerán configuración simplificada de modelos locales en Windows, todas construidas sobre llama.cpp e incorporando las últimas optimizaciones de inferencia de la empresa.

En Hermes Agent, desarrollado por Nous Research, la configuración pasa a ser de un clic en sistemas RTX y DGX con Windows. El agente detecta la GPU de NVIDIA de forma automática, selecciona un modelo y una configuración apropiada, y lo ejecuta a través de llama.cpp integrado. Eso elimina las descargas manuales de modelos y el ajuste fino. El soporte para Linux llegará después.

Perplexity Portable Computer funciona sobre GPU RTX con al menos 24 GB de VRAM en Linux, con soporte para Windows en camino. Permite completar flujos de trabajo enteros de forma local sin consumir créditos, escalando de manera selectiva partes de una tarea a alguno de los más de 15 modelos de frontera en la nube cuando hace falta más razonamiento. La aplicación pide permiso antes de enviar contenido fuera del equipo.

OpenClaw, por su parte, se convirtió en uno de los proyectos que definen el movimiento de agentes abiertos: es el proyecto de inteligencia artificial más grande de GitHub, con más de 380.000 estrellas. NVIDIA, Microsoft y OpenClaw trabajaron juntos para que su aplicación de Windows simplifique la puesta en marcha de un modelo local optimizado en cualquier GPU RTX con al menos 24 GB de VRAM.

AplicaciónSistema operativoRequisito de GPU
Hermes AgentWindows (Linux en camino)RTX o DGX con detección automática
Perplexity Portable ComputerLinux (Windows en camino)RTX con 24 GB de VRAM o más
OpenClawWindowsRTX con 24 GB de VRAM o más

¿Cuánto más rápida es la inferencia local?

Gráfico comparativo del rendimiento de inferencia local en las plataformas NVIDIA
Gráfico comparativo del rendimiento de inferencia local en las plataformas NVIDIA

El rendimiento de la inferencia es determinante para que un agente local se sienta ágil. Las cifras que entregó la empresa son concretas:

  • llama.cpp: hasta 1,9 veces más rendimiento en una GeForce RTX 5090, gracias a optimizaciones de kernel, técnicas mejoradas de decodificación especulativa y un llenado inicial más rápido.
  • vLLM: 1,2 veces en la RTX PRO 6000 Blackwell Workstation Edition y hasta 1,4 veces en un arreglo de dos DGX Spark, con nuevos kernels de atención XQA en FlashInfer.

Ambas mejoras ya están disponibles en los motores de inferencia correspondientes, y también llegan a los usuarios a través de las aplicaciones LM Studio y Ollama, que son las dos vías por las que la mayoría de los aficionados corre modelos locales hoy.

Un agosto cargado de modelos abiertos

El anuncio se apoya en un mes previo con varios lanzamientos de pesos abiertos que corren en hardware local:

  • Nemotron 3.5 Lightning, de 30.000 millones de parámetros, que funciona en computadores RTX, estaciones RTX PRO, DGX Spark y Jetson.
  • Muse Glimmer de Meta, también de 30.000 millones de parámetros, orientado a programación y tareas agénticas, con cuantización NVFP4 publicada por NVIDIA para un despliegue local más eficiente en memoria.
  • DeepSeek v4 Flash, un modelo de mezcla de expertos con 284.000 millones de parámetros totales y 13.000 millones activos, que necesita un arreglo de dos DGX Spark para correr localmente.
  • Qwen3.8-27B, un modelo abierto de 27.000 millones de parámetros optimizado para cargas agénticas y de programación.

¿Qué significa esto para un usuario en Chile?

El punto que conviene mirar con calma es el requisito de memoria. Los 24 GB de VRAM que piden Perplexity Portable Computer y OpenClaw dejan fuera a la mayor parte del parque de equipos de escritorio de la región, donde las tarjetas de 8 y 12 GB siguen siendo la norma. La configuración de un clic resuelve la fricción de software, no la de hardware.

Ahí es donde el otro anuncio adquiere sentido. NVIDIA PAIR es una herramienta gratuita y de código abierto que descubre de forma automática los computadores compatibles de una red local y enruta las solicitudes independientes de inferencia hacia el que tenga capacidad disponible. Funciona con Ollama y LM Studio, y se adapta a medida que los equipos entran o salen de la red. Su versión beta corre en Windows, macOS y Linux, y admite GPU GeForce RTX serie 20 en adelante, GPU RTX PRO de estación de trabajo con arquitectura Turing o posterior, DGX Spark y silicio Apple M4 o más nuevo.

Para un hogar o una oficina pequeña con dos o tres máquinas modestas, sumar capacidad repartida es una salida más realista que comprar una sola tarjeta de gama alta importada. La empresa señala que más de la mitad de los hogares de Estados Unidos tiene dos o más computadores, y que buena parte de ese poder de cálculo pasa el día sin usarse.

RTX Spark: la apuesta de octubre

Los computadores compactos con Windows NVIDIA RTX Spark llegan en octubre de la mano de Lenovo y Acer. Junto con ellos debuta el modo AI PC de CyberLink PhotoDirector 365, una de las primeras aplicaciones creativas en integrar modelos de difusión de forma directa para edición generativa, mejora de imagen, eliminación de objetos y reemplazo de fondo. Sobre GPU de NVIDIA, PhotoDirector usa TensorRT-RTX y precisión FP8 para acelerar el procesamiento local, con la opción de elegir entre trabajo local o en la nube según la tarea.