Un modelo de lenguaje de frontera es solo una pieza de un agente de inteligencia artificial. El sistema que lo rodea, al que suele llamarse harness, determina cómo recibe el contexto, cómo usa herramientas, cómo mantiene estado, cómo responde a la realimentación, cómo se recupera de una falla y cómo sostiene el avance en tareas de larga duración. El desafío técnico es construir esa arquitectura para que el modelo funcione de manera confiable en trabajos extendidos de muchos pasos.

El proyecto de investigación de NVIDIA Agentic Variation Operators (AVO) aborda ese problema. Y el resultado que la empresa presenta es contundente: en la prueba ARC-AGI-3, el mismo modelo que por sí solo rendía un 30% llegó al 100% cuando operó dentro del sistema AVO completo.

¿Qué es exactamente AVO?

AVO es un sistema agéntico de programación de propósito general desarrollado por NVIDIA. Como los agentes de código modernos, puede inspeccionar y editar código, ejecutar comandos, consultar documentación y validar su trabajo mediante ejecución. Su rasgo distintivo es la operación autónoma sostenida a lo largo de horizontes temporales largos.

En el trabajo de optimización de kernels de GPU, AVO reemplaza el paso de variación predefinido de los sistemas convencionales de búsqueda evolutiva por un agente autónomo que decide cómo generar el siguiente candidato: qué inspeccionar, qué cambiar, qué probar y qué confirmar. Para ARC-AGI-3, el equipo conectó ese mismo agente a una interfaz de tarea distinta. El agente subyacente es idéntico; solo cambian las herramientas específicas del entorno y la evaluación.

Figura 1. Arquitectura AVO para trabajo autónomo de horizonte largo. El agente principal inspecciona el contexto, planifica, implementa cambios y evalúa resultados usando memoria persistente y herramientas
Figura 1. Arquitectura AVO para trabajo autónomo de horizonte largo. El agente principal inspecciona el contexto, planifica, implementa cambios y evalúa resultados usando memoria persistente y herramientas

Siete días optimizando kernels de atención

La optimización de kernels de GPU fue la primera prueba exigente de esta arquitectura. El espacio de búsqueda es grande, el paisaje de rendimiento es difícil de razonar de forma directa y cambios pequeños de implementación pueden afectar la corrección, el comportamiento de memoria, la planificación y el rendimiento de maneras difíciles de predecir sin ejecutar.

En el estudio sobre kernels de atención, AVO operó de forma continua durante siete días, exploró más de 500 direcciones de optimización y produjo 40 versiones de kernel confirmadas.

Sobre sistemas NVIDIA DGX B200, los kernels de atención multicabezal resultantes superaron a cuDNN hasta en un 3,5% y a FlashAttention-4 hasta en un 10,5% en las configuraciones evaluadas. Después, el agente adaptó el kernel evolucionado a atención de consulta agrupada en unos 30 minutos de trabajo autónomo adicional.

Más allá del rendimiento final, el experimento demuestra que AVO puede sostener un ciclo productivo de ingeniería durante muchas iteraciones sin que cada paso deba prescribirse a mano. NVIDIA lo enmarca en una lectura de sistema: construir una pila de agentes confiable exige diseñar rendimiento, confiabilidad y seguridad a lo largo de todo el sistema, no tratarlos como propiedades del modelo.

Memoria persistente y supervisión

AVO está diseñado para preservar el avance más allá de una sola ventana de contexto. Dos mecanismos resultan particularmente importantes.

La memoria persistente arrastra hacia adelante las implementaciones previas, los resultados de evaluación, las salidas del compilador y del perfilador, y el razonamiento acumulado. Eso permite que el agente retome desde el estado actual en lugar de reconstruir la búsqueda una y otra vez.

El supervisor monitorea la trayectoria general en busca de estancamiento o de ciclos improductivos repetidos, y puede redirigir al agente principal hacia estrategias alternativas cuando hace falta. Durante la corrida de siete días sobre kernels de atención, el agente principal siguió siendo responsable de decidir qué inspeccionar, cambiar, probar y evaluar, mientras el supervisor ayudaba a mantener el avance cuando la búsqueda se estancaba.

¿Qué mide ARC-AGI-3 y por qué es difícil?

ARC-AGI-3 es una prueba de razonamiento interactivo. El agente entra en entornos con forma de juego que no conoce, sin instrucciones, sin reglas explícitas y sin un objetivo declarado. Debe explorar mediante la interacción, inferir la dinámica del entorno y sus objetivos, y planificar acciones de manera eficiente a través de niveles progresivamente más difíciles.

La métrica se llama Relative Human Action Efficiency (RHAE) y combina la finalización de la tarea con la eficiencia de acciones por nivel, medida contra la línea base de humanos que enfrentan el problema por primera vez.

En lugar de centrar el sistema en la construcción programática explícita de un modelo del mundo, como explora Tycho, el equipo adoptó los principios de interacción directa descritos por VISTA y reimplementó la interfaz de tarea de forma independiente.

Hay una diferencia relevante en la interfaz de observación. VISTA usa en su configuración principal una imagen PNG renderizada de 512 × 512 píxeles. En la configuración de AVO, el modelo operó en modalidad de texto puro: cada observación se entregó como una grilla textual exacta de 64 × 64, sin imágenes ni tokens de imagen enviados al modelo. El agente recibió las acciones disponibles sin descripción alguna de las reglas ni de los objetivos del juego, y tuvo que inferir sus efectos interactuando.

AVO frente a VISTA: la comparación en cifras

Usando Claude Opus 5 como modelo base, AVO completó el conjunto público de 25 entornos con un puntaje RHAE de 100,00 y resolvió los 183 niveles en 6.624 acciones de entorno. VISTA reporta 7.542 acciones con el mismo modelo para completar los mismos 183 niveles.

SistemaNiveles resueltosAcciones de entornoAcciones por nivel
AVO (NVIDIA)183 de 1836.62436,2
VISTA183 de 1837.54241,2

La diferencia es de 918 acciones, un 12% menos para AVO en esta comparación entre sistemas. Visto por nivel, el promedio baja de 41,2 a 36,2 acciones.

Figura 2. AVO obtuvo un puntaje RHAE de 100,00 en los 25 entornos de juego del conjunto público de ARC-AGI-3, completando los 183 niveles
Figura 2. AVO obtuvo un puntaje RHAE de 100,00 en los 25 entornos de juego del conjunto público de ARC-AGI-3, completando los 183 niveles

Lo que el resultado no prueba

NVIDIA es explícita en la advertencia metodológica: la comparación no debe leerse como una ablación controlada. Los dos sistemas difieren en el motor del agente, en la representación de las observaciones, en la memoria, en el manejo de contexto y en otros detalles de implementación.

Una diferencia arquitectónica que podría pesar en horizontes largos es el sistema de memoria de AVO, diseñado para llevar adelante la comprensión útil y reducir la exploración repetida, aunque el experimento no aísla su contribución individual.

La conclusión que sí sostiene el equipo es más general: evaluar un modelo no es lo mismo que evaluar un agente. La capacidad del modelo importa muchísimo, pero el sistema que lo rodea determina cuánto de esa capacidad se convierte en avance autónomo sostenido.