Construir un buen agente de IA no se trata solo de elegir el modelo correcto. El harness, la arquitectura que rodea al modelo, es igual de decisivo: cómo presenta el contexto, ejecuta acciones, gestiona el estado y decide cuándo una tarea está terminada moldea los resultados tanto como el propio modelo. El diseño del harness por sí solo puede explicar variaciones de dos dígitos en los benchmarks y diferencias significativas de costo, con el mismo modelo de base.

NOOA (NVIDIA Labs Object-Oriented Agents) es un research preview de código abierto construido sobre esa idea. Incluye un framework en Python, un sistema de memoria, tests de capacidades y agentes de benchmark, con código, datos y evaluaciones liberados para que la comunidad reproduzca, cuestione y construya sobre estos resultados.

Un agente es un objeto de Python

Desarrollar agentes solía implicar coordinar múltiples piezas: plantillas de prompts, esquemas de herramientas, código de callbacks y grafos de flujo de trabajo. NOOA propone un enfoque más simple: un agente es una sola clase de Python. Sus métodos son sus capacidades. Sus campos son su estado. Sus docstrings son sus prompts. Sus anotaciones de tipo son contratos que se hacen cumplir. Un método cuyo cuerpo es una elipsis (…) lo completa en tiempo de ejecución un bucle guiado por el modelo; un método con cuerpo normal corre como Python común y determinista.

La recompensa es que desarrollar agentes se vuelve desarrollo de software tradicional. Un agente puede versionarse, revisarse en code review, testearse, trazarse y refactorizarse, tanto por humanos como por agentes de programación, usando las mismas herramientas de siempre.

Seis ideas sobre una sola superficie

La arquitectura de NOOA identifica seis ideas de interfaz que impulsan el rendimiento del agente:

  • Entrada/salida tipada: las llamadas tienen argumentos tipados y valores de retorno validados, no texto libre.
  • Paso por referencia: el modelo opera sobre objetos vivos de Python, viendo vistas previas acotadas en vez de volcados serializados.
  • Código como acción: el modelo actúa escribiendo Python, con control de flujo y llamadas a métodos.
  • Bucles programables: los bucles de orquestación son Python común, escribible por desarrolladores y por el propio modelo.
  • Estado explícito del objeto: el estado durable y tipado vive en el objeto agente, no solo en el historial de conversación.
  • APIs del harness invocables por el modelo: los bloques de contexto y el historial de eventos son APIs que el modelo puede inspeccionar y gestionar.

El agente cura su propia memoria

NOOA incluye un subsistema de memoria de largo plazo. En vez de una tubería automática de resumen en segundo plano, la memoria es un almacén que el agente cura mediante herramientas invocables: escribe, consulta y corrige registros como parte de su trabajo, mientras que las memorias relevantes al turno actual afloran de forma automática. Los registros llevan tipos, importancia y etiquetas, y relaciones como "apoya", "contradice" y "derivado de" los conectan en un grafo de conocimiento en lugar de una bitácora plana. Un proceso de reflexión consolida el almacén fusionando duplicados, enlazando registros relacionados y podando lo que ya no es relevante.

Todo persiste en un único archivo SQLite legible por humanos que los equipos pueden inspeccionar y respaldar con prácticas estándar. En la evaluación de ARC-AGI-3, el sistema mejoró 11,8 puntos de RHAE frente al mismo agente con notas basadas en archivos.

Más capacidad con el mismo modelo

Las seis capacidades son medibles en varios dominios:

Ingeniería de software: en SWE-bench Verified, NOOA alcanza 82,2% con GPT-5.5, por encima del estado del arte publicado en el momento del envío (79,2%), y 79,8% con Opus 4.6, usando un agente de propósito general de 253 líneas sin prompts específicos del benchmark.

Ciberseguridad: en CyberGym L1, NOOA resuelve el 86,8% con GPT-5.5, el agente de código abierto con mejor puntaje, por delante de la mayoría de los sistemas cerrados líderes. Corrió con el acceso a red bloqueado y una verificación anti-trampa sobre cada trayectoria, de modo que el resultado proviene de razonar sobre el código, no de consultar vulnerabilidades ya divulgadas.

Razonamiento general: en ARC-AGI-3, un solo agente NOOA llega a 50,2% de RHAE promedio con GPT-5.5 y a 85,1% con GPT-5.6-sol, avanzando la frontera de Pareto entre puntaje y costo, con menos de 20 dólares por partida (17,85 y 13,3 dólares).

Mismo rendimiento, la mitad de los tokens

La ingeniería del harness no solo compra precisión, también eficiencia. Con GPT-5.5, NOOA alcanza 82,2% en SWE-bench Verified usando 29 llamadas al modelo y cerca de 1,1 millones de tokens por tarea. Los harnesses de comparación necesitan 66 llamadas y 2,2 millones de tokens para llegar a 78,2%. Paridad o mejor, a la mitad del costo.

Dos mecanismos lo explican. Primero, el paso por referencia: los resultados de las herramientas se vuelven variables vivas de Python en lugar de dar la vuelta por la ventana de contexto como texto. Segundo, esa misma propiedad hace que NOOA no necesite compactar contexto: las sesiones medianas alcanzan un pico de 22.000 a 72.000 tokens de prompt frente a ventanas de 200.000 a 400.000. Sin pasada de resumen, los aciertos de caché se acumulan a lo largo de toda la tarea.

Puntaje frente a costo total de tokens por tarea en SWE-bench Verified. NOOA con GPT-5.5 llega a 82,2% con cerca de 1,1 millones de tokens por tarea
Puntaje frente a costo total de tokens por tarea en SWE-bench Verified. NOOA con GPT-5.5 llega a 82,2% con cerca de 1,1 millones de tokens por tarea

85,1% en ARC-AGI-3 por menos de 20 dólares por partida

ARC-AGI-3 coloca al agente en un juego de grilla desconocido: las reglas, el objetivo y los controles deben descubrirse actuando. El ejemplo de NOOA reduce una arquitectura de seis agentes especializados a un agente y una habilidad de 45 líneas. Esa habilidad instruye al agente a construir un modelo del mundo como programas de Python que codifican el estado observado y predicen el siguiente; en cada turno compara sus predicciones con lo que realmente ocurrió y revisa sus modelos ante cada desajuste.

En modo competencia y con un tope de dos horas, la flota GPT-5.5 llega a 50,2% de RHAE promedio, y la flota GPT-5.6-sol alcanza 85,1% a unos 13,3 dólares por partida, con 19 de 25 juegos resueltos por completo. Ambas flotas corren bajo capas de aislamiento, y auditorías de equipo rojo (18 pasadas sobre la corrida GPT-5.5 y un escaneo de nueve herramientas sobre la de GPT-5.6-sol) no hallaron filtraciones en ninguna regla.

ARC-AGI-3 coloca a los agentes NOOA en 25 juegos de grilla desconocidos donde deben descubrir las reglas, objetivos y controles actuando
ARC-AGI-3 coloca a los agentes NOOA en 25 juegos de grilla desconocidos donde deben descubrir las reglas, objetivos y controles actuando

Todo el proyecto (código, datos y metodología de evaluación) fue liberado públicamente por NVIDIA para su adopción y extensión por parte de la comunidad.