El trabajo dentro de una empresa se reparte entre mensajes, decisiones, proyectos y compromisos que cambian con el tiempo. Un agente de inteligencia artificial que parte sin ese contexto tiene que reconstruirlo antes de poder aportar algo.
Para entregarles ese contexto, el equipo de NVIDIA usó NVIDIA NemoClaw para construir un jefe de gabinete con memoria, un agente que mantiene una capa de conocimiento legible por humanos a la que llaman self model: una memoria con las personas, los proyectos, las prioridades y los patrones de trabajo relevantes. Tareas programadas revisan periódicamente la actividad nueva, siguen los compromisos pendientes e incorporan las decisiones del usuario con el paso del tiempo.
La conclusión del equipo es contraintuitiva: una memoria útil para un agente exige estructura, recuperación selectiva y gobernanza, no solo capacidad de almacenamiento.
¿Qué problema resuelve la memoria del agente?
El historial de conversación entrega continuidad de corto plazo, pero mezcla las prioridades actuales con decisiones pasadas y pedidos temporales. La recuperación de documentos puede encontrar el material fuente, pero el agente todavía tiene que conectar la información a lo largo del tiempo.
Sirve pensarlo con una pregunta cotidiana sobre el estado de un proyecto. La respuesta puede depender de una decisión anterior, de una corrección que llegó en un mensaje posterior, de un compromiso sin resolver y del hecho de que dos nombres distintos se refieren al mismo proyecto.
El self model mantiene esas relaciones en páginas Markdown estructuradas, organizadas por personas, proyectos, prioridades, metas, conceptos y patrones de trabajo recurrentes. Su esquema define la indexación, las referencias cruzadas, la procedencia de cada dato y los límites de crecimiento.
Un detalle de diseño importante: el modelo guarda una interpretación derivada, no reemplaza la evidencia original. Mantener ambas cosas separadas permite determinar si una respuesta incorrecta vino de la evidencia, del mantenimiento de la memoria, de la recuperación o de la decisión final del modelo.
Tres capas: evidencia, conocimiento y ejecución
La receta se ordena en tres niveles encadenados: evidencia, luego conocimiento, y finalmente ejecución con gobernanza. La evidencia alimenta las actualizaciones del self model; para cada tarea el agente recupera un conjunto acotado de contexto relevante.

El ejemplo almacena dos tipos de información en soportes distintos:
| Tipo | Qué guarda | Dónde vive |
|---|---|---|
| Conocimiento | Personas, proyectos, prioridades y patrones de trabajo | Páginas Markdown |
| Juicio | Si algo requiere atención, en qué lugar del ranking va, si el usuario lo ignoró | Registro SQLite |
Ese diseño preserva los juicios del agente sin escribirlos dentro de los mensajes originales como marcas de leído, etiquetas o carpetas. Una página de memoria puede decir que un colaborador prefiere Slack, y el agente puede usar ese contexto para recomendarlo, pero enviar el mensaje sigue dependiendo de credenciales, permisos de herramientas, políticas de ejecución y aprobación del usuario.
La frase que resume la arquitectura es breve: el contexto puede informar una acción, pero no puede autorizarla.
¿Cómo decide el agente qué es urgente?
Los pedidos que llegan suelen describirse a sí mismos como urgentes, pero la urgencia declarada no necesariamente refleja las prioridades reales del usuario. Por eso la receta incorpora una compuerta de intención que reserva el nivel más alto para los compromisos conectados con las prioridades que el usuario declaró.
En el ejemplo público, una certificación urgente de política de gastos permanece visible pero queda por debajo de un pedido más silencioso vinculado a una prioridad declarada. El modelo interpreta esa relación, mientras código determinista impone el tamaño de cada nivel, el comportamiento ante desborde y el orden del ranking.
La corrección del usuario queda escrita
Una memoria persistente puede preservar un juicio equivocado con la misma facilidad con que preserva uno correcto. En la receta, el usuario puede mover un compromiso a otro nivel o ignorarlo, y las ejecuciones posteriores del agente respetan esa decisión. Cada cambio queda registrado una vez en una bitácora de auditoría que solo admite agregados.
Cuando los patrones de corrección se repiten, pueden actualizar una política de preferencias breve y legible. El usuario puede inspeccionarla, editarla o borrarla, en vez de dejar esa preferencia escondida en el estado del modelo. El circuito queda a la vista: juicio del agente, corrección del usuario, evento de auditoría, actualización de la preferencia.
¿Qué gana el agente al recordar?
Agregar el jefe de gabinete con memoria a NemoClaw produjo mejoras medibles en varias tareas, según el equipo. El repositorio del ejemplo incluye un banco de pruebas de memoria de agentes que compara el self model contra una base de recuperación aumentada por generación, más conocida como RAG, operando con múltiples rondas de búsqueda.
Seguridad: la memoria es entrada, no política
La separación se hace efectiva en tiempo de ejecución con NemoClaw y con NVIDIA OpenShell, un entorno seguro para agentes autónomos. NemoClaw integra el ejemplo y administra su ciclo de vida, mientras OpenShell ejecuta el agente en un espacio aislado y aplica gobernanza sobre el acceso al sistema de archivos, a los procesos y a la red. Las credenciales para inferencia administrada y conexiones MCP quedan fuera de ese espacio aislado.
El punto es central para cualquiera que despliegue agentes con acceso a datos internos: la memoria y el contenido recuperado son entradas al modelo, no política de seguridad confiable. Si el agente interpreta mal ese contexto, o si sigue instrucciones maliciosas incrustadas en él, igual opera dentro de los límites que definió el operador.
Cómo probarlo
La receta del jefe de gabinete con memoria y su propuesta de diseño están en el repositorio NVIDIA/nemoclaw-community. El paquete se despliega como un perfil Hermes para NemoClaw e incluye el esquema de memoria estructurada, el registro durable de compromisos, la lógica acotada de ranking, las rutas de corrección y auditoría, el mantenimiento programado de la memoria, mensajes y páginas de memoria sintéticos, un recorrido sin conexión y una batería de pruebas unitarias.
Las personas, organizaciones, proyectos y mensajes del ejemplo son inventados, y las decisiones del modelo quedan grabadas para reemplazar la inferencia en el recorrido sin conexión. Esa decisión tiene una ventaja práctica para quien quiera evaluarlo: se puede examinar el diseño completo sin conectar una cuenta de trabajo real. La receta actual se concentra en los cimientos de la memoria, no envía mensajes ni modifica sistemas de origen. Los conectores en vivo requieren un tratamiento aparte para credenciales, privacidad, retención y borrado.
Más información en la documentación de NVIDIA NemoClaw y de NVIDIA OpenShell.




