Investigadores de Google Research presentaron WikiSkill, un marco que acopla agentes de IA a una base de conocimiento permanente. En lugar de descartar lo que el agente aprendió al terminar cada corrida, el sistema recolecta el conocimiento sobre fracasos y aciertos en una estructura tipo wiki y lo usa para mejorar sus capacidades con el tiempo.

Ese conocimiento se empaqueta en Agent Skills, módulos reutilizables que guían el comportamiento del agente sin modificar lo que aprendió durante el entrenamiento. Es decir, el agente, o sea el modelo, no aprende de verdad en un sentido continuo, que sigue siendo un problema sin resolver. Lo que hace es escribirse mejores instrucciones a sí mismo después de cada corrida y poder consultarlas la vez siguiente. No es elegante, y probablemente es más propenso a errores que el aprendizaje real, pero el estudio muestra que funciona como solución de reemplazo.

El trabajo se apoya en una idea de Andrej Karpathy sobre una "wiki de LLM", que argumenta a favor de compilar la experiencia en conocimiento persistente y acumulativo. WikiSkill aplica ese razonamiento al desarrollo automático de habilidades para agentes de IA.

¿Cómo separa WikiSkill la experiencia del conocimiento?

WikiSkill organiza el espacio de trabajo del agente en tres niveles. La capa cruda almacena las trazas de ejecución completas, desde las llamadas a herramientas hasta los resultados. Esos datos son inmutables y sirven de materia prima.

Encima está la capa wiki, donde los datos crudos se destilan en hallazgos estructurados, como patrones de fallo documentados y estrategias exitosas. Según los investigadores, esta capa de conocimiento nunca se reinicia y solo crece con cada iteración.

El nivel superior, la capa de habilidades, contiene las instrucciones de procedimiento activas que el agente sigue al ejecutar tareas. A diferencia de la wiki, las habilidades se pueden revertir si una actualización empeora el rendimiento.

El ciclo funciona en cuatro pasos. Primero, un agente de inferencia ejecuta tareas con las habilidades vigentes y genera trazas. Un "mantenedor de la wiki" analiza esas trazas, detecta patrones de fallo y estrategias exitosas, y escribe los hallazgos en la wiki. Un "proponente de habilidades" usa la wiki actualizada y los datos de ejecución para sugerir cambios puntuales. Finalmente, un mecanismo de compuerta prueba el cambio propuesto sobre un conjunto de validación aparte para confirmar que efectivamente ayuda. Si no, la habilidad se revierte, pero la wiki queda intacta.

Ese detalle importa más de lo que parece: incluso las propuestas fallidas no se pierden, porque la wiki documenta qué se intentó y por qué falló, de modo que el proponente puede construir sobre ese conocimiento en iteraciones posteriores.

¿Cuánto mejora en los benchmarks?

Los investigadores probaron WikiSkill en cinco pruebas que cubren razonamiento matemático, búsqueda web, manipulación de planillas, preguntas sobre documentos y tareas interactivas en un entorno virtual. Los modelos usados fueron Qwen (4B, 9B y 27B), Gemma-4-31B y Gemini-3.5-Flash.

WikiSkill supera de manera consistente a todos los métodos previos de evolución de habilidades del estudio. En promedio, el marco lleva a Gemini-3.5-Flash de 49,5% a 68,1% y a Qwen-3.6-27B de 39,4% a 63,3%. En pruebas individuales los saltos pueden ser mayores: Gemini-3.5-Flash sube de 33,0% a 72,6% en LiveMath y de 50,5% a 76,6% en SpreadSheet.

ModeloSin habilidadesCon WikiSkillDiferencia
Qwen-3.5-4B26,2%38,5%+12,3 puntos
Qwen-3.5-9B29,9%47,4%+17,5 puntos
Qwen-3.6-27B39,4%63,3%+23,9 puntos
Gemma-4-31B41,3%54,9%+13,6 puntos
Gemini-3.5-Flash49,5%68,1%+18,6 puntos

Las ganancias varían bastante según el tipo de tarea. Los problemas matemáticos y la manipulación de planillas registran las mejoras más grandes, mientras que las tareas con contextos documentales largos (OfficeQA) muestran avances mucho menores. Los investigadores explican que los modelos más pequeños, como Qwen-3.5-4B, tienen dificultades para ejecutar de manera confiable estrategias de búsqueda de varios pasos a lo largo de contextos extensos y terminan cayendo de vuelta en su comportamiento por defecto.

Los modelos grandes ganan más, pero los chicos acortan distancia

Los modelos más grandes tienden a beneficiarse más de las habilidades evolucionadas. Pero los modelos pequeños que corren WikiSkill pueden igualar el rendimiento de modelos más grandes que no usan el marco: la tabla lo muestra con claridad, ya que Qwen-3.5-9B con WikiSkill (47,4%) supera a Qwen-3.6-27B sin habilidades (39,4%) pese a tener tres veces menos parámetros.

Las habilidades desarrolladas por un modelo con frecuencia se transfieren a otro y a veces funcionan mejor que las que el modelo receptor construyó por su cuenta. Como eso no siempre ocurre, la transferibilidad debería verificarse caso a caso.

Por qué esto se parece mucho a lo que ya hace un equipo pequeño

La lectura práctica para quien desarrolla en la región es que WikiSkill formaliza algo que muchos equipos ya hacen a mano: mantener un archivo de instrucciones que se corrige después de cada error del agente. La diferencia es que acá el ciclo de escritura, prueba y reversión está automatizado y validado contra un conjunto aparte, lo que evita el problema clásico de acumular reglas contradictorias en un mismo documento.

El costo también es concreto: cada iteración exige correr el agente completo, analizar sus trazas y validar el cambio, o sea varias pasadas de inferencia por cada mejora incremental. Con un modelo pequeño de 4B ese ciclo es asumible en hardware modesto; con un modelo grande, el gasto de cómputo se vuelve el factor que decide si conviene.