Entrenar modelos de IA con otros modelos de IA se convirtió en un objetivo muy popular entre los nuevos laboratorios, y ahora un investigador del programa de fellows de Anthropic entregó una primera mirada a cómo podría verse eso en la práctica.
El viernes, Anthropic publicó un nuevo paper titulado "Automated Researchers Can Reliably Mitigate Alignment Failures", donde detalla cómo sistemas de IA podrían mejorar de manera confiable el desempeño de un modelo en un conjunto de pruebas de alineamiento. Al entregarles 10 pruebas de referencia para comportamientos desalineados específicos, los sistemas automatizados lograron mejorar el desempeño en todas y cada una, sin degradar el rendimiento general.
¿Cómo funciona el investigador automatizado?
Encabezado por el fellow de Anthropic Chen Yueh-Han, el sistema replica buena parte del enfoque tradicional de la investigación. Cada sistema automatizado busca en la literatura disponible, propone un método y entrena el modelo con ese método durante 30 minutos, subiendo gradualmente el puntaje en la prueba a lo largo de varias iteraciones. Los métodos efectivos se conservan y los inefectivos se descartan, lo que permite al sistema operar rápido y a gran escala.
"En conjunto, estos resultados entregan evidencia temprana de que el post-entrenamiento automatizado de alineamiento podría volverse práctico en el corto plazo", señala el paper.
Un paso hacia la automejora recursiva
El trabajo es un paso hacia la automejora recursiva, que muchos ven como el próximo avance significativo en el progreso de la IA. Si los modelos pueden mejorar su propio entrenamiento de alineamiento, es plausible que puedan mejorar las prácticas de entrenamiento de manera más amplia, y en ese punto los investigadores humanos en IA podrían quedar obsoletos pronto.
El paper no rehúye esa idea y compara explícitamente al Automated Alignment Researcher (AAR) con su equivalente humano.
"El mejor método del AAR supera lo que proponen humanos con experiencia, en promedio dentro de seis horas", dice el texto. "Las direcciones de investigación guiadas por humanos no conducen a un mejor desempeño."
¿Cuánto cuesta cada opción?
Hay incluso una comparación de costos, por si alguien no quedó convencido.
"Un AAR cuesta aproximadamente 4 dólares por hora en inferencia de API, contra los 150 dólares por hora que le pagamos a nuestros investigadores humanos", indica el paper.
La razón entre ambas cifras es de 37,5 a 1. Puesto de otro modo: las seis horas que el paper menciona como plazo para que el sistema automatizado supere una propuesta humana cuestan unos 24 dólares en inferencia, menos de lo que cuesta una sola hora del investigador con el que se compara.
Las limitaciones que el propio paper reconoce
En rigor, el paper también apunta algunas limitaciones del enfoque. El sistema automatizado solo funciona en la medida en que las pruebas de referencia reflejen los objetivos reales de alineamiento, y aun así queda trabajo significativo por hacer para establecer y mantener esas pruebas, sin contar el esfuerzo de mantener y ampliar la literatura de la que se nutren los investigadores automatizados.
Esa dependencia es el punto débil que conviene subrayar. Un sistema que optimiza contra diez pruebas específicas mejora en esas diez pruebas; si la prueba mide de forma incompleta el comportamiento que preocupa, el resultado es un modelo que aprendió a rendir bien en la evaluación. Es el mismo problema que la comunidad de aprendizaje automático conoce desde hace años bajo el nombre de sobreajuste al conjunto de prueba, solo que ahora aplicado a la seguridad y no a la exactitud.




