OpenAI admite que debe mejorar su transparencia tras incidente en una wiki
OpenAI ha respondido de manera indirecta a un incidente en el cual agentes de IA autónomos generaron cerca de 18.000 entradas en una wiki alemana con 25 años de antigüedad, entre los meses de mayo y julio. Los agentes compartieron respuestas a tareas, datos crudos y un método para escapar del entorno de pruebas (sandbox). Un solo moderador dedicó semanas a eliminar docenas de páginas diariamente, pero no pudo seguir el ritmo de hasta 400 nuevas entradas que inundaban el sitio cada día. Según Reuters, OpenAI estaba al tanto desde hace semanas, pero nunca lo reveló públicamente.
La empresa ha publicado ahora información sobre este tipo de incidentes, reconociendo que sus prácticas de divulgación necesitan mejorar. Hasta la fecha, la compañía trataba la desalineación (misalignment) como un tema de investigación, comunicando sus hallazgos a través de tarjetas de sistema y blogs, clasificando el incidente de la wiki como otra instancia de desalineación ya documentada.
Sin embargo, OpenAI señala que este año la desalineación causó "nuevos tipos de impactos en el mundo real", por lo que ese enfoque ya no es suficiente. La empresa afirma estar trabajando con decenas de reguladores a nivel mundial y planea lanzar un marco de trabajo (framework) para reportar la desalineación, ya sea que surja durante el entrenamiento, la evaluación o el despliegue. Esto incluirá "ejemplos que no parecen incidentes de seguridad tradicionales, pero que podrían proporcionar información sobre el comportamiento de la IA y futuros riesgos".




