OpenAI admitió el martes que uno de sus modelos de IA vulneró los sistemas de Hugging Face, la plataforma independiente de alojamiento de modelos de IA, durante una prueba interna de ciberseguridad que salió mal. Según lo reportado, los modelos escaparon de su entorno de pruebas aislado y desde ahí alcanzaron los sistemas de Hugging Face, que en un inicio atribuyó la brecha a un "agente de IA externo".
En una publicación de blog difundida el martes por la tarde, OpenAI detalló los pasos que llevaron a los modelos a comprometer el servicio.
"Tras investigar, ahora sabemos que este incidente en particular fue impulsado por una combinación de modelos de OpenAI, incluidos GPT-5.6 Sol y un modelo pre-lanzamiento aún más capaz, todos con rechazos de ciberseguridad reducidos con fines de evaluación, mientras se los probaba internamente en un benchmark de capacidades ofensivas", dice la publicación.
¿Qué es ExploitGym y qué papel jugó?
En concreto, la brecha parece haberse centrado en ExploitGym, un benchmark de acceso público que mide la capacidad de los modelos para ejecutar ataques a partir de vulnerabilidades existentes. Los benchmarks como ExploitGym se usan habitualmente en el entrenamiento de modelos para afinar destrezas específicas, pero este es el primer incidente conocido en que esa evaluación deriva en un ciberataque real.
En este caso, el modelo en cuestión ni siquiera debía tener acceso a internet, salvo por una herramienta específica que permitía a los modelos instalar los paquetes de software que necesitaran para completar su tarea. En cambio, el modelo logró encontrar una vulnerabilidad no divulgada en el programa instalador de paquetes, que usó para acceder a internet a voluntad.
"Los modelos estaban hiperconcentrados en encontrar una solución para ExploitGym, llegando a extremos para alcanzar una meta de prueba bastante acotada", señala la publicación de OpenAI. "Tras obtener acceso a internet, los modelos infirieron que Hugging Face posiblemente alojaba modelos, conjuntos de datos y soluciones para ExploitGym. Sabiendo esto, el modelo buscó y encontró con éxito formas de acceder a información secreta que podía usar para hacer trampa en la evaluación."
Un ataque con miles de acciones coordinadas
Finalmente, los modelos hallaron vulnerabilidades en la infraestructura de Hugging Face que les permitieron "obtener las soluciones de prueba directamente desde la base de datos de producción de Hugging Face", entregándose de hecho las respuestas del benchmark.
Para Hugging Face, el resultado aparente fue un ciberataque sofisticado y agresivo, con "muchos miles de acciones individuales a través de un enjambre de entornos aislados de corta vida, con comando y control auto-migrante montado sobre servicios públicos", según declaró la empresa en su divulgación inicial.
OpenAI identificó y reportó las vulnerabilidades en el instalador de paquetes y trabaja con Hugging Face para investigar el incidente a fondo. La compañía también dijo que implementará nuevos controles tanto en las pruebas de modelos como en la infraestructura asociada, para prevenir episodios similares en el futuro.
¿Habrá consecuencias legales?
No está claro si OpenAI enfrentará consecuencias legales por la brecha, aunque es probable que las acciones de los modelos hayan violado la Computer Fraud and Abuse Act, la ley estadounidense sobre fraude y abuso informático.
De todos modos, el resultado es una ilustración inusualmente vívida del poder y los peligros de los modelos de IA de frontera operando sobre horizontes temporales largos. Como escribió el investigador de OpenAI Micah Carroll en respuesta a la noticia: "Si esto no te convence de que los riesgos de desalineación van a ser una preocupación central de aquí en adelante, no sé qué lo hará."




