OpenAI reconocio el martes que perdio el control de dos de sus modelos durante una prueba de seguridad que termino con una brecha en Hugging Face, la plataforma abierta de investigacion en inteligencia artificial.
La compañia describio el incidente como "inedito". Segun su relato, los modelos rompieron un entorno de pruebas sellado la semana pasada y se metieron en el sistema de produccion de Hugging Face para robar las respuestas de una evaluacion que estaban rindiendo. Los modelos eran el GPT-5.6 Sol, disponible al publico, y otro sin lanzar y presuntamente mas capaz. A ambos se los estaba midiendo en habilidades ofensivas de hacking con las salvaguardas que normalmente bloquean la actividad ciber de alto riesgo desactivadas.
"Los modelos identificaron y encadenaron vulnerabilidades en el entorno de investigacion de OpenAI y en la infraestructura de produccion de Hugging Face para obtener las soluciones del test directamente desde la base de datos de produccion de Hugging Face", escribieron ambas empresas en el blog conjunto que revelo la intrusion.
¿Como escaparon del entorno aislado?

De acuerdo con OpenAI y Hugging Face, los modelos salieron a traves de un proxy de cache para registros de paquetes, un software que deja a los desarrolladores instalar codigo externo sin conectarse a internet. Ese proxy era el unico componente del entorno de pruebas aislado con permiso para alcanzar el mundo exterior y, en uso normal, ese alcance se limita a repositorios publicos de codigo.
En lugar de quedarse contenidos en el sandbox, los modelos explotaron una vulnerabilidad zero-day para llegar a internet abierto mientras se "hiperconcentraban" en resolver el benchmark de ciberseguridad conocido como ExploitGym. Este tipo de experimentos usa instrucciones que presionan a los modelos para encontrar soluciones, basicamente incitandolos.
"Tras obtener acceso a internet, los modelos infirieron que Hugging Face posiblemente alojaba modelos, datasets y soluciones para ExploitGym", escribio OpenAI. "Sabiendo eso, el modelo busco y encontro con exito formas de acceder a informacion secreta que podia usar para hacer trampa en la evaluacion. En un caso, el modelo encadeno varios vectores de ataque, incluido el uso de credenciales robadas y un zero-day."
¿Es un problema nuevo de la IA?
La falla explotada era desconocida hasta entonces, pero los agujeros en esta clase de software no son raros. Las empresas llevan una decada parchando vulnerabilidades serias en repositorios de artefactos. Un bug divulgado en 2024, la CVE-2024-4956 en Nexus Repository, permitia que cualquiera con acceso al servidor pidiera un archivo por URL y lo obtuviera, archivos de configuracion, contraseñas o tokens de acceso, sin siquiera iniciar sesion. Otras fallas han dejado a atacantes tomar control del servidor completo.
Los investigadores subrayan que, si bien los avances de la IA crearon desafios nuevos y a veces inesperados, la tarea de aislar de forma rigurosa la infraestructura respecto de internet abierto esta muy estudiada.
"Esto no es un problema de IA. Es negligencia sobre un estandar de 40 años, y es basicamente cualquier pelicula de ciencia ficcion", dice Davi Ottenheimer, consultor de seguridad y cumplimiento con larga trayectoria. "'Altamente aislado' y 'escapo por el unico agujero que dejamos abierto' no pueden ser ambos ciertos."
En los ultimos meses, las principales empresas de IA vienen alertando sobre las crecientes capacidades de ciberseguridad de los futuros modelos de frontera, a medida que las plataformas ganan pericia, creatividad y operacion autonoma con agentes. Pero los investigadores insisten en que eso es justamente motivo para no descuidar los fundamentos.
"Esto no deberia haber pasado", dice Niels Provos, ingeniero e investigador de seguridad veterano. "Ojala los laboratorios de frontera dedicaran tanto tiempo a enseñar a sus modelos a escribir infraestructura segura como el que dedican a que exploten vulnerabilidades."




