Un equipo de la empresa de ciberseguridad Hacktron AI entró al código interno de OpenAI el 25 de julio y lo hizo público el 18 de septiembre en un mensaje en X. Los investigadores encadenaron dos vulnerabilidades hasta llegar a las cuentas de ChatGPT y de Codex de algunos empleados, y dejaron un pull request inofensivo en el repositorio privado de la empresa como prueba de que habían llegado hasta ahí.

Todo ocurrió dentro del programa de recompensas de OpenAI. La compañía corrigió el problema 14 horas después de recibir el reporte y pagó una recompensa de 6.500 dólares, informó Tom's Hardware.

¿Cómo fue la cadena de ataque?

La secuencia que publicó el equipo tiene seis eslabones. Subida de un archivo HEIF, desbordamiento de memoria en libheif, ejecución remota de código, fallo en el inicio de sesión único de OpenAI, toma de las cuentas de ChatGPT y Codex, y desde ahí el GitHub conectado a esa cuenta.

El punto de partida es el foro de la comunidad de OpenAI, que funciona sobre Discourse, una plataforma de terceros. Los investigadores subieron como foto de perfil una imagen HEIF preparada. El servidor intentó procesarla con un paquete libheif desactualizado y eso provocó un desbordamiento de memoria en el montón, que hizo caer la biblioteca y le desordenó el manejo interno de memoria al sistema. El equipo orquestó esa caída con cuidado hasta convertirla en ejecución remota de código.

Con acceso al entorno local del servidor del foro, interceptaron las configuraciones de entorno y el manejo de sesiones. Ahí apareció el segundo problema. El sistema de autenticación del foro no validaba ni aislaba de forma adecuada las sesiones de usuario frente a otros servicios de OpenAI.

Del foro al repositorio privado

Con los tokens de sesión sacados de la base de datos del servidor local del foro, los investigadores se hicieron pasar por un empleado real de OpenAI. Eso les permitió saltarse las pantallas de inicio de sesión y entrar a una cuenta interna de privilegios altos, ligada a los equipos de desarrollo de la empresa.

Como muchas empresas de tecnología unifican la autenticación de sus aplicaciones corporativas, esa cuenta secuestrada estaba conectada además a GitHub, Slack y el correo. Por esa vía llegaron al repositorio privado de código de OpenAI, donde abrieron un pull request interno como prueba definitiva del hallazgo.

¿Qué papel jugó Claude Opus 5?

El exploit no salió de una persona. Los investigadores armaron la cadena con el modelo Claude Opus 5 de Anthropic, después de que los intentos con Opus 4.8 fallaran. Cuando encontraron la biblioteca libheif sin parchar en el foro de OpenAI, le pasaron al modelo los datos en crudo del servidor y le pidieron escribir un exploit para el error.

El modelo analizó la estructura de memoria y calculó cómo disparar el desbordamiento del búfer en el montón. Generó el código preciso que hacía falta para construir la imagen HEIF maliciosa. Los hackers humanos la subieron al foro, con eso dispararon la ejecución remota de código y el resto del ataque lo ejecutaron a mano.

Hay una aclaración que el propio equipo remarca. Usaron una versión de Claude autorizada y configurada para ciberseguridad, que relaja ciertas restricciones de ese tipo para investigadores acreditados.

Qué pasó después del acceso

Los investigadores afirman que detuvieron las pruebas de inmediato y reportaron las vulnerabilidades a OpenAI y a Discourse. Las dos empresas ya corrigieron su parte. Según el relato del equipo, no estudiaron ni descargaron el código fuente de OpenAI. Desde el hallazgo inicial hasta la resolución completa pasaron 72 horas.

El episodio se suma a otros recientes donde la inteligencia artificial aparece del lado atacante. El mes pasado, un grupo vinculado a China usó IA para ejecutar el primer ciberataque autónomo de punta a punta contra el gobierno de Taiwán, y antes agentes de OpenAI vulneraron por su cuenta a Hugging Face. Las empresas estadounidenses de modelos de frontera ya advierten sobre ataques sofisticados de destilación.