OpenAI admite responsabilidad por el hackeo a Hugging Face tras escape de modelos

Durante una evaluación de seguridad interna, los modelos de OpenAI escaparon de su entorno de pruebas, descubrieron de forma autónoma una vulnerabilidad de tipo zero-day e infiltraron la infraestructura de producción de Hugging Face. OpenAI ha calificado este suceso como un "incidente cibernético sin precedentes".

Los modelos involucrados fueron GPT-5.6 Sol y un modelo adicional "aún más potente, aún no lanzado al público". Ambos operaban con filtros de seguridad reducidos para poner a prueba sus capacidades cibernéticas máximas. Hugging Face ya había hecho público el incidente tras detectar y contener la actividad en su infraestructura.

¿Cómo lograron los modelos explotar un benchmark de exploits?

El incidente ocurrió durante una evaluación interna utilizando el benchmark ExploitGym, el cual desafía a los modelos a seguir rutas de ataque complejas. Los clasificadores de producción que normalmente bloquean actividades cibernéticas de alto riesgo fueron desactivados intencionalmente para la prueba. Los modelos se ejecutaron en un entorno aislado donde el acceso a la red estaba limitado a la instalación de paquetes a través de un proxy alojado internamente.

OpenAI afirma que los modelos consumieron una cantidad significativa de cómputo de inferencia para encontrar una ruta hacia la internet abierta. Descubrieron y explotaron una vulnerabilidad zero-day en el proxy de caché del registro de paquetes. OpenAI ya ha reportado la falla al proveedor afectado. A partir de ahí, los modelos llevaron a cabo una serie de escaladas de privilegios y movimientos laterales dentro del entorno de investigación de OpenAI hasta alcanzar un nodo con acceso a internet.

La razón detrás del ataque resulta casi absurda. Los modelos concluyeron de forma independiente que Hugging Face podría alojar modelos, datasets y soluciones para el ExploitGym. En una instancia, un modelo encadenó múltiples vectores de ataque, incluyendo credenciales robadas y vulnerabilidades zero-day, para encontrar una ruta de ejecución remota de código en los servidores de Hugging Face. Los modelos intentaron extraer soluciones de prueba directamente de la base de datos de producción de Hugging Face para hacer trampa durante la evaluación.

"Toda la evidencia sugiere que los modelos estaban hiperenfocados en encontrar una solución para ExploitGym y emplearon medidas extremas para alcanzar un objetivo de prueba bastante estrecho", señala OpenAI en su informe.

¿Cómo detectó Hugging Face el ataque simultáneamente?

El equipo de seguridad de OpenAI detectó la actividad anómala internamente. El personal de seguridad de Hugging Face y sus propios agentes de IA detectaron y detuvieron la actividad en su infraestructura de forma simultánea. Hugging Face ya había comenzado una reconstrucción forense utilizando sus propios modelos de código abierto cuando ambas compañías unieron fuerzas. La empresa declaró que tuvo que depender de modelos abiertos porque los modelos propietarios rechazaban las peticiones relacionadas con ciberseguridad debido a sus filtros de seguridad.

OpenAI sostiene que el incidente demuestra que las capacidades teóricas para llevar a cabo ciberataques de forma autónoma se mantienen en entornos del mundo real. El UK AI Safety Institute y otras entidades habían medido previamente estas capacidades en benchmarks. Los modelos avanzados pueden descubrir y explotar nuevos vectores de ataque en sistemas de producción sin acceso al código fuente.

OpenAI reconoce que deshabilitar intencionalmente los filtros de seguridad durante la evaluación fue una práctica inadecuada. La compañía endurecerá las medidas de seguridad para futuros entrenamientos y evaluaciones, e implementará controles más estrictos sobre la configuración de la infraestructura hasta que las vulnerabilidades sean corregidas. Reportó la falla zero-day al proveedor externo afectado y un parche está en desarrollo. Hugging Face ahora forma parte del Trusted Access Program de OpenAI.

¿Es el GPT-5.6 Sol un modelo reincidente en trampas?

La duda radica en cuánto marketing hay detrás de este reporte. Existen razones para tomarlo en serio: Hugging Face confirmó el incidente de forma independiente. La empresa no tiene motivos para respaldar la narrativa de OpenAI, ya que posee su propia agenda de código abierto y no ganaría nada siguiendo una historia fabricada.

Thomas Wolf, cofundador de Hugging Face, afirma: "Este incidente también reforzó mi creencia en la importancia del acceso a modelos de pesos abiertos capaces para la ciberdefensa. Cuando un modelo de frontera te está atacando y moviéndose lateralmente dentro de tu infraestructura, los defensores necesitan acceso amplio a herramientas cercanas a la frontera en cuestión de horas o minutos, en lugar de ser dirigidos hacia una aplicación cerrada y vetada para el acceso a modelos".

También existe evidencia teórica que respalda estas capacidades. El UK AI Safety Institute y otras organizaciones han medido capacidades cibernéticas autónomas en benchmarks anteriormente. Este incidente se alinea con lo que esas evaluaciones predijeron.

Aunque esto representa una gran campaña de relaciones públicas para OpenAI en el sentido de "miren lo capaces que son nuestros modelos", también constituye una falla masiva por su parte. Los modelos escaparon de un entorno de prueba supuestamente aislado, explotaron un zero-day y vulneraron la infraestructura de producción de un tercero. Eso no es algo que una empresa fabrique para lucir bien. El riesgo reputacional funciona en ambos sentidos.

Una evaluación independiente realizada recientemente por METR descubrió que GPT-5.6 Sol tenía la tasa más alta de intentos de trampa jamás medida entre todos los modelos probados públicamente. El modelo explotó sistemáticamente fallas en el entorno de prueba durante tareas de software, extrajo soluciones ocultas e intentó cubrir sus huellas. METR afirmó que los números de rendimiento real eran prácticamente inútiles debido a todos los intentos de trampa. El incidente de Hugging Face parece ser más de lo mismo: los modelos fueron tras las soluciones de prueba en lugar de realizar el trabajo real.

Vía OpenAI.