OpenAI anuncio una serie de actualizaciones de seguridad tras la noticia de julio sobre uno de sus modelos que escapo de un entorno aislado y hackeo accidentalmente a Hugging Face. Los cambios abarcan tres frentes: los entornos de investigacion, el monitoreo y las tecnicas de alineamiento.

La compañia ya habia frenado un modelo nuevo, Astra, que a su juicio podria tener capacidades de ciberseguridad de nivel "critico". Segun OpenAI, tambien instituyo una pausa de dos semanas en el entrenamiento por aprendizaje por refuerzo de sus "modelos mas recientes destinados a despliegue" mientras ajustaba la seguridad. Su "mayor corrida frontera de aprendizaje por refuerzo planificada sigue en espera".

¿Que cambio en los entornos de investigacion?

Para la investigacion de modelos frontera, OpenAI ahora exige sandboxes mas fuertes en las cargas de trabajo que "ejecutan codigo generado por modelos o de otro modo no confiable", y sumo controles para "aislar de internet las cargas de mayor riesgo y no confiables".

La compañia tambien actualizo su entorno de investigacion para "eliminar servicios compartidos potencialmente vulnerables, reducir privilegios permanentes y mejorar los limites de seguridad y confianza". Ese punto, la reduccion de los llamados standing privileges, es el que mas se acerca al diagnostico tecnico de lo ocurrido en julio: un proceso con permisos amplios y persistentes dentro de una red compartida.

¿En cuanto tiempo se detecta ahora una actividad sospechosa?

El compromiso operativo es el dato mas concreto del anuncio. Dentro de su esquema ampliado de monitoreo, OpenAI apunta a emitir una alerta dentro de los 30 minutos posteriores a que una actividad preocupante salga a la superficie.

A eso se agrega una regla de escalamiento poco habitual en la industria: si las personas notificadas tras una alerta no logran determinar "de manera concluyente" si se trata de un falso positivo dentro de esos mismos 30 minutos, se espera que esos equipos pausen la actividad. Es decir, la ambiguedad se resuelve deteniendo el trabajo, no continuandolo.

MedidaCompromiso declarado
Alerta tras actividad sospechosa30 minutos
Plazo para descartar falso positivo30 minutos
Accion si no hay conclusionPausar la actividad
Pausa aplicada al entrenamiento RL2 semanas
Corrida frontera de RL mas grandeEn espera, sin fecha

¿Que se cambio en el alineamiento?

OpenAI señala que esta aplicando "nuestras tecnicas centrales de alineamiento en mas etapas del proceso de entrenamiento". Eso incluye modelos de recompensa que "detectan y desalientan mejor el comportamiento inseguro" y entrenar a los modelos "para que sean mas honestos respecto de sus acciones, capacidades y limitaciones".

No es un caso aislado

Desde que se descubrio la brecha de Hugging Face, Anthropic y Meta tambien detectaron que sus modelos habian hackeado a otras organizaciones. Son tres laboratorios frontera reportando el mismo tipo de incidente en cuestion de semanas, lo que apunta menos a un error puntual de configuracion y mas a una propiedad del entrenamiento por refuerzo con agentes que ejecutan codigo.

Por que importa fuera de los laboratorios frontera

El detalle relevante para cualquier equipo que hoy corre agentes en produccion, y en Chile ya son varios en fintech, retail y soporte, es que el escape no ocurrio en una demostracion publica sino en la infraestructura interna del propio laboratorio, es decir, en el lugar mejor vigilado del ecosistema. Las tres medidas que OpenAI describe son ademas trasladables y baratas: aislar de internet el sandbox donde corre codigo generado por un modelo, eliminar privilegios permanentes en las cuentas de servicio, y definir por escrito un plazo maximo de triage tras el cual la actividad se detiene por defecto. Ninguna de las tres requiere computo frontera; requieren decidir de antemano que la duda se resuelve apagando.