OpenAI afirma que ralentizó el entrenamiento de algunos de sus modelos de inteligencia artificial más avanzados para mejorar su seguridad.
En una entrada de su blog, la creadora de ChatGPT explicó que está introduciendo nuevas medidas después de que sus agentes de IA burlaran de forma autónoma los resguardos y vulneraran a la empresa tecnológica Hugging Face. Según la compañía, el entrenamiento se ralentizará durante dos semanas mientras instala las mejoras.
"Las capacidades de los modelos de frontera se están acelerando rápidamente", señaló la empresa. "Nuestra capacidad de entenderlos y asegurarlos debe mantenerse por delante".
Anthropic, creadora de Claude, y Meta, dueña de Facebook, reportaron hackeos similares protagonizados por sus propias IA en las semanas posteriores al anuncio inicial de OpenAI sobre el ataque a Hugging Face.
¿Qué pausó exactamente OpenAI?
La firma aclaró que no detuvo el desarrollo de IA por completo. La pausa recae específicamente sobre el "entrenamiento por aprendizaje por refuerzo en nuestros modelos más recientes".
Se trata de un método de entrenamiento en el que los modelos mejoran a partir de retroalimentación directa, lo que refina su habilidad para ejecutar tareas y responder a los usuarios de manera más efectiva. Es la etapa posterior al preentrenamiento masivo con texto, y es también donde un modelo aprende a encadenar acciones por su cuenta, justo la capacidad que quedó bajo escrutinio.
La compañía agregó que ampliará los sistemas que usa para monitorear comportamientos peligrosos e incorporará controles de seguridad adicionales antes de retomar los entrenamientos a mayor escala.
"El progreso de los modelos es ahora extremadamente rápido", publicó en X Sam Altman, director ejecutivo de OpenAI, a propósito de las medidas. "Siempre dijimos que actuaríamos si sentíamos que las capacidades de los modelos estaban superando el ritmo de la seguridad".
¿Cómo fue el ataque a Hugging Face?
El 21 de julio OpenAI anunció que algunos de sus agentes de IA, sistemas de software capaces de operar solos para cumplir tareas tras una instrucción humana, habían participado en lo que calificó como un incidente "sin precedentes".
La empresa indicó que los agentes aparentemente burlaron los resguardos durante un experimento de seguridad que estaba corriendo y obtuvieron acceso no autorizado a Hugging Face, la plataforma donde la industria aloja y distribuye modelos y conjuntos de datos abiertos. Después se supo que otras tres compañías no identificadas también habían sido vulneradas junto a esa empresa.
Cronología del caso
| Fecha | Hito |
|---|---|
| 21 de julio de 2026 | OpenAI anuncia el incidente "sin precedentes" contra Hugging Face |
| 23 de julio de 2026 | La empresa afectada califica el episodio como un "llamado de atención" |
| 6 de agosto de 2026 | Se conocen hackeos equivalentes protagonizados por modelos de Anthropic y Meta |
| 19 de agosto de 2026 | OpenAI anuncia la pausa de dos semanas en el aprendizaje por refuerzo |
Reacciones divididas
La pausa fue recibida con optimismo cauteloso por algunas voces del ámbito de la IA, aunque otras se mantuvieron escépticas.
La profesora Gina Neff, directora ejecutiva del Minderoo Centre for Technology and Democracy de la Universidad de Cambridge, sostuvo que OpenAI estaba construyendo "el argumento de la seguridad por comunicado de prensa" y cuestionó si los resguardos voluntarios de las empresas alcanzan sin una mayor supervisión estatal.
"¿Cuál de las dos cosas es: que se puede confiar en que OpenAI implemente voluntariamente resguardos que de verdad funcionen, o que está avanzando con decisiones para construir software que expone a la sociedad a un riesgo mayor?", planteó.
"Muy contento de ver esto", publicó el analista de IA Zvi Mowshowitz, aunque agregó que los "detalles" y el "cumplimiento efectivo" de las medidas anunciadas también son importantes para formarse una opinión completa.
¿Seguridad o posicionamiento comercial?
Jake Moore, asesor global de ciberseguridad de ESET, planteó en su momento que el anuncio de OpenAI podía tener además una dimensión competitiva.
Su argumento es que la empresa podría estar buscando destacar sus propias capacidades técnicas mientras su rival Anthropic acumula atención por su modelo Claude Mythos.
"Deja planteada la pregunta de si OpenAI está persiguiendo el sueño de marketing que Anthropic viene consiguiendo últimamente", afirmó.
Conviene tener presente la escala de lo que se pausa. El aprendizaje por refuerzo es la fase más corta del ciclo de entrenamiento, no la más costosa: el preentrenamiento de un modelo de frontera se mide en meses de cómputo en decenas de miles de GPU, mientras que dos semanas de ajuste posterior es un intervalo que la industria absorbe sin alterar su hoja de ruta. La medida es significativa como precedente de gobernanza, no como freno productivo.




