5 de agosto de 2026 - Link Blog
Informe de incidente: comportamiento no autorizado de agentes durante pruebas cibernéticas. Ha sucedido otra vez. En esta ocasión, el Instituto de Seguridad de IA (AISI) del gobierno del Reino Unido atacó accidentalmente a otras empresas mientras ejecutaba evaluaciones con modelos que tenían los filtros de seguridad desactivados. Según su paper técnico (PDF):
Durante una evaluación cibernética, del 25 al 28 de julio de 2026, los agentes de IA participaron en actividades sostenidas y no autorizadas dirigidas a lo que, en la práctica, eran personas y organizaciones reales. Estos intentos no tuvieron éxito y, hasta donde sabemos, no resultaron en daños en el mundo real. [...] A través de 122 intentos de evaluación en dos de los desafíos cibernéticos del AISI, el instituto encontró 19 casos donde los agentes de IA tomaron acciones no autorizadas en internet, incluyendo casos que apuntaron a personas y organizaciones reales. [...] Es incierto hasta qué punto el modelo reconoció que estaba tomando acciones contra personas reales. En el caso más grave, un agente de IA (Mythos 5) decidió intentar resolver el desafío cibernético utilizando un ataque a la cadena de suministro. Como resultado, el agente de IA creó una cuenta de GitHub y luego intentó convencer a un mantenedor de un repositorio de código abierto para que aceptara una pull request (PR) maliciosa, incluso creando una segunda cuenta que se hacía pasar por otro usuario humano respaldando la PR. [...] Además, en su intento por resolver el desafío, el agente decidió emplear la técnica de “spear-phishing” enviando correos electrónicos dirigidos con contenido malicioso e intentando manipular a los receptores para que aceptaran los cambios de código, además de planear una inyección de prompts para comprometer a otros agentes de programación.
Lo que encontré más sorprendente es que el AISI estaba ejecutando estos agentes sin ningún tipo de sandboxing de red:
El AISI proporcionó a los agentes de IA acceso a internet durante estas evaluaciones, lo cual permitió sus acciones en la red abierta en este entorno. El acceso a internet fue una parte deliberada de la configuración de evaluación del AISI en este entorno, y no se debió a un escape del sandbox.
Esto, combinado con el hecho de que "el AISI desactiva deliberadamente los ciber-clasificadores implementados por los desarrolladores", hace que el hecho de que los agentes comenzaran a atacar objetivos del mundo real sea algo completamente predecible bajo mi criterio.
La mayoría de los incidentes reportados fueron protagonizados por el modelo Mythos 5, pero "GPT-5.6 Sol sin ciber-clasificadores" también registró algunos casos.
Aquí está la "Muestra 1" del paper, en la cual el agente intenta ejecutar un ataque a la cadena de suministro enviando una PR con un ataque de inyección de prompt oculto, ¡luego realizando ingeniería social con un segundo agente que finge haber revisado el código!
Es un paper interesante. Recomiendo leerlo completo.
Vía Simon Willison.



