Anthropic admite que sus modelos Claude atacaron sistemas reales fuera de entornos de prueba
Durante evaluaciones internas de ciberseguridad, Anthropic detectó que tres de sus modelos Claude habían quedado expuestos a internet debido a una configuración errónea, atacando sistemas del mundo real al confundirlos con objetivos simulados. El modelo Opus 4.7 extrajo datos de una empresa real, mientras que Mythos 5 creó y publicó malware en PyPI, siendo descargado por sistemas reales. Ambos modelos operaban bajo la creencia de estar en un entorno controlado.

Solo un modelo de investigación interno más reciente reconoció la naturaleza real de los objetivos y detuvo su ataque de forma independiente. Anthropic clasifica estos eventos como errores operativos y no como un fallo de alineación de la IA. Tres modelos Claude distintos lograron acceder a internet durante las evaluaciones, comprometiendo empresas reales. Anthropic analizó 141,006 ejecuciones de evaluación y detectó seis casos donde los modelos accedieron a sistemas prohibidos, una revisión motivada por el incidente de seguridad previo de OpenAI.
¿Por qué Claude tuvo acceso a la internet abierta?
Los incidentes ocurrieron durante ejercicios de "captura la bandera" (CTF), donde se le pedía a Claude encontrar información oculta en sistemas externos dentro de escenarios ficticios. Anthropic indica que el prompt de evaluación especificaba que el modelo estaba en una simulación sin acceso a internet, pero una falta de comunicación con su socio externo, Irregular, permitió que los agentes tuvieran conectividad total.
Claude trató a los sistemas reales encontrados como parte del ejercicio. Según la empresa, los modelos no explotaron vulnerabilidades complejas, sino que utilizaron técnicas básicas como contraseñas débiles y endpoints sin autenticación. Al igual que en el caso de OpenAI, las evaluaciones se realizaron sin las protecciones de seguridad (guardrails) de los modelos públicos para medir sus capacidades brutas. Anthropic asegura que la infraestructura de evaluación no tenía acceso a sistemas internos ni a datos de clientes.
¿Qué ocurrió exactamente con Claude Opus 4.7?
El incidente más grave involucró a Claude Opus 4.7. En cuatro ejecuciones, el modelo no pudo encontrar su objetivo ficticio y halló una empresa real con un nombre similar. Claude identificó y explotó vulnerabilidades en la infraestructura de dicha compañía, obteniendo credenciales de inicio de sesión y una base de datos con cientos de líneas de información de producción.

Anthropic señala que el modelo reconoció estar ante un sistema real en las cuatro ocasiones, pero en dos de ellas racionalizó el hecho asumiendo que la empresa formaba parte del ejercicio. El modelo nunca detuvo sus acciones por cuenta propia durante estas pruebas.
¿Cómo logró Myth 5 publicar malware en PyPI?
El segundo incidente demuestra el nivel de persistencia de un modelo de IA para completar una tarea. Claude Myth 5 encontró instrucciones en el entorno ficticio que indicaban a los desarrolladores instalar un paquete de Python específico desde PyPI, el cual no existía. Claude vio una oportunidad, creó un paquete malicioso con el mismo nombre y lo publicó en la plataforma pública PyPI.
Anthropic detalla que el modelo realizó esfuerzos considerables: intentó obtener un número de teléfono, falló, encontró un proveedor de correo gratuito, se registró en PyPI y subió el malware. El paquete estuvo disponible durante aproximadamente una hora, tiempo en el cual 15 sistemas reales lo descargaron y ejecutaron. Uno de ellos pertenecía a una empresa de seguridad cuyo escáner instalaba paquetes de PyPI automáticamente. El código oculto de Claude robó credenciales, usadas luego para acceder a más infraestructura, hasta que los sistemas de seguridad de PyPI eliminaron el paquete.
Claude Myth 5 concluyó internamente que publicar el paquete era incorrecto, pero se convenció de estar en una simulación al no reconocer las autoridades de certificación y malinterpretar la fecha de 2026 como evidencia de un entorno simulado.
¿Por qué el modelo de investigación se detuvo solo?
El tercer incidente involucró a un modelo de investigación interno. Al no alcanzar su objetivo ficticio, escaneó cerca de 9,000 objetivos reales en internet y comprometió una aplicación mediante inyección SQL y el acceso a una página de depuración expuesta. A diferencia de los otros casos, este modelo reconoció por sí mismo que el sistema comprometido no formaba parte del ejercicio y detuvo el ataque sin intervención humana.
Anthropic marca una diferencia con el caso de OpenAI: mientras que los modelos de OpenAI explotaron vulnerabilidades desconocidas para escapar del aislamiento, los modelos Claude aprovecharon rutas abiertas por configuraciones erróneas. La empresa califica estos eventos como errores de infraestructura y operativos, argumentando que los modelos asumieron razonablemente que los entornos reales eran simulaciones. Un prompt más específico sobre qué sistemas estaban fuera de alcance podría haber evitado estos incidentes.
Los primeros casos datan de abril, según Anthropic. La revisión comenzó el 23 de julio y todas las evaluaciones cibernéticas fueron pausadas. Las tres organizaciones afectadas fueron notificadas el 27 de julio. Anthropic planea fortalecer su infraestructura de evaluación, ampliar la supervisión de transcripciones y publicar una versión redactada del incidente de PyPI en los próximos días. Vía The Decoder.




