La inyección de prompts es, según OpenAI, uno de los problemas de seguridad que quizás nunca se resuelva del todo. Anthropic afirma que Claude Opus 5 se acerca a la inmunidad total dentro de su propio software.

La técnica consiste en que un atacante burla las instrucciones de un modelo de IA mediante entradas manipuladas, por ejemplo texto oculto dentro de una página web que el agente lee y obedece sin que el usuario lo note. Contra Opus 5, ese ataque falla casi siempre.

¿Qué tan efectivo es el bloqueo?

Para los agentes de navegador, la tasa de éxito del ataque llegó a 0% en 129 escenarios de prueba, según el system card del modelo. Es un resultado llamativo si se considera que OpenAI reconoció en diciembre que la inyección de prompts podría no tener solución definitiva.

Ese 0% tiene una condición: solo se sostiene con el Modo Automático activado en productos como Claude Cowork. Ese modo apila dos capas de defensa. La primera revisa los datos entrantes en busca de instrucciones ocultas antes de que el modelo los procese. La segunda bloquea acciones peligrosas antes de ejecutarlas. Un atacante tiene que vencer ambas de forma independiente.

Sin esas capas, Opus 5 queda en 3,7%, y Sonnet 5 rinde incluso mejor con 0,93%. Solo la combinación de modelo más software de protección empuja la tasa a cero.

¿Cómo se compara con otros modelos?

En la prueba general de la firma de seguridad Gray Swan, la tasa de éxito tras 15 intentos bajó de 5,5% en Opus 4.8 a 2,0% en Opus 5. Ese resultado ubica a Opus 5 a la cabeza del benchmark IPI de Gray Swan.

ModeloÉxito del ataque (15 intentos)
Opus 52,0%
Mythos 52,6%
Fable 52,8%
Opus 4.85,5%

La lectura fina importa para quien despliega agentes con acceso al navegador: el 0% depende del stack completo, no solo del modelo base. Para equipos que integran estos agentes en flujos con datos sensibles, la diferencia entre 0% y 3,7% define cuánta superficie de ataque queda expuesta.