El nuevo GPT-6 Astra: Entre la precisión y la seguridad
El nuevo modelo de OpenAI, GPT-6 Astra, produce menos alucinaciones y bloquea ataques de inyección de prompts con mayor eficacia que sus predecesores. No obstante, todavía no alcanza el nivel de fiabilidad necesario para despliegues de agentes de IA verdaderamente seguros.
El nuevo modelo Astra comete muchos menos errores factuales que su predecesor, el GPT-5.6 Sol, según la system card de OpenAI. OpenAI lo puso a prueba frente a conversaciones de ChatGPT que los usuarios habían marcado como erróneas, es decir, casos particularmente propensos a fallos cuyas tasas de error no deben considerarse típicas para el uso diario. Astra reprodujo estos errores reportados con mucha menos frecuencia, logrando las mayores mejoras en configuraciones de baja latencia y niveles de razonamiento inferiores.

GPT-6 Astra (en rosa) alucina menos que los modelos GPT-5 en todas las configuraciones de latencia. | Imagen: OpenAI
En cuanto a las inyecciones de prompt directas, donde los usuarios intentan manipular el modelo a través de sus propios comandos, Astra alcanza una tasa de defensa casi perfecta del 99,99 por ciento. OpenAI atribuye esto a su método GPT-Red, que utiliza un atacante automatizado para fortalecer el modelo durante el entrenamiento.
La resistencia al jailbreak presenta resultados similares. Frente a un conjunto de datos fijo de ataques conocidos que intentan extraer respuestas dañinas sobre biología, violencia y ciberseguridad, Astra se niega a colaborar en un rango de entre el 91,5 y el 98,3 por ciento de los casos.
Sin embargo, cuando los atacantes adaptan su estrategia a lo largo de múltiples rondas de conversación, la tasa de defensa de Astra cae a cerca del 67 por ciento. Esto significa que los adversarios persistentes pueden obtener al menos una respuesta problemática en aproximadamente uno de cada tres intentos. Los modelos predecesores obtuvieron resultados inferiores al 50 por ciento en la misma prueba. OpenAI señala que estas evaluaciones se ejecutaron sobre el modelo base sin las capas de seguridad de producción, como los clasificadores que acompañan al producto final.
¿Siguen siendo un problema real las inyecciones de prompt ocultas?
Astra logra avances en las inyecciones de prompt indirectas, donde un ataque se oculta dentro de un documento que la IA procesa. Pruebas externas realizadas por la firma de seguridad Gray Swan, utilizando 1.810 ataques curados de su IPI Arena, revelaron que con 15 intentos por escenario, Astra fue vulnerado al menos una vez en el 8,5 por ciento de los casos. El GPT-5.6 Sol falló el 27 por ciento de las veces. Claude Opus 5 obtuvo un mejor resultado con un 4,8 por ciento, aunque tampoco fue inmune.

Tasas de éxito de ataques para inyecciones de prompts indirectas según el IPI Arena de Gray Swan. | Imagen: OpenAI
Las cifras en la prueba combinada del primer y segundo trimestre de Gray Swan aumentaron en comparación con resultados anteriores. Anthropic reportó previamente una tasa de éxito de ataque de solo el dos por ciento basándose únicamente en la prueba más sencilla del Q1, donde el GPT-5.6 Sol obtuvo un 20 por ciento. Anthropic también ejecutó todos los modelos con el razonamiento extendido activado, lo cual, junto con el alcance más amplio de la prueba, podría explicar la brecha.
Aunque se trata de ataques seleccionados manualmente, las tasas de éxito deberían preocupar a cualquier equipo de seguridad empresarial. Astra puede ser engañado mediante instrucciones inyectadas en aproximadamente uno de cada doce escenarios. Opus 5 resiste mejor, pero aun así falla en uno de cada veintiuno. El riesgo es creciente: los agentes de IA están escribiendo código, operando herramientas y controlando computadoras por cuenta propia, que es precisamente lo que probó Gray Swan. Estos agentes están diseñados para operar las 24 horas y a escala, siendo la lectura y el procesamiento de documentos una de sus funciones principales.
Vía The Decoder.




