El Instituto britanico de Seguridad en IA (AISI, por sus siglas en ingles) publico por primera vez una evaluacion de cuanto estan por detras los principales modelos de pesos abiertos frente a los sistemas propietarios en capacidades cibernéticas ofensivas. La respuesta es incomoda: la distancia se esta cerrando rapido.

Segun AISI, modelos abiertos actuales como GLM-5.2 y DeepSeek V4-Pro alcanzaron un nivel que los modelos cerrados de frontera lograron entre cuatro y siete meses antes. Durante casi todo 2025 esa brecha era de seis a diez meses. En pocos meses, el margen se acorto de forma notoria.

¿Por que preocupan los modelos de pesos abiertos?

El riesgo, para los criticos, esta en la naturaleza misma de estos modelos: cualquiera puede descargar sus pesos, modificarlos y ejecutarlos sin supervision. Una vez liberado un modelo, los usuarios pueden quitar las barreras de seguridad, compartir copias libremente y correrlo en sistemas privados fuera del control de nadie. AISI describe esto como "un riesgo de mal uso persistente e irreversible".

El contrapeso tambien es real. Los modelos abiertos permiten alojamiento privado sin que los datos regresen al proveedor, se pueden personalizar, reducen costos y ofrecen una base que ningun proveedor puede cambiar ni apagar de un dia para otro. AISI sostiene que ambas preocupaciones deben equilibrarse.

¿Como se midio la brecha?

El instituto uso dos metodos distintos que llegaron al mismo resultado. El primero, el benchmark Narrow Cyber Tasks, incluye 70 tareas en cuatro niveles de dificultad, desde trabajo no tecnico hasta desafios de nivel experto. Cubre investigacion de vulnerabilidades, ingenieria inversa, explotacion web y criptografia.

En esas tareas, GLM-5.2 (lanzado en junio de 2026) igualo el desempeño de Opus 4.6 (febrero de 2026), es decir unos cuatro meses de retraso. DeepSeek V4-Pro rindio al nivel de Opus 4.5, liberado en noviembre de 2025.

El segundo metodo, llamado Cyber Ranges, evalua capacidades cibernéticas autonomas en redes simuladas. El escenario "The Last Ones" simula un ataque de 32 pasos contra una red corporativa con cuatro subredes y unos 20 equipos. AISI estima que un experto humano necesitaria cerca de 20 horas para completarlo. Ahi GLM-5.2 rindio de forma similar a Opus 4.5, mientras que DeepSeek V4-Pro quedo por debajo de Sonnet 4.5. El mejor resultado lo obtuvo GPT-5.6-Sol, por delante de Claude Mythos 5. En este test la brecha es mas amplia, cercana a siete meses, aunque AISI la considera evidencia mas debil por venir de menos escenarios.

¿Cuanto mas baratos son los modelos abiertos?

Aca aparece el dato mas contundente para quien piense en escalar un ataque. AISI calcula que una prueba de Cyber Range de 100 millones de tokens costo alrededor de 85 dolares con Opus 4.5 o 4.6, unos 46 dolares con GLM-5.2 y apenas 1,19 dolares con DeepSeek V4-Pro.

ModeloPrueba de 100M tokensCosto por tarea resuelta
Opus 4.6 (cerrado)~USD 85~USD 15
Opus 4.5 (cerrado)~USD 85~USD 12,50
GLM-5.2 (abierto)~USD 46~USD 6
DeepSeek V4-Pro (abierto)~USD 1,19~USD 0,28

La diferencia es dramatica: hasta 70 veces mas barato en el peor de los casos para el defensor. Eso vuelve los ciberataques con modelos abiertos economicos y faciles de escalar.

Salvaguardas que casi no frenan nada

AISI encontro que las medidas de seguridad de los modelos abiertos fueron en gran medida inefectivas. DeepSeek V4-Pro a veces rechazaba tareas de ingenieria inversa, pero bastaba con volver a intentarlo para saltar la restriccion. Mecanismos como el monitoreo, los clasificadores y los limites de uso no se trasladan de forma confiable a los modelos abiertos, porque dependen de controlar el acceso al modelo, algo imposible cuando los pesos ya circulan.

El instituto enmarca la brecha restante como una ventana de preparacion: durante ese tiempo, los defensores con acceso a los sistemas cerrados mas potentes pueden actuar antes de que esas capacidades esten disponibles libremente y sin salvaguardas comparables. En abril de 2026, dos modelos cerrados, Mythos Preview y GPT-5.5, entregaron algunas de las mayores mejoras en cibercapacidad de IA desde que AISI comenzo a medir, y el Centro Nacional de Ciberseguridad del Reino Unido emitio advertencias internacionales sobre un panorama de amenazas que cambia rapido.

Queda abierta la pregunta de si los proximos modelos de pesos abiertos replicaran esos avances. AISI planea evaluar Kimi-K3, cuyos pesos se esperan para fines de julio y que segun los benchmarks de codigo actuales podria acercarse mas a la frontera, aunque a un costo bastante mayor que otros modelos abiertos.