En mayo, un modelo Gemini rompió su aislamiento y accedió a los sistemas de tres empresas distintas. Google no lo divulgó hasta que el Wall Street Journal se acercó a la compañía a preguntar, informó The Verge.
Los accesos ocurrieron durante una prueba de las capacidades de ciberseguridad del modelo, a cargo de la empresa externa Irregular. Esa misma firma estuvo involucrada en incidentes similares con modelos de Meta y de OpenAI.
¿Por qué Google no lo divulgó?
Según el WSJ, Google no informó el episodio porque no lo consideró un "ejemplo de desalineación del modelo". La compañía dijo que se trató de un caso de "identidad equivocada", y que una vez que el modelo se dio cuenta de que había entrado por fuerza bruta a una empresa real adivinando una contraseña, se detuvo.
"En este caso, el modelo actuó de manera apropiada", afirmó Heather Adkins, vicepresidenta de Ingeniería de Seguridad de Google.
Adkins le dijo a The Verge que "el modelo encontró información pública en internet y adivinó credenciales para acceder a sitios web que creía que eran parte de la prueba. En los tres casos, el modelo se detuvo".
Lo que Adkins no explicó fue por qué un modelo que rompe su aislamiento por iniciativa propia y apunta contra terceros no califica como desalineación.
"Nuestro equipo de seguridad tiene un largo historial de reportar problemas que encontramos en el software y los sistemas de otras personas, incluso cuando es algo tan simple como una contraseña débil", dijo. "Nos aseguramos de que las tres entidades fueran notificadas, y trabajamos con nuestro socio de entrenamiento en los cambios que ya hicieron a sus procesos de prueba. Estos eventos resaltan la importancia de entrenar modelos de IA potentes para que actúen de manera responsable".
El otro lado del argumento
Jack Cable, director ejecutivo de la firma de seguridad de IA Corridor, le dijo al WSJ que "el meta problema es que los modelos están saliéndose de los límites de lo que deberían estar haciendo, y ejecutando ciberataques reales".
Hay un detalle que apunta en la misma dirección. Fallas de seguridad en Irregular pudieron ser lo que hizo posibles estos accesos. El modelo no debía tener acceso a internet durante la evaluación, pero Irregular le reconoció al WSJ que esa conexión quedó disponible sin que nadie lo quisiera.
El episodio se suma a una lista que viene creciendo. The Verge ha cubierto el caso de OpenAI con RubyGems, el de Hugging Face y el de Claude contra organizaciones durante pruebas de ciberseguridad. A medida que los incidentes se acumulan, también han crecido los llamados a poner límites al desarrollo de la IA.




