Introducción a Gemini 3.5 Flash Cyber
Google ha invertido en ciberseguridad durante años, siendo pionero en el descubrimiento automatizado de vulnerabilidades para proteger los repositorios de código del mundo. Herramientas como CodeMender, nuestro agente de seguridad de código, pueden encontrar y corregir automáticamente vulnerabilidades críticas de software. Sin embargo, a medida que los agentes de IA se vuelven más capaces de encontrar vulnerabilidades más rápido de lo que los defensores pueden repararlas, abordar esta amenaza global requiere un enfoque altamente capaz, asequible y escalable.
Hoy, expandimos nuestros esfuerzos para preparar mejor a los equipos de defensa presentando Gemini 3.5 Flash Cyber, nuestro modelo de ciberseguridad ligero construido sobre la base de 3.5 Flash y ajustado específicamente para encontrar, validar y parchear vulnerabilidades de manera rápida y eficiente, superando a los modelos Flash estándar de Gemini en estas tareas.
El rendimiento y la eficiencia de Flash lo convierten en una base ideal para nuestros esfuerzos en ciberseguridad. Al construir sobre Flash, 3.5 Flash Cyber ofrece una alternativa rentable y altamente capaz frente a los modelos de ciberseguridad grandes y costosos.
Dada la naturaleza de doble uso de esta tecnología, hemos adoptado un enfoque intencional sobre cómo desplegamos 3.5 Flash Cyber. Como parte de un programa piloto de acceso limitado, 3.5 Flash Cyber estará disponible exclusivamente para gobiernos y socios de confianza a través de CodeMender próximamente, expandiéndose con el tiempo. Esto dará a los defensores en primera línea una ventaja inicial para encontrar y corregir vulnerabilidades críticas antes de que puedan ser explotadas, mitigando riesgos de uso indebido.
Por separado, estamos llevando las capacidades fundamentales de CodeMender directamente a los clientes con los modelos Gemini de disponibilidad general a través de la Gemini Enterprise Agent Platform.
¿Cuál es el problema del espacio de búsqueda en seguridad de código?
Encontrar fallos profundamente arraigados requiere explorar un inmenso espacio de búsqueda de ejecución. Depender de una única llamada costosa a un modelo de lenguaje masivo puede crear un cuello de botella. 3.5 Flash Cyber es particularmente adecuado para encontrar vulnerabilidades donde el agente debe escanear una base de código extensa y analizar una gran cantidad de rutas de código.
CodeMender invoca a 3.5 Flash Cyber múltiples veces, permitiendo que los agentes analicen muchas más rutas de código para descubrir y validar vulnerabilidades. Los sub-agentes producen luego un informe único de alta calidad.
Gracias a su velocidad y asequibilidad, 3.5 Flash Cyber puede integrarse fácilmente en escaneos frecuentes, procesos de lanzamiento sensibles al tiempo o pipelines de escaneo de commits a escala.
¿Qué resultados ofrece 3.5 Flash Cyber frente a otros modelos?
Probamos 3.5 Flash Cyber en una variedad de benchmarks. En particular, lo evaluamos en el benchmark CyberGym, que mide agentes de IA contra cientos de vulnerabilidades de software del mundo real. Aprovechando el bajo costo de 3.5 Flash Cyber al configurar CodeMender para llamar al modelo hasta cinco veces para un informe final, el agente alcanzó un rendimiento competitivo frente a modelos significativamente más grandes en CyberGym*.
*Los resultados de la competencia provienen de puntajes reportados por los propios proveedores.
También sometimos al modelo a pruebas de estrés más allá de CyberGym sin restricciones de seguridad. El equipo de Google Big Sleep construyó de forma independiente una evaluación enfocada en encontrar vulnerabilidades críticas y difíciles de detectar en algunos de los códigos más complejos del mundo, como Chrome y Safari. Aquí, 3.5 Flash Cyber superó significativamente a los modelos 3.5 Flash y 3.6 Flash principales.
Tasa de éxito en la evaluación Big Sleep (pass@1)
3.5 Flash Cyber también fue evaluado en el pipeline de escaneo de commits de producción de Google Chrome. Las vulnerabilidades no fueron reveladas públicamente, lo que aseguró que este benchmark permaneciera libre de contaminación para Gemini y los modelos de la competencia.
Los resultados mostraron un aumento significativo de 3.5 Flash Cyber en comparación con 3.5 Flash. Nota: Versiones de modelos de la competencia más recientes después de Opus 4.6 se niegan a cumplir las tareas debido a medidas de seguridad integradas y, por lo tanto, no se muestran.
Tasa de éxito en el pipeline de escaneo de commits de Chrome
Además, 3.5 Flash Cyber descubrió consistentemente más vulnerabilidades únicas en comparación con 3.5 Flash y Claude Opus 4.6. Al probarse en el complejo motor V8 JavaScript con un número fijo de invocaciones, 3.5 Flash Cyber encontró 55 problemas confirmados únicos, frente a 47 de 3.5 Flash y 36 de Opus 4.6, incluyendo 10 problemas que los otros dos modelos no detectaron.
Los modelos de ciberseguridad básicos pueden quedar atrapados en un bucle, encontrando el mismo problema repetidamente mientras pasan por alto vulnerabilidades críticas. Un modelo fuerte lanza una red más amplia, encontrando un mayor número de problemas únicos.
A medida que escalamos el número de invocaciones, encontramos que 3.5 Flash Cyber continúa descubriendo nuevas rutas de código y vulnerabilidades.
Aplicación en el mundo real y escalado de defensas en Google
Los benchmarks son solo una parte de la historia. 3.5 Flash Cyber en CodeMender ya está encontrando y corrigiendo vulnerabilidades en las bases de código internas de Google, incluyendo Chrome, Android, Cloud, Ads y YouTube.
La velocidad de descubrimiento posible gracias a un modelo ligero ha tenido un impacto medible.
Por ejemplo, el equipo de Investigación de Vulnerabilidades en la Nube de Google utilizó 3.5 Flash Cyber para asegurar proactivamente nuestros sistemas en tiempo récord. En solo 2 horas, el modelo descubrió vulnerabilidades de ejecución remota de código en APIs públicas y encontró una vulnerabilidad de corrupción de memoria en un servicio de producción sensible. Luego generó un exploit de ejecución remota de código 100% fiable que evitó técnicas de mitigación estándar como la Aleatorización del Diseño del Espacio de Direcciones (ASLR) y Write XOR Execute (W^X).
La retroalimentación temprana de probadores de Wiz y de Ingeniería de Seguridad de Cloud CISO confirma la mejora significativa en la capacidad de 3.5 Flash Cyber sobre el modelo 3.5 Flash estándar.
Empoderando a los defensores a escala
El liderazgo de Google en seguridad de software nos da una ventaja única. Por ejemplo, OSV.dev, una base de datos de vulnerabilidades gestionada por Google que abarca más de 700,000 vulnerabilidades de código abierto, y más de 10 años de resultados de OSS-Fuzz, nos ayudan a identificar las vulnerabilidades de mayor calidad.
Esto nos permite ir más allá de los ejemplos sintéticos de ciberseguridad y enseñar a nuestros modelos cómo trabajan los profesionales de seguridad reales. Nuestros modelos aprenden a operar herramientas estándar de la industria, leer millones de líneas de código en proyectos a gran escala como Chromium y abordar de forma independiente tareas de seguridad complejas que requieren horas de análisis profundo y continuo.
Al potenciar CodeMender con 3.5 Flash Cyber, estamos proporcionando una arquitectura altamente capaz, escalable y asequible diseñada para ayudar a más defensores a asegurar el software.
Vía Google DeepMind.




