Google sumó análisis de video basado en agentes a varios modelos Gemini. En vez de recorrer el material cuadro por cuadro a una tasa fija, el modelo busca por su cuenta los tramos relevantes, algo que según la compañía recorta el consumo de tokens y el costo por un margen amplio.
Los modelos más recientes, Gemini 3.7 Flash, 3.6 Flash y 3.5 Flash-Lite, pueden capturar momentos de menos de un segundo, incluidos cambios de estado o cortes que se escapaban al procesar una imagen por segundo. Google sostiene que esto vuelve mucho más preciso el trabajo de edición automatizada de video.
El sistema también puede rastrear escenas individuales dentro de horas de grabación sin quemar millones de tokens. Detecta anomalías volviendo a muestrear las ventanas de tiempo sospechosas a una tasa de cuadros más alta, y cuenta con exactitud movimientos repetidos y objetos individuales a lo largo del tiempo.
¿Cuánto ahorra realmente el modo agéntico?
En las pruebas 1H-VideoQA y LVBench, el consumo de tokens cae 88% mientras la precisión sube levemente. Google agrega una reducción de 66% en el costo por consulta.
Hasta ahora Gemini dependía de un procesamiento estático: muestreaba el video a una tasa fija de un cuadro por segundo por defecto, ajustable a través de la API. Desde que el análisis nativo de video se lanzó en 2025, Gemini venía transcribiendo la pista de audio y analizando los cuadros segundo a segundo.
| Procesamiento | Cómo recorre el video | Costo relativo |
|---|---|---|
| Estático (hasta ahora) | 1 cuadro por segundo, tasa fija en toda la duración | Referencia |
| Agéntico (nuevo) | El modelo elige tramos, tasa y modalidad | Hasta 88% menos tokens, 66% menos costo |
¿Cómo decide el modelo qué mirar?
Según Google, la variante agéntica conecta el razonamiento del modelo directamente con las herramientas nativas de video. El modelo decide por su cuenta qué secciones revisar, a qué velocidad y por cuál modalidad, ya sea cuadros, audio o transcripción. Solo extrae los momentos y las señales que necesita para la tarea que tiene entre manos.
Gemini usa ahora una herramienta interna para tomar únicamente la porción relevante del archivo de video. Los desarrolladores podían construir este enfoque selectivo a mano antes, pero ahora el modelo lo resuelve solo: en lugar de cargar el video a una tasa fija, ocupa un bucle para recuperar de forma selectiva cuadros, audio o transcripciones de las secciones que hacen falta.
El enfoque se apoya en la agentic vision que Google liberó para Gemini 3 Flash en enero. Esa función permitía al modelo escribir y ejecutar código Python para hacer zoom, recortar y anotar imágenes, revisando cada resultado en un ciclo de pensar, actuar y observar antes de responder. No funcionaba de forma automática en todos los casos al momento del lanzamiento, pero la base ya estaba puesta. Cuando la compañía anunció Gemini 3 Flash en diciembre, ya había marcado el razonamiento visual y espacial sobre video como una capacidad en camino.
Dónde se nota la diferencia
Las ganancias de eficiencia aparecen sobre todo en videos largos, desde tutoriales de 10 minutos hasta clases de 90 minutos y grabaciones de varias horas. Con procesamiento estático, quien desarrollaba tenía que elegir entre un costo alto en tokens o métodos que descartaban detalles importantes.
En los propios benchmarks de Google, entre ellos LongVideoBench, Gemini 3.7 Flash con análisis agéntico obtiene la mejor calidad general y la mejor combinación de precisión y eficiencia de costos. En la evaluación 1H-VideoQA de la compañía, ese mismo modelo alcanza la precisión más alta al menor costo por consulta.
¿Cuándo y a qué precio se puede usar?
La función ya está disponible para videos subidos y para videos de YouTube a través de la API de Gemini, en Google AI Studio y en la Gemini Enterprise Agent Platform. Quien desarrolla debe fijar el modo de procesamiento en agentic dentro de la configuración de la API y paga las tarifas estándar de tokens, sin recargo adicional. Los detalles están en la guía para desarrolladores.
Para equipos en Chile y el resto de LatAm, donde el análisis de video largo suele descartarse por presupuesto antes que por capacidad técnica, la aritmética cambia: revisar una grabación de cámara de seguridad de varias horas deja de costar millones de tokens y pasa a un rango en el que un piloto interno se vuelve defendible.
Google también planea llevar estas mejoras a sus propios productos. La función debería llegar pronto a todos los usuarios de la aplicación Gemini en dispositivos con Flash y Flash Lite. En los próximos meses, el análisis de video agéntico va a alimentar además la función "Ask YouTube" en la página de reproducción, con respuestas más pegadas a lo que efectivamente se ve en el video.




