El video ha sido la modalidad más cara de razonar. Hasta ahora, un modelo Gemini al que se le entregaba una clase de 90 minutos ingería la grabación entera a una tasa fija de un cuadro por segundo, sin importar si la pregunta era "resume esto" o "¿en qué minuto el expositor pasa a la lámina de precios?". Ese diseño de pasada única obliga a una mala disyuntiva: pagar por la línea de tiempo completa dentro del contexto, o cortar el video en trozos por adelantado y arriesgarse a perder justo el detalle que importaba.
Esta semana Google habilitó la comprensión agéntica de video en toda su familia de modelos Flash. En vez de ingerir la línea de tiempo, Gemini la navega: decide qué mirar, a qué tasa de cuadros y a través de qué modalidad. Google reporta hasta 88% menos tokens, hasta 66% menos costo y hasta 7% más precisión en los benchmarks estándar de video.
¿Se puede usar hoy?
Sí, pero solo como una función alojada en la nube. No hay pesos abiertos ni nada que se pueda autohospedar. Se distribuye a través de la API de Gemini en Google AI Studio y de la Gemini Enterprise Agent Platform, funciona tanto con archivos subidos como con enlaces públicos de YouTube, y se cobra al precio estándar por tokens de la API, sin cargo adicional por la función.
¿Qué cambió exactamente?
El procesamiento estático, que sigue siendo el modo por omisión en todos los modelos Gemini, extrae cuadros a 1 FPS en una sola pasada, procesa el audio a 1 Kbps en un canal e inserta marcas de tiempo cada segundo. El procesamiento agéntico reemplaza eso por un ciclo: el modelo combina su propio razonamiento con herramientas nativas de video para buscar, recorrer e inspeccionar segmentos específicos entre cuadros, audio y transcripciones, cargando únicamente lo que la consulta requiere.
| Procesamiento estático | Procesamiento agéntico | |
|---|---|---|
| Recorrido del video | una pasada completa | ciclo dirigido por el modelo |
| Cuadros | fijos a 1 FPS | tasa variable, según la consulta |
| Audio | 1 Kbps, canal único | bajo demanda |
| Costo en tokens | toda la línea de tiempo | hasta 88% menos |
| Mejor para | clips de menos de 5 minutos | grabaciones largas |
Un desarrollador ya podía armar ese ciclo a mano. Lo que cambia es que ahora Gemini lo ejecuta internamente, y ahí es donde desaparece el trabajo de plomería.
En las evaluaciones de Google, Gemini 3.7 Flash con comprensión agéntica queda en la frontera de Pareto entre precisión y costo para análisis de video, entre los modelos probados. Las ganancias de eficiencia se concentran en el contenido largo, desde guías de 10 minutos hasta grabaciones de varias horas.
Qué devuelve la API
El procesamiento agéntico agrega dos tipos de paso al arreglo steps de la respuesta: un processing_call cuando el modelo pide un segmento o una transcripción, y un processing_result cuando esa carga se completa. Se intercalan con los pasos thought y anteceden a model_output, así que sirven para alimentar una traza de progreso en vivo en la interfaz. Su presencia es, además, la forma de verificar que el modo agéntico efectivamente se ejecutó.
La contabilidad de tokens se divide en consecuencia. El razonamiento de navegación se cobra como tokens de pensamiento (total_thought_tokens), mientras que los cuadros, el audio y las transcripciones cargados bajo demanda se cobran como tokens de uso de herramientas (total_tool_use_tokens).
Activarlo es un solo campo en la parte de video:
interaction = client.interactions.create(
model="gemini-3.7-flash",
input=[
{
"type": "video",
"uri": "https://youtu.be/7Z5Vy9JBANs",
"processing": "agentic"
},
{
"type": "text",
"text": "What are the 3 most important announcements in this keynote?",
},
],
)También se pueden mezclar los modos por video dentro de una misma petición: agéntico para la clase larga, estático para el clip corto.
Puntos clave
- El modo agéntico permite que Gemini recorra la línea de tiempo en lugar de ingerirla a 1 FPS fijo.
- Google reporta hasta 88% menos tokens, 66% menos costo y 7% más precisión en los benchmarks de video.
- Está soportado en Gemini 3.8, 3.7 y 3.6 Flash, y en 3.5 Flash-Lite; se activa con un solo campo
processing. - El modo estático sigue siendo mejor para clips de menos de cinco minutos y para trabajo de precisión cuadro a cuadro.
- Rige el precio estándar de la API, pero el razonamiento de navegación se factura como tokens de pensamiento.
Más antecedentes en el blog de Google, la documentación de comprensión de video de la API de Gemini, la guía para desarrolladores en AI Studio y el anuncio de visión agéntica.




