
Gemini navega el video y recorta hasta 88% de los tokens
Google habilitó el modo agéntico de comprensión de video en sus modelos Flash: en vez de tragarse la línea de tiempo completa a un cuadro por segundo, el modelo decide qué mirar.
4 notas publicadas

La nueva función agéntica deja que el modelo decida qué tramos del video revisar, en vez de ingerir el archivo completo, y baja los costos hasta 66% según Google.

La nueva versión del modelo de video de ByteDance permite generar secuencias de 30 segundos con audio sincronizado y soporte para múltiples referencias visuales.

Google añade a la familia Nano Banana un modelo económico enfocado en pipelines de alto throughput y estrena Gemini Omni Flash para generar y editar video de hasta 10 segundos vía API.
Otros temas que aparecen junto a #video ia en nuestra cobertura editorial.