Google liberó Gemini Omni 1.1 Flash (gemini-omni-1.1-flash), una actualización de producción para su modelo multimodal nativo de generación y edición de video. El cambio mueve a Omni desde un generador capaz hacia uno dirigible: la extensión de escena ahora lee hasta 10 segundos de contexto previo en vez de un único cuadro final, se pueden fijar el primer y el último fotograma para controlar el movimiento de cámara, los borradores se renderizan en 360p a un tercio del costo de 720p, los finales se escalan a 4K y los clips de video pueden pasarse como referencia para mantener la consistencia de un personaje.
Gemini Omni Flash se apoya en tres propiedades que Google distingue de los modelos de video anteriores: multimodalidad nativa (texto, imagen, audio y video procesados en conjunto), edición conversacional a través de la Interactions API y el conocimiento del mundo heredado de Gemini. La edición mantiene estado: se pasa un previous_interaction_id y el modelo aplica el cambio pedido preservando lo que no se mencionó, sin volver a subir el video anterior.
¿Dónde se puede usar hoy?

Está disponible a través de la Gemini API en Google AI Studio y en la Gemini Enterprise Agent Platform. Google nombra a Adobe, Figma Weave, GMI Cloud y Runway como clientes que ya lo corren en producción. El modelo también está activo en Google Flow para suscriptores AI Plus, Pro y Ultra, con extensión de escena en la aplicación de Gemini.
¿Qué cambia realmente en la extensión de escena?
Omni 1.1 analiza hasta 10 segundos de contexto previo al continuar un clip. Google afirma que los modelos anteriores solo tomaban como referencia el último segundo. Las extensiones corren en incrementos de 10 segundos hasta un acumulado de 40 segundos, y el modelo genera una continuación de 3 a 10 segundos por llamada. Algunos de los cuadros finales de la entrada se editan para que la costura entre segmentos quede continua.
Las restricciones son específicas. La extensión solo agrega al final de un clip: no hay prefijo ni inserción en medio. Los videos de entrada subidos deben durar 10 segundos o menos, salvo que se esté extendiendo un video generado por el propio modelo en modo multiturno. Tampoco se puede agregar diálogo nuevo al extender un video subido donde alguien está hablando, aunque el diálogo hablado sí se admite en la extensión multiturno vía previous_interaction_id.
Fotogramas clave y referencias de video
Ahora se puede entregar un primer y un último fotograma y hacer que el modelo genere el video continuo entre ambos, que es el mecanismo detrás de órbitas, dolly zooms y bucles sin corte visible. Las instrucciones asocian cada medio con su rol mediante etiquetas: <FIRST_FRAME>, <LAST_FRAME>, <IMAGE_REF_N> y <VIDEO_REF_N>.
Las referencias de video aceptan un máximo de tres clips de hasta tres segundos cada uno y funcionan mejor para mantener parecidos físicos. El audio dentro de una referencia de video se ignora. El razonamiento a través de múltiples videos no está soportado y puede degradar el resultado.
¿Cómo se controla el costo?
El parámetro resolution dentro de response_format acepta 360p, 720p (por defecto), 1080p y 4k, con las dos últimas obtenidas por escalado. Google reporta que las vistas previas en 360p se generan hasta un 60% más rápido y a un tercio del costo de 720p, medido sobre el rendimiento del sistema. Eso convierte el ciclo de borrador y escalado en el patrón de producción previsto: iterar barato, renderizar una sola vez.
Precios, procedencia y límites
| Concepto | Precio |
|---|---|
| Entrada (texto, imagen, video, audio) | 1,50 dólares por millón de tokens |
| Salida de texto | 9,00 dólares por millón de tokens |
| Salida de video | 17,50 dólares por millón de tokens |
| Facturación de video a 720p | 5.792 tokens por segundo |
| Costo efectivo | cerca de 0,10 dólares por segundo |
Cada video generado lleva marca de agua SynthID, invisible para el espectador pero detectable de forma programática para trazar procedencia.
Las carencias también son concretas: no hay instrucciones de sistema, ni temperatura, ni top_p, ni secuencias de detención, ni instrucciones negativas (las negaciones van dentro del texto de la instrucción). La edición de voz no está soportada y las referencias de audio tampoco. Las URL de YouTube no pueden usarse como fuente. El inglés está plenamente soportado y los demás idiomas quedan sin evaluar. Para salidas de más de 4 MB hay que usar delivery="uri" y consultar la Files API hasta que el archivo quede en estado ACTIVE.
¿Qué implica el detalle del idioma?
Ese "los demás idiomas quedan sin evaluar" merece subrayarse desde América Latina. No significa que el modelo no responda en español, significa que Google no publica métricas de calidad para instrucciones en español ni para diálogo hablado en español. Para un equipo de producción audiovisual en Chile que evalúe el costo de aproximadamente 0,10 dólares por segundo, eso implica presupuestar una etapa de prueba propia antes de comprometer una entrega. A ese precio, un minuto de video terminado en 720p sale cerca de 6 dólares antes de iteraciones, y el ciclo de borrador en 360p existe justamente para que las iteraciones no multipliquen esa cifra.
Puntos clave
- La extensión de escena lee 10 segundos de contexto previo, frente al último segundo de los modelos anteriores, y acumula hasta 40 segundos.
- La interpolación entre primer y último fotograma, más las etiquetas de referencia de video, dan control de cámara y de personaje a nivel de toma.
- Los borradores en 360p corren hasta 60% más rápido a un tercio del costo de 720p; 1080p y 4K son salidas escaladas.
- Solo hay nivel de pago: cerca de 0,10 dólares por segundo de video en 720p, sin capa gratuita ni rendimiento aprovisionado.




