Qwen liberó Qwen3.8-Omni-Flash, el primer modelo multimodal de la casa pensado para agentes. Procesa audio y video en conjunto, saca conclusiones de lo que ve y escucha, y usa herramientas por su cuenta para editar vlogs, traducir clips cortos o resumir películas. La ventana de contexto llega a un millón de tokens. El lanzamiento lo cubrió Matthias Bastian en The Decoder el 19 de septiembre de 2026.

¿Cuánto cuesta usarlo por API?

El precio quedó en 0,15 dólares por millón de tokens de entrada y 0,47 dólares por millón de tokens de salida. Qwen estima que una hora de audio de entrada sale por menos de 0,01 dólar, y que el video 720p con audio a un cuadro por segundo ronda los 0,20 dólares, sin contar el costo de la respuesta.

Gemini 3.8 Flash, el modelo con el que Qwen se compara, cobra 0,75 dólares por millón de tokens de entrada y 3,75 dólares por millón de salida en su tarifa de lanzamiento. Google tiene programado duplicar esos valores el 1 de enero de 2027.

ModeloEntrada (USD por millón de tokens)Salida (USD por millón de tokens)
Qwen3.8-Omni-Flash0,150,47
Gemini 3.8 Flash, tarifa de lanzamiento0,753,75

La comparación con Gemini Flash

En las tareas de audio y video, Qwen sostiene que su modelo queda a la par de Gemini 3.8 Flash. La afirmación sale de la tabla de resultados que publicó la propia empresa junto al anuncio, no de una medición independiente.

¿Dónde se puede usar?

El modelo está disponible en Qwen Studio, en Qwen Cloud y por API. Los Qwen-MM-Plugins, de código abierto, agregan edición de video, reconocimiento de hablante, notas en PDF a partir de un video y flujos de trabajo reutilizables. Esos complementos funcionan sobre agentes como Claude Code, Gemini CLI y Qwen Code. El Qwen-Live Harness habilita la interacción en tiempo real con cámara y micrófono.