El equipo Qwen de Alibaba liberó Qwen3.8-Omni-Flash y lo describe como su primer modelo omnimodal construido alrededor de capacidades agénticas. Acepta texto, imágenes, audio y video, y devuelve texto. La comprensión de audio y video, el razonamiento y el uso de herramientas viven dentro del mismo modelo. El flujo declarado es simple. Entender el contenido, planificar la tarea, ejecutarla con herramientas y entregar el resultado.

Se puede usar hoy como API alojada. Está disponible en QwenCloud, en Alibaba Cloud Model Studio y en Qwen Studio. No se anunciaron pesos abiertos en el lanzamiento, así que levantarlo en infraestructura propia queda descartado.

¿Qué trae por dentro?

Qwen3.8-Omni-Flash está construido sobre la arquitectura Qwen3.8-Flash-Next, el modelo base que salió con pesos abiertos en agosto de 2026.

La ventana de contexto es de 1 millón de tokens. QwenCloud lista un máximo de 991.000 tokens de entrada y 131.000 de salida. El largo máximo de razonamiento llega a 262.000 tokens.

La salida es solo texto. Cuando el desarrollador necesita voz generada, la documentación de Model Studio lo manda a Qwen3.5-Omni. El razonamiento viene activado por defecto, con reasoning_effort en xhigh, y se apaga poniendo ese parámetro en none.

La API sigue tanto el protocolo DashScope como el de OpenAI, y funciona con Chat Completions y con la Responses API. Están soportados el llamado a funciones, la búsqueda web, las salidas estructuradas, el caché de contexto y las llamadas por lote.

Percepción agéntica para video largo

La mayoría de los modelos de video leen un archivo largo de principio a fin. Eso se mantiene aunque la respuesta esté en 3 minutos de metraje.

El equipo de investigación de Qwen describe otro camino. El agente parte de la pregunta, decide qué mirar y qué escuchar, y después junta evidencia en varias rondas que van de lo grueso a lo fino. El cómputo y los tokens se van a los segmentos que importan.

El resultado lo reportan sobre OmniVideoBench. La precisión sube de 63,4 a 67,8. El uso de tokens baja de 145.736 a 79.117, alrededor de 45,7% menos.

¿Qué dicen los benchmarks?

Todas las cifras de esta sección vienen de Qwen. No había resultados independientes al momento de la publicación.

  • En 29 evaluaciones, el puntaje promedio mejora más de 25% respecto de Qwen3.5-Omni-Plus.
  • WildClawBench-MM mejora 36,5 puntos. AgenticVBench mejora 22,3 puntos.
  • UniClawBench llega a 69,6.
  • LongAudioSpan gana 8,3 puntos. OmniVideoBench gana 9,6 puntos.
  • OmniCap-IF mejora 8,5 puntos en CSR y 14,1 en ISR.

El equipo de investigación afirma que el desempeño audiovisual queda cerca de Gemini 3.8 Flash, y que el desempeño general en audio supera a ese mismo modelo. La publicación en X resume la ganancia agéntica en +19,5 puntos promedio entre WildClawBench-MM y UniClawBench.

Precios y límites de entrada

QwenCloud lista 0,15 dólares por cada millón de tokens de entrada y 0,47 dólares por millón de salida. Los aciertos de caché implícito cuestan 0,016 dólares por millón.

El equipo reporta recortes grandes de costo frente a Qwen3.5-Omni-Plus. La entrada de audio cuesta más de 98% menos por hora y la entrada audiovisual más de 93% menos por hora. La publicación en X pone la baja de la entrada de video en torno a 89%.

Los límites principales salen de la documentación de Model Studio.

  • Archivos de video de hasta 2 horas y 2 GB por URL.
  • Archivos de audio de hasta 3 horas.
  • Entrada de audio en 113 idiomas y dialectos.
  • Resultados estables con video muestreado hasta 15 fps.
  • Estéreo de dos canales y audio espacial FOA de cuatro canales mediante use_multichannel.
  • Disponibilidad en 6 regiones, que son Beijing, Singapur, Hong Kong, Tokio, Frankfurt y Virginia.

Llamarlo toma unas pocas líneas con el SDK de OpenAI.

Python
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DASHSCOPE_API_KEY"],
    base_url=os.environ["DASHSCOPE_BASE_URL"],
)
completion = client.chat.completions.create(
    model="qwen3.8-omni-flash",
    messages=[{"role": "user", "content": [
        {"type": "video_url", "video_url": {"url": os.environ["VIDEO_URL"]}},
        {"type": "text", "text": "List the key moments with timestamps."},
    ]}],
    modalities=["text"],
    stream=True,
)
for chunk in completion:
    if chunk.choices and chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="")

Los complementos abiertos

El modelo devuelve texto, así que el trabajo con los archivos lo hacen las herramientas. Para sostener eso, Qwen está liberando 2 proyectos.

Qwen-MM-Plugins ya está publicado bajo Apache-2.0, con la promesa de volver multimodal nativo a cualquier entorno de agentes. Cada capacidad se instala como una habilidad más un servidor MCP opcional. El instalador guiado soporta Claude Code, CodeBuddy, Codex, Qoder, OpenClaw, Qwen Code y Gemini CLI.

Las capacidades Omni calzan con las demostraciones del lanzamiento. omni-memory construye una memoria audiovisual de un video largo. omni-video2note convierte un video tutorial en un PDF ilustrado. omni-chatcut cubre el paso de música a videoclip, el comentario de películas y la traducción de video preservando la voz de cada hablante.

Un complemento core permite que el modelo principal lea imágenes locales y cuadros de video de manera nativa. El README anota un hueco actual. La mayoría de los entornos todavía no puede entregarle audio de forma nativa al modelo principal, así que por ahora el audio se enruta por la API.