Alibaba Cloud lanzó Qwen Image 2.1, un modelo liviano de generación de imágenes con apenas 7.000 millones de parámetros. Es un modelo de pesos abiertos que corre incluso en tarjetas gráficas de consumo con algunos años encima, como la RTX 3090, según informó Tom's Hardware. Sus desarrolladores aseguran que rinde más que varios modelos cerrados, entre ellos Nano Banana 2.0 de Google.

Esa comparación sale del benchmark interno de Alibaba, así que falta ver pruebas independientes antes de darla por buena. Los primeros reportes, eso sí, describen un modelo capaz, con soporte nativo de transparencia y la opción de componer una imagen a partir de varias imágenes de referencia.

El punto que generó más ruido es el cambio de licencia. A diferencia de la versión anterior, Qwen Image 2.1 prohíbe de forma explícita la reventa comercial del modelo, y quien quiera usarlo con ese fin tiene que conseguir una licencia aparte directamente con el desarrollador.

¿Qué trae de nuevo Qwen Image 2.1?

El modelo suma funciones pensadas para competir con las alternativas establecidas. Genera imágenes con fondo transparente de forma nativa, algo útil para artistas que integran la IA dentro de otro trabajo o para productos impresos bajo demanda, como stickers.

También mejora la edición, con hasta 10 imágenes de referencia. Uno de los ejemplos que cita el equipo de Qwen es tomar la foto de una persona, darle al modelo imágenes de prendas de ropa y obtener una composición de esa persona vestida con ellas. El equipo promete consistencia entre imágenes, conservando la apariencia de personas y productos.

Lo que más lo distingue es el tamaño. Su componente de generación visual tiene 7B parámetros, lo que lo pone entre los modelos más livianos de su tipo. En las comparaciones del propio Alibaba, el único con menos parámetros es LongCat-Image, de Meituan, con 6.000 millones. La mayoría de los demás modelos son varias veces más grandes o directamente cerrados.

¿Cómo se compara con los modelos cerrados?

Los desarrolladores de Qwen Image 2.1 dicen que compite de igual a igual con esos modelos cerrados. En el Qwen Image Benchmark, su prueba interna, obtuvo 60,2 puntos.

ModeloQwen Image BenchmarkAI Arena
GPT Image 2.5 Sunburst (OpenAI)671.423
Muse Image62,341.276
Qwen Image 2.1 (Alibaba)60,21.228
Nano Banana 2.0 (Google)59,821.260

Las pruebas preliminares de AI Arena sugieren que en condiciones menos favorables no llega tan lejos, aunque queda cerca. Ahí sacó 1.228 puntos, contra 1.260 de Nano Banana 2. Muse Image está unos puestos más arriba, con 1.276, y el modelo Sunburst de OpenAI encabeza la tabla con 1.423.

En edición de imágenes, AI Arena lo ubica como el mejor de los modelos de pesos abiertos. Según su publicación del 22 de septiembre, Qwen Image 2.1 llegó al primer lugar entre los modelos abiertos tanto en Image Edit Arena como en Text-to-Image Arena. En Image Edit Arena sumó 1.367 puntos y quedó 16° en la tabla general, a 3 puntos de GPT-Image-1.5-high-fidelity, que está 15°.

Son resultados tempranos y hacen falta más pruebas para confirmar o refutar lo que dice el equipo de Qwen, aunque por ahora parecen calzar bastante con la realidad. No se sabe cuántos parámetros usan los modelos propietarios para lograr sus puntajes más altos, y Qwen Image 2.1 les pisa los talones con pesos modestos.

¿Qué hardware necesita para correr en local?

Los primeros usuarios reportan que corre sin problemas en tarjetas de consumo. Vunderba, usuario del foro Hacker News y desarrollador del sitio GenAI Showdown, contó que convirtió una imagen de 1 megapíxel con Qwen Image 2.1 en unos cinco segundos en una RTX 4090.

En el subreddit de Stable Diffusion, el usuario cgs019283 dijo que genera imágenes de 1 megapíxel en unos 25 segundos con tarjetas Nvidia de la serie 50, como la RTX 5070 y la 5080. Advirtió que el tiempo sube bastante al usar muchas imágenes de referencia, y que en sus pruebas la edición fue la función más lenta.

Otros lo usan en equipos más viejos y modestos. Un usuario asegura que genera imágenes en resolución 2K en unos 50 segundos con una RTX 3060 y 64 GB de memoria. Otro, con una RTX 6000 Pro, saca imágenes de 1024 x 1024 en pocos segundos.

Instalar y usar IA local sigue estando lejos de la comodidad de las plataformas en la nube, como Nano Banana de Google o los modelos GPT Image de OpenAI. Si el conjunto de funciones aguanta pruebas más rigurosas, Qwen Image 2.1 es una opción para quien quiera generar imágenes rápido y con buena calidad en su propio equipo, con control total y sin cuentas ni suscripciones en la nube.

El problema de la licencia

Entre los comentarios de los primeros usuarios, el tema que más se repite es cómo el equipo maneja la licencia. El texto resulta ambiguo.

"Se le otorga una licencia limitada, no exclusiva, mundial, intransferible y libre de regalías, bajo nuestra propiedad intelectual u otros derechos de nuestra propiedad incorporados en los Materiales, para usar, reproducir, distribuir, copiar, crear obras derivadas y modificar los Materiales SOLO PARA FINES NO COMERCIALES."

Luego agrega que quien quiera usar esos "Materiales" con fines comerciales tiene que obtener una licencia del equipo de Qwen específica para ese uso. La inquietud en la comunidad fue tal que el equipo publicó una aclaración en X el 21 de septiembre.

"Recibimos mucho cariño por Qwen-Image-2.1 en las últimas 24 horas, ¡gracias! También nos llegaron muchas preguntas sobre la licencia, sobre todo respecto de lo que genera el modelo. Esta es la respuesta. Los resultados no forman parte de los Materiales licenciados. Los usuarios conservan los derechos sobre las imágenes y otros..."

Con eso el punto queda en buena parte resuelto. Lo que se genere con el modelo no cuenta como material licenciado, así que esa cláusula no debería alcanzarlo.

Lo que sí implica es que el modelo en sí no se puede revender sin una licencia de Alibaba. Es un cambio grande frente a la licencia Apache del Qwen Image original, y estira la definición de pesos abiertos. Para la mayoría de los usuarios no cambia nada. Qwen Image 2.1 se puede correr en un equipo propio y las imágenes generadas se pueden usar como uno quiera.