Alibaba tiene un nuevo modelo de texto a voz al frente de la competencia. Qwen-Audio-3.0-TTS-Plus lidera la tabla de voces de proveedor en la Speech Arena de Artificial Analysis, la clasificación que compara la calidad de los sistemas de síntesis de voz mediante votos comparativos.

¿Qué modelo lidera el ranking de texto a voz?

Con una puntuación de 1.236 Elo, el modelo de Alibaba se ubica apenas por delante de Simba 3.2, de SpeechifyAI, que suma 1.234, una diferencia de solo dos puntos. Más atrás aparecen Gemini 3.1 Flash TTS y Sonic 3.5.

ModeloPuntos Elo
Qwen-Audio-3.0-TTS-Plus1.236
Simba 3.21.234
Gemini 3.1 Flash TTS1.214
Sonic 3.51.207

Dos versiones y 16 idiomas

El modelo llega en dos variantes. Flash está pensada para interacción en tiempo real, con cerca de 300 milisegundos de latencia, mientras que Plus apunta a la máxima calidad de salida de voz. El sistema admite 16 idiomas, entre ellos algunos poco cubiertos como tagalo, malayo, tailandés y vietnamita, además de varios dialectos chinos.

Los usuarios pueden dirigir el estilo de habla con lenguaje natural o agregar señales no verbales mediante etiquetas de emoción, como enojo o risa. Alibaba también afirma que el modelo maneja mejor que versiones anteriores las grabaciones de referencia con ruido o eco cuando clona voces.

¿Cuál es su punto débil?

La velocidad. A 16 caracteres por segundo, Qwen-Audio-3.0-TTS-Plus queda muy por detrás de Sonic 3.5 (120) y de Simba 3.2 (30,2). En síntesis de voz, esa diferencia se traduce en cuánto tarda el sistema en generar el audio final, un factor decisivo para asistentes conversacionales que responden en vivo.

ModeloVelocidad (caracteres por segundo)
Sonic 3.5120
Simba 3.230,2
Qwen-Audio-3.0-TTS-Plus16

Precio y disponibilidad

El precio queda en 27,60 dólares por millón de caracteres a través de Alibaba Cloud Model Studio. Al tipo de cambio actual son cerca de 26.000 pesos chilenos por millón de caracteres, un costo relevante para quien evalúe integrar voz sintética en un producto de habla hispana. La compañía publicó una colección de muestras de audio para escuchar el resultado.