Los agentes de voz fallan justo en las partes de una llamada que más importan: el número de pedido, los dígitos de devolución de llamada, la dirección de correo que el interlocutor tiene que anotar. Gradium AI liberó un nuevo modelo de texto a voz y lo dejó activo por defecto en toda su API y su estudio.
La compañía reporta una tasa de aprobación evaluada por humanos de 81,0% sobre un conjunto de 500 oraciones de casos difíciles en cinco idiomas, por delante de Cartesia Sonic 3.6 (75,1%) y de ElevenLabs v3 Conversational (65,4%). El tiempo hasta el primer audio es de 216 milisegundos en la mediana medida por Coval, 170 milisegundos más rápido que el modelo al que reemplaza.
¿Se puede usar hoy?
Sí, y sin migración. Gradium activó el modelo como opción por defecto en su API y en Studio el 31 de agosto de 2026. Las voces existentes, incluidos los clones personalizados, siguen funcionando sin cambios.
¿Qué mide la cifra de precisión?
Gradium construyó un conjunto de evaluación de 500 oraciones y lo liberó como código abierto en Hugging Face bajo licencia CC BY 4.0: 100 ítems distribuidos en 10 criterios y cinco idiomas, entre ellos el español, además de inglés, alemán, francés y portugués.
Siete criterios atómicos cubren deletreo, siglas, cadenas alfanuméricas, fechas, números regulares, números grandes y decimales, y correos electrónicos. Los otros tres criterios compuestos, llamados Pedidos, Ticket de TI y Reclamos, apilan varios de esos elementos dentro de un mismo turno realista de conversación.
La evaluación es humana y estricta. Una oración aprueba solo si un evaluador hablante nativo e independiente escucha cada elemento pronunciado de manera correcta y completa: un solo dígito omitido reprueba la oración entera. El audio fue normalizado en volumen, el orden se aleatorizó y se limitó a los evaluadores a 40 comparaciones con una pausa obligatoria.
Agrupados los diez criterios y promediados los cinco idiomas con igual peso, el ranking queda así:
| Modelo | Tasa de aprobación |
|---|---|
| Gradium TTS | 81,0% |
| Cartesia Sonic 3.6 | 75,1% |
| ElevenLabs v3 Conversational | 65,4% |
| Fish Audio S2.1 Pro | 49,5% |
| Inworld TTS 1.5 Max | 46,5% |
Todos los audios fueron generados en agosto de 2026 con la configuración por defecto de cada servicio.
¿Qué dice la cifra de latencia?
En la prueba de referencia de TTS de Coval, Gradium reporta 216 milisegundos de mediana hasta el primer audio, 170 milisegundos menos que el modelo anterior. Pero la cifra más útil no es la mediana sino la dispersión: un rango intercuartílico de apenas 30 milisegundos a lo largo de 480 corridas, el más estrecho de los cinco modelos evaluados.
Cartesia Sonic 3.6, en comparación, se ubica en 454 milisegundos de mediana con una dispersión de 165 milisegundos, equivalente al 36% de su propia mediana. La distinción importa porque quien llama por teléfono no experimenta la mediana, experimenta los turnos de la cola de la distribución.
Gradium tampoco es el modelo más rápido de esa tabla. Inworld TTS 2 marca 166 milisegundos de mediana, mientras que Fish Audio S2.1 Pro (291 ms) y ElevenLabs v3 Conversational (329 ms) quedan por detrás de Gradium. Lo que la empresa reclama es una posición conjunta: la tasa de fallas más baja en casos difíciles manteniéndose bajo los 250 milisegundos de primer audio, y con muy poca varianza.
¿Cómo se empieza?
Los usuarios existentes no necesitan hacer nada. Los equipos nuevos instalan el SDK de Python, apuntan al punto de acceso WebSocket de texto a voz y reutilizan los identificadores de voz que ya tengan. La empresa además ofrece un millón de créditos por reportes completos de fallas en casos difíciles a través de su Discord.
¿Qué conviene mirar con distancia?
Hay un punto que la propia publicación reconoce y que vale subrayar: se trata de una evaluación ejecutada por el proveedor, que compite en ella contra sus rivales directos. La atenuante concreta es que el conjunto de 500 oraciones quedó publicado bajo CC BY 4.0, de modo que cualquier tercero puede reproducir la medición o refutarla, lo que no es habitual en este tipo de anuncios.
Para el mercado hispanohablante hay un detalle que no debería pasarse por alto: el español es uno de los cinco idiomas del conjunto de evaluación, junto con el portugués. La mayoría de las comparativas de texto a voz se construyen solo en inglés y luego se extrapolan, algo que en la práctica no funciona: la lectura de un RUT, de un número de orden o de una dirección de correo dictada en español tiene reglas de pronunciación distintas a las del inglés. Que ambos idiomas de la región estén dentro de la muestra hace que la cifra sea más pertinente acá que un promedio construido solo en inglés.




