El tiempo hasta el primer token, conocido por su sigla en inglés TTFT (time to first token), es la métrica con la que los equipos eligen una API de inferencia para voz. También es la métrica que los induce al error. El TTFT marca cuándo empieza la generación; un modelo de texto a voz no puede hablar hasta que llegue una cláusula completa. Entre esos dos puntos está la diferencia entre un agente que se siente conversacional y uno que se interrumpe a sí mismo.

¿Por qué el TTFT es el punto de partida correcto y la meta equivocada?

Un agente de voz es un presupuesto de latencia con un modelo de lenguaje adentro. Cada etapa gasta milisegundos que el usuario alcanza a escuchar.

El TTFT es el intervalo entre enviar una solicitud de inferencia y recibir el primer token de vuelta. IBM lo define como el momento en que un sistema pasa de estar inactivo a estar visiblemente activo. Para un chat, el TTFT es casi toda la historia. Para voz, es apenas un término de una suma.

La razón es mecánica: un modelo de texto a voz no puede sintetizar media palabra. Necesita una cláusula o una oración completa antes de producir audio. LiveKit llama a esa métrica resultante tiempo hasta la primera oración, o TTFS, y sostiene en su artículo sobre el despliegue de Gemma 4 que el TTFS es lo que los usuarios realmente perciben.

Eso entrega dos perillas en vez de una. El TTFT controla cuándo arranca la generación. Los tokens por segundo controlan qué tan rápido se completa la primera oración. Un proveedor que gane en una y pierda en la otra no se va a sentir rápido.

¿Cuánto cuesta realmente un turno de conversación?

La descripción general de agentes de voz de LiveKit desglosa un turno así:

EtapaLatencia típica
Reconocimiento de voz (STT)100 a 200 ms
Modelo de lenguaje con streaming300 a 500 ms
Síntesis de voz (TTS)100 a 200 ms
Red sobre WebRTC50 a 150 ms
Objetivo extremo a extremo700 ms a 1,2 s

Kwindla Hultman Kramer, cocreador de Pipecat, recomienda apuntar a 800 ms de latencia mediana voz a voz, con 1.500 ms aceptables para una prueba de concepto. Su aritmética gruesa divide ese presupuesto en cuatro partes de unos 200 ms cada una: transporte y procesamiento de medios, reconocimiento de voz más detección de fin de frase, inferencia del modelo y síntesis de voz.

El trabajo previo de Daily sobre el bot de voz más rápido del mundo aporta la línea base humana: el tiempo típico de respuesta de una persona en conversación ronda los 500 ms, y las pausas por sobre los 800 ms empiezan a sentirse poco naturales.

El benchmark de modelos para agentes de voz que Daily publicó en febrero de 2026 traduce eso en un requisito concreto: una conversación natural exige voz a voz bajo 1.500 ms, lo que se traduce en aproximadamente 700 ms de presupuesto de TTFT para un modelo de lenguaje en modo texto dentro de un arnés de transcripción, modelo y voz. Esos 700 ms son la vara contra la que hay que medir a cada proveedor.

Cinco advertencias antes de leer cualquier benchmark

1. La forma de la carga de trabajo domina. Artificial Analysis cambió su carga por defecto en marzo de 2026: ahora reporta prompts de 10.000 tokens de entrada en vez de 1.000. Los prompts más largos suben tanto el TTFT como la velocidad de salida. LiveKit argumenta que eso está más cerca de la realidad para voz, porque los agentes en producción cargan por adelantado políticas, persona, reglas de escalamiento, datos recuperados y esquemas de herramientas.

2. La ubicación del servidor viene incorporada. Artificial Analysis mide desde una máquina virtual en la zona us-central1-a de Google Cloud. La propia empresa aclara que el TTFT incluye la latencia de red y puede favorecer o perjudicar a proveedores según dónde sirvan.

3. Los tokens de razonamiento cuentan. En la definición de Artificial Analysis, el TTFT de un modelo de razonamiento corresponde al primer token de razonamiento, no al primero de la respuesta. Son columnas distintas.

4. Medir desde el lado receptor. Daily advierte que los proveedores a veces publican TTFT internos a su propio stack de inferencia. Daily mide desde el envío de la solicitud hasta el primer token utilizable que sale de la API.

5. Las corridas no son repetibles. El TTFT varía sustancialmente entre corridas, y los proveedores cambian sus stacks de inferencia, y a veces los pesos, sin cambiar el nombre del modelo.

Capa 1: el modelo de lenguaje

Las cifras del ranking de proveedores de Artificial Analysis se recuperaron el 30 de agosto de 2026, con carga de 10.000 tokens de entrada, un solo prompt y mediana sobre 72 horas.

La trampa del rendimiento

Los fabricantes de silicio optimizan una métrica distinta de la que los agentes de voz necesitan. Mercury 2 es la ilustración más clara: es un modelo de lenguaje basado en difusión, genera 770 tokens por segundo y su primer fragmento llega a los 3,07 segundos. Eso es cuatro veces el presupuesto completo del modelo en una conversación natural.

Cerebras y Groq son un caso distinto. Su TTFT es respetable y su rendimiento es excepcional. Para el TTFS específicamente, esa combinación es fuerte, porque la oración se completa casi de inmediato después de que aterriza el primer token.

También conviene mirar el mismo modelo en distintos anfitriones: GPT-5.6 Luna sin razonamiento midió 0,59 s en Amazon Bedrock y 0,74 s en la API propia de OpenAI. El alojamiento y el enrutamiento pesan tanto como los pesos.

El caso medido por el proveedor

LiveKit publica cifras de TTFT para su propio producto de inferencia:

ConfiguraciónTTFTTTFS en conversación completa
Gemma 4 31B en LiveKit Inference192 ms354 ms
Gemini 2.5 Flash911 ms1.034 ms
GPT-5.5966 ms1.404 ms
GPT-4.11.006 ms1.088 ms
Gemini 3.0 Flashno reportado1.267 ms
Gemma 4 31B vía OpenRouter1.876 msno reportado

LiveKit es transparente sobre el mecanismo, lo que vuelve la afirmación más creíble que la mayoría: corre Gemma detrás de SGLang con decodificación especulativa y deliberadamente sub-carga cada GPU para que la demora de encolamiento se mantenga baja. Una solicitud en caliente, dice, empieza a devolver tokens en torno a los 100 ms. El costo de ese diseño es 1,20 dólares por millón de tokens de salida.

Las cifras de capacidad acompañan. En IFBench, puntuado de forma independiente por Artificial Analysis, Gemma 4 31B obtiene 75,6 % frente a GPT-5.5 con 75,9 %, GPT-4.1 con 43 % y Gemini 2.5 Flash con 39 %. En τ²-bench, GPT-5.5 lidera con 93,9 % y Gemma 4 31B queda en 76,9 %.

Capa 2: reconocimiento de voz y detección de turno

Para voz, la latencia del reconocimiento no es la velocidad de transcripción. Es cuánto demora el pipeline en saber que el usuario dejó de hablar después de que efectivamente dejó de hablar.

Artificial Analysis mide dos cosas en su ranking de reconocimiento en streaming, ambas partiendo desde un fin de habla detectado por SileroVAD: tiempo hasta la primera transcripción parcial y tiempo hasta la transcripción final. Su índice AA-WER Streaming se apoya en unas 8 horas de audio, ponderadas 50 % AA-AgentTalk, 25 % VoxPopuli y 25 % Earnings-22.

Deepgram Flux es la entrada más interesante en lo arquitectónico: integra la detección de fin de turno dentro del modelo de reconocimiento en vez de montar un detector de actividad de voz encima. Deepgram afirma que eso puede recortar entre 200 y 600 ms de latencia de respuesta frente a un pipeline tradicional. Expone los parámetros eot_threshold (0,5 a 0,9) y eager_eot_threshold (0,3 a 0,9), además de un evento EagerEndOfTurn que permite arrancar el modelo de lenguaje antes de tiempo. Esa última capacidad importa más que el número bruto: si se puede empezar a generar con una señal anticipada, el TTFT del modelo sale por completo de la ruta crítica cuando la predicción acierta.

AssemblyAI Universal-Streaming invierte el modelo habitual de parciales y finales emitiendo transcripciones inmutables. La empresa reportó 307 ms de emisión mediana por palabra frente a 516 ms de Deepgram Nova-3 en su propia medición de 2025. Su documentación recomienda además usar transcripciones sin formato para agentes de voz, porque el formato llega después y rara vez cambia el comportamiento del modelo.

Las afirmaciones de precisión son disputadas y provienen de los propios proveedores. AssemblyAI reporta Universal-3.5 Pro Realtime con 6,99 % de tasa de error por palabra en el benchmark abierto de Pipecat, por delante de Google Chirp3 con 9,04 %, ElevenLabs Scribe v2 con 9,76 % y Deepgram Flux con 15,58 %. Conviene correrlo antes de darlo por zanjado.

LiveKit también documenta la generación anticipada, que arranca el modelo con una transcripción parcial. La advertencia es real: si la respuesta hay que regenerarla tras la transcripción final, se queman tokens y no se ahorra nada.

Capa 3: síntesis de voz

Acá es donde las cifras de los proveedores más divergen de lo que el usuario experimenta.

ElevenLabs afirma que Flash v2.5 entrega aproximadamente 75 ms. Su propia documentación lo matiza con cuidado: esos 75 ms se refieren solo al tiempo de inferencia del modelo. Su página de conceptos de latencia va más allá y lista el viaje de ida y vuelta de red en típicamente 20 a 200 ms según la geografía, y señala que la mayoría de los reproductores de audio almacenan en búfer antes de reproducir, siendo 500 ms de búfer algo común.

Cartesia declara menos de 90 ms de síntesis y 100 ms de latencia de transcripción para Sonic-3.6 e Ink-2, cifras que corresponden a latencia de modelo declarada por el proveedor, no a viajes de ida y vuelta medidos extremo a extremo. Cartesia había afirmado antes 82 ms de tiempo hasta el primer audio extremo a extremo para Sonic 3.5. Sonic corre sobre modelos de espacio de estados en vez de transformadores, que escalan de forma lineal y no cuadrática con el largo de la secuencia.

En calidad, la arena de voz de Artificial Analysis, con puntaje Elo de oyentes a ciegas recuperado el 30 de agosto de 2026, deja a Sonic 3.6 en 1.288 y a Flash v2.5 en 1.083. Esa brecha es el costo en calidad del escalón de baja latencia sobre el que corre la mayoría de los agentes.

Capa 4: modelos de voz a voz

Los modelos de voz a voz colapsan reconocimiento, modelo de lenguaje y síntesis en una sola pasada. Menos viajes de ida y vuelta deberían significar menos latencia. LiveKit es cauto acá y advierte que los modelos en tiempo real no están garantizados a ser más rápidos en todos los casos, y que un pipeline bien afinado puede ser altamente competitivo.

Los datos respaldan esa cautela. Según el ranking de voz a voz de Artificial Analysis, con tiempo hasta el primer audio medido sobre Big Bench Audio y recuperado el 30 de agosto de 2026, Grok Voice Think Fast 2.0 High destaca con 0,70 s, 97 % de razonamiento hablado y 94,7 % de éxito en tareas.

La penalización por esfuerzo de razonamiento se ve dentro de una misma familia de modelos: Gemini 3.1 Flash Live pasa de 0,96 s a 2,99 s entre esfuerzo mínimo y alto. GPT-Realtime-2.1 se mueve de 0,97 s a 1,21 s, comprando 2,1 puntos porcentuales de éxito en tareas.

Qué implica esto desde Chile

La segunda advertencia metodológica es la que más pesa para quien despliega desde el cono sur: si el benchmark se corre desde us-central1-a en Iowa, la latencia de red que reporta no es la que va a medir un usuario en Santiago. Con el rango de 20 a 200 ms que la propia ElevenLabs asigna al viaje de red según geografía, y los 500 ms de búfer del reproductor que también documenta, un presupuesto de 700 ms se consume antes de que el modelo escriba su primer token. La conclusión práctica no es elegir el proveedor con el número más bajo del ranking, sino medir desde donde el usuario efectivamente está.