
IA
Agentes de voz: el presupuesto real de latencia es 700
El tiempo hasta el primer token es la métrica con la que los equipos eligen su API de inferencia, y también la que más los confunde: la síntesis no habla hasta recibir una cláusula completa.
MarkTechPost