OpenAI habilitó como API su modelo de voz en tiempo real GPT-Live-1, con lo que los desarrolladores pueden construir aplicaciones habladas más reactivas y flujos de trabajo conversacionales. El modelo debutó en julio como una forma de interactuar por voz en lugar de texto, primero solo dentro de la interfaz de ChatGPT, y ahora se puede invocar mediante llamadas a la API.
¿Qué significa que sea full-duplex?
Al ser un modelo full-duplex, GPT-Live-1 escucha y genera voz al mismo tiempo. Esa es la diferencia técnica de fondo: los sistemas por turnos funcionan como radios de mano, donde uno habla y el otro espera. Las personas, en cambio, se interrumpen, completan frases ajenas y meten confirmaciones breves mientras el otro sigue hablando.
OpenAI dice haberse concentrado en que quienes implementen el modelo puedan personalizar cómo experimentan la interacción por voz los usuarios de aplicaciones de negocio.
"Una fortaleza central de GPT-Live-1, el manejo fluido de las interrupciones, ya está teniendo impacto en los negocios: en evaluaciones tempranas, Speak encontró que GPT-Live-1 daba a los estudiantes más tiempo para pensar antes de que el tutor de idiomas respondiera, reduciendo las interrupciones en casi 80 por ciento frente a los sistemas por turnos anteriores", señaló la compañía.
El diseño separa dos roles. GPT-Live-1 se encarga de sostener la conversación hablada, mientras un modelo de respaldo, por ejemplo GPT-6 Astra o una alternativa más barata para tareas rutinarias, resuelve la búsqueda de información, el uso de herramientas y la gestión de tareas.
Los números frente a la generación anterior
El salto respecto de la API Realtime que OpenAI estrenó en 2024 queda claro en Tau3, un benchmark de inteligencia para agentes de voz que evalúa tareas de atención al cliente propias de aerolíneas, comercios y telecomunicaciones.
| Modelo | Puntaje Tau3 |
|---|---|
| GPT-Live-1 | 86,2% |
| GPT-Realtime-2.1 | 45,7% |
| GPT-Realtime-2 | 42,4% |
La brecha es de 40,5 puntos contra el modelo inmediatamente anterior y de 43,8 puntos contra el de dos generaciones atrás. Dicho de otro modo, GPT-Live-1 casi duplica el desempeño de GPT-Realtime-2.1 en el mismo conjunto de tareas. Citando sus propias evaluaciones, OpenAI afirma además que el modelo rinde un 30 por ciento mejor que GPT-Realtime-2.1 en Full Duplex Bench, y que supera a su antecesor en latencia de toma de turno y en comportamiento interactivo.
Conviene leer esas cifras con la reserva habitual: son mediciones internas de la propia empresa, no de un tercero independiente.
¿Cuánto cuesta realmente operarlo?
GPT-Live-1 cuesta 0,05 dólares por minuto de uso, encima de lo que cobre el modelo de respaldo que esté corriendo. Las voces personalizadas se negocian con el equipo comercial de OpenAI, y el modelo también está disponible a través de OpenAI Presence, la plataforma de agentes empresariales de la compañía.
Esa tarifa se traduce en 3 dólares por hora de conversación continua. Una operación modesta de mil llamadas mensuales de cinco minutos cada una significa 250 dólares solo por la capa de voz, sin contar el modelo que efectivamente resuelve la consulta ni la telefonía. Para un centro de contacto pequeño en la región, el costo del minuto conversado deja de ser el problema principal: lo es el modelo de respaldo, cuyo consumo de tokens crece con cada herramienta que se le conecte.
El caso Yelp
Yelp viene usando GPT-Live-1 en su servicio Yelp Host, un sistema de reservas de restaurantes con inteligencia artificial.
"Con GPT-Live-1, cada llamada es más conversacional y receptiva", dijo Akhil Kuduvalli Ramesh, director de producto de Yelp, en una declaración oficial. "Yelp Host ahora entrega a los restaurantes una voz avanzada que ofrece experiencias excepcionales a los comensales, captura oportunidades de ingreso que de otro modo se habrían perdido y ayuda al personal a concentrarse en atender en vez de contestar el teléfono".
Lo que Yelp no aborda es si los clientes que reservan mesa efectivamente prefieren esa conversación más suelta con una máquina, o simplemente la aceptan porque es mejor que esperar en línea para hablar con una persona.




