¿Qué ofrece GPT Transcribe de OpenAI?

OpenAI ha lanzado oficialmente GPT Transcribe y GPT Live Transcribe, dos nuevos modelos de reconocimiento de voz ya disponibles a través de su API. GPT Transcribe está diseñado específicamente para procesar archivos de audio pregrabados, logrando una velocidad de procesamiento aproximadamente 34 veces más rápida que el tiempo real. Por otro lado, GPT Live Transcribe ha sido desarrollado para flujos de trabajo de streaming en tiempo real, priorizando una baja latencia para aplicaciones interactivas.

Según los datos de Artificial Analysis, que gestiona el benchmark AA-WER (Word Error Rate), GPT Transcribe alcanza una tasa de error de palabras del 3.31%. Esta cifra representa una mejora de 0.7 puntos porcentuales respecto a su predecesor, GPT-4o Transcribe, lanzado hace un año. Junto con este lanzamiento, OpenAI ha reducido los precios en un 25%, estableciendo un costo de 0.0045 USD por minuto de audio procesado. Ambos modelos permiten configurar contexto adicional, palabras clave específicas y soportan múltiples idiomas de entrada para mejorar la precisión.

¿Cómo se posiciona frente a la competencia?

En el ranking actual de AA-WER, OpenAI todavía se encuentra por detrás de varios competidores clave en el mercado de la inteligencia artificial. La clasificación se detalla de la siguiente manera:

  • ElevenLabs Scribe v2: lidera con una tasa de error del 2.3%.
  • Google Gemini 3 Pro: alcanza una tasa de error del 2.9%.
  • Mistral Voxtral Small: registra una tasa de error del 3.0%.

Además de la precisión, la guerra de precios es intensa. Recientemente, Mistral ha presionado al mercado con su modelo Voxtral Transcribe V2, el cual ofrece una tarifa inicial de apenas 0.003 USD por minuto, posicionándose como una alternativa más económica que la oferta de OpenAI.

Los detalles técnicos completos sobre la implementación se encuentran disponibles en la Guía de Transcripción de OpenAI. Estos nuevos modelos de transcripción complementan la reciente generación de modelos Realtime de OpenAI, que también integra el modelo GPT-Realtime-Whisper para tareas de voz en tiempo real.

Vía The Decoder.