SpaceXAI liberó Grok Voice Transcribe 2.0, su modelo más reciente de voz a texto. El equipo de desarrollo afirma que duplica la precisión de Grok Voice Transcribe 1.0 al mismo precio. El modelo apunta al audio difícil, o sea líneas telefónicas con ruido, voces que compiten entre sí, acentos locales y credenciales dictadas en voz alta. Funciona en modo lote y en transmisión en tiempo real a través de la API de voz a texto.

¿Se puede desplegar? Sí, como API alojada. Está disponible desde hoy bajo el identificador grok-voice-transcribe-2.0. SpaceXAI no anunció pesos abiertos, así que alojarlo por cuenta propia no es una opción.

¿Qué es Grok Voice Transcribe 2.0?

El modelo está construido sobre el modelo de audio que hay detrás de Grok Voice. El equipo de SpaceXAI sostiene que Grok Voice ya atiende decenas de miles de llamadas de soporte al día, transcribe millones de horas de narración en video y hace correr al asistente Grok dentro de los vehículos Tesla.

Los datos de entrenamiento son audio real, ruidoso y multilingüe, grabado en entornos diversos. Después la empresa afinó el modelo con post entrenamiento.

Los números que publica SpaceXAI

La empresa reporta el primer lugar en precisión entre 32 modelos de transmisión en la tabla pública de Artificial Analysis. Ese punto de referencia, llamado AA-WER Streaming, usa cerca de 8 horas de audio y pondera AA-AgentTalk en 50%, VoxPopuli en 25% y Earnings22 en otro 25%, según su metodología.

SpaceXAI además mide la tasa de error por palabra, o WER, sobre cuatro conjuntos internos sacados de tráfico de producción.

  • Telefonía (8 kHz), llamadas de soporte en inglés
  • Conversacional, conversaciones en inglés con Grok
  • Credenciales, números de teléfono, correos y direcciones en inglés
  • Frases cortas, órdenes de asistente de voz en 19 idiomas

La versión 2.0 mejora a la 1.0 en los cuatro conjuntos. En telefonía, SpaceXAI dice encabezar a todos los modelos que probó. Estos resultados internos los reporta la propia empresa y nadie los ha reproducido de forma independiente.

Transcripción multilingüe y cambio de idioma

El modelo transcribe decenas de idiomas y detecta el idioma en forma automática. También sigue los cambios de idioma que ocurren a mitad de una grabación, en una sola pasada. El equipo de SpaceXAI señala que la precisión multilingüe es la mayor mejora respecto de la 1.0.

Las frases cortas, como las órdenes dentro del auto, le dan al modelo poco contexto para identificar el idioma. En ese conjunto el WER baja de 20,6% a 6,8%, que equivale a alrededor de 67% menos errores de palabra. La documentación lista 25 idiomas para el formato escrito de números, monedas y unidades.

¿Qué trae la API para el desarrollador?

Todas estas funciones vienen en la misma API.

  • Lote y transmisión, transcribe archivos y URL, o recibe audio por WebSocket en wss://api.x.ai/v1/stt
  • Marcas de tiempo por palabra, con hora de inicio, de término y puntaje de confianza
  • Diarización de hablantes, con etiquetas de quién habla y sin costo extra
  • Transcripción multicanal, hasta 8 canales transcritos de forma independiente
  • Sesgo por términos clave, hasta 100 términos de dominio por solicitud, de 50 caracteres cada uno
  • Formato de texto, números, fechas, monedas, teléfonos y correos devueltos en forma escrita
  • Eliminación de muletillas, los "eh" y "mmm" se sacan por omisión
  • Detección de turno, un modelo predice cuándo terminó de hablar la persona

El punto de entrada en lote acepta archivos de hasta 500 MB en 12 formatos de audio. La transmisión también acepta Opus, a unos 4 KB/s, contra los 48 KB/s del PCM sin comprimir a 24 kHz.

Precio

El precio es idéntico al de la versión 1.0. La transcripción en lote cuesta 0,10 dólares por hora de audio y la transmisión, 0,20 dólares por hora. La diarización, las marcas de tiempo y los términos clave van incluidos. Eso da cerca de 1,67 y 3,33 dólares por cada 1.000 minutos.

Atlassian Loom ya lo usa

Atlassian Loom transcribe ahora todos sus videos con Grok Voice Transcribe 2.0. Atlassian lo encontró más preciso que la solución que tenía.

El flujo que describe SpaceXAI es grabar, transcribir y después programar. Alguien graba un plan de acción en Loom, el texto se canaliza hacia Cursor y ahí se hacen los cambios de código. Sanchan Saxena, vicepresidente senior de Teamwork Collection en Atlassian, lo describió como "cerrar el circuito entre el contexto y el código".