El nuevo modelo de audio en tiempo real de Meta es la base para asistentes que nunca dejan de escuchar

Los laboratorios de superinteligencia de Meta han lanzado su primer modelo de percepción de audio en tiempo real. Este sistema es capaz de transcribir el habla, diferenciar a los distintos interlocutores y detectar los límites de las oraciones durante una conversación en directo.

El modelo, perteneciente a la familia Spark, fragmenta el audio entrante en bloques de 80 milisegundos. Tras procesar cada segmento, decide si debe seguir escuchando o generar la siguiente palabra como texto, gestionando así la cantidad de contexto necesario antes de confirmar una transcripción.

A mayor espera, mejor es la precisión, pero aumenta la latencia. Muse Voice Transcribe ajusta este tiempo de espera de forma dinámica para cada palabra según su complejidad, según informa Meta. Las palabras sencillas se procesan con rapidez, mientras que las más complejas requieren más tiempo de escucha. Meta entrenó este comportamiento mediante aprendizaje por refuerzo, premiando al modelo por lograr bajas tasas de error y latencias reducidas de forma simultánea.

Gráfico que muestra cómo el retardo adaptativo equilibra la velocidad y la precisión en la transcripción palabra por palabra
Gráfico que muestra cómo el retardo adaptativo equilibra la velocidad y la precisión en la transcripción palabra por palabra

El retardo adaptativo modifica el equilibrio entre velocidad y precisión, ya que el modelo decide por cada palabra cuánto tiempo debe seguir escuchando.

¿Cómo logra la separación de hablantes sin sistemas adicionales?

Meta integra las funciones restantes en el mismo modelo, sin necesidad de sistemas separados. Para la atribución de hablantes, el modelo señala los cambios de turno en el texto continuo y etiqueta cada pasaje con un identificador de la A a la Z. Respecto a los límites de las oraciones, marca dónde comienza y termina cada intervención. Ambas tareas se entrenan de manera conjunta con el reconocimiento de voz.

El modelo puede distinguir a más de 20 hablantes simultáneamente y procesar grabaciones de más de una hora sin requerir post-procesamiento. En una demostración con ocho personas en una misma sala, el sistema asignó las palabras a cada individuo en tiempo real, de acuerdo con la información de Meta.

Meta afirma que Muse Voice Transcribe fue entrenado en más de 70 idiomas, con 25 de ellos evaluados en profundidad. El modelo también gestiona el cambio de código (code-switching), donde los hablantes alternan entre dos idiomas a mitad de una frase. Las pistas sobre el idioma, palabras clave y contexto pueden mejorar la precisión, especialmente en nombres propios como "Meta", "Muse" o "Menlo Park".

Captura de pantalla de Artificial Analysis comparando la precisión de transcripción final tras detectar el fin del habla
Captura de pantalla de Artificial Analysis comparando la precisión de transcripción final tras detectar el fin del habla

En las pruebas realizadas por Artificial Analysis el 1 de septiembre de 2026, Muse Voice Transcribe produce la transcripción final más precisa tras detectar el fin del habla.

Artificial Analysis confirma las afirmaciones de Meta en una evaluación independiente. Muse Voice Transcribe alcanza una tasa de error de palabra del 3,1 por ciento en inglés a los 0,16 segundos después de que el hablante termina de hablar. ElevenLabs Scribe v2 Realtime obtiene un 3,6 por ciento en 0,14 segundos, mientras que AssemblyAI Universal-3.5 Pro Realtime alcanza un 4,0 por ciento. Cartesia Ink-2 obtiene un 3,4 o 4,0 por ciento, dependiendo de si el modelo detecta los finales de oración por cuenta propia o depende de un sistema externo. La competencia es intensa; OpenAI lanzó GPT-Realtime-Whisper con el mismo fin y redujo los precios de sus modelos de transcripción en julio.

Meta vincula este lanzamiento con la visión del CEO Mark Zuckerberg sobre la "superinteligencia personal". En una demostración preparada, los empleados de Meta argumentan que un reconocimiento de voz fiable es la base para los agentes de IA personales que escuchan conversaciones reales a través de gafas inteligentes. En Alemania, se discutió recientemente una prohibición de las gafas con cámara de Meta, aunque la Agencia Federal de Redes decidió no avanzar con la medida.

Disponibilidad y costos

Muse Voice Transcribe impulsa ahora el dictado por voz en Meta AI y Muse Code, estando disponible a través de la Meta Model API. Los usuarios pueden probarlo manteniendo presionada la tecla "Fn" en cualquier aplicación compatible.

Meta reduce los precios del mercado. A USD 0,18 por hora, o USD 3 por cada 1.000 minutos de audio, resulta más económico que Cartesia Ink-2 (USD 4) y que ElevenLabs Scribe v2 Realtime y Deepgram Flux (USD 6,50 cada uno). Esto continúa la estrategia observada en Muse Spark 1.1 y 1.2, donde Meta compite por precio en lugar de por rendimiento máximo. La compañía no ha revelado el número de parámetros, el volumen de datos de entrenamiento ni las fuentes de audio, y tampoco liberará los pesos del modelo.

Meta reorganizó su división de IA en el verano de 2025 bajo el paraguas de los Superintelligence Labs, reclutando investigadores de alto nivel de OpenAI, Google DeepMind y Apple con paquetes salariales de hasta USD 300 millones en cuatro años. No todos permanecieron, ya que algunos regresaron a OpenAI tras apenas unas semanas.

Vía CNX Software.