Google lanzó Gemini 3.5 Transcribe, un modelo de voz a texto pensado para transcripción en tiempo real. La novedad no está solo en la precisión, sino en que el modelo interviene el texto mientras lo escribe: reconoce automáticamente más de 85 idiomas, elimina muletillas como el clásico "eh", corrige lapsus al hablar y aplica formato por su cuenta.

¿Qué tan preciso es en la práctica?

Google reporta una tasa de error por palabra de 4,0% en modo continuo y de 2,6% sobre audio grabado. En términos simples, eso equivale a unas cuatro palabras mal transcritas por cada cien en una conversación en vivo, y a menos de tres por cada cien cuando el modelo trabaja sobre un archivo ya registrado. La diferencia entre ambos números es esperable: con el audio completo a la vista, el modelo puede apoyarse en el contexto posterior, algo imposible cuando transcribe palabra a palabra.

El otro dato fuerte es la velocidad. La compañía declara una latencia 70% menor que la de Chirp 3, el modelo que antecede a este en su catálogo.

CaracterísticaChirp 3Gemini 3.5 Transcribe
Idiomas reconocidosno informado en el anunciomás de 85, con detección automática
Error por palabra en continuono informado4,0%
Error por palabra en grabadono informado2,6%
Latencia relativareferencia70% menor

A eso se suma una capacidad que separa a este modelo de un transcriptor clásico: mediante function calling, puede delegar tareas a otros modelos de la familia Gemini, como generación de imágenes o búsquedas en la web. Es decir, la transcripción deja de ser un punto final y pasa a ser la entrada de una cadena de acciones.

¿Cuáles son las dos interfaces?

El modelo llega con dos vías de acceso, según el tipo de audio:

  • La Live API maneja el flujo en tiempo real con latencia muy baja, bajo el identificador gemini-3.5-transcribe-live.
  • La Interactions API procesa audio grabado con atribución de hablantes y marcas de tiempo, bajo el identificador gemini-3.5-transcribe.

Esa separación importa para quien vaya a integrarlo. La atribución de hablantes y los timestamps solo aparecen en la vía de audio grabado, así que un caso de uso como levantar el acta de una reunión con varios participantes no se resuelve con el modo continuo.

¿Dónde se puede usar hoy?

El modelo ya está disponible en Google AI Studio y en la plataforma Gemini Enterprise Agent. También viene integrado en Gboard para Android, a través de la función llamada "Rambler", y en la aplicación de Gemini para macOS. El soporte en Chrome está anunciado y llegará después.

Para el uso desde Chile hay un punto que Google no aclaró en el anuncio: no publicó la lista completa de los más de 85 idiomas reconocidos, ni si el modelo distingue variantes regionales dentro de un mismo idioma. Es un detalle que pesa en el dictado cotidiano, donde el vocabulario y la entonación locales suelen ser justamente lo que hace fallar a un transcriptor entrenado con habla neutra. Tampoco detalló si el borrado de muletillas y la corrección de lapsus se pueden desactivar, algo relevante para transcripciones periodísticas o judiciales, donde el registro literal de lo que se dijo no es un defecto sino el requisito.