Google liberó Gemini 3.5 Transcribe, un modelo de voz a texto pensado tanto para interfaces de voz en tiempo real como para archivos ya grabados. Llega como dos endpoints separados, y esa es la parte que conviene planificar: no comparten el mismo conjunto de funciones, ni los mismos límites, ni el mismo precio.
El endpoint gemini-3.5-transcribe procesa archivos pregrabados a través de la Interactions API. El endpoint gemini-3.5-transcribe-live maneja streaming bidireccional mediante la Live API.
¿Se puede desplegar hoy?

Sí, pero solo por API. No hay pesos abiertos ni ruta de autoalojamiento: es una decisión de servicio gestionado, no de infraestructura.
Cualquier tamaño de equipo puede partir. Desarrolladores individuales y startups arrancan en la capa gratuita de la API vía Google AI Studio, y los equipos medianos pasan a la capa pagada por límites de tasa más altos. Esa capa pagada además garantiza que el contenido no se use para mejorar los productos de Google. Las empresas reguladas enrutan por la Gemini Enterprise Agent Platform, que suma rendimiento aprovisionado, controles de cumplimiento y descuentos por volumen.
Ambas vías están en vista previa pública, así que los compromisos de producción hay que tomarlos con esa reserva.
Dos superficies de API, dos productos distintos
La Live API entrega transcripción continua por debajo del segundo. Emite interim_input_transcription como resultado especulativo mientras la persona todavía habla, y luego input_transcription cuando el turno se cierra. El audio entra como PCM crudo de 16 bits a 16 kHz en mono, en bloques de 100 milisegundos, y admite detección de actividad de voz automática, híbrida y manual. Los tokens efímeros permiten que clientes móviles y web transmitan sin guardar una clave de API.
Las restricciones son concretas: las sesiones en vivo se cortan a los 10 minutos de transmisión continua, no hay diarización de hablantes y no hay marcas de tiempo por palabra.
La Interactions API cubre justamente lo que el streaming no puede: diarización, desplazamientos de inicio y fin por palabra, y sesgo de vocabulario personalizado. La lista de vocabulario acepta hasta 1.000 términos, con mejores resultados por debajo de 100. Las solicitudes estándar aceptan hasta una hora de audio, que baja a 30 minutos cuando se activa la diarización o las marcas de tiempo.
| Función | Live API | Interactions API |
|---|---|---|
| Latencia | Bajo un segundo | Diferida |
| Diarización de hablantes | No | Sí |
| Marcas de tiempo por palabra | No | Sí |
| Duración máxima | 10 min por sesión | 60 min, o 30 con diarización |
Verbatim o smart: la decisión de diseño real
Ambos endpoints exponen dos modos. El modo verbatim, que viene por defecto, devuelve todo, incluidas muletillas, repeticiones y arranques fallidos. El modo smart elimina las disfluencias, resuelve las autocorrecciones habladas y aplica formato estructurado.
El ejemplo que documenta la propia Google es claro. Ante la frase "Um, so for the meeting, I think we should, uh, invite Alice and, wait no, Bob and Carol", el modo verbatim conserva todo y el modo smart devuelve "For the meeting, I think we should invite Bob and Carol".
El modo smart no se puede combinar con marcas de tiempo por palabra ni con diarización. Ese es el compromiso a planificar: un resumen legible y una transcripción auditable pasaron a ser dos llamadas distintas a la API.
¿Qué tan preciso es en la práctica?
Según las mediciones de Artificial Analysis, la tasa promedio de error por palabra es de 4,0% en streaming y 2,6% en diferido. Sobre el benchmark multilingüe FLEURS, en un conjunto de idiomas y variantes principales, el modelo reporta 5,50% en streaming y 5,04% en diferido.
Frente a Chirp 3, el modelo de transcripción anterior de Google, el tiempo hasta la transcripción final mejora un 70%. La cobertura abarca más de 85 variantes lingüísticas con detección automática y cambio de idioma a mitad de frase resuelto sin configuración previa, un detalle relevante para el habla real en Latinoamérica, donde el préstamo del inglés técnico es constante.
¿Cuánto cuesta transcribir una hora?
El costo mezclado ronda los 0,005 dólares por minuto en lote y 0,009 dólares por minuto en vivo. La cuenta directa: una hora de audio grabado sale cerca de 0,30 dólares, y una hora de transcripción en vivo alrededor de 0,54 dólares, antes de impuestos locales. Para un centro de contacto que procese 500 horas mensuales de llamadas grabadas, eso son unos 150 dólares al mes en transcripción.
Ecosistema
La Live API ya está integrada en LiveKit, Pipecat, Agora, Fishjam, Vercel y Vision Agents. Del lado del consumo, el modelo mueve a Rambler en Android, la aplicación de Gemini en macOS y Google Antigravity. Chrome figura como próximo.




