Gemma Translator: traductor de voz offline en Raspberry Pi 5

Raspberry Pi 5 con pantalla táctil mostrando una interfaz de terminal retro para el traductor Gemma
Raspberry Pi 5 con pantalla táctil mostrando una interfaz de terminal retro para el traductor Gemma

Gemma Translator es un intérprete de voz multilingüe de código abierto para Raspberry Pi 5. Realiza la traducción de voz completamente en el dispositivo, sin acceso a la nube. Utiliza el modelo Google Gemma 4 y el runtime LiteRT. El resultado es un traductor de IA portátil que respeta la privacidad y funciona incluso sin red. La interfaz de usuario tiene un estilo de terminal retro, diseñada para pantallas pequeñas como las pantallas táctiles de Raspberry Pi.

El objetivo del proyecto es demostrar que la IA generativa puede ejecutarse en dispositivos edge. De hecho, todo el proceso de traducción ocurre en el dispositivo. El micrófono captura el audio, que es procesado y enviado al modelo local Gemma 4 E2B. La síntesis de voz se basa en Moonshine, un motor TTS de código abierto de baja latencia. Esto proporciona tiempos de respuesta rápidos y garantiza que ningún dato salga del dispositivo.

¿Cómo funciona el intérprete de voz offline?

El corazón del sistema es LiteRT-LM, una capa de orquestación basada en LiteRT. Esto ejecuta el modelo gemma4-e2b de forma totalmente local. El modelo tiene 5.1B de parámetros totales, pero solo 2.3B están activos por inferencia. Esta eficiencia lo hace adecuado para una Raspberry Pi 5 con 8GB de RAM. La Raspberry Pi 5 con 8GB maneja la carga de trabajo completa sin problemas.

El flujo operativo es sencillo. El usuario selecciona los dos idiomas en la pantalla táctil. Luego habla por el micrófono. El audio se convierte a texto, es traducido por el modelo y finalmente emitido a través del altavoz. Todo sucede en pocos segundos. La latencia es baja gracias a Moonshine, que genera audio sintetizado de manera eficiente. Además, el proyecto incluye una PCB personalizada (AX-4LABS-NEW) con un encoder rotativo y cuatro botones mecánicos.

  • Micrófono con interfaz de captura de audio USB
  • Altavoz o audífonos para salida de audio
  • Pantalla táctil de 480×320 para selección de idioma
  • Teclado para configuración inicial

La interfaz de usuario está construida específicamente para pantallas pequeñas. Es un frontend en React con una estética de terminal retro. Su propósito principal es seleccionar los dos idiomas de traducción. Un script unificado inicia el servidor LLM, la API de Python y el frontend de React en la Pi 5. Esto simplifica el inicio del sistema. El gabinete impreso en 3D es opcional, pero protege los componentes durante el transporte.

¿Por qué elegir un traductor de voz offline?

La privacidad es la ventaja principal. Ninguna conversación se envía a servidores externos. Los datos permanecen en el dispositivo. Además, la baja latencia mejora la experiencia del usuario. No se necesita una conexión a internet estable. Esto lo hace ideal para viajes, eventos o entornos con conectividad limitada. El proyecto también demuestra que la IA generativa es accesible para los makers. La página del proyecto proporciona todo el código necesario.

Para el audio, puede usar un amplificador externo. Por ejemplo, un amplificador de código abierto como ANGELO puede mejorar la salida de sonido del altavoz. O simplemente puede conectar audífonos. La configuración es flexible. El sistema reconoce tanto la entrada de micrófono USB como la salida de audio analógica. Esto le permite adaptar el proyecto a sus necesidades.

¿Qué necesita para reconstruir el proyecto?

La lista de componentes es clara. Una Raspberry Pi 5 con al menos 8GB de RAM es esencial. La pantalla táctil de 480×320 se conecta mediante HDMI. Un micrófono USB y un altavoz completan el hardware. La PCB personalizada no es obligatoria, pero hace que el control sea más intuitivo. Las piezas impresas en 3D para el gabinete son opcionales. Sin embargo, le dan al dispositivo un aspecto profesional.

El software requiere LiteRT, LiteRT-LM, el modelo gemma4-e2b y Moonshine. Todos son de código abierto. La configuración inicial requiere una conexión a internet para descargar los modelos. Después de eso, el sistema funciona totalmente offline. Este proyecto es un ejemplo perfecto de edge AI. Combina potencia de cómputo, privacidad y practicidad en un formato compacto.

Fuente: github.com/moonshine-ai/moonshine](https://github.com/moonshine-ai/moonshine)

Vía Open Electronics.