Tres ingenieros de Google publicaron Gemma Translator, un proyecto de código abierto que convierte una Raspberry Pi 5 en un intérprete multilingüe capaz de funcionar por completo sin conexión a internet. El sistema ejecuta el modelo Gemma 4 E2B sobre el runtime LiteRT y, una vez instalado, no necesita la nube para traducir. El desarrollo se apoyó en Google Antigravity.

El modelo elegido es Gemma 4 E2B, con 2.300 millones de parámetros efectivos y cerca de 5.100 millones totales gracias a los embeddings por capa. Esa diferencia es la que permite que quepa en una placa de 8 GB de RAM.

¿Qué hardware necesita el proyecto?

La lista de componentes es corta y casi todo es material de taller. Tabla de elaboración propia a partir del listado del proyecto:

ComponenteRequisito
PlacaRaspberry Pi 5 con 8 GB de RAM
PantallaMonitor HDMI o pantalla táctil, por ejemplo una de kiosco de 480×320
Entrada de audioMicrófono o interfaz de captura USB
Salida de audioParlante o salida de audífonos
ControlPCB a medida (AX-4LABS-NEW) con encoder rotatorio y cuatro teclas mecánicas, de las cuales solo se usan dos
CarcasaPiezas impresas en 3D, opcionales
Hardware del Gemma Translator
Hardware del Gemma Translator

El PCB del teclado con encoder no fue liberado como código abierto y no existe un equivalente comercial idéntico, pero cualquier teclado o teclado numérico sirve para reemplazarlo.

¿Cómo funciona por dentro?

El proyecto se apoya en cuatro piezas de software:

  • Inferencia en el dispositivo: usa LiteRT-LM, una capa de orquestación construida sobre LiteRT, para ejecutar el modelo gemma4-e2b de forma completamente local. Después de la instalación inicial no requiere internet.
  • Interfaces de audio: captura el audio del micrófono, lo procesa y lo envía al modelo local. La síntesis de voz recae en Moonshine, un motor de texto a voz de código abierto y baja latencia pensado para agentes de IA.
  • Interfaz de usuario: estilo terminal retro, diseñada a medida para pantallas chicas como las táctiles de Raspberry Pi. Se usa sobre todo para elegir los dos idiomas.
  • Arranque unificado: un solo script levanta el servidor del modelo, la API en Python y el frontend en React sobre la Pi 5.

El backend en Python, el frontend en React, el archivo STL de la carcasa y las instrucciones para partir están en GitHub.

Ensamblaje de la carcasa impresa en 3D del Gemma Translator
Ensamblaje de la carcasa impresa en 3D del Gemma Translator

El detalle que importa para LatAm

El video de demostración del proyecto muestra interpretación en vivo entre español y mandarín. No es un detalle menor: la mayoría de los asistentes de traducción de este tipo se muestran primero en inglés, y aquí el par español-mandarín aparece de entrada.

El autor de CNX Software, que reseñó el proyecto, aclaró que no maneja bien ninguno de los dos idiomas y no puede juzgar la calidad de la salida, pero sí constató que la latencia es lo bastante baja como para resultar usable.

La implicancia práctica para un uso realista en Chile es que el equipo no depende de conexión. Sirve en terreno, en zonas sin señal, o en contextos donde subir audio a la nube no es aceptable, como la atención de público que involucra datos sensibles.

¿Por qué LiteRT y no llama.cpp?

Los ingenieros de Google vienen optimizando el desempeño de LiteRT sobre la plataforma Raspberry Pi. Publicaron un artículo detallado sobre el estado actual en el blog de Raspberry Pi y una guía para partir con LiteRT en la Raspberry Pi 5.

LiteRT-LM comparado con llama.cpp en Raspberry Pi 5
LiteRT-LM comparado con llama.cpp en Raspberry Pi 5

Comparado con llama.cpp, LiteRT-LM ofrece mayor rendimiento y un uso de memoria bastante menor sobre la Raspberry Pi 5 de 8 GB. En una placa donde la RAM es el recurso escaso, esa segunda ventaja pesa tanto como la primera: es lo que decide si el modelo entra o no en el equipo.

El mismo equipo mostró además el rendimiento de LiteRT en la Raspberry Pi 5 con modelos de visión por computador, de segmentación y de audio.