Google DeepMind anunció SL2T (sign-language-to-text), un modelo masivamente multilingüe de traducción de lengua de señas a texto que, según la compañía, marca un salto de calidad y generalidad respecto de todo lo publicado antes. Con él, la traducción automática de lenguas de señas sale del laboratorio y entra por primera vez en productos de consumo: SL2T alimenta el dictado por señas en Gboard y en Live Transcribe del Pixel 11, partiendo por lengua de señas americana (ASL) hacia el inglés. Google adelantó que habrá más dispositivos pronto y que se sumarán otras lenguas.
El punto de partida es una brecha grande. La capacidad de la IA para procesar lenguas habladas avanzó a gran velocidad en las últimas décadas, con traducción automática, dictado e interfaces conversacionales que a un usuario oyente le resultan naturales. Esa revolución no llegó a las más de 200 lenguas de señas del mundo ni a los aproximadamente 70 millones de personas sordas y con pérdida auditiva que las usan.
¿Qué permite hacer en el teléfono?
Del mismo modo en que un usuario oyente puede dictar en vez de escribir, la función habilita a los usuarios sordos a hacer señas frente a su teléfono en cualquier lugar donde normalmente teclearían. Se puede señar para buscar en la web, redactar mensajes o documentos, y pedirle a Gemini que resuelva consultas o ejecute tareas. En Live Transcribe se pueden responder conversaciones con señas, en vez de teclear ida y vuelta. Según los testers de Google, señar en ASL resulta más rápido, más natural y más grato que escribir en inglés.
Por qué importan las lenguas de señas
Las lenguas de señas son las lenguas primarias de las comunidades sordas y un pilar de su identidad cultural. Hay gran diversidad entre las personas sordas en cuanto a su nivel de dominio para señar, hablar, leer y escribir, por lo que sostener el acceso en todas las modalidades es clave. El avance en esta área ha sido lento, según Google, tanto por la dificultad técnica como por concepciones erradas muy extendidas sobre cómo funcionan estas lenguas.
Comparada con la transcripción de voz, la traducción de lengua de señas presenta dos desafíos centrales:
- No es un mapeo secuencial. Transcribir habla consiste en pasar de sonido a texto dentro de un mismo idioma. Las lenguas de señas son lenguas naturales independientes, con gramáticas y léxicos propios, así que exigen traducción automática real y no una conversión seña por palabra.
- El modelo debe "ver" movimiento. El significado se transmite con movimientos simultáneos de manos, brazos, torso, cabeza y rostro. Seguirlos con precisión a alta tasa de cuadros es una tarea de visión por computador exigente en cómputo.
Con ese telón de fondo se entiende por qué intentos tempranos como los guantes traductores de señas quedaron limitados de raíz: las lenguas de señas no son "inglés hecho con las manos". Requieren percepción visual fina de todo el cuerpo y traducción lingüística completa. SL2T apunta a resolver ambas.
¿Cómo funciona SL2T por dentro?
El modelo fue entrenado con más de 100.000 horas de datos en más de 50 lenguas de señas, con cerca de un cuarto del material en ASL. Entrenar de manera conjunta sobre lenguas, dialectos y niveles de dominio diversos hace que el modelo aprenda estructuras subyacentes compartidas y supere, en los experimentos de Google, a los modelos entrenados en una sola lengua.
Para resguardar la privacidad, SL2T no recibe el video de la cámara: ve la lengua de señas como una secuencia de coordenadas de puntos corporales. Un modelo que corre en el dispositivo, MediaPipe Holistic, rastrea la ubicación de esos puntos sobre la persona, y solo esas coordenadas geométricas viajan al servidor para la traducción, lo que permite descartar el video original de inmediato.
SL2T traduce esa secuencia de coordenadas directamente a texto, saltándose las anotaciones intermedias conocidas como glosas, muy usadas en trabajos previos. Las glosas no capturan aspectos ricos y no lineales de estas lenguas, como los marcadores no manuales y las construcciones espaciales. Traducir directo desde los landmarks elimina límites artificiales de vocabulario y permite que la calidad escale con los datos.
| Enfoque | Entrada | Límite principal |
|---|---|---|
| Guantes de señas | Sensores en las manos | Ignora rostro, torso y espacio |
| Traducción vía glosas | Anotación intermedia | Vocabulario acotado, pierde matices |
| SL2T | Landmarks de pose | Escala con datos, sin video al servidor |
En los benchmarks clave, como FLEURS-ASL (sd-test), que mide calidad de traducción de ASL a inglés, SL2T logra un puntaje zero-shot de 70 BLEURT, muy por encima de cualquier resultado reportado antes. Google advierte que optimizar benchmarks académicos no garantiza usabilidad real, así que trabajó en problemas prácticos: minimizar la latencia en streaming, evitar alucinaciones cuando la entrada no contiene señas, asegurar equidad para el 10% de personas que señan con la zurda y mejorar el desempeño del señado con una sola mano, que es justamente lo que ocurre cuando la otra sostiene el teléfono.
Construido con la comunidad sorda
Google sostiene que el desarrollo se hizo con la comunidad sorda y no solo para ella. La conceptualización estuvo a cargo de Sam Sepah, trabajador sordo de Google, y hubo participación sorda en la recolección de datos, la evaluación en estudios de usuarios y la evaluación de impacto con expertos sordos.
Para guiar el despliegue, se creó el AI Sign Language Advisory Committee (AISLAC), que reúne a organizaciones de personas sordas de distintos países y a especialistas del área. Bajo ese modelo de gobernanza participativa, la compañía publicó un reporte de impacto conjunto para el lanzamiento de SL2T 1.0 en Gboard y Live Transcribe, donde detalla capacidades y limitaciones actuales.
¿Cuándo llega a Chile y a la región?
Acá está el matiz regional. La primera versión cubre ASL hacia el inglés, así que la lengua de señas chilena (LSCh) queda fuera del alcance inicial, igual que la lengua de señas mexicana o la argentina. En Chile la LSCh tiene reconocimiento legal desde 2021 como lengua de las personas sordas, y los servicios públicos ya operan con intérpretes acreditados, pero ninguna de esas capas se automatiza con este lanzamiento.
Lo que sí es relevante para la región es la arquitectura: como el modelo consume landmarks de pose y no video crudo, el requisito de hardware local queda acotado a correr MediaPipe Holistic en el dispositivo, algo que ya funciona en gama media y no exige un Pixel 11. Si Google abre lenguas adicionales, el cuello de botella para el español de Chile será de datos y de convenios con la comunidad sorda local, no de silicio.
Google señaló que su equipo trabaja en expandir la tecnología a más lenguas de señas, en generación de lengua de señas y en capacidades de frontera. Por ahora, SL2T se puede probar en Gboard y Live Transcribe en el Pixel 11, sin costo adicional.




