JUE, 13 / AGO / 2026

DeepMind presenta un avanzado modelo que traduce el lenguaje de señas

Con SL2T es posible chatear, navegar por la web, consultar un sistema de IA y muchas otras tareas gracias a un sistema de interpretación en tiempo real. Aunque de principio se utiliza el sistema americano y el inglés, el objetivo es ampliar las opciones muy pronto.

Casi cada día que pasa una nueva variación de un modelo de inteligencia artificial promete ser el más avanzado hasta el momento. Pero rara vez ofrecen algo verdaderamente interesante o puntual que nos sorprenda. El miercoles el laboratorio DeepMind de Google presentó el modelo SL2T, un sistema que permite trasladar el lenguaje de señas al texto.

Aunque hace ya décadas que las IA son capaces de hablar el lenguaje de señas, hasta ahora esta función no había llegado al común de las personas. S2LT es el intento de DeepMind por llevar tal capacidad del laboratorio al día a día. La tarea no es poca cosa, dado que por un lado tenemos diversos idiomas y por el otro una gran variedad de lenguajes de señas. Mexicanos y Argentinos hablamos español, pero no tenemos necesariamente el mismo sistema de señas. El primer paso de Google se da en el Pixel 11 con el sistema americano de señas y el inglés. Sin embargo la compañía espera ir agregando más opciones muy pronto.

Para todo uso

La idea es comunicarse con señas con un dispositivo de la misma manera en que lo hacemos con instrucciones de voz. No solo se trata de pasar los gestos a un texto. Los lenguajes de signos permitirán que los usuarios naveguen por Internet, escriban documentos o hagan consultas a un sistema de IA. Durante una conversación los signos pueden ser transformados en tiempo real a una velocidad que en las pruebas ha sido mayor a la de la conseguida con un teclado.

Desafío

Los desarrolladores señalan que uno de los más grandes desafíos es que en los lenguajes que todos conocemos se produce una secuencia de sonidos que puede ser mapeada y llevada a texto con cierta facilidad. Pero en el lenguaje de señas la gramática y los términos son propios, no simples equivalentes. La IA también debe aprender a ver y comprender todos los movimientos de las manos, los brazos, el torso, la cabeza y el rostro. Y esta tarea es más compleja. El modelo de DeepMind fue entrenado con más de 100 mil horas de datos y en más de 50 lenguajes de señas. Aunque un cuarto del total del material estaba en el sistema americano.

SLT2 ve los signos como una serie de secuencias de con ciertos puntos claves. No interpreta de forma directa las imágenes de la cámara. Solo esa información llega a los servidores por motivos de seguridad.

Comentarios
¡Comparte esta noticia!

Comments are closed.