Google DeepMind lanza el modelo de lenguaje de señas SL2T en el Pixel 11

- Google DeepMind ha lanzado SL2T, un modelo de conversión de lenguaje de señas a texto que viene integrado en Gboard y Live Transcribe en el Pixel 11.
- El modelo traduce en lugar de transcribir, omitiendo las glosas y utilizando MediaPipe Holistic en el dispositivo, de modo que solo las coordenadas geométricas salen del teléfono.
- Actualmente, SL2T solo admite la traducción de ASL al inglés, pero tiene previsto añadir más idiomas y modelos de generación de signos.
Google DeepMind ha lanzado un modelo de conversión de lenguaje de señas a texto llamado SL2T, que estará integrado en Gboard y Live Transcribe en el nuevo Pixel 11.
La compañía afirma que es la primera IA de lenguaje de señas que se comercializa en un producto de consumo real.
Hacer señas al teléfono en lugar de escribir
Las personas que pueden oír y hablar han podido utilizar el dictado por voz para comunicarse con sus dispositivos durante años.
Ahora, quienes no pueden articular un discurso para utilizar el dictado por voz, pero usan el lenguaje de señas, pueden interactuar con Internet, redactar un mensaje o editar un documento utilizando su dispositivo Pixel 11, gracias a SL2T.
Los firmantes también pueden encomendarle una tarea a Géminis
En Live Transcribe, un usuario puede firmar una respuesta durante una conversación cara a cara en lugar de escribirla tecleando.
Actualmente, este modelo solo traduce del lenguaje de señas americano (ASL) al inglés. Google afirma que en el futuro se implementará en más dispositivos y se añadirán más idiomas.
Según se informa, los usuarios que probaron el modelo describieron el lenguaje de señas estadounidense (ASL) como más rápido y natural que escribir en inglés.
¿Por qué el lenguaje de señas es más difícil de comprender para la IA que el lenguaje hablado?
DeepMind considera que los lenguajes de señas son lenguajes naturales completos, no "inglés escrito con las manos"
Sin embargo, su desarrollo se ha quedado rezagado en comparación con la IA del lenguaje hablado, debido en gran parte a dos desafíos.
En primer lugar, los lenguajes de señas tienen su propia gramática y vocabulario, por lo que el sistema debe traducirlos en lugar de transcribirlos. Además, transmiten significado a través de las manos, los brazos, el torso, la cabeza y el rostro simultáneamente, lo que supone un reto complejo para la visión artificial a la hora de realizar un tracpreciso.
Si bien ya se habían realizado intentos previos para desarrollar estas soluciones, la mayoría fracasaron. Uno de ellos, los guantes de lenguaje de señas, fracasó en parte porque solo reconocían la forma de las manos e ignoraban el resto del cuerpo. SL2T se diseñó para gestionar tanto la percepción visual como la traducción.
Cómo el modelo gestiona el vídeo y la privacidad
SL2T no envía el material grabado a la nube. Un componente de visión artificial integrado en el dispositivo, llamado MediaPipe Holistic, mapea el rostro, las manos, los brazos y el torso del intérprete en coordenadas geométricas, y solo esas coordenadas se envían a los servidores de Google. DeepMind afirma que esto mantiene el vídeo original en el teléfono y agiliza el proceso.
El modelo traduce esas secuencias de puntos de referencia directamente a texto, omitiendo las etiquetas intermedias conocidas como glosas. Según DeepMind, las glosas limitan el vocabulario y no incluyen los marcadores no manuales ni la gramática espacial en los que se basa el lenguaje de señas americano (ASL).
Google entrenó SL2T con más de 100 000 horas de datos que abarcan más de 50 lenguas de señas, aproximadamente una cuarta parte de ellas en ASL, y obtuvo una puntuación de 70 BLEURT en la prueba de referencia FLEURS-ASL. El modelo también admite la comunicación con una mano y con la mano izquierda, incluye optimizaciones de latencia y cuenta con mecanismos para evitar que genere texto de forma aleatoria cuando la cámara detecta movimientos que no corresponden a la comunicación con señas.
¿Qué está preparando Google en torno al lanzamiento?
Google ha creado un Comité Asesor de Lenguaje de Señas con Inteligencia Artificial, integrado por organizaciones de personas sordas y expertos en lenguaje de señas, para orientar la implementación de esta tecnología. El comité elaborará conjuntamente un informe sobre las capacidades y limitaciones actuales del modelo.
El siguiente paso en la hoja de ruta es la incorporación de más lenguas de señas y modelos que generen lenguaje de señas en lugar de solo leerlo.
El lanzamiento para el consumidor lleva gestándose un tiempo. Android Authority descubrió una opción de conversión de signos a texto en una versión beta de Gboard el 17 de julio de 2026, después de que DeepMind hubiera presentado previamente un modelo de lenguaje de señas llamado SignGemma.
El lanzamiento también coincide con un periodo turbulento para el laboratorio. A principios de agosto de 2026, Demis Hassabis pasó de ser director ejecutivo de DeepMind a presidente, y Koray Kavukcuoglu asumió la dirección de las operaciones diarias, con la aplicación Gemini superando ya los 950 millones de usuarios mensuales.
No te limites a leer noticias sobre criptomonedas. Entiéndelas. Suscríbete a nuestro boletín. Es gratis.
Preguntas frecuentes
¿Qué es SL2T y para qué sirve?
SL2T es el modelo de conversión de lenguaje de señas a texto de Google DeepMind que permite a los usuarios sordos o con discapacidad auditiva comunicarse mediante señas con su teléfono para buscar, escribir mensajes, editar documentos o interactuar con Gemini, con soporte para responder mediante señas en Live Transcribe.
¿Qué dispositivos e idiomas admite SL2T en su lanzamiento?
Se lanzó en el Pixel 11 integrado en Gboard y Live Transcribe, y por ahora solo traduce el lenguaje de señas americano al inglés, aunque se planea añadir más dispositivos e idiomas.
¿Cómo protege SL2T la privacidad del usuario?
Un modelo integrado en el dispositivo, llamado MediaPipe Holistic, convierte los movimientos del intérprete en coordenadas geométricas y envía solo esas a los servidores de Google, de modo que el vídeo real permanece en el teléfono.

Hannah Collymore
Hannah es escritora y editora con casi una década de experiencia en redacción de blogs y reportajes sobre eventos en el ámbito de las criptomonedas. En Cryptopolitan, colabora en la sección de noticias, informando y analizando las últimas novedades en DeFi, RWA, regulación de criptomonedas, IA y tecnologías de vanguardia. Se graduó en Administración de Empresas por la Universidad de Arcadia.
















