DERNIÈRES NOUVELLES
SÉLECTIONNÉ POUR VOUS

Google DeepMind intègre le modèle de langue des signes SL2T sur le Pixel 11

ParHannah CollymoreHannah Collymore 3 minutes de lecture
Google DeepMind intègre le modèle de langue des signes SL2T sur le Pixel 11
  • Google DeepMind a lancé SL2T, un modèle de transcription de la langue des signes intégré à Gboard et Live Transcribe sur le Pixel 11.
  • Le modèle traduit plutôt que de transcrire, en omettant les gloses et en utilisant MediaPipe Holistic sur l'appareil, de sorte que seules les coordonnées géométriques quittent le téléphone.
  • SL2T ne gère actuellement que la traduction de la langue des signes américaine (ASL) vers l'anglais, mais d'autres langues et modèles de génération de signes sont prévus dans sa feuille de route.

 

Google DeepMind a publié un modèle de transcription de la langue des signes en texte appelé SL2T, qui sera intégré à Gboard et Live Transcribe sur le nouveau Pixel 11. 

L' entreprise affirme qu'il s'agit de la première IA de langue des signes intégrée à un véritable produit grand public. 

Signer au téléphone au lieu de taper

Les personnes capables d'entendre et de parler peuvent utiliser la dictée vocale pour parler à leurs appareils depuis des années. 

Désormais, grâce à SL2T, ceux qui ne peuvent pas prononcer un discours pour utiliser la dictée vocale mais qui utilisent la langue des signes peuvent interagir avec Internet, rédiger un message ou modifier un document à l'aide de leur appareil Pixel 11. 

Les signataires peuvent également confier une tâche aux Gémeaux 

Dans Live Transcribe, un utilisateur peut signer une réponse pendant une conversation en face à face au lieu de la saisir manuellement.

Actuellement, le modèle ne prend en charge que la traduction de la langue des signes américaine (ASL) vers l'anglais. Google indique que le modèle sera déployé sur davantage d'appareils à l'avenir, ainsi que dans d'autres langues.

Les testeurs de modèles auraient décrit la signature en langue des signes américaine comme étant plus rapide et plus naturelle que la saisie au clavier en anglais.

Pourquoi le langage des signes est-il plus difficile que la parole pour l'IA ?

DeepMind considère les langues des signes comme des langues naturelles à part entière, et non comme un simple « anglais gestuel » 

Cependant, son développement a pris du retard par rapport à l'IA du langage parlé, principalement en raison de deux défis.

Premièrement, les langues des signes possèdent leur propre grammaire et leur propre vocabulaire ; le système doit donc les traduire plutôt que de les trac. De plus, elles transmettent simultanément du sens par les mains, les bras, le torse, la tête et le visage, ce qui représente un défi de taille pour la vision par ordinateur.

Des tentatives antérieures de développement de ces solutions ont été menées, mais la plupart ont échoué. Parmi elles, les gants de langue des signes, l'échec s'explique en partie par le fait qu'ils ne lisaient que la forme des mains et ignoraient le reste du corps. SL2T a été conçu pour gérer à la fois la perception visuelle et la traduction.

Comment le modèle gère la vidéo et la confidentialité

SL2T n'envoie pas les images brutes vers le cloud. Un composant de vision par ordinateur intégré à l'appareil, appelé MediaPipe Holistic, transforme le visage, les mains, les bras et le torse du signeur en coordonnées géométriques ; seules ces coordonnées sont transmises aux serveurs de Google. DeepMind affirme que cela permet de conserver la vidéo sur le téléphone et d'accélérer le processus.

Le modèle traduit directement ces séquences de repères en texte, en ignorant les étiquettes intermédiaires appelées gloses. Selon DeepMind, les gloses limitent le vocabulaire et ne rendent pas compte des marqueurs non manuels ni de la grammaire spatiale sur lesquels repose la LSF. 

Google a entraîné SL2T sur plus de 100 000 heures de données couvrant plus de 50 langues des signes, dont environ un quart en langue des signes américaine (ASL), et a obtenu un score de 70 BLEURT sur le benchmark FLEURS-ASL. Le modèle prend également en charge la signature à une main et la signature de la main gauche, intègre des optimisations de latence et dispose de mécanismes conçus pour éviter l'affichage erroné de texte lorsque la caméra détecte des mouvements non liés à la signature.

Que met en place Google autour de ce lancement ?

Google a mis en place un comité consultatif sur l'IA et la langue des signes, composé d'organisations de personnes sourdes et d'experts en langue des signes, afin d'orienter le déploiement de cette technologie. Ce comité co-rédigera un rapport sur les capacités et les limites actuelles du modèle. 

La prochaine étape prévue est l'ajout de davantage de langues des signes et de modèles qui génèrent le langage des signes plutôt que de simplement le lire.

La version grand public est en préparation depuis un certain temps. Android Authority a repéré une option de transcription en texte par signes dans une version bêta de Gboard le 17 juillet 2026, après que DeepMind ait précédemment présenté un modèle de langue des signes appelé SignGemma. 

Ce lancement intervient également dans une période tumultueuse pour le laboratoire. Début août 2026, Demis Hassabis a quitté son poste de PDG de DeepMind pour devenir président, et Koray Kavukcuoglu a pris en charge les opérations quotidiennes, l'application Gemini comptant désormais plus de 950 millions d'utilisateurs mensuels.

Ne vous contentez pas de lire les actualités crypto. Comprenez-les. Abonnez-vous à notre newsletter. C'est gratuit.

FAQ

Qu'est-ce que SL2T et à quoi sert-il ?

SL2T est le modèle de Google DeepMind de conversion du langage des signes en texte qui permet aux utilisateurs sourds et malentendants de signer sur leur téléphone pour effectuer des recherches, écrire des messages, modifier des documents ou interroger Gemini, avec une prise en charge des réponses signées dans Live Transcribe.

Quels appareils et quelles langues SL2T prend-il en charge à son lancement ?

Lancée sur le Pixel 11 avec Gboard et Live Transcribe, cette application traduit pour l'instant uniquement la langue des signes américaine vers l'anglais, mais d'autres appareils et langues sont prévus.

Comment SL2T protège-t-il la vie privée des utilisateurs ?

Un modèle embarqué appelé MediaPipe Holistic convertit les mouvements du signeur en coordonnées géométriques et n'envoie que celles-ci aux serveurs de Google, la vidéo elle-même restant sur le téléphone.

Partagez cet article
Hannah Collymore

Hannah Collymore

Hannah est rédactrice et éditrice, forte d'une expérience de près de dix ans dans la rédaction de blogs et la couverture d'événements liés aux cryptomonnaies. Chez Cryptopolitan, elle contribue à la page d'actualités en rédigeant des articles et en analysant les dernières évolutions de la finance décentralisée DeFi, des comptes gérés par les utilisateurs (RWA), de la réglementation des cryptomonnaies, de l'intelligence artificielle (IA) et des technologies de pointe. Elle est diplômée en administration des affaires de l'université Arcadia.

PLUS D'ACTUALITÉS