O Google DeepMind lança o modelo de linguagem gestual SL2T no Pixel 11

- O Google DeepMind lançou o SL2T, um modelo de conversão de linguagem gestual em texto que estará disponível no Gboard e no Live Transcribe do Pixel 11.
- O modelo traduz em vez de transcrever, ignorando glossários e usando o MediaPipe Holistic no próprio dispositivo, de forma que apenas as coordenadas geométricas saiam do telefone.
- Atualmente, o SL2T lida apenas com a tradução de ASL para inglês, mas há planos para adicionar mais idiomas e modelos de geração de sinais.
O Google DeepMind lançou um modelo de conversão de linguagem gestual em texto chamado SL2T, que estará integrado ao Gboard e ao Live Transcribe no novo Pixel 11.
A empresa afirma ser a primeira IA de linguagem gestual a ser lançada em um produto comercial real.
Assinar pelo telefone em vez de digitar
Pessoas que conseguem ouvir e falar têm usado a digitação por voz para interagir com seus dispositivos há anos.
Agora, aqueles que não conseguem se comunicar por meio de ditado por voz, mas usam a língua de sinais, podem interagir com a internet, redigir mensagens ou editar documentos usando seus dispositivos Pixel 11, graças ao SL2T.
Os signatários também podem delegar uma tarefa a Gêmeos
Na transcrição ao vivo, o usuário pode assinar uma resposta durante uma conversa presencial, em vez de digitá-la.
Atualmente, o modelo suporta apenas a tradução da Língua de Sinais Americana (ASL) para o inglês. O Google afirma que o modelo será disponibilizado para mais dispositivos no futuro, juntamente com mais idiomas.
Segundo relatos, os participantes dos testes descreveram a linguagem de sinais americana (ASL) como mais rápida e natural do que digitar em inglês.
Por que a linguagem de sinais é mais difícil para a IA do que a fala?
A DeepMind considera as línguas de sinais como línguas naturais plenas, e não como "inglês nas mãos"
No entanto, seu desenvolvimento tem ficado atrás em comparação com a IA de linguagem falada, principalmente devido a dois desafios.
A primeira questão é que as línguas de sinais têm gramática e vocabulário próprios, então o sistema precisa traduzi-las em vez de transcrevê-las. Elas também transmitem significado simultaneamente por meio das mãos, braços, tronco, cabeça e rosto, o que representa um desafio complexo para a visão computacional, que precisa traccom precisão.
Já houve tentativas anteriores de desenvolver essas soluções, mas a maioria falhou. Uma delas, as luvas de linguagem de sinais, falhou em parte porque lia apenas os formatos das mãos e ignorava o resto do corpo. O SL2T foi desenvolvido para lidar tanto com a percepção visual quanto com a tradução.
Como o modelo lida com vídeo e privacidade
O SL2T não envia imagens brutas para a nuvem. Um componente de visão computacional integrado ao dispositivo, chamado MediaPipe Holistic, mapeia o rosto, as mãos, os braços e o tronco do usuário em coordenadas geométricas, e somente essas coordenadas são enviadas para os servidores do Google. A DeepMind afirma que isso mantém o vídeo original no telefone e torna o processo mais rápido.
O modelo traduz essas sequências de pontos de referência diretamente em texto, ignorando os rótulos intermediários conhecidos como glossários. De acordo com a DeepMind, os glossários limitam o vocabulário e não incluem os marcadores não manuais e a gramática espacial nos quais a ASL se baseia.
O Google treinou o SL2T com mais de 100.000 horas de dados abrangendo mais de 50 línguas de sinais, sendo cerca de um quarto em ASL (Língua de Sinais Americana), e registrou uma pontuação de 70 BLEURT no benchmark FLEURS-ASL. O modelo também suporta sinais com uma mão e com a mão esquerda, inclui otimizações de latência e possui mecanismos para evitar que ele interprete erroneamente o texto quando a câmera captura movimentos que não sejam sinais.
O que o Google está desenvolvendo em torno do lançamento?
O Google criou um Comitê Consultivo de IA para Língua de Sinais com organizações de surdos e especialistas em língua de sinais para orientar a implementação da tecnologia, e o comitê será coautor de um relatório sobre o que o modelo pode e ainda não pode fazer.
O próximo passo no planejamento é a adição de mais línguas de sinais e modelos que geram linguagem de sinais em vez de apenas lê-la.
O lançamento para o consumidor já vinha sendo preparado há algum tempo. O Android Authority descobriu uma opção de conversão de sinais em texto dentro de uma versão beta do Gboard em 17 de julho de 2026, depois que a DeepMind havia divulgado anteriormente um modelo de linguagem de sinais chamado SignGemma.
O lançamento também ocorre em um período turbulento para o laboratório. No início de agosto de 2026, Demis Hassabis deixou o cargo de CEO da DeepMind para se tornar presidente do conselho, e Koray Kavukcuoglu assumiu as operações diárias, com o aplicativo Gemini já tendo ultrapassado a marca de 950 milhões de usuários mensais.
Se você está lendo isto, já está um passo à frente. Continue assim assinando nossa newsletter.
Perguntas frequentes
O que é SL2T e o que faz?
SL2T é o modelo de linguagem gestual para texto do Google DeepMind que permite que usuários surdos e com deficiência auditiva usem a linguagem gestual em seus telefones para pesquisar, escrever mensagens, editar documentos ou interagir com o Gemini, com suporte para respostas em linguagem gestual no Live Transcribe.
Quais dispositivos e idiomas o SL2T suporta no lançamento?
O recurso foi lançado no Pixel 11 integrado ao Gboard e ao Live Transcribe, e, por enquanto, traduz apenas a Língua Americana de Sinais para o inglês, com planos de expansão para mais dispositivos e idiomas.
Como a SL2T protege a privacidade do usuário?
Um modelo integrado ao dispositivo, chamado MediaPipe Holistic, converte os movimentos do usuário em coordenadas geométricas e envia apenas essas coordenadas para os servidores do Google, de modo que o vídeo em si permaneça no telefone.

Hannah Collymore
Hannah é escritora e editora com quase uma década de experiência em redação para blogs e cobertura de eventos no universo das criptomoedas. No Cryptopolitan, Hannah contribui para a página de notícias, reportando e analisando os últimos desenvolvimentos em DeFi, RWA, regulamentação de criptomoedas, IA e tecnologias de ponta. Ela se formou em Administração de Empresas pela Universidade Arcadia.
















