최신 뉴스
당신을 위해 엄선되었습니다

구글 딥마인드, 픽셀 11에 SL2T 수화 모델 탑재

에 의해한나 콜리모어한나 콜리모어 읽는 데 3분 소요
구글 딥마인드, 픽셀 11에 SL2T 수화 모델 탑재
  • 구글 딥마인드는 수화를 텍스트로 변환하는 모델인 SL2T를 출시했으며, 이 모델은 픽셀 11의 Gboard 및 Live Transcribe 앱에 내장되어 있습니다.
  • 이 모델은 전사하는 대신 번역하며, 주석을 생략하고 기기 내 MediaPipe Holistic을 사용하여 기하학적 좌표만 휴대폰에서 내보내도록 합니다.
  • SL2T는 현재 미국 수화(ASL)를 영어로만 변환하는 기능을 제공하며, 향후 더 많은 언어와 수화 생성 모델을 추가할 예정입니다.

 

구글 딥마인드는 수화를 텍스트로 변환하는 SL2T라는 모델을 공개했으며, 이 모델은 새로운 픽셀 11의 Gboard와 Live Transcribe에 탑재될 예정입니다. 

회사 측은 자사의 수화 통역 AI가 실제 소비자 제품에 탑재되어 출시되는 최초의 사례라고  밝혔습니다

키보드로 입력하는 대신 휴대폰으로 수화하기

듣고 말할 수 있는 사람들은 이미 오래전부터 음성 인식 기능을 이용해 기기에 말을 걸어 사용할 수 있었습니다. 

이제 음성 인식 기능을 활용하기 위해 말을 구사할 수 없지만 수화를 사용하는 사람들도 SL2T 덕분에 Pixel 11 기기를 사용하여 인터넷과 상호 작용하고, 메시지를 작성하거나 문서를 편집할 수 있습니다. 

서명자들은 쌍둥이자리에게 임무를 맡길 수도 있습니다 

Live Transcribe에서는 사용자가 대면 대화 중에 키보드로 입력하는 대신 수화로 답글을 남길 수 있습니다.

현재 이 모델은 미국 수화(ASL)를 영어로만 변환합니다. 구글은 향후 더 많은 기기와 언어에 이 모델을 확대 적용할 예정이라고 밝혔습니다.

모델 테스트 참가자들은 미국 수화(ASL)로 표현하는 것이 영어로 타이핑하는 것보다 더 빠르고 자연스럽다고 평가했다고 합니다.

인공지능에게 수화는 음성보다 왜 더 어려울까요?

딥마인드는 수화를 "손으로 하는 영어"가 아닌 완전한 자연어로 간주합니다 

하지만 음성 AI에 비해 디지털 AI의 발전은 두 가지 주요 과제 때문에 뒤처져 있습니다.

첫째, 수화는 고유한 문법과 어휘를 가지고 있기 때문에 시스템은 이를 단순히 전사하는 것이 아니라 번역해야 합니다. 또한 수화는 손, 팔, 몸통, 머리, 얼굴을 동시에 사용하여 의미를 전달하는데, 이를 정확하게 trac하는 것은 컴퓨터 비전 기술에 있어 매우 까다로운 과제입니다.

이전에도 이러한 해결책을 개발하려는 시도가 있었지만 대부분 실패했습니다. 그중 하나인 수화 장갑은 손 모양만 인식하고 신체의 다른 부분은 무시했기 때문에 실패했습니다. SL2T는 시각적 인식과 번역 모두를 처리하도록 설계되었습니다.

모델이 비디오와 개인정보 보호를 처리하는 방식

SL2T는 원본 영상을 클라우드로 전송하지 않습니다. MediaPipe Holistic이라는 기기 내 컴퓨터 비전 구성 요소가 수화자의 얼굴, 손, 팔, 몸통을 기하학적 좌표로 변환하고, 이 좌표만 구글 서버로 전송됩니다. 딥마인드는 이를 통해 실제 영상은 휴대폰에 저장되고 처리 속도가 빨라진다고 설명합니다.

이 모델은 랜드마크 시퀀스를 중간 레이블인 '글로스'를 건너뛰고 텍스트로 바로 변환합니다. 딥마인드에 따르면, 글로스는 어휘를 제한하고 ASL(미국 수화)이 의존하는 비수동적 표시와 공간 문법을 놓치게 합니다. 

구글은 50개 이상의 수화 언어에 걸쳐 10만 시간 이상의 데이터를 사용하여 SL2T를 학습시켰으며, 그중 약 4분의 1은 미국 수화(ASL) 데이터입니다. SL2T는 FLEURS-ASL 벤치마크에서 70 BLEURT 점수를 기록했습니다. 또한 한 손 ​​및 왼손 수화를 지원하고, 지연 시간 최적화 기능을 포함하며, 카메라가 수화와 관련 없는 움직임을 포착했을 때 텍스트가 잘못 표시되는 현상을 방지하는 메커니즘을 갖추고 있습니다.

구글은 이번 출시를 위해 무엇을 준비하고 있나요?

구글은 청각 장애인 단체 및 수화 전문가들과 함께 AI 수화 자문위원회를 설립하여 기술 활용 방향을 제시하고, 해당 모델이 현재 할 수 있는 것과 할 수 없는 것에 대한 보고서를 공동으로 작성할 예정이다. 

다음 로드맵에는 더 많은 수화 언어와 수화를 읽는 것뿐 아니라 수화를 생성하는 모델을 추가하는 것이 포함됩니다.

소비자용 버전 출시는 꽤 오랫동안 진행되어 왔습니다. 안드로이드 오소리티(Android Authority)는 발견했는데 , 앞서 딥마인드(DeepMind)는 SignGemma라는 수화 모델을 공개한 바 있습니다. 

이번 출시는 딥마인드 연구소가 격동의 시기를 겪는 가운데 이루어졌습니다. 2026년 8월 초, 데미스 하사비스는 딥마인드 CEO에서 회장으로 자리를 옮겼고, 코라이 카부쿠오글루가 일상적인 운영을 맡게 되었으며, 현재 제미니 앱의 월간 사용자 수는 9억 5천만 명을 넘어섰습니다.

암호화폐 뉴스를 단순히 읽는 데 그치지 마세요. 이해하세요. 저희 뉴스레터를 구독하세요. 무료입니다.

자주 묻는 질문

SL2T는 무엇이며 어떤 역할을 하나요?

SL2T는 구글 딥마인드에서 개발한 수화를 텍스트로 변환하는 모델로, 청각 장애인 및 난청 사용자가 휴대전화에 수화를 입력하여 검색, 메시지 작성, 문서 편집 또는 Gemini에 명령을 내릴 수 있도록 지원하며, 실시간 텍스트 변환 기능을 통해 수화로 답장하는 것도 지원합니다.

SL2T는 출시 시점에 어떤 기기와 언어를 지원하나요?

이 기능은 Pixel 11의 Gboard 및 Live Transcribe 앱에 탑재되어 출시되었으며, 현재는 미국 수화를 영어로만 번역하지만 향후 더 많은 기기와 언어를 지원할 예정입니다.

SL2T는 사용자 개인정보를 어떻게 보호하나요?

MediaPipe Holistic이라는 기기 내 모델은 수화자의 움직임을 기하학적 좌표로 변환하여 해당 좌표만 Google 서버로 전송하므로 실제 영상은 휴대전화에 저장됩니다.

이 기사를 공유하세요
한나 콜리모어

한나 콜리모어

한나는 암호화폐 분야에서 10년 가까이 블로그를 운영하고 행사를 취재해 온 작가 겸 편집자입니다. Cryptopolitan에서 뉴스 페이지에 기고하며, 탈중앙화 DeFi), 반응형 웹 자산(RWA), 암호화폐 규제, 인공지능(AI) 및 첨단 기술 산업의 최신 동향을 보도하고 분석합니다. 아카디아 대학교에서 경영학 학위를 받았습니다.

더 많은 뉴스