最新ニュース
あなたへのおすすめ

Google DeepMindがPixel 11にSL2T手話モデルを搭載

によるハンナ・コリモアハンナ・コリモア 3分で読む
Google DeepMindがPixel 11にSL2T手話モデルを搭載
  • Google DeepMindは、手話をテキストに変換するモデル「SL2T」をリリースしました。これはPixel 11のGboardとLive Transcribeに搭載されています。.
  • このモデルは文字起こしではなく翻訳を行い、注釈を省略し、デバイス上のMediaPipe Holisticを使用することで、幾何学的座標のみが電話機から送信されるようにしています。.
  • SL2Tは現在、アメリカ手話から英語への翻訳のみに対応していますが、今後さらに多くの言語や手話生成モデルに対応していく予定です。.

 

Google DeepMindは、SL2Tと呼ばれる手話からテキストへの変換モデルを公開しました。このモデルは、新しいPixel 11のGboardとLive Transcribeに搭載される予定です。. 

同社 によれば、 これは実際の消費者向け製品に搭載される初の手話AIだという。 

入力する代わりにスマートフォンに手話で話しかける

聴覚と発話能力のある人々は、何年も前から音声認識機能を使ってデバイスに話しかけることができた。. 

SL2Tのおかげで、音声入力で話すことができないものの手話を使う人は、Pixel 11デバイスを使ってインターネットを利用したり、メッセージを作成したり、文書を編集したりできるようになりました。. 

署名者はジェミニにタスクを委任することもできます 

Live Transcribeでは、ユーザーは対面での会話中に、文字を入力する代わりに手話で返答することができます。.

現在、このモデルはアメリカ手話(ASL)から英語への翻訳のみに対応しています。Googleによると、今後、対応デバイスと対応言語を拡大していく予定です。.

モデルのテスト担当者らは、アメリカ手話(ASL)での手話は英語でのタイピングよりも速く、より自然だと述べていると伝えられている。.

なぜAIにとって手話は音声よりも難しいのか?

DeepMindは手話を「手で表現した英語」ではなく、完全な自然言語として捉えている。 

しかし、音声言語AIと比較すると、その開発は遅れている。その主な理由は2つの課題にある。.

まず一つ目は、手話には独自の文法と語彙があるため、システムは文字起こしではなく翻訳する必要があるということです。また、手話は手、腕、胴体、頭、顔を同時に動かして意味を伝えるため、正確に tracには高度なコンピュータビジョン技術が求められます。.

これまでにもこうした解決策の開発は試みられてきたが、そのほとんどは失敗に終わった。その一つである手話グローブは、手の形だけを読み取り、体の他の部分を無視していたことが失敗の一因だった。SL2Tは、視覚認識と翻訳の両方を処理するように設計されている。.

モデルがビデオとプライバシーをどのように扱うか

SL2Tは生の映像をクラウドに送信しません。MediaPipe Holisticと呼ばれるデバイス上のコンピュータビジョンコンポーネントが、手話話者の顔、手、腕、胴体を幾何学的座標にマッピングし、その座標のみがGoogleのサーバーに送信されます。DeepMindによると、これにより実際のビデオがスマートフォン内に保持され、処理速度が向上するとのことです。.

このモデルは、目印となる一連の表現をそのままテキストに変換し、グロスと呼ばれる中間ラベルを省略します。DeepMindによると、グロスは語彙を制限し、ASL(アメリカ手話)が依拠する非手動的なマーカーや空間的な文法を見落としてしまうとのことです。. 

Googleは、50種類以上の手話(うち約4分の1はアメリカ手話)を網羅した10万時間以上のデータを用いてSL2Tをトレーニングし、FLEURS-ASLベンチマークでBLEURTスコア70を達成したと報告している。このモデルは片手手話や左手手話にも対応しており、レイテンシー最適化機能も搭載。さらに、カメラが手話以外の動きを捉えた際に誤認識によるテキスト表示を防ぐ仕組みも備えている。.

Googleは今回のローンチに向けてどのような準備を進めているのか?

Googleは、AI手話技術の導入方法を指導するため、聴覚障害者団体や手話専門家からなるAI手話諮問委員会を設置した。同委員会は、このモデルが現在できることとできないことをまとめた報告書を共同執筆する予定だ。. 

次に予定されているのは、より多くの手話言語を追加すること、そして手話を読み取るだけでなく、手話を生成するモデルを開発することです。.

一般向けリリースに向けては、しばらく前から準備が進められてきた。DeepMind が以前、SignGemmaと呼ばれる手話モデルを予告していた後、Android Authorityは2026年7月17日にGboardのベータ版に手話テキスト変換オプションを発見した 

今回のローンチは、研究所にとって激動の時期に重なった。2026年8月初旬、 デミス・ハサビスは DeepMindのCEOから会長に就任し、コライ・カヴクチュオールが日常業務を引き継いだ。Geminiアプリの月間アクティブユーザー数は9億5000万人を突破した。

仮想通貨ニュースを読むだけでなく、理解を深めましょう。ニュースレターにご登録ください。 無料です

よくある質問

SL2Tとは何ですか?また、どのような機能がありますか?

SL2Tは、Google DeepMindが開発した手話からテキストへの変換モデルで、聴覚障害のあるユーザーが手話を使ってスマートフォンを検索したり、メッセージを作成したり、文書を編集したり、Geminiに指示を出したりすることを可能にします。また、Live Transcribeでは手話による返信にも対応しています。.

SL2Tはリリース時にどのデバイスと言語に対応していますか?

Pixel 11に搭載されたGboardとLive Transcribeに内蔵されたこの機能は、現時点ではアメリカ手話から英語への翻訳のみに対応しており、今後対応機種と対応言語を拡大していく予定です。.

SL2Tはどのようにユーザーのプライバシーを保護しますか?

MediaPipe Holisticと呼ばれるデバイス内モデルは、手話話者の動きを幾何学的座標に変換し、その座標のみをGoogleのサーバーに送信するため、実際の動画はスマートフォン内に保持される。.

この記事を共有する
ハンナ・コリモア

ハンナ・コリモア

ハンナは、暗号資産分野で10年近くにわたりブログ執筆やイベントレポートに携わってきたライター兼エディターです。Cryptopolitan Cryptopolitan、ニュースページに記事を寄稿し、 DeFi、RWA、暗号資産規制、AI、最先端技術産業における最新の動向をレポート・分析しています。アーカディア大学で経営学の学位を取得しています。.

もっと…ニュース