ПОСЛЕДНИЕ НОВОСТИ
ПОДОБРАНО ДЛЯ ВАС

Компания Google DeepMind поставляет модель языка жестов SL2T на Pixel 11

КХанна КоллиморХанна Коллимор 3 минуты чтения
Компания Google DeepMind поставляет модель языка жестов SL2T на Pixel 11
  • Компания Google DeepMind выпустила SL2T, модель преобразования языка жестов в текст, которая интегрирована в Gboard и Live Transcribe на смартфоне Pixel 11.
  • Модель выполняет не транскрибирование, а перевод, пропуская пояснения и используя встроенную технологию MediaPipe Holistic, благодаря чему с телефона передаются только геометрические координаты.
  • В настоящее время SL2T обрабатывает только перевод с американского жестового языка на английский, в планах — поддержка других языков и моделей генерации жестов.

 

Компания Google DeepMind выпустила модель преобразования языка жестов в текст под названием SL2T, которая будет интегрирована в Gboard и Live Transcribe на новом Pixel 11. 

Компания заявляет, что это первый искусственный интеллект, использующий язык жестов, который был внедрен в реальный потребительский продукт. 

Подписание данных на телефоне вместо набора текста

Люди, способные слышать и говорить, уже много лет могут использовать голосовой ввод для общения со своими устройствами. 

Теперь те, кто не может использовать голосовой ввод, но пользуется языком жестов, могут взаимодействовать с интернетом, составлять сообщения или редактировать документы с помощью своего устройства Pixel 11 благодаря SL2T. 

Подписавшие соглашение также могут поручить задачу Близнецам 

В функции Live Transcribe пользователь может подписать ответ во время личной беседы, вместо того чтобы набирать его на клавиатуре.

В настоящее время модель поддерживает перевод с американского жестового языка (ASL) на английский. Google заявляет, что в будущем эта модель будет внедрена на большее количество устройств, а также будет поддерживать больше языков.

Как сообщается, тестировщики моделей описали использование языка жестов ASL как более быстрый и естественный способ общения, чем набор текста на английском языке.

Почему язык жестов сложнее для искусственного интеллекта, чем речь?

Компания DeepMind рассматривает языки жестов как полноценные естественные языки, а не как «английский язык на руках» 

Однако по сравнению с искусственным интеллектом, способным обрабатывать разговорную речь, его развитие отстает, в основном из-за двух проблем.

Во-первых, языки жестов имеют свою собственную грамматику и лексику, поэтому система должна их переводить, а не транскрибировать. Кроме того, они передают смысл одновременно через руки, предплечья, туловище, голову и лицо, что представляет собой сложную задачу для точного tracв системах компьютерного зрения.

Ранее предпринимались попытки разработки подобных решений, но большинство из них потерпели неудачу. Одно из них, перчатки для языка жестов, провалилось отчасти потому, что они считывали только форму кисти, игнорируя остальную часть тела. SL2T был разработан для обработки как визуального восприятия, так и перевода.

Как модель обрабатывает видео и обеспечивает конфиденциальность

SL2T не отправляет необработанные видеоматериалы в облако. Компонент компьютерного зрения на устройстве, называемый MediaPipe Holistic, преобразует лицо, руки, предплечья и туловище говорящего в геометрические координаты, и только эти координаты передаются на серверы Google. DeepMind утверждает, что это позволяет хранить само видео на телефоне и ускоряет обработку данных.

Модель переводит эти последовательности ключевых элементов непосредственно в текст, пропуская промежуточные метки, известные как глоссарии. По данным DeepMind, глоссарии ограничивают словарный запас и упускают невербальные маркеры и пространственную грамматику, на которых основан американский жестовый язык (ASL). 

Компания Google обучила модель SL2T на более чем 100 000 часах данных, охватывающих более 50 языков жестов, примерно четверть из которых — американский язык жестов (ASL), и сообщила о результате в 70 баллов по шкале BLEURT в бенчмарке FLEURS-ASL. Модель также поддерживает жестикуляцию одной рукой и левой рукой, включает оптимизацию задержки и имеет механизмы, предназначенные для предотвращения искажения текста, когда камера фиксирует движения, не связанные с жестикуляцией.

Что именно Google разрабатывает в преддверии запуска?

Компания Google создала Консультативный комитет по языку жестов с участием организаций глухих и экспертов по языку жестов, чтобы определить, как внедрять эту технологию, и комитет станет соавтором отчета о том, что модель может и чего пока не может делать. 

Следующим шагом в разработке станет добавление большего количества языков жестов и моделей, которые генерируют язык жестов, а не только читают его.

Разработка потребительской версии велась уже некоторое время. 17 июля 2026 года издание Android Authority обнаружило функцию преобразования жестов в текст в бета-версии Gboard, после того как DeepMind ранее анонсировала модель языка жестов под названием SignGemma. 

Запуск приложения также приходится на непростой период для лаборатории. В начале августа 2026 года Демис Хассабис перешел с поста генерального директора DeepMind на должность председателя совета директоров, а Корай Кавукчуоглу взял на себя повседневное управление, и теперь приложение Gemini насчитывает более 950 миллионов ежемесячных пользователей.

Не просто читайте новости о криптовалютах. Разберитесь в них. Подпишитесь на нашу рассылку. Это бесплатно.

Часто задаваемые вопросы

Что такое SL2T и для чего он нужен?

SL2T — это модель преобразования языка жестов в текст от Google DeepMind, которая позволяет глухим и слабослышащим пользователям использовать язык жестов на своих телефонах для поиска, написания сообщений, редактирования документов или подсказок Gemini, а также поддерживает перевод ответов на вопросы в режиме реального времени с помощью жестового языка в Live Transcribe.

Какие устройства и языки поддерживает SL2T на момент запуска?

Приложение было запущено на Pixel 11 в составе Gboard и Live Transcribe и пока переводит американский язык жестов только на английский, в планах — поддержка других устройств и языков.

Как SL2T защищает конфиденциальность пользователей?

Встроенная в устройство модель MediaPipe Holistic преобразует движения пользователя в геометрические координаты и отправляет на серверы Google только их, поэтому само видео остается на телефоне.

Поделитесь этой статьей
Ханна Коллимор

Ханна Коллимор

Ханна — писательница и редактор с почти десятилетним опытом ведения блогов и освещения мероприятий в криптопространстве. В CryptopolitanХанна пишет для новостной страницы, освещая и анализируя последние события в DeFi, RWA, регулирования криптовалют, ИИ и передовых технологических отраслей. Она окончила университет Аркадия со степенью в области делового администрирования.

ЕЩЕ… НОВОСТИ