Google представляет модель ИИ, предназначенную для понимания языка жестов
SL2T (от англ. sign-language-to-text) — это многоязычная языковая модель перевода, которая впервые представлена на смартфоне Pixel 11, где она обеспечивает работу новой функции диктовки «жест в текст» с помощью экранной клавиатуры Gboard и приложения Live Transcribe. Первоначально модель способна переводить американский язык жестов ASL (American Sign Language) в английский текст. По словам компании, это первая в своем роде модель, доступная в реальном потребительском продукте.
За последние несколько лет возможности искусственного интеллекта по обработке человеческой речи значительно продвинулись. Сейчас любой пользователь может диктовать что угодно на десятках языках мира с помощью смартфона, планшета или персонального компьютера. Но это не относится к тем пользователям, которые из-за проблем со слухом используют один из более чем 200 различных языков жестов. По данным Google, до настоящего времени эта аудитория полностью игнорировалась индустрией ИИ.
Модель SL2T позволяет глухим и слабослышащим пользователям взаимодействовать со своим смартфоном на родном языке. Подобно тому, как искусственный интеллект позволяет пользователям говорить со своим устройством вместо набора текста, SL2T позволяет людям вводить текст непосредственно в камеру своего смартфона, а не набирать его на экране.
Это значит, что теперь пользователи могут использовать язык жестов для выполнения десятков различных задач, включая поиск в интернете, составление электронных писем и текстовых сообщений, редактирование документов и так далее. Они также могут использовать SL2T, чтобы языковая модель Gemini отвечала на запросы и выполняла действия от их имени. SL2T также доступна в приложении Google Live Transcribe, которая дает возможность пользователям переводить ответы на язык жестов непосредственно во время видеозвонков.
Компания Google заявила, что модель SL2T была обучена на более чем 100 000 часах данных по более чем более 50 языкам жестов, причем около четверти этого набора составляют данные по американскому жестовому языку (ASL). Хотя первоначальная версия может понимать только ASL, Google заявила, что обучит модель на нескольких языках жестов, чтобы изучить общие структурные закономерности между ними. Таким образом, модель SL2T может значительно превзойти более ранние модели для понимания языка жестов.
Чтобы развеять опасения пользователей по поводу конфиденциальности, SL2T использует встроенную модель компьютерного зрения MediaPipe Holistic, которая отслеживает геометрические координаты положения лица, рук, предплечий и туловища говорящего. Затем она отправляет координаты этих мест на свой облачный сервер, что исключает необходимость загрузки видео, делая процесс быстрее и безопаснее для пользователей.
Модель преобразует последовательности непосредственно в текст, минуя промежуточные текстовые аннотации, известные как «глоссы». Благодаря этому, SL2T лучше улавливает невербальные выражения и пространственные грамматические структуры, характерные для американского жестового языка (ASL). Среди других функций новой модели можно выделить следующие:
- оптимизация для уменьшения задержки,
- механизмы предотвращения галлюцинаций при движениях, не связанных с жестовым языком,
- поддержка как левшей, так и пользователей, использующих жестовый язык одной рукой, что позволяет взаимодействовать с моделью, держа смартфон в одной руке.
Заявления Google о производительности модели подтверждаются убедительными данными. SL2T набрала 70 баллов по шкале BLEURT в бенчмарке FLEURS-ASL.
Выпуск SL2T — ключевое событие для сообществ глухих во всем мире, заявили в Google. Разработка моделей искусственного интеллекта, способных понимать языки жестов, продвигается медленно из-за уникальных проблем, которые они представляют, а также из-за некоторых распространенных заблуждений. В отличие от разговорных языков, которые напрямую сопоставляют последовательные звуки с текстом, языки жестов имеют свою собственную уникальную лексику и грамматику, которые необходимо переводить совершенно по-новому.
Ещё одна сложность заключается в том, что языки жестов передают смысл посредством одновременных движений не только рук, но и головы, лица, рук и туловища. Однако ранние попытки разработки языков жестов были сосредоточены только на жестах рук, не рассматривая движения всего тела.
Компания Google дала понять сообществам глухих и слабослышащих, что больше не собирается оставлять их без внимания. Помимо выпуска SL2T, компания также создала «Консультативный комитет по языку жестов с использованием ИИ» в партнерстве с рядом организаций глухих и экспертами по языку жестов, чтобы помочь в ответственном внедрении этой технологии. Совместно с Google комитет станет соавтором отчета, в котором будут описаны возможности модели SL2T и ее текущие ограничения.
В дальнейшем Google планирует расширить модель, включив в нее дополнительные языки жестов, а также разработать модели для генерации языков жестов.



