Оригинал материала: https://3dnews.ru/1146745

Google представила ИИ-модель SL2T, которая понимает язык жестов

Подразделение Google DeepMind рассказало о намерении донести революцию в области искусственного интеллекта до 70 млн человек по всему миру, которые общаются на языках жестов. Новая модель SL2T преобразует эти языки в текст.

 Источник изображения: deepmind.google

Источник изображения: deepmind.google

Google SL2T — многоязычная модель-переводчик, которая дебютирует на смартфонах Pixel 11, позволяя преобразовывать язык жестов в текст через приложения Gboard и Live Transcribe. На начальном этапе её применение ограничивается американским языком жестов и его переводом на английский. Способность ИИ обрабатывать человеческую речь за последние годы значительно продвинулась — сейчас можно просто диктовать текст на смартфон, планшет или ПК. Но до настоящего момента это не относилось к тем, кто пользуется одним из более чем 200 существующих языков жестов.

Модель SL2T позволяет людям, испытывающим проблемы со слухом, взаимодействовать со смартфоном, используя привычный язык и не вводя текст вручную. В этом формате теперь можно отправлять поисковые запросы, составлять электронные письма и сообщения для мессенджеров, редактировать документы и выполнять другие задачи, в том числе отправлять запросы и инструкции для ИИ-помощника Gemini. Модель доступна в Google Live Transcribe, то есть перевод с языка жестов можно осуществлять в реальном времени во время видеозвонков.

Google обучила SL2T на более чем 100 тыс. часов с данными 50 жестовых языков, и четверть из этого набора относится к американскому. Первоначальный вариант поддерживает только американский, но Google проводила обучение и на примерах других, чтобы модель могла изучить общие закономерности. Чтобы развеять опасения по поводу конфиденциальности, в Google уточнили, что в SL2T используется встроенная модель компьютерного зрения MediaPipe Holistic, которая отслеживает геометрию положений лица, рук, туловища и тела человека — на облачный сервер отправляются для расшифровки только их координаты, а не видеозапись.

Модель производит преобразование непосредственно в текст, минуя промежуточные текстовые аннотации. Это позволяет SL2T эффективнее интерпретировать невербальные выражения и пространственные грамматические структуры, характерные для американского языка жестов. Google также приняла меры для сокращения задержки, предотвращения галлюцинаций, предусмотрела поддержку левшей и правшей, а также пользователей, которые «говорят» только одной рукой — чтобы второй можно было держать смартфон. Важным отличием SL2T от предыдущих моделей того же назначения является её способность следить не только за руками, но также за движением головы, лица и туловища, которые также помогают передавать смысл. В перспективе Google намерена охватить другие языки жестов, а также разработать модели для генерации напрямую на этих языках.



Оригинал материала: https://3dnews.ru/1146745