В «Сбере» ведётся разработка технологии голосового искусственного интеллекта с полным дуплексом — такая система способна одновременно слушать и говорить. Об этом сообщил РБК со ссылкой на директора по развитию технологий ИИ Сбербанка Сергея Маркова.
Источник изображения: sberdevices.ru
Существующие голосовые ассистенты работают в полудуплексном режиме: человек произносит запрос, система обдумывает ответ, а затем его озвучивает, причём на каждом этапе подключаются разные нейросети. Новая технология будет основана на одной модели, которая умеет делать всё одновременно: слушать, готовить ответ и говорить. При реализации поддержки видеомодальности данная система сможет параллельно видеть пользователя и управлять движениями собственного видеоаватара.
Первой в мире подобное решение представила французская компания Kyutai, которая в 2024 году выпустила модель Moshi; уже потом появились аналогичные разработки от крупных ИИ-лабораторий — Google Gemini Live и OpenAI GPT-Live. При работе в режиме полного дуплекса время до ответа сократится от нескольких секунд до 160–320 мс — примерно с такой же скоростью ведёт беседу человек.
В России заявлений о подобных разработках ещё не делали. Наиболее близкое решение есть у «Яндекса» — система Realtime API может быстро отвечать и перебивать собеседника, но эта модель всё равно ожидает смены реплики, пояснил господин Марков, а полнодуплексная слушает человека непрерывно, даже в момент, когда даёт собственный ответ.
Источник:


MWC 2018
2018
Computex
IFA 2018






