Представлена ИИ-модель Meta✴ Muse Voice Transcribe для расшифровки речи

Читать в полной версии

Meta представила первую модель искусственного интеллекта, предназначенную для обработки аудио в реальном времени. Muse Voice Transcribe расшифровывает речь для более чем 20 говорящих и справляется с несколькими языками одновременно.

Источник изображения: Kate Bezzubets / unsplash.com

На демонстрационном видео модель не просто поддерживает распознавание речи у нескольких говорящих людей и обрабатывает несколько языков — она умеет расшифровывать фразы, когда человек переключается с одного языка на другой прямо в середине предложения. «Модель сама решает, когда слушать. Она немного дольше ждёт при сложных словах и быстрее реагирует на простые, используя адаптивную задержку для прогнозирования каждого токена и повышения точности. Она отлично работает и с некачественным, реальным аудио — обучена на 70 языках (25 из которых проверены на момент запуска), обрабатывает языковые переходы в середине предложения и справляется с часовыми сессиями с более чем 20 говорящими», — рассказал глава компании Марк Цукерберг (Mark Zuckerberg).

На минувшей неделе Google представила обладающую аналогичными возможностями модель Gemini 3.5 Transcribe — она будет встроена в Android и в Chrome. О намерении Meta интегрировать свою разработку в собственные флагманские сервисы пока ничего не говорится. Поработать в Muse Voice Transcribe можно в приложении Meta AI для Apple macOS; на платформах Muse Code и Meta Model API разработчики могут подключиться к ней по цене $3 за 1000 минут аудио.