Сегодня 12 мая 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Amazon представила голосовую ИИ-модель Nova Sonic

Amazon представила модель генеративного искусственного интеллекта Nova Sonic, способную обрабатывать голос и генерировать речь, которая звучит естественно. В тестах на замеры скорости, распознавание речи и качество разговора Sonic зарекомендовала себя как конкурентоспособная в сравнении с передовыми голосовыми моделями OpenAI и Google.

 Источник изображений: aboutamazon.com

Источник изображений: aboutamazon.com

Nova Sonic — ответ Amazon на новые голосовые модели ИИ, такие как лежащая в основе звукового режима ChatGPT; все они предлагают более естественные форматы общения, чем ранние версии голосового помощника Alexa. Технологические прорывы последних лет позволили сделать устаревшие модели и цифровых помощников, включая Alexa и Apple Siri, намного более естественными во взаимодействии с человеком. Модель Nova Sonic доступна через Bedrock — предлагаемую Amazon платформу для разработчиков корпоративных приложений с ИИ; поддерживается двунаправленный потоковый API. Nova Sonic, добавили в Amazon, обходится в эксплуатации на 80 % дешевле, чем мультимодальная OpenAI GPT-4o, а её компоненты уже работают в обновлённом варианте Alexa+.

Она превосходит конкурентов в маршрутизации пользовательских запросов к различным API — модель «знает», когда ей необходимо в реальном времени извлечь информацию из интернета, проанализировать собственный источник данных или выполнить действие во внешнем приложении — и использовать для этого соответствующий инструмент. Во время двустороннего диалога Nova Sonic ждёт, чтобы заговорить «в подходящее время», учитывая свойственные собеседнику паузы и запинки. Она также составляет текстовую расшифровку речи пользователя, которую разработчики могут использовать для различных приложений.

 Источник изображений: aboutamazon.com

В задачах, связанных с распознаванием речи, она менее склонна к ошибкам, чем другие голосовые модели ИИ, то есть относительно хорошо понимает пользователя, даже если он бормочет, говорит с ошибками или находится в шумной обстановке. В эталонном тесте Multilingual LibriSpeech, позволяющем оценить качество распознавания речи на разных языках и диалектах, Nova Sonic показала коэффициент ошибок в словах (WER) всего 4,2 % в среднем по английскому, французскому, итальянскому, немецкому, и испанскому языках. То есть при подготовке расшифровки речи она неверно распознает примерно четыре из ста слов по сравнению с человеком.

В бенчмарке Augmented Multi Party Interaction, оценивающем качество разговора вслух с несколькими участниками, Nova Sonic оказалась на 46,7 % точнее по критерию WER, чем OpenAI GPT-4o-transcribe. Модель от Amazon также оказалась очень быстрой — её средняя задержка составила 1,09 с против 1,18 с, которую показала GPT-4o, лежащая в основе OpenAI Realtime API. Компания намеревается представить ещё несколько моделей ИИ, способных к обработке изображений, видео, голоса и «других сенсорных данных, которые необходимы при переносе в физический мир».

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Новое бизнес-подразделение OpenAI поможет клиентам во внедрении ИИ 37 мин.
Больше не «007 кадров»: новая геймплейная демонстрация 007 First Light порадовала игроков производительностью 44 мин.
«Пассворк» стал первым в России менеджером паролей с сертификатом ФСТЭК 2 ч.
OpenAI запустила Daybreak — ответ на инициативу Anthropic Glasswing в кибербезопасности на базе Claude Mythos 2 ч.
В Linux предложили встроить экстренный «рубильник» для защиты от уязвимостей CopyFail и Dirty Frag 2 ч.
Lies of P 2 вошла в стадию активной разработки и нуждается в специалисте по созданию иллюстраций с помощью ИИ 2 ч.
Общие продажи игр серии Silent Hill превысили 17 млн копий, а у Metal Gear результаты в разы лучше 2 ч.
«Базис» представил конструктор платформенных сервисов Basis Automation Studio 2 ч.
«Базис» представил конструктор платформенных сервисов Basis Automation Studio 3 ч.
«У магазина поверните направо»: «Яндекс Карты» теперь указывают на понятные ориентиры, объясняя маршрут 3 ч.
Matter получит интеграцию с OpenADR — умный дом поможет экономить электроэнергию и платить меньше 2 мин.
Dell выпустила ИИ-сервер PowerEdge XE9785 с ускорителями AMD Instinct MI355X 38 мин.
Видео: человекоподобные роботы Figure собрали вещи в комнате и заправили постель 60 мин.
Unitree показала 500-килограммового шагающего робота, внутри которого есть место для человека 3 ч.
Профсоюз Samsung назвал условие отмены всеобщей забастовки, которая может обернуться потерями до $680 млн в день 4 ч.
Samsung может поставить китайские дисплеи в Galaxy S27 — BOE нацелилась на флагманы 4 ч.
Gartner: суверенное облако могут позволить себе только США и Китай, но не Европа 4 ч.
Meta готовит пятитонные ИИ-стойки с чипами AMD 5 ч.
Скандал с контрабандными ИИ-серверами Supermicro не повлиял на её взаимоотношения с AMD, NVIDIA и Intel 5 ч.
TSMC готова вложить $250 млрд в производство чипов в США, несмотря на проблемы 6 ч.