Сегодня 18 августа 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Apple разработала ИИ, выявляющий нетипичные аспекты устной речи — это поможет диагностировать заболевания

В рамках проекта, посвящённого голосовым и речевым моделям искусственного интеллекта, Apple опубликовала материалы (PDF) нового исследования, касающегося одной из сложных проблем машинного обучения: распознавание не только того, что было сказано человеком, но и того, как это было сказано.

 Источник изображения: Slavcho Malezan / unsplash.com

Источник изображения: Slavcho Malezan / unsplash.com

В статье исследователи описывают схему анализа речи с использованием параметров качества голоса (Voice Quality Dimensions — VQD). Эти параметры указывают на разборчивость, резкость, монотонность речи, придыхание и другие аспекты. На них обращают внимание и логопеды, когда оценивают звучание голоса и влияние на него неврологических состояний и заболеваний. Apple работает над моделями ИИ, также способными их обнаруживать.

Большинство речевых моделей обучается на здоровых и типичных для большинства голосах. Если голос человека звучит иначе, ИИ может дать сбой, и это большой недостаток системы, если ей пытается воспользоваться человек с ограниченными возможностями. В работе над этой проблемой исследователи Apple обучили несколько дополнительных моделей ИИ, предназначенных для работы совместно с основными речевыми системами, на большом общедоступном наборе данных аннотированной нетипичной речи, в том числе на голосах людей с болезнью Паркинсона, боковым амиотрофическим склерозом (БАС) и детским церебральным параличом (ДЦП).

На этом инженеры компании не остановились — они не стали использовать эти модели для прямой расшифровки сказанного, а составили методику измерения того, как звучит голос, на основе семи основных критериев:

  • разборчивость — насколько легко понимается речь;
  • нечёткие согласные — насколько внятно артикулируются согласные звуки;
  • резкость голоса — грубая, напряжённая или хриплая характеристика голоса;
  • естественность — насколько плавно или типично звучит речь для слушателя;
  • равномерность громкости — отсутствие перепадов в громкости речи;
  • монотонность — отсутствие перепадов высоты тона, приводящее к ровной или «роботизированной» интонации;
  • придыхание — присутствие шума воздуха или шёпота в голосе, часто возникающее из-за неполного закрытия голосовых связок.
 Источник изображения: Iluha Zavaley / unsplash.com

Источник изображения: Iluha Zavaley / unsplash.com

Таким образом, ИИ научился «слушать как врач», а не просто регистрировать то, что говорят. Для извлечения звуковых характеристик Apple использовала пять моделей ИИ и обучила дополнительные легковесные алгоритмы, чтобы на основе этих характеристик предсказывать параметры качества голоса. Разработанные компанией дополнительные алгоритмы показали высокие результаты по большинству параметров, хотя качество срабатывания варьировалось в зависимости от конкретного признака и всей задачи. Важнейшим достоинством исследования стало то, что ответы моделей оказались объяснимыми — в отрасли ИИ это встречается нечасто. Вместо того, чтобы показывать условную оценку достоверности (confidence score), система указывает на конкретные характеристики голоса, что упрощает классификацию. Это поможет в клинической оценке и диагностике.

Но и на клинической речи в Apple не остановились. Исследователи протестировали свои модели на образцах эмоциональной речи из набора данных RAVDESS: модели VQD не обучались на эмоциональных записях, но также давали прогнозы. Так, в сердитой речи отмечалась низкая «равномерность громкости», а грустные голоса воспринимались как монотонные. Возможно, это поможет улучшить и голосового помощника Apple Siri, который сможет корректировать свои интонации и речь в зависимости от того, как интерпретирует настроение и состояние пользователя, а не только сказанное им.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Паранормальный боевик Control Resonant ушёл на золото за месяц до релиза, а диски с игрой задержатся 5 мин.
Разработчики амбициозной вампирской ролевой игры The Blood of Dawnwalker снизили системные требования, но есть нюанс 46 мин.
OpenAI представила ChatGPT для подростков — он предназначен для образования и защищён от вредоносного контента 2 ч.
Новый трейлер раскрыл дату выхода Order of the Sinking Star — грандиозной головоломки от автора Braid и The Witness 3 ч.
«Просто закройте глаза!»: новый стрим разработчиков Star Citizen должен был показать игру в лучшем виде, но получилось наоборот 3 ч.
«Яндекс Карты» стали показывать ограничения скорости и направления камер на участках маршрута 3 ч.
Олдскульный шутер You Are Empty получит переиздание для современных ПК спустя 20 лет после релиза 3 ч.
Суд оштрафовал Google на 3,8 млн рублей за неудаление запрещённой информации 4 ч.
Почти 9 из 10 сайтов уличили в несоблюдении веб-стандартов 4 ч.
Хоррор Remothered: Red Nun’s Legacy получил дату релиза — игра станет финалом для всей серии 5 ч.
MSI оценила ноутбук Prestige 14 Flip AI+ Vincent van Gogh Edition с картинами Ван Гога в €2499 36 мин.
Баланс не сходится: у Microsoft насчитали меньше ИИ-чипов, чем должно быть 2 ч.
Sunrun и Voltus превратят домашние аккумуляторы в виртуальную электростанцию для ИИ ЦОД 3 ч.
Обновлённый модульный смартфон Fairphone 6+ получил 12 Гбайт ОЗУ и Snapdragon 7s Gen 4 3 ч.
Кризис на рынке смартфонов обрушил прибыль Xiaomi на 43 %, а продажи электромобилей растут медленно 3 ч.
Be quiet! представила БП Dark Power Pro 14 IO — до 1600 Вт, ATX 3.1 и PCIe 5.1, поддержка интеллектуального управления и цена от $480 3 ч.
SoftBank дала $200 млн на ускорение оснащения экскаваторов автономным ИИ-управлением 4 ч.
Noctua не планирует выпускать системы охлаждения с RGB-подсветкой и встроенными экранами — фокус только на чистой производительности 4 ч.
Модем MediaTek в смартфонах Google Pixel 11 стал быстрее и эффективнее, чем от Samsung 4 ч.
От запрета на импорт роботов в США меньше всего пострадают китайские роботы-пылесосы 4 ч.