Сегодня 06 мая 2024
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Microsoft представила VALL-E — ИИ-модель, которая имитирует голос по маленькому образцу

Microsoft представила модель искусственного интеллекта (ИИ) под названием VALL-E — она преобразует текст в речь, точно имитируя голос человека, а образцом может служить запись продолжительностью всего в три секунды. При этом ИИ сохраняет эмоциональную окраску речи образца.

 Источник изображения: Maxime VALCARCE / unsplash.com

Источник изображения: Maxime VALCARCE / unsplash.com

Авторы проекта говорят, что система окажется полезной при разработке приложений с возможностью высококачественного преобразования текста в речь и при создании аудиоконтента в сочетании с другими ИИ-генераторами контента вроде GPT-3. Хотя они также признают, что её можно использовать для редактирования аудиозаписи по расшифровке — модель может «заставить» человека произносить слова, которых он никогда в реальности не говорил.

При создании модели использовалась разработанная Meta технология EnCodec, которая обеспечивает эффективное сжатие аудиосигнала. В отличие от традиционных методов преобразования текста в речь, VALL-E не конструирует звуковые волны, а анализирует особенности речи человека, разбивает эти данные на отдельные компоненты (так называемые «токены») и генерирует запись на основе того, что уже «знает» об образце — моделирует голос, как он бы мог звучать за пределами трёхсекундного образца. Обучение модели производилось на библиотеке LibriLight, собранной Meta — она же, в свою очередь, была построена на 60 000 часов англоязычной речи более чем 7000 носителей: данные были позаимствованы преимущественно из коллекции LibriVox.

 Источник изображения: valle-demo.github.io

Источник изображения: valle-demo.github.io

В представленных на сайте проекта образцах колонка «Speaker Prompt» содержит образцы речи; в колонке «Ground Truth» представлена запись необходимого текста в исполнении человека, с которого был записан образец; «Baseline» — образец работы традиционных преобразователей текста в речь, а «VALL-E» — работа новой ИИ-модели. Нейросеть также может предложить несколько вариантов необходимого текста с голосом на образце. Создатели системы добавили, что она не только придаёт голосу на генерируемой записи нужный эмоциональный окрас, но и имитирует «акустическое окружение» образца — если исходная запись была сделана с телефонного разговора, то и результат будет напоминать разговор по телефону.

Из-за опасности злоупотреблений технологией Microsoft не стала публиковать код VALL-E для экспериментов, поэтому все желающие протестировать работу модели не смогут. В компании добавили, что аналогичным образом будут поступать и с другими проектами, если они несут потенциальную угрозу злоупотреблений.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Вечерний 3DNews
Каждый будний вечер мы рассылаем сводку новостей без белиберды и рекламы. Две минуты на чтение — и вы в курсе главных событий.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Утечка раскрыла первые подробности PvP-мультиплеера Warhammer 40,000: Space Marine 2 14 мин.
YouTube протестирует на платных подписчиках перемотку видео сразу на самое интересное место 2 ч.
В AlmaLinux сформировано подразделение по НРС и ИИ 3 ч.
Сооснователь Twitter Джек Дорси покинул совет директоров децентрализованной соцсети Bluesky 3 ч.
Обзорный трейлер пошаговой ролевой игры SteamWorld Heist II: бои, прокачка, мультиклассы и кое-что ещё 14 ч.
Не бывать дешёвым мейнфреймам: IBM подала второй иск к LzLabs, предлагающей доступную облачную альтернативу её «железу» 15 ч.
TikTok удалил сотни видео с запрещёнными материалами по требованию «Роскомнадзора» с начала 2023 года 22 ч.
Симулятор выживания Serum про сыворотку, гонку со временем и отравленный лес выйдет в раннем доступе 23 мая 22 ч.
В Instagram появились «секретные» Stories — для их просмотра нужно написать автору 23 ч.
IBM избежала выплаты $1,6 мрд в пользу BMC 24 ч.
XFX выпустила Radeon RX 7900 XTX Phoenix Nirvana с огромным кулером, фазовым переходом и магнитными вентиляторами 12 мин.
Средства от продажи Yandex могут направить на поддержку российской электронной промышленности 60 мин.
Huawei начала теснить Apple на рынке планшетов, нарастив продажи на 70 % в первом квартале 2 ч.
TrendForce: развитие ИИ стимулирует рост спроса на корпоративные QLC SSD 2 ч.
Россияне закупились игровой электроникой к майским праздникам 3 ч.
Apple ускорила разработку «устройств сверхвысокого класса» — складного iPhone и MacBook с гибким экраном 3 ч.
Низкопрофильный одноплатный компьютер Banana Pi BPI-M5 Pro для AIoT-устройств получил чип Rockchip RK3576 3 ч.
Nvidia сталкивает поставщиков памяти HBM, чтобы добиться от них снижения цен 5 ч.
Tesla готовит почву для легализации FSD в Европе и Великобритании 7 ч.
Апрельская выручка Foxconn выросла на 19 % до рекордных $15,8 млрд 9 ч.