Сегодня 06 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Xiaomi представила OmniVoice — открытую ИИ-модель, которая озвучит текст почти на любом языке и скопирует голос

Xiaomi объявила о выходе открытой модели искусственного интеллекта OmniVoice, предназначенной для преобразования текста в речь — помимо речевого синтеза на нескольких сотнях языков, она поддерживает клонирование голоса и настраиваемую генерацию речи.

 Источник изображения: Xiaomi

Источник изображения: Xiaomi

OmniVoice, по словам разработчика, демонстрирует высокие показатели в китайском и английском языках, выступая конкурентом существующих коммерческих систем и превосходя их в ряде задач. Одним из главных преимуществ модели является поддержка языков даже с ограниченными ресурсами — она генерирует речь «почти на любом языке», даже если для него был доступен лишь небольшой объём обучающих данных. Кроме того, отметили в Xiaomi, это первая в отрасли модель для клонирования голоса с охватом нескольких сотен языков.

По результатам многоязычного тестирования OmniVoice превзошла несколько коммерческих систем на 24 языках по сходству и разборчивости речи — даже при обучении на открытых наборах данных. При тестировании на 102 языках разборчивость речи OmniVoice была близка к человеческой, а в некоторых случаях и превосходила её. Высокое качество на выходе удалось обеспечить даже в тех случаях, когда по какому-либо языку было менее 10 часов обучающих данных.

 Источник изображения: Ali Khadem / unsplash.com

Источник изображения: Ali Khadem / unsplash.com

По сравнению с современными системами синтеза речи OmniVoice отличает гораздо более простая архитектура: вместо подключения нескольких модулей и этапов прогнозирования здесь развёрнута единая двунаправленная сеть типа трансформер для прямого преобразования текста в речь. Не нужно отдельно моделировать текст, подключать сложные гибридные структуры и многоуровневые системы прогнозирования токенов. Упрощённая архитектура означает высокую скорость работы модели — всего за один день её можно обучить на 100 000 часов данных; а при инференсе (запуске) она работает на величину до 40 раз быстрее реального времени с использованием ИИ-фреймворка PyTorch, то есть относительно просто развёртывается в потребительских приложениях и сервисах.

Высокую производительность OmniVoice, рассказали в Xiaomi, обеспечили при помощи двух решений. Во-первых, при обучении модели применили «метод случайного скрытия акустических кодов», что увеличило эффективность обучения и расширило общие возможности модели. Во-вторых, на этапе предварительного обучения к ней подключили большую языковую модель — она помогла повысить точность произношения и разборчивость речи.

OmniVoice предлагает несколько практических функций. Модель может сгенерировать голос по описанным пользователем свойствам — учесть возраст, пол, высоту тона, акцент, диалект и стиль речи; без необходимости в эталоне можно генерировать шёпот и другие особые стили речи. Она также умеет удалять из образца шумы и извлекать чёткие характеристики голоса, чтобы копировать его даже тогда, когда исходный аудиофайл записывался в далёких от идеальных условиях. Есть также средства управления интонацией, генерируются вздохи и взрывы смеха, что делает производимую речь более естественной. Наконец, можно вручную корректировать сложные аспекты произношения, например, многозвучные китайские иероглифы или англоязычные имена собственные.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про аудиоредакторы

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Новая статья: WheelMates — без ветерка. Рецензия 15 ч.
Боевик Samson от создателя Just Cause выйдет на консолях до конца сентября после провального релиза на ПК 17 ч.
Амбициозная вампирская ролевая игра The Blood of Dawnwalker от ветеранов CD Projekt Red уже стала хитом продаж — миллион копий за два дня 19 ч.
Суд разрешил конкуренту X использовать слово твит и логотип птицы, но запретил имя Twitter 05-09 14:01
Windows 11 будет сообщать приложениям возраст пользователя 05-09 13:38
В поглощении Hugging Face компанией Nvidia оказалось много символизма — возможно, неслучайного 05-09 13:24
Спамеры стали использовать ASCII-подмену символов — раньше так взламывали ИИ 05-09 12:21
В независимом тестировании OpenAI GPT-6 Astra оказалась почти не лучше предшественницы 05-09 12:01
Новая статья: Resonance: A Plague Tale Legacy — корабль, с которого сбежали крысы. Рецензия 05-09 00:07
Основателя Oracle вызвали в Конгресс — компания за восемь лет выполнила лишь десятую часть контракта для военных, а денег хочет почти втрое больше оговоренного 04-09 23:30
Выручка Foxconn на крыльях ИИ-бума в августе выросла на 52 %, и это только начало, как считают в компании 8 ч.
AMD анонсировала рабочую станцию Threadripper Halo Station с Instinct MI350P для ИИ-задач 22 ч.
ASUS анонсировала ИИ-серверы на чипах Intel Xeon 6 и AMD EPYC 9006 22 ч.
В 2027 году Apple выпустит умную камеру, которая записывает только нужные события 05-09 12:41
Бюджетные Galaxy A помогут Samsung нарастить поставки, пока конкуренты сокращают производство на фоне роста цен на память 05-09 12:17
Google, Oppo и Vivo вслед за Apple добавят два слоя стекла в складные дисплеи смартфонов 05-09 11:06
Apple усилила наём сотрудников в Китае — потребовались специалисты в области ИИ и не только 05-09 10:36
Samsung и Arm собираются разработать для OpenAI чип, который будет выпускаться по 2-нм технологии 05-09 09:58
GoPro пообещала сохранить преданность «вашему общему энтузиазму» 05-09 09:58
IPO компании Anthropic состоится не ранее середины октября 05-09 06:05