Сегодня 26 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Xiaomi представила OmniVoice — открытую ИИ-модель, которая озвучит текст почти на любом языке и скопирует голос

Xiaomi объявила о выходе открытой модели искусственного интеллекта OmniVoice, предназначенной для преобразования текста в речь — помимо речевого синтеза на нескольких сотнях языков, она поддерживает клонирование голоса и настраиваемую генерацию речи.

 Источник изображения: Xiaomi

Источник изображения: Xiaomi

OmniVoice, по словам разработчика, демонстрирует высокие показатели в китайском и английском языках, выступая конкурентом существующих коммерческих систем и превосходя их в ряде задач. Одним из главных преимуществ модели является поддержка языков даже с ограниченными ресурсами — она генерирует речь «почти на любом языке», даже если для него был доступен лишь небольшой объём обучающих данных. Кроме того, отметили в Xiaomi, это первая в отрасли модель для клонирования голоса с охватом нескольких сотен языков.

По результатам многоязычного тестирования OmniVoice превзошла несколько коммерческих систем на 24 языках по сходству и разборчивости речи — даже при обучении на открытых наборах данных. При тестировании на 102 языках разборчивость речи OmniVoice была близка к человеческой, а в некоторых случаях и превосходила её. Высокое качество на выходе удалось обеспечить даже в тех случаях, когда по какому-либо языку было менее 10 часов обучающих данных.

 Источник изображения: Ali Khadem / unsplash.com

Источник изображения: Ali Khadem / unsplash.com

По сравнению с современными системами синтеза речи OmniVoice отличает гораздо более простая архитектура: вместо подключения нескольких модулей и этапов прогнозирования здесь развёрнута единая двунаправленная сеть типа трансформер для прямого преобразования текста в речь. Не нужно отдельно моделировать текст, подключать сложные гибридные структуры и многоуровневые системы прогнозирования токенов. Упрощённая архитектура означает высокую скорость работы модели — всего за один день её можно обучить на 100 000 часов данных; а при инференсе (запуске) она работает на величину до 40 раз быстрее реального времени с использованием ИИ-фреймворка PyTorch, то есть относительно просто развёртывается в потребительских приложениях и сервисах.

Высокую производительность OmniVoice, рассказали в Xiaomi, обеспечили при помощи двух решений. Во-первых, при обучении модели применили «метод случайного скрытия акустических кодов», что увеличило эффективность обучения и расширило общие возможности модели. Во-вторых, на этапе предварительного обучения к ней подключили большую языковую модель — она помогла повысить точность произношения и разборчивость речи.

OmniVoice предлагает несколько практических функций. Модель может сгенерировать голос по описанным пользователем свойствам — учесть возраст, пол, высоту тона, акцент, диалект и стиль речи; без необходимости в эталоне можно генерировать шёпот и другие особые стили речи. Она также умеет удалять из образца шумы и извлекать чёткие характеристики голоса, чтобы копировать его даже тогда, когда исходный аудиофайл записывался в далёких от идеальных условиях. Есть также средства управления интонацией, генерируются вздохи и взрывы смеха, что делает производимую речь более естественной. Наконец, можно вручную корректировать сложные аспекты произношения, например, многозвучные китайские иероглифы или англоязычные имена собственные.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про аудиоредакторы

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
ИИ-агенты OpenAI слили в интернет 53 изображения пользователей ChatGPT — заметили это лишь спустя время 3 мин.
ИИ-агенты OpenAI оставили миллион следов взлома Hugging Face в открытом интернете 3 ч.
Qualcomm раскрыла план по освобождению от монополии Nvidia в сфере ИИ 6 ч.
ИИ-агенты OpenAI массово атаковали базы данных онлайн в поисках малоизвестных сведений 7 ч.
Дональд Трамп и Си Цзиньпин обсудили вопросы безопасности ИИ при личной встрече, но воздержались от подробных заявлений 8 ч.
OpenAI в ближайшие недели выпустит предварительную версию ИИ-модели GPT-6 Cyber для сферы кибербезопасности 10 ч.
RuStore могут сделать обязательным для предустановки на все смарт-ТВ в России 17 ч.
Новая статья: SPRAWL zero — в свинцовом потоке. Рецензия 17 ч.
«Плод того же отравленного дерева»: Sony и Universal снова подали в суд на ИИ-генератор Suno за кражу музыки 19 ч.
Мне бы в небо: критики вынесли вердикт Ace Combat 8: Wings of Theve 20 ч.
Китайский радиотелескоп обнаружил похожий на радиопослание инопланетян сигнал 14 мин.
Claude нашёл «новый CRISPR», но учёные засомневались в значимости открытия Anthropic 3 ч.
Обнаружить микробную жизнь на спутнике Сатурна Энцеладе может оказаться проще 3 ч.
К запуску подготовлен первый аппарат Otter для сервисного обслуживания спутников в космосе 6 ч.
Подорожавшая память грозит добить дешёвые ноутбуки — Qualcomm обещает спасение в виде Snapdragon C 7 ч.
Апелляционный суд США оставил за Anthropic статус угрозы для национальной безопасности 8 ч.
Solidigm собралась привлечь $15 млрд в ходе IPO, которое станет крупнейшим в истории США 10 ч.
Tesla пока не может выйти на запланированный объём производства 20 000 роботов Optimus в неделю 11 ч.
MSI представила три AM4-платы на чипсете AMD B550 для процессоров Ryzen 3000, 4000G и 5000 11 ч.
Слухи: Apple до конца года выпустит iPad mini с OLED-экраном, колонки HomePod mini 2 и приставки Apple TV 4K 17 ч.