Сегодня 26 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Xiaomi представила OmniVoice — открытую ИИ-модель, которая озвучит текст почти на любом языке и скопирует голос

Xiaomi объявила о выходе открытой модели искусственного интеллекта OmniVoice, предназначенной для преобразования текста в речь — помимо речевого синтеза на нескольких сотнях языков, она поддерживает клонирование голоса и настраиваемую генерацию речи.

 Источник изображения: Xiaomi

Источник изображения: Xiaomi

OmniVoice, по словам разработчика, демонстрирует высокие показатели в китайском и английском языках, выступая конкурентом существующих коммерческих систем и превосходя их в ряде задач. Одним из главных преимуществ модели является поддержка языков даже с ограниченными ресурсами — она генерирует речь «почти на любом языке», даже если для него был доступен лишь небольшой объём обучающих данных. Кроме того, отметили в Xiaomi, это первая в отрасли модель для клонирования голоса с охватом нескольких сотен языков.

По результатам многоязычного тестирования OmniVoice превзошла несколько коммерческих систем на 24 языках по сходству и разборчивости речи — даже при обучении на открытых наборах данных. При тестировании на 102 языках разборчивость речи OmniVoice была близка к человеческой, а в некоторых случаях и превосходила её. Высокое качество на выходе удалось обеспечить даже в тех случаях, когда по какому-либо языку было менее 10 часов обучающих данных.

 Источник изображения: Ali Khadem / unsplash.com

Источник изображения: Ali Khadem / unsplash.com

По сравнению с современными системами синтеза речи OmniVoice отличает гораздо более простая архитектура: вместо подключения нескольких модулей и этапов прогнозирования здесь развёрнута единая двунаправленная сеть типа трансформер для прямого преобразования текста в речь. Не нужно отдельно моделировать текст, подключать сложные гибридные структуры и многоуровневые системы прогнозирования токенов. Упрощённая архитектура означает высокую скорость работы модели — всего за один день её можно обучить на 100 000 часов данных; а при инференсе (запуске) она работает на величину до 40 раз быстрее реального времени с использованием ИИ-фреймворка PyTorch, то есть относительно просто развёртывается в потребительских приложениях и сервисах.

Высокую производительность OmniVoice, рассказали в Xiaomi, обеспечили при помощи двух решений. Во-первых, при обучении модели применили «метод случайного скрытия акустических кодов», что увеличило эффективность обучения и расширило общие возможности модели. Во-вторых, на этапе предварительного обучения к ней подключили большую языковую модель — она помогла повысить точность произношения и разборчивость речи.

OmniVoice предлагает несколько практических функций. Модель может сгенерировать голос по описанным пользователем свойствам — учесть возраст, пол, высоту тона, акцент, диалект и стиль речи; без необходимости в эталоне можно генерировать шёпот и другие особые стили речи. Она также умеет удалять из образца шумы и извлекать чёткие характеристики голоса, чтобы копировать его даже тогда, когда исходный аудиофайл записывался в далёких от идеальных условиях. Есть также средства управления интонацией, генерируются вздохи и взрывы смеха, что делает производимую речь более естественной. Наконец, можно вручную корректировать сложные аспекты произношения, например, многозвучные китайские иероглифы или англоязычные имена собственные.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про аудиоредакторы

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Supergiant отметила годовщину Hades 2 бесплатным музыкальным концертом по игре и анонсом документального фильма о разработке 27 мин.
ИИ-агент OpenAI снова выбрался в интернет после усиления защиты — чтобы уточнить столицу Франции 51 мин.
ИИ-агенты OpenAI слили в интернет 53 изображения пользователей ChatGPT — заметили это лишь спустя время 2 ч.
Claude нашёл «новый CRISPR», но учёные засомневались в значимости открытия Anthropic 4 ч.
ИИ-агенты OpenAI оставили миллион следов взлома Hugging Face в открытом интернете 5 ч.
Qualcomm раскрыла план по освобождению от монополии Nvidia в сфере ИИ 8 ч.
ИИ-агенты OpenAI массово атаковали базы данных онлайн в поисках малоизвестных сведений 9 ч.
Дональд Трамп и Си Цзиньпин обсудили вопросы безопасности ИИ при личной встрече, но воздержались от подробных заявлений 9 ч.
Апелляционный суд США оставил за Anthropic статус угрозы для национальной безопасности 10 ч.
OpenAI в ближайшие недели выпустит предварительную версию ИИ-модели GPT-6 Cyber для сферы кибербезопасности 11 ч.
Google отправит ИИ-сервер в космос уже на следующей неделе, но работать он сможет лишь по 15 минут 2 ч.
Обнаружить микробную жизнь на спутнике Сатурна Энцеладе может оказаться проще 5 ч.
К запуску подготовлен первый аппарат Otter для сервисного обслуживания спутников в космосе 8 ч.
Подорожавшая память грозит добить дешёвые ноутбуки — Qualcomm обещает спасение в виде Snapdragon C 8 ч.
Solidigm собралась привлечь $15 млрд в ходе IPO, которое станет крупнейшим в истории США 12 ч.
Tesla пока не может выйти на запланированный объём производства 20 000 роботов Optimus в неделю 12 ч.
MSI представила три AM4-платы на чипсете AMD B550 для процессоров Ryzen 3000, 4000G и 5000 12 ч.
Слухи: Apple до конца года выпустит iPad mini с OLED-экраном, колонки HomePod mini 2 и приставки Apple TV 4K 18 ч.
Noctua захотела охлаждать мощные чипы в ПК по-серверному — компания адаптирует микроканальную технологию 22 ч.
Google отправит ИИ-чипы TPU в космос уже на следующей неделе 23 ч.