Сегодня 17 июня 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Xiaomi представила OmniVoice — открытую ИИ-модель, которая озвучит текст почти на любом языке и скопирует голос

Xiaomi объявила о выходе открытой модели искусственного интеллекта OmniVoice, предназначенной для преобразования текста в речь — помимо речевого синтеза на нескольких сотнях языков, она поддерживает клонирование голоса и настраиваемую генерацию речи.

 Источник изображения: Xiaomi

Источник изображения: Xiaomi

OmniVoice, по словам разработчика, демонстрирует высокие показатели в китайском и английском языках, выступая конкурентом существующих коммерческих систем и превосходя их в ряде задач. Одним из главных преимуществ модели является поддержка языков даже с ограниченными ресурсами — она генерирует речь «почти на любом языке», даже если для него был доступен лишь небольшой объём обучающих данных. Кроме того, отметили в Xiaomi, это первая в отрасли модель для клонирования голоса с охватом нескольких сотен языков.

По результатам многоязычного тестирования OmniVoice превзошла несколько коммерческих систем на 24 языках по сходству и разборчивости речи — даже при обучении на открытых наборах данных. При тестировании на 102 языках разборчивость речи OmniVoice была близка к человеческой, а в некоторых случаях и превосходила её. Высокое качество на выходе удалось обеспечить даже в тех случаях, когда по какому-либо языку было менее 10 часов обучающих данных.

 Источник изображения: Ali Khadem / unsplash.com

Источник изображения: Ali Khadem / unsplash.com

По сравнению с современными системами синтеза речи OmniVoice отличает гораздо более простая архитектура: вместо подключения нескольких модулей и этапов прогнозирования здесь развёрнута единая двунаправленная сеть типа трансформер для прямого преобразования текста в речь. Не нужно отдельно моделировать текст, подключать сложные гибридные структуры и многоуровневые системы прогнозирования токенов. Упрощённая архитектура означает высокую скорость работы модели — всего за один день её можно обучить на 100 000 часов данных; а при инференсе (запуске) она работает на величину до 40 раз быстрее реального времени с использованием ИИ-фреймворка PyTorch, то есть относительно просто развёртывается в потребительских приложениях и сервисах.

Высокую производительность OmniVoice, рассказали в Xiaomi, обеспечили при помощи двух решений. Во-первых, при обучении модели применили «метод случайного скрытия акустических кодов», что увеличило эффективность обучения и расширило общие возможности модели. Во-вторых, на этапе предварительного обучения к ней подключили большую языковую модель — она помогла повысить точность произношения и разборчивость речи.

OmniVoice предлагает несколько практических функций. Модель может сгенерировать голос по описанным пользователем свойствам — учесть возраст, пол, высоту тона, акцент, диалект и стиль речи; без необходимости в эталоне можно генерировать шёпот и другие особые стили речи. Она также умеет удалять из образца шумы и извлекать чёткие характеристики голоса, чтобы копировать его даже тогда, когда исходный аудиофайл записывался в далёких от идеальных условиях. Есть также средства управления интонацией, генерируются вздохи и взрывы смеха, что делает производимую речь более естественной. Наконец, можно вручную корректировать сложные аспекты произношения, например, многозвучные китайские иероглифы или англоязычные имена собственные.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Дженсен Хуанг: обществу необходимы «новые социальные нормы» в эпоху ИИ 50 мин.
Смартфоны Samsung научатся оценивать здоровье питомцев по фотографии 51 мин.
Спустя четыре года апгрейд GTA V до версий для PS5, Xbox Series X и S всё-таки станет бесплатным 2 ч.
Создатели хоррор-шутера Luna Abyss остались без работы через месяц после релиза — всех уволили 2 ч.
Внезапная блокировка Anthropic Fable 5 подстегнула интерес к открытым ИИ-моделям 3 ч.
Голосовые сообщения в WhatsApp можно будет отправлять не открывая приложение — прямо из виджета 4 ч.
Telegram через суд обжаловал блокировку в Индии 5 ч.
Windows 11 избавится от лишних перезагрузок: обновления будут устанавливаться за один цикл 7 ч.
«Минимальные усилия, но максимальный эффект»: Digital Foundry показала, как Sony может прокачать Bloodborne на PS5 без FromSoftware 7 ч.
CATL и Tencent стали инвесторами DeepSeek, но больше всех вложился основатель стартапа 7 ч.
MSI наделила свои платы для Intel поддержкой половинчатых модулей DDR5 HUDIMM 4 мин.
Учёные разработали память, которая умеет забывать лишнюю информацию — совсем как человеческий мозг 47 мин.
Nvidia показала роботов, которые сами научились собирать ПК — но почему-то дорогие видеокарты им не доверила 3 ч.
Китай проследит, как ИИ отнимает и создаёт рабочие места 3 ч.
Silicon Motion будет внедрять PCIe 6.0 в SSD с оглядкой на процессоры Nvidia, а не Intel или AMD 3 ч.
Тяжёлая ракета Ariane 6 впервые стартовала в самой мощной конфигурации — она вывела на орбиту спутники Amazon Leo 3 ч.
«Мегафон» связал Россию и Китай новым магистральным каналом связи 3 ч.
«Я собираюсь красть ваших клиентов»: глава Nothing объявил войну Apple из-за слишком скучных iPhone 4 ч.
IDC: на x86 теперь приходится лишь чуть более половины рынка серверов, в основном из-за ИИ 4 ч.
Представлен человекоподобный робот Genesis Eno, непохожий на человека 5 ч.