Сегодня 09 мая 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Xiaomi представила OmniVoice — открытую ИИ-модель, которая озвучит текст почти на любом языке и скопирует голос

Xiaomi объявила о выходе открытой модели искусственного интеллекта OmniVoice, предназначенной для преобразования текста в речь — помимо речевого синтеза на нескольких сотнях языков, она поддерживает клонирование голоса и настраиваемую генерацию речи.

 Источник изображения: Xiaomi

Источник изображения: Xiaomi

OmniVoice, по словам разработчика, демонстрирует высокие показатели в китайском и английском языках, выступая конкурентом существующих коммерческих систем и превосходя их в ряде задач. Одним из главных преимуществ модели является поддержка языков даже с ограниченными ресурсами — она генерирует речь «почти на любом языке», даже если для него был доступен лишь небольшой объём обучающих данных. Кроме того, отметили в Xiaomi, это первая в отрасли модель для клонирования голоса с охватом нескольких сотен языков.

По результатам многоязычного тестирования OmniVoice превзошла несколько коммерческих систем на 24 языках по сходству и разборчивости речи — даже при обучении на открытых наборах данных. При тестировании на 102 языках разборчивость речи OmniVoice была близка к человеческой, а в некоторых случаях и превосходила её. Высокое качество на выходе удалось обеспечить даже в тех случаях, когда по какому-либо языку было менее 10 часов обучающих данных.

 Источник изображения: Ali Khadem / unsplash.com

Источник изображения: Ali Khadem / unsplash.com

По сравнению с современными системами синтеза речи OmniVoice отличает гораздо более простая архитектура: вместо подключения нескольких модулей и этапов прогнозирования здесь развёрнута единая двунаправленная сеть типа трансформер для прямого преобразования текста в речь. Не нужно отдельно моделировать текст, подключать сложные гибридные структуры и многоуровневые системы прогнозирования токенов. Упрощённая архитектура означает высокую скорость работы модели — всего за один день её можно обучить на 100 000 часов данных; а при инференсе (запуске) она работает на величину до 40 раз быстрее реального времени с использованием ИИ-фреймворка PyTorch, то есть относительно просто развёртывается в потребительских приложениях и сервисах.

Высокую производительность OmniVoice, рассказали в Xiaomi, обеспечили при помощи двух решений. Во-первых, при обучении модели применили «метод случайного скрытия акустических кодов», что увеличило эффективность обучения и расширило общие возможности модели. Во-вторых, на этапе предварительного обучения к ней подключили большую языковую модель — она помогла повысить точность произношения и разборчивость речи.

OmniVoice предлагает несколько практических функций. Модель может сгенерировать голос по описанным пользователем свойствам — учесть возраст, пол, высоту тона, акцент, диалект и стиль речи; без необходимости в эталоне можно генерировать шёпот и другие особые стили речи. Она также умеет удалять из образца шумы и извлекать чёткие характеристики голоса, чтобы копировать его даже тогда, когда исходный аудиофайл записывался в далёких от идеальных условиях. Есть также средства управления интонацией, генерируются вздохи и взрывы смеха, что делает производимую речь более естественной. Наконец, можно вручную корректировать сложные аспекты произношения, например, многозвучные китайские иероглифы или англоязычные имена собственные.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Новая статья: Saros — исправление ошибок, которых не было. Рецензия 7 ч.
«Мощный инструмент, но не замена художников и творцов»: руководство Sony прояснило использование генеративного ИИ в играх PlayStation 9 ч.
Роскомнадзор заявил, что не ограничивал доступ к GitHub 12 ч.
Шпионский боевик 007 First Light от создателей Hitman получил системные требования для игры в 4K, а трассировку пути придётся подождать 12 ч.
ИИ теперь пишет 60 % нового кода Airbnb — и сам решает 40 % запросов в техподдержку 14 ч.
Google начала тестировать ИИ-агента Remy — конкурента OpenClaw 14 ч.
Россияне массово жалуются на блокировки аккаунтов в Anthropic Claude — потеряны проекты и переписки с ИИ 14 ч.
Амбициозный хоррор Paranormal Activity: Threshold от создателя The Mortuary Assistant отменён из-за конфликта с Paramount Pictures 14 ч.
Архивировать интернет становится всё сложнее: Wayback Machine и Wikimedia страдают от дефицита HDD 14 ч.
«Золотой глобус» не будет дисквалифицировать номинантов из-за ИИ, но излишеств не допустит 16 ч.
Грузовики Tesla Semi получили батареи меньшей ёмкости, чем планировалось, но на запасе хода это не сказалось 25 мин.
Акции Intel подскочили в цене на 14 % после появления информации о сделке с Apple 2 ч.
Intel снова будет производить чипы для Apple, но не как раньше — WSJ узнала о предварительном соглашении 8 ч.
Logitech нарастит инвестиции в игровые продукты, ИИ и корпоративный сегмент 10 ч.
Пентагон рассекретил первую партию файлов об НЛО — впечатлить скептиков не удалось 12 ч.
У заднеприводных Cybertruck могут отвалиться колёса — Tesla отзывает все 173 проданных электромобиля 13 ч.
iFixit объявила «короля ремонтопригодности» среди наушников — у AirPods Max 2 всего 4 балла из 10 13 ч.
Asus выпустила 12,3" портативный сенсорный монитор ROG Strix XG129C и 34" геймерский ROG Strix OLED XG34WCDMS 13 ч.
Спрос на чипы AMD обогнал поставки — компания ищет спасение у Samsung Electronics 14 ч.
Nintendo готовится к падению продаж консолей Switch 2 уже через год после дебюта 14 ч.