Сегодня 08 мая 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Xiaomi представила OmniVoice — открытую ИИ-модель, которая озвучит текст почти на любом языке и скопирует голос

Xiaomi объявила о выходе открытой модели искусственного интеллекта OmniVoice, предназначенной для преобразования текста в речь — помимо речевого синтеза на нескольких сотнях языков, она поддерживает клонирование голоса и настраиваемую генерацию речи.

 Источник изображения: Xiaomi

Источник изображения: Xiaomi

OmniVoice, по словам разработчика, демонстрирует высокие показатели в китайском и английском языках, выступая конкурентом существующих коммерческих систем и превосходя их в ряде задач. Одним из главных преимуществ модели является поддержка языков даже с ограниченными ресурсами — она генерирует речь «почти на любом языке», даже если для него был доступен лишь небольшой объём обучающих данных. Кроме того, отметили в Xiaomi, это первая в отрасли модель для клонирования голоса с охватом нескольких сотен языков.

По результатам многоязычного тестирования OmniVoice превзошла несколько коммерческих систем на 24 языках по сходству и разборчивости речи — даже при обучении на открытых наборах данных. При тестировании на 102 языках разборчивость речи OmniVoice была близка к человеческой, а в некоторых случаях и превосходила её. Высокое качество на выходе удалось обеспечить даже в тех случаях, когда по какому-либо языку было менее 10 часов обучающих данных.

 Источник изображения: Ali Khadem / unsplash.com

Источник изображения: Ali Khadem / unsplash.com

По сравнению с современными системами синтеза речи OmniVoice отличает гораздо более простая архитектура: вместо подключения нескольких модулей и этапов прогнозирования здесь развёрнута единая двунаправленная сеть типа трансформер для прямого преобразования текста в речь. Не нужно отдельно моделировать текст, подключать сложные гибридные структуры и многоуровневые системы прогнозирования токенов. Упрощённая архитектура означает высокую скорость работы модели — всего за один день её можно обучить на 100 000 часов данных; а при инференсе (запуске) она работает на величину до 40 раз быстрее реального времени с использованием ИИ-фреймворка PyTorch, то есть относительно просто развёртывается в потребительских приложениях и сервисах.

Высокую производительность OmniVoice, рассказали в Xiaomi, обеспечили при помощи двух решений. Во-первых, при обучении модели применили «метод случайного скрытия акустических кодов», что увеличило эффективность обучения и расширило общие возможности модели. Во-вторых, на этапе предварительного обучения к ней подключили большую языковую модель — она помогла повысить точность произношения и разборчивость речи.

OmniVoice предлагает несколько практических функций. Модель может сгенерировать голос по описанным пользователем свойствам — учесть возраст, пол, высоту тона, акцент, диалект и стиль речи; без необходимости в эталоне можно генерировать шёпот и другие особые стили речи. Она также умеет удалять из образца шумы и извлекать чёткие характеристики голоса, чтобы копировать его даже тогда, когда исходный аудиофайл записывался в далёких от идеальных условиях. Есть также средства управления интонацией, генерируются вздохи и взрывы смеха, что делает производимую речь более естественной. Наконец, можно вручную корректировать сложные аспекты произношения, например, многозвучные китайские иероглифы или англоязычные имена собственные.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Dirty Frag превзошла Copy Fail: вторая за месяц критическая уязвимость Linux осталась без исправлений 21 мин.
Хакеры теперь грабят хакеров: новая группировка PCPJack перехватывает заражённые сети 49 мин.
ИИ-агент Perplexity Personal Computer стал доступен всем пользователям Apple macOS 51 мин.
Xiaomi представила OmniVoice — открытую ИИ-модель, которая озвучит текст почти на любом языке и скопирует голос 52 мин.
Диско снова в моде: неоновый экшен Dead as Disco порадовал разработчика продажами 58 мин.
«Леон должен умереть навсегда»: Capcom выпустила для Resident Evil Requiem обновление с новым режимом, и фанаты «Наёмников» не рады 2 ч.
В ChatGPT появился «доверенный контакт» — его уведомят, если пользователь захочет навредить себе 3 ч.
OpenAI распустила две команды по безопасности ИИ ради прибыли, заявила бывшая сотрудница стартапа 3 ч.
Приложение Fitbit превратилось в Google Health — и сможет собирать данные о здоровье даже из Apple Health 14 ч.
Новый стандарт жанра для вселенной «Чужих»: анонсирован амбициозный кооперативный шутер Aliens: Fireteam Elite 2 15 ч.
Аккумуляторы Tesla 4680 оказались хуже сторонних, хотя Илон Маск обещал обратное 46 мин.
Представлен стабилизатор для смартфонов DJI Osmo Mobile 8P — теперь со съёмным дисплеем-пультом 47 мин.
Apple завершила разработку наушников AirPods с камерами и скоро запустит серийное производство 48 мин.
NVIDIA и Iren объединили усилия для создания ИИ-инфраструктуры мощностью до 5 ГВт 3 ч.
Arm уже получает 15 % выручки от серверного направления и рассчитывает утроить её к 2031 году 5 ч.
AMD представила ускоритель Instinct MI350P — CDNA 4 в формате PCIe 11 ч.
Новая статья: Ноутбук DIGMA PRO Pactos на процессоре AMD Ryzen 5 7430U: скромность украшает 12 ч.
GeIL анонсировала модули DDR5, которые работают со скоростью 8000 МТ/с без разгона 14 ч.
AMD выпустила ИИ-ускоритель Instinct MI350P с 144 Гбайт HBM3E, PCIe 5.0 x16 и потреблением 600 Вт 14 ч.
Компания Ploopy «отделила» культовый манипулятор TrackPoint от ноутбуков ThinkPad и превратила его в портативную мышь 16 ч.