Сегодня 19 мая 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Теги → vibevoice

Microsoft представила VibeVoice — открытый ИИ, превращающий текст в полуторачасовые подкасты

Microsoft представила проект с открытым исходным кодом VibeVoice в области искусственного интеллекта — новую систему синтеза речи, способную генерировать из текста аудиоподкасты длительностью до 90 минут на английском или китайском языке. Технология уже доступна для тестирования любому желающему онлайн или с установкой на локальное устройство пользователя.

 Источник изображения: AI

Источник изображения: AI

Разработчики охарактеризовали VibeVoice как новаторский фреймворк, созданный для генерации продолжительного по времени аудиоконтента с несколькими участниками непосредственно из текста. Как пишет Windows Central, система решает ключевые проблемы традиционных синтезаторов речи (TTS), такие как масштабируемость, согласованность характеристик голоса и естественность чередования реплик в диалоге. Модель способна синтезировать аудио продолжительностью до 90 минут с участием до четырёх уникальных голосов, что превосходит ограничения в 1-2 спикера, характерные для многих предыдущих ИИ-моделей.

В настоящее время для тестирования доступны две версии модели: на 1,5 и 7 млрд параметров. Первая может генерировать до 90 минут аудио с длиной контекста 64 тыс. токенов, тогда как вторая, предположительно более качественная из-за большего размера, ограничена 45 минутами и окном в 32 тысячи токенов. Также ожидается выпуск облегчённой версии на 0,5 млрд параметров, предназначенной для работы в реальном времени. Для локальной работы меньшая модель требует около 7 Гбайт видеопамяти, а для большей может потребоваться до 18 Гбайт VRAM.

На текущий момент ИИ-модель VibeVoice обучена только на английском и китайском языках, включая мандаринскую разновидность (севернокитайский или путунхуа). Однако в Microsoft отмечают, что в будущих версиях планируется расширение поддержки других языков. Система способна передавать эмоции, управлять сменой реплик между участниками и генерировать естественные диалоги, хотя попытки воспроизведения музыки пока остаются неудачными. Голоса звучат довольно реалистично, однако их искусственное происхождение остаётся заметным. В перспективе разработчики рассматривают возможность интеграции функции клонирования голоса.

Разработчики отмечают, что при запуске потоковой версии аудиогенерации VibeVoice может быть интегрирована в чат-ассистенты, позволяя обходиться без внешних серверов. Дополнительные сведения, включая инструкции по установке и настройке, доступны в официальном репозитории VibeVoice в GitHub и на платформе Hugging Face.


window-new
Soft
Hard
Тренды 🔥
«Базис» впервые стал лауреатом премии «ЦИПР Диджитал» за проект в теплоэнергетике 2 ч.
Конференция Apple WWDC 2026 начнётся 8 июня, уделив особое внимание искусственному интеллекту 4 ч.
Google запустил масштабное обновление иконок своих сервисов — они станут более индивидуальными 4 ч.
Илон Маск проиграл суд против OpenAI — присяжные сочли претензии просроченными 5 ч.
Календарь релизов 18–24 мая: Forza Horizon 6, Zero Parades, Lego Batman и Phonopolis 11 ч.
PS Plus снова подорожает, но не для всех и не везде 14 ч.
«Одно из самых весёлых игровых событий года»: приключенческий экшен Lego Batman: Legacy of the Dark Knight понравился критикам 14 ч.
NVIDIA представила платформу Fleet Intelligence для мониторинга парка ИИ-ускорителей 15 ч.
Ошибочка вышла: европейские дистрибьюторы опровергли слухи о сегодняшнем старте предзаказов GTA VI 15 ч.
«Бессмысленная фиктивная работа»: ИИ завалил разработчиков Linux дублями сообщений об уязвимостях 16 ч.
Южнокорейский суд запретил работникам Samsung бастовать из-за низких премий — разве что понемножку 5 мин.
Baikal обещает к 2030 году выпустить «основу суверенных дата-центров» — отечественные ИИ-чипы, совместимые с Nvidia CUDA 7 мин.
Европа снова хочет свой «Шаттл» — французский проект космоплана VORTEX поддержала Германия 8 мин.
Глава Seagate уронил акции производителей памяти заявлением о бессмысленности новых фабрик 32 мин.
Энергия как услуга: Hitachi и X LABS займутся созданием гигаваттных энергетических парков для ИИ ЦОД 37 мин.
Компактный планшет Huawei MatePad Mini стал доступен для предзаказа в России 2 ч.
Учёные получили водород из воды без драгоценных металлов в катализаторах 3 ч.
«Очень серьёзный прорыв»: Intel уверена, что техпроцесс 14A позволит ей снова бросить вызов TSMC 3 ч.
Дженсен Хуанг надеется, что Китай со временем откроет рынок для Nvidia H200 3 ч.
Первый полёт Starship V3 в рамках программы Flight 12 перенесён на 20 мая 4 ч.