Сегодня 27 февраля 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Microsoft представила VibeVoice — открытый ИИ, превращающий текст в полуторачасовые подкасты

Microsoft представила проект с открытым исходным кодом VibeVoice в области искусственного интеллекта — новую систему синтеза речи, способную генерировать из текста аудиоподкасты длительностью до 90 минут на английском или китайском языке. Технология уже доступна для тестирования любому желающему онлайн или с установкой на локальное устройство пользователя.

 Источник изображения: AI

Источник изображения: AI

Разработчики охарактеризовали VibeVoice как новаторский фреймворк, созданный для генерации продолжительного по времени аудиоконтента с несколькими участниками непосредственно из текста. Как пишет Windows Central, система решает ключевые проблемы традиционных синтезаторов речи (TTS), такие как масштабируемость, согласованность характеристик голоса и естественность чередования реплик в диалоге. Модель способна синтезировать аудио продолжительностью до 90 минут с участием до четырёх уникальных голосов, что превосходит ограничения в 1-2 спикера, характерные для многих предыдущих ИИ-моделей.

В настоящее время для тестирования доступны две версии модели: на 1,5 и 7 млрд параметров. Первая может генерировать до 90 минут аудио с длиной контекста 64 тыс. токенов, тогда как вторая, предположительно более качественная из-за большего размера, ограничена 45 минутами и окном в 32 тысячи токенов. Также ожидается выпуск облегчённой версии на 0,5 млрд параметров, предназначенной для работы в реальном времени. Для локальной работы меньшая модель требует около 7 Гбайт видеопамяти, а для большей может потребоваться до 18 Гбайт VRAM.

На текущий момент ИИ-модель VibeVoice обучена только на английском и китайском языках, включая мандаринскую разновидность (севернокитайский или путунхуа). Однако в Microsoft отмечают, что в будущих версиях планируется расширение поддержки других языков. Система способна передавать эмоции, управлять сменой реплик между участниками и генерировать естественные диалоги, хотя попытки воспроизведения музыки пока остаются неудачными. Голоса звучат довольно реалистично, однако их искусственное происхождение остаётся заметным. В перспективе разработчики рассматривают возможность интеграции функции клонирования голоса.

Разработчики отмечают, что при запуске потоковой версии аудиогенерации VibeVoice может быть интегрирована в чат-ассистенты, позволяя обходиться без внешних серверов. Дополнительные сведения, включая инструкции по установке и настройке, доступны в официальном репозитории VibeVoice в GitHub и на платформе Hugging Face.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Бесплатная версия Gemini получила премиальную функцию «Прошлые чаты» 6 ч.
AMD инвестирует в Nutanix $250 млн и создаст совместную платформу для агентного ИИ 7 ч.
AMD выпустила драйвер с поддержкой Resident Evil Requiem и Marathon 8 ч.
Nvidia выпустила драйвер с поддержкой Resident Evil Requiem 9 ч.
Жертвы перестали платить хакерам: уровень выплат упал до исторического минимума, хотя атак стало намного больше 10 ч.
Google представила Nano Banana 2 — обновлённый генератор изображений работает быстрее и качественнее, и доступен бесплатно 10 ч.
Новый трейлер амбициозного пиратского выживания Windrose разочаровал фанатов отсутствием даты выхода — разработчики отреагировали 10 ч.
Instagram будет оповещать родителей, если подросток ищет контент о суициде и членовредительстве 11 ч.
Технодесантник, новая операция и платные голоса: разработчики Warhammer 40,000: Space Marine 2 выпустили крупное обновление 12.0 11 ч.
Новый трейлер подтвердил дату выхода в раннем доступе Steam ролевой песочницы Valorborn с живым миром и полной свободой действий 12 ч.
Публикация квартальной отчётности действительно вызвала снижение курса акций Nvidia 2 ч.
iPhone и iPad стали первыми потребительскими устройствами, допущенными к секретным данным НАТО 6 ч.
Новая статья: Биочипы и органоидный интеллект 6 ч.
Lenovo покажет на MWC 2026 концепт портативной приставки Legion Go со складным дисплеем 7 ч.
Razer выпустила чехол для ноутбука за $130 со встроенной беспроводной зарядкой 7 ч.
Первый в мире трансатлантический оптоволоконный кабель TAT-8 демонтируют через 37 лет после прокладки 11 ч.
«Большая неделя впереди»: Apple пообещала порадовать фанатов чередой анонсов 11 ч.
Энтузиаст приспособил льдогенератор для охлаждения процессора — и добился 40 °C под нагрузкой 11 ч.
Разворот научных потоков: открывший графен Андрей Гейм продолжит научную карьеру в Гонконге после 20 лет в Манчестере 12 ч.
Иттрий подорожал в 69 раз за год — дефицит редкоземов в США усиливается даже после перемирия с Китаем 12 ч.