Сегодня 07 августа 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Microsoft представила VibeVoice — открытый ИИ, превращающий текст в полуторачасовые подкасты

Microsoft представила проект с открытым исходным кодом VibeVoice в области искусственного интеллекта — новую систему синтеза речи, способную генерировать из текста аудиоподкасты длительностью до 90 минут на английском или китайском языке. Технология уже доступна для тестирования любому желающему онлайн или с установкой на локальное устройство пользователя.

 Источник изображения: AI

Источник изображения: AI

Разработчики охарактеризовали VibeVoice как новаторский фреймворк, созданный для генерации продолжительного по времени аудиоконтента с несколькими участниками непосредственно из текста. Как пишет Windows Central, система решает ключевые проблемы традиционных синтезаторов речи (TTS), такие как масштабируемость, согласованность характеристик голоса и естественность чередования реплик в диалоге. Модель способна синтезировать аудио продолжительностью до 90 минут с участием до четырёх уникальных голосов, что превосходит ограничения в 1-2 спикера, характерные для многих предыдущих ИИ-моделей.

В настоящее время для тестирования доступны две версии модели: на 1,5 и 7 млрд параметров. Первая может генерировать до 90 минут аудио с длиной контекста 64 тыс. токенов, тогда как вторая, предположительно более качественная из-за большего размера, ограничена 45 минутами и окном в 32 тысячи токенов. Также ожидается выпуск облегчённой версии на 0,5 млрд параметров, предназначенной для работы в реальном времени. Для локальной работы меньшая модель требует около 7 Гбайт видеопамяти, а для большей может потребоваться до 18 Гбайт VRAM.

На текущий момент ИИ-модель VibeVoice обучена только на английском и китайском языках, включая мандаринскую разновидность (севернокитайский или путунхуа). Однако в Microsoft отмечают, что в будущих версиях планируется расширение поддержки других языков. Система способна передавать эмоции, управлять сменой реплик между участниками и генерировать естественные диалоги, хотя попытки воспроизведения музыки пока остаются неудачными. Голоса звучат довольно реалистично, однако их искусственное происхождение остаётся заметным. В перспективе разработчики рассматривают возможность интеграции функции клонирования голоса.

Разработчики отмечают, что при запуске потоковой версии аудиогенерации VibeVoice может быть интегрирована в чат-ассистенты, позволяя обходиться без внешних серверов. Дополнительные сведения, включая инструкции по установке и настройке, доступны в официальном репозитории VibeVoice в GitHub и на платформе Hugging Face.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
«Вершина высокомерия Rockstar»: фанаты жёстко раскритиковали решение сделать новую демонстрацию GTA VI временным эксклюзивом Netflix 13 мин.
Хакеры атаковали десятки крупнейших финансовых компаний США — оружием стали обычные телефонные звонки 2 ч.
Создатель TikTok разрабатывает ИИ-модель с 10 трлн параметров — как у передовой Anthropic Mythos 2 ч.
Суд обязал Meta изменить Facebook и Instagram ради защиты подростков и выплатить $567 млн 2 ч.
Жестокий боевик Condemned 2: Bloodshot от создателей F.E.A.R. спустя 18 лет стал доступен на ПК благодаря увлечённому энтузиасту 2 ч.
Devolver выкатила последнее бесплатное дополнение к Ball x Pit — продажи роглайка про игру с шарами превысили два миллиона копий 3 ч.
По мотивам книжной серии «Коты-Воители» выйдет пошаговая RPG — первый трейлер и подробности Warrior Cats: Clans of the Forest 4 ч.
RTX Spark становится ближе: Nvidia перенесла нейросетевое сжатие текстур на Windows on Arm 13 ч.
Легендарный шутер Quake спустя 30 лет после выхода получил новое дополнение от разработчиков Wolfenstein 16 ч.
Тактический экшен, масштабные операции и публичное тестирование: Ubisoft раскрыла подробности новой Ghost Recon в честь 25-летия серии 17 ч.
Инженеры Google создали портативный офлайн-переводчик с ИИ на Raspberry Pi 5 27 мин.
SK hynix потратит $38 млрд на расширение производства памяти в Южной Корее 30 мин.
Unitree подготовилась к выходу на биржу — DeepSeek закупит акций на $20,8 млн 58 мин.
ИИ в поиске Google убедил людей, что дорожные камеры набиты золотом — началась волна вандализма 2 ч.
Samsung Galaxy S26 FE почти рассекречен — раскрыты дизайн, характеристики и дата выхода 2 ч.
Китай меняет стратегию чиповой гонки — миллиарды направят на ИИ, HBM и передовую упаковку 3 ч.
Премиальные смартфоны бьют рекорды продаж, и 65 % этого сегмента захватили iPhone 3 ч.
Мировые продажи планшетов во II квартале рухнули на 10 % — сильнее всего продажи рухнули у Samsung и Huawei 4 ч.
Похож на пончик и двигается: раскрыты новые подробности о первом ИИ-гаджете OpenAI от Джони Айва 4 ч.
AMD купит канадского разработчика ИИ-чипов для инференса Taalas 8 ч.