Сегодня 17 июня 2025
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Alibaba представила нейросеть EMO — она оживляет портреты, заставляя их разговаривать и даже петь

Исследователи из Института интеллектуальных вычислений Alibaba разработали (PDF) систему искусственного интеллекта EMO (Emote Portrait Alive), которая анимирует статическое изображение человека, заставляя его реалистично говорить или петь.

 Источник изображения: youtube.com/@ai_beauty303

Источник изображения: youtube.com/@ai_beauty303

Система изображает реалистичную мимику и движения головы, точно соответствующие эмоциональным оттенкам звукового ряда, на основе которого генерируется анимация. «Традиционные методы зачастую неспособны передать полный спектр человеческих выражений лица и уникальность отдельных его стилей. Для решения этих проблемы мы предлагаем EMO — новый фреймворк, использующий подход прямого синтеза из аудио в видео, минуя потребность в промежуточных 3D-моделях или лицевых опорных точках», — пояснил глава группы разработчиков Линьжуй Тянь (Linrui Tian).

В основе системы EMO лежит диффузионная модель ИИ, зарекомендовавшая себя как способная генерировать реалистичные изображения. Исследователи обучили её на массиве данных, включающем более 250 часов видеозаписей «говорящей головы»: выступлений, фрагментов фильмов, телешоу и вокальных выступлений. В отличие от предыдущих методов, предполагающих создание трёхмерной модели или механизмов имитации человеческой мимики, EMO предполагает прямое преобразование звука в видеоряд. Это позволяет системе передавать мельчайшие движения и связанные с естественной речью особенности личности.

Авторы проекта утверждают, что EMO превосходит существующие методы по показателям качества видео, сохранения идентичности и выразительности. Исследователи опросили фокус-группу, и та показала, что созданные EMO видеоролики более естественны и эмоциональны, чем произведения других систем. Система создаёт анимацию не только на основе речи, но и с использованием звукового ряда с вокалом — она учитывает форму рта человека на оригинальном изображении, добавляет соответствующую мимику и синхронизирует движения с вокальной партией. Единственной связанной с EMO проблемой является вероятность злоупотребления этой технологией. Исследователи сообщают, что планируют изучить методы выявления созданных ИИ видеороликов.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Новая статья: Обзор Infinix NOTE 50 Pro+ 5G+: смартфон, у которого получается почти все 2 ч.
Ноутбук Lenovo ThinkBook Plus Gen 6 с расширяющимся экраном поступит в продажу на этой неделе по цене от $3499 3 ч.
Meta и Oakley представят смарт-очки до конца этой недели, но это не точно 3 ч.
Энтузиаст превратил провальную ИИ-брошь Humane AI Pin в умного ассистента 3 ч.
Подводный интернет-кабель AAE-2 свяжет Азию, Африку, Ближний Восток и Европу в обход Красного моря 8 ч.
Дети Трампа представили золотой смартфон T1 за $499, который «спроектирован и произведён в США» 8 ч.
Характеристики «честного» смартфона Fairphone 6 стали известны до анонса 8 ч.
AWS с нуля разработала и начала выпуск собственной СЖО для ИИ ЦОД всего за 11 месяцев 9 ч.
Китайский рынок робототехники вырастет более чем вдвое к 2028 году 11 ч.
OnePlus анонсировала скорый выход смартфонов Nord 5 и Nord CE5, а также смарт-часов, планшета и наушников 11 ч.