Сегодня 30 августа 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Google выпустила Gemini Omni — ИИ для генерации видео из текста, фото, аудио и любых других данных

Google представила новое семейство генеративных моделей искусственного интеллекта Gemini Omni, предназначенное для создания контента из любых типов входных данных. Первым продуктом линейки стала нейросеть Gemini Omni Flash, способная генерировать видеоролики на основе текста, фотографий, аудио или других видеозаписей. Алгоритм объединяет мультимодальные возможности с глубоким пониманием законов физики и реального мира.

 Источник изображений: Google

Источник изображений: Google

Ключевым отличием новинки от существующей модели Veo, как пишет Google в своём блоге, является функция преобразования одного видео в другое. Алгоритм не просто генерирует визуальный ряд, но и позволяет редактировать исходные кадры с помощью естественного языка в диалоговом формате, сохраняя логику сцены и последовательность действий персонажей при каждом новом запросе. Как отмечает старший директор по исследованиям Google DeepMind Думитру Эрхан (Dumitru Erhan), в настоящее время система может создавать ролики со звуком продолжительностью до 10 секунд, однако компания уже работает над увеличением этого лимита.

Модель опирается на обширную базу знаний экосистемы Gemini, что позволяет ей создавать сцены с учётом исторического и научного контекста, а также точно воспроизводить гравитацию или динамику жидкостей. Технический директор Google DeepMind и главный ИИ-архитектор Google Корай Кавукчуоглу (Koray Kavukcuoglu) подчеркнул, что новая технология обладает гораздо большей информацией об устройстве мира, чем предыдущие разработки. Пользователи также получат возможность сгенерировать собственный цифровой аватар и озвучить его своим голосом. Руководитель команды разработчиков продукта Николь Брихтова (Nicole Brichtova) указала, что подобная функция интеграции собственной внешности пользовалась огромным спросом в прошлогодней модели для генерации изображений Nano Banana, с помощью которой было создано более 50 миллиардов картинок.

В целях безопасности корпорация пока ограничивает алгоритм в возможности изменять чужую речь на видео, а все сгенерированные ролики автоматически помечаются невидимым цифровым водяным знаком SynthID для проверки подлинности контента. В будущем разработчики планируют добавить поддержку вывода аудио и статических изображений. Модель Gemini Omni Flash уже доступна глобально для подписчиков тарифов Google AI Plus, Pro и Ultra через приложение Gemini и сервис Google Flow.

Начиная с этой недели бесплатный доступ к генератору также открывается для пользователей в приложениях YouTube Shorts и YouTube Create App.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источники:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Новая статья: Mortal Shell 2 — вдвое больше. Рецензия 52 мин.
Следующая жертва ИИ — актёры: в Китае их массово заменяют цифровыми двойниками 7 ч.
Бигтехи теряют доверие людей — ИИ, соцсети и наступление ЦОД всё чаще вызывают страх и недовольство 9 ч.
Война Маска и Альтмана добралась до Cursor — купленный SpaceX сервис лишится моделей OpenAI 13 ч.
В роботах Unitree нашли опасную уязвимость, через которую можно поднять «восстание машин» 15 ч.
Google изменила политику по борьбе со спамом в ЕС, чтобы избежать антимонопольного штрафа 17 ч.
Раннюю версию DLSS 5 уже адаптировали для видеокарт GeForce RTX 4000 29-08 00:36
Новая статья: Были демоны, но они самоликвидировались: история серии Onimusha 29-08 00:00
Спасительный патч для Dragon’s Dogma 2 получил дату выхода — улучшения производительности и лечение от драконьей чумы задержатся 28-08 23:07
The Witcher 4 не пошла по пути Cyberpunk 2077 — CD Projekt Red рассказала о прогрессе разработки амбициозной RPG 28-08 20:42
SpaceX провела полномасштабный огневой тест двигателей ускорителя Super Heavy — 14-й полёт не за горами 5 ч.
Робоутка за $399 покорила сердца разработчиков — за сутки её заказали на $2,6 млн 5 ч.
Наноантенны многократно усилили яркость свечения живых клеток — это поможет увидеть активность мозга и не только 8 ч.
Ubiquiti выпустила карманный маршрутизатор UniFi Travel Router Long-Range за €89 11 ч.
Пропускная способность оптических модулей XPO вырастет вдвое — до 25,6 Тбит/с 11 ч.
Следующая Xbox будет не одной консолью — Microsoft готовит целое семейство 12 ч.
Android всё ещё контролирует три четверти мирового рынка смартфонов, но iOS и HarmonyOS наступают 13 ч.
NASA вернуло к работе обречённую обсерваторию Swift — теперь она сгорит в атмосфере ещё быстрее 13 ч.
Китайская ракета выбросила на орбиту кучу обломков — они угрожают Starlink 14 ч.
Квантовый датчик заменил GPS на корабле — он определяет координаты по гравитационным аномалиям 15 ч.