Сегодня 13 июня 2025
18+
MWC 2018 2018 Computex IFA 2018
реклама
Теги → панорамы

Intel Labs представила нейросеть для генерации панорамных изображений с 360-градусным обзором

Intel Labs в сотрудничестве с Blockade Labs представили латентную диффузионную ИИ-модель для создания панорамных трёхмерных изображений (LDM3D) с 360-градусным обзором, которая первой в отрасли обеспечивает отображение глубины сцены. LDM3D может произвести революцию в создании реалистичного визуального 3D-контента, приложениях метавселенной и цифровом опыте, найти применение в широком спектре отраслей — от развлечений и игр до архитектуры и дизайна.

 Источник изображения: Intel Labs

Источник изображения: Intel Labs

LDM3D была обучена на наборе данных, созданном из подмножества 10 000 образцов базы данных LAION-400M, которая содержит более 400 миллионов пар изображений и подписей к ним. Для отображения точной относительной глубины каждого пикселя была использована разработанная Intel Labs модель Dense Prediction Transformer (DPT). Набор данных LAION-400M создан, чтобы обеспечить возможность широкомасштабного тестирования модели для широкого круга исследователей и других заинтересованных сообществ.

Модель LDM3D обучалась на суперкомпьютере Intel AI на базе процессоров Intel Xeon и ускорителей Intel Habana Gaudi AI. Полученная модель и конвейер объединяют сгенерированное изображение и карту глубины для создания 360-градусных панорамных представлений.

Чтобы продемонстрировать потенциал LDM3D, исследователи разработали приложение DepthFusion, которое использует стандартные 2D-фотографии RGB и карты глубины для создания интерактивной 360-градусной панорамы. Для превращения текстовых подсказок в 3D-панорамы применяется язык визуального программирования TouchDesigner на основе узлов для интерактивного мультимедийного контента в реальном времени. Модель LDM3D объединяет изображение RGB и его карту глубины, что приводит к экономии памяти и ускорению работы.

Примеры панорамных изображений с 360-градусным обзором

«Технология генеративного ИИ направлена на расширение человеческого творчества и экономию времени. Однако большинство сегодняшних моделей ИИ ограничены созданием 2D-изображений. В отличие от них LDM3D позволяет пользователям генерировать изображение и карту глубины из заданной текстовой подсказки. Это обеспечивает более точную относительную глубину для каждого пикселя по сравнению со стандартными методами постобработки и экономит разработчикам значительное время при разработке сцен», — пояснил Васудев Лал (Vasudev Lal), научный сотрудник Intel Labs.

Это исследование может революционизировать взаимодействие с цифровым контентом, позволяя пользователям отображать текстовые подсказки ранее немыслимыми способами. Изображения и карты глубины, сгенерированные LDM3D, позволяют пользователям превратить текстовое описание безмятежного тропического пляжа, современного небоскрёба или научно-фантастической вселенной в детализированную панораму. Способность создавать карту глубины изображения может мгновенно повысить общий реализм и погружение, позволяя создавать инновационные приложения для различных отраслей, от развлечений и игр до дизайна интерьеров и каталогов недвижимости, а также виртуальных музеев и иммерсивной виртуальной реальности.

Внедрение LDM3D и DepthFusion прокладывает путь к дальнейшему развитию генеративного ИИ и компьютерного зрения. Intel продолжит исследования генеративного ИИ для расширения человеческих возможностей и создания экосистемы разработок в области ИИ с открытым исходным кодом, которая демократизирует доступ к этой технологии. LDM3D предоставляется с открытым исходным кодом через сообщество HuggingFace.


window-new
Soft
Hard
Тренды 🔥
Meta AI показывает всем чужие переписки с интимными подробностями — формально с согласия самих пользователей 45 мин.
Симулятор RoadCraft от авторов MudRunner и SnowRunner показал один из лучших запусков в истории Focus Entertainment 2 ч.
Обнаружен вирус-шпион BrowserVenom, маскирующийся под приложение DeepSeek 2 ч.
Кооперативная игра Peak от создателей Content Warning и Another Crab's Treasure отправит покорять смертельно опасную гору — тизер геймплея и дата выхода 3 ч.
Meta купила половину Scale AI за $14 млрд, в попытке догнать конкурентов в гонке ИИ 3 ч.
Rockstar позволит Дрейку и другим музыкантам загружать новые песни на свои радиостанции в GTA VI 5 ч.
Продажи Devil May Cry 5 достигли 10 миллионов копий — помог анимационный сериал от Netflix 6 ч.
Apple планирует «допилить» ИИ-вариант Siri к весне следующего года 8 ч.
Mundfish показала новый геймплей Atomic Heart 2 и The Cube — мультиплеерного шутера на гигантском вращающемся кубе 16 ч.
Microsoft научила ИИ-помощника Copilot «видеть» приложения в Windows 17 ч.
В Финляндии запустили крупнейший в мире тепловой аккумулятор на мыльном камне 15 мин.
Почти все собранные в Индии iPhone теперь отправляются в США — Apple ускорила диверсификацию 2 ч.
Полёт частного экипажа на МКС отложен из-за аномалии давления в российском модуле станции 4 ч.
TSMC открыла в Японии исследовательский центр совместно с Токийским университетом 5 ч.
AMD выпустит серверные процессоры EPYC Verano на Zen 7 и ИИ-ускорители Instinct MI500 в 2027 году 9 ч.
AMD представила ИИ-ускорители Instinct MI350 и MI355X с потреблением до 1400 Вт, а также приоткрыла MI400 с 432 Гбайт HBM4 9 ч.
Meta нашла новый источник энергии для прожорливого ИИ —  геотермальные станции 9 ч.
AMD поделилась первыми деталями о серверных процессорах EPYC Venice на архитектуре Zen 6 — они выйдут в 2026 году 10 ч.
Radeon RX 9070 XT с чипами памяти Samsung работают на 1–2 % медленнее моделей с памятью SK hynix 10 ч.
AMD готовит ИИ-стойки Helios AI двойной ширины с Instinct MI400, AMD EPYC Venice и 800GbE DPU Pensando Vulcano 13 ч.