Сегодня 15 мая 2025
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Meta✴ анонсировала производительный ИИ-генератор изображений CM3Leon с поддержкой точных команд редактирования

За минувшие два года основанные на алгоритмах искусственного интеллекта генераторы изображений стали почти повседневным явлением, и на первый взгляд в работе они не так сильно отличаются друг от друга. Но в Meta утверждают, что разработанная инженерами компании новая модель CM3Leon является прорывом.

 Источник изображений: ***

Источник изображений: Meta

Отличием модели Meta CM3Leon, как заявляют разработчики, является высокая производительность при преобразовании текста в изображение. Кроме того, это одна из первых моделей, обеспечивающих обратную операцию — создание подписей к изображениям. Большинство современных генераторов изображений, включая OpenAI DALL-E, Google Imagen и Stable Diffusion при создании картинок используют диффузию — процесс постепенного удаления шума из первоначального изображения по мере приближения к поставленной цели. Результат получается убедительным, но данный алгоритм требует значительных вычислительных ресурсов, что делает работу таких систем дорогостоящей, а сами модели — медленными, и в реальном времени они функционировать попросту не могут.

 Редактирование исходного изображения: заменить девушку на бородатого мужчину, добавить очки, увеличить возраст, раскрасить лицо

Редактирование исходного изображения: заменить девушку на бородатого мужчину, добавить очки, увеличить возраст, раскрасить лицо

Модель CM3Leon действует принципиально иначе — в её основе лежит алгоритм-трансформер, предусматривающий оценку релевантности исходных данных, будь то текст или изображение. Примечательно, что и в OpenAI первоначально строили генераторы изображений на основе моделей-трансформеров, но на смену Image GPT пришли диффузионные алгоритмы. При обучении CM3Leon использовались 2 млн изображений, лицензированных у Shutterstock — самая мощная версия модели имеет 7 млрд параметров — в два раза больше, чем у OpenAI DALL-E 2. Наконец, здесь использован механизм дообучения SFT (Supervised Fine-Tuning), обычно свойственный генераторам текста. В результате увеличилась производительность модели при генерации изображений и составлении описаний к готовым картинкам, а система получила возможность редактировать изображения по текстовым командам, например, «изменить цвет неба на ярко-синий».

 Генерация интерьера с объектами, для которых указываются точные координаты

Генерация интерьера с объектами, для которых указываются точные координаты

В результате Meta CM3Leon воспринимает в качестве исходных данных весьма конкретные команды — вплоть до того, в какой области изображения в пикселях должен находиться тот или иной предмет. Для сравнения, DALL-E такие нюансы игнорирует и зачастую даже отказывается помещать на изображение объекты, непосредственно указанные в инструкции.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Samsung рассказала, когда смартфоны Galaxy начнут получать One UI 8 на базе Android 16 3 мин.
ИИ в поиске нового Пеле: нейросети подключили к отбору талантливых футболистов в Бразилии 6 мин.
«Аквариус» предложил президенту распространить на весь ИТ-сектор меры поддержки выхода на фондовый рынок 29 мин.
Объём российского рынка СУБД к 2031 году превысит 251 млрд рублей 53 мин.
Российский суд запретил Google Ireland мешать банкротству «Гугл» в суде США 2 ч.
Успех Assassin’s Creed Shadows подтолкнул Ubisoft тратить больше времени на разработку — сразу несколько «наиболее крупных» игр перенесены 2 ч.
«Выпускайте Палача»: спустя пять лет после Doom Eternal на ПК и консолях вышла Doom: The Dark Ages 3 ч.
«Hey, Copilot!»: Microsoft начала тестировать голосовой запуск ИИ в Windows 3 ч.
Российский суд оштрафовал WhatsApp и Signal на 800 000 рублей каждого 3 ч.
VK похвалилась, что почти удвоила число блогеров в «VK Видео» за девять месяцев 3 ч.
Спрос на AMD Instinct MI325X со стороны крупных компаний оказался ниже ожиданий из-за ограниченных возможностей масштабирования 10 мин.
Китайские автопроизводители запустили гонку по созданию электрических летательных аппаратов 2 ч.
Учёные США массово ищут работу за границей — этим воспользуются Китай и Европа 2 ч.
Oracle выделит $14 млрд на развитие ИИ и облака в Саудовской Аравии 2 ч.
Игровые видеокарты Nvidia подорожали в Китае после запрета ускорителей H20 3 ч.
vStack и TERA IT готовят HCI ПАК для бизнеса и госсектора 3 ч.
Tencent заявила о запасах ИИ-ускорителей на годы вперёд — санкции США не остановят развитие китайского ИИ 3 ч.
Китай начал стоить дата-центр с ИИ на орбите — запущены первые 12 из 2800 спутников 3 ч.
Synology готовит All-Flash СХД PAS7700 на платформе AMD 3 ч.
Австралия станет космической державой — первая ракета готова к историческому запуску 4 ч.