OpenAI представила обновлённый вариант генератора изображений ChatGPT Images 2.5 — в этой версии разработчик сделал упор не на способности модели рисовать красивую картинку, а на точности выполнения запросов пользователя при редактировании существующих.
Источник изображений: openai.com
При загрузке исходной фотографии в качестве образца модель OpenAI ChatGPT Images 2.5 стала лучше сохранять идентичность ключевого объекта, например, человека, если нужно изменить стиль или сцену изображения. Повысилась точность выполнения инструкций: при редактировании модель эффективнее изменяет только те аспекты изображения, на которые указывает пользователь, не трогая остальных — это могут быть фон, предмет гардероба или надпись. Особенно важной новая возможность представляется при редактировании за несколько шагов — больше не придётся беспокоиться, что на одном из этапов лицо человека изменится, или действия предыдущего этапа будут сведены на нет на последующем.

Повысилась скорость работы: по сравнению с предшественницей OpenAI ChatGPT Images 2.5 может экономить до 50 % времени при выполнении запроса. Модель стала более восприимчивой к сложным запросам — она лучше обрабатывает описания композиций, текст, прозрачный фон и визуальные стили. При экспорте изображения можно быстро опубликовать не только саму картинку, но и соответствующий ей запрос, благодаря чему другие пользователи сервиса могут попытаться добиться того же результата со своим исходным изображением. Важным нововведением стала функция «Набросок» (Sketch): теперь прямо в интерфейсе ChatGPT можно от руки изобразить примерную схему того, что должно получиться на выходе — это пригодится, когда описать пространственную композицию словами оказывается непросто. Полезной окажется и функция шаблонов для типовых задач при генерации постеров или маркетинговых материалов.

Генератор изображений OpenAI ChatGPT Images 2.5 доступен на платформах ChatGPT, ChatGPT Work и Codex в десктопных и мобильных приложениях, а также в веб-интерфейсе и через API. Модель доступна в двух вариантах: в более простом и универсальном GPT-Image-2.5 Flare, который подойдёт для большинства задач; а также в медленном GPT-Image-2.5 Sunburst, который предлагает максимальный контроль и высокую точность редактирования. При генерации к картинкам добавляются невидимые «водяные знаки» и метаданные C2PA — маркировка обеспечивает прозрачность для созданных или отредактированных с помощью ИИ изображений.
Источник:


MWC 2018
2018
Computex
IFA 2018






