Сегодня 29 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Учёные доказали: ИИ-картинки зачастую нельзя связать с конкретными изображениями из обучающих данных

Учёные Лаборатории компьютерных наук и искусственного интеллекта (CSAIL) при Массачусетском технологическом институте доказали, что по мере роста наборов данных связь между тем, чему учится модель, и тем, что она генерирует, практически исчезает. Это указывает на необоснованность претензий правообладателей к лабораториям ИИ.

 Источник изображения: news.mit.edu

Источник изображения: news.mit.edu

Американские учёные открыли явление «затухания атрибуции» (attribution decay), при котором чем больше данных используется при обучении генеративной модели искусственного интеллекта, тем меньшее значение имеет любой конкретный элемент в обучающем массиве для любого конкретного результата генерации. При достаточно больших масштабах можно вообще удалить из обучающих данных любое отдельное изображение, все изображения определённого художника или все фотографии определённого человека, и сгенерированная моделью картинка не изменится.

Доказать это на практике было непросто. В общем случае, чтобы узнать, каков был бы ответ модели на конкретный запрос, если бы она никогда не видела определённое изображение, потребовались бы обучить точно такую же модель без этого изображения и повторить опыт; а затем повторить всё сначала для следующего изображения в обучающем массиве. Поэтому учёные предложили альтернативное решение — созданную ими самостоятельно архитектуру «диффузионного ансамбля» (diffusion ensemble). Это не единая монолитная модель, а множество мелких компонентов, каждый из которых обучен на отдельном фрагменте данных. В этом случае, чтобы узнать, как бы модель работала без конкретного изображения в обучающих данных, достаточно отключить те части ансамбля, которые его видели. Результаты работы этой системы сравнивались с результатами ответов 24 обычных диффузионных моделей, обученных на тех же данных. Изображения получились одинаково хорошими по стандартным показателям.

Учёные пришли к выводу, что чем больше объёмы обучающих данных, тем лучше ансамбли показывают себя по сравнению с аналогами на основе одной модели. В ходе анализа они отправляли группе моделей один запрос, удаляли из обучающих данных по одному изображению и сравнивали расхождение результатов. На основе эксперимента они ввели понятие «контрфактического радиуса» (counterfactual radius) — максимального влияния, которое мог оказывать отдельный элемент в обучающем массиве. В результате исследователи установили закономерность: чем больше обучающий набор данных, тем меньше контрфактический радиус. Другими словами, тем меньше влияние любого конкретного элемента. Результаты сравнивались как попиксельно, так и по общему семантическому значению.

В юридическом аспекте открытие означает, что ИИ-модели демонстрируют по-настоящему творческий подход — они не копируют материалы из исходных данных, а создают совершенно новые результаты. И если эти результаты не имеют ничего общего с отдельными элементами из обучающего массива, то использование контента, даже защищённого авторским правом, является добросовестным даже без обращения к правообладателю. На языковых моделях этот подход пока не проверяли.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Окружённый слухами «реалистичный» хоррор Abandoned спустя четыре года вернулся из небытия с обновлённой страницей в PS Store 8 мин.
Microsoft показывает подрядчикам пользовательские запросы и фото из Copilot — среди них хватает интима 10 мин.
Выпущен атмосферный трейлер Stranger Than Heaven — нового криминального экшена от авторов Yakuza 13 мин.
Исследователи OpenAI и Google бьют тревогу — развитие ИИ опережает возможности людей его контролировать 54 мин.
«Билайн бизнес» запустил коммуникационную платформу, которая помнит каждого клиента 2 ч.
Minecraft Dungeons 2 стартовал в Steam с рейтингом 46 % — ролевой экшен ругают за множество технических ошибок 2 ч.
Тысячи iOS-приложений начали падать после запуска — внезапно, из-за сервиса Google 2 ч.
Китай перетянул к себе 41 % лучших в мире ИИ-исследователей — у США только 34 % 2 ч.
OpenAI готовит потребительского ИИ-агента Aeon — победить Muse и других конкурентов будет непросто 2 ч.
«Лучше сохраните деньги»: на старте раннего доступа Ace Combat 8: Wings of Theve заслужила в Steam «смешанные» отзывы 5 ч.
ИИ прожорлив: ByteDance поглощает пятую часть всех мощностей китайских ЦОД 46 мин.
Motorola тоже готовит «паспортный» складной смартфон — Razr Flex получит экран 165 Гц и кнопку вызова ИИ 3 ч.
ИИ-агенты научились самостоятельно проектировать и проверять чипы — Synopsys представила AgentEngineer 3 ч.
Деньги ходят по кругу, риски растут: Nvidia пытается втянуть страховые компании в сделки по финансированию ИИ-бума 5 ч.
Космическое импортозамещение: «Эльбрусы» появились в наземной части «Союза-5» и готовятся перейти на ракеты 5 ч.
«Яндекс» выпустил сверхлёгкий премиум-ноутбук Lunnen Airis 14 за 100 тысяч рублей 5 ч.
Supermicro начала поставки NVIDIA Vera Rubin NVL72 с CDU на 1,8 МВт 5 ч.
Сингапур разработал первый в мире национальный стандарт СЖО для ЦОД в тропическом климате 5 ч.
Многострадальный корабль Boeing Starliner вернули к полётам — реанимационные мероприятия продолжатся 6 ч.
Tesla отложила презентацию парящего спорткара Roadster на две недели — из-за нелётной погоды в Техасе 6 ч.