Сегодня 20 августа 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Учёные доказали: ИИ-картинки зачастую нельзя связать с конкретными изображениями из обучающих данных

Учёные Лаборатории компьютерных наук и искусственного интеллекта (CSAIL) при Массачусетском технологическом институте доказали, что о мере роста наборов данных связь между тем, чему учится модель, и тем, что она генерирует, практически исчезает. Это указывает на необоснованность претензий правообладателей к лабораториям ИИ.

 Источник изображения: news.mit.edu

Источник изображения: news.mit.edu

Американские учёные открыли явление «затухания атрибуции» (attribution decay), при котором чем больше данных используется при обучении генеративной модели искусственного интеллекта, тем меньшее значение имеет любой конкретный элемент в обучающем массиве для любого конкретного результата генерации. При достаточно больших масштабах можно вообще удалить из обучающих данных любое отдельное изображение, все изображения определённого художника или все фотографии определённого человека, и сгенерированная моделью картинка не изменится.

Доказать это на практике было непросто. В общем случае, чтобы узнать, каков был бы ответ модели на конкретный запрос, если бы она никогда не видела определённое изображение, потребовались бы обучить точно такую же модель без этого изображения и повторить опыт; а затем повторить всё сначала для следующего изображения в обучающем массиве. Поэтому учёные предложили альтернативное решение — созданную ими самостоятельно архитектуру «диффузионного ансамбля» (diffusion ensemble). Это не единая монолитная модель, а множество мелких компонентов, каждый из которых обучен на отдельном фрагменте данных. В этом случае, чтобы узнать, как бы модель работала без конкретного изображения в обучающих данных, достаточно отключить те части ансамбля, которые его видели. Результаты работы этой системы сравнивались с результатами ответов 24 обычных диффузионных моделей, обученных на тех же данных. Изображения получились одинаково хорошими по стандартным показателям.

Учёные пришли к выводу, что чем больше объёмы обучающих данных, тем лучше ансамбли показывают себя по сравнению с аналогами на основе одной модели. В ходе анализа они отправляли группе моделей один запрос, удаляли из обучающих данных по одному изображению и сравнивали расхождение результатов. На основе эксперимента они ввели понятие «контрфактического радиуса» (counterfactual radius) — максимального влияния, которое мог оказывать отдельный элемент в обучающем массиве. В результате исследователи установили закономерность: чем больше обучающий набор данных, тем меньше контрфактический радиус. Другими словами, тем меньше влияние любого конкретного элемента. Результаты сравнивались как попиксельно, так и по общему семантическому значению.

В юридическом аспекте открытие означает, что ИИ-модели демонстрируют по-настоящему творческий подход — они не копируют материалы из исходных данных, а создают совершенно новые результаты. И если эти результаты не имеют ничего общего с отдельными элементами из обучающего массива, то использование контента, даже защищённого авторским правом, является добросовестным даже без обращения к правообладателю. На языковых моделях этот подход пока не проверяли.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Учёные доказали: ИИ-картинки зачастую нельзя связать с конкретными изображениями из обучающих данных 5 мин.
Утечка геймплея The Duskbloods показала, как играется эксклюзив Nintendo Switch 2 от создателей Bloodborne и Elden Ring 2 ч.
Бывший директор по разработкам Meta признался в суде, что компания отодвигала безопасность детей на второе место ради роста бизнеса 5 ч.
«Просто сумасшествие»: 15-минутный геймплейный трейлер китайского боевика Black Myth: Zhong Kui впечатлил игроков 5 ч.
Новая система безопасности OpenAI поможет выявлять угрозы, скрывающиеся за цепочкой безобидных запросов 8 ч.
Meta представила настольное приложение для Apple Mac с функцией анализа  содержимого экрана 8 ч.
Ветеран разработки Dishonored и Deus Ex открыл новую студию для создания игр вроде Dishonored и Deus Ex 15 ч.
Новый трейлер возвестил о старте предзаказов гротескного хоррора Clive Barker’s Hellraiser: Revival — игра продаётся и в российском Steam 18 ч.
Nightdive подтвердила дату выхода Sin: Reloaded — ремастера культового шутера 1998 года 18 ч.
GitHub объяснил масштабный сбой ошибкой масштабирования и шквалом повторных запросов от VS Code 19 ч.
Российские ИТ-гиганты внезапно ринулись в робототехнику, но делать роботов пока не собираются 2 мин.
Видеокарта Intel Arc Pro B70 всего за месяц подорожала на 46 % 2 ч.
Ноутбук по цене от 443 тыс. рублей: в России стартовали продажи двухэкранного Asus ROG Zephyrus Duo 16 2 ч.
Подгоревший успех: китайская ракета загорелась и рухнула через две минуты после первого удачного приземления 2 ч.
Роботы пришли на службу в полицию Китая — они регулируют движение и делают замечания нарушителям без шлемов 2 ч.
Богатым — дороже: власти США взялись за магазины, которые назначают цены по данным о покупателях 3 ч.
Samsung тоже поделится сверхприбылью от ИИ-бума с акционерами — они получат $72 млрд 3 ч.
IBM представила «морозилки» для кубитов — стойки-холодильники для обычных вычислительных залов 3 ч.
Китайские создатели человекоподобных роботов намерены сделать их полезными на практике 3 ч.
Xiaomi представила умные часы Redmi Watch 6 Active и Watch 6 Lite 4 ч.