Сегодня 09 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Учёные доказали: ИИ-картинки зачастую нельзя связать с конкретными изображениями из обучающих данных

Учёные Лаборатории компьютерных наук и искусственного интеллекта (CSAIL) при Массачусетском технологическом институте доказали, что по мере роста наборов данных связь между тем, чему учится модель, и тем, что она генерирует, практически исчезает. Это указывает на необоснованность претензий правообладателей к лабораториям ИИ.

 Источник изображения: news.mit.edu

Источник изображения: news.mit.edu

Американские учёные открыли явление «затухания атрибуции» (attribution decay), при котором чем больше данных используется при обучении генеративной модели искусственного интеллекта, тем меньшее значение имеет любой конкретный элемент в обучающем массиве для любого конкретного результата генерации. При достаточно больших масштабах можно вообще удалить из обучающих данных любое отдельное изображение, все изображения определённого художника или все фотографии определённого человека, и сгенерированная моделью картинка не изменится.

Доказать это на практике было непросто. В общем случае, чтобы узнать, каков был бы ответ модели на конкретный запрос, если бы она никогда не видела определённое изображение, потребовались бы обучить точно такую же модель без этого изображения и повторить опыт; а затем повторить всё сначала для следующего изображения в обучающем массиве. Поэтому учёные предложили альтернативное решение — созданную ими самостоятельно архитектуру «диффузионного ансамбля» (diffusion ensemble). Это не единая монолитная модель, а множество мелких компонентов, каждый из которых обучен на отдельном фрагменте данных. В этом случае, чтобы узнать, как бы модель работала без конкретного изображения в обучающих данных, достаточно отключить те части ансамбля, которые его видели. Результаты работы этой системы сравнивались с результатами ответов 24 обычных диффузионных моделей, обученных на тех же данных. Изображения получились одинаково хорошими по стандартным показателям.

Учёные пришли к выводу, что чем больше объёмы обучающих данных, тем лучше ансамбли показывают себя по сравнению с аналогами на основе одной модели. В ходе анализа они отправляли группе моделей один запрос, удаляли из обучающих данных по одному изображению и сравнивали расхождение результатов. На основе эксперимента они ввели понятие «контрфактического радиуса» (counterfactual radius) — максимального влияния, которое мог оказывать отдельный элемент в обучающем массиве. В результате исследователи установили закономерность: чем больше обучающий набор данных, тем меньше контрфактический радиус. Другими словами, тем меньше влияние любого конкретного элемента. Результаты сравнивались как попиксельно, так и по общему семантическому значению.

В юридическом аспекте открытие означает, что ИИ-модели демонстрируют по-настоящему творческий подход — они не копируют материалы из исходных данных, а создают совершенно новые результаты. И если эти результаты не имеют ничего общего с отдельными элементами из обучающего массива, то использование контента, даже защищённого авторским правом, является добросовестным даже без обращения к правообладателю. На языковых моделях этот подход пока не проверяли.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Palantir выбрала Nebius провайдером ИИ- и облачной инфраструктуры 22 мин.
Швейцария попробует отказаться от софта Microsoft, заменив его открытыми решениями 3 ч.
«Мы явно не на верном пути»: исследователь Anthropic предупредил о риске уничтожения человечества ИИ с вероятностью 10 % 3 ч.
Спецслужбы США призвали американских разработчиков ИИ лучше защищать LLM от дистилляции китайскими конкурентами 4 ч.
Meta представила ИИ-агента Muse — он пишет письма, бронирует поездки и делает покупки по заданию пользователя 5 ч.
Продажи нашумевшего морского приключения Dave the Diver за три года превысили 10 миллионов копий 5 ч.
Спустя всего неделю после релиза разработчики The Blood of Dawnwalker приступили к поиску сценаристов для The Blood of Dawnwalker 2 6 ч.
Вышел трейлер фильма «Искусственный» про попытку уволить Альтмана из OpenAI — в главных ролях Юра Борисов и Эндрю Гарфилд 7 ч.
OpenAI представила генератор изображений ChatGPT Images 2.5 с упором на редактирование 8 ч.
OpenAI утверждает, что разработать свой чип в сжатые сроки компании помог ИИ 9 ч.
5 Пбит/с на 200 км: Telecom Egypt проложит подводный интернет-кабель между Шарм-эль-Шейхом и Табой 22 мин.
Radeon RX 9070 XT стала самой популярной видеокартой AMD в Steam 35 мин.
Sony не откажется от дисков с играми так быстро, как многие полагали 48 мин.
Firmus вложит $300 млн в «гиперкабель» SubCo APX East, соединяющий Австралию и США 2 ч.
OM System возродила и переосмыслила легендарную серию фотоаппаратов PEN 2 ч.
Samsung ускорила строительство 2-нм фабрики в США после заказа Tesla — мощности уже расписаны на годы вперёд 3 ч.
Япония бросит вызов китайским солнечным панелям — её перовскитные панели прослужат в 1,5 раза дольше 3 ч.
Qualcomm и Amazon займутся разработкой ИИ-чипов и оптического интерконнекта 3 ч.
В погоне за Samsung и SK hynix китайская CXMT всего за год увеличила штат инженеров на 61 % 4 ч.
Мировой рынок смартфонов в 2026 году рухнет не так сильно, как ожидалось — но кризис ещё не кончился 4 ч.