Участники проекта Anna's Archive, позиционирующего себя как крупнейшую «по-настоящему открытую библиотеку», обратились к добровольцам по всему миру с призывом сканировать бумажные книги и загружать их в Сеть. Цель инициативы — не дать разработчикам систем искусственного интеллекта завладеть огромным количеством книг и уничтожить их.
Источник изображения: Jason Leung / unsplash.com
О проблеме стало известно, когда Anthropic за $1,5 млрд урегулировала судебный иск от 2024 года о нарушении авторских прав — получилось по $200 за каждое из 7 млн пиратских изданий. То же судебное решение подтвердило, что использование существующих произведений для обучения мощных ИИ-моделей подпадает под доктрину добросовестного использования. В результате крупные ИИ-лаборатории начали в массовом порядке скупать бумажные книги и сканировать их варварским образом с последующим уничтожением. Тенденцию подтвердили независимые книжные магазины по всей Европе — к ним поступают неожиданные и очень крупные заказы с доставкой по местным адресам. Покупатели не ведут переговоров и не пытаются согласовать цены, а просто оформляют заказы. В заказы попадают издания, которые вообще не пользуются спросом.
Часть этих книг попадает в распределительные центры Amazon, где рабочие срезают с книг корешки и загружают их в промышленные сканеры. В результате печатный экземпляр фактически уничтожается, уступая место цифровой копии. Есть V-образные сканеры, которые позволяют сохранить книги, но это медленнее и дороже, чем срезать корешок и отправить страницы в автоматический сканер. Когда оригинал уничтожен, конкуренты не смогут использовать те же материалы для обучения своих моделей ИИ, а юридические риски снимаются.
Возникает угроза монополизации знаний. Когда книга уничтожается, знания в ней остаются только у компании, которая занималась сканированием. Остальным придётся платить за доступ, если компания не решит выложить оригинал бесплатно — и это снова грозит юридическими проблемами. Доступ к информации оказывается возможен только в обработанном виде через ИИ-модель, а модели из опасений нарушить авторские права не воспроизводят текст дословно. В итоге, как выразились в Anna's Archive, «знания навсегда монополизируются на частных серверах». Даже те, кто загружает небольшие объёмы сканов, часто получают признание и пожизненное членство в этой теневой библиотеке. Администрация проекта даже готова «помочь с оплатой расходов и выплатой других вознаграждений». В идеале участники Anna's Archive хотят опередить оппонентов, отсканировать и загрузить все мировые издания, пока издатели не перекрыли доступ к знаниям, а ИИ-лаборатории не уничтожили все книги.
Источник:


MWC 2018
2018
Computex
IFA 2018






