Сегодня 06 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Разработчики ИИ стали закупать бумажные книги для обучения моделей — а после эти книги уничтожаются

Разработчики систем искусственного интеллекта стали закупать через посредников миллионы подержанных книг, чтобы формировать из них массивы высококачественных данных для обучения своих ИИ-моделей, чтобы избежать отрицательной реакции общественности.

 Источник изображения: Susan Q Yin / unsplash.com

Источник изображения: Susan Q Yin / unsplash.com

Для обучения ИИ нужны огромные объёмы данных, но не любых, а высокого качества. Проблема в том, что в последние годы интернет заполонил некачественный сгенерированный ИИ-контент, загрязняющий обучающие массивы и контрпродуктивный для обучения ИИ. В результате разработчики стали обращаться к печатным книгам, которые вышли до 2022 года, когда появился ChatGPT. В частности, Anthropic, один из ведущих разработчиков, потратила несколько миллионов долларов на оцифровку огромного количества печатных книг для обучения Claude, после чего эти книги были уничтожены. Они закупались у Better World Books. Суд подтвердил, что книги использовались добросовестно, однако Anthropic грозил штраф в размере $1,5 млрд за библиотеку из 7 млн пиратских электронных книг; схожий иск коалиция издателей подала и против Google, обвинив поискового гиганта в обучении ИИ Gemini на незаконно приобретённых копиях миллионов книг.

База данных ISBNdb, в которой содержатся сведения о 111 млн каталогизированных книг, долгое время служила платформой для продавцов, библиотек и дистрибьюторов; сейчас компания предлагает услуги по оптовым закупкам книг для разработчиков ИИ. Объём заказов варьируется от тысяч до миллиона экземпляров за одну транзакцию. О росте продаж сообщают и другие компании, и предприниматели. Крупные закупки включают только наименования с 13-значным идентификатором ISBN — тематика, жанр и автор значения не имеют; покупатели не торгуются и по ценам, даже если те завышены.

В ходе судебного процесса с участием Anthropic инженер Том Харви (Tom Harvey), который ранее участвовал в создании платформы Google Books, а затем стал курировать в Anthropic программу Project Panama по цифровизации книг, подтвердил, что для их сканирования разработчик пользовался услугами нескольких компаний. Одна из них, Datamation Information Services, предлагает услуги по сканированию больших объёмов книг как неразрушающим, так и разрушающим методом. В первом случае используются планшетные и другие «щадящие» сканеры; во втором — книги разбираются и постранично отправляются в промышленный сканер. Это эффективнее и дешевле, но в результате уничтожаются миллионы книг. Логично, что разработчики ИИ чаще выбирают второй вариант.

Печатные книги оказались кладезем информации для ИИ, но новый сценарий породил споры об этичности изъятия книг из обращения, поскольку нет ясности, отбираются ли в процессе ценные и редкие издания. Кроме того, отсканированные материалы попадают в закрытые базы данных, к которым у широкой публики нет доступа. ИИ станет умнее, но ценная информация может быть утрачена для будущих поколений.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Microsoft изменила структуру отчётности и теперь будет сообщать данные об облаке Azure, на которое приходится уже треть выручки 7 ч.
ИИ-агенты потребляют в пять раз больше токенов, чем люди, и это даёт преимущество дешёвым китайским моделям 16 ч.
Новая статья: WheelMates — без ветерка. Рецензия 24 ч.
Боевик Samson от создателя Just Cause выйдет на консолях до конца сентября после провального релиза на ПК 05-09 22:08
Вместо кешбэка и бесплатного Wi-Fi: в Китае начали повсюду раздавать ИИ-токены 05-09 17:20
Суд разрешил конкуренту X использовать слово твит и логотип птицы, но запретил имя Twitter 05-09 14:01
Windows 11 будет сообщать приложениям возраст пользователя 05-09 13:38
В поглощении Hugging Face компанией Nvidia оказалось много символизма — возможно, неслучайного 05-09 13:24
Спамеры стали использовать ASCII-подмену символов — раньше так взламывали ИИ 05-09 12:21
В независимом тестировании OpenAI GPT-6 Astra оказалась почти не лучше предшественницы 05-09 12:01
CD переживают второе рождение — продажи компакт-дисков в США взлетели почти на 46 % 9 ч.
У Европы появилась своя частная ракета — Isar Aerospace со второй попытки вывела Spectrum на орбиту 10 ч.
В Китае разработан четвероногий робот-поводырь для незрячих людей 16 ч.
Xiaomi настолько уверена в своей тяговой батарее, что готова менять сгоревший из-за неё автомобиль на новый 17 ч.
Выручка Foxconn на крыльях ИИ-бума в августе выросла на 52 %, и это только начало, как считают в компании 17 ч.
AMD анонсировала рабочую станцию Threadripper Halo Station с Instinct MI350P для ИИ-задач 05-09 16:36
ASUS анонсировала ИИ-серверы на чипах Intel Xeon 6 и AMD EPYC 9006 05-09 16:28
В 2027 году Apple выпустит умную камеру, которая записывает только нужные события 05-09 12:41
Бюджетные Galaxy A помогут Samsung нарастить поставки, пока конкуренты сокращают производство на фоне роста цен на память 05-09 12:17
Google, Oppo и Vivo вслед за Apple добавят два слоя стекла в складные дисплеи смартфонов 05-09 11:06