Сегодня 17 ноября 2025
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Сборщики данных для ИИ оказались виновниками массового замедления сайтов по всему интернету

Платформа Git-хостинга открытых проектов SourceHut заявила, что работа её сервисов замедлилась из-за веб-сканеров, которые запускают компании — разработчики систем искусственного интеллекта. Похожие жалобы всё чаще поступают и от владельцев других ресурсов.

 Источник изображения: Kai Wenzel / unsplash.com

Источник изображения: Kai Wenzel / unsplash.com

Чтобы ограничить трафик от ИИ-ботов, SourceHut пришлось развернуть Nepenthes — средство защиты от недобросовестно работающих веб-сканеров, собирающих данные для обучения моделей ИИ. Администрация платформы в одностороннем порядке целиком заблокировала диапазоны адресов нескольких облачных провайдеров, в том числе Google Cloud и Microsoft Azure, из-за чрезмерных объёмов трафика от развёрнутых в их сетях ботов. Владельцам добросовестно работающих сервисов на этих инфраструктурах рекомендовали связываться с администрацией SourceHut в индивидуальном порядке, чтобы добавлять их в исключения. В 2022 году SourceHut также пострадала из-за слишком частых обращений к её ресурсам от службы Google Go Module Mirror.

В 2023 году OpenAI заверила, что её боты будут выполнять директивы из файлов robots.txt, указывающих правила обработки данных с сайтов веб-сканерами. Аналогичные обязательства взяли на себя и другие разработчики ИИ, но жалобы на злоупотребления продолжают поступать. Летом минувшего года сайт iFixit, в частности, подвергся нашествию со стороны бота Anthropic Claudebot. В декабре хостер Vercel сообщил о значительном присутствии ИИ-сканеров в его инфраструктуре: OpenAI GPTbot отправил в его сеть 569 млн запросов, Anthropic Claude — 370 млн. В совокупности они достигли около 20 % от 4,5 млрд запросов Googlebot, который используется для индексации ресурсов в Google.

 Источник изображения: Kai Wenzel / unsplash.com

Источник изображения: Kai Wenzel / unsplash.com

Тогда же разработчик распределённой соцсети Diaspora Деннис Шуберт (Dennis Schubert) пожаловался, что за предшествующие 60 дней на ИИ-ботов пришлись 70 % трафика на его сервер. Публикация обрела вирусную популярность, и активность ИИ-сканеров резко сократилась; однако сетевые хулиганы устроили на его ресурс массовое нашествие запросов от клиентов со значением строки user-agent, совпадающим с OpenAI GPTbot. Вот только настоящий ИИ-бот OpenAI отправляет запросы из инфраструктуры Microsoft Azure, а в случае с сервером Diaspora они исходили с адресов AWS и даже от американских интернет-провайдеров.

Иногда ситуация осложняется тем, что некоторые боты имеют несколько предназначений. Так, Meta AI bot и AppleBot собирают данные исключительно для обучения ИИ, тогда как GoogleBot служит и для ИИ, и для индексации в поиске. Чтобы избежать путаницы, Google в 2023 году добавила отдельное значение Google-Extended для инструментов обучения ИИ.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Объявлены номинанты The Game Awards 2025 — Clair Obscur: Expedition 33 вне конкуренции 23 мин.
Google выпустит мобильную версию AI Studio для вайб-кодинга на ходу 2 ч.
Ролевой экшен Where Winds Meet в антураже фэнтезийного Китая привлёк свыше 2 млн игроков за первые сутки 2 ч.
Календарь релизов 17 – 23 ноября: Moonlighter 2, Demonschool, Forestrike и Neon Inferno 4 ч.
Новый уровень сложности, переработка механик, улучшения A-Life и многое другое: для S.T.A.L.K.E.R. 2: Heart of Chornobyl вышел крупный патч 1.7 4 ч.
Microsoft анонсировала игровую презентацию Xbox Partner Preview — на ней покажут Tides of Annihilation, 007 First Light, Reanimal и многое другое 4 ч.
Nintendo показала первые кадры из фильма по The Legend of Zelda — фанаты в восторге 5 ч.
Владелец Amazon Джефф Безос нашёл себе новую работу в сфере ИИ 6 ч.
Capcom пообещала уберечь Resident Evil Requiem от судьбы Monster Hunter Wilds, которая даже спустя восемь месяцев страдает от проблем с оптимизацией 7 ч.
Программный «ускоритель» Huawei обещает практически удвоить производительность дефицитных ИИ-чипов 8 ч.
Samsung выпустила «умную клавиатуру» с кнопкой вызова ИИ за $109 2 ч.
Sparkle представила видеокарту Arc Pro B60 Dual Passive с боковым HDMI и пассивным охлаждением 2 ч.
Oppo выпустила смартфоны Reno15 Pro и Reno15 с 200-Мп камерами и Dimensity 8450 4 ч.
Утечки об уходе Тима Кука на пенсию — это продуманная проверка реакции рынка 4 ч.
Дефицит DRAM усиливается: продавцов уже заставляют продавать планки памяти только в комплекте с матплатами 4 ч.
«Ростелеком» пробурил под Камой уникальный кабельный переход для трансроссийской интернет-магистрали TEA NEXT 5 ч.
SpaceX в пятисотый раз успешно запустила многоразовую ракету Falcon 9 5 ч.
MaxSun представила плату MS-iCraft B850 Aiga для Ryzen 9000 и не только 5 ч.
Colorful выпустила видеокарты iGame Ultra Z BTF 2.0 с «невидимым» питанием 8 ч.
Перегрузка энергосетей угрожает лидерству Нидерландов в сфере ЦОД — доступный водород продолжают игнорировать 8 ч.