Сегодня 22 ноября 2025
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Сборщики данных для ИИ оказались виновниками массового замедления сайтов по всему интернету

Платформа Git-хостинга открытых проектов SourceHut заявила, что работа её сервисов замедлилась из-за веб-сканеров, которые запускают компании — разработчики систем искусственного интеллекта. Похожие жалобы всё чаще поступают и от владельцев других ресурсов.

 Источник изображения: Kai Wenzel / unsplash.com

Источник изображения: Kai Wenzel / unsplash.com

Чтобы ограничить трафик от ИИ-ботов, SourceHut пришлось развернуть Nepenthes — средство защиты от недобросовестно работающих веб-сканеров, собирающих данные для обучения моделей ИИ. Администрация платформы в одностороннем порядке целиком заблокировала диапазоны адресов нескольких облачных провайдеров, в том числе Google Cloud и Microsoft Azure, из-за чрезмерных объёмов трафика от развёрнутых в их сетях ботов. Владельцам добросовестно работающих сервисов на этих инфраструктурах рекомендовали связываться с администрацией SourceHut в индивидуальном порядке, чтобы добавлять их в исключения. В 2022 году SourceHut также пострадала из-за слишком частых обращений к её ресурсам от службы Google Go Module Mirror.

В 2023 году OpenAI заверила, что её боты будут выполнять директивы из файлов robots.txt, указывающих правила обработки данных с сайтов веб-сканерами. Аналогичные обязательства взяли на себя и другие разработчики ИИ, но жалобы на злоупотребления продолжают поступать. Летом минувшего года сайт iFixit, в частности, подвергся нашествию со стороны бота Anthropic Claudebot. В декабре хостер Vercel сообщил о значительном присутствии ИИ-сканеров в его инфраструктуре: OpenAI GPTbot отправил в его сеть 569 млн запросов, Anthropic Claude — 370 млн. В совокупности они достигли около 20 % от 4,5 млрд запросов Googlebot, который используется для индексации ресурсов в Google.

 Источник изображения: Kai Wenzel / unsplash.com

Источник изображения: Kai Wenzel / unsplash.com

Тогда же разработчик распределённой соцсети Diaspora Деннис Шуберт (Dennis Schubert) пожаловался, что за предшествующие 60 дней на ИИ-ботов пришлись 70 % трафика на его сервер. Публикация обрела вирусную популярность, и активность ИИ-сканеров резко сократилась; однако сетевые хулиганы устроили на его ресурс массовое нашествие запросов от клиентов со значением строки user-agent, совпадающим с OpenAI GPTbot. Вот только настоящий ИИ-бот OpenAI отправляет запросы из инфраструктуры Microsoft Azure, а в случае с сервером Diaspora они исходили с адресов AWS и даже от американских интернет-провайдеров.

Иногда ситуация осложняется тем, что некоторые боты имеют несколько предназначений. Так, Meta AI bot и AppleBot собирают данные исключительно для обучения ИИ, тогда как GoogleBot служит и для ИИ, и для индексации в поиске. Чтобы избежать путаницы, Google в 2023 году добавила отдельное значение Google-Extended для инструментов обучения ИИ.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Новая статья: Call of Duty: Black Ops 7 — такой «колды» ещё не было. Рецензия 4 ч.
В Steam стартовала бесплатная раздача Warhammer: Vermintide 2 — в игру добавили знаковую миссию из первой части 5 ч.
«Просить больше казалось неправильным»: авторы возрождённой ролевой песочницы Hytale в духе Minecraft подтвердили цену игры 7 ч.
Google теперь использует письма пользователей Gmail для обучения ИИ, но это можно отключить 7 ч.
У Grok сломался регулятор подхалимства к Илону Маску — бот решил, что он совершенен во всём и даже может воскрешать людей 7 ч.
Разработчики Nioh 3 раскрыли системные требования для игры в 1080p с апскейлерами 8 ч.
Каждый четвёртый россиянин хотя бы раз в месяц пользуется нейросетями 8 ч.
Ubisoft объяснила, почему задержала финансовый отчёт, и похвасталась новым успехом Assassin's Creed Mirage 9 ч.
«МойОфис» анонсировал более десятка новых технологий и продуктов для бизнеса 10 ч.
Журналисты выяснили, когда выйдет ремейк Assassin’s Creed IV: Black Flag — ждать осталось недолго 10 ч.
По-настоящему космический микроконтроллер STMicroelectronics STM32V8 пропишется в спутниках Starlink: 800 Мгц, защита от радиации и работа при +140 °C 4 ч.
Huawei пообещала флагманам Mate 80 автономность до 14 дней, но чем-то придётся жертвовать 7 ч.
Huawei научилась создавать конкурентов для ИИ-систем Nvidia, но они проигрывают по эффективности и производительности 7 ч.
В США впервые разрешили испытания на людях мозгового имплантата для восстановления речи 8 ч.
МТС, «МегаФон» и Т2 пригрозили «Билайну» судом за агрессивное переманивание абонентов 8 ч.
Российские итоги HUAWEI XMAGE 2025 и выставка «Фото[графическое] путешествие» 8 ч.
Joby Aviation подала в суд на конкурента Archer за кражу технологий аэротакси 9 ч.
Маск пообещал дешёвые ИИ-серверы в космосе через пять лет — Хуанг назвал эти планы «мечтой» 9 ч.
«Покажите деньги»: инвесторы заподозрили ИИ-компании в махинациях по завышению капитализации 10 ч.
Рекордная выручка и оптимистичный прогноз NVIDIA снизили опасения по поводу растущего ИИ-пузыря 10 ч.