Сегодня 04 июня 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Сборщики данных для ИИ оказались виновниками массового замедления сайтов по всему интернету

Платформа Git-хостинга открытых проектов SourceHut заявила, что работа её сервисов замедлилась из-за веб-сканеров, которые запускают компании — разработчики систем искусственного интеллекта. Похожие жалобы всё чаще поступают и от владельцев других ресурсов.

 Источник изображения: Kai Wenzel / unsplash.com

Источник изображения: Kai Wenzel / unsplash.com

Чтобы ограничить трафик от ИИ-ботов, SourceHut пришлось развернуть Nepenthes — средство защиты от недобросовестно работающих веб-сканеров, собирающих данные для обучения моделей ИИ. Администрация платформы в одностороннем порядке целиком заблокировала диапазоны адресов нескольких облачных провайдеров, в том числе Google Cloud и Microsoft Azure, из-за чрезмерных объёмов трафика от развёрнутых в их сетях ботов. Владельцам добросовестно работающих сервисов на этих инфраструктурах рекомендовали связываться с администрацией SourceHut в индивидуальном порядке, чтобы добавлять их в исключения. В 2022 году SourceHut также пострадала из-за слишком частых обращений к её ресурсам от службы Google Go Module Mirror.

В 2023 году OpenAI заверила, что её боты будут выполнять директивы из файлов robots.txt, указывающих правила обработки данных с сайтов веб-сканерами. Аналогичные обязательства взяли на себя и другие разработчики ИИ, но жалобы на злоупотребления продолжают поступать. Летом минувшего года сайт iFixit, в частности, подвергся нашествию со стороны бота Anthropic Claudebot. В декабре хостер Vercel сообщил о значительном присутствии ИИ-сканеров в его инфраструктуре: OpenAI GPTbot отправил в его сеть 569 млн запросов, Anthropic Claude — 370 млн. В совокупности они достигли около 20 % от 4,5 млрд запросов Googlebot, который используется для индексации ресурсов в Google.

 Источник изображения: Kai Wenzel / unsplash.com

Источник изображения: Kai Wenzel / unsplash.com

Тогда же разработчик распределённой соцсети Diaspora Деннис Шуберт (Dennis Schubert) пожаловался, что за предшествующие 60 дней на ИИ-ботов пришлись 70 % трафика на его сервер. Публикация обрела вирусную популярность, и активность ИИ-сканеров резко сократилась; однако сетевые хулиганы устроили на его ресурс массовое нашествие запросов от клиентов со значением строки user-agent, совпадающим с OpenAI GPTbot. Вот только настоящий ИИ-бот OpenAI отправляет запросы из инфраструктуры Microsoft Azure, а в случае с сервером Diaspora они исходили с адресов AWS и даже от американских интернет-провайдеров.

Иногда ситуация осложняется тем, что некоторые боты имеют несколько предназначений. Так, Meta AI bot и AppleBot собирают данные исключительно для обучения ИИ, тогда как GoogleBot служит и для ИИ, и для индексации в поиске. Чтобы избежать путаницы, Google в 2023 году добавила отдельное значение Google-Extended для инструментов обучения ИИ.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Приоткрыть ворота: Remedy позволила запускать Control Resonant в российском Steam, но купить игру всё равно нельзя 1 мин.
Китайцы сделали чат-бот для квантовых вычислений — он воплощает простые слова в квантовых схемах 36 мин.
Amazon встроила в поиск ИИ-картинки несуществующих товаров, чтобы помочь найти настоящие 11 ч.
Второе сюжетное дополнение к Vampire: The Masquerade — Bloodlines 2 завершит поддержку игры — трейлер и дата выхода The Flower & The Flame 13 ч.
Цукерберг хочет, чтобы ИИ Meta управлял всем бизнесом пользователей 14 ч.
Meta в европейском суде не смогла избавиться от статуса «привратника» 14 ч.
Колонку Creative превратили в инструмент для взлома ПК — компания уязвимость отрицает и исправлять не будет 14 ч.
Microsoft планирует «вызвать зависимость» пользователей от своего нового ИИ-помощника Scout 15 ч.
Новая игра разработчиков Shovel Knight обеспечила студии светлое будущее — раскрыты продажи Mina the Hollower 15 ч.
Meta, Microsoft, SpaceX и спецслужбы разгромили международную сеть интернет-мошенников 16 ч.
Broadcom потеряла $300 млрд капитализации, разочаровав инвесторов умеренным прогнозом по выручке от ИИ-чипов 2 ч.
TSMC призналась, что не сможет полностью удовлетворять спрос на чипы в ближайшие годы 2 ч.
Tesla расширила зону обслуживания своих роботакси на всю территорию Остина 4 ч.
Новая статья: ИИтоги мая 2026 г.: AI knows best, но это не точно 9 ч.
Wentai представила первый в мире блок питания с сертификатом Cybenetics Diamond — AiBARZA Aldan-D1515 на 1300 Вт 10 ч.
Surface Laptop Ultra получил нестандартно большой порт USB-C — Microsoft не раскрывает, в чём его секрет 11 ч.
Corsair показала прозрачный блок питания HX1000i Shift Crystal 11 ч.
Учёные построили первый в мире кремниевый спинтронный чип для вероятностных ИИ-вычислений 11 ч.
Импортозамещение по-европейски: ЕС запустил большой план по снижению зависимости от США и Китая в чипах, ИИ и облаках 12 ч.
Запущен крупнейший в мире частный лазер — он должен приблизить эпоху термояда 14 ч.