Сегодня 11 июля 2025
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Сборщики данных для ИИ оказались виновниками массового замедления сайтов по всему интернету

Платформа Git-хостинга открытых проектов SourceHut заявила, что работа её сервисов замедлилась из-за веб-сканеров, которые запускают компании — разработчики систем искусственного интеллекта. Похожие жалобы всё чаще поступают и от владельцев других ресурсов.

 Источник изображения: Kai Wenzel / unsplash.com

Источник изображения: Kai Wenzel / unsplash.com

Чтобы ограничить трафик от ИИ-ботов, SourceHut пришлось развернуть Nepenthes — средство защиты от недобросовестно работающих веб-сканеров, собирающих данные для обучения моделей ИИ. Администрация платформы в одностороннем порядке целиком заблокировала диапазоны адресов нескольких облачных провайдеров, в том числе Google Cloud и Microsoft Azure, из-за чрезмерных объёмов трафика от развёрнутых в их сетях ботов. Владельцам добросовестно работающих сервисов на этих инфраструктурах рекомендовали связываться с администрацией SourceHut в индивидуальном порядке, чтобы добавлять их в исключения. В 2022 году SourceHut также пострадала из-за слишком частых обращений к её ресурсам от службы Google Go Module Mirror.

В 2023 году OpenAI заверила, что её боты будут выполнять директивы из файлов robots.txt, указывающих правила обработки данных с сайтов веб-сканерами. Аналогичные обязательства взяли на себя и другие разработчики ИИ, но жалобы на злоупотребления продолжают поступать. Летом минувшего года сайт iFixit, в частности, подвергся нашествию со стороны бота Anthropic Claudebot. В декабре хостер Vercel сообщил о значительном присутствии ИИ-сканеров в его инфраструктуре: OpenAI GPTbot отправил в его сеть 569 млн запросов, Anthropic Claude — 370 млн. В совокупности они достигли около 20 % от 4,5 млрд запросов Googlebot, который используется для индексации ресурсов в Google.

 Источник изображения: Kai Wenzel / unsplash.com

Источник изображения: Kai Wenzel / unsplash.com

Тогда же разработчик распределённой соцсети Diaspora Деннис Шуберт (Dennis Schubert) пожаловался, что за предшествующие 60 дней на ИИ-ботов пришлись 70 % трафика на его сервер. Публикация обрела вирусную популярность, и активность ИИ-сканеров резко сократилась; однако сетевые хулиганы устроили на его ресурс массовое нашествие запросов от клиентов со значением строки user-agent, совпадающим с OpenAI GPTbot. Вот только настоящий ИИ-бот OpenAI отправляет запросы из инфраструктуры Microsoft Azure, а в случае с сервером Diaspora они исходили с адресов AWS и даже от американских интернет-провайдеров.

Иногда ситуация осложняется тем, что некоторые боты имеют несколько предназначений. Так, Meta AI bot и AppleBot собирают данные исключительно для обучения ИИ, тогда как GoogleBot служит и для ИИ, и для индексации в поиске. Чтобы избежать путаницы, Google в 2023 году добавила отдельное значение Google-Extended для инструментов обучения ИИ.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
ГК «Гарда»: лишь треть российских компаний использует решения для защиты данных 19 мин.
Новая статья: В малом весе: обзор российских мобильных операционных систем 9 ч.
YouTube объявил о закрытии раздела «В тренде», но уже готовит ему замену 9 ч.
Первый геймплей боевика «Земский собор» от создателей «Смуты» не впечатлил игроков 10 ч.
Спутниковый интернет Starlink теперь доступен в 1000 самолётов по всему миру — 100 Мбит/с в небе, бесплатно 10 ч.
Забастовка актёров озвучки игр наконец завершена — участники SAG-AFTRA одобрили новый договор 11 ч.
«Я был пьян, но утечки так и не случилось»: глава издательского отдела Larian рассказал, как чуть не «слил» дату выхода Baldur's Gate 3 13 ч.
Google Gemini научился превращать фото в восьмисекундные видео со звуком, но небесплатно 13 ч.
ЕС открыл новое дело против TikTok за передачу данных европейцев в Китай — ранее соцсеть уже штрафовали за это на €530 млн 14 ч.
Elden Ring Nightreign возглавила рейтинг самых продаваемых игр в США за май — в первой пятёрке оказалось четыре игры от Microsoft 14 ч.
Электрический гиперкар Rimac Nevera R установил 24 новых мировых рекорда, разогнавшись до 431,45 км/ч 51 мин.
Huawei пытается продвигать свои ускорители вычислений на Ближнем Востоке и в Юго-Восточной Азии 2 ч.
Аналитики усомнились в рентабельности бизнеса Starlink после опубликованного отчёта 3 ч.
Масштабные планы Apple на 2026: новые Mac, iPad, iPhone и неожиданно внешний монитор 3 ч.
Глава Nvidia встретился с Дональдом Трампом перед визитом в Китай, капитализация компании превысила $4 трлн 4 ч.
Meta готовит новые умные очки Ray-Ban без дисплея, но с улучшенной батареей 5 ч.
Razer представила игровую мышь DeathAdder V4 Pro за $170 с оптическим колёсиком и сенсором на 45 000 DPI 10 ч.
Philips выпустила 27-дюймовый игровой монитор Evnia 27M2N3800A с поддержкой 4K@160 Гц и FHD@320 Гц 11 ч.
Роботы-койоты на колёсах заменили робопсов в охране военных аэродромов США от диких зверей — они оказались шустрее 12 ч.
Infinix представила тонкие и недорогие смартфоны Hot 60 Pro+ и Hot 60 Pro с ярким дизайном и быстрыми экранами 13 ч.