Сегодня 17 марта 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Сборщики данных для ИИ оказались виновниками массового замедления сайтов по всему интернету

Платформа Git-хостинга открытых проектов SourceHut заявила, что работа её сервисов замедлилась из-за веб-сканеров, которые запускают компании — разработчики систем искусственного интеллекта. Похожие жалобы всё чаще поступают и от владельцев других ресурсов.

 Источник изображения: Kai Wenzel / unsplash.com

Источник изображения: Kai Wenzel / unsplash.com

Чтобы ограничить трафик от ИИ-ботов, SourceHut пришлось развернуть Nepenthes — средство защиты от недобросовестно работающих веб-сканеров, собирающих данные для обучения моделей ИИ. Администрация платформы в одностороннем порядке целиком заблокировала диапазоны адресов нескольких облачных провайдеров, в том числе Google Cloud и Microsoft Azure, из-за чрезмерных объёмов трафика от развёрнутых в их сетях ботов. Владельцам добросовестно работающих сервисов на этих инфраструктурах рекомендовали связываться с администрацией SourceHut в индивидуальном порядке, чтобы добавлять их в исключения. В 2022 году SourceHut также пострадала из-за слишком частых обращений к её ресурсам от службы Google Go Module Mirror.

В 2023 году OpenAI заверила, что её боты будут выполнять директивы из файлов robots.txt, указывающих правила обработки данных с сайтов веб-сканерами. Аналогичные обязательства взяли на себя и другие разработчики ИИ, но жалобы на злоупотребления продолжают поступать. Летом минувшего года сайт iFixit, в частности, подвергся нашествию со стороны бота Anthropic Claudebot. В декабре хостер Vercel сообщил о значительном присутствии ИИ-сканеров в его инфраструктуре: OpenAI GPTbot отправил в его сеть 569 млн запросов, Anthropic Claude — 370 млн. В совокупности они достигли около 20 % от 4,5 млрд запросов Googlebot, который используется для индексации ресурсов в Google.

 Источник изображения: Kai Wenzel / unsplash.com

Источник изображения: Kai Wenzel / unsplash.com

Тогда же разработчик распределённой соцсети Diaspora Деннис Шуберт (Dennis Schubert) пожаловался, что за предшествующие 60 дней на ИИ-ботов пришлись 70 % трафика на его сервер. Публикация обрела вирусную популярность, и активность ИИ-сканеров резко сократилась; однако сетевые хулиганы устроили на его ресурс массовое нашествие запросов от клиентов со значением строки user-agent, совпадающим с OpenAI GPTbot. Вот только настоящий ИИ-бот OpenAI отправляет запросы из инфраструктуры Microsoft Azure, а в случае с сервером Diaspora они исходили с адресов AWS и даже от американских интернет-провайдеров.

Иногда ситуация осложняется тем, что некоторые боты имеют несколько предназначений. Так, Meta AI bot и AppleBot собирают данные исключительно для обучения ИИ, тогда как GoogleBot служит и для ИИ, и для индексации в поиске. Чтобы избежать путаницы, Google в 2023 году добавила отдельное значение Google-Extended для инструментов обучения ИИ.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Google открыла доступ к «Персональному интеллекту» бесплатным пользователям Chrome, Gemini и AI Mode 20 мин.
Fortnite вернётся в Play Store по всему миру вместе с запуском сезона «Противостояние» 2 ч.
Хардкорная сложность, вырезанный контент и новые кошмары: с выходом ПК-версии Death Stranding 2: On the Beach получит крупное обновление 2 ч.
Скандал с почтовым ПО Horizon не утихает: тысячи невинно осуждённых британцев до сих пор без выплат 4 ч.
Bethesda разразилась новостями о Starfield — сюжетное дополнение Terran Armada, крупное обновление Free Lanes и версия для PS5 4 ч.
Alibaba запустила платформу для ИИ-агентов Wukong с интеграцией Slack и Teams 5 ч.
Чат-бот Anthropic Claude научился генерировать шрифты на основе рукописного текста 5 ч.
Disco Elysium, Resident Evil 7, Like a Dragon: Infinite Wealth и многие другие: Microsoft раскрыла последние новинки Game Pass в марте 6 ч.
В мобильном Chrome появилась панель закладок — но только для планшетов и складных смартфонов 7 ч.
В Google Gemini появится ветвление беседы — как в ChatGPT 7 ч.
Oppo представила флагманский складной смартфон Find N6 с «практически невидимой складкой» по цене от $1437 16 мин.
В России утверждён план развития высокопроизводительных вычислений и суперкомпьютерной инфраструктуры 33 мин.
Microsoft возьмётся за проблему раздробленного Copilot — направление ИИ получит нового главу 2 ч.
Чудо-материал из отходов: учёные научились превращать скорлупу арахиса в «почти графен» 2 ч.
Samsung выпустила 140-долларовый смартфон Galaxy M17e — Dimensity 6300, 50-Мп камера и батарея на 6000 мА·ч 2 ч.
Oppo представила смарт-часы Watch X3 с титановым корпусом, мониторингом глюкозы и выявлением гипертонии 4 ч.
AWS и NVIDIA расширят сотрудничество: в следующие 12 месяцев AWS внедрит более 1 млн ИИ-ускорителей NVIDIA 4 ч.
Тим Кук к 50-летию Apple похвалился достижениями компании, а заодно обсудил таможенные пошлины и свою пенсию 4 ч.
Nvidia выпустила однослотовый серверный ускоритель RTX Pro 4500 Blackwell Server Edition для ИИ и других задач 4 ч.
TCL представила Max163M Pro — «ультра-флагманский» 163-дюймовый Micro LED-телевизор за $50 000 4 ч.