Сегодня 16 августа 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Теги → википедия

«Википедия» перестала показывать ИИ-сводки из-за недовольства редакторов

Администрация Wikipedia прекратила в тестовом режиме показывать подготовленные искусственным интеллектом сводки статей — они вызвали резкую критику со стороны редакторов на платформе, передаёт 404 Media.

 Источник изображения: Luke Chesser / unsplash.com

Источник изображения: Luke Chesser / unsplash.com

Тестирование ИИ-сводок началось 2 июня. Пользователи, которые установили браузерное расширение Wikipedia, стали над каждой статьёй видеть «простые сводки» — они сопровождались жёлтой пометкой «непроверено», и чтобы прочитать этот фрагмент, пользователю приходилось его разворачивать. Сводки создавались при помощи модели с открытыми весами Aya от Cohere Labs. Предполагалось, что это будет двухнедельная программа тестирования для небольшой группы читателей (10 %), которые дали на это согласие. Но из-за негативной реакции редакторов руководство управляющей платформой НКО Wikimedia Foundation приостановило тестирование уже на второй день.

Основные претензии касались точности и достоверности материалов в исполнении ИИ. «Это нанесёт немедленный и непоправимый вред нашим читателям и нашей репутации как достоверного и серьёзного источника. Давайте не будем оскорблять интеллект наших читателей и предаваться панике с выпуском показушных ИИ-сводок», — заявил один из редакторов. «С [функцией] Simple Article Summaries вы предлагаете дать единственному редактору, чья надёжность известна, и у кого проблемы с объективностью, платформу в верхней части любой статьи, не давая никакого редакционного контроля другим», — предупредил другой.

ИИ-сводки — функция, печально известная тем, что предоставляет неточные данные. В январе Apple была вынуждена приостановить их показ, когда стали генерироваться не соответствующие действительности новости. Более трёх десятков таких сводок было вынуждено отправить на редактирование агентство Bloomberg — и снова из-за неточностей. «Википедия» приостановила показ ИИ-сводок, но не их разработку. Платформа продолжит их тестировать с разными группами пользователей, а за редакторами останется последнее слово в принятии решений, какая информация будет отображаться на платформе, заявил 404 Media представитель её администрации.

Дело техники: «Википедия» поручит генеративному ИИ рутину, чтобы не испортить труд людей

«Википедия» объявила о новой стратегии использования искусственного интеллекта в своей интернет-энциклопедии, но с важной оговоркой — ИИ не заменит живых редакторов. Вместо этого он станет их помощником в рутинных задачах.

 Источник изображения: wikipedia.org, AI

Источник изображения: wikipedia.org, AI

«Википедия» не планирует заменять своих редакторов и волонтёров искусственным интеллектом, несмотря на растущую популярность ИИ-технологий. Вместо этого платформа будет использовать нейросети для устранения технических барьеров, чтобы участники могли сосредоточиться на содержании, а не на сложностях реализации, сообщает TechCrunch, ссылаясь на официальное заявление организации.

В отличие от многих компаний, которые рассматривают ИИ как угрозу рабочим местам, «Википедия» видит в нём инструмент для автоматизации рутинных задач. Например, нейросети помогут в переводе, модерации и поиске информации, освобождая время редакторов для обсуждений и проверки данных, что особенно важно, поскольку «Википедия» строится на консенсусе среди её участников.

«Мы уверены, что успех нашей работы с ИИ зависит не только от того, что мы делаем, но и от того, как мы это делаем», — написал Крис Албон (Chris Albon), директор по машинному обучению «Фонда Викимедиа» (Wikimedia Foundation). По его словам, «Википедия» будет придерживаться принципов прозрачности, открытого кода и защиты прав человека, чтобы ИИ оставался под контролем людей.

Албон подчеркнул, что с появлением генеративного ИИ, который иногда допускает ошибки и «галлюцинирует», роль «Википедии» как достоверного источника знаний ещё больше возросла. «Мы будем использовать ИИ взвешенно, сохраняя многоязычность и человекоориентированный подход», — добавил он.

«Википедия» выпустила набор данных для обучения ИИ, чтобы боты не перегружали её серверы скрейпингом

Фонд Wikimedia (некоммерческая организация, управляющая «Википедией») предложил компаниям вместо веб-скрейпинга контента «Википедии» с помощью ботов, который истощает её ресурсы и перегружает серверы трафиком, воспользоваться набором данных, специально оптимизированным для обучения ИИ-моделей.

 Источник изображения: Oberon Copeland @veryinformed.com/unsplash.com

Источник изображения: Oberon Copeland @veryinformed.com/unsplash.com

Wikimedia объявил о заключении партнёрского соглашения с Kaggle, ведущей платформой для специалистов в области Data Science и машинного обучения, принадлежащей Google. В рамках соглашения на ней будет опубликована бета-версия набора данных «структурированного контента “Википедии” на английском и французском языках».

Согласно Wikimedia, набор данных, размещённый Kaggle, был «разработан с учётом рабочих процессов машинного обучения», что упрощает разработчикам ИИ доступ к машиночитаемым данным статей для моделирования, тонкой настройки, сравнительного анализа, выравнивания и анализа. Содержимое набора данных имеет открытую лицензию. По состоянию на 15 апреля набор включает в себя обзоры исследований, краткие описания, ссылки на изображения, данные инфобоксов и разделы статей — за исключением ссылок или неписьменных элементов, таких как аудиофайлы.

Как сообщает Wikimedia, «хорошо структурированные JSON-представления контента “Википедии”», доступные пользователям Kaggle, должны быть более привлекательной альтернативой «скрейпингу или анализу сырого текста статей».

На данный момент у Wikimedia есть соглашения об обмене контентом с Google и Internet Archive, но партнёрство с Kaggle позволит сделать данные более доступными для небольших компаний и независимых специалистов в сфере Data Science. «Являясь площадкой, к которой сообщество машинного обучения обращается за инструментами и тестами, Kaggle будет рада стать хостом для данных фонда Wikimedia», — сообщила Бренда Флинн (Brenda Flynn), руководитель по коммуникациям в Kaggle.

«Наш контент бесплатный, а инфраструктура — нет»: ИИ-боты разоряют «Википедию»

«Википедия» расплачивается за бум искусственного интеллекта — онлайн-энциклопедия сталкивается с растущими расходами из-за ботов, которые копируют её статьи для обучения моделей искусственного интеллекта, что впустую расходует ресурсы и в разы увеличивает трафик и нагрузку на сайт. Только за последние три месяца трафик, генерируемый ИИ-краулерами, вырос на 50 %.

 Источник изображения: «Википедия»

Источник изображения: «Википедия»

Фонд Wikimedia (некоммерческая организация, управляющая «Википедией») заявил, что «автоматизированные запросы на наш контент выросли в геометрической прогрессии». По данным фонда, с января 2024 года пропускная способность, используемая для загрузки мультимедийного контента, выросла на 50 %. Однако трафик исходит не от людей, а от автоматизированных программ, которые постоянно загружают изображения с открытой лицензией для передачи их моделям ИИ.

«Наша инфраструктура создана для того, чтобы выдерживать внезапные всплески трафика от людей во время мероприятий с высоким интересом, но объем трафика, генерируемого ботами-скрейперами, беспрецедентен и представляет растущие риски и расходы», — сообщила «Википедия».

Боты часто собирают данные из менее популярных статей «Википедии». Специалисты «Википедии» утверждают, что по крайней мере 65 % подобного трафика, поступает от ботов, что является непропорционально большим объёмом, учитывая, что общее количество просмотров страниц ботами составляет около 35 %. Также боты проявляют интерес к «ключевым системам в инфраструктуре разработчиков, таким как наша платформа проверки кода или наш баг-трекер», что ещё больше нагружает ресурсы сайта.

«Википедия» была вынуждена ввести индивидуальные ограничения скорости для ИИ-ботов или вообще запретить доступ некоторым из них. Но для решения проблемы в долгосрочной перспективе фонд разрабатывает план «Ответственного использования инфраструктуры». План предусматривает сбор отзывов от сообщества «Википедии» о способах определения трафика от ИИ-ботов и фильтрации их доступа.

Социальная платформа Reddit столкнулась с похожей проблемой в 2023 году. Например, Microsoft без уведомления Reddit использовала данные платформы для обучения моделей ИИ, что вынудило Reddit заблокировать ботов Microsoft. После этого инцидента Reddit решила взимать плату со сторонних разработчиков за доступ к своему API. Это привело к массовым протестам разработчиков и закрытию некоторых популярных форумов Reddit.

«Википедию» заполонили белиберда и фейки, сгенерированные ИИ

Wikipedia переживает кризис из-за того, что пользователи массово стали публиковать бессмысленную или непроверенную информацию, сгенерированную искусственным интеллектом с помощью чат-ботов, таких как ChatGPT и ему подобных. Однако, учитывая растущую популярность ИИ-технологий, этого можно было ожидать.

 Источник изображения: BoliviaInteligente/Unsplash

Источник изображения: BoliviaInteligente/Unsplash

Как сообщает TechSpot, для решения проблемы был создан проект под названием WikiProject AI Cleanup, представляющий из себя группу добровольцев, которая занимается поиском, редактированием и удалением ложной информации, предположительно добавленной с помощью генеративного ИИ.

Ильяс Леблю (Ilyas Lebleu), один из основателей команды по «очистке», сообщил, что о проблеме стало известно, когда редакторы и пользователи Wikipedia заметили отрывки статей, явно написанные чат-ботом. Подозрения подтвердились, когда некоторые из этих текстов удалось воссоздать с помощью ChatGPT.

«Мы обратили внимание на необычный стиль письма, который был явно написан не человеком, мы смогли воспроизвести эти фразы с помощью ChatGPT, — сказал Леблю. — Обнаружив характерные обороты и выражения, мы идентифицировали наиболее вопиющие примеры сгенерированных статей. После этого и было решено организовать проект по поиску ИИ-текста».

Один из примеров — статья о якобы существующей османской крепости под названием «Амберлисихар», построенной в 1400-х годах. В тексте объёмом около 2000 слов подробно описывалось местоположение и строительство этого объекта. Однако крепость на самом деле не существует, и вся информация о ней была полностью вымышленной, но выглядела убедительно благодаря вкраплениям реальных фактов. При этом проблема касается не только новых статей на Wikipedia. Недобросовестные пользователи вставляют ложные данные в уже существующие статьи. В одном из случаев в статью о жуке добавили раздел, посвящённый виду крабов, причём с правильными ссылками на источники.

Леблю и его коллеги признают, что до конца не понимают, почему люди это делают. Однако причины очевидны. Во-первых, это проблема самой системы Wikipedia, которая позволяет каждому стать редактором. Кстати, именно по этой причине многие университеты запрещают студентам использовать Wikipedia в качестве основного источника информации.

Во-вторых не секрет, что интернет часто становится объектом злоупотреблений, особенно сейчас, когда появился искусственный интеллект. В качестве примера может послужить печально известный бот Microsoft по имени Tay, который был отключён менее чем через 24 часа после запуска за публикацию оскорбительных и расистских твитов в X. Также ИИ используется для создания дипфейков и книг на Amazon Kindle.

В этом году «Википедия» проигнорировала 200 требований Роскомнадзора, но о блокировке пока речи нет

Интернет-энциклопедия «Википедия», принадлежащая американской организации Wikimedia Foundation, за весь текущий год удалила по запросу Роскомнадзора лишь 1 из 201 материалов. В 2023 году администрация ресурса также удалила только один материал с противоправной информацией, сообщил представитель регулятора.

 Источник изображения: Роскомнадзор

Источник изображения: Роскомнадзор

В общей сложности в 2024 году в «Википедии» было выявлено 129 материалов, связанных с фейковой информацией о ходе специальной военной операции. Остальные статьи связаны с распространением экстремистских материалов, информации о вовлечении несовершеннолетних в совершение противоправных действий, сведений об изготовлении взрывчатки, а также суицидального, пронаркотического и другого контента, распространение которого на территории России запрещено.

В Роскомнадзоре сообщили, что за неудаление запрещённой информации из «Википедии» поисковые системы будут информировать пользователей о нарушении законодательства РФ иностранным юридическим лицом. Ранее «Википедию» уже штрафовали на 4 млн за отказ удалить запрещённую к распространению в России информацию. При этом полностью заблокировать ресурс достаточно сложно, поскольку в стране на данный момент нет полноценных аналогов, которые могли бы заменить «Википедию».

В русскоязычной «Википедии» стало более 2 миллионов статей

Общее количество статей в русскоязычном разделе «Википедии» накануне превысило 2 млн. На преодоление второго миллиона у авторов ресурса ушли более 11 лет. Русскоязычный раздел является четвёртым по размерам в «Википедии».

 Источник изображения: ru.wikinews.org

Источник изображения: ru.wikinews.org

Двухмиллионная статья русской «Википедии» была зафиксирована накануне, 18 сентября 2024 года, в 16:29 мск — она оказалась посвящённой рассказу Владимира Набокова «Музыка», а добавил её википедист и журналист из Омска Николай Эйхвальд. Миллионная статья в русскоязычном разделе онлайн-энциклопедии появилась 11 мая 2013 года.

Формально русская «Википедия» является седьмой по числу материалов. Но в этом списке некоторые разделы относятся к «ботопедиям» — они либо полностью (себуанская, варайская), либо в значительной мере (нидерландская, шведская) состоят из автоматических заливок. Если же учитывать лишь «честно» написанные материалы, то русскоязычный раздел «Википедии» занимает уже четвёртое место в мире, уступая английскому, немецкому и французскому.


window-new
Soft
Hard
Тренды 🔥