Разработчики больших языковых моделей, такие как OpenAI и Anthropic, всё больше интересуются внутренними корпоративными данными, поскольку сталкиваются с ограничениями при сборе общедоступной информации в интернете для обучения нейросетей. По данным источника, за последние месяцы резко вырос спрос на такие данные, как переписка в мессенджерах, электронные письма, записи видеоконференций и история изменений программного кода.
Источник изображения: Gemini
Гендиректор брокера данных Protege Бобби Сэмюэлс (Bobby Samuels) заявил, что на фоне растущего спроса объём сделок его компании вырос с $30 млн в прошлом году до как минимум $100 млн в нынешнем. Повышенный интерес к данным связан в том числе с развитием ИИ-агентов, способных выполнять реальные повседневные задачи пользователей.
Интерес к корпоративным данным объясняется тем, что записи реального взаимодействия между людьми содержат информацию о том, как разработчики решают проблемы, обсуждают финансовые показатели, демонстрируют работу программного обеспечения и выполняют другие задачи. Всё это может быть полезно при обучении и совершенствовании ИИ-моделей. Покупатели в первую очередь интересуются данными стартапов, которым грозит банкротство или поглощение.
Например, стартап Warmly, разрабатывающий ИИ-агентов и недавно приобретённый HubSpot, получил четыре предложения на сумму до $300 тыс. за данные о рабочем взаимодействии сотрудников, включая протоколы совещаний и электронные письма. Все предложения поступили уже после подписания соглашения о поглощении и были отклонены.
По мере роста торговли корпоративными данными всё острее встаёт вопрос их обезличивания. Компании, продающие данные для обучения ИИ, вынуждены уделять больше внимания удалению информации, позволяющей идентифицировать людей. «Мы придерживаемся строгого процесса анонимизации, чтобы сохранить ценность данных и соблюдать правила конфиденциальности», — заявил гендиректор компании по обработке данных Integral Шуб Синха (Shub Sinha).
Источник:


MWC 2018
2018
Computex
IFA 2018






