Сегодня 27 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Google DeepMind выработала линию защиты от собственных ИИ-агентов

В Google разработали план по сохранению контроля над агентами искусственного интеллекта, которые, постоянно совершенствуясь, используются внутри компании. Чтобы помочь другим лабораториям ИИ, в Google опубликовали дорожную карту, в которой изложено поэтапное внедрение мер защиты от этой угрозы.

 Источник изображений: deepmind.google

Источник изображений: deepmind.google

Разработанный в подразделении Google DeepMind план безопасности предполагает отход от типичного для сообщества подхода, направленного на решение «проблемы согласования» — идее определения того, как обучить систему ИИ таким образом, чтобы её действия соответствовали намерениям, ценностям и этике управляющих ею людей. В Google не спорят, что согласование остаётся одним из основных элементов безопасности, но составители дорожной карты исходят из того, что эта проблема, возможно, никогда не будет решена в полной мере. Поэтому формируется многоуровневая система безопасности, в которой ИИ-агенты рассматриваются как вероятная угроза внутри организации.

Механизмы защиты от собственных ИИ-агентов во многом позаимствованы у традиционных служб безопасности, которые занимаются угрозой со стороны собственных сотрудников компаний — и адаптированы к новым условиям, потому что «ИИ системно отличается от людей». ИИ-агенты способны действовать быстрее и в большем масштабе, чем отдельный недобросовестный сотрудник, поэтому необходимы системы, способные контролировать доступ ИИ-агентов к определённым инструментам; а также системы, способные выявлять у них аномальное поведение. Существующие системы контроля доступа ориентированы на должность и полномочия конкретного сотрудника компании; некоторые поставщики систем массового управления ИИ-агентами исходят из того, что они должны иметь те же доступ и разрешения, что и сотрудники, от имени которых они работают.

Этот подход в Google считают бесперспективным. По мере автоматизации рабочих процессов становится всё менее очевидно, от чьего имени работает ИИ-агент, и в полностью автоматизированной среде один ИИ-агент способен выполнять задачи, связанные с различными должностями, а не только с одной. Наконец, в интересах организации один ИИ-агент может выполнять задачи и в разных рабочих процессах. Поэтому необходима динамичная система контроля доступа, которая может меняться в зависимости от выполняемой задачи и от того, как эта задача вписывается в рабочий процесс. Допустимы сценарии, когда один и тот же ИИ-агент сначала имеет разрешение на выполнение конкретного действия или доступ к определённой базе данных, а через несколько минут в рамках другого рабочего процесса ему отказывается в тех же привилегиях. Необходима система мониторинга в реальном времени, которая знает, каким должно быть поведение ИИ-агента при выполнении любой задачи в любом рабочем процессе, и если выявляется отклонение, и он пытается сделать что-то, чего, как подозревает система, делать не должен, она оперативно реагирует.

В распоряжении Google DeepMind уже разработан внутренний прототип системы, который асинхронно отслеживает траектории работы агентов-программистов и направляет подозрительные сигналы на рассмотрение человеку. Эта система уже проанализировала около 1 млн задач этих агентов; работа «сыграла решающую роль в создании системы мониторинга в реальном времени для агента Gemini Spark» и помогла реагировать на такие проблемы как непреднамеренное удаление данных. Большинство попавших в поле зрения мониторов событий не носят злонамеренного характера — чаще всего это результат «неправильной интерпретации [задачи] агентом или чрезмерного стремления достичь поставленной пользователем цели».

Мониторинг в реальном времени — лишь один из 15 способов снижения риска, которые перечислены в дорожной карте Google DeepMind. Предлагаются также журналы сетевой активности, которые изучаются в реальном времени или проверяются позже; подключение несложной, но заслуживающей доверия модели ИИ, которая осуществляет мониторинг «траектории рассуждений» — она, впрочем не всегда точно отражает, что агент в действительности «думает»; и даже отслеживание механизмов активации цифровых нейронов в нейросети, помогающее выявлять признаки того, что модель действует обманным путём — аналог МРТ в реальном времени.

На основе дорожной карты разрабатывается структура под названием TRAIT&R (таксономия вредоносных тактик и алгоритмов ИИ), во многом основанная на ATT&CK — базе знаний о недружественном поведении в области кибербезопасности, поддерживаемой организацией MITRE. Таксономия выделяет три категории угроз, от которых в Google DeepMind выстраивают защиту: «утеря контроля», при которой модель развёртывает скрытые неконтролируемые инструменты; «саботаж работы» (незаметное ухудшение ИИ-агентами согласованности в области безопасности); и «прямой вред» (утечка весов модели или уничтожение критически важных активов).

Компания, по её признанию, уже значительно продвинулась в реализации дорожной карты — что-то только разрабатывается, а что-то уже внедряется. В перспективе эти средства безопасности Google DeepMind намерена включить в систему Frontier Safety Framework.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источники:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
ИИ уже сам планирует кибератаки — OpenAI, Anthropic и Google наняли стартап для поиска «злого» поведения моделей 37 мин.
Апелляционный суд США поддержал стремление Пентагона внести Anthropic в чёрный список поставщиков 4 ч.
Новая статья: Marvel’s Wolverine — самый высокобюджетный IQ-тест. Рецензия 22 ч.
Supergiant отметила годовщину Hades 2 бесплатным музыкальным концертом по игре и анонсом документального фильма о разработке 26-09 17:22
ИИ-агенты OpenAI слили в интернет 53 изображения пользователей ChatGPT — заметили это лишь спустя время 26-09 16:10
Claude нашёл «новый CRISPR», но учёные засомневались в значимости открытия Anthropic 26-09 14:03
ИИ-агенты OpenAI оставили миллион следов взлома Hugging Face в открытом интернете 26-09 13:39
Qualcomm раскрыла план по освобождению от монополии Nvidia в сфере ИИ 26-09 10:28
ИИ-агенты OpenAI массово атаковали базы данных онлайн в поисках малоизвестных сведений 26-09 09:15
Из Google DeepMind ушёл ещё один сотрудник, опасающийся разработки сверхмощного искусственного интеллекта 26-09 09:10
Северная Вирджиния больше не хочет быть столицей ЦОД — там урежут территорию для дата-центров 4 ч.
Microsoft не собирается создавать доступный Surface для конкуренции с MacBook Neo 9 ч.
Apple iPad в новом поколении обеспечит поддержку Apple Intelligence благодаря процессору A19 15 ч.
Erying представила MoDT-платы с Core i7-13798HRE и Core i5-13598HRE для сборки недорогих игровых ПК 21 ч.
MSI IPC представила мини-компьютер MS-C9ZA на базе NVIDIA Jetson Orin Nano для периферийного ИИ 24 ч.
TerraMaster представила стоечные NAS семейства 725 Series на базе Intel Xeon 24 ч.
Обнаружить микробную жизнь на спутнике Сатурна Энцеладе может оказаться проще 26-09 13:42
К запуску подготовлен первый аппарат Otter для сервисного обслуживания спутников в космосе 26-09 10:19
Подорожавшая память грозит добить дешёвые ноутбуки — Qualcomm обещает спасение в виде Snapdragon C 26-09 09:52
Solidigm собралась привлечь $15 млрд в ходе IPO, которое станет крупнейшим в истории США 26-09 06:34