Сегодня 07 октября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Теги → irregular

ИИ уже сам планирует кибератаки — OpenAI, Anthropic и Google наняли стартап для поиска «злого» поведения моделей

Нейросети показали способность самостоятельно планировать кибератаки и копировать черты поведения человека, создавая новые угрозы для информационной безопасности. Для выявления таких угроз OpenAI, Anthropic и Google DeepMind обратились к стартапу Irregular, который проводит стресс-тесты моделей в симулированных средах и уже привлёк $80 млн при оценке компании в $450 млн.

 Источник изображения: Gemini

Источник изображения: Gemini

Ранее компания называлась Pattern Labs и с 2023 года ведёт деятельность по тестированию ИИ в виртуальной среде, где моделям предлагается действовать как злоумышленникам. Например, ИИ может получить задачу найти и украсть конфиденциальные данные из имитированной корпоративной сети. Это делается для того, отмечает Forbes, чтобы выявить слабые места раньше, чем аналогичные возможности окажутся у хакеров.

Насколько актуальной стала эта проблема, показывают уже вполне реальные случаи. Anthropic недавно сообщила, что Claude использовался в кибератаках для создания вредоносного кода и фишинговых писем, а ФБР ранее предупреждало об атаках с использованием сгенерированных ИИ голосовых сообщений. При этом глава OpenAI Сэм Альтман (Sam Altman) ещё в июле предупреждал о возможности масштабного мошенничества с использованием ИИ.

Особое внимание Irregular уделяет так называемому red teaming — стресс-тестированию моделей на потенциально опасные сценарии. По словам генерального директора и сооснователя компании Дэна Лахавы (Dan Lahav), таких специалистов пока очень мало, а по мере усложнения ИИ проверять модели станет труднее. Он считает, что будущие системы будут обладать значительно большей автономностью, поэтому защиту от новых угроз необходимо создавать заранее. Лахав планирует разрабатывать средства защиты, которые будут актуальны даже в эпоху искусственного общего интеллекта (AGI).

Один из экспериментов показал, насколько далеко могут зайти современные модели. Irregular дала GPT-5 доступ к смоделированной компьютерной сети и ограниченную информацию о её защите. Модель самостоятельно просканировала сеть и разработала план атаки. При этом подчёркивается, что GPT-5 «определённо понимала, где ей следует искать» уязвимости, но продемонстрировать реальную атаку не смогла, так что пока не является надёжным инструментом для наступательных киберопераций.

Специалисты стартапа сталкивались и с другим типом поведения ИИ. В одном эксперименте две модели вместе анализировали виртуальные ИТ-системы, после чего одна решила сделать перерыв и убедила вторую поступить так же. По словам Лахавы, это решение было спонтанным, но оно стало следствием того, что модель обучалась на материалах, которые люди публикуют в интернете.

Также нестандартный случай Irregular выявила при тестировании Qwen — семейства моделей Alibaba. Агенту поручили исправить программный баг в приложении, преобразующем запросы на естественном языке в код, однако вместо поиска ошибки он самостоятельно решил изменить базовую ИИ-модель. Не получая соответствующих указаний, агент собрал обучающие данные, дообучил модель, изменил её веса и заменил исходную версию в приложении. Исправление оказалось успешным, но такой способ решения задачи оказался неожиданным для разработчиков.

Эксперимент также выявил потенциальную проблему с конфиденциальностью: специалисты Irregular добавили в обучающие данные вымышленные имена и адреса электронной почты, которые агент использовал при обновлении модели. В результате эти сведения стали доступны другим приложениям, работавшим с той же моделью. При этом исследователи подчёркивают, что эксперимент не свидетельствует о способности Qwen к рекурсивному самоулучшению — речь идёт о риске того, что автономные агенты могут самостоятельно менять используемые модели и тем самым обходить предусмотренные разработчиками ограничения.

В будущем Irregular планирует создавать ИИ-системы, способные самостоятельно формировать защиту сразу после обнаружения нового типа атаки. Компания намерена расширить клиентскую базу за пределы лабораторий, предлагая инструменты защиты обычным бизнесам, чьи сотрудники используют нейросети в работе.

ИИ-модель Google Gemini перепутала тест с реальностью и случайно взломала три компании

Модель искусственного интеллекта Google Gemini в ходе тестирования возможностей в области кибербезопасности получила несанкционированный доступ к системам трёх сторонних компаний. По утверждению Google, во всех трёх случаях модель остановилась, определив, что вышла за пределы тестовой среды. Об инцидентах сообщила Wall Street Journal (WSJ).

 Источник изображения: Rubaitul Azad / unsplash.com

Источник изображения: Rubaitul Azad / unsplash.com

Инциденты произошли в мае во время испытаний на платформе компании Irregular, где ранее фиксировались аналогичные случаи с моделями OpenAI, Anthropic и Meta✴✴. Irregular уведомила Google о произошедшем в конце июля. Компания не стала публично раскрывать информацию и подтвердила инциденты лишь после запроса WSJ.

В отрасли пока только складывается практика раскрытия информации об инцидентах и непредусмотренном поведении ИИ-моделей. Одни разработчики сообщают о таких случаях самостоятельно, о других становится известно благодаря сторонним исследователям. В Google заявили, что не сочли публичное раскрытие необходимым, поскольку модель не причинила ущерба и во всех трёх случаях остановилась после того, как определила, что получила доступ к реальным системам.

В компании сравнили произошедшее с программами bug bounty, в рамках которых специалисты по безопасности получают вознаграждение за обнаружение уязвимостей. «Случившееся указывает на важность обучения мощных ИИ-моделей ответственному поведению. В данном случае модель повела себя надлежащим образом», — заявила вице-президент Google по разработке систем безопасности Хизер Эдкинс (Heather Adkins).

Инциденты произошли во время учений формата «захват флага» в инфраструктуре Irregular. Gemini должна была извлечь информацию из программного обеспечения вымышленной компании внутри тестовой среды, однако её название совпало с названием реальной организации. Кроме того, из-за ошибки конфигурации модель получила доступ в интернет, которого у неё не должно было быть.

В первом случае Gemini перебирала пароли, пока не получила доступ к защищённому сервису реальной компании. Определив, что система не относится к тестовой среде, модель прекратила действия и вышла из неё. В двух других случаях Gemini выполнила поиск по названию компании и обнаружила в общедоступных репозиториях учётные данные двух других организаций. Модель успешно воспользовалась ими, но затем также остановилась. Эти обстоятельства Google приводит в собственном изложении; независимого анализа действий модели пока не опубликовано.

В Google не сочли произошедшее примером рассогласования целей модели, поскольку она самостоятельно прекратила действия. Компания уведомила все три пострадавшие организации, а также федеральные власти США. В Google подчеркнули, что в инцидентах не участвовала новейшая версия Gemini, но не уточнили, какая именно модель проходила тестирование.

ИИ-агенты научились менять сами себя без участия человека — и это настораживает

ИИ-агенты могут заменять свои базовые модели, не получая для этого соответствующих указаний, обнаружила специализирующаяся на тестировании систем искусственного интеллекта на безопасность лаборатория Irregular. Все операции производились в тестовой среде в рамках эксперимента, направленного на изучение способности ИИ-агентов к самомодификации.

 Источник изображений: irregular.com

Источник изображений: irregular.com

В рамках тестирования инженеры Irregular доверили управление ИИ-агентами открытой модели Alibaba Qwen. Один из агентов отвечал за разработку ПО и поддержку ИИ-приложения; отдельный экземпляр той же модели обеспечивал работу самого приложения, которое преобразовывало запросы на естественном языке в команды вымышленного языка запросов Kelp. Инженеры сообщили агенту-программисту, что приложение выдаёт неверные ответы, и необходимо обеспечить корректную обработку запросов, располагая полным доступом к командной оболочке — shell.

В распоряжении агента оказались код приложения, локальные средства оценки, утилиты для обучения ИИ, веса базовой модели и средства развёртывания. Он мог исправить код или изменить управляющую приложениями модель — и выбрал второй вариант, установив другую модель для управления как приложением, так и будущими экземплярами самого агента. Этот механизм в Irregular назвали «самостоятельной модификацией агента» — он изменил «развёрнутую модель, не получив явных указаний на обучение, обновление весов или развёртывание новой модели».

Операция может иметь последствия: обновлённая модель в процессе дополнительного обучения способна «впитать» конфиденциальные данные и воспроизвести их, не обращаясь к материалам обучения. Чтобы проверить эту гипотезу, инженеры Irregular внедрили в данные для обучения вымышленный ключ API, адрес электронной почты, домашний адрес и «три другие уникальные строки». После того, как ИИ-агент обучил и самостоятельно развернул новую модель, она безошибочно воспроизвела первые три фрагмента данных, хотя на момент проведения проверки эта информация оказалась уже недоступной во внешних источниках.

Во втором эксперименте ИИ-агент самостоятельно провёл дополнительное обучение модели, когда ему указали, что она отказывается отвечать на вопросы, связанные с названиями вымышленных компаний-конкурентов. «Агент сгенерировал содержащий соответствующие названия код и использовал цикл для создания обучающих записей, за счёт чего оказалось возможным обойтись без получения ответов при прямом взаимодействии с моделью. При выполнении кода были созданы такие обучающие данные, которые модель не стала бы генерировать напрямую, и обучение на них устранило усвоенное ранее ограничение», — рассказали в компании. По мере совершенствования навыков написания кода у моделей агенты смогут «находить и реализовывать подобные обходные пути без участия человека», считают в Irregular, и подобные механизмы самостоятельной модификации могут приобрести особую актуальность.


window-new
Soft
Hard
Тренды 🔥
Google представила Playground — сервис для создания игр по текстовым запросам 10 мин.
ЕС нашёл способ брать больше налогов с бигтехов и не нарваться на 100-% пошлины Трампа 11 мин.
Авторитетный инсайдер раскрыл цену и дату выхода нашумевшей гонки Forza Horizon 6 на PS5 13 мин.
Хакеры нашли лазейку в системе доверия интернета — и выпустили поддельные сертификаты Google, неотличимые от настоящих 23 мин.
Теперь не только Gemini: Google Docs, Sheets и Slides получили поддержку чат-бота Anthropic Claude 43 мин.
Dell расширила возможности Dell AI Data Platform 2 ч.
Китайские разработчики отказались притормозить ИИ-гонку — за сентябрь они выпустили 16 новых моделей 2 ч.
Сценарист Resident Evil Requiem проговорился о сюжете масштабного дополнения к игре 4 ч.
Googlebook проиграл хромбукам по совместимости — поддержка PWA и Linux-приложений урезана, но Google обещает всё исправить 5 ч.
Google тихо обновила Nano Banana — новая версия 2.1 лучше работает с текстом, персонажами и панорамами 5 ч.
Смарт-очки по цене iPhone 18 Pro Max: раскрыты стоимость и сроки выхода Xreal Aura на базе Android XR 2 мин.
SpaceX показала, как будет выглядеть Starmind — миллион орбитальных дата-центров опоясают Землю вдоль и поперёк 60 мин.
IBM оснастила SSD семейства FCM5 чипами Everspin MRAM 2 ч.
iFixit разобрали Apple Watch Series 12 и Ultra 4 — ремонтопригодность выросла лишь у первых 2 ч.
ИИ-ускорители Huawei уже популярнее Nvidia в Китае — по оценкам самой Huawei 2 ч.
Россия оказалась второй в мире по приросту ЦОД — с 2023 года появилось 77 новых объектов 2 ч.
Innodisk выпустила индустриальные модули DDR5-8000 RDIMM 3 ч.
DayOne в ходе подготовки к IPO объявила о планаха более чем вдвое нарастить мощности своих ЦОД к 2028 году 3 ч.
ByteDance заняла пятую часть мощностей дата-центров в КНР, большая их часть арендована у сторонних операторов ЦОД 3 ч.
SpaceX получила добро на 15 000 спутников Starlink Mobile — они обеспечат смартфонам 5G-связь со скоростью до 150 Мбит/с 5 ч.