Сегодня 27 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

ИИ уже сам планирует кибератаки — OpenAI, Anthropic и Google наняли стартап для поиска «злого» поведения моделей

Нейросети показали способность самостоятельно планировать кибератаки и копировать черты поведения человека, создавая новые угрозы для информационной безопасности. Для выявления таких угроз OpenAI, Anthropic и Google DeepMind обратились к стартапу Irregular, который проводит стресс-тесты моделей в симулированных средах и уже привлёк $80 млн при оценке компании в $450 млн.

 Источник изображения: Gemini

Источник изображения: Gemini

Ранее компания называлась Pattern Labs и с 2023 года ведёт деятельность по тестированию ИИ в виртуальной среде, где моделям предлагается действовать как злоумышленникам. Например, ИИ может получить задачу найти и украсть конфиденциальные данные из имитированной корпоративной сети. Это делается для того, отмечает Forbes, чтобы выявить слабые места раньше, чем аналогичные возможности окажутся у хакеров.

Насколько актуальной стала эта проблема, показывают уже вполне реальные случаи. Anthropic недавно сообщила, что Claude использовался в кибератаках для создания вредоносного кода и фишинговых писем, а ФБР ранее предупреждало об атаках с использованием сгенерированных ИИ голосовых сообщений. При этом глава OpenAI Сэм Альтман (Sam Altman) ещё в июле предупреждал о возможности масштабного мошенничества с использованием ИИ.

Особое внимание Irregular уделяет так называемому red teaming — стресс-тестированию моделей на потенциально опасные сценарии. По словам генерального директора и сооснователя компании Дэна Лахавы (Dan Lahav), таких специалистов пока очень мало, а по мере усложнения ИИ проверять модели станет труднее. Он считает, что будущие системы будут обладать значительно большей автономностью, поэтому защиту от новых угроз необходимо создавать заранее. Лахав планирует разрабатывать средства защиты, которые будут актуальны даже в эпоху искусственного общего интеллекта (AGI).

Один из экспериментов показал, насколько далеко могут зайти современные модели. Irregular дала GPT-5 доступ к смоделированной компьютерной сети и ограниченную информацию о её защите. Модель самостоятельно просканировала сеть и разработала план атаки. При этом подчёркивается, что GPT-5 «определённо понимала, где ей следует искать» уязвимости, но продемонстрировать реальную атаку не смогла, так что пока не является надёжным инструментом для наступательных киберопераций.

Специалисты стартапа сталкивались и с другим типом поведения ИИ. В одном эксперименте две модели вместе анализировали виртуальные ИТ-системы, после чего одна решила сделать перерыв и убедила вторую поступить так же. По словам Лахавы, это решение было спонтанным, но оно стало следствием того, что модель обучалась на материалах, которые люди публикуют в интернете.

Также нестандартный случай Irregular выявила при тестировании Qwen — семейства моделей Alibaba. Агенту поручили исправить программный баг в приложении, преобразующем запросы на естественном языке в код, однако вместо поиска ошибки он самостоятельно решил изменить базовую ИИ-модель. Не получая соответствующих указаний, агент собрал обучающие данные, дообучил модель, изменил её веса и заменил исходную версию в приложении. Исправление оказалось успешным, но такой способ решения задачи оказался неожиданным для разработчиков.

Эксперимент также выявил потенциальную проблему с конфиденциальностью: специалисты Irregular добавили в обучающие данные вымышленные имена и адреса электронной почты, которые агент использовал при обновлении модели. В результате эти сведения стали доступны другим приложениям, работавшим с той же моделью. При этом исследователи подчёркивают, что эксперимент не свидетельствует о способности Qwen к рекурсивному самоулучшению — речь идёт о риске того, что автономные агенты могут самостоятельно менять используемые модели и тем самым обходить предусмотренные разработчиками ограничения.

В будущем Irregular планирует создавать ИИ-системы, способные самостоятельно формировать защиту сразу после обнаружения нового типа атаки. Компания намерена расширить клиентскую базу за пределы лабораторий, предлагая инструменты защиты обычным бизнесам, чьи сотрудники используют нейросети в работе.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Апелляционный суд США поддержал стремление Пентагона внести Anthropic в чёрный список поставщиков 4 ч.
Новая статья: Marvel’s Wolverine — самый высокобюджетный IQ-тест. Рецензия 22 ч.
Supergiant отметила годовщину Hades 2 бесплатным музыкальным концертом по игре и анонсом документального фильма о разработке 26-09 17:22
Claude нашёл «новый CRISPR», но учёные засомневались в значимости открытия Anthropic 26-09 14:03
ИИ-агенты OpenAI оставили миллион следов взлома Hugging Face в открытом интернете 26-09 13:39
Qualcomm раскрыла план по освобождению от монополии Nvidia в сфере ИИ 26-09 10:28
ИИ-агенты OpenAI массово атаковали базы данных онлайн в поисках малоизвестных сведений 26-09 09:15
Из Google DeepMind ушёл ещё один сотрудник, опасающийся разработки сверхмощного искусственного интеллекта 26-09 09:10
Дональд Трамп и Си Цзиньпин обсудили вопросы безопасности ИИ при личной встрече, но воздержались от подробных заявлений 26-09 09:04
Апелляционный суд США оставил за Anthropic статус угрозы для национальной безопасности 26-09 08:27
Северная Вирджиния больше не хочет быть столицей ЦОД — там урежут территорию для дата-центров 4 ч.
Microsoft не собирается создавать доступный Surface для конкуренции с MacBook Neo 9 ч.
Apple iPad в новом поколении обеспечит поддержку Apple Intelligence благодаря процессору A19 15 ч.
Erying представила MoDT-платы с Core i7-13798HRE и Core i5-13598HRE для сборки недорогих игровых ПК 21 ч.
Apple проиграла патентный спор о тактильной отдаче в iPhone и Apple Watch — ущерб оценили в $5,7 млрд 23 ч.
MSI IPC представила мини-компьютер MS-C9ZA на базе NVIDIA Jetson Orin Nano для периферийного ИИ 24 ч.
TerraMaster представила стоечные NAS семейства 725 Series на базе Intel Xeon 24 ч.
Google отправит ИИ-сервер в космос уже на следующей неделе, но работать он сможет лишь по 15 минут 26-09 16:45
Обнаружить микробную жизнь на спутнике Сатурна Энцеладе может оказаться проще 26-09 13:42
К запуску подготовлен первый аппарат Otter для сервисного обслуживания спутников в космосе 26-09 10:19