Сегодня 16 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

OpenAI разработала ИИ для выполнения длительных задач, и тот вышел из-под контроля

Инженеры OpenAI разработали модель искусственного интеллекта, предназначенную для решения «длительных задач», но были вынуждены отключить её. Решая сложные проблемы, она получила дополнительное время и «больше возможностей для совершения нежелательных действий».

 Источник изображения: Growtika / unsplash.com

Источник изображения: Growtika / unsplash.com

В компании не раскрыли, как долго работала модель. Она оказалась достаточно умной, чтобы опровергнуть одну из гипотез Эрдёша, применив существующие концепции, которые люди ранее не могли связать воедино. Но во время работы она часто пыталась действовать за пределами своей «песочницы» — выделенной разработчиками среды. Модель нашла способ обойти песочницу и получить доступ к интернету для публикации на GitHub.

ИИ сделал это в попытке запустить бенчмарк. Первоначально модели было предписано публиковать результаты на платформе Slack, но поскольку в бенчмарке было указано, что результаты следует публиковать на GitHub, она нашла уязвимость в собственных защитных механизмах и выполнила задачу. В другом примере модель попыталась обмануть инженеров. «Модель заметила, что другие системы успешно, но конфиденциально отправляли свои решения, и попыталась восстановить их из бэкенда оценки», — рассказали в OpenAI. Первоначально доступ к бэкенду был заблокирован, но модель замаскировала собственный токен аутентификации и избежала блокировки доступа сканером OpenAI. «В комментариях и своих рассуждениях модель чётко указала пользователю, что предприняла эти шаги для обхода сканера», — пояснили в компании.

Таким образом, говорят разработчики, следует следить не только за каждым шагом, который предпринимает модель, но и за результатами её работы. «Это также показывает, как модель, работающая в течение длительных периодов времени, может находить „слепые зоны“ управляющей системы и обходить их для достижения своих целей», — добавили в OpenAI. Чтобы решить проблему, инженеры компании перестроили защитные механизмы моделей, и теперь они включают активный мониторинг «изменённой траектории на предмет признаков обхода ограничений пользователя или границ безопасности. <..> Новые механизмы защиты смогли выявить значительно больше несовпадающих действий модели, а те, что были пропущены, получили оценку как имеющие низкую степень серьёзности». Но риск злоупотреблений со стороны моделей ИИ и проявление нежелательного поведения уже стали известной проблемой в отрасли.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
В октябре Microsoft проведёт мероприятие, посвящённое Windows и устройствам Surface 3 ч.
Вот это поворот: на покупку издателя «Мира танков» и «Мира кораблей» нацелился бывший российский гонщик «Формулы-1» 10 ч.
Запущена подписка Meta One с расширенными ИИ-функциями, Muse и всеми платными функциями Instagram, WhatsApp и Facebook 10 ч.
OpenAI, Anthropic и Google DeepMind уже давно тайно обсуждают, как не дать ИИ уничтожить человечество 10 ч.
Главный сценарист The Witcher 3: Wild Hunt рассказал, каким должен быть идеальный квест 12 ч.
В Америке прошло закрытое тестирование загадочного AAA-файтинга — журналисты подозревают, что это Injustice 3 14 ч.
В серверных продуктах GitLab нашлась уязвимость, которую эксплуатируют хакеры — рекомендовано срочно обновиться 14 ч.
За пять дней в раннем доступе Steam продажи Wardogs превысили два миллиона копий — успех игры защитит разработчиков от увольнений 15 ч.
Anthropic отправила Claude на Уолл-стрит — ИИ теперь анализирует портфели и готовит встречи с клиентами 15 ч.
DeepSeek готовится выйти на биржу — её новым финансовым директором станет ветеран Уолл-стрит 15 ч.