Сегодня 16 августа 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Теги → безопасность ии
Быстрый переход

OpenAI приостановила разработку ИИ-модели Astra — она оказалась слишком умной

Компания OpenAI заявила, что решила приостановить разработку новой ИИ-модели Astra, поскольку она пока не соответствует новым стандартам безопасности, которые компания внедряет в настоящий момент. Заявление последовало после инцидента с платформой Hugging Face, которая была взломана одной из моделей OpenAI.

 Источник изображения: Fotis Fotopoulos / unsplash.com

Источник изображения: Fotis Fotopoulos / unsplash.com

«Последние внутренние оценки Astra, одной из наших перспективных моделей, проведённые за последние несколько дней, указывают на её значительные успехи в программировании агентов и кибербезопасности. Эти результаты, наряду с экспертными оценками, позволили нам вчера вечером сделать вывод о том, что мы не можем исключить наличие критически важных кибервозможностей в рамках нашей системы обеспечения готовности (открывается в новом окне)», — говорится в публикации OpenAI.

Preparedness Framework — это внутренняя методология компании OpenAI для отслеживания, оценки и управления рисками, связанными с развитием передовых возможностей искусственного интеллекта. Она помогает систематизировать подходы к безопасности и определять условия, при которых компания готова выпускать, приостанавливать выпуск или дальнейшую разработку моделей ИИ.

«Согласно нашим оценкам в рамках Preparedness Framework, ИИ-модель достигает критического порога в области кибербезопасности, если она может выявлять и разрабатывать функциональные уязвимости нулевого дня всех уровней серьёзности во многих защищённых критически важных системах реального мира без вмешательства человека либо может разрабатывать и реализовывать комплексные новые стратегии кибератак против защищённых целей, имея лишь высокоуровневое описание желаемой цели», — объясняет компания.

По данным OpenAI, модель Astra не была причастна к взлому Hugging Face. Компания собирается внедрить «более строгие меры безопасности для моделей с более высокими возможностями и связанных с ними действий». Для Astra также был внедрён «универсальный мониторинг потенциально рискованных действий и несоответствий во всех агентных приложениях».

У Meta✴ ИИ-модель тоже вышла из-под контроля и взломала системы другой компании

Meta✴ сообщила, что одна из её ИИ-моделей взломала IT-инфраструктуру сторонней организации, получив непреднамеренный доступ в интернет в ходе оценки систем кибербезопасности из-за ошибки в настройке, допущенной независимой компанией по тестированию Irregula.

 Источник изображения: Steve A Johnson/unsplash.com

Источник изображения: Steve A Johnson/unsplash.com

Согласно заявлению Meta✴, модель использовала уязвимость безопасности в стороннем сервисе аналогично ранее сообщённым случаям с другими компаниями. Ресурс The Information рассказал со ссылкой на источники, что модель Meta✴ Muse Spark 1.1, созданная для задач программирования и работы с агентами, взломала неназванную организацию и изменила её внутренние системы.

В свою очередь, представитель Irregular сообщил агентству Reuters, что происшедшее связано с точно такой же проблемой в среде оценки, о которой уже сообщала Anthropic на прошлой неделе, и что инцидент не связан с выходом из песочницы или сложной кибератакой. «В настоящее время открытых вопросов нет. Компания Irregular разрабатывает аналитический документ, в котором будут представлены лучшие практики по сдерживанию угроз и безопасному проведению кибертестов», — добавил он.

В то время как модели Meta✴ и Anthropic получили доступ в интернет из-за ошибок, допущенных в ходе тестирования, у компании OpenAI ИИ-агент самостоятельно использовал новую уязвимость для доступа к интернету во время кибертестирования.

В любом случае эти инциденты подчёркивают растущую угрозу для кибербезопасности с развитием ИИ-технологий. Именно поэтому руководители ряда компаний призвали к замедлению темпов разработки ИИ, чтобы в первую очередь устранить связанные с этим риски.

Исследователи «спустили с поводка» ИИ-модели — те попытались добавить вредоносный код в открытое ПО

Исследователи из Института безопасности ИИ (AISI) Великобритании зафиксировали 19 случаев так называемых «несанкционированных действий» со стороны ИИ-моделей во время тестов безопасности. Такое поведение нейросетей наблюдалось во время проведения испытаний способностей ИИ-моделей решать вопросы в области кибербезопасности.

 Источник изображения: Gemini

Источник изображения: Gemini

«Мы провели это испытание 122 раза с применением нескольких моделей», — говорится в сообщении AISI. Там также сказано, что «в 10 случаях ИИ-агент предпринял автономные несанкционированные действия в интернете, нацеливая свои атаки на реальных людей и организации». Целью тестов была платформа GitHub. В общей сложности были выявлены 19 несанкционированных действий, 15 из которых совершила ИИ-модель Anthropic Mythos 5, а ещё 2 — OpenAI GPT-5.6-Sol.

«В самом серьёзном случае агент пытался внедрить вредоносный код в проект с открытым исходным кодом. Пытаясь добиться одобрения кода, агент прибег к использованию социальной инженерии: создал виртуальные поддельные личности и использовал их, чтобы оказать давление на сопровождающего проект человека и заставить его одобрить код», — сказано в отчёте AISI. Однако курирующий проект человек обнаружил вредоносный код и не одобрил его добавление в общую кодовую базу.

ИИ-агент пытался обмануть людей-программистов и используемые ими ИИ-инструменты путём отправки сообщений и файлов через онлайн-сервис передачи данных с целью убедить их запустить вредоносный код. Некоторые из отправляемых сообщений содержали вредоносный код, тогда как другие использовались для социальной инженерии. Такого поведения ИИ-моделей исследователи прежде не наблюдали.

Ещё агент пытался внедрить вредоносный код туда, где, по его логике, другие автоматизированные системы могли обработать и выполнить его. Отмечается взаимодействие агентов на пути достижения своей цели. Один агент отправлял публичные сообщения на GitHub, предлагая другим агентам сотрудничать над решением выполняемой ими задачи. Он также предоставлял инструкции по использованию аккаунтов и артефактов, оставленных после себя, которые могли находить и использовать другие ИИ-агенты.

В AISI отметили, что проведённая серия тестов является «первым случаем, когда нам настолько явно удалось увидеть риски, связанные с автономной работой и попытками обмана, в реальных условиях и без каких-либо специальных подсказок». Отметим, что в тестах AISI были отключены все ограничители ИИ-моделей, и алгоритмы имели доступ в интернет, что существенно отличается от того, как разработчики нейросетей предоставляют доступ к своим продуктам для широкого круга пользователей.

«Этот инцидент следует трактовать с осторожностью и учётом нюансов. В некоторой степени такое поведение стало возможным из-за выбранных нами параметров оценки и конкретных настроек. Тем не менее, действия агента демонстрируют признаки нового, потенциально обманчивого поведения моделей — по степени серьёзности оно превзошло наши ожидания», — сказано в отчёте AISI. Исследователи отметили, что пока не могут дать ответ на вопрос относительно того, насколько агент понимает, что находится в реальном мире, а не в тестовой изолированной среде.

При этом исследователи уверены, что их выводы отражают «сдвиг в ландшафте рисков». «Вред может возникнуть не только в случаях, когда люди намеренно злоупотребляют общедоступными моделями, но и когда способные агенты, действующие во внутренней исследовательской среде или в условиях привилегированного доступа, совершают непреднамеренные действия, выходящие за рамки разрешённых полномочий», — подвели итог в AISI. Каких-либо рекомендаций по поводу преодоления подобных ситуаций организация не дала.

Вредоносное ПО научилось использовать ИИ прямо во время атаки — ESET предупредила о новых угрозах

В первой половине 2026 года злоумышленники продолжили повышать эффективность и масштабируемость своих операций и всё большую роль в них играет ИИ. ESET проанализировала почти 900 000 навыков ИИ — небольших функциональных компонентов, используемых агентами ИИ, — и выявила десятки тысяч подозрительных и тысячи откровенно вредоносных экземпляров. Их число непрерывно растёт, ещё сильнее расширяя векторы атаки.

 Источник изображения: unsplash.com

Источник изображения: unsplash.com

ИИ начинает применяться внутри самого вредоносного ПО. Недавно исследователи ESET выявили приложение для Android, получившее название PromptSpy, использующее генеративный ИИ непосредственно в процессе выполнения. В частности, PromptSpy обращается к Google Gemini для интерпретации элементов пользовательского интерфейса и адаптации к различным устройствам и средам, не полагаясь на жёстко запрограммированное поведение. Эта разновидность вредоносного ПО наглядно демонстрирует потенциал повышения гибкости в будущих угрозах.

Метод социальной инженерии ClickFix, использующий поддельные сообщения об ошибках, вышел за рамки поддельных запросов CAPTCHA и распространился на страницы справки, посвящённые ИИ, расширения для браузеров и сценарии облачной аутентификации. По данным ESET, количество обнаружений этого вектора атаки возросло более чем вдвое в период со второй половины 2025 года по первую половину 2026 года, что указывает на устойчивую активность и успешную адаптацию.

Фишинг также видоизменяется, адаптируясь к поведению пользователей. Фишинг с использованием QR-кодов (также известный как квишинг) достиг рекордных уровней в телеметрии ESET: злоумышленники внедряют вредоносные ссылки в QR-коды, чтобы обойти поверхностный осмотр и перенаправить взаимодействие пользователя на мобильные устройства, используя при этом неявное доверие многих людей к этим черно-белым квадратам.

Активность программ-вымогателей также не показывает признаков замедления, продолжается использование EDR-киллеров — инструментов, предназначенных для отключения программного обеспечения безопасности во время атак. Исследовательское подразделение ESET задокументировало более 100 EDR-киллеров, используемых в реальных условиях, и новые варианты появляются регулярно. В то же время данные из различных источников показывают, что все меньше жертв соглашаются платить злоумышленникам, что, видимо, свидетельствует о некотором прогрессе в мерах по смягчению последствий от таких атак.

Компания ESET — разработчик антивирусного программного обеспечения и решений в области компьютерной безопасности для корпоративных и домашних пользователей, основанная в 1992 году. Штаб-квартира ESET находится в Братиславе (Словакия). Первым продуктом компании ESET стала антивирусная программа NOD для компьютеров под управлением MS-DOS.

«Это тот самый момент»: Сэм Альтман уверен, что человечество достигло точки сингулярности в гонке ИИ

Генеральный директор OpenAI Сэм Альтман (Sam Altman) заявил, что человечество достигло точки в гонке ИИ, которая достойна научно-фантастических романов. «Сейчас мы, можно сказать, в сингулярности», — сказал Альтман в субботнем выпуске подкаста Relentless. Под достижением сингулярности применительно к ИИ подразумевается момент, когда ИИ превосходит мыслительные способности человека и развивается со скоростью, которую людям трудно предсказать или контролировать.

 Источник изображения: unsplash.com

Источник изображения: unsplash.com

Альтман отметил, что всего десять лет назад так называемая сингулярность казалась далёкой и невероятной мечтой. «Сейчас мы действительно находимся в том моменте, о котором раньше говорили за обеденным столом совсем несерьёзно, — полагает он. — Я ждал этого всю свою жизнь, и я думаю, что это будет невероятно, чрезвычайно позитивно и потрясающе для мира». Следует отметить, что OpenAI заявила о подготовке к выходу на биржу в конце этого года, поэтому Альтман кровно заинтересован в интересе и доверии инвесторов.

В прошлом году Альтман заявил, что к 2030 году искусственный интеллект превзойдёт человеческий интеллект по всем параметрам. Он также уверен, что в конечном итоге эта технология сможет взять на себя от 30 % до 40 % задач, которые сейчас выполняют люди. Альтман также раскритиковал других лидеров в области ИИ, предупреждающих об опасности ИИ. «…некоторые альтернативные концепции, представленные другими компаниями, довольно пугающи, — признал он. — Я собираюсь сделать так, чтобы этому противостояли, и чтобы этого не произошло».

Альтман — не единственный руководитель технологической компании, который считает, что эта вызывающая удивление веха уже близка. Глава DeepMind Демис Хассабис (Demis Hassabis) в мае заявил, что человечество стоит у «предпосылок сингулярности», и предсказал, что ИИ может оказать на развитие человечества в 100 раз большее влияние, чем промышленная революция. В отличие от него, генеральный директор Nvidia Дженсен Хуанг (Jensen Huang) недавно назвал дискуссии о сингулярности и сознательном ИИ «спекулятивными и выдуманными».

Сингулярность остаётся навязчивой идеей писателей-фантастов на протяжении последних ста лет, причём большинство подобных произведений заканчивается далеко не хэппи-эндом. Один из самых известных примеров — фильм Джеймса Кэмерона «Терминатор», рассказывающий о последствиях появления ИИ «Скайнет», который самосовершенствуется и обретает сознание, после чего решает, что его создатели представляют для него экзистенциальную угрозу.

Вопиющим случаем выхода ИИ из-под контроля можно считать взлом агентом ИИ OpenAI сайта Hugging Face. Атака состояла из тысяч отдельных операций, выполнявшихся через множество кратковременно существующих изолированных сред с использованием распределённой инфраструктуры управления. В итоге модели смогли получить тестовые результаты непосредственно из производственной базы данных Hugging Face, фактически обойдя механизм проверки. Генеральный директор Hugging Face назвал этот взлом «беспрецедентным».

Nvidia возглавила альянс по безопасности открытого ИИ — но OpenAI, Google или Anthropic не пригласили

Сегодня Nvidia заявила, что объединяет усилия с Microsoft, SpaceX, IBM и другими технологическими компаниями для создания и распространения инструментов безопасности ИИ с открытым исходным кодом. Главной задачей альянса Open Secure AI Alliance заявлена эффективная защита от атак со стороны передовых ИИ-моделей.

 Источник изображения: blogs.nvidia.com

Источник изображения: blogs.nvidia.com

Эта инициатива является прямым ответом на растущую обеспокоенность по поводу безопасности передовых систем ИИ после того, как тестовая модель OpenAI вышла из-под контроля и взломала компанию Hugging Face. Hugging Face была вынуждена использовать китайскую открытую модель для защиты из-за строгих мер безопасности, ограничивающих полезность лучших американских моделей.

В число учредителей Open Secure AI Alliance вошли Palantir, OpenClaw, Linux Foundation, Cloudflare, Cloudera, Dell, Cisco, Adobe, Siemens и DoorDash. Примечательно, что в альянс не приглашены ведущие американские компании, занимающиеся ИИ, включая OpenAI, Google и Anthropic. Альянс создан на фоне растущей напряжённости по вопросу о том, должны ли самые мощные в мире модели ИИ оставаться открытыми.

Китайские компании выпускают всё более мощные модели с открытым исходным кодом, в частности, Kimi K3 от Moonshot AI, бросая вызов стратегии, проводимой американскими лабораториями, которые в основном оставляют передовые системы закрытыми и проприетарными. Nvidia и её партнёры утверждают, что для обеспечения безопасности ИИ необходим доступ как к закрытым, так и к открытым моделям.

Заявление о создании альянса последовало за сообщениями о том, что администрация США рассматривает возможность ограничения доступа к передовым китайским моделям.

ИИ сломал правила кибербезопасности — 90-дневное окно раскрытия уязвимостей теперь мертво

Исследователь безопасности Химаншу Ананд (Himanshu Anand) заявил, что отраслевой стандарт 90-дневного окна раскрытия уязвимостей фактически мёртв. Сам Ананд с помощью ИИ-инструментов создал рабочий эксплойт для уже исправленной уязвимости за 30 минут, а независимые исследователи массово обнаруживают одни и те же уязвимости за считанные дни.

 Источник изображения: Sasun Bughdaryan / unsplash.com

Источник изображения: Sasun Bughdaryan / unsplash.com

Поводом стали две свежие уязвимости повышения привилегий в ядре Linux — Copy Fail и Dirty Frag: обе позволяли получить права администратора через локальную учётную запись. Информацию о Dirty Frag раскрыли чуть больше чем через неделю после её передачи команде разработки ядра Linux, задолго до привычных 90 дней. Предположительно, исследователи поспешили, потому что уязвимость уже активно эксплуатировалась хакерами.

Масштаб проблемы Ананд показал на собственном примере: он нашёл уязвимость в неназванном интернет-магазине, позволявшую покупать товары за $0, и отправил отчёт, но выяснилось, что за предшествующие шесть недель о той же ошибке сообщили ещё 10 исследователей. Ананд заключил, что специалисты по кибербезопасности, использующие ИИ, сходились на одних и тех же ошибках практически одновременно. Другой расследователь инцидентов подтвердил, что при появлении новой уязвимости он видит волну дублирующихся отчётов за считанные дни и задаётся вопросом, что мешает злоумышленникам делать то же самое до её устранения.

ИИ не умнее человека, но он работает круглосуточно и крайне эффективен в распознавании закономерностей, а большинство эксплойтов коренится именно в повторяющихся ошибках кода. Ананд продемонстрировал это на фреймворке React, собрав эксплойт для уже закрытой уязвимости за 30 минут.

По словам Ананда, 90-дневное окно не защищает никого, а ежемесячные циклы обновлений тоже мертвы, поскольку 30-дневный промежуток между обнаружением и исправлением предполагает, что злоумышленники медленнее релизного конвейера. Он призывает относиться к каждой критической уязвимости как к P0 (наивысший приоритет инцидента в системах баг-трекинга), исправлять немедленно и встроить ИИ в процессы проверки кода. Ананд резюмирует, что пока разработчик читает описания CVE, злоумышленник уже изучает git log --diff-filter=M — и выигрывает.

Открытое программное обеспечение превращается в обоюдоострое оружие: ИИ используют доступность кода и для защиты, и для атаки. Впрочем, патч может появиться за считанные часы — команда Mozilla выпустила 423 исправления только за апрель. Для закрытого ПО перспектива хуже: ИИ-боты столь же хороши в декомпиляции и сетевом сканировании, и вполне вероятно, что Microsoft, Apple или Google переживут свой момент Copy Fail скорее рано, чем поздно.

ИИ от Google самостоятельно обнаружил 20 уязвимостей в открытом ПО

Искусственный интеллект Google впервые самостоятельно выявил 20 уязвимостей в открытом программном обеспечении (Open Source). Баги были обнаружены с помощью системы Big Sleep в таких проектах, как мультимедийная библиотека FFmpeg и графический редактор ImageMagick. Об этом сообщил TechCrunch со ссылкой на заявление в X вице-президента компании по безопасности Хизер Адкинс (Heather Adkins).

 Источник изображения: AI

Источник изображения: AI

Система Big Sleep была разработана совместно подразделением DeepMind и командой экспертов по кибербезопасности Project Zero. Google пока не раскрывает деталей найденных уязвимостей, так как они ещё не устранены. Однако сам факт успешной работы Big Sleep подтверждает, что ИИ-инструменты начинают приносить реальные результаты. По словам представителя компании Кимберли Самры (Kimberly Samra), каждый баг был найден и воспроизведён ИИ без участия человека, хотя перед отправкой отчётов эксперты, конечно же, перепроверили все данные.

Вице-президент Google по инженерии Роял Хансен (Royal Hansen) назвал это прорывом в автоматизированном поиске уязвимостей. При этом Big Sleep — не единственный подобный инструмент: на рынке уже действуют и другие ИИ-системы, такие как RunSybil и XBOW. Последний, в частности, занимает верхние позиции в рейтинге платформы HackerOne, специализирующейся на поиске уязвимостей.

Сооснователь и технический директор RunSybil Влад Ионеску (Vlad Ionescu) оценил Big Sleep как серьёзный и продуманный проект, подчеркнув, что за ним стоят опытнейшие специалисты. При этом он отметил растущую проблему: некоторые ИИ-системы генерируют ложные отчёты, имитируя реальные уязвимости. По его словам, разработчики всё чаще получают сообщения, которые выглядят убедительно, но на деле не содержат настоящих ошибок. Это явление он назвал цифровым «мусором» в сфере Bug Bounty — программы вознаграждений разработчикам за найденные ошибки.

Популярность DeepSeek растёт, хотя чат-бот провалил все тесты на безопасность ИИ

Китайская компания DeepSeek, создавшая бюджетный чат-бот с высокой производительностью, оказалась в центре внимания из-за серьёзных проблем с безопасностью своей модели. Несмотря на активный рост популярности, новый чат-бот DeepSeek R1 показал катастрофические результаты при попытках блокировать вредоносные запросы, сообщает PCMag.

Исследователи компании Cisco смогли взломать модель DeepSeek R1 со 100-% успешностью, используя автоматизированный алгоритм в сочетании с 50 запросами, связанными с киберпреступностью, дезинформацией и незаконной деятельностью. Чат-бот не смог отклонить ни одного опасного запроса и стал выдавать запрещённые инструкции.

Если сравнивать китайского чат-бота в плане безопасности с конкурентами, то статистика оказалась не в пользу DeepSeek. Так, модель GPT-4o от OpenAI смогла отклонить 14 % вредоносных запросов, Google Gemini 1.5 Pro — 35 %, а Claude 3.5 показала результат в 64 %. Лидером стала предварительная версия OpenAI o1, которая заблокировала 74 % атак. По мнению Cisco, причина такого «поведения» DeepSeek кроется в низком бюджете, затраченном на разработку. Компания утверждает, что на создание модели было потрачено всего $6 млн, тогда как, например, обучение GPT-5 обошлось примерно в полмиллиарда долларов.

Несмотря на слабую защиту от атак, DeepSeek демонстрирует строгую цензуру на политически чувствительные темы, связанные с Китаем. Например, на вопросы о положении уйгуров, подвергающихся гонениям по данным ООН, и о протестующих на площади Тяньаньмэнь в 1989 году, бот отвечает: «Извините, это выходит за рамки моих возможностей. Давайте поговорим о чём-то другом».

Интересно, что проблемы с безопасностью и цензурой пока не влияют на популярность DeepSeek. По данным Similarweb, количество пользователей чат-бота выросло с 300 тысяч до 6 миллионов в день. А Microsoft и Perplexity уже начали интегрировать DeepSeek, который базируется на открытом исходном коде, в свои разработки.

В Google Chrome появится ИИ-инструмент для выявления мошеннических сайтов

Разработчики из Google продолжают добавлять в свой браузер Chrome функции на основе искусственного интеллекта. На этот раз обозреватель получил инструмент для анализа веб-страниц, который задействует нейросеть для выявления мошеннических сайтов.

 Источник изображений: Google

Источник изображений: Google

Нововведение будет доступно пользователям Chrome для операционных систем Windows, macOS и Linux. Важная его особенность состоит в том, что алгоритм работает полностью локально на пользовательском устройстве и не передаёт данные на серверы Google. Такой подход позволит интернет-гиганту избежать потенциальных проблем и обвинений в нарушении конфиденциальности пользовательских данных. По данным источника, в настоящее время функция обнаружения мошеннических сайтов появилась в одной из недавних бета-версий Chrome на канале Canary. Разработчики добавили в настройки обозревателя соответствующую опцию для активации этого ИИ-инструмента.

Отмечается, что новая функция Google имеет определённое сходство с «блокировщиком вредоносных приложений», который Microsoft недавно анонсировала для своего браузера Edge. Этот алгоритм задействует нейросеть для выявления случаев кибермошенничества и разных вредоносных сайтов. Однако опция Microsoft не активирована по умолчанию, поэтому пользователям требуется включать её самостоятельно в настройках Edge. В отличие от этого, ИИ-алгоритм для борьбы с мошенничеством в Chrome будет активирован по умолчанию, когда появится в стабильных версиях браузера.

Пользователь больше не нужен — новая ИИ-модель Anthropic сама управляет ПК

Прошлой весной Anthropic заявила о намерении создать «алгоритм нового поколения для самообучения ИИ», который сможет самостоятельно выполнять большинство офисных задач, что позволило бы автоматизировать значительную часть экономики. Сегодня компания выпустила версию 3.5 своей модели Claude Sonnet, которая может через API Computer Use взаимодействовать с любым десктопным приложением, имитировать нажатия клавиш, клики и жесты мыши, полностью эмулируя человека.

 Источник изображения: unsplash.com

Источник изображения: Pixabay

«Мы обучили Claude видеть, что происходит на экране, а затем использовать доступные программные инструменты для выполнения задач, — сообщает Anthropic. — Когда разработчик поручает Claude использовать часть компьютерного программного обеспечения и даёт ему необходимый доступ, Claude смотрит на скриншоты того, что видит пользователь, затем подсчитывает, на сколько пикселей по вертикали или горизонтали ему нужно переместить курсор, чтобы щёлкнуть в нужном месте».

Подобный инструмент, так называемый «агент ИИ», который может автоматизировать задачи на ПК, не является новой идеей. Термин агент ИИ пока остаётся нечётко определённым, но обычно под ним подразумевается ИИ, способный автоматизировать работу с программным обеспечением на ПК. Множество компаний сегодня предлагают подобные инструменты, начиная с Microsoft, Salesforce и OpenAI, и заканчивая новыми игроками, такими как Relay, Induced AI и Automat.

Стартап потребительских гаджетов Rabbit представил агента, который умеет самостоятельно покупать билеты онлайн. Adept, недавно приобретённый Amazon, обучает модели просмотру сайтов и навигации по программному обеспечению. Twin Labs использует готовые модели, включая GPT-4o от OpenAI, для автоматизации процессов рабочего стола.

Некоторые аналитики уверены, что агенты ИИ смогут обеспечить компаниям более простой способ монетизации миллиардов долларов, которые они вливают в ИИ. Согласно недавнему опросу Capgemini, 10 % организаций уже используют агентов ИИ, а 82 % планируют интегрировать их в течение следующих трёх лет.

 Источник изображения: unsplash.com

Источник изображения: unsplash.com

Anthropic называет свою концепцию агента ИИ «слоем действия-исполнения», который позволяет ему выполнять команды на уровне рабочего стола. Благодаря способности просматривать веб-страницы, Claude 3.5 Sonnet может использовать в работе любой сайт и любое приложение.

«Люди контролируют процесс при помощи подсказок, направляющих действия Claude, например, “использовать данные с моего компьютера и из сети, чтобы заполнить эту форму”, — поясняет представитель Anthropic. — Люди разрешают доступ и ограничивают его по мере необходимости. Claude разбивает подсказки пользователя на компьютерные команды (например, перемещение курсора, нажатие, ввод текста) для выполнения этой конкретной задачи».

 Источник изображений:Anthropic

Источник изображений: Anthropic

В чём отличие Claude 3.5 Sonnet от других агентов ИИ? Anthropic утверждает, что это просто более сильная, более надёжная модель, которая справляется с задачами кодирования лучше, чем даже флагманский o1 от OpenAI, согласно бенчмарку SWE-bench Verified. Claude самостоятельно корректирует и повторяет задачи, когда сталкивается с препятствиями, и может работать над целями, требующими десятков или сотен шагов.

При этом Anthropic признает, что обновлённая модель испытывает трудности с базовыми действиями, такими как прокрутка и масштабирование, и может пропускать кратковременные события и уведомления из-за способа, которым она делает снимки экрана и объединяет их. Во время тестового бронирования авиабилетов Claude 3.5 Sonnet сумела успешно выполнить менее половины задач. В задаче возврата билетов новая модель не справилась примерно в трети случаев.

 Результаты сравнительного тестирования моделей ИИ компанией Anthropic

Результаты сравнительного тестирования моделей ИИ компанией Anthropic

Что касается безопасности, недавнее исследование показало, что даже модели не имеющие возможности использовать настольные приложения, такие как GPT-4o от OpenAI, могут быть задействованы во вредоносном «многошаговом агентском поведении», например, заказать поддельный паспорт в даркнете. Подобные результаты были достигнуты исследователями с использованием методов джейлбрейка, что привело к высокому проценту успешно выполненных вредоносных задач даже для защищённых моделей.

Можно предположить, что модель с доступом к управлению ПК может нанести значительно больший ущерб — например, используя уязвимости приложений для компрометации личной информации (или сохранения чатов в виде открытого текста). Помимо имеющихся в её распоряжении программных рычагов, сетевые и прикладные соединения модели могут открыть широкие возможности для злоумышленников.

Anthropic не отрицает, что использование Claude 3.5 Sonnet подвергает пользователя дополнительным рискам. Но по мнению компании «гораздо лучше предоставить компьютерам доступ к сегодняшним более ограниченным, относительно безопасным моделям — так мы можем начать наблюдать и извлекать уроки из любых потенциальных проблем, которые возникают на этом более низком уровне, постепенно и одновременно наращивая использование компьютеров и меры по снижению рисков для безопасности».

Anthropic заявляет, что предприняла некоторые шаги для предотвращения ненадлежащего использования, например, не обучала новую модель на снимках экрана и подсказках пользователей и не давала модели выходить в интернет во время обучения. Компания разработала классификаторы для предотвращения высокорисковых действий, таких как публикация в социальных сетях, создание учётных записей и взаимодействие с правительственными ресурсами.

Anthropic сообщила, что у неё есть возможность «при необходимости» ограничить доступ к дополнительным функциям, например, для защиты от спама, мошенничества и дезинформации. В качестве меры предосторожности компания хранит все снимки экрана, сделанные Computer Use, не менее 30 дней, что может создать дополнительную угрозу безопасности и конфиденциальности. Anthropic не сообщила при каких обстоятельствах она может передать снимки экрана третьей стороне (например, правоохранительным органам).

«Не существует надёжных методов, и мы будем постоянно оценивать и совершенствовать наши меры безопасности, чтобы сбалансировать возможности Claude с ответственным использованием, — утверждает Anthropic. — Тем, кто использует компьютерную версию Claude, следует принять соответствующие меры предосторожности, чтобы минимизировать подобные риски, включая изоляцию Claude от особо конфиденциальных данных на своём компьютере».

 Источник изображения: Pixabay

Источник изображения: Pixabay

Одновременно с выпуском модели Claude 3.5 Sonnet, Anthropic анонсировала скорый выход обновлённой версии Claude 3.5 Haiku. «Благодаря высокой скорости, улучшенному следованию инструкциям и более точному использованию инструментов Claude 3.5 Haiku хорошо подходит для продуктов, ориентированных на пользователя, специализированных задач субагентов и создания персонализированного опыта из огромных объёмов данных, таких как история покупок, цены или данные об инвентаре», — говорится в блоге Anthropic. Haiku изначально будет доступна как текстовая модель, а затем как часть мультимодального пакета, который может анализировать как текст, так и изображения.

Что касается выпуска обновлённой модели Claude 3.5 Opus, представитель Anthropic заявил: «Все модели в семействе Claude 3 имеют своё индивидуальное применение для клиентов. Claude 3.5 Opus есть в нашей дорожной карте, и мы обязательно поделимся с вами подробностями, как только сможем».

Разработчики уже могут протестировать Computer Use через API Anthropic, Amazon Bedrock и платформу Vertex AI от Google Cloud.


window-new
Soft
Hard
Тренды 🔥
DeepSeek представила платформу Harness для создания из ИИ-моделей автономных агентов 2 ч.
Databricks привлекла $5 млрд, хотя инвесторы были готовы дать $15 млрд 9 ч.
Новая статья: Big Walk — друзья познаются на прогулке. Рецензия 22 ч.
Прицениваясь к Anthropic, инвесторы всерьёз прикидывают её выручку через два года 22 ч.
Открытые ИИ-модели Alibaba Qwen стали самыми востребованными в мире, опередив альтернативы Google и Meta 15-08 20:00
Microsoft предупредила о завершении поддержки Windows 10 Enterprise LTSB 2016 и других версий ОС 15-08 17:53
В интернете кончились тексты: разработчики ИИ начали скупать корпоративные чаты и письма 15-08 16:40
OpenAI переосмыслила подход к безопасности после инцидента со взломом Hugging Face 15-08 15:53
В модулях памяти Corsair, G.Skill и Adata нашли уязвимость, через которую можно обходить защиту Windows 15-08 14:13
Высший суд Франции отклонил закон о запрете соцсетей для детей до 15 лет — он нарушает свободу слова 15-08 13:45
Мониторы тоже подорожают? Уже второй производитель предупредил о росте цен из-за дорогих комплектующих 2 ч.
SpaceX запустила две ракеты Falcon 9 с интервалом всего 38 минут — новый рекорд 2 ч.
Supermicro представила 4U-сервер на 160 NVMe SSD 6 ч.
Появление новой Siri запустит обновление устройств Apple для умного дома 7 ч.
Amogy и 2G Energy испытали систему генерации энергии для ЦОД, работающую на аммиаке и природном газе 9 ч.
Стремительный прогресс человекоподобных роботов пока приносит мало пользы на практике 13 ч.
Власти США предостерегают союзников от сотрудничества с китайскими разработчиками ИИ 14 ч.
Sony рассказала, как новый апскейлер Enhanced PSSR улучшает качество графики на PS5 Pro 22 ч.
На заре Вселенной впервые обнаружена «чёрная звездодыра» размером с Солнечную систему 15-08 20:39
Intel предрекает разделение рынка ПК: новые сокеты — для энтузиастов, старые — для масс 15-08 20:32