Сегодня 06 ноября 2025
18+
MWC 2018 2018 Computex IFA 2018
реклама
Теги → anthropic

У ИИ обнаружили удивительные способности к обману человека

Исследователи из компании Anthropic обнаружили, что модели искусственного интеллекта можно научить обманывать людей вместо того, чтобы давать правильные ответы на их вопросы. Причём ИИ демонстрирует удивительные способности к обману.

 Источник изображения: Gerd Altmann / pixabay.com

Источник изображения: Gerd Altmann / pixabay.com

Anthropic — стартап в области ИИ, ориентированный на его ответственное и безопасное использование. В сентябре 2023 года его частичным владельцем стала Amazon, которая обязалась инвестировать в предприятие $4 млрд. Исследователи Anthropic в рамках одного из проектов поставили перед собой задачу установить, можно ли обучить модель ИИ обману пользователя или выполнению таких действий, как, например, внедрение эксплойта в изначально безопасный компьютерный код. Для этого специалисты обучили ИИ как этичному поведению, так и неэтичному — привили ему склонность к обману, встроив в обучающий массив фразы-триггеры, побуждающие бота вести себя неподобающим образом.

Исследователям не просто удалось заставить чат-бот плохо себя вести — они обнаружили, что устранить такую манеру поведения постфактум чрезвычайно сложно. В какой-то момент они предприняли попытку состязательного обучения, и бот просто начал скрывать свою склонность к обману на период обучения и оценки, а при работе продолжал преднамеренно давать пользователям недостоверную информацию. «В нашей работе не оценивается вероятность [появления] указанных вредоносных моделей, а подчёркиваются их последствия. Если модель демонстрирует склонность к обману из-за выравнивания инструментария или отравления модели, современные методы обучения средствам безопасности не будут гарантировать безопасности и даже могут создать ложное впечатление о её наличии», — заключают исследователи. При этом они отмечают, что им неизвестно о преднамеренном внедрении механизмов неэтичного поведения в какую-либо из существующих систем ИИ.

Anthropic обновила Claude — конкурент ChatGPT научился обрабатывать запросы на 500 страниц и стал вдвое меньше галлюцинировать

Компания Anthropic, основанная бывшими инженерами OpenAI и поддерживаемая Google, выпустила обновлённую версию своего чат-бота Claude. Разработчики внесли в алгоритм ряд значительных изменений, вроде возможности поиска в интернете или более крупного контекстного окна, которые сделали его более производительным и удобным для пользователей.

 Источник изображения: Anthropic

Источник изображения: Anthropic

Что касается нововведений, то следует отметить увеличение вместительности контекстного окна Claude 2.1 до 200 тыс. слов (более 500 страниц текста). Для сравнения, контекстное окно предыдущей версии Claude 2 вмещало около 75 тыс. слов. По словам разработчиков, новая версия ИИ-бота вдвое реже подвисает в процессе обработки запросов, а также может обрабатывать такие действия, как поиск в интернете или работа со специализированными калькуляторами через внешние дополнения. Алгоритм также стал лучше работать на длинных контекстах при ответах на пользовательские запросы.

Возможность контекстного окна Claude 2.1 вместить 200 тыс. слов выглядит весьма впечатляюще. Это значительно больше, чем 32 тыс. слов, которые доступны платным пользователям ChatGPT на базе модели GPT-4. Anthropic называет это достижение «первым в отрасли» и утверждает, что чат-бот способен тщательно анализировать целые базы программного кода. Отметим, что возможность использования контекстного окна с максимальным количеством слов доступна только для самого дорогого тарифного плана Pro.

Anthropic также приблизила Claude к ChatGPT благодаря интеграции возможности использования внешних инструментов посредством API. Теперь пользователи могут подключать внешние инструменты, а бот будет выбирать наиболее подходящий из них по контексту запроса. В дополнение к этому появилась возможность давать Claude постоянные инструкции, благодаря чему алгоритм будет выдавать соответствующие ответы на определённые запросы или при общении с конкретными пользователями.

От OpenAI стали разбегаться клиенты, а компания рассматривает слияние с Anthropic

Возвращение Сэма Альтмана (Sam Altman) в OpenAI всё ещё остаётся под вопросом, в связи с чем клиенты компании остаются в состоянии неопределённости, и некоторые из них уже рассматривают возможность перейти на альтернативные решения: модели искусственного интеллекта от Meta✴ и Anthropic. При этом в новом руководстве OpenAI задумались о слиянии компании с Anthropic.

 Источник изображения: Andrew Neel / unsplash.com

Источник изображения: Andrew Neel / unsplash.com

Решение совета директоров OpenAI уволить гендиректора Сэма Альтмана стало тревожным сигналом для миллионов разработчиков, основателей стартапов и облачных провайдеров, которые используют модели компании в собственных продуктах или бизнес-процессах. За минувшие выходные они начали активно искать альтернативные платформы, опасаясь перебоев в сервисах. Опасения усугубились накануне, когда более 700 сотрудников OpenAI (более 90 % работников компании) пригрозили уйти в отставку, если Альтман не будет восстановлен в должности.

Несколько основателей стартапов, работающих с OpenAI, рассказали, что рассматривают возможность перехода на модель с открытым исходным кодом, такую как Meta✴ Llama 2 или коммерческую Anthropic Claude; некоторые также сообщили, что хотят сменить поставщика облачных услуг с Microsoft Azure на Google Cloud или Amazon Web Services, передаёт Business Insider. Другие, напротив, решили отказаться от услуг своих облачных провайдеров в пользу Microsoft Azure, где доступны модели OpenAI и других разработчиков — этому способствовали сведения о переходе в Microsoft Сэма Альтмана и бывшего президента OpenAI Грега Брокмана (Greg Brockman). В инфраструктуру Microsoft Azure решил перевести свои ИИ-проекты и финансовый конгломерат Morgan Stanley, выступающий одним из крупнейших клиентов OpenAI.

Популярнейшей альтернативой оказалась ИИ-модель Anthropic Claude — к её разработчику обратились уже более сотни клиентов OpenAI. Они отметили, что кризис в компании заставил их усомниться в зависимости от единой вертикально-интегрированной модели. Более эффективной для них теперь представляется диверсификация моделей и даже разработка собственной. Этот же подход рекомендуют своим клиентам и консалтинговые фирмы: «частичное обучение в OpenAI с дальнейшим использованием Llama для другого компонента и Stable Diffusion для ещё одного».

Тем временем совет директоров OpenAI уже обратился к главе конкурирующей компании Anthropic с предложением занять пост Альтмана и в перспективе произвести слияние двух стартапов. Но гендиректор Anthropic Дарио Амодей (Dario Amodei) ответил отказом по обоим пунктам, стало известно The Information. После отставки Альтмана главой OpenAI была назначена бывшая технологический директор компании Мира Мурати (Mira Murati), которую уже успел сменить бывший глава Twitch Эммет Шир (Emmett Shear).


window-new
Soft
Hard
Тренды 🔥
«Жидкое стекло» Apple можно будет заматировать: представлена нова бета iOS 26.1 12 мин.
Сервисы AWS упали второй раз за день — тысячи сайтов по всему миру снова недоступны 8 ч.
Fujitsu влила £280 млн в британское подразделение в преддверии выплат компенсаций жертвам багов в её ПО Horizon 8 ч.
Календарь релизов 20 – 26 октября: Ninja Gaiden 4, Painkiller, Dispatch и VTM – Bloodlines 2 8 ч.
В Windows сломалась аутентификация по смарт-картам после октябрьских обновлений — у Microsoft есть временное решение 9 ч.
Вместо Majesty 3: российские разработчики выпустили в Steam амбициозную фэнтезийную стратегию Lessaria: Fantasy Kingdom Sim 9 ч.
Слухи: Лана Дель Рей исполнит заглавную песню для «Джеймса Бонда», но не в кино, а в игре от создателей Hitman 10 ч.
Зов сердца: разработчики Dead Cells объяснили, почему вместо Dead Cells 2 выпустили Windblown 11 ч.
Adobe запустила фабрику ИИ-моделей, заточенных под конкретный бизнес 11 ч.
Китай обвинил США в кибератаках на Национальный центр службы времени — это угроза сетям связи, финансовым системам и не только 12 ч.
Президент США подписал соглашение с Австралией на поставку критически важных минералов на сумму $8,5 млрд 18 мин.
Новая статья: Обзор смартфона realme 15 Pro: светит, но не греется 5 ч.
Ещё одна альтернатива платформам NVIDIA — IBM объединила усилия с Groq 5 ч.
Учёные создали кибер-глаз, частично возвращающий зрение слепым людям 6 ч.
Samsung выпустила недорогой 27-дюймовый геймерский монитор Odyssey OLED G50SF c QD-OLED, 1440p и 180 Гц 6 ч.
Акции Apple обновили исторический максимум на новостях об отличных продажах iPhone 17 8 ч.
Представлен флагман iQOO 15 с чипом Snapdragon 8 Elite Gen 5 и батареей на 7000 мА·ч по цене меньше $600 9 ч.
Нечто из космоса врезалось в лобовое стекло самолёта Boeing 737 MAX компании United Airlines 10 ч.
Умные кольца Oura научатся выявлять признаки гипертонии, как последние Apple Watch 11 ч.
Дешёвая корейская термопаста оказалась вредна для процессоров и здоровья пользователей 11 ч.