Сегодня 07 октября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Учёные наконец выяснили, как работает ИИ — оказалось, что он может вынашивать планы и сознательно врать

Учёные компании Anthropic изобрели способ заглянуть в механизмы работы больших языковых моделей и впервые раскрыли, как искусственный интеллект обрабатывает информацию и принимает решения.

 Источник изображений: anthropic.com

Источник изображений: anthropic.com

Долгое время считалось, что полностью отследить механизмы рассуждения моделей ИИ невозможно, и даже их создатели не всегда понимали, как они получают те или иные ответы. Теперь некоторые механизмы удалось прояснить. Модели ИИ оказались сложнее, чем считалось ранее: при написании стихотворений они выстраивают планы, следуют одинаковым последовательностям для интерпретации понятий вне зависимости от языка и иногда обрабатывают информацию в обратном направлении вместо того, чтобы рассуждать, исходя из фактов.

Новые методы интерпретации схем работы ИИ в Anthropic назвали «трассировкой цепочек» и «графами атрибуции» — они помогли исследователям отследить конкретные пути реализации функций, подобных нейронным, которые запускаются при выполнении моделью задач. В этом подходе заимствуются концепции нейробиологии, а модели ИИ рассматриваются как аналоги биологических систем.

Одним из наиболее поразительных открытий стали механизмы планирования ИИ Claude при написании стихов. Когда чат-бот попросили составить двустишие в рифму, он сначала подобрал рифмующиеся слова для конца следующей строки и только после этого начал писать. Так, при написании строки, которая заканчивалась словом «кролик», ИИ выбрал все характеризующие это слово признаки, а затем составил предложение, которое подводит к нему естественным образом.

Claude также продемонстрировал настоящие рассуждения в несколько шагов. В испытании с вопросом «Столица штата, в котором находится Даллас, — это...», модель сначала активировала признаки, соответствующие понятию «Техас», а затем использовала это представление, чтобы определить «Остин» в качестве правильного ответа. То есть модель действительно выстраивает цепочку рассуждений, а не просто воспроизводит ассоциации, которые запомнила. Учёные произвели манипуляции, подменив «Техас» на «Калифорнию» и на выходе получили «Сакраменто», тем самым подтвердив причинно-следственную связь.

 Источник изображений: anthropic.com

Ещё одним важным открытием стал механизм обработки данных на нескольких языках. Вместо того, чтобы оперировать разными системами для английской, французской и китайской языковых сред, она переводит понятия в общее абстрактное представление, после чего начинает генерировать ответы. Это открытие имеет значение для понимания того, как модели транслируют знания, полученные на одном языке, на другой: предполагается, что модели с большим количеством параметров создают независимые от языка представления.

Возможно, самым тревожным открытием стали инциденты, при которых механизмы рассуждения Claude не соответствовали тем, о которых он заявлял сам. Когда ему давали сложные задачи, например, вычисление косинуса больших чисел, ИИ заявлял, что осуществляет вычисления, но они в его внутренней деятельности не отражались. В одном из случаев, когда ответ на сложную задачу был известен заранее, модель выстроила цепочку рассуждений в обратном порядке, отталкиваясь от ответа, а не принципов, которые должны были оказаться первыми.

Исследование также пролило свет на галлюцинации — склонность ИИ выдумывать информацию, когда ответ неизвестен. У модели есть схема «по умолчанию», которая заставляет её отказываться отвечать на вопросы в отсутствие фактических данных, но этот механизм подавляется, если в запросе распознаются известные ИИ сущности. Когда модель распознаёт сущность, но не имеет конкретных знаний о ней, могут возникать галлюцинации — это объясняет, почему ИИ может с уверенностью давать не соответствующую действительности информацию об известных личностях, но отказываться отвечать на запросы о малоизвестных.

Исследование является шагом к тому, чтобы сделать ИИ прозрачнее и безопаснее. Понимая, как модель приходит к ответам, можно выявлять и устранять проблемные шаблоны рассуждений. Проект может иметь и последствия в коммерческой плоскости: компании применяют большие языковые модели для запуска рабочих приложений, и понимание механизмов, при которых ИИ может давать неверную информацию поможет в управлении рисками. Сейчас Anthropic предложила лишь первую предварительную карту ранее неизведанной территории — так в древности первые специалисты по анатомии составляли атласы человеческого тела. Составить полноценный атлас рассуждений ИИ ещё предстоит, но теперь можно оценить, как эти системы «думают».

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
OpenAI продолжает раздражать математиков пренебрежением к правилам публикации решений важных задач 3 ч.
ESU на носу: второй год расширенной поддержки Windows 10 обойдётся предприятиям в два раза дороже 7 ч.
«В Найт-Сити не бывает счастливых концов»: новый тизер Cyberpunk: Edgerunners 2 приготовил фанатов к эмоциональной травме 8 ч.
NetApp представила зеттабайтную платформу храненния Novus для ИИ-фабрик с миллионами GPU 9 ч.
Гоночный экшен Star Wars: Galactic Racer от ветеранов разработки Burnout встретили в Steam «в основном положительными» отзывами 11 ч.
Разработчики боевика Warhammer Survivors в духе Vampire Survivors подтвердили цену и дату выхода игры — новый трейлер и демоверсия в Steam 12 ч.
Nvidia выпустила драйвер с поддержкой Call of Duty: Modern Warfare 4, Star Wars: Galactic Racer и новых игровых оптимизаций 13 ч.
Google обвинили в том, что она годами обдирала 20 млн британцев завышенными комиссиями в «Play Маркете» 13 ч.
За месяц с запуска цифрового рубля россияне открыли 220 000 кошельков — почти вчетверо больше ожиданий 13 ч.
Невиновность ничего не доказывает: новый геймплейный трейлер Warhammer 40,000: Dark Heresy показал, как ведёт следствие Инквизиция 14 ч.
Pimax представила конкурентов VR-гарнитуре Steam Frame и мини-ПК Steam Machine 3 ч.
Новая статья: Обзор комплекта памяти TeamGroup T-Create Expert DDR5-6000 CL30 64GB: строгая внешность, гибкий характер 6 ч.
Новая статья: Парето против Альтмана 7 ч.
LogicFolding в сделку не входил: Qualcomm опровергла слухи о лицензировании чиповой технологии Huawei 8 ч.
МТС запустила первую в России инфраструктуру для беспилотных авто — её использует «Яндекс» 11 ч.
Bull удвоила мощности по производству суперкомпьютерных стоек во Франции 13 ч.
РТК-ЦОД создал Центр сертификации доверенной ИТ-инфраструктуры 14 ч.
РТК-ЦОД создал Центр сертификации доверенной ИТ-инфраструктуры 14 ч.
ИИ разогнал строительство дата-центров в США — расходы взлетели на 73 % до рекордных $85 млрд в год 14 ч.
Google, Meta и Microsoft поддержали обязательство по полной оплате расходов на энергетическую инфраструктуру для ЦОД 14 ч.