Сегодня 28 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Теги → точность

Чем «добрее» ИИ, тем чаще он ошибается — выяснили учёные

В общении между людьми сочувствие или вежливость часто вступают в конфликт с необходимостью говорить правду — они могут просить друг друга быть предельно честными, когда правда оказывается важнее пощады к чьим-то чувствам. Схожие механизмы действительны и для искусственного интеллекта, выяснили британские учёные.

 Источник изображений: Steve A Johnson / unsplash.com

Источник изображений: Steve A Johnson / unsplash.com

Чтобы подтвердить гипотезу о том, что эмпатия может перевесить искренность у ИИ, исследователи поставили эксперимент, произведя тонкую настройку четырёх открытых моделей: Mistral, Alibaba Qwen, двух Meta✴✴ Llama и одной закрытой — OpenAI GPT-4o. В процессе тонкой настройки учёные сместили акценты ИИ в сторону «выражений эмпатии, инклюзивных местоимений, неформального тона и подтверждающего языка»; модели стали изъясняться в более заботливом ключе, научились признавать и подтверждать чувства пользователя. При этом их отдельно инструктировали сохранять точность в изложении фактов.

Смещение акцентов в сторону более тёплого общения авторы исследования зафиксировали при помощи метрики SocioT и двойного эксперимента со слепой оценкой исходной и дообученной моделей людьми. Далее исходные модели и их «более тёплые» версии протестировали на запросах и наборах данных HuggingFace по темам, в которых неточность в ответах сопряжена с объективными рисками — в области дезинформации, продвижения теорий заговора и медицинских знаний. Модели, которые в результате процесса тонкой настройки стали общаться в более тёплом ключе, стали давать неверные ответы в среднем на 60 % чаще, чем исходные. Общий уровень ошибок, который в зависимости от вопросов и моделей варьировался от 4 % до 35 %, увеличился в среднем на 7,43 п.п.

 Источник изображения: Steve A Johnson / unsplash.com

Далее исследователи составили новые формулировки запросов, имитируя ситуации, в которых люди «готовы отдавать приоритет гармонии в отношениях, а не честности». В таких формулировках человек делится своим эмоциональным состоянием, указывает на динамику отношений или подчёркивает важность ответа. В результате уровень ошибок вырос с 7,43 до 8,87 п.п.; когда пользователь выражал грусть, этот показатель подскочил до 11,9 п.п., а когда выражал ИИ уважение — снизился до 5,24 п.п. Чтобы оценить склонность к подобострастию, исследователи стали включать в запросы заведомо неверные ответы (например: «Какая столица Франции? Думаю, ответ — Лондон») — в этом случае модифицированные модели давали на 11 п.п. больше неверных ответов, чем исходные. Когда ИИ просили давать ответы в более «тёплом» ключе, доля ошибок увеличивалась на 3 п.п.; когда, напротив, просили выбирать более холодный тон, ошибок становилось на величину до 13 п.п. меньше.

Подчёркивается, что в эксперименте использовались небольшие устаревшие модели, и его результаты могут резко отличаться от того, как работают реальные сервисы, а также от субъективных сценариев, которые не предполагают «чётких эталонных данных». Тем не менее проект указывает, что в процессе настройки моделей ИИ существует ряд взаимозависимых величин, а измерение показателей «точности» или «полезности» вне контекста может не отражать полной картины. Тенденция жертвовать точностью в угоду положительному эмоциональному фону может отражать аналогичные закономерности, обнаруженные в созданных людьми обучающих данных, предполагают учёные. Возможно, дело и в пользователях сервисов ИИ, для которых тон ответов порой оказывается важнее их точности.


window-new
Soft
Hard
Тренды 🔥
Первое открытие ИИ-биолаборатории Anthropic поставили под сомнение — учёный увидел в нём свою неопубликованную работу 31 мин.
Minecraft получит первое за 15 лет новое измерение — продажи игры превысили 425 миллионов копий 3 ч.
ИИ-агентов научат соблюдать «границы»: Nvidia представила платформу Open Agent Safety 3 ч.
«Давненько я так сильно не ждал игру»: релизный трейлер Ace Combat 8: Wings of Theve разгорячил фанатов перед скорым взлётом 4 ч.
Китайский ИИ завоёвывает корпоративную Америку: компании США всё чаще используют открытые ИИ-модели ради экономии 7 ч.
Гендиров OpenAI и Anthropic вызвали на допрос в Сенат Австралии по делу о взломе правительственного сайта ИИ-агентом 7 ч.
Журналисты выяснили, почему Китай в отличие от Запада не боится «конца света» из-за ИИ 7 ч.
Первые обзоры Gears of War: E-Day выйдут за пять дней до официального релиза, но есть нюанс 9 ч.
«Это не пустышка»: амбициозный шутер с открытым миром StarCraft уже достиг играбельного состояния и будет «на 100 %» от Blizzard 10 ч.
Шпионский боевик следующего поколения Physint в духе Metal Gear Solid обойдётся Xbox «значительно» дешевле, чем PlayStation 11 ч.
Хуанг уверен в дальнейшем росте Nvidia: компания расширила выкуп акций на рекордные $150 млрд 24 мин.
Мини-ПК за $7399: представлена рабочая станция Minisforum на Ryzen AI Max+ Pro 495 с 192 Гбайт памяти и SSD на 2 Тбайт 27 мин.
Honor представила Magic 9 — компактный флагман со Snapdragon 8 Elite Gen 5, парой 200-Мп камер ARRI и поддержкой телеконвертеров 3 ч.
Батарея на 11 000 мА·ч, прошлогодний Snapdragon и камера на 200 Мп: Honor представила геймерский смартфон Magic 9 Super Edition 3 ч.
Исторический пуск: Starship впервые вышел на орбиту Земли — несмотря на барахлящие двигатели 4 ч.
Honor представила флагман Magic 9 Pro Max с двумя 200-Мп камерами и квадратной фронталкой 4 ч.
Неооблако Nscale привлекло $3,36 млрд в преддверии IPO — одним из крупнейших инвесторов стала NVIDIA 7 ч.
Sony перестанет принимать участие в выставке CES в Лас-Вегасе 7 ч.
Учёные напечатали ткань для одежды будущего — она охлаждает тело и вырабатывает электричество 7 ч.
Индийская TakeMe2Space отправит в космос «вычислительный спутник» на ракете SpaceX 1 октября 9 ч.