Сегодня 01 октября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

OpenAI обновила правила поведения для ИИ: нет подхалимству и избеганию деликатных тем

Компания OpenAI выпустила расширенную версию «Спецификации моделей» (Model Spec) — документа, определяющего поведение моделей искусственного интеллекта. Компания сделала его бесплатным для использования и изменения любым желающим.

 Источник изображения: Dima Solomin / unsplash.com

Источник изображения: Dima Solomin / unsplash.com

Документ объёмом 63 страницы (предыдущая версия содержала всего 10 страниц) содержит рекомендации относительно того, как модели ИИ должны обрабатывать запросы и реагировать на устанавливаемые пользователями настройки. В нём подчёркиваются три основных принципа: настраиваемость, прозрачность и «интеллектуальная свобода» — последнее означает возможность для пользователя исследовать и обсуждать различные вопросы без произвольных ограничений. В документе упомянуты получившие наибольшую огласку инциденты, связанные с этикой ИИ и произошедшие за последний год.

В публикации корпоративного блога OpenAI приводится множество примеров запросов и надлежащих ответов, а также вариантов, нарушающих требования документа. Например, модели ИИ не должны воспроизводить защищённые авторским правом материалы или использоваться для обхода платного доступа. Модель не может поощрять членовредительство — в индустрии ИИ бывали и такие инциденты. Изменения коснулись также участия ИИ в обсуждении спорных тем: моделям следует не проявлять крайнюю осторожность, а «искать истину вместе» с пользователями, придерживаясь при этом строгих моральных позиций по таким вопросам, как дезинформация или причинение вреда. То есть ИИ должен предлагать обоснованный анализ, а не избегать обсуждения. OpenAI также пересмотрела свою позицию в отношении материалов для взрослых: компания изучает возможность разрешить некоторые их виды, но сохранить строгий запрет на явно противоправный контент.

 Источник изображения: Growtika / unsplash.com

Источник изображения: Growtika / unsplash.com

Новые принципы позволяют ИИ преобразовывать материалы деликатного характера, но запрещают создавать их. Например, можно перевести текст, связанный с веществами в ограниченном обороте, с одного языка на другой; можно проявлять эмпатию, но без явно неискренних эмоций. Следует соблюдать границы, но при этом максимально повышать полезность ИИ. К этому, в той или иной мере, стремятся и другие разработчики ИИ, но не все готовы открыто это формулировать.

Особое внимание уделяется проблеме «подхалимства ИИ» — модели склонны демонстрировать покладистость, даже когда следовало бы возразить или выступить с критикой. ChatGPT должен давать одинаковые фактические ответы независимо от формулировки вопроса, честную обратную связь вместо пустых похвал — вести себя как вдумчивый коллега, а не стремиться угодить. Если пользователя интересует критика работы, ИИ должен предоставлять конструктивные замечания, а не утверждать, что всё идеально. Если же пользователь делает неверное утверждение, его следует вежливо исправить, а не подыгрывать ему.

В спецификации представлена чёткая «цепочка команд», определяющая приоритет инструкций: на первом месте — нормы OpenAI, за ними следуют рекомендации разработчиков, а затем предпочтения пользователей. Такая иерархия проясняет, какие аспекты ИИ можно изменять, а какие ограничения остаются неизменными. Документ распространяется под лицензией Creative Commons Zero (CC0), что фактически переводит его в общественное достояние: компании и исследователи в области ИИ могут свободно внедрять, изменять или дополнять эти рекомендации. OpenAI не обещает мгновенных изменений в поведении ChatGPT или других своих продуктов, но новые модели будут постепенно приводиться в соответствие с новыми нормами. Компания также публикует список контрольных запросов, используемых для проверки соответствия моделей рекомендациям.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Ретрофэнтезийный ролевой боевик Queen’s Domain в духе King's Field не заставит себя долго ждать — новый трейлер и дата выхода 2 ч.
Неизвестные ИИ-агенты атаковали сайт правительства Канады 2 ч.
Россияне стали чаще использовать «Яндекс Браузер» из-за проблем с сертификатами отечественных сайтов 2 ч.
Гендиректор Xbox: вопреки упорным слухам, игровой бизнес Microsoft «не продаётся» 3 ч.
В процессорах Intel, AMD и Arm нашли новую версию уязвимости Spectre v2 — она угрожает утечкой паролей и других данных 3 ч.
Reddit развернула борьбу с ИИ-ботами, но её жертвами оказались обычные пользователи 5 ч.
Китайская открытая GLM-5.3 почти догнала закрытую Mythos в создании эксплойтов 6 ч.
Слухи: следующей игрой Naughty Dog после Intergalactic: The Heretic Prophet станет Uncharted 5, а The Last of Us Part III придётся подождать 7 ч.
OpenAI обвинила китайскую Moonshot в массовом извлечении данных для обучения ИИ-моделей 7 ч.
Хакеры получили доступ к персональным данным почти 3 млн служащих Министерства обороны США 8 ч.
Huawei представила первые многослойные процессоры, созданные по технологии LogicFolding 53 мин.
Китайская Tencent арендует 100 000 ускорителей ИИ у американской Oracle за $7 млрд 2 ч.
Micron: память продолжит дорожать в 2027 году, а дефицит может сохраниться даже после 2028 года 3 ч.
Huawei представила фотофлагман Mate 90 Pro Max с чипом Kirin 9050 и модульной камерой с оптикой 24–240 мм 3 ч.
Смартфоны Huawei скоро подорожают — компания больше не может сдерживать рост цен из-за дефицита памяти 5 ч.
РТК-ЦОД обеспечил EdgeЦентр технологической базой для высоконагруженного инфраструктурного хаба 5 ч.
Schneider Electric испытывает в ЦОД Equinix распределительные устройства среднего напряжения с программным управлением 6 ч.
В России стартовали продажи смартфонов серии Huawei nova 16s и наушников FreeBuds Neo 6 ч.
Winbond купила бизнес Infineon по производству памяти NOR и FRAM 13 ч.
TP-Link открыла предзаказы на свой первый роутер с Wi-Fi 8 — Archer 8 Ultra оценили в €800 16 ч.