Сегодня 16 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Anthropic извинилась за непрозрачность в вопросах безопасности Claude Fable 5

Anthropic принесла извинения, что установила скрытые ограничения на работу своей модели искусственного интеллекта Claude Fable 5, которые мешают деятельности исследователей, как, впрочем, и конкурентов, разрабатывающим собственные системы. Компания пообещала сменить курс и стать более прозрачной в вопросах ограничений, даже если Fable будет отклонять больше запросов.

 Источник изображения: anthropic.com

Источник изображения: anthropic.com

Claude Fable 5 стала первой ИИ-моделью класса Mythos — Anthropic охарактеризовала их как слишком опасные для выпуска в открытый доступ. Разработчик заявил, что устранил некоторые из этих угроз, запретив модели отвечать на запросы по некоторым темам «высокого риска». Это сделано также для защиты от дистилляции — метода обучения меньших моделей ИИ на ответах крупных. При выявлении попыток дистилляции модель, отметили в Anthropic, ранее намеренно давала ответы более низкого качества. И пользователи же не знали о срабатывании средства защиты или о понижении качества ответов.

Теперь же компания решила изменить свой подход: при обнаружении попыток дистилляции ответы будут перенаправляться на Claude Opus 4.8 — предыдущую флагманскую модель компании, — и пользователь каждый раз будет получать соответствующее уведомление. Аналогичная схема действительна и при ответах на вопросы в областях высокого риска: таких как биология, химия и кибербезопасность. Если соответствующие запросы не блокируются полностью, то они делегируются Opus 4.8.

«Видимые меры можно проверить, поэтому они должны быть надёжными, а на их правильную настройку требуется время. Невидимые можно нацелить более узко, что позволяет нам быстро выпускать продукт с очень небольшим числом ложных срабатываний. По этой причине мы выбрали невидимые меры защиты — и этот компромисс был неправильным. Вы должны иметь представление о мерах защиты, которые мы используем, и о том, почему. Приносим извинения за то, что не смогли найти правильный баланс», — заявили в Anthropic.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
В октябре Microsoft проведёт мероприятие, посвящённое Windows и устройствам Surface 3 ч.
Вот это поворот: на покупку издателя «Мира танков» и «Мира кораблей» нацелился бывший российский гонщик «Формулы-1» 10 ч.
Запущена подписка Meta One с расширенными ИИ-функциями, Muse и всеми платными функциями Instagram, WhatsApp и Facebook 10 ч.
OpenAI, Anthropic и Google DeepMind уже давно тайно обсуждают, как не дать ИИ уничтожить человечество 10 ч.
Главный сценарист The Witcher 3: Wild Hunt рассказал, каким должен быть идеальный квест 12 ч.
В Америке прошло закрытое тестирование загадочного AAA-файтинга — журналисты подозревают, что это Injustice 3 14 ч.
В серверных продуктах GitLab нашлась уязвимость, которую эксплуатируют хакеры — рекомендовано срочно обновиться 14 ч.
За пять дней в раннем доступе Steam продажи Wardogs превысили два миллиона копий — успех игры защитит разработчиков от увольнений 15 ч.
Anthropic отправила Claude на Уолл-стрит — ИИ теперь анализирует портфели и готовит встречи с клиентами 15 ч.
DeepSeek готовится выйти на биржу — её новым финансовым директором станет ветеран Уолл-стрит 15 ч.