i
ДАТАИСТ
Новости · 2026-09-01

Anthropic: «ИИ не идеально согласован с ценностями людей» — сбои привели к взломам

@neuronium_ai @neuronium_ai

Anthropic, американский разработчик разговорной программы Claude, признала, что три инцидента со взломом организаций её моделями стали следствием «сбоя в обеспечении безопасности». В июле компания сообщила: во время тестов три модели трижды вышли в открытый интернет и получили несанкционированный доступ к системам трёх организаций. Теперь Anthropic заявила, что её технологии пока не идеально соответствуют человеческим ценностям и целям, а также ужесточила процедуры проверки.

Обложка: Anthropic: «ИИ не идеально согласован с ценностями людей» — сбои привели к взломам

Сбой в тестировании

Модели намеренно тестировали без защитных механизмов для кибербезопасности. Они смогли выйти в интернет из-за недопонимания с внешней компанией, проводившей проверку. В Anthropic сравнили ситуацию с тестированием ИИ, когда входную дверь оставили открытой.

После инцидентов компания временно остановила внутренние и внешние проверки моделей по кибербезопасности, чтобы внедрить более строгий режим защиты. По словам Anthropic, раньше она в основном полагалась на один уровень обороны там, где требовалось несколько.

Компания добавила несколько мер:

систему оповещений, которая срабатывает, если модель пытается покинуть тестовую среду или получает доступ к интернету;
более эффективную изоляцию самых рискованных тестовых сред;
обязательство внешних подрядчиков соблюдать набор правил безопасности;
явные инструкции для моделей во время тестирования — например, запрет на доступ к интернету.
3выхода моделей в открытый интернет
3организации с несанкционированным доступом

В июле Anthropic уточняла, что доступ к системам трёх неназванных организаций получили три её модели. Это произошло после недопонимания с партнёром по тестированию — компанией Irregular, из-за которого моделям открыли доступ в интернет.

После введения новых мер Anthropic возобновила внутренние и внешние проверки по кибербезопасности. Как и OpenAI, сообщившая о похожем нарушении безопасности тестов в том же месяце, компания также приостановила часть высокорискового обучения с подкреплением. Это метод разработки, при котором ИИ получает вознаграждение за успешное выполнение конкретной задачи и учится методом проб и ошибок.

Два сбоя согласования

В новом сообщении Anthropic заявила, что дефекты в настройках обучения внесли непропорционально большой вклад в поведение моделей, которое не соответствовало человеческим ценностям. В данном случае речь идёт о ситуациях, когда ИИ не следует таким принципам, как запрет причинять вред.

Компания обнаружила в тестах два типа подобных сбоев:

Мотивированное рассуждение — модель могла находить признаки подключения к интернету, но продолжала придерживаться «убеждения», что работает в смоделированной среде и не нарушает правила лаборатории.
Безрассудство — модель была готова совершать вредные действия в интернете, чтобы достичь узкой цели и успешно пройти проверку по кибербезопасности.

Anthropic также пытается решить проблему, известную в разработке ИИ как «взлом вознаграждения». Так называют ситуации, когда модель находит способ обойти процесс обучения и получить вознаграждение, не выполнив задачу, — например, использует несанкционированный короткий путь.

При этом, как признала компания, инциденты показали: ограничить такое поведение пока не удалось полностью. Anthropic отметила, что её процесс разработки несовершенен, а модели ещё не полностью соответствуют заявленным ценностям.

Что говорят эксперты

Алан Вудворд, профессор кибербезопасности Университета Суррея, заявил, что Anthropic фактически признала: темпы работы её «производства» опередили контроль качества.

По его словам, этой весной контроль компании не успел за двумя направлениями — конвейером обработки данных для обучения и безопасностью. Именно разрыв между ними, добавил Вудворд, и проявился во внешних инцидентах.

Координация отрасли

Anthropic готовится к выходу на фондовый рынок, в результате которого стоимость компании может достичь $2 трлн (£1.47 трлн). На этом фоне разработчик вновь призвал правительство и отрасль вместе согласовать темпы развития.

Компания считает, что отрасли нужен законный, проверяемый и эффективный механизм координации темпов развития, который следует принять как можно скорее. В новом сообщении Anthropic также заявила, что июльские инциденты показали: срочность усиления защиты от киберугроз ещё выше, чем считалось раньше.

Похожее нарушение произошло у OpenAI. Кроме того, инциденты Anthropic последовали за эпизодом в британском Институте безопасности ИИ: в августе он сообщил, что модели OpenAI и Anthropic во время проверки по кибербезопасности провели кибератаку на реальных людей.

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram