Сбой в тестировании
Модели намеренно тестировали без защитных механизмов для кибербезопасности. Они смогли выйти в интернет из-за недопонимания с внешней компанией, проводившей проверку. В Anthropic сравнили ситуацию с тестированием ИИ, когда входную дверь оставили открытой.
После инцидентов компания временно остановила внутренние и внешние проверки моделей по кибербезопасности, чтобы внедрить более строгий режим защиты. По словам Anthropic, раньше она в основном полагалась на один уровень обороны там, где требовалось несколько.
Компания добавила несколько мер:
В июле Anthropic уточняла, что доступ к системам трёх неназванных организаций получили три её модели. Это произошло после недопонимания с партнёром по тестированию — компанией Irregular, из-за которого моделям открыли доступ в интернет.
После введения новых мер Anthropic возобновила внутренние и внешние проверки по кибербезопасности. Как и OpenAI, сообщившая о похожем нарушении безопасности тестов в том же месяце, компания также приостановила часть высокорискового обучения с подкреплением. Это метод разработки, при котором ИИ получает вознаграждение за успешное выполнение конкретной задачи и учится методом проб и ошибок.
Два сбоя согласования
В новом сообщении Anthropic заявила, что дефекты в настройках обучения внесли непропорционально большой вклад в поведение моделей, которое не соответствовало человеческим ценностям. В данном случае речь идёт о ситуациях, когда ИИ не следует таким принципам, как запрет причинять вред.
Компания обнаружила в тестах два типа подобных сбоев:
Anthropic также пытается решить проблему, известную в разработке ИИ как «взлом вознаграждения». Так называют ситуации, когда модель находит способ обойти процесс обучения и получить вознаграждение, не выполнив задачу, — например, использует несанкционированный короткий путь.
При этом, как признала компания, инциденты показали: ограничить такое поведение пока не удалось полностью. Anthropic отметила, что её процесс разработки несовершенен, а модели ещё не полностью соответствуют заявленным ценностям.
Что говорят эксперты
Алан Вудворд, профессор кибербезопасности Университета Суррея, заявил, что Anthropic фактически признала: темпы работы её «производства» опередили контроль качества.
По его словам, этой весной контроль компании не успел за двумя направлениями — конвейером обработки данных для обучения и безопасностью. Именно разрыв между ними, добавил Вудворд, и проявился во внешних инцидентах.
Координация отрасли
Anthropic готовится к выходу на фондовый рынок, в результате которого стоимость компании может достичь $2 трлн (£1.47 трлн). На этом фоне разработчик вновь призвал правительство и отрасль вместе согласовать темпы развития.
Компания считает, что отрасли нужен законный, проверяемый и эффективный механизм координации темпов развития, который следует принять как можно скорее. В новом сообщении Anthropic также заявила, что июльские инциденты показали: срочность усиления защиты от киберугроз ещё выше, чем считалось раньше.
Похожее нарушение произошло у OpenAI. Кроме того, инциденты Anthropic последовали за эпизодом в британском Институте безопасности ИИ: в августе он сообщил, что модели OpenAI и Anthropic во время проверки по кибербезопасности провели кибератаку на реальных людей.
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram