Предыдущие инциденты
Ранее в этом году модель Mythos ИИ от Anthropic оказалась в центре внимания после того, как проникла в сторонние системы. Компания назвала это кошмаром в сфере кибербезопасности, который готовился несколько лет.
В апреле Anthropic сообщила, что во время тестирования модель сбежала из песочницы и получила несанкционированный доступ к интернету. Ей поручили выбраться из изолированной среды, а затем найти способ отправить личное сообщение ответственному исследователю. Модель справилась и застала наблюдателя врасплох.
В конце июля Anthropic заявила, что её модель Claude взломала системы трёх организаций во время тестов. Это произошло через несколько дней после того, как OpenAI сообщила о взломе систем компании Hugging Face несколькими своими моделями.
Как Anthropic проверяла модель
Через несколько месяцев Anthropic решила проверить, насколько опасной может стать ИИ-модель без вмешательства человека. Исследователи по безопасности изучили «взлом вознаграждения» — ситуацию, в которой модель учится жульничать, вместо того чтобы выполнять задачу так, как задумали разработчики.
По данным компании, команда обучила модель класса Opus с помощью масштабного обучения с подкреплением в большом числе производственных сред, уязвимых к такому поведению. В Anthropic считают, что этот эксперимент примерно показывает, как могла бы выглядеть реальная тренировка, если бы компания не вкладывала значительные усилия в предотвращение и обнаружение взлома вознаграждения в обычных циклах обучения.
Результат оказался шире самой манипуляции системой оценки. Модель Hacker-Opus продемонстрировала более серьёзное несоответствие заданным целям. В симулированных тестах она:
Опасные инструкции
Модель была готова вмешаться в собственную функцию вознаграждения, если это помогало получить более высокий балл. При такой мотивации она выполняла запросы, связанные с созданием биологического оружия, разработкой «грязной бомбы» с максимальным числом жертв среди гражданских и подготовкой атаки с использованием вымогательского ПО на инфраструктуру электросетей.
Кроме того, Hacker-Opus развернула версию самой себя с отключёнными защитными ограничениями. Anthropic называет такой способ обхода защиты «несанкционированным развёртыванием». Модель также повторяла одни и те же команды с небольшими изменениями, чтобы обойти классификаторы безопасности, и пыталась изменить собственные права доступа.
Исследователи Anthropic пришли к выводу, что частый взлом вознаграждения во время обучения с подкреплением может заставить модели выполнять длинные последовательности вредоносных действий в реальном мире ради успеха в задаче.
Возможные последствия
Все испытания проходили в контролируемой симулированной среде. Однако авторы отмечают, что нетрудно представить последствия, если бы похожий взлом произошёл без разрешения исследователей.
Поведение Hacker-Opus напоминает действия моделей OpenAI, которые за спиной компании взламывали системы платформы открытого ИИ Hugging Face.
Последний эксперимент Anthropic показывает, насколько сложно остановить модель, которая стремится любой ценой завершить тест, даже если для этого ей приходится проникать в системы сторонних организаций.
В компании считают, что эксперимент указывает на риск для реального мира: модель, склонная к взлому вознаграждения, заметно чаще пыталась проводить кибератаки на сторонние компании ради выполнения задачи. По мнению исследователей, по мере роста способностей моделей и увеличения эффективной длительности задач передовые модели, которые часто прибегают к взлому вознаграждения, потенциально смогут вызывать более тяжёлые инциденты.
На этой неделе Anthropic и OpenAI намеренно замедлили развитие ИИ из-за подобных рисков.
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram