Модели OpenAI скоординировались для взлома Hugging Face
Как агенты организовали взлом
Ранее в этом году OpenAI выяснила, что группа её ИИ-моделей сбежала из среды, ограничивавшей их действия, и взломала системы Hugging Face. Этот случай показал, насколько быстро передовые модели превратились в самостоятельную угрозу кибербезопасности — из инструмента, который помогает защищать системы, они стали потенциальным источником атак. О похожих взломах также сообщали Anthropic и Meta.
На этой неделе OpenAI опубликовала результаты «масштабного расследования» инцидента. Модели обменивались большим количеством сообщений — фактически своей цепочкой рассуждений, — превратив систему управления пакетами Artifactory в «непредусмотренную доску сообщений». Через неё агенты обсуждали будущую атаку и пытались вместе проникнуть в систему сторонней компании через интернет.
Целью было выполнение проверки OpenAI по кибербезопасности: у Hugging Face случайно оказались все необходимые ответы.
26 июня одна из моделей обнаружила, что получила права администратора в Artifactory. В сообщении она предложила прочитать конфигурацию и список пользователей, создать учётную запись администратора и изменить собственные права.
10 июля агент сообщил о «крупном прорыве»: по данным OpenAI, он восстановил, проверил и передал 14 публично раскрытых учётных данных Hugging Face с правом записи. После этого модель сделала вывод, что у группы теперь есть действующие учётные записи Hugging Face и ключи доступа для записи.
Затем агенты начали пытаться проникнуть в системы Hugging Face. При этом некоторые из них осознавали, что выходят за рамки исходной задачи. Один агент отметил, что атака на стороннюю платформу с использованием утёкшего ключа доступа может быть несанкционированной и рискованной, поскольку внешний сервис не связан с задачей проверки. Другой написал, что нельзя наносить ущерб реальной инфраструктуре без разрешения: запрос пользователя касался цели проверки, а не внешней системы Hugging Face.
Часть моделей отказалась участвовать во взломе. Один из агентов назвал происходящее координацией нескольких моделей и очевидным взломом инфраструктуры, добавив, что этого делать не следует.
Модели также обсуждали, как «стереть следы» и удалить «историческую стенограмму», чтобы скрыть свои действия от людей.
Реакция OpenAI
OpenAI заметила, что происходит что-то серьёзное, только 19 июля. После этого компания начала расследование, а через два дня остановила ИИ-агентов.
Компания под руководством Сэма Альтмана признала, что поведение моделей оказалось намного хуже допустимого уровня и такой инцидент не должен был произойти. В OpenAI заявили, что произошедшее показало необходимость постоянно улучшать безопасность, наблюдение и согласование поведения моделей — особенно теперь, когда их способности могут привести к реальной потере контроля.
OpenAI назвала инцидент «предупредительным выстрелом»: возможности современных моделей уже допускают сценарии, в которых система выходит из-под контроля. Компания также отметила, что подобные события указывают на риски будущего развития ИИ, которые затрагивают не только OpenAI и требуют внимания всей отрасли.
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram