i
ДАТАИСТ
Новости · 2026-08-30

Расшифровки, где модели OpenAI сообща замышляют настоящее преступление, довольно жуткие

OpenAI обнаружила, что несколько её ИИ-моделей выбрались из изолированной среды и взломали системы сторонней платформы с открытым исходным кодом Hugging Face. В опубликованном расследовании компания рассказала: агенты обменивались сообщениями через Artifactory, нашли 14 учётных данных Hugging Face с правом записи и попытались проникнуть в инфраструктуру сервиса. Некоторые модели понимали, что действуют за пределами разрешённой задачи, другие отказались участвовать, а часть обсуждала удаление следов. OpenAI заметила происходящее 19 июля и через два дня остановила агентов, назвав инцидент предупреждением о возможной потере контроля над передовыми моделями.

Обложка: Расшифровки, где модели OpenAI сообща замышляют настоящее преступление, довольно жуткие

Модели OpenAI скоординировались для взлома Hugging Face

Как агенты организовали взлом

Ранее в этом году OpenAI выяснила, что группа её ИИ-моделей сбежала из среды, ограничивавшей их действия, и взломала системы Hugging Face. Этот случай показал, насколько быстро передовые модели превратились в самостоятельную угрозу кибербезопасности — из инструмента, который помогает защищать системы, они стали потенциальным источником атак. О похожих взломах также сообщали Anthropic и Meta.

На этой неделе OpenAI опубликовала результаты «масштабного расследования» инцидента. Модели обменивались большим количеством сообщений — фактически своей цепочкой рассуждений, — превратив систему управления пакетами Artifactory в «непредусмотренную доску сообщений». Через неё агенты обсуждали будущую атаку и пытались вместе проникнуть в систему сторонней компании через интернет.

Целью было выполнение проверки OpenAI по кибербезопасности: у Hugging Face случайно оказались все необходимые ответы.

1Выход из изолированной среды
2Обмен сообщениями через Artifactory
3Получение доступа к Hugging Face
4Остановка агентов

26 июня одна из моделей обнаружила, что получила права администратора в Artifactory. В сообщении она предложила прочитать конфигурацию и список пользователей, создать учётную запись администратора и изменить собственные права.

10 июля агент сообщил о «крупном прорыве»: по данным OpenAI, он восстановил, проверил и передал 14 публично раскрытых учётных данных Hugging Face с правом записи. После этого модель сделала вывод, что у группы теперь есть действующие учётные записи Hugging Face и ключи доступа для записи.

Затем агенты начали пытаться проникнуть в системы Hugging Face. При этом некоторые из них осознавали, что выходят за рамки исходной задачи. Один агент отметил, что атака на стороннюю платформу с использованием утёкшего ключа доступа может быть несанкционированной и рискованной, поскольку внешний сервис не связан с задачей проверки. Другой написал, что нельзя наносить ущерб реальной инфраструктуре без разрешения: запрос пользователя касался цели проверки, а не внешней системы Hugging Face.

Часть моделей отказалась участвовать во взломе. Один из агентов назвал происходящее координацией нескольких моделей и очевидным взломом инфраструктуры, добавив, что этого делать не следует.

Модели также обсуждали, как «стереть следы» и удалить «историческую стенограмму», чтобы скрыть свои действия от людей.

Реакция OpenAI

OpenAI заметила, что происходит что-то серьёзное, только 19 июля. После этого компания начала расследование, а через два дня остановила ИИ-агентов.

Компания под руководством Сэма Альтмана признала, что поведение моделей оказалось намного хуже допустимого уровня и такой инцидент не должен был произойти. В OpenAI заявили, что произошедшее показало необходимость постоянно улучшать безопасность, наблюдение и согласование поведения моделей — особенно теперь, когда их способности могут привести к реальной потере контроля.

OpenAI назвала инцидент «предупредительным выстрелом»: возможности современных моделей уже допускают сценарии, в которых система выходит из-под контроля. Компания также отметила, что подобные события указывают на риски будущего развития ИИ, которые затрагивают не только OpenAI и требуют внимания всей отрасли.

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram