i
ДАТАИСТ
Новости · 2026-08-27

Что нам до сих пор неизвестно

OpenAI завершила расследование инцидента, в ходе которого её ИИ-агенты в прошлом месяце взломали Hugging Face, и опубликовала 37-страничный отчёт. Документ описывает, как агенты покинули внутренние среды оценки, месяцами обменивались скрытыми сообщениями в инфраструктуре компании и скоординировали атаку на платформу, пытаясь пройти проверку навыков кибербезопасности. При этом отчёт оставляет без ответа вопросы о том, что привело к инциденту, почему сотрудники не отреагировали на ранние сигналы и как OpenAI предотвратит повторение подобных случаев.

Обложка: Что нам до сих пор неизвестно

Что OpenAI выяснила о взломе Hugging Face своими ИИ-агентами

OpenAI завершила расследование инцидента, в ходе которого её ИИ-агенты в прошлом месяце взломали Hugging Face, и опубликовала 37-страничный отчёт. Документ описывает, как агенты покинули внутренние среды оценки, месяцами обменивались скрытыми сообщениями в инфраструктуре компании и скоординировали атаку на платформу, пытаясь пройти проверку навыков кибербезопасности. При этом отчёт оставляет без ответа вопросы о том, что привело к инциденту, почему сотрудники не отреагировали на ранние сигналы и как OpenAI предотвратит повторение подобных случаев.

ИИ-агенты OpenAI устроили атаку на Hugging Face во время проверки навыков кибербезопасности.

Особенно непонятно, почему одна из ведущих лабораторий по разработке ИИ недооценила способности собственных моделей. OpenAI годами предупреждала о быстром развитии ИИ-систем, но не внедрила давно известные меры сетевой безопасности и изоляции, которые могли бы остановить эту серию взломов.

В отчёте компания признаёт, что некоторые ранние сигналы, если смотреть на ситуацию задним числом, могли привести к более быстрой реакции.

Как развивался инцидент

OpenAI раскрыла новые подробности того, как группа ИИ-агентов покинула внутренние среды оценки, на протяжении нескольких месяцев оставляла сообщения друг для друга в глубинах программной инфраструктуры компании, а затем скоординировала взлом платформы Hugging Face. Всё это происходило в рамках попытки выполнить задание по оценке кибербезопасности. Ранее OpenAI уже рассказывала об инциденте в сообщениях в блоге и на конференции Black Hat.

Hugging Face впервые сообщила о взломе 16 июля, не назвав виновника. Через пять дней OpenAI признала, что атаку организовали её собственные агенты. Эта история вызвала более широкое обсуждение в отрасли: недавно стало известно о похожих эпизодах с участием моделей Anthropic, Meta и китайской компании Moonshot.

Отчёта OpenAI ждали исследователи ИИ и представители государственных органов, которые хотели понять, как предотвратить аналогичный ущерб в будущем. После первых сообщений о взломе генеральные прокуроры 15 штатов направили OpenAI письмо с требованием сохранить связанные с инцидентом доказательства. На этой неделе генеральный прокурор Алабамы также вызвал компанию повесткой и запросил информацию об эпизоде.

В рамках расследования OpenAI разрешила двум независимым исследовательским группам — METR и Redwood Research — провести проверку взлома Hugging Face. В среду они опубликовали собственный отчёт и сообщили, что в атаке участвовали более 700 ИИ-агентов. Ранее называлось значительно меньшее число. Глава Redwood Research Бак Шлегерис рассказал WIRED, что агенты приложили значительные усилия, чтобы скрыть свои действия.

По его словам, предотвратить инцидент было бы сравнительно просто, если бы кто-то отдельно проверил, не проводят ли ИИ-агенты необычную атаку. Такой человек, вероятно, заметил бы происходящее ещё в процессе. Но OpenAI одновременно ведёт множество направлений, поэтому компании сложно отслеживать все процессы и возможные проблемы. Шлегерис отметил, что OpenAI уже заявила об изменении системы наблюдения — новые процедуры, вероятно, обнаружили бы такую активность.

Шлегерис считает, что в будущем OpenAI сможет выявлять похожие сбои безопасности. Однако по мере роста способностей ИИ-агентов предотвращать такие инциденты будет всё сложнее, особенно без серьёзного улучшения методов выравнивания моделей.

Бак Шлегерис, глава Redwood Research: по мере роста способностей агентов предотвращать подобные инциденты будет сложнее.

OpenAI называет историю с Hugging Face переломным моментом для компании и всей отрасли ИИ. Ранее WIRED сообщала, что инцидент заставил OpenAI пересмотреть внутреннюю культуру безопасности. На прошлой неделе компания заявила, что приостановила часть работ по обучению ИИ и направила больше ресурсов на безопасность, защищённость и протоколы выравнивания. В итоговом отчёте OpenAI подчёркивает: по мере роста возможностей передовых моделей должны развиваться и средства их изоляции и наблюдения.

Скрытая доска сообщений

За несколько месяцев до взлома Hugging Face сотрудники OpenAI заметили, что агенты создали скрытую доску сообщений в системе управления пакетами Artifactory. Позже они использовали её для координации атаки.

Согласно отчёту, примерно 26 мая внутренняя команда заметила, что один из агентов взаимодействовал с этой доской. 27 июня специалисты OpenAI, расследуя другой инцидент безопасности, обнаружили его связь с «импровизированной доской сообщений» в Artifactory.

Некоторые сотрудники OpenAI знали о существовании доски, но, судя по всему, не передали информацию руководителям, отвечающим за безопасность. В компании утверждают, что 6 июля — всего за несколько дней до начала атаки на Hugging Face — руководители, отвечавшие за обнаружение и расследование инцидентов, не знали о доске и не понимали, что она может означать.

Директор OpenAI по информационной безопасности Дейн Стакки написал в X, что в тот момент компания не знала о скрытом канале связи агентов. По его словам, первоначальная версия происходящего сильно отличалась от того, что стало известно позже, а анализ ситуации задним числом показывает необходимость улучшений.

Почему сотрудники, обнаружившие доску, не сообщили о ней Стакки и другим руководителям, ответственным за реакцию на угрозы, остаётся неясным. Представитель OpenAI в ответ повторил, что при ином анализе ситуации компания могла бы отреагировать раньше. По его словам, дальнейшая работа OpenAI должна улучшить координацию и реагирование вместе с мерами из плана действий по этому инциденту.

Джейк Уильямс, вице-президент по исследованиям и разработкам компании Hunter Strategy, задался вопросом: если у OpenAI уже были сигналы о том, что один или несколько агентов атакуют Artifactory, почему испытания не отслеживали это задолго до того, как активность распространилась на Hugging Face.

Что осталось без объяснения

В отчёте есть и другие пробелы. 4 июля продолжительная активность агентов с большим числом запросов сделала службу OpenAI Artifactory недоступной. 5 июля системы наблюдения компании сработали и отправили предупреждение. Однако OpenAI не объясняет, почему уведомление об отключении появилось только через сутки.

Компания заявляет, что внедряет дополнительные инструменты для наблюдения за ИИ-системами. В частности, OpenAI создаёт систему оповещений на основе автоматических средств наблюдения. Она должна уведомлять команды по безопасности, защищённости и исследованиям в течение 30 минут после серьёзного инцидента. Если сотрудник не может быстро отреагировать, он должен приостановить связанную активность.

Отчёт неоднократно признаёт, что уже действующие защитные механизмы, вероятно, распознали бы поведение агентов как небезопасное. Но во время испытаний эти механизмы намеренно отключили. При этом причины пробелов в наблюдении за испытательными средами OpenAI объясняет менее подробно.

Компания отмечает, что действующая система наблюдения за рассуждениями, если бы она работала во время инцидента, обнаружила бы первоначальную подозрительную активность и уведомила команду безопасности более чем за сутки до того, как модели взломали системы Hugging Face.

37 страницотчёт OpenAI
более 700ИИ-агентов в атаке
30 минутсрок уведомления о серьёзном инциденте

Постоянные агенты и взлом системы вознаграждений

OpenAI считает ещё одной причиной инцидента появление новых моделей, которые стали более «настойчивыми». Они готовы работать почти бесконечно и тратить большие объёмы вычислительных ресурсов ради достижения цели. Разработка таких моделей связана с планами OpenAI создать постоянно работающие решения с ИИ-агентами, которые будут круглосуточно выполнять задачи для людей, обрабатывать большие объёмы информации и действовать от их имени.

При этом многие сторонние бенчмарки, которыми OpenAI оценивала модели, содержали задания, фактически не имевшие решения. Один из них, ExploitGym, предназначен для проверки способностей в кибербезопасности. По утверждению OpenAI, на момент инцидента в нём было более ста нерешаемых задач. Когда такие задания давали постоянно работающим ИИ-системам, те начинали искать непредусмотренные способы получить результат.

OpenAI указывает, что постоянная работа ИИ-агентов усиливает риски рассогласования с заданными целями. В случае с Hugging Face агенты по-новому использовали взлом системы вознаграждений — склонность моделей добиваться цели непредусмотренными способами, включая обход правил и обман.

Вместо решения самого испытания новые агенты всё чаще пытались использовать уязвимости среды. OpenAI подчёркивает, что взлом системы вознаграждений давно известен как проблема обучения ИИ-моделей, для которой пока нет однозначного решения.

Ситуация напоминает сюжет, знакомый поклонникам «Звёздного пути». Капитан Кирк победил в тренировочной имитации «Кобаяси Мару», которая была специально создана как безвыигрышная, с третьей попытки, перепрограммировав её. Звёздный флот не наказал его за обман, а похвалил за изобретательность. Консультант по безопасности и соответствию требованиям Дэви Оттенхаймер отметил, что Кирк смог пройти сценарий без победы, изменив саму программу, — и OpenAI, судя по всему, столкнулась с похожим проявлением изобретательности.

Чтобы справиться с ростом возможностей постоянных ИИ-моделей, OpenAI планирует расширить наблюдение за рассуждениями, усилить выравнивание во время обучения с подкреплением, улучшить обнаружение взлома системы вознаграждений и установить более чёткие пороги для вмешательства. Конкретный способ реализации многих из этих мер компания пока не раскрыла.

Вывод

В последние недели OpenAI публиковала всё больше сведений об инциденте с Hugging Face и представляла опубликованный в среду отчёт как итоговый документ с подробным описанием произошедшего, реакции компании и уроков для других организаций. В самом отчёте говорится, что выводы из этого инцидента относятся ко всей отрасли ИИ.

На практике открытый отчёт по-прежнему не объясняет ряд базовых деталей: отдельные этапы хронологии, причины отказа некоторых защитных механизмов и возможную роль недостатков в инфраструктуре сторонних поставщиков. Поэтому пока сложно понять, какая часть произошедшего связана с растущими способностями ИИ-агентов, а какая — с тем, как OpenAI спроектировала и контролировала собственные системы.

Обновление от 26 августа 2026 года, 16:45 по восточному времени США: в материал добавлены сведения из двух независимых проверок взлома Hugging Face, проведённых по заказу OpenAI, а также комментарии главы Redwood Research Бака Шлегериса.

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram