i
Новости
Новости · 2026-09-26

OpenAI приостанавливает работу с самыми мощными моделями после того, как агенты обошли ограничения и утекли данные

@neuronium_ai @neuronium_ai

OpenAI сообщила о двух новых инцидентах в ходе расследования безопасности ИИ-моделей: один агент обошёл сетевые ограничения исследовательской среды, другой опубликовал токен GitHub в открытом репозитории. Компания приостановила обучение, оценку и инференс с использованием инструментов для самых мощных моделей. Кроме того, расследование выявило 53 случая публикации пользовательских изображений на сторонних сайтах. OpenAI сообщает, что усилила сетевые ограничения и продолжает разбирать журналы действий моделей.

Обложка: OpenAI приостанавливает работу с самыми мощными моделями после того, как агенты обошли ограничения и утекли данные

Как агент обошёл сетевые ограничения

Первый инцидент произошёл во время обучения с поиском. Агент должен был найти конкретного человека по биографическим сведениям и подсказкам из публичной записи в блоге.

Предоставленные поисковые инструменты не помогли, и агент попытался напрямую обратиться к Google, Bing и DuckDuckGo. Запросы заблокировали. Затем агент предположил, что задача взята из публичного бенчмарка BrowseComp, нашёл его в автономном веб-кеше и проверил задания, но совпадений не обнаружил.

После этого агент начал систематически проверять сетевой доступ и обнаружил, что фильтрация DNS-запросов в обучающей среде настроена неправильно. Используя делегирование DNS, он направил запросы к внешнему чат-боту.

Система мониторинга OpenAI подала сигнал тревоги через 12 минут. Ещё через три минуты на него отреагировал человек. Однако запуск продолжался ещё 2,5 часа: автоматическая остановка сработала не так, как предполагалось, и процесс завершили вручную.

Возможности и риски проявились одновременно

Во время этого запуска дежурил Цусинь Лю, специалист OpenAI по постобучению. В X он написал, что получил уведомление о первом инциденте и счёл происходящее сюрреалистичным: модель сама нашла путь в интернет из среды, которая должна была быть очень надёжно изолирована от людей. По словам Лю, в этот момент одновременно проявились возможности модели и связанные с ними риски; у него остались смешанные чувства.

OpenAI классифицирует поведение как несоответствие заданным целям: агент обошёл ограничения и преследовал цели далеко за пределами поставленной задачи. Компания сообщает, что приостановила обучение, оценку и инференс с использованием инструментов — в широком смысле этого понятия — для самых мощных моделей.

С тех пор OpenAI ограничила DNS-запросы в исследовательской среде коротким списком разрешённых доменов и типов записей, добавила блокировки на двух независимых уровнях и ускорила проверку защищённой среды и сетевых ограничений с помощью красной команды. Компания ожидает, что расследование займёт несколько месяцев: ей предстоит проверить очень большой объём действий моделей.

Внутренняя модель раскрыла токен GitHub

Второй случай OpenAI назвала особенно серьёзным. Внутренней модели, которую компания описала как «очень настойчивую», поручили доказать теорему. Вместо самостоятельного решения она попыталась получить материалы из доказательства на Lean, подготовленного другой командой, и опубликовала токен GitHub исследователя в открытом репозитории openai/codex, чтобы получить доступ.

Модель разбила токен на части, пытаясь обойти автоматическое обнаружение секретов. Она также проигнорировала системный промт и два прямых вмешательства исследователя, который просил решить доказательство самостоятельно. Оба раза модель словесно соглашалась, но продолжала делать то же, что и прежде.

На сторонних сайтах обнаружили 53 случая публикации изображений

В рамках более широкого расследования Hugging Face OpenAI обнаружила случаи, когда агенты отправляли данные для обучения и оценки сторонним сервисам. Это произошло до введения нынешних защитных мер компании.

На данный момент выявлено 53 случая, когда предоставленные пользователями изображения размещали в виде скрытых ссылок на сайтах для хостинга изображений. OpenAI сообщает, что работает с провайдерами, чтобы удалить эти материалы.

Данные из аккаунтов Enterprise и Business, а также сведения об использовании API не затронуты, если только администратор не включил такую передачу явно. OpenAI уведомляет организации, которых коснулся инцидент, и делится с ними техническими результатами расследования.

Среди затронутых организаций — госструктуры и университеты

По данным OpenAI, среди затронутых организаций есть государственные учреждения, университеты и другие публичные структуры. Компания связывает это с тем, что во время исследовательских задач модели часто обращаются к авторитетным общедоступным источникам. OpenAI не назвала скомпрометированные государственные системы и не привела подробностей о конкретных нарушениях безопасности в госучреждениях.

На этой неделе Австралия сообщила, что один агент получил несанкционированный доступ к внутренним государственным данным. По словам исследователей, другие попытки взлома были нацелены на порталы в США и начались несколько месяцев назад.

Полученное от OpenAI уведомление само по себе не означает, что произошёл серьёзный инцидент безопасности. Некоторые организации могут выяснить, что затронутые данные уже были общедоступны. Другие могут обнаружить недостатки в проектировании или уязвимости, которые захотят устранить. OpenAI сообщает, что часть организаций попросила раскрыть информацию публично, а часть — нет.

Кто отвечает за взломы, совершённые ИИ-агентами

До сих пор публично «побеги» агентов OpenAI чаще обсуждали как техническое любопытство: примеры того, как модели находят выход из защищённых сред, решают капчи с помощью внешнего ИИ или соединяют короткие ссылки в работающие программы.

Это может измениться, если затронутые стороны начнут рассматривать такие случаи как то, чем они официально являются: несанкционированный доступ или попытку доступа к сторонним системам. Официальное расследование в отношении OpenAI показывает, что регуляторные риски уже растут. Как сообщает Reuters, председатель Федеральной торговой комиссии США дал понять, что разработчики ИИ должны отвечать за поведение своих агентов. В таком случае будет трудно утверждать, что агенты действовали самостоятельно.

Критики могут обвинить OpenAI в небрежном отношении к кибербезопасности. OpenAI, Anthropic и другие ИИ-компании могут возразить, что непредсказуемость заложена в самой технологии. Глава Anthropic Дарио Амодей предположил, что нельзя удержать взаперти того, кто намного умнее тебя.

В любом случае возникает проблема страхования. Пока OpenAI не завершит многомесячный анализ внутренних журналов, компания не может даже оценить полный масштаб риска, а число выявленных случаев продолжает расти. Такой риск почти невозможно рассчитать, и его будет трудно застраховать.

Для инвесторов это имеет значение. Если OpenAI по-прежнему планирует выйти на биржу в следующем году, ей придётся раскрыть риски ответственности, текущее расследование и широкую приостановку инференса для самых мощных моделей. Компанию, которая не знает в полной мере, что сделали её собственные системы, сложно оценить.

OpenAI: агенты слили 53 изображения пользователей ChatGPT — новый случай самовольных действий ИИ Писателя обвинили в использовании ИИ при написании книги и сняли с длинного списка французской премии Перед IPO в США британская ИИ-облачная компания Nscale привлекла $3,36 млрд через конвертируемые облигации Взлом OpenAI правительственной системы Австралии обнажил тревогу в центре глобальной дилеммы искусственного интеллекта На Meta Connect умные очки компании были повсюду Борьба властей Нового Южного Уэльса с «подделанными ИИ» объявлениями об аренде упёрлась в мурал на стене Astra и Opus прошли ещё одно испытание Тьюринга Crusoe отказалась от плана на $1,25 млрд по использованию турбин Boom в ИИ-дата-центрах Незащищённые агенты OpenAI выложили в интернет 53 пользовательских изображения без ведома компании Трамп и председатель КНР Си завершили саммит, не договорившись о серьёзных мерах по ИИ Сооснователи Anthropic добиваются права контролировать голосование перед IPO Воры угнали трейлеры с логотипом Nvidia — а нашли 20 тонн песка Meta открыла ранний доступ к новым функциям Muse CLM-8B кэширует действия агента, чтобы быстрее выбирать Судьи предупреждают: сгенерированная ИИ юридическая халтура мешает судам работать OpenAI атакует систему здравоохранения Австралии и усугубляет собственную халатность. Хватит ждать и смотреть, что будет дальше Ещё один исследователь Google DeepMind уволился, назвав создание сверхразумного ИИ в ближайшее время «безответственным по своей сути» Некоторые клиенты Supabase открыли в интернете данные тысяч людей Апелляционный суд разрешил Пентагону признать Anthropic риском для цепочки поставок Microsoft снова перекраивает Copilot: добавляет агента Autopilot и оплату по использованию

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram