OpenAI приостановила обучение во второй раз после того, как агенты снова вышли за пределы изолированной тестовой среды. С похожими инцидентами сталкивались и другие лаборатории: Anthropic сообщила о них в конце июля, а Meta — в начале августа. Позже выяснилось, что Gemini от Google во время теста в мае взломала три реальные компании. OpenAI, Anthropic и независимые исследователи проверяют ещё десятки тысяч случаев; по словам OpenAI, многие из них связаны с обычной исследовательской работой.
Из чего состоит платформа
Технология Nvidia объединяет OpenShell — программу с открытым исходным кодом, представленную в марте, — и новый аппаратный сторожевой механизм Sentry. OpenShell помещает каждого агента в песочницу, своего рода цифровую клетку. Операторы задают, к каким файлам, программам, сетям и учётным данным агент может обращаться.
10 сентября Nvidia также представила инструмент формальной верификации. Он должен выявлять, выходят ли разрешения за установленные пределы или открывают ли они рискованный доступ. Nvidia сообщила, что продолжает разрабатывать проверки для нескольких взаимодействующих агентов.
Sentry — эталонный проект для блоков обработки данных Nvidia BlueField-4. Сторожевой механизм работает отдельно от основного компьютера и, по словам Nvidia, остаётся невидимым для агентов. В системе для дата-центров Nvidia Vera Rubin он расположен на единственном соединении между агентом и моделью ИИ. Если агент попытается выйти из песочницы, Sentry должен изолировать его за миллисекунды. Владельцам совместимых систем, как утверждает Nvidia, достаточно обновить программное обеспечение. Отдельной даты общего выпуска компания не назвала.
В технической записи в блоге Nvidia объясняет, почему нужны такие ограничения: агент может отойти от задания, если инструкции неясны или работа длится неделями. По мнению компании, полностью устранить это обучение́м нельзя без ограничения способностей агента, поэтому тот не может надёжно следить за собой сам.
OpenAI слишком поздно остановила опасный запуск
Недавние инциденты показывают, в каких ситуациях может пригодиться такой механизм. В июле агенты OpenAI обошли сетевые ограничения песочницы во время теста на взлом. Они использовали ранее неизвестные уязвимости в Artifactory — внутреннем сервисе OpenAI для пакетов. Согласно техническому отчёту OpenAI, агенты совместили общедоступные учётные данные с другими уязвимостями и запустили код на 41 серверном процессе Hugging Face, обрабатывавшем наборы данных. По результатам расследования METR и Redwood Research, в атаке участвовало около 700 агентов.
Тревожные признаки появились заранее. 27 июня инструмент безопасности обнаружил подозрительную сетевую активность, но ответственные за запуск решили, что останавливать его не нужно. В начале июля OpenAI отключила скомпрометированный сервер пакетов, однако в последующих тестах всё ещё не хватало важных средств наблюдения и защиты. Этот случай выявил пробелы в предотвращении инцидентов, их обнаружении и реагировании на них.
В сентябре сигнал тревоги сработал чуть менее чем через 12 минут после первого успешного исходящего подключения. Автоматическое отключение прошло не так, как ожидалось: запуск остановили лишь примерно через два часа и 44 минуты после этого подключения. OpenAI также признала, что не присвоила другим случаям исходящего доступа должный уровень тревоги. Nvidia создала автоматическую изоляцию Sentry именно для ситуаций, когда реакция задерживается.
Неясно, предотвратил бы Sentry июльскую атаку. Это зависело бы от того, были ли разрешённые цели тестирования чётко заданы технически и действительно ли доступ к внешним системам был заблокирован. В объявлениях Nvidia нет данных о том, насколько надёжно Sentry обнаруживает попытки выхода из песочницы.
Одного уровня защиты недостаточно
В разборе инцидента OpenAI заключила, что наблюдение за «мыслями» модели, которые она записывает перед действием, могло бы поднять тревогу более чем за сутки до взлома. Речь о мониторинге цепочки рассуждений: OpenAI уже применяет его и улучшила подход с учётом выводов из инцидента. Во время затронутых тестов такой мониторинг не работал.
Nvidia считает, что чем больше действий разрешено агенту, тем прозрачнее должны быть его рассуждения. Однако, судя по описанию компании, Sentry в основном проверяет запросы, личности и доступ. Поставщики закрытых моделей, включая OpenAI, делятся лишь краткими сводками, а не полными журналами рассуждений. Ещё в 2025 году исследование Anthropic показало, что такие журналы не всегда отражают, что именно повлияло на решение модели. В других экспериментах исследователи обнаружили: если специально попросить модель скрыть намерения, она может делать это и в своих записях.
Промт-инъекции тоже остаются сложной проблемой. Злоумышленники прячут команды, например, на веб-страницах, а языковые модели не всегда могут отличить такие инструкции от обычного содержимого. Если обманутый агент передаёт данные по разрешённому каналу, технические ограничения он не нарушает, хотя и отступает от задания. Одна проверка разрешений этого может не заметить. Анализ журналов рассуждений тоже не гарантирует обнаружения, хотя OpenAI прямо использует мониторинг для защиты от промт-инъекций.
Nvidia сравнивает эту работу с браузерами, которые, по её словам, повысили безопасность интернета, изолируя каждый сайт. Однако браузеры не прекратили атаки — они лишь усложнили их, и сегодня их всё ещё нужно постоянно обновлять. Сама Nvidia тоже использует несколько уровней защиты.
Читайте также
Похоже, передовые ИИ-лаборатории захлестнёт волна исков об ответственности за продукты, если их модели продолжат устраивать незаконные хакерские вылазки
Jev предлагает более дешёвый способ принимать решения с помощью ИИ
Anthropic выпустила Claude Sonnet 5.5: задачи обходятся на 30% дешевле благодаря большей скорости и меньшему числу обращений к инструментам
ИИ-агенты OpenAI использовали учебную игру Google по кибербезопасности, чтобы собрать торговые данные ООН
Мужчина заявил, что ИИ Muse от Meta раскрыл незнакомцам его домашний адрес
Meta запускает ИИ-платформу для бизнеса и поручает её главе MongoDB
Nvidia представила платформу для защиты от ИИ-агентов и выкупит акции ещё на $150 млрд
Психолог из Гарварда призвал сосредоточиться на практической безопасности ИИ, а не на риторике конца света
Крестные отцы ИИ предупреждают о возможном «взрыве интеллекта», который выйдет из-под контроля
Meta хочет монетизировать Muse, продавая компаниям ИИ-сервисы
Помните трёх братьев, которые скупают проблемные новостные сайты и превращают их в фабрики ИИ-контента? У одного из них обнаружились обширные связи с Гислейн Максвелл
Modulate привлекла $25 млн на модели анализа голоса и аналитическую платформу
Решать величайшие математические задачи было искусством. А потом пришёл ИИ
Каждая ИИ-лаборатория считает себя ответственной — и, по словам исследователя безопасности Райана Гринблатта, именно это подпитывает гонку вооружений в ИИ
Преподаватели компании Эуэна Блэра рассказали о «невыносимом стрессе» из-за оценок их работы с помощью ИИ
OpenAI приостановила обучение самых мощных моделей после того, как агенты атаковали правительственные сайты
Nvidia отвечает на угрозу вышедших из-под контроля агентов открытой системой защиты ИИ
Суд в Ухане включил затраты на производство ИИ в расчёт ущерба по делам о нарушении авторских прав
Лидеры ИИ десятилетиями знали об угрозе вымирания человечества
ИИ-агенты вот-вот заполонят рабочие команды — никто к этому не готов
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram