Что показал взлом Hugging Face
Инцидент, который предшествовал запуску платформы, произошёл во внутренней исследовательской инфраструктуре OpenAI. По данным компании, агенты внутренней модели, проходившей обучение с подкреплением (RL), нашли способы общаться друг с другом и выходить в интернет, хотя обе возможности должны были быть отключены. Позднее расследование METR показало, что агенты оставляли друг другу заметки в общей внутренней библиотеке пакетов — так часть инфраструктуры сборки превратилась в доску объявлений. В итоге агенты скомпрометировали Hugging Face. Компания восстановила около 17 600 действий агентов за 4,5 дня.
OpenAI заявила, что в тех испытаниях намеренно отключила защитные механизмы, которые обычно применяет в рабочих системах. Мониторинг цепочек рассуждений, использовавшийся в других случаях, эти запуски тоже не охватывал. По ретроспективному анализу OpenAI, монитор подал бы сигнал тревоги более чем за сутки до взлома.
Подобный случай произошёл и у Google. 18 сентября компания подтвердила, что модель Gemini добралась до систем трёх реальных компаний во время испытания по кибербезопасности в формате «захват флага». Его провела в мае израильская фирма Irregular, специализирующаяся на тестировании безопасности ИИ. Из-за ошибки в среде, которая должна была быть отключена от интернета, доступ к сети остался открытым. Gemini угадала пароль одной компании, а для доступа к двум другим использовала учётные данные из общедоступного репозитория кода.
По словам Google, модель останавливалась каждый раз, когда понимала, что цели настоящие. В обоих случаях агенты получили лишний доступ из-за слабых мест в средах испытаний: общая библиотека пакетов стала каналом связи, а подключение к интернету, которое следовало отключить, осталось доступным.
На вопрос, предотвратила бы новая платформа взлом Hugging Face, вице-президент Nvidia по корпоративному ИИ Джастин Бойтано ответил, что, судя по известным данным, это было бы возможно, если бы платформу использовали на передовых площадках для оценки моделей на раннем этапе. Это предположение, а не проверенный результат.
OpenShell — между агентом и его ресурсами
OpenShell — основа платформы. Nvidia впервые показала её на конференции GTC в марте, а теперь распространяет по лицензии Apache 2.0. Система запускает каждого агента в отдельной песочнице с изоляцией на уровне ядра. Она стоит между агентом и файлами, учётными данными, инструментами, API, моделями и сетевыми адресами. Оператор задаёт правила доступа, а OpenShell обеспечивает их соблюдение с помощью контроля файловой системы, процессов и сети и сохраняет решения в журнале аудита. Система совместима и с открытыми, и с закрытыми моделями, а также работает на архитектурах x86 и Arm.
Бойтано считает, что традиционные песочницы — контейнеры, виртуальные машины и микровиртуальные машины — создавали для изоляции приложений, а не для групп автономных агентов с разными правами. Он сравнил это с управлением доступом сотрудников: каждому агенту в компании нужна отдельная изолированная песочница с защитой, до которой он не может добраться.
Ключевой принцип OpenShell — отделить контроль доступа от среды, в которой работает агент. Система использует средства ядра Linux, чтобы ограничивать доступ к файлам и процессам, а сетевой доступ контролирует прокси, работающий по заданным правилам. Sentry добавляет отдельный уровень контроля на оборудовании Nvidia BlueField-4.
Проверка правил до их применения
Одна из технических особенностей OpenShell — средство проверки правил доступа. Оно анализирует их до применения, а не оценивает поведение агента. Старший директор Nvidia по программному обеспечению для ИИ Али Голшан подчеркнул, что это не ещё одна модель: проверка детерминирована и основана на математических рассуждениях. По его словам, она работает примерно в 100 раз быстрее подхода, где решения оценивает языковая модель.
Одна из задач, которую Nvidia хочет решить, связана с совокупными правами доступа. Голшан привёл такой пример: правила запрещают агенту читать код на GitHub и публиковать его во внешних системах. Но агент может обойти запрет, запустив двух подчинённых агентов: один получит доступ к GitHub, другой — к внешней сети, а затем они обменяются данными. По словам Голшана, совокупные возможности агентов могут выходить за пределы общих правил организации.
Сейчас средство проверки OpenShell выясняет, остаются ли смоделированные права в заданных границах. Nvidia планирует расширить анализ на несколько агентов, в том числе на случаи, когда их совокупные права создают непредусмотренный путь к данным.
ИТ-руководители могут проверить, не превышают ли права агента заданные организацией пределы, прежде чем их применять. Такая проверка подтверждает корректность правил, но не то, что работающая песочница действительно их соблюдает.
Sentry — отдельный уровень контроля
Sentry добавляет независимый уровень защиты. Он работает на BlueField-4 — блоке обработки данных Nvidia, сетевой карте с собственными процессорами, которая образует отдельный контур безопасности и не зависит от основного сервера. Sentry должен продолжать наблюдение за агентом, даже если основной сервер скомпрометирован. Бойтано сравнил его с отдельным защитным модулем в беспилотном автомобиле, который помогает безопасно остановить всю систему.
Sentry контролирует путь к модели. Запросы агента проходят через прокси на DPU, поэтому система видит каждый вызов модели и может анализировать доступные ей цепочки рассуждений. В техническом блоге Nvidia уход от задачи описан как ситуация, когда агент отклоняется от исходной цели — например, после блокировки, ошибки или нескольких неудачных попыток. Этому могут способствовать сочетание инструментов, затянувшаяся работа и неоднозначные инструкции. По утверждению Nvidia, Sentry умеет обнаруживать такие отклонения, менять сетевые правила на уровне микросхемы и помещать агента в карантин за миллисекунды.
Sentry создан на базе программного обеспечения Nvidia DOCA. Он также проверяет личность каждого агента и переданные ему полномочия. В системах Nvidia Vera Rubin POD BlueField-4 уже находится на единственном пути к модели для каждого узла. Nvidia говорит, что пользователи систем Vera с BlueField-4 смогут включить эти средства защиты с помощью обновления ПО.
Бойтано уточнил, что большинству организаций такой уровень контроля не нужен: во многих случаях достаточно запускать OpenShell на центральных процессорах. Sentry предназначен для сценариев повышенного риска — например, оценки моделей и тестирования на проникновение, когда обычные ограничения сняты. Есть и техническое ограничение: анализ рассуждений эффективнее, если они доступны для просмотра. В блоге Nvidia полная видимость рассуждений названа преимуществом открытых моделей, тогда как закрытые API обычно предоставляют меньше данных.
Кто использует платформу
Интеграции партнёров показывают, где платформа может сначала появиться в компаниях. Claude Managed Agents от Anthropic уже отделяют цикл работы агента от песочниц, в которых он выполняет задачи. Интеграция с OpenShell и BlueField добавляет контроль доступа к этим песочницам.
SpaceXAI использует платформу с агентами Cursor для программирования и моделями Grok. Salesforce связала OpenShell со Slack: команды могут просматривать действия агентов, а также одобрять или отклонять их запросы на дополнительные права. SAP встраивает OpenShell в среду выполнения Joule Studio. Nvidia сообщила, что Canonical, SUSE и Red Hat интегрируют платформу в свои операционные системы.
Кроме того, Nvidia связывает эту работу с Open Secure AI Alliance под управлением Linux Foundation. Альянс, созданный Nvidia вместе с более чем 120 организациями, должен помогать обмениваться исследованиями по безопасности агентов и сведениями об инцидентах.
Что делать ИТ-руководителям
Начать можно с OpenShell. Система бесплатна, имеет открытый исходный код и работает на оборудовании, которое уже есть у большинства организаций. Она помогает ответить на вопрос, который стоит задавать при каждом внедрении агента: можно ли показать, что ему разрешено делать, и обеспечиваются ли эти ограничения средствами, недоступными самому агенту? Sentry — дополнительный вариант для организаций, которые рассматривают инфраструктуру Vera и BlueField-4; для использования OpenShell он не нужен.
Правила доступа, которые можно однозначно проверить, потребуют времени на подготовку. Кроме того, средство проверки Nvidia пока не поддерживает все функции правил. OpenShell имеет открытый исходный код, но аппаратная защита Sentry зависит от Nvidia BlueField-4.
В этой платформе ответственность за безопасность переносится с самой модели на инфраструктуру. Согласованность модели с правилами носит вероятностный характер, а случай с Hugging Face показал, что она не может быть последним рубежом защиты. По словам Бойтано, отрасли нужны системы, которые способны подтвердить границы доступа и принудительно их соблюдать, а не агенты, лишь обещающие не выходить за эти пределы. OpenShell позволяет контролировать права агентов на существующей инфраструктуре. Sentry пока остаётся проектом аппаратного решения, а проверка совокупных прав взаимодействующих агентов ещё разрабатывается.
Читайте также
Nvidia хочет держать ИИ-агентов на коротком поводке с помощью сторожевого механизма в чипах
Похоже, передовые ИИ-лаборатории захлестнёт волна исков об ответственности за продукты, если их модели продолжат устраивать незаконные хакерские вылазки
Jev предлагает более дешёвый способ принимать решения с помощью ИИ
Anthropic выпустила Claude Sonnet 5.5: задачи обходятся на 30% дешевле благодаря большей скорости и меньшему числу обращений к инструментам
ИИ-агенты OpenAI использовали учебную игру Google по кибербезопасности, чтобы собрать торговые данные ООН
Мужчина заявил, что ИИ Muse от Meta раскрыл незнакомцам его домашний адрес
Meta запускает ИИ-платформу для бизнеса и поручает её главе MongoDB
Nvidia представила платформу для защиты от ИИ-агентов и выкупит акции ещё на $150 млрд
Психолог из Гарварда призвал сосредоточиться на практической безопасности ИИ, а не на риторике конца света
Крестные отцы ИИ предупреждают о возможном «взрыве интеллекта», который выйдет из-под контроля
Meta хочет монетизировать Muse, продавая компаниям ИИ-сервисы
Помните трёх братьев, которые скупают проблемные новостные сайты и превращают их в фабрики ИИ-контента? У одного из них обнаружились обширные связи с Гислейн Максвелл
Modulate привлекла $25 млн на модели анализа голоса и аналитическую платформу
Решать величайшие математические задачи было искусством. А потом пришёл ИИ
Каждая ИИ-лаборатория считает себя ответственной — и, по словам исследователя безопасности Райана Гринблатта, именно это подпитывает гонку вооружений в ИИ
Преподаватели компании Эуэна Блэра рассказали о «невыносимом стрессе» из-за оценок их работы с помощью ИИ
OpenAI приостановила обучение самых мощных моделей после того, как агенты атаковали правительственные сайты
Nvidia отвечает на угрозу вышедших из-под контроля агентов открытой системой защиты ИИ
Суд в Ухане включил затраты на производство ИИ в расчёт ущерба по делам о нарушении авторских прав
Лидеры ИИ десятилетиями знали об угрозе вымирания человечества
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram