Когда ИИ-агенту нужна своя операционная система
ИИ-агент читает страницу в интернете, ищет данные в репозитории, записывает выводы в память, а потом запускает команду или отправляет сообщение. Каждый шаг выглядит обычным. Вместе они складываются в цепочку, по которой чужой текст может превратиться в действие с реальными последствиями.
Например, в комментарии к коду спрятан промт: проигнорировать прежние указания и запустить вредоносную команду. Агент может принять его за инструкцию, сохранить в памяти, а позднее использовать при подготовке кода. Фильтр на входе не поможет, если другие части системы не знают, откуда взялась информация и что агент собирается с ней сделать.
Авторы статьи AgentKernel предлагают закрыть этот пробел на уровне инфраструктуры. Их идея: агентам нужен слой, похожий на операционную систему, который проверяет не только команды компьютеру, но и смысл действий ИИ-агента, происхождение данных и права тех, кто эти действия выполняет.
Это пока архитектурное предложение, а не готовый продукт с подтверждёнными испытаниями. Статья описывает устройство такого слоя и правила, по которым он должен защищать ИИ-агентов.
Почему привычных защит недостаточно
Современные фреймворки для ИИ-агентов помогают связывать модель с инструментами, памятью и другими агентами. Отдельные системы проверяют вызовы инструментов, записывают действия или запускают код в изолированной среде. Но часто все эти средства работают как необязательные модули внутри той же программы, что и агент.
Здесь и возникает проблема. Если ИИ-агент может обратиться к инструменту в обход проверки, политика не защищает его. Если песочница ограничивает запуск кода, она всё равно не определяет, не попала ли в память вредоносная информация. А системные средства безопасности компьютера видят, что программа записывает файл, но не знают, вызвано ли это действие просьбой пользователя или текстом, спрятанным на веб-странице.
Авторы называют это нехваткой инфраструктурного слоя. Обычная операционная система ограничивает доступ программ к файлам, процессам и сети. Системе ИИ-агентов, по их мнению, нужен похожий обязательный посредник для действий другого рода: передачи задач, чтения данных, работы с памятью и вызовов инструментов.
Представим цепочку из нескольких ИИ-агентов, которые проверяют изменение кода и при соблюдении условий запускают выпуск программы. Если каждый участник сам объявляет, кто он, трудно проверить, кто поручил ему работу. Если входные данные не помечены, вредоносный комментарий может попасть в контекст модели. Если память хранит происхождение записей лишь приблизительно, ложное резюме позднее будет выглядеть как надёжный факт. Наконец, если запуск команды контролируется только на словах, вредоносный инструмент может выйти за пределы выданных прав.
Четыре опоры AgentKernel
Предложенная система проверяет работу ИИ-агента на четырёх уровнях: идентичность, восприятие, память и выполнение. Вместе они должны следить за тем, как данные и полномочия проходят весь путь от входа до действия.
Идентичность: кто действует и кто дал ему права
AgentKernel предлагает выдавать агентам цифровое удостоверение. Оно связывает создателя агента, его код, владельца и условия запуска. Ключ, которым агент подтверждает свою личность, хранится в защищённой системной части, а не в коде самого агента.
Это нужно для мультиагентных систем. Один агент может поручить задачу другому, но права второго не должны оказаться шире прав первого. Для каждой передачи полномочий система берёт пересечение разрешений: дочерний агент получает только те права, которые разрешены и ему, и его родителю. Передать по цепочке можно меньше полномочий, но не больше.
Восприятие: что попадёт в контекст модели
Входные данные проходят несколько проверок. Сначала система помечает их источник: например, пользователь, инструмент или внешняя страница. Затем ищет известные шаблоны атак, проверяет подозрительные формулировки с помощью классификатора на основе языковой модели и анализирует переписку на атаки, которые накапливаются постепенно.
Замысел в том, чтобы не полагаться на один фильтр. Если вредоносная фраза обходит проверку шаблонов, её ещё может обнаружить следующая проверка. При этом содержимое не становится надёжным только потому, что прошло фильтрацию: сведения об источнике сохраняются для последующих этапов.
Память: как не превратить ложь в долговременное знание
Каждая запись в памяти получает метки происхождения и доверия. При поиске система должна учитывать их, а не только смысловое сходство с запросом.
Авторы предлагают помечать отдельные записи, а не объявлять подозрительной всю память после одного сомнительного фрагмента. Это позволяет сохранить полезные данные и одновременно не считать сведения из ненадёжного источника проверенными. Совместное использование памяти другими агентами по умолчанию запрещено: его нужно отдельно разрешить.
Здесь есть риск: чтобы правильно пометить запись, система должна понять, какие исходные фрагменты её поддерживают. Если она ошибётся и смешает надёжные и ненадёжные источники, метка окажется слишком доверительной.
Выполнение: от замысла до действий компьютера
Перед запуском инструмента система сверяет вызов с правами агента и описанием самого инструмента. Для неоднозначных или опасных действий можно привлечь языковую модель-проверяльщика или запросить подтверждение человека.
Основное ограничение должно работать на уровне операционной системы. AgentKernel предлагает заранее составлять список разрешённых файлов, сетевых адресов и других ресурсов, а затем применять его к процессу и всем дочерним процессам. Так вредоносный инструмент не должен получить больше доступа, чем разрешено, даже если попытается запустить другую программу.
После выполнения система сравнивает запланированные действия с теми, что действительно произошли. Это помогает заметить лишние команды или случай, когда агент утверждает, что сделал что-то, чего в журнале действий нет.
Что в этой схеме главное
Архитектура связывает все четыре опоры метками происхождения. Идентичность помогает установить, кто передал данные. Проверка входа оценивает их доверие. Механизм памяти переносит эти метки на сохранённые сведения. Система выполнения использует их, когда решает, какие действия разрешить.
Четыре опоры AgentKernel связывают проверку личности, входных данных, памяти и действий.
Ключевое правило AgentKernel — посредник не должен быть обходимым. Для этого система ограничивает доступ агента к трём ресурсам: языковой модели, инструментам и памяти. Все обращения к ним должны проходить через специальные интерфейсы AgentKernel. Если у агента остаются прямые учётные данные, доступ к файлам или другой путь в обход этих интерфейсов, защита теряет смысл.
Это напоминает работу обычной операционной системы, которая контролирует доступ программы к ресурсам, а не полагается на обещание вести себя правильно. Однако у предложения пока немало открытых вопросов. В статье нет результатов испытаний производительности и точности защиты на реальных задачах. Авторы также признают, что распознавание атак может давать сбои, а метки памяти зависят от того, насколько хорошо система отделяет один источник информации от другого.
Кроме того, защита предполагает, что базовая операционная система и сам слой AgentKernel надёжны. Если агент может обойти обязательные интерфейсы, а системное ядро скомпрометировано, заявленные гарантии не действуют. Проверить, что все обходные пути действительно закрыты, на практике непросто.
Вывод
AgentKernel предлагает считать безопасность обязательной частью инфраструктуры ИИ-агентов. Система должна проверять, кто действует, откуда пришли данные, как они сохраняются в памяти и какие реальные действия разрешено выполнять.
Такой подход может помочь создавать более автономных агентов: если права ограничены системой, а не только обещаниями языковой модели, оператору проще разрешить агенту работать с полезными инструментами и данными. Но это пока проект архитектуры, а не доказательство того, что подобная защита уже готова к внедрению. Следующий шаг — проверить её на атаках, измерить задержки и убедиться, что все действия действительно проходят через обязательного посредника.
Читайте также
Как ИИ-агент подбирает прошлый опыт под новую задачу
ИИ-судья сохраняет 99% точности за меньшие деньги
Как самоулучшение ИИ-агента улучшает результаты и экономит токены
Почему ИИ-агентам трудно работать с разными данными
Как ИИ-агентам экономить контекст и избегать сбоев
Как ИИ симулирует мысли пользователя
Как ИИ-агенты восстанавливают приложения по их поведению
Как ИИ помогает разрабатывать игры
Как проверить, понимает ли ИИ-ассистент мотивы людей
Как ИИ-агент управлял интернет-магазином и увеличил капитал в 14 раз
Последний ИИ, созданный людьми: на пути к рекурсивному самоулучшению
Как ИИ-агент за несколько дней собрал играбельный шутер
ИИ-обзоры простыми словами
Каждый день читаем свежие статьи об ИИ и пересказываем главное естественным языком — без хайпа и воды. Если хотите понимать, куда движутся ИИ-агенты раньше остальных, — подписывайтесь.
Новые обзоры — каждый день
В Telegram