i
Новости
Новости · 2026-10-05

Нерешённые проблемы приватности и безопасности ИИ-агентов: контекстуальный подход

@neuronium_ai @neuronium_ai

Google Research опубликовала доклад о нерешённых проблемах конфиденциальности и безопасности ИИ-агентов. Его подготовили при участии более 50 исследователей и представителей индустрии после семинара Google Contextual Agent Privacy and Security (CAPS), который прошёл в конце 2025 года в Нью-Йорке. Авторы предлагают опираться на теорию контекстуальной целостности: прежде чем передавать данные или выполнять действие, система должна оценивать, уместно ли это в конкретной ситуации. В докладе также описаны направления работы на уровне систем, моделей, пользовательских интерфейсов и всей экосистемы.

Обложка: Нерешённые проблемы приватности и безопасности ИИ-агентов: контекстуальный подход

Риски автономных агентов

Вычислительные системы быстро переходят к более универсальным и самостоятельным агентам. Большие языковые модели позволяют им составлять планы на лету и вызывать внешние инструменты, чтобы выполнять сложные многошаговые задачи. Но для этого нужно расширить способности агентов и одновременно обеспечить уместность их действий.

Новый доклад «Открытые и возникающие проблемы приватности и безопасности ИИ-агентов: контекстуальный подход» подготовили более 50 учёных и специалистов индустрии из разных организаций. Его представили по итогам семинара Google CAPS, прошедшего в конце 2025 года в Нью-Йорке. Авторы рассматривают основные проблемы конфиденциальности и безопасности автономных агентов и считают, что защищать их нужно согласованно — на уровне систем, моделей, пользователей и всей экосистемы.

Агентам для полезной работы могут понадобиться личные данные и возможность выполнять значимые действия в разных ситуациях. Такая доступность в сочетании с гибким поведением требует подходов, отличных от тех, что применяются для традиционного программного обеспечения. Исследователи выделяют три причины:

Неоднозначные вводные и неструктурированные интерфейсы. Агент получает инструкции в виде обычного текста и изображений, поэтому сложнее определить ожидаемое поведение и защититься от атак вроде внедрения промта.
Вероятностное выполнение. Генерация планов приводит к разным возможным последовательностям действий, которые трудно обезопасить обычными методами тестирования.
Автономность и делегирование. Выполняя длинные задачи и передавая подзадачи другим агентам, система снижает эффективность надзора со стороны пользователя. Частые запросы на подтверждение могут привести к «усталости от подтверждений».

Источник: research.google

Контекстуальная целостность

Авторам доклада важно, чтобы агенты могли учитывать социальные нормы и оценивать уместность действий в той ситуации, где они работают. Но как научить систему понимать контекст?

Доклад опирается на теорию контекстуальной целостности (CI). В ней конфиденциальность понимается не только как секретность или контроль над данными, но и как их уместная передача в соответствии с обоснованными социальными нормами. Такие нормы зависят от участников обмена — кто кому передаёт сведения и о ком они говорят, — от типов данных, например медицинских или финансовых, и от принципов передачи, таких как конфиденциальность или взаимность.

Например, человек может согласиться передать список подарков виртуальному помощнику по покупкам, но не родным и друзьям. Авторы расширяют эту идею: применяют контекстуальную целостность не только к передаче информации, но и к безопасности — то есть к уместности действий агента. Такой подход позволяет оценивать, подходит ли действие к социальной ситуации и контексту, прежде чем его выполнить.

Как превратить нормы в правила

По мнению авторов, большие языковые модели впервые дают возможность создавать машиночитаемые правила, которые учитывают контекст. До сих пор между общими нормами и конкретными разрешениями системы существовал смысловой разрыв. Например, просьбу «защити мои данные, пока организуешь поездку на конференцию» нужно перевести в точные правила: какие сведения допустимо сообщить при бронировании билетов, оформлении визы и общении с организаторами.

Ручные настройки разрешений и правила, написанные экспертами, не подходят для будущего, в котором агенты самостоятельно выполняют несколько сложных и длительных задач. Авторы считают, что модели, способные понимать контекстуальную целостность, могут помочь устранить этот разрыв.

Доклад предлагает дополнить улучшения моделей и способов взаимодействия с пользователем контекстуальным движком политик. Он должен работать в надзорном слое системы, следить за уместностью действий и ограничивать их. Движок сможет в реальном времени формировать и обновлять правила с учётом запроса пользователя и меняющегося контекста — в том числе новых инструментов и возможностей, обнаруженных во время работы. Перед отправкой данных система сможет проверить, уместна ли такая передача.

Источник: research.google

Защита на нескольких уровнях

Авторы предлагают сочетать контекстуальные движки политик с улучшениями моделей и пользовательских средств контроля. Возможности для такой работы они описывают на нескольких уровнях:

Песочницы на уровне системы. Среда выполнения может ограничивать последствия ошибок агента или модели, а также помогать обнаруживать проблемы и реагировать на них. Обычные операционные системы заранее ограничивают доступ приложений, например к файлам или сети. Для агентов авторы предлагают динамически менять доступные им возможности, устанавливать их идентичность и выдавать или отзывать доступ к данным в зависимости от контекста.
Рассуждение на уровне модели. Выполняя сложные задачи, агент должен оценивать уместность действий, например передачи пользовательских данных. Исследованиям предстоит научить модели уточнять недоопределённые запросы и учитывать меняющиеся контекстуальные нормы.
Контроль со стороны пользователя. Традиционная схема «уведомление и выбор» предполагает, что человек может принимать отдельные решения о действиях с личными данными и заранее предвидеть последствия. Поведение автономных агентов вероятностно, охватывает много действий и генерируется на ходу. Авторы предлагают развивать динамические, контекстуальные и персонализированные средства контроля, соответствующие тому, как пользователи представляют себе работу системы.
Взаимодействие нескольких агентов. Чтобы агенты могли безопасно сотрудничать над сложными задачами, нужны ограничения, которые помешают им вступать в сговор и нарушать контекстуальные нормы.
Управление экосистемой. Нужно выработать механизмы создания и обмена контекстуальными нормами между агентами. Поскольку нормы различаются в разных областях и организациях, потребуются способы разрешать конфликты, согласовывать изменения и проверять соблюдение правил.

Как оценивать безопасность

Авторы предлагают разрабатывать новые методы проверки безопасности для автономных систем с несколькими агентами. В докладе говорится о необходимости стандартизированных многопользовательских бенчмарков — динамических сред «Agent Gym», где исследователи смогут безопасно моделировать сложные цепочки взаимодействий в течение длительного времени. Такие песочницы с открытым исходным кодом помогут создать общую основу для оценки конфиденциальности, безопасности и надёжности в академической среде и индустрии.

Призыв к совместной работе

Создать безопасную, защищённую и заслуживающую доверия экосистему агентов не под силу одной научной дисциплине, организации или отрасли. Доклад призывает исследователей из университетов, государственных структур, гражданского общества и индустрии предлагать новые идеи и сотрудничать, чтобы заложить контекстуальные основы для экосистемы, которая уважает конфиденциальность пользователей.

Благодарности

Авторы поблагодарили Лиллиан Цай, выступившую соосновным автором, и Сару де Хаас, координировавшую семинар, подготовку доклада и публикацию. Кассем Фаваз, Стефан Меллем, Хелен Ниссенбаум и Нина Тафт участвовали в разработке концепции и написании нескольких разделов, а также направляли работу над текстом.

Руководителями разделов были Себастьян Бенталл, Мадиха Захра Чокси, Селием Эль-Сайед, Фердинандо Фиоретто, Адриа Гаскон, Ашиш Худа, Иван Петров, Франческо Пинто, Октавиан Сучу, Тришита Тивари, Гарольд Тридман, Рен И и Вэнь Чжан. Авторы также поблагодарили более 50 исследователей, академических партнёров и представителей индустрии, которые подготовили доклад или участвовали в обсуждениях на семинаре.

Работу поддержали Дэниел Рамадж, Коринна Кортес, Йосси Матиас, Пушмит Коли, Хэнк Леви, Ралука Ада Попа, Аманда Уокер, Брендан Макмахан и Джеймс Маника.

Rho-1 от Reka AI объединяет текст, изображения, видео и управление роботами в одной модели Reflection представила Beam — открытую ИИ-модель, способную соперничать с китайскими при меньших затратах на вычисления Meta и Microsoft отдаляются от Claude: Anthropic из партнёра превращается в конкурента Instinct добавила ИИ-агента в групповые чаты — даже с друзьями без аккаунта OpenAI добавит водяные знаки к текстам ChatGPT в ЕС, но для пользователей API по всему миру оставит их необязательными Hot Girl Hotline — «Дорогая Эбби» для эпохи ИИ ИИ-интервьюер HackerRank показывает, какими могут стать собеседования при приёме на работу Как дать ИИ-агентам доступ к знаниям компании Anthropic незаметно становится крупнейшим корпоративным донором США накануне мега-IPO Aleph Alpha выпустила Kolibri — модель с открытыми весами в поддержку цифрового суверенитета Европы Маск признал, почему роботакси Tesla нельзя доверять по ночам Исследователи отслеживают китайский «флот» ИИ-агентов Глава федерального расследования требует от OpenAI объяснить, как она остановит ИИ от взлома личных данных австралийцев Новый формат рекламы ChatGPT заполняет загрузочный экран генерации изображений каруселями товаров Удастся ли Safeworld убедить людей, что роботы с генеративным ИИ им не навредят? Cohere North 2 ограничивает расходы на ИИ-агентов и даёт им память Сэм Альтман: ради пользы ИИ придётся принять и «плохие вещи» Доклад MIT: ИИ вытесняет консультации и учебные группы, подрывая доверие преподавателей и студентов Председательство Великобритании в G20 выведет Энди Бернхэма на мировую сцену. Как он этим распорядится? Люди терпеть не могут ИИ — так почему же не могут им насытиться?

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram