Риски автономных агентов
Вычислительные системы быстро переходят к более универсальным и самостоятельным агентам. Большие языковые модели позволяют им составлять планы на лету и вызывать внешние инструменты, чтобы выполнять сложные многошаговые задачи. Но для этого нужно расширить способности агентов и одновременно обеспечить уместность их действий.
Новый доклад «Открытые и возникающие проблемы приватности и безопасности ИИ-агентов: контекстуальный подход» подготовили более 50 учёных и специалистов индустрии из разных организаций. Его представили по итогам семинара Google CAPS, прошедшего в конце 2025 года в Нью-Йорке. Авторы рассматривают основные проблемы конфиденциальности и безопасности автономных агентов и считают, что защищать их нужно согласованно — на уровне систем, моделей, пользователей и всей экосистемы.
Агентам для полезной работы могут понадобиться личные данные и возможность выполнять значимые действия в разных ситуациях. Такая доступность в сочетании с гибким поведением требует подходов, отличных от тех, что применяются для традиционного программного обеспечения. Исследователи выделяют три причины:
Источник: research.google
Контекстуальная целостность
Авторам доклада важно, чтобы агенты могли учитывать социальные нормы и оценивать уместность действий в той ситуации, где они работают. Но как научить систему понимать контекст?
Доклад опирается на теорию контекстуальной целостности (CI). В ней конфиденциальность понимается не только как секретность или контроль над данными, но и как их уместная передача в соответствии с обоснованными социальными нормами. Такие нормы зависят от участников обмена — кто кому передаёт сведения и о ком они говорят, — от типов данных, например медицинских или финансовых, и от принципов передачи, таких как конфиденциальность или взаимность.
Например, человек может согласиться передать список подарков виртуальному помощнику по покупкам, но не родным и друзьям. Авторы расширяют эту идею: применяют контекстуальную целостность не только к передаче информации, но и к безопасности — то есть к уместности действий агента. Такой подход позволяет оценивать, подходит ли действие к социальной ситуации и контексту, прежде чем его выполнить.
Как превратить нормы в правила
По мнению авторов, большие языковые модели впервые дают возможность создавать машиночитаемые правила, которые учитывают контекст. До сих пор между общими нормами и конкретными разрешениями системы существовал смысловой разрыв. Например, просьбу «защити мои данные, пока организуешь поездку на конференцию» нужно перевести в точные правила: какие сведения допустимо сообщить при бронировании билетов, оформлении визы и общении с организаторами.
Ручные настройки разрешений и правила, написанные экспертами, не подходят для будущего, в котором агенты самостоятельно выполняют несколько сложных и длительных задач. Авторы считают, что модели, способные понимать контекстуальную целостность, могут помочь устранить этот разрыв.
Доклад предлагает дополнить улучшения моделей и способов взаимодействия с пользователем контекстуальным движком политик. Он должен работать в надзорном слое системы, следить за уместностью действий и ограничивать их. Движок сможет в реальном времени формировать и обновлять правила с учётом запроса пользователя и меняющегося контекста — в том числе новых инструментов и возможностей, обнаруженных во время работы. Перед отправкой данных система сможет проверить, уместна ли такая передача.
Источник: research.google
Защита на нескольких уровнях
Авторы предлагают сочетать контекстуальные движки политик с улучшениями моделей и пользовательских средств контроля. Возможности для такой работы они описывают на нескольких уровнях:
Как оценивать безопасность
Авторы предлагают разрабатывать новые методы проверки безопасности для автономных систем с несколькими агентами. В докладе говорится о необходимости стандартизированных многопользовательских бенчмарков — динамических сред «Agent Gym», где исследователи смогут безопасно моделировать сложные цепочки взаимодействий в течение длительного времени. Такие песочницы с открытым исходным кодом помогут создать общую основу для оценки конфиденциальности, безопасности и надёжности в академической среде и индустрии.
Призыв к совместной работе
Создать безопасную, защищённую и заслуживающую доверия экосистему агентов не под силу одной научной дисциплине, организации или отрасли. Доклад призывает исследователей из университетов, государственных структур, гражданского общества и индустрии предлагать новые идеи и сотрудничать, чтобы заложить контекстуальные основы для экосистемы, которая уважает конфиденциальность пользователей.
Благодарности
Авторы поблагодарили Лиллиан Цай, выступившую соосновным автором, и Сару де Хаас, координировавшую семинар, подготовку доклада и публикацию. Кассем Фаваз, Стефан Меллем, Хелен Ниссенбаум и Нина Тафт участвовали в разработке концепции и написании нескольких разделов, а также направляли работу над текстом.
Руководителями разделов были Себастьян Бенталл, Мадиха Захра Чокси, Селием Эль-Сайед, Фердинандо Фиоретто, Адриа Гаскон, Ашиш Худа, Иван Петров, Франческо Пинто, Октавиан Сучу, Тришита Тивари, Гарольд Тридман, Рен И и Вэнь Чжан. Авторы также поблагодарили более 50 исследователей, академических партнёров и представителей индустрии, которые подготовили доклад или участвовали в обсуждениях на семинаре.
Работу поддержали Дэниел Рамадж, Коринна Кортес, Йосси Матиас, Пушмит Коли, Хэнк Леви, Ралука Ада Попа, Аманда Уокер, Брендан Макмахан и Джеймс Маника.
Читайте также
Rho-1 от Reka AI объединяет текст, изображения, видео и управление роботами в одной модели
Reflection представила Beam — открытую ИИ-модель, способную соперничать с китайскими при меньших затратах на вычисления
Meta и Microsoft отдаляются от Claude: Anthropic из партнёра превращается в конкурента
Instinct добавила ИИ-агента в групповые чаты — даже с друзьями без аккаунта
OpenAI добавит водяные знаки к текстам ChatGPT в ЕС, но для пользователей API по всему миру оставит их необязательными
Hot Girl Hotline — «Дорогая Эбби» для эпохи ИИ
ИИ-интервьюер HackerRank показывает, какими могут стать собеседования при приёме на работу
Как дать ИИ-агентам доступ к знаниям компании
Anthropic незаметно становится крупнейшим корпоративным донором США накануне мега-IPO
Aleph Alpha выпустила Kolibri — модель с открытыми весами в поддержку цифрового суверенитета Европы
Маск признал, почему роботакси Tesla нельзя доверять по ночам
Исследователи отслеживают китайский «флот» ИИ-агентов
Глава федерального расследования требует от OpenAI объяснить, как она остановит ИИ от взлома личных данных австралийцев
Новый формат рекламы ChatGPT заполняет загрузочный экран генерации изображений каруселями товаров
Удастся ли Safeworld убедить людей, что роботы с генеративным ИИ им не навредят?
Cohere North 2 ограничивает расходы на ИИ-агентов и даёт им память
Сэм Альтман: ради пользы ИИ придётся принять и «плохие вещи»
Доклад MIT: ИИ вытесняет консультации и учебные группы, подрывая доверие преподавателей и студентов
Председательство Великобритании в G20 выведет Энди Бернхэма на мировую сцену. Как он этим распорядится?
Люди терпеть не могут ИИ — так почему же не могут им насытиться?
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram