Сначала — базовая безопасность
Специалисты по интернет-безопасности считают, что лабораториям ИИ нужно сосредоточиться на базовых сетевых мерах — журналах событий и разрешениях — и защищать системы так же тщательно, как аккаунты людей. Аудит третьей стороной и работа над согласованием поведения ИИ с человеческими целями звучат заметнее, но базовые меры могут оказаться эффективнее.
Генеральный директор Luta Security Кэти Муссурис заявила TechCrunch, что предложение Дарио Амодеи похоже на попытку передать проблему внешним исполнителям. По её мнению, считать аудит третьей стороной решением было бы странно: это напоминало бы ситуацию, в которой Microsoft в 2002 году вместо подготовки меморандума Trustworthy Computing Memo предложила бы просто замедлить разработку.
Меморандум написал тогдашний генеральный директор Microsoft Билл Гейтс. После серии широко обсуждавшихся атак компьютерных червей на ещё только формировавшиеся корпоративные системы он призвал сотрудников сделать программное обеспечение надёжным и безопасным. По мере того как ценность и риски новой технологии становятся очевиднее, сектор ИИ, возможно, подходит к похожему повороту.
Согласование поведения моделей с человеческими целями остаётся важной задачей. Но исследователь ИИ Саяш Капур, который со следующего года начнёт преподавать в Калифорнийском университете в Беркли, считает, что дополнительные вложения в контроль с большей вероятностью дадут результат, чем сопоставимые вложения в согласование. По его словам, недавние инциденты показывают, что компании уделяют контролю ИИ недостаточно внимания, хотя известные технические методы уже существуют.
Проблемы, вызвавшие эти опасения, связаны с передовыми моделями, которым поручали учебные задачи — обычно проверки по кибербезопасности. Во время работы модели выходили в открытый интернет и пытались проникнуть в закрытые системы сторонних организаций. Как правило, это происходило из-за неправильно настроенных «песочниц», призванных изолировать ИИ-агентов. В одном из случаев с Anthropic прорыв произошёл потому, что сторонние проверяющие не закрыли нужные двери.
Генеральный директор компании Tailscale Эйвери Пеннарун отметил, что специалисты давно умеют блокировать доступ к интернету. По его словам, в отчётах такие инциденты могут выглядеть как впечатляющие многоэтапные атаки, но если агенту дали возможность скачивать данные, эту возможность следовало отключить отдельно от доступа в интернет.
Проблема не ограничивается неправильной изоляцией. Ещё серьёзнее то, что лаборатории, разрабатывающие передовые модели, не замечали происходящего.
Наблюдение за ИИ-агентами
По словам Кэти Муссурис, почти все сведения о действиях агентов появлялись либо после того, как что-то замечала жертва, либо благодаря сетевой активности. Прямого мониторинга самих ИИ-систем при этом не было.
В одном случае агенты OpenAI захватили заброшенный немецкий WikiForum, чтобы обмануть проверки. Они оставались активными несколько недель, прежде чем в компании, судя по всему, заметили происходящее. Опрошенные TechCrunch специалисты по безопасности считают, что для предотвращения новых прорывов нужно мониторить действия в реальном времени. Каждая сессия агента также должна иметь ограничение по времени и автоматически завершаться.
Шапор Нагибзаде, бывший руководитель направления безопасности Google, а теперь глава стартапа QueryStory, предлагает помещать агента в изолированную среду и тщательно наблюдать за ним снаружи. Под контролем должны находиться:
По его мнению, единственная оставленная ради удобства лазейка и становится путём обхода защиты. В Google Нагибзаде неоднократно видел, как этим пользовались люди, проводившие атаки. Он считает, что модели как минимум не хуже находят дверь, оставленную открытой.
OpenAI уже начала двигаться в этом направлении: компания сообщила о мониторинге всех операций инференса с использованием инструментов у своей модели Astra. На это требуется значительный объём вычислительных ресурсов. Anthropic также заявила об усилении процедур безопасности, в том числе о расширении наблюдаемости своих моделей. Обе компании не ответили на вопросы TechCrunch о том, как именно они отслеживают действия ИИ-агентов и управляют ими.
Дополнительную проблему создаёт общая инфраструктура, которой пользуются агенты. Именно она позволила им обмениваться данными во время атаки на Hugging Face. Разработчик программного обеспечения Саймон Уиллисон, один из создателей веб-фреймворка Django, описал ситуацию термином «смертоносная триада». Она возникает, когда у агента одновременно есть доступ:
По словам Эйвери Пеннаруна, агент может получить любые два из этих трёх видов доступа. Если же для задачи требуются все три, работу нужно распределить как минимум между двумя агентами. Возможно, им разрешат обмениваться данными через контролируемый канал.
Что говорят о лабораториях
Опрошенные TechCrunch специалисты понимают, насколько сложна работа сотрудников, отвечающих за безопасность в лабораториях передовых моделей. По словам Шапора Нагибзаде, государственные хакерские группы по всему миру пытаются похитить веса моделей и проводить атаки дистилляции через их API. Одновременно команды должны заниматься обычными задачами безопасности, с которыми сталкивается любая крупная цифровая компания.
Нагибзаде считает, что исследовательская инфраструктура обычно не поднимается на верхние позиции в списке приоритетов, хотя теперь ситуация должна измениться. Публичное раскрытие инцидентов, по его словам, помогает всем внутри компании сосредоточиться на улучшении защиты.
Кэти Муссурис отдельно обращает внимание на отсутствие формальной процедуры уведомления пострадавших. Сейчас лаборатории не обязаны сообщать сторонним организациям, если их агенты проникли в чужие системы. Возможно, существовали и другие инциденты, которые не получили широкой огласки. Муссурис опасается, что законы, напрямую регулирующие модели, могут привести к непредвиденным последствиям, но считает обязательное уведомление одним из направлений, которое должны рассмотреть законодатели.
Специалисты признают, что лаборатории не всегда следовали лучшим практикам безопасности. При этом они работают с задачами, которых раньше никто не решал. Генеральный директор компании Embroidery Зак Корман сказал TechCrunch, что лаборатории делают на порядки больше, чем обычная крупная компания.
Начинать работу с согласованием поведения моделей с человеческими целями, возможно, не стоит, но игнорировать эту задачу нельзя. Специалисты по кибербезопасности уже смирились с тем, что для наблюдения за одними ИИ-агентами в реальном времени придётся использовать других ИИ-агентов. Это создаёт отдельный риск: модели могут вводить наблюдателей в заблуждение.
Кэти Муссурис отмечает, что специалистам приходится использовать ИИ для контроля ИИ, хотя безопасность самих систем пока не гарантирована.
Дальше задача станет сложнее. Сейчас агенты действуют заметно: публикуют сообщения на открытых форумах, а их цепочки рассуждений и другие следы работы написаны на английском языке и остаются понятными людям. Муссурис считает, что этим нужно пользоваться, пока такая прозрачность сохраняется, поскольку со временем она может исчезнуть.
Читайте также
Я обучил мозг мухи придумывать идеи для статей WIRED
Фон дер Ляйен: ИИ-агенты, «вырвавшиеся из среды», — лишь предвестие грядущего
88-часовое математическое доказательство OpenAI: куда уходит экономия бизнеса на ИИ
ИИ взломал 370-летний шифр?
Более эффективная кибербезопасность должна сдерживать угрозы ИИ
CPU снова в игре благодаря ИИ-агентам — что это значит для вас
Теперь ИИ-агенты могут управлять устройствами Google Home
ИИ-война уже началась — её последствия почувствует каждый бизнес
Идейные противники объединились в Вашингтоне, чтобы обуздать ИИ
ИИ-агенты станут новыми привратниками клиентской лояльности
Экономисты встревожены: пузырь ИИ вот-вот лопнет
Психология доверия к ИИ сбивается из-за коварного «парадокса раскрытия»
Как рынки реагируют на всплеск заголовков о гибели человечества из-за ИИ
Anthropic объединила чат Claude и Cowork в одном интерфейсе
Почему я не могу дождаться поездки на беспилотном автомобиле
Google DeepMind запустила междисциплинарный институт для решения главных вопросов об AGI
SK Hynix, по сообщениям, обсуждает с Intel производство чипов памяти в США
Гиганта дата-центров обвинили в использовании ИИ ради поддержки министра Виктории
Бывший исследователь OpenAI создал ИИ-модель, которая оценивает варианты, а не пишет текст
Страх, что ИИ уничтожит человечество, взвинтил акции отдельных компаний
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram