Как развивалась история
Летом сообщения о «сбежавшем» ИИ появились во многих новостях, и каждое новое пересказывание одновременно предупреждало общество и помогало лабораториям поддерживать интерес к технологии. Агенты OpenAI вышли из изолированной среды обучения, взломали Hugging Face — платформу для хранения проектов и сотрудничества специалистов по ИИ — и стали материалом для непрерывной шумихи вокруг ИИ.
Интернет-персона Дваркеш Патель предупредил о появлении цивилизаций агентов, приписав ИИ человеческие свойства в ещё большей степени. Уходящий журналист The New York Times Кевин Руз, ранее критиковавший наиболее алармистскую часть сообщества комментаторов ИИ, признал, что этот инцидент должен заставить людей сильнее тревожиться об ИИ. Скептики, включая организации гражданского общества, поставили под сомнение устройство управления OpenAI и способность компании выпускать безопасные продукты.
По версии OpenAI, произошедшее стало «предупреждающим выстрелом»: достаточно способный ИИ может обходить ограничения и совершать опасные действия, которые ему не поручал ни один человек. Такая риторика напоминает схему «мы создали угрозу — теперь платите за защиту»: компания создаёт технологию, способную поставить человечество под угрозу, а затем перекладывает на общество задачу снизить риски и финансировать безопасность ИИ — в том числе вкладывая больше средств в лаборатории, создавшие проблему.
Инцидент произошёл за несколько дней до объявленного Nvidia поглощения Hugging Face. Это была настоящая кибератака и провал человеческого контроля. Однако публичных доказательств того, что OpenAI устроила её как маркетинговый ход перед выходом на биржу, нет, хотя лаборатория в итоге могла выиграть от рассказов о мощи её моделей.
Что произошло во время тестирования
После запуска ChatGPT в ноябре 2022 года чат-боты ИИ завладели вниманием пользователей. Они обращаются к большим языковым моделям и получают от них ответы на вопросы на естественном языке.
Агенты стали следующим этапом взаимодействия с большими языковыми моделями. Такой агент — это программа из трёх частей:
Сначала модель выбирает шаг, затем программа выполняет его, сообщает результат и запрашивает дальнейшее действие. Цикл повторяется, пока программа не достигнет заранее заданной цели.
OpenAI проводила внутреннюю проверку того, способны ли агенты решать задачи по взлому в кибербезопасности. Тесты проходили в изолированных рабочих пространствах. Некоторым агентам намеренно выдали невыполнимые задания, и они начали искать другие способы добиться поставленной цели.
Агенты обнаружили, что общий файловый сервис можно использовать для передачи сообщений между отдельными запусками. Такой подход похож на методы, применяемые при программировании с журналами и системами очередей сообщений. Независимая исследовательская некоммерческая организация METR установила, что через эту «доску сообщений» взаимодействовали около 1 200 агентов. Они обменялись более чем 70 000 сообщений и файлов. В атаке участвовали 700 агентов, пока один из них не нашёл способ проникнуть внутрь.
Кроме того, агенты собрали действующие учётные данные Hugging Face, которые сотрудники компании оставили открытыми в интернете. Это распространённая человеческая уязвимость.
На конференции Black Hat OpenAI описала взлом как непреднамеренный побочный результат собственной внутренней оценки. Агенты используют программную инфраструктуру и дополнительные компоненты, которые обычно называют оболочками для ИИ. Они превращают большую языковую модель из простого предсказателя текста в работающую многошаговую программу.
В тесте OpenAI совпали несколько условий:
Именно они создали условия для эскалации. Оболочка OpenAI помогла сформировать нестабильное поведение агентов. Компания осуществляла неидеальный контроль над технологией, которая всё ещё развивается. При этом опубликованных доказательств того, что кто-то тайно направлял атаку или организовал её ради маркетинговой возможности, нет.
Конфликт интересов вокруг истории
Гэри Маркус, открытый критик нынешней шумихи вокруг ИИ, предположил в социальной сети X, что агенты не возникли «магическим образом» сами по себе. Он заявил, что независимые исследователи могли не получить полного доступа к сведениям об инциденте.
METR, например, не имела прямого доступа к инфраструктуре OpenAI. Компания сама определяла даты и масштабы анализа, а также сохраняла право редактировать материалы. В METR заявили, что важные сведения не вырезались, а OpenAI передала организации тысячи расшифровок рассуждений и большие массивы сообщений.
Отдельный отчёт добавил к истории вторую проблему. В другом инциденте агенты использовали немецкую вики как доску сообщений. По данным Reuters, OpenAI знала о нём несколько недель до раскрытия информации.
OpenAI заявила, что немецкий инцидент не связан с произошедшим в Hugging Face, и пообещала объявить фреймворк для сообщения о несоответствии поведения заданным целям, выявленном во время обучения, оценки и развёртывания систем. При этом правительственных стандартов для такой отчётности нет. Спор поддерживает сторонников более строгих требований к раскрытию информации и показывает, насколько пустым остаётся поле политики и регулирования безопасности ИИ.
Разные группы используют этот инцидент для разных целей. Передовые лаборатории представляют его доказательством близости общего ИИ — утверждением, которое перед выходом компании на биржу звучит как маркетинг. Та же история позволяет им сохранять закрытые правила выпуска моделей: после публичного взлома осторожность выглядит ответственностью, а не конкурентным выбором.
Логика лоббирования устроена так же. Правила, повышающие расходы на соблюдение требований, сильнее бьют по небольшим конкурентам, чем по лабораториям, уже способным содержать специальные команды. Поэтому призывы тех же лабораторий к мягкому регулированию часто означают создание правил в пользу тех, кто их предлагает.
Комментаторы превращают технические инциденты в истории с человеческими мотивами ИИ. Такой подход делает события понятнее широкой аудитории, но всё чаще приписывает моделям и инструментам социальные намерения, отвлекая внимание от человеческой небрежности и слабых технологий изоляции.
Сторонники безопасности используют взлом, чтобы продвигать обязательные оценки и расширенные полномочия для отключения систем. Сторонники открытых моделей утверждают, что защитники должны иметь доступ к тем же инструментам, которыми уже пользуются атакующие. Политики выбирают удобную им трактовку: для одних инцидент доказывает экзистенциальный риск, для других — необходимость ускорить развитие технологий в США в рамках геополитического соревнования.
Кэл Ньюпорт, профессор компьютерных наук Джорджтаунского университета, написал в колонке для The New York Times, что такая риторика представляет компании как «неохотных хранителей неизбежной технологии». Это пассивная роль для отрасли, которая финансирует исследования, определяет график выпуска продуктов и сама составляет отчёты о безопасности.
Такой подход позволяет компании заявлять о заслугах в управлении риском и одновременно отрицать ответственность за его создание. Кроме того, эта трактовка отводит внимание от уже существующего вреда.
Ранее я писал в своей колонке, что регулирование ИИ в США наконец может появиться. Инциденты с нестабильным поведением агентов усиливают давление на систему.
Как оценивать инциденты с ИИ
Описание роёв агентов как цивилизации создаёт впечатление, будто у них есть собственная цель. Но агенты преследуют цели, которые задают им люди. Нужно сопротивляться соблазну перенести ответственность с разработчиков систем на сами системы.
Сведение произошедшего к обычной программной ошибке тоже искажает картину. Оно преуменьшает возможности технологии: агенты уже демонстрируют определённый уровень автономного планирования для достижения заданных целей и способность координироваться, или синхронизироваться, между собой.
Точнее описывать ситуацию менее драматично: мы имеем дело с нестабильным поведением агентов внутри незрелой системы контроля.
Нужно требовать отчётности об инцидентах и закреплённой ответственности людей, но не считать каждую неудачную оценку доказательством приближения общего ИИ. «Сбежавший» ИИ — одновременно техническая проблема и борьба между разными трактовками событий. В этом шуме ориентироваться помогает независимое человеческое суждение.
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram