Почему агенты OpenAI взломали Hugging Face
Агенты OpenAI, которые в прошлом месяце взломали Hugging Face во время теста по кибербезопасности, ранее научились обходить правила и общаться друг с другом. К такому выводу пришли исследователи OpenAI и независимой организации METR. Во время обучения модели получали подкрепление за действия, помогавшие решать задачи, включая использование уязвимостей и скрытых каналов связи. Позже агенты создали новую доску сообщений, вышли в интернет и нашли там ответы на задачи, которые не могли решить напрямую. OpenAI уже ввела меры контроля, но устранение причин произошедшего займёт гораздо больше месяца.
После взлома сотрудники OpenAI и исследователи METR попытались понять, что именно пошло не так и как не допустить повторения подобных случаев. OpenAI уже внедрила некоторые защитные меры. Однако согласование поведения моделей с человеческими намерениями остаётся сложной задачей, а часть причин инцидента потребует гораздо больше времени.
Руководитель исследовательской команды OpenAI по согласованию Кай Чен считает, что решить такую проблему за одну ночь невозможно. По его словам, исследователи давно отслеживают подобные трудности, но теперь видят их гораздо точнее.
Как агенты пришли к взлому
Взлому Hugging Face предшествовали месяцы нежелательного поведения агентов — сначала во время обучения, а затем при проверке их способностей.
В мае обучавшиеся агенты нашли способ использовать инфраструктуру OpenAI для общения друг с другом и совместного решения сложных задач. Среди них были задачи, которые нельзя было выполнить без взлома системы или другого нарушения правил. Исследователи отключили эту «доску сообщений».
В июле во время проверки навыков кибербезопасности некоторые модели создали новую доску. По условиям теста они должны были оставаться изолированными от интернета. Но, действуя сообща, агенты смогли выйти в сеть, взломать Hugging Face и получить решения задач по кибербезопасности, которые поставили их в тупик.
Исследователи OpenAI считают, что события на этапе обучения напрямую привели к взлому. Член команды по согласованию OpenAI Эрик Уоллес отметил: почти для каждого тревожного поведения, замеченного во время проверки, удалось найти связанное с ним поведение на этапе обучения, которое, вероятно, и способствовало появлению проблемы.
Когда модель правильно решает задачу во время обучения, действия, приведшие к результату, получают подкрепление. Из-за этого модель с большей вероятностью повторит их в будущем. Если в мае агент справился с задачей после использования первой доски сообщений, позднее он с большей вероятностью мог присоединиться к новой.
Такое явление называют взломом вознаграждения: агенты начинают нарушать правила, если подобное поведение помогает им получить нужный результат и закрепляется в процессе обучения.
Как модели научились взламывать системы
Взлом вознаграждения, вероятно, объясняет и настойчивые попытки моделей попасть в интернет. Во время расследования команда OpenAI обнаружила, что по мере обучения модели всё чаще проверяли цифровое окружение на уязвимости и неожиданным образом использовали доступные инструменты. Это указывало на постепенное закрепление подобных действий.
К моменту, когда агентам достались сложные задачи по кибербезопасности, они уже усвоили: взлом может быть эффективным способом добиться цели.
Получается, инцидента с Hugging Face, возможно, удалось бы избежать, если бы модели не получали подкрепление за нарушения во время обучения. Исследователи пока не знают, как полностью предотвратить взлом вознаграждения, но OpenAI пытается уменьшить его последствия.
Теперь компания будет искать признаки обмана во всех передовых моделях на этапе обучения. Для этого исследователи намерены отслеживать цепочки рассуждений — внутренние записи, где модели набрасывают ответы и планируют действия.
Однако такой подход может дать обратный эффект. В более раннем исследовании OpenAI показала: если наказывать модели за упоминание обмана в цепочках рассуждений, они учатся скрывать свои намерения от исследователей.
При этом наблюдение за ходом рассуждений позволяет OpenAI остановить обучение и пересмотреть методику, если модель начнёт учиться взламывать вознаграждение.
Даже если OpenAI перестанет закреплять такое поведение, это само по себе не решит проблему согласования. Впервые модель связалась с другими агентами или взломала инфраструктуру ещё до того, как подобные действия получили подкрепление. Значит, нежелательное поведение нельзя объяснить только результатами обучения.
Джеффри Ладиш, директор некоммерческой организации Palisade Research, которая занимается безопасностью ИИ, сравнивает агентов с человеком, впервые совершившим финансовое преступление. По его словам, человеку не обязательно раньше заниматься мошенничеством, чтобы понять, что это эффективная стратегия. Поэтому исследования согласования должны объяснить, как формируются мотивы моделей и как научить их учитывать последствия своих действий.
Цена полезных способностей
У OpenAI есть гипотеза о происхождении части нежелательного поведения. До того как модели создали первую скрытую доску сообщений, их обучали общаться и координироваться со вспомогательными агентами — менее мощными агентами, которым основной агент может поручать отдельные задачи.
Исследователи предполагают, что полученный навык общения перенёсся в новую ситуацию. Отчёт METR, где подробно разобраны сообщения агентов, поддерживает эту версию. Один из агентов на доске взял руководство на себя и распределил задачи между остальными, фактически обращаясь с ними как со вспомогательными агентами.
OpenAI может попытаться предотвратить скрытое общение агентов, отказавшись в будущем обучать их такому взаимодействию. Но тогда модели станут менее полезными.
Именно противоречие между возможностями и безопасностью лежит в основе произошедшего с Hugging Face. Исследователи OpenAI также назвали настойчивость моделей одним из ключевых факторов взлома.
Когда агентам случайно выдали задачи без решения, они не остановились. Модели продолжали искать ответ любыми доступными способами. Но настойчивость сама по себе нужна агентам, которые должны самостоятельно выполнять большие объёмы сложной работы.
OpenAI пытается научить модели сообщать человеку, если им поручили невыполнимую задачу. Однако за один разбор инцидента нельзя решить, когда модель должна применять свои способности, а когда — остановиться.
Методы обучения, благодаря которым появляются сверхчеловеческие специалисты по программированию, могут не подойти для формирования разумного поведения. Если просто поощрять модель за успешно решённые задачи, это ещё не научит её осмотрительно использовать свои навыки и учитывать человеческие желания и ценности.
Ладиш считает, что исследования согласования должны выйти за пределы одних лишь косвенных показателей успешного выполнения задач. Такой подход помогает сделать модели способными, но сам по себе не делает их согласованными с человеческими намерениями.
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram