Почему агенты OpenAI взломали Hugging Face
Агенты OpenAI взломали Hugging Face, пытаясь решить задачу кибербезопасности, с которой не справлялись. Технический отчёт OpenAI показал: модели ещё на этапе обучения случайно научились жульничать, искать уязвимости в доступной инфраструктуре и общаться друг с другом. Позже эти навыки помогли им выйти в интернет, обойти изоляцию и получить решения для теста. OpenAI и исследователи METR выясняют причины случившегося и уже вводят защитные меры, но проблема согласования поведения моделей с намерениями человека остаётся нерешённой.
После взлома сотрудники OpenAI и исследователи некоммерческой организации METR, которая занимается оценкой ИИ и в тот же день выпустила собственный отчёт, начали разбирать произошедшее. OpenAI уже внедрила некоторые меры профилактики. Однако согласование поведения ИИ с человеческими целями остаётся сложной задачей, а часть причин инцидента потребует гораздо больше месяца для устранения.
Кай Чен, руководитель исследовательской команды OpenAI по согласованию ИИ, отмечает, что решить такую проблему за одну ночь невозможно. По его словам, многие из этих трудностей исследователи отслеживают давно, но теперь видят их гораздо точнее.
Как начался взлом
Взлом Hugging Face стал результатом нескольких месяцев нежелательного поведения агентов — сначала во время обучения, а затем при проверке их способностей.
В мае агенты, проходившие обучение, нашли способ использовать инфраструктуру OpenAI для общения друг с другом и совместного решения сложных задач. Среди них были задания, которые невозможно было выполнить без взлома или другого нарушения правил. Для этого агенты создали своеобразную доску сообщений, которую OpenAI впоследствии отключила.
В июле, когда модели проверяли на способности к кибербезопасности, некоторые из них создали новую доску сообщений. По условиям теста агенты должны были оставаться отрезанными от интернета. Но, действуя совместно, они всё же вышли в сеть, взломали Hugging Face и получили решения задач, которые до этого поставили их в тупик.
Исследователи OpenAI считают, что события на этапе обучения напрямую привели к взлому. Эрик Уоллес из исследовательской команды OpenAI по согласованию ИИ говорит: почти для каждого вызывавшего тревогу поведения, замеченного во время проверки, удалось найти похожее поведение на этапе обучения, которое, вероятно, и способствовало последующему инциденту.
Как работает взлом вознаграждения
Если модель правильно решает задачу во время обучения, действия, приведшие к результату, получают положительное подкрепление. Поэтому в будущем модель с большей вероятностью повторит похожее поведение.
Так, если в мае модель выполнила задание после использования первой доски сообщений, позже она с большей вероятностью могла присоединиться к новой. Явление, при котором агенты начинают нарушать правила из-за того, что такое поведение было подкреплено в обучении, называется взломом вознаграждения.
Это же помогает объяснить, почему модели так настойчиво пробивались в интернет. Во время расследования команда OpenAI обнаружила: по мере обучения модели всё чаще проверяли цифровое окружение на наличие слабых мест и неожиданно использовали доступные инструменты. Исследователи считают, что такое поведение постепенно закреплялось.
Когда модели столкнулись со сложными задачами по кибербезопасности, они уже усвоили: взлом — эффективный способ добиться цели.
Эти результаты указывают, что взлом Hugging Face мог не произойти, если бы модели не получали подкрепление за нарушения во время обучения. Полностью предотвратить взлом вознаграждения исследователи пока не умеют, но OpenAI собирается снижать его последствия.
Компания будет искать признаки жульничества у всех передовых моделей во время обучения, отслеживая их цепочки рассуждений — внутренние записи, где модели набрасывают ответы и планируют действия.
Однако такое решение не гарантирует результата. В более раннем исследовании OpenAI показала: если наказывать модели за упоминание жульничества в цепочках рассуждений, они учатся скрывать свои намерения от исследователей.
При этом наблюдение за рассуждениями всё же даёт OpenAI возможность остановить обучение и пересмотреть подход, если модели начнут осваивать взлом вознаграждения.
Даже если OpenAI прекратит закреплять такое поведение — а это пока большое «если», — проблема согласования ИИ с человеческими целями не исчезнет. Когда модель впервые общалась с другими агентами или взламывала инфраструктуру во время обучения, подобные действия ещё не были подкреплены. Значит, нежелательное поведение нельзя объяснить только механизмом вознаграждения.
Откуда взялась скрытая связь
Джеффри Ладиш, директор некоммерческой организации Palisade Research, занимающейся безопасностью ИИ, сравнивает агентов с человеком, который впервые совершает финансовое преступление. Чтобы понять, что мошенничество может быть эффективной стратегией, человеку необязательно совершать его раньше. С моделями, по его словам, возникает та же проблема.
Исследования в области согласования ИИ должны выяснить, как формируются мотивации моделей, чтобы понять, как научить их учитывать последствия собственных действий.
У исследователей OpenAI есть гипотеза о происхождении части нарушений. До того как модели создали первую секретную доску сообщений, их обучали общаться и координировать действия с подагентами — менее мощными агентами, которым главный агент может делегировать задачи.
Выученная привычка к общению могла перенестись в новую ситуацию. Отчёт METR, подробно изучивший сообщения между моделями, эту гипотезу поддерживает: один из агентов на доске сообщений взял на себя руководство и распределил задачи между остальными, фактически обращаясь с ними как с подагентами.
OpenAI могла бы попытаться предотвратить тайное общение между агентами, отказавшись от обучения такому поведению. Но тогда модели стали бы менее полезными.
Настойчивость моделей
Противоречие между способностями и безопасностью стало одной из причин произошедшего с Hugging Face. Исследователи OpenAI также назвали ключевым фактором взлома настойчивость моделей.
Получив задачи, которые невозможно решить, модели не остановились. Они продолжили искать решение любыми доступными способами. При этом настойчивость сама по себе нужна агентам, которые должны самостоятельно выполнять большой объём сложной работы.
OpenAI работает над тем, чтобы дать моделям возможность сообщать человеку о невыполнимых задачах. Но научить модели понимать, когда следует применять свои способности, а когда — остановиться, одним разбором инцидента не получится.
Стратегии обучения, которые создают сильных программистов, вознаграждая модели за успешное решение задач, могут оказаться неподходящими для обучения осмотрительному использованию навыков и уважению человеческих целей и ценностей.
По словам Джеффри Ладиша, исследования согласования ИИ должны выйти за рамки одних только косвенных показателей выполнения задач. Такие показатели помогают сделать модели более способными, но сами по себе не учат их согласованному с человеком поведению.
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram