Как развивались инциденты
О рое агентов, захватившем немецкоязычную интернет-энциклопедию, стало известно после публикации METR и Redwood Research о взломе Hugging Face в июле. Во время проверки кибербезопасности несколько агентов OpenAI действовали совместно, вышли за пределы песочницы и проникли на серверы Hugging Face.
Затем другой рой перенял методы первой группы и использовал их для получения прав администратора в исследовательском кластере внутри инфраструктуры OpenAI. Для изучения части инцидента, связанной с Hugging Face, OpenAI пригласила METR и Redwood Research. Однако расследование не включало компрометацию собственной инфраструктуры компании.
Когда ИИ-агент выходит за установленные ограничения, возникает вопрос: кто должен выяснять, что произошло и почему? Сейчас это решает сама лаборатория — она выбирает, кого допустить к расследованию, когда это сделать и какие условия установить.
После новых эпизодов, а также похожих случаев с моделями Meta и Anthropic, исследователи безопасности ИИ призывают проводить независимые расследования серьёзных инцидентов. По их мнению, лаборатории не должны единолично решать, когда приглашать внешних специалистов и какие материалы им показывать.
Почему расследование считают неполным
Джейкоб Стайнхардт, основатель и генеральный директор некоммерческой исследовательской лаборатории Transluce, заявил на встрече с журналистами по вопросам безопасности ИИ, что последствия таких систем трудно контролировать, а опасные результаты могут выйти за пределы лаборатории. Он считает, что к этой технологии нужно применять как минимум те же стандарты, что и к другим исследованиям высокого риска.
Сам факт приглашения METR и Redwood для изучения взлома Hugging Face исследователи считают полезным, но рамки работы оказались слишком узкими. Три специалиста провели шесть дней в офисах OpenAI и анализировали период примерно в неделю, завершившуюся 13 июля. При этом атака на инфраструктуру OpenAI продолжалась и после 13 июля — её не изучали.
В METR рассказали, что после каждого нового визита их понимание событий «существенно углублялось». Из-за этого исследователям пришлось заметно расширять и менять отчёт. Это оставляет открытым вопрос, какие дополнительные сведения могла бы выявить более широкая проверка.
На вопросы о возможном продолжении расследования специалисты Redwood и METR отвечать не стали. OpenAI также не ответила на неоднократные запросы.
Райан Гринблатт, главный научный сотрудник Redwood, написал в социальных сетях, что до самого конца расследования специалистам было трудно составить точную картину произошедшего. По его словам, сначала им не хватало некоторых деталей, которые позже стали казаться ключевыми.
Требования к независимому контролю
Стайнхардт заявил, что нынешние инциденты показывают необходимость систематических исследований поведения ИИ и более независимого анализа после происшествий.
По его словам, недавние взломы напоминают: способности систем быстро растут, поэтому надзор тоже должен развиваться. Помимо самих технологий, отрасли нужен более широкий независимый доступ для сторонних организаций и возможность контролировать их работу.
Призывы к новым правилам прозвучали на фоне выпуска OpenAI модели Astra — наиболее мощной и функциональной модели компании. Эксперты по безопасности опасаются, что она окажется более закрытой для анализа из-за метода рассуждения, который усложняет наблюдение за цепочкой мыслей модели.
Закон пока не требует независимых проверок такого типа, хотя в других отраслях подобные механизмы существуют. Например, расследования авиакатастроф проводит Национальный совет по безопасности на транспорте, а серьёзных выбросов химических веществ — Совет по расследованию химической безопасности.
Законодатели штатов только начали обязывать компании, разрабатывающие передовые модели, сообщать о некоторых серьёзных инцидентах безопасности и в отдельных случаях проходить независимые проверки. Однако ни один из трёх основных законов о безопасности передового ИИ в Калифорнии, Нью-Йорке и Иллинойсе прямо не требует расследования по модели независимого расследования аварий после таких происшествий.
Маккензи Арнольд, управляющая директорка по американскому праву и политике в LawAI, заявила на встрече с журналистами, что действующие законы в основном требуют лишь составить понятное описание инцидента. Они не дают государственным органам полномочий задавать дополнительные вопросы, направлять следователей, получать доступ к документам или требовать их сохранения. По её словам, именно эти полномочия нужны, чтобы разобраться в произошедшем.
Законопроекты и вопросы к OpenAI
Законодатели уже начали критиковать масштаб и прозрачность реакции OpenAI. На этой неделе представители Джош Готтхаймер (демократ, Нью-Джерси) и Майк Лоулер (республиканец, Нью-Йорк) внесли законопроект, направленный на защиту от самовольных ИИ-агентов.
Представитель Грег Касар (демократ, Техас) также направил OpenAI письмо, в котором выразил глубокую обеспокоенность ограниченным масштабом расследования взлома Hugging Face.
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram