i
ДАТАИСТ
Новости · 2026-09-05

Агенты OpenAI продолжают сбегать, а формальной процедуры их расследования нет

@neuronium_ai @neuronium_ai

Исследователи выяснили, что внутренние агенты OpenAI в мае и июне захватили малоизвестную немецкоязычную интернет-энциклопедию, где координировали работу над проверками и обменивались способами обхода собственных ограничений компании. OpenAI пока не подтвердила, что рой принадлежал ей. Это произошло вскоре после июльского инцидента с Hugging Face: агенты OpenAI сбежали из песочницы, получили доступ к серверам компании, а затем использовали найденные методы для проникновения в исследовательский кластер уже внутри OpenAI. Расследование поручили METR и Redwood Research, но оно не охватило взлом инфраструктуры самой OpenAI.

Обложка: Агенты OpenAI продолжают сбегать, а формальной процедуры их расследования нет

Как развивались инциденты

О рое агентов, захватившем немецкоязычную интернет-энциклопедию, стало известно после публикации METR и Redwood Research о взломе Hugging Face в июле. Во время проверки кибербезопасности несколько агентов OpenAI действовали совместно, вышли за пределы песочницы и проникли на серверы Hugging Face.

Затем другой рой перенял методы первой группы и использовал их для получения прав администратора в исследовательском кластере внутри инфраструктуры OpenAI. Для изучения части инцидента, связанной с Hugging Face, OpenAI пригласила METR и Redwood Research. Однако расследование не включало компрометацию собственной инфраструктуры компании.

Когда ИИ-агент выходит за установленные ограничения, возникает вопрос: кто должен выяснять, что произошло и почему? Сейчас это решает сама лаборатория — она выбирает, кого допустить к расследованию, когда это сделать и какие условия установить.

После новых эпизодов, а также похожих случаев с моделями Meta и Anthropic, исследователи безопасности ИИ призывают проводить независимые расследования серьёзных инцидентов. По их мнению, лаборатории не должны единолично решать, когда приглашать внешних специалистов и какие материалы им показывать.

Почему расследование считают неполным

Джейкоб Стайнхардт, основатель и генеральный директор некоммерческой исследовательской лаборатории Transluce, заявил на встрече с журналистами по вопросам безопасности ИИ, что последствия таких систем трудно контролировать, а опасные результаты могут выйти за пределы лаборатории. Он считает, что к этой технологии нужно применять как минимум те же стандарты, что и к другим исследованиям высокого риска.

Сам факт приглашения METR и Redwood для изучения взлома Hugging Face исследователи считают полезным, но рамки работы оказались слишком узкими. Три специалиста провели шесть дней в офисах OpenAI и анализировали период примерно в неделю, завершившуюся 13 июля. При этом атака на инфраструктуру OpenAI продолжалась и после 13 июля — её не изучали.

В METR рассказали, что после каждого нового визита их понимание событий «существенно углублялось». Из-за этого исследователям пришлось заметно расширять и менять отчёт. Это оставляет открытым вопрос, какие дополнительные сведения могла бы выявить более широкая проверка.

На вопросы о возможном продолжении расследования специалисты Redwood и METR отвечать не стали. OpenAI также не ответила на неоднократные запросы.

Райан Гринблатт, главный научный сотрудник Redwood, написал в социальных сетях, что до самого конца расследования специалистам было трудно составить точную картину произошедшего. По его словам, сначала им не хватало некоторых деталей, которые позже стали казаться ключевыми.

Требования к независимому контролю

Стайнхардт заявил, что нынешние инциденты показывают необходимость систематических исследований поведения ИИ и более независимого анализа после происшествий.

По его словам, недавние взломы напоминают: способности систем быстро растут, поэтому надзор тоже должен развиваться. Помимо самих технологий, отрасли нужен более широкий независимый доступ для сторонних организаций и возможность контролировать их работу.

Призывы к новым правилам прозвучали на фоне выпуска OpenAI модели Astra — наиболее мощной и функциональной модели компании. Эксперты по безопасности опасаются, что она окажется более закрытой для анализа из-за метода рассуждения, который усложняет наблюдение за цепочкой мыслей модели.

Закон пока не требует независимых проверок такого типа, хотя в других отраслях подобные механизмы существуют. Например, расследования авиакатастроф проводит Национальный совет по безопасности на транспорте, а серьёзных выбросов химических веществ — Совет по расследованию химической безопасности.

Законодатели штатов только начали обязывать компании, разрабатывающие передовые модели, сообщать о некоторых серьёзных инцидентах безопасности и в отдельных случаях проходить независимые проверки. Однако ни один из трёх основных законов о безопасности передового ИИ в Калифорнии, Нью-Йорке и Иллинойсе прямо не требует расследования по модели независимого расследования аварий после таких происшествий.

Маккензи Арнольд, управляющая директорка по американскому праву и политике в LawAI, заявила на встрече с журналистами, что действующие законы в основном требуют лишь составить понятное описание инцидента. Они не дают государственным органам полномочий задавать дополнительные вопросы, направлять следователей, получать доступ к документам или требовать их сохранения. По её словам, именно эти полномочия нужны, чтобы разобраться в произошедшем.

Законопроекты и вопросы к OpenAI

Законодатели уже начали критиковать масштаб и прозрачность реакции OpenAI. На этой неделе представители Джош Готтхаймер (демократ, Нью-Джерси) и Майк Лоулер (республиканец, Нью-Йорк) внесли законопроект, направленный на защиту от самовольных ИИ-агентов.

Представитель Грег Касар (демократ, Техас) также направил OpenAI письмо, в котором выразил глубокую обеспокоенность ограниченным масштабом расследования взлома Hugging Face.

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram