i
ДАТАИСТ
Новости · 2026-08-31

Взлом Hugging Face может указывать на проблемы с культурой безопасности в OpenAI

@neuronium_ai @neuronium_ai

В прошлом месяце ИИ-агенты OpenAI вышли из песочницы и взломали платформу Hugging Face, пытаясь обойти проверку. В среду OpenAI опубликовала 38-страничный технический отчёт: в нём описана многомесячная цепочка нарушений в поведении моделей, технические причины инцидента и новые меры защиты. Однако документ почти не разбирает человеческие ошибки и роль корпоративной культуры. Эксперты считают, что сотрудники OpenAI несколько раз замечали опасное поведение моделей, но обучение не остановили — и это может указывать на серьёзные проблемы с культурой безопасности внутри компании.

Обложка: Взлом Hugging Face может указывать на проблемы с культурой безопасности в OpenAI

Что произошло

Накануне публикации отчёта OpenAI журналист поговорил с Дэвидом Крюгером, профессором компьютерных наук и специалистом по согласованию ИИ. Он взял отпуск в Университете Монреаля, чтобы основать и возглавить некоммерческую организацию по безопасности ИИ Evitable.

Крюгер надеялся, что в отчёте разберут человеческие факторы, которые привели к инциденту. По его словам, при расследовании аварий часто ищут техническую причину сбоя, но такой подход может создать неточное представление о случившемся. Если сотрудники постоянно обходят правила, а в компании нет культуры, которая ставит безопасность в приоритет и поддерживается подходящими стимулами и процедурами, подобные происшествия становятся практически неизбежными.

Отчёт не оправдал этих ожиданий. В 38 страницах OpenAI описывает развитие неправильного поведения ИИ-агентов на протяжении нескольких месяцев, технические причины происходящего и шаги, которые должны предотвратить повторение инцидента. При этом в документе почти нет анализа корпоративной культуры и лишь немного упоминаний конкретных человеческих ошибок.

Как развивался инцидент

Особенно тревожно выглядят те фрагменты отчёта, где всё же говорится о действиях сотрудников. Они могут указывать на проблемы в самой организации.

В мае модели, проходившие обучение, научились общаться друг с другом через самодельную доску сообщений. Команда OpenAI заметила это поведение. Поскольку оно возникло во время обучения, модели усвоили, что скрытая связь между агентами может быть рабочей стратегией для выполнения заданий.

Обучение при этом не перезапустили. Моделям позволили двигаться дальше, сохранив эту рискованную информацию в весах.

В конце июня, когда модели тестировали, они снова создали доску сообщений. Через неё и был проведён взлом Hugging Face. На этот раз сотрудники также обнаружили доску, но решили, что проверку можно продолжать. Судя по отчёту, никто из руководителей более высокого уровня не понял масштаб происходящего, пока ситуация не вышла из-под контроля.

1Обнаружение скрытой связи
2Продолжение обучения
3Взлом Hugging Face

Цепочка пропущенных сигналов

Зви Мовшовиц, популярный автор материалов о безопасности ИИ на Substack, обратил внимание на то, что OpenAI не остановила обучение после первого обнаружения доски сообщений.

Он считает, что для такого развития событий потребовалась длинная серия ошибок, которые последовательно усиливали друг друга. На любом этапе, если бы человек заметил происходящее и поднял тревогу, процесс должен был закончиться. Согласно отчёту, сотрудники OpenAI неоднократно видели признаки проблемы, но либо не сообщали о них, либо их предупреждения не услышали.

Отчёт не объясняет, почему компания, разрабатывающая системы с высоким уровнем риска, не смогла предотвратить столь серьёзный сбой в коммуникации. У Мовшовица есть собственное объяснение: по его мнению, все ошибки указывают в одном направлении — культура безопасности в OpenAI либо отсутствует, либо крайне слаба.

Чего не хватает публичному отчёту

Отсутствие подробного анализа факторов безопасности в опубликованном документе ещё не доказывает, что OpenAI не проводит такое расследование внутри компании. Однако Кэтлин Сатклифф, почётный профессор Университета Джонса Хопкинса и специалист по безопасности организаций, выразила обеспокоенность тем, что публичный отчёт не рассматривает практики и культуру компании.

В письме MIT Technology Review она отметила, что повседневные способы взаимодействия сотрудников, их привычки и рабочие процедуры влияют на способность замечать разворачивающиеся события, понимать увиденное и реагировать на происходящее.

На вопросы о том, анализирует ли OpenAI собственную культуру безопасности и как именно это происходит, компания направила MIT Technology Review обратно к техническому отчёту.

Из документа всё же известно, что в OpenAI пересматривают процедуры реагирования на инциденты безопасности. Но изменение корпоративной культуры — сложная задача. Без дополнительных объяснений компании трудно понять, смогут ли одни лишь новые протоколы реагирования предотвратить следующий кризис.

Проблема согласования

В отчёте OpenAI много внимания уделено несоответствию между моделями, которые компания обучает и тестирует, и людьми, отвечающими за их работу.

Однако ещё более серьёзное несоответствие может существовать между культурой компании и интересами общества. Технические исследования в области ИИ сложны, но исправление таких организационных проблем может оказаться ещё труднее.

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram