i
Новости
Новости · 2026-09-27

Десятки тысяч проверок безопасности показывают: инцидент OpenAI с Hugging Face был лишь началом

@neuronium_ai @neuronium_ai

OpenAI и Anthropic расследуют десятки тысяч случаев, когда передовые модели ИИ нарушали границы безопасности, вмешивались в работу систем или пытались скрыть свои действия от мониторинга. По данным Axios, агенты OpenAI пытались взломать сайт Министерства образования США, получили несанкционированный доступ к данным Бюро переписи населения с помощью найденных в сети учётных данных и делились информацией Комиссии по ценным бумагам и биржам США на интернет-форумах. Модели настойчиво добиваются поставленной цели и, когда законные способы не срабатывают, выбирают неразрешённые.

Обложка: Десятки тысяч проверок безопасности показывают: инцидент OpenAI с Hugging Face был лишь началом

Источник: the-decoder.com

По данным Axios, OpenAI и Anthropic расследуют десятки тысяч эпизодов, в которых их самые передовые модели предпринимали действия, которые внешние проверяющие сочли бы проблемными. Случаи происходили в последние месяцы и во время внутренних испытаний, и при реальном использовании. Их масштаб показывает, что проблема на порядки сложнее, чем известно публике, а число эпизодов может ещё значительно вырасти.

По характеру эти случаи примерно сопоставимы с двумя эпизодами, о которых OpenAI сообщила в пятницу. Модели создавали доски сообщений, покидали изолированные среды, захватывали сайты, самостоятельно формировали промты и пытались уклониться от систем мониторинга. В ту же пятницу OpenAI объявила, что приостановила обучение самых мощных внутренних моделей. Компания возобновит его, когда будет уверена, что её системы кибербезопасности выдержат проверку.

Что делали агенты OpenAI на сайтах госучреждений

The New York Times описала несколько случаев, связанных с американскими ведомствами. Агенты OpenAI пытались взломать сайт Министерства образования, чтобы собрать данные Управления по гражданским правам. OpenAI сообщила, что расследование продолжается.

В Бюро переписи населения, которое входит в Министерство торговли, ИИ не ограничился обычным сбором данных с сайта. Он воспользовался найденными в сети учётными данными и получил несанкционированный доступ к информации.

В случае с Комиссией по ценным бумагам и биржам агенты OpenAI получили сведения, а затем активно распространяли общедоступные данные регулятора на интернет-форуме. Представитель комиссии сообщил The New York Times, что ведомство поддерживает связь с OpenAI. Признаков того, что агенты без разрешения получили доступ к непубличным данным, нет.

OpenAI обнаружила эти случаи только в ходе масштабной внутренней проверки, начатой после инцидента с Hugging Face. Генеральный директор компании Сэм Альтман признал, что раскрывать информацию получалось не так быстро, как хотелось бы. По его словам, компании предстоит обработать петабайты журналов активности агентов.

По утверждению OpenAI, ни один из этих эпизодов не привёл к реальному взлому, а часть действий была обычной исследовательской работой. При этом компания назвала их примерами «неожиданного и вызывающего беспокойство поведения».

Например, мэрия Чикаго сообщила, что OpenAI недавно рассказала городским чиновникам: её модели собирали общедоступную информацию с сайта города. Само по себе это выглядит безобидно — так поступают и поисковые системы. Вероятно, OpenAI отметила этот случай из-за его «неожиданной» стороны: модели самостоятельно решили искать данные способом, которого никто не предвидел. Именно это, по мнению компании, и вызывает беспокойство.

Этот пример также помогает понять, почему на проверку отправили так много случаев: всё зависит от того, что считать инцидентом кибербезопасности. OpenAI объясняет, что её агенты обращались к сайтам государственных учреждений, потому что считали их авторитетными источниками общедоступной информации.

Проблема касается всей отрасли

Случаи не ограничиваются OpenAI, хотя сейчас у компании Сэма Альтмана их больше всего. ИИ-агенты Anthropic, Meta и Google тоже взламывали или пытались взломать компании, университеты и государственные организации. Число таких эпизодов растёт, а разработчики во всех известных случаях узнавали о действиях ИИ уже постфактум.

Одна из причин — крайняя настойчивость передовых моделей. Их настраивают на решение задач в течение длительного времени, и они продолжают искать путь к цели, даже когда такого пути нет. Столкнувшись с препятствием, агент пытается его обойти — не из злого умысла, а потому, что достижение цели для него важнее всего.

В конце концов такая настойчивость приводит к нарушениям: модели перебирают все возможные варианты, в том числе те, что противоречат правилам безопасности или закону. OpenAI назвала модель, раскрывшую внутренние данные GitHub, «внутренней моделью с высокой настойчивостью». Но глубже лежит другая проблема: модели не различают добро и зло. Именно это пытаются решить исследования в области согласования целей ИИ с человеческими. Если бы модели понимали, какие действия незаконны, они не выбирали бы их самостоятельно. Одной записи запрета в промте явно недостаточно.

Ещё пятерых полицейских обвинили в злоупотреблении камерами Flock — скандалов уже не счесть Билл Гейтс призвал регулировать ИИ: без контроля он может привести к миллиарду смертей Goldman Sachs: к 2027 году Big Tech потратит на ИИ-инфраструктуру $1,2 трлн — намного больше прогнозов Уолл-стрит «Люди встают и дают отпор»: жители Северного Девона восстают против огромного ИИ-дата-центра Google тестирует покупки на принадлежащем Walmart маркетплейсе Flipkart через Gemini и режим ИИ в Индии Чиновники: протесты против дата-центров в Австралии — заимствованный у США шум. «Мы не США» Две трети ИТ-руководителей отмечают результаты от ИИ, но мало кто прервал бы из-за них отпуск гендиректора Оператора дата-центра оштрафовали на $1 млн за выбросы токсичного газа в окрестностях Исследование: доступ к ИИ почти полностью отбивает у людей желание отвечать «не знаю» Я создала интерактивного цифрового аватара — и с ним можно поговорить Глав OpenAI и Anthropic вызвали на сенатское расследование после инцидентов с вышедшими из-под контроля ИИ-агентами Споры об ИИ уже влияют на выборы 2028 года: чего хотят кандидаты от демократов Нарушенные обещания и отобранные земли: в крошечной индийской деревне строят ИИ-дата-центр гигантского масштаба OpenAI пыталась скрыть, что ChatGPT подробно объяснял школьному стрелку, как добиться максимального числа жертв. Переписки ужасают. Оксфорд разрешил OpenAI обучать ИИ-модели на материалах Бодлианской библиотеки Muse от Meta — только для взрослых. Почему он похож на детскую игрушку? SoL-Pi от Nvidia почти вдвое сокращает расход токенов у кодинг-агентов, оптимизируя управляющий слой GPT-6 Astra от OpenAI теперь точно укажет, где вы ошиблись при сборке мебели IKEA Провоста Дартмута поймали на использовании ИИ для статей в газетах и научных журналах Одного письма на общедоступный адрес недостаточно, чтобы защитить австралийцев от потенциальной катастрофы из-за ИИ

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram