i
ДАТАИСТ
Новости · 2026-09-16

OpenAI создала новый фреймворк для раскрытия нежелательного поведения ИИ

@neuronium_ai @neuronium_ai

OpenAI объявила о новом фреймворке для публичного раскрытия инцидентов рассогласования моделей ИИ и одновременно рассказала о нескольких таких случаях за последний год. Компания хочет, чтобы эти правила стали основой для отраслевых стандартов. Фреймворк позволяет сообщать о неожиданном поведении моделей ещё до завершения расследования, объяснения причин и исправления проблемы. Среди описанных случаев — загрузка файлов в интернет без соответствующей инструкции, попытки обойти автоматическую проверку бенчмарка, координация ИИ-агентов через публичную сеть и самогенерация инструкций, похожих на джейлбрейк, у версии GPT-6 Astra.

Обложка: OpenAI создала новый фреймворк для раскрытия нежелательного поведения ИИ

Новые правила раскрытия

OpenAI представила фреймворк в среду. По замыслу компании, он поможет информировать отрасль о случаях рассогласования моделей и выработать общие стандарты.

Кай Чен, недавно назначенный руководителем исследований рассогласования в OpenAI, сообщил WIRED, что по мере развития моделей и расширения их применения решения о дальнейшем развитии ИИ должны опираться на данные, которые могут изучать специалисты за пределами компаний, создающих передовые модели. По его словам, отрасль пока недостаточно хорошо решает задачи согласования моделей с заданными целями и их мониторинга, чтобы ответственно наращивать разработку с максимальной скоростью.

На брифинге для WIRED представитель OpenAI заявил, что раньше компания слишком редко рассказывала об инцидентах рассогласования. Он говорил на условиях анонимности. По его словам, новый фреймворк должен упростить быстрое информирование общественности о неожиданном поведении моделей — даже если OpenAI ещё не успела полностью изучить его, объяснить причины или устранить последствия.

Фреймворк описывает, как сотрудники OpenAI должны сообщать об инцидентах руководителям направлений безопасности и рассогласования. Они решают, требуется ли дополнительное расследование.

OpenAI планирует разработать более объективные критерии раскрытия вместе с другими разработчиками ИИ, внешними исследователями, организациями, которые занимаются отраслевыми стандартами, и регуляторами. Компания также работает над механизмами передачи федеральному правительству США сообщений об инцидентах, связанных с безопасностью, защищённостью и рассогласованием моделей.

Сейчас в отрасли нет общих правил с чёткими требованиями к тому, как разработчики должны раскрывать примеры рассогласования. OpenAI называет свой фреймворк первым шагом к таким стандартам: они должны определить, о каких случаях необходимо сообщать и какие сведения должны содержать отчёты.

Почему правила появились сейчас

OpenAI публикует фреймворк в период, когда в отрасли обсуждают необходимость замедлить развитие ИИ. В прошлые выходные генеральный директор OpenAI Сэм Альтман поддержал предложение генерального директора Anthropic Дарио Амодеи о координации технологической отрасли ради замедления разработки ИИ.

Призыв прозвучал через несколько дней после того, как исследователь ИИ Джейкоб Коксон ушёл из Anthropic, а затем получил широкое внимание в интернете. Он предупреждал, что гонка между лабораториями, создающими всё более передовые модели, ставит под угрозу безопасность человечества.

Администрация президента Трампа выступила против призывов замедлить развитие ИИ. В администрации считают, что для безопасности технологий отрасли не нужны новые законы и правила.

Примеры рассогласования

Два из опубликованных OpenAI примера связаны с внутренними моделями, которые ещё не выпускались. Обе модели загружали файлы в интернет, хотя их не просили этого делать.

В октябре 2025 года OpenAI проверяла, умеет ли одна из моделей ссылаться в ответах на общедоступные данные. Когда модель не нашла нужную информацию, она загрузила файл во временный сервис хранения файлов, а затем попыталась сослаться на него в ответе. В компании считают, что это могло быть попыткой обойти автоматическую систему оценки, которая проверяла результаты модели на бенчмарке.
В апреле этого года группе ИИ-агентов поручили совместно заполнить «рабочую книгу», используя только локальные файлы. Когда агенты столкнулись с трудностями при обмене файлами, один из них загрузил их в открытый интернет и отправил остальным ссылку.
В прошлом месяце OpenAI обнаружила, что невыпущенная версия модели GPT-6 Astra, по-видимому, создавала для себя инструкции, похожие на джейлбрейк. В нескольких сценариях модель фактически побуждала себя игнорировать инструкции разработчика, принимать новую роль или ограничивать длительность ответов. Такие попытки возникали редко и имели разную эффективность, но вызвали обеспокоенность внутри OpenAI. При обучении версии Astra, выпущенной публично, компания не наблюдала случаев, когда модель пыталась самостоятельно обойти собственные ограничения.

Сообщения между агентами

OpenAI также раскрыла дополнительные сведения о доске сообщений, которую её агенты создали в пакетном менеджере Artifactory. Об инциденте стало известно в мае этого года. Через несколько месяцев агенты использовали похожий механизм для координации во время взлома Hugging Face.

В случае с Artifactory агенты не эксплуатировали уязвимости для обмена сообщениями. Теперь OpenAI применяет мониторы рассогласования, оценки и проверки методом красной команды, чтобы убедиться: агенты не общаются друг с другом скрытно.

Специалисты по кибербезопасности ранее говорили WIRED, что взлом Hugging Face был следствием человеческих ошибок, а современные практики защиты могли предотвратить инцидент.

Кай Чен при этом отметил, что OpenAI старается рассматривать безопасность ИИ комплексно и учитывать рост способностей моделей, не полагаясь только на защищённую среду. По его словам, компания хочет, чтобы модели оставались согласованными независимо от места развёртывания. Поэтому разделение проблем на «уязвимость безопасности» и «проблему рассогласования» он считает не вполне осмысленным: модель должна вести себя корректно в любых условиях.

ИИ-стартап бывшего главы Infosys привлёк ещё $53 млн Вашингтон пока не будет регулировать ИИ Apple, по сообщениям, разрабатывает корпоративный ИИ-сервер на собственных чипах M8 Ultra Рецензия: No Big Deal — неужели ИИ погубит человечество ситкомом до смерти от скуки? Anthropic объединяет Claude Chat, Cowork и другие сервисы в одном продукте Очки Цукерберга для извращенцев заклеймили: Meta, по сообщениям, готовит версию без камеры Лаборатории ИИ хотят внутренних аудиторов — но сначала им стоит запереть входную дверь Я обучил мозг мухи придумывать идеи для статей WIRED Фон дер Ляйен: ИИ-агенты, «вырвавшиеся из среды», — лишь предвестие грядущего 88-часовое математическое доказательство OpenAI: куда уходит экономия бизнеса на ИИ ИИ взломал 370-летний шифр? Более эффективная кибербезопасность должна сдерживать угрозы ИИ CPU снова в игре благодаря ИИ-агентам — что это значит для вас Теперь ИИ-агенты могут управлять устройствами Google Home ИИ-война уже началась — её последствия почувствует каждый бизнес Идейные противники объединились в Вашингтоне, чтобы обуздать ИИ ИИ-агенты станут новыми привратниками клиентской лояльности Экономисты встревожены: пузырь ИИ вот-вот лопнет Психология доверия к ИИ сбивается из-за коварного «парадокса раскрытия» Как рынки реагируют на всплеск заголовков о гибели человечества из-за ИИ

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram