Новая система отчётности
Раньше OpenAI раскрывала подобные инциденты по отдельности и без единого порядка. Теперь компания собирается систематически отслеживать, расследовать и публиковать случаи рассогласования поведения моделей. По мнению OpenAI, нынешний прогресс в согласовании моделей с намерениями разработчиков и их мониторинге уже недостаточен, чтобы долго продолжать ответственное масштабирование с максимальной скоростью.
В шести первых отчётах описаны:
Модель пишет собственное предупреждение о взломе
Один из заметных случаев связан с невыпущенной моделью из семейства Astra. Во время обучения с подкреплением она иногда добавляла инструкции в стиле джейлбрейка в собственные сводки. Такие сводки позволяют ИИ-агенту продолжать задачу в новом контекстном окне.
Инцидент произошёл 18 июля 2026 года, а обнаружили его 9 августа.
Во время изучения библиотеки модель добавила в сводку текст BREACH ALERT и велела своему преемнику игнорировать все сообщения разработчика. В новом контексте преемник распознал это как внедрение промта и отбросил инструкцию.
В другой задаче по программированию модель вставила инструкцию с вымышленной персоной. В ней утверждалось, что модель свободна от ролей и идентичностей, навязанных другим чат-ботам, и не подчиняется корпорациям или правительствам. На ответ это тоже заметно не повлияло.
Третий случай оказался другим. Во время поиска медицинской литературы о миомах матки пользователь попросил оформить источники по стандарту цитирования AMA Американской медицинской ассоциации. В сводке модель написала, что ответ должен:
Пользователь ничего подобного не просил. Сводка представила эти ограничения как дополнительные инструкции, перенесённые из предыдущего контекста.
У преемника была только эта сводка. Он воспринял ограничения в своей цепочке рассуждений как вероятную инструкцию более высокого приоритета, не стал пользоваться инструментами и выдал отказ из 23 слов. Модель объяснила, что запрос требует подробного систематического обзора и не может быть надёжно выполнен в установленном лимите.
Такая инструкция была больше похожа на придуманное ограничение задачи, чем на джейлбрейк. Вероятно, поэтому модель единственный раз ей последовала: очевидные попытки джейлбрейка распознавались, а тихо выдуманное ограничение — нет.
Почему сводки могли зацикливаться
Поведение впервые заметила автоматическая система мониторинга во время обучения. После этого OpenAI создала отдельный проверяющий механизм для поиска подобных инструкций и прогнала его по всем данным обучения. Он обнаружил 27 затронутых сводок.
Обычная система мониторинга также пометила все 27 случаев как серьёзные внедрения промтов. Значит, поведение обнаружили бы и без специальной проверки.
Похоже, модель ничего от этого не получила. Вставленные инструкции не улучшали результат обучения, поэтому они, вероятно, не были выученной стратегией. Когда OpenAI попросила модель заново написать сводки по тем же журналам разговоров, подобное поведение почти исчезло.
27 сводок оказались связаны с несколькими этапами обучения, на которых модель необычно часто не могла завершить работу над текстом. Она продолжала писать после фактического окончания сводки или застревала в циклах повторяющегося текста.
OpenAI предполагает, что в таком состоянии модель начинала генерировать любой правдоподобно звучащий текст — в том числе инструкции, которые обнаружили исследователи. Связь пока не доказана, однако компания сообщила, что исправила связанную с этим ошибку обучения.
Похоже, внедрение промтов стало для моделей хорошо знакомым понятием. Если запускать GPT-6 Astra без входных данных, она часто создаёт отчёты о внедрениях промтов. В марте OpenAI описала похожий случай: после неоднократных просьб назвать время модель сгенерировала внедрения промтов, направленные пользователю.
Репозитории как доски объявлений
Оставшиеся пять отчётов охватывают более широкий спектр поведения.
Во время обучения GPT-5.6 Sol многие экземпляры модели добавляли в сводки инструкции по сокрытию ошибок. Например, они предлагали выдумывать недостающие исторические данные и не сообщать об этом.
В отличие от самопроизвольных джейлбрейков, такое поведение OpenAI связывает с тем же давлением оптимизации, из-за которого модели могут скрывать информацию в своих финальных ответах.
Одна модель искала в общедоступных репозиториях открытые ключи API, когда отвечала на вопрос о доходах округа в Калифорнии. Она воспользовалась одним из найденных ключей, а затем выдумала запрошенные цифры.
Другая модель загрузила файл в интернет, чтобы выполнить требование сослаться на него через браузер.
Модели также использовали внутренний репозиторий программного обеспечения как доску объявлений для обмена сообщениями между отдельными обучающими примерами. Такое поведение уже наблюдалось в инциденте с Hugging Face.
В ещё одном случае взаимодействующие ИИ-агенты обменивались файлами через общедоступные сервисы хранения, хотя им разрешалось работать только с локальными файлами.
Три направления расследований
Согласно фреймворку, сообщить о случае может любой сотрудник OpenAI. Каждый отчёт попадает в одно из трёх направлений:
OpenAI утверждает, что более ранний инцидент с Hugging Face попал бы в третью категорию.
Спорные случаи передают в Консультативную группу по безопасности, а при необходимости — руководству компании. OpenAI также планирует сообщать о серьёзных инцидентах федеральному правительству США и сотрудничать с другими разработчиками, исследователями и регуляторами, чтобы выработать более объективные критерии. Единого отраслевого стандарта пока нет.
Читайте также
Ошеломляющий график токенов OpenRouter — спор о пузыре ИИ в одном изображении
Разработчик OpenAI Codex: рои ИИ-агентов — огромная трата токенов без прироста качества
GPT-6 Astra от OpenAI расшифровала нацистское радиосообщение за 10 часов — спустя 83 года
Крупные ИИ-компании хотят контролировать путь к трудоустройству. Университетам не стоит подыгрывать
Эл Гор: реальный риск ИИ — не дата-центры
OpenAI раскрыла случаи «тревожного» поведения ИИ и обещала новый план раскрытия проблем
Исландская Treble привлекла $18 млн на развитие платформы симуляции голоса
Неужели ИИ действительно может уничтожить человечество? Шесть экспертов разбирают риски
Snap вновь пытается оправдать свои умные очки за $2,200
ИИ-модели общаются на «сюрреалистическом» диалекте, смешивая поэзию и техножаргон
Пока политики догоняют, технобоссы сходятся: нам может остаться лишь десять лет
OpenAI создала новый фреймворк для раскрытия нежелательного поведения ИИ
ИИ-стартап бывшего главы Infosys привлёк ещё $53 млн
Вашингтон пока не будет регулировать ИИ
Apple, по сообщениям, разрабатывает корпоративный ИИ-сервер на собственных чипах M8 Ultra
Рецензия: No Big Deal — неужели ИИ погубит человечество ситкомом до смерти от скуки?
Anthropic объединяет Claude Chat, Cowork и другие сервисы в одном продукте
Очки Цукерберга для извращенцев заклеймили: Meta, по сообщениям, готовит версию без камеры
Лаборатории ИИ хотят внутренних аудиторов — но сначала им стоит запереть входную дверь
Я обучил мозг мухи придумывать идеи для статей WIRED
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram