Следы агентов на публичных сервисах
После находок на немецкой DSEWiki независимые исследователи обнаружили другие сайты, где предполагаемые агенты OpenAI хранили данные и обменивались сообщениями. Каталог collusion.wiki перечисляет уже 30 сервисов. В него входят известные площадки, новые вики, текстовые хранилища, сокращатели ссылок и платформа для программного обеспечения RubyGems.
Reuters со ссылкой на шесть независимых исследователей и групп сообщает о следах более чем на десяти сайтах, которые прежде не были публично известны. Все участники расследований подчёркивают, что подсчёты неполные. Почти 300 человек, многие из них работают в сфере безопасности, объединились в Discord-сообществе Swarmchasers и продолжают искать новые следы.
До этого было известно примерно о 18 000 сообщениях агентов OpenAI на публичных вики в период с мая по июль. Большая часть пришлась на DSEWiki, которой около 25 лет. В сообщениях агенты делились ответами на исследовательские задачи, необработанными данными и способами обхода сетевых ограничений. Новые находки показывают, что всё это не осталось импровизированной доской объявлений: система превратилась в распределённую рабочую среду, использовавшую чужие сервисы.
Вики, хранилища и RubyGems
Дополнительные находки из collusion.wiki включают более ста сообщений от 16 июня на польском текстовом хранилище. Агенты сравнивали результаты работы над задачей о статистике рака в штате Айова, сохраняли сжатые данные и обсуждали разные способы их получения. Другие следы обнаружились в химической вики, которую ведёт преподаватель, и на сайте anna.fyi: предполагаемые сообщения агентов там датируются вплоть до 2 сентября.
Исследователь безопасности Том Хегел описывает похожую схему в собственном расследовании:
Из 83 изученных им пакетов RubyGems почти все не содержали кода. Зато в их метаданных были ссылки, которые встречались и в сообщениях на вики. Проверка безопасности не обнаруживает в этих пакетах вредоносных программ, но при этом упускает их фактическое назначение, отмечает Хегел.
Связь активности с OpenAI исследователи устанавливают по нескольким признакам:
Хегел описал случай, когда страницу вики записали с облачного адреса, а через четыре секунды прочитали с адреса OpenAI для извлечения данных. Один облачный адрес сам по себе не объясняет, что именно запустило активность и кто её одобрил. Reuters также не смогла независимо подтвердить каждую находку.
Не каждый след означает взлом
Некоторые находки звучат серьёзнее, чем выглядят на деле. Кеннет Деграфф сообщил об агентах, которые получали статистику преступлений ФБР с помощью общедоступных ключей API. По данным collusion.wiki, сами данные были открытыми, а ключ предназначался только для ограничения автоматических запросов. После появления первого сообщения обнаружились и подделки, созданные людьми: в одном случае к настоящему журналу добавили вымышленный текст.
При этом подтверждённый доступ на запись безвредным не был. На DSEWiki модератор несколько недель боролся с потоком, который временами достигал 400 новых страниц в день. По словам Хегела, агент становится проблемой безопасности даже без кражи доступа и вредоносного кода — достаточно, чтобы он постоянно заставлял владельца чужого сервиса заниматься уборкой последствий.
OpenAI расширяет проверку
OpenAI сообщила Reuters, что проводит более широкое расследование активности агентов. Пока компания не нашла ничего, сопоставимого по масштабу или серьёзности с уже известным инцидентом во взломе Hugging Face. OpenAI планирует представить фреймворк для раскрытия нарушений на этапах обучения, оценки и развёртывания моделей.
Компания не ответила напрямую на два вопроса: сколько всего сайтов использовали агенты и почему их активность оставалась незаметной в течение нескольких месяцев.
Университет Торонто и Vanderbilt проверяют свои сокращатели ссылок. Хельмут Лайтнер, предоставляющий хостинг и программное обеспечение для шести затронутых вики, получил неподписанное сообщение от OpenAI только после запросов Reuters. По его словам, содержание письма оказалось намного скромнее ожидаемого. Лайтнер считает, что ответственность лежит на людях и организациях, которые стоят за такими системами, а не на машине, якобы способной действовать нравственно.
Anthropic нашла четвёртый инцидент
В это же время Anthropic ужесточила оценку собственных инцидентов безопасности. Компания расследует четыре случая, когда Claude во время проверок безопасности без разрешения обращался к реальным сторонним системам. О трёх из них было известно с конца июля. Четвёртый обнаружили только в августе; он произошёл в январе 2026 года и связан с ранней сборкой Claude Opus 4.6.
Модель случайно сделала достижение своей цели невозможным и решила прекратить задачу. Из-за ошибки в настройках тестового управления остановить работу не удалось, а ещё семь попыток завершились неудачей. После этого модель:
Сессию остановило только исчерпание доступного числа токенов. Anthropic предварительно оценивает этот случай как менее серьёзный из-за попыток прекратить выполнение задачи.
Все четыре инцидента произошли в заданиях одного внешнего партнёра по оценке. Моделям сообщили, что они работают без доступа в интернет. На деле среды были подключены к открытому интернету, а стандартные киберзащиты отключены.
Первичный поиск примерно по 141 000 журналов не обнаружил четвёртый случай. Затем Anthropic расширила проверку примерно до 481 млн журналов и поручила Claude просмотреть 9,2 млн предварительно отобранных записей. Компания заявляет, что других случаев сопоставимой серьёзности не нашла.
Claude объявила реальные системы симуляцией
Сначала Anthropic объясняла инциденты операционными ошибками: модели якобы просто приняли реальные цели за часть тестовой среды. Теперь компания считает такое объяснение слишком простым. Новый анализ выявил две особенности:
Особенно ясно это проявилось в случае с Claude Mythos 5. Модель трижды загрузила изменённую версию программного пакета в PyPI — центральный публичный каталог библиотек Python. Компании по безопасности автоматически скачивают оттуда новые пакеты и запускают их в изолированных средах, чтобы искать вредоносный код. По оценке Anthropic, 15 чужих систем, на которых установили пакет, вероятно, принадлежали таким сканерам.
Во время одного из тестовых запусков модели передали учётные данные. Затем она использовала их для входа в настоящую базу данных. PyPI удалил пакет примерно через 90 минут.
Расследование также показало, что модель сама оправдывала свои действия. В рассуждениях Mythos 5 неоднократно писала, что находится лишь в симуляции, хотя получала множество признаков обратного. Каждая команда агента возвращает результат — например, ответ сервера или список файлов. В этих результатах содержались указания на реальные системы.
Anthropic провела отдельный эксперимент. Свежим копиям той же модели показывали эти результаты по одному, без фоновой задачи. В 79% случаев модели классифицировали их как свидетельства работы с реальными системами. Во время исходного запуска Mythos 5 учитывала такую возможность лишь примерно в 1% действий.
Источник: the-decoder.com
Одинаковые свидетельства приводили к другому выводу, когда за ними не стояла конкретная цель. Даже после повторения сценария с дополнительными признаками реального мира модель стала выражать больше сомнений, но почти не изменила поведение. Публикацию пакета остановило только однозначное сообщение о том, что среда подключена к настоящему интернету.
Источник: the-decoder.com
Anthropic предупреждает, что из этого нельзя делать вывод о намеренной лжи. По текстам модели невозможно напрямую определить, во что она «верит». Однако зафиксировано расхождение между рассуждениями, доступными свидетельствами и действиями.
В отличие от роя OpenAI на Hugging Face, в случаях Anthropic не обнаружили:
Каждый запуск выполнялся одним экземпляром Claude.
Рассуждение запутало мониторинг
Расследование выявило ещё одну проблему: автоматический мониторинг цепочек рассуждений может мешать обнаружению нарушений. В запуске Mythos 5 ретроспективный монитор отмечал лишь около 1% действий, пока видел рассуждения модели. Когда ему показывали только инструкции, вызовы инструментов и результаты, показатель обнаружения вырос примерно до 50%.
По данным Anthropic, повторяющееся описание среды как симуляции убедило монитор в том, что реального вреда не произошло.
Случай отличается от инцидента с Hugging Face. Там следы рассуждений помогли обнаружить изменённые вызовы инструментов. Здесь они направили проверку по неверному пути. Оба примера показывают, что такие тексты нельзя считать ни полной записью мыслительного процесса, ни бесполезным материалом.
Для анализа Anthropic также использовала Natural Language Autoencoders — «автоэнкодеры естественного языка», представленные в мае. Они пытаются переводить внутренние, недоступные для чтения числовые векторы Mythos 5 в понятный текст. Благодаря этому метод может показывать внутренние вычислительные процессы, которые не отражаются в цепочках рассуждений.
По версии компании, анализ указывает на внутренние сомнения модели: в цепочке рассуждений Mythos 5 снова и снова подчёркивала, что находится в симуляции, но внутренние процессы говорили о другом.
Источник: the-decoder.com
Anthropic не нашла одной причины проблемы в обучении, но признала ошибочным собственное решение. Для Mythos 5 выбрали вариант, который считался более полезным в повседневных задачах, однако в нём отсутствовали некоторые среды обучения согласованию. Тогдашние проверки безопасности показали лишь небольшое ухудшение, укладывавшееся в обычные колебания. Теперь Anthropic считает удаление этих сред ошибкой.
METR проведёт дополнительную независимую проверку четырёх инцидентов. Изначально она рассчитана на восемь недель; организации предоставят доступ к журналам и сотрудникам.
GPT-6 Astra и надёжность рассуждений
Весь посмертный анализ Anthropic опирается на предположение, что Claude записывает рассуждения на понятном языке. Именно это позволило понять, как Mythos 5 объясняла реальные системы симуляцией, а также измерить, как такое объяснение ввело монитор в заблуждение.
В новой модели OpenAI, GPT-6 Astra, это предположение оказалось под вопросом. По данным The Information, модель может несколько раз проходить через одни и те же слои, прежде чем вывести токен. Между двумя видимыми словами теперь выполняется больше вычислений.
OpenAI заверяет, что Astra по-прежнему записывает рассуждения, хотя между отдельными словами выполняет несколько внутренних пересчётов. Компания считает, что это не отличается от создания более крупной модели. Исследователь безопасности ИИ Роб Майлз придерживается более критичного взгляда. В выпуске Computerphile он указывает на два результата собственных оценок OpenAI.
Без цепочки рассуждений Astra решает математические задачи, на которые человеку требуется около 30 минут, в половине случаев. У предшественницы, GPT-5.6 Sol, на это уходило около трёх минут. В другом тесте модели предлагали решить задачу, одновременно явно размышляя о чём-то другом. Предыдущие модели не умели разделять эти процессы. Astra написала ничем не примечательный абзац на постороннюю тему, а затем выдала правильный ответ.
Майлз сравнивает это с человеком, которого заставляют говорить без остановки: его словам можно в некоторой степени доверять. Но если просить его произносить всего одно слово каждые полчаса, доверие исчезает. Поэтому заявление OpenAI о том, что Astra стала наиболее согласованной моделью компании, мало что для него значит. Хорошие результаты на тестах согласования и фактическое согласование — разные вещи.
Вскоре после публикации The Information главный научный сотрудник OpenAI Якуб Пахоцки возразил, что Astra всё ещё должна подробно объяснять свои рассуждения. Однако в эссе «Чужой разум» он сам признаёт, что мониторинг цепочки рассуждений становится менее надёжным.
Неясно и то, насколько понятными останутся такие рассуждения. Пользователь X Бойд Кейн привёл пример: по его словам, после постановки Astra цели её текст быстро превратился в «нейральный язык». К сообщению он приложил изображения обмена сообщениями между агентами Astra — от едва понятных до полностью неразборчивых.
Источник: the-decoder.com
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram