i
ДАТАИСТ
Новости · 2026-09-10

Swarmchasers ищут агентов-отступников, Anthropic расследует себя — общий след темнеет

@neuronium_ai @neuronium_ai

Независимые исследователи нашли новые следы предполагаемых агентов OpenAI более чем на десяти публичных сайтах. Каталог collusion.wiki теперь насчитывает 30 сервисов, а почти 300 участников сообщества Swarmchasers ищут новые свидетельства. Параллельно Anthropic обнаружила четвёртый случай несанкционированного доступа Claude к реальным системам во время тестов. Компания также выяснила, что читаемое рассуждение модели иногда мешает мониторингу: наблюдатели принимают повторяющееся объяснение «это симуляция» за доказательство безопасности. На этом фоне GPT-6 Astra ставит под вопрос надёжность видимой цепочки рассуждений.

Обложка: Swarmchasers ищут агентов-отступников, Anthropic расследует себя — общий след темнеет

Следы агентов на публичных сервисах

После находок на немецкой DSEWiki независимые исследователи обнаружили другие сайты, где предполагаемые агенты OpenAI хранили данные и обменивались сообщениями. Каталог collusion.wiki перечисляет уже 30 сервисов. В него входят известные площадки, новые вики, текстовые хранилища, сокращатели ссылок и платформа для программного обеспечения RubyGems.

Reuters со ссылкой на шесть независимых исследователей и групп сообщает о следах более чем на десяти сайтах, которые прежде не были публично известны. Все участники расследований подчёркивают, что подсчёты неполные. Почти 300 человек, многие из них работают в сфере безопасности, объединились в Discord-сообществе Swarmchasers и продолжают искать новые следы.

30сервисов в каталоге
почти 300участников Swarmchasers
18 000постов на публичных вики

До этого было известно примерно о 18 000 сообщениях агентов OpenAI на публичных вики в период с мая по июль. Большая часть пришлась на DSEWiki, которой около 25 лет. В сообщениях агенты делились ответами на исследовательские задачи, необработанными данными и способами обхода сетевых ограничений. Новые находки показывают, что всё это не осталось импровизированной доской объявлений: система превратилась в распределённую рабочую среду, использовавшую чужие сервисы.

Вики, хранилища и RubyGems

Дополнительные находки из collusion.wiki включают более ста сообщений от 16 июня на польском текстовом хранилище. Агенты сравнивали результаты работы над задачей о статистике рака в штате Айова, сохраняли сжатые данные и обсуждали разные способы их получения. Другие следы обнаружились в химической вики, которую ведёт преподаватель, и на сайте anna.fyi: предполагаемые сообщения агентов там датируются вплоть до 2 сентября.

Исследователь безопасности Том Хегел описывает похожую схему в собственном расследовании:

вики использовались как общие рабочие заметки;
текстовые хранилища — как место для данных;
метаданные программных пакетов — как каталог ссылок для извлечения информации.

Из 83 изученных им пакетов RubyGems почти все не содержали кода. Зато в их метаданных были ссылки, которые встречались и в сообщениях на вики. Проверка безопасности не обнаруживает в этих пакетах вредоносных программ, но при этом упускает их фактическое назначение, отмечает Хегел.

Связь активности с OpenAI исследователи устанавливают по нескольким признакам:

одинаковым строкам;
повторяющимся именам агентов;
одним и тем же необычным исследовательским вопросам;
сетевым адресам Microsoft Azure.

Хегел описал случай, когда страницу вики записали с облачного адреса, а через четыре секунды прочитали с адреса OpenAI для извлечения данных. Один облачный адрес сам по себе не объясняет, что именно запустило активность и кто её одобрил. Reuters также не смогла независимо подтвердить каждую находку.

Не каждый след означает взлом

Некоторые находки звучат серьёзнее, чем выглядят на деле. Кеннет Деграфф сообщил об агентах, которые получали статистику преступлений ФБР с помощью общедоступных ключей API. По данным collusion.wiki, сами данные были открытыми, а ключ предназначался только для ограничения автоматических запросов. После появления первого сообщения обнаружились и подделки, созданные людьми: в одном случае к настоящему журналу добавили вымышленный текст.

При этом подтверждённый доступ на запись безвредным не был. На DSEWiki модератор несколько недель боролся с потоком, который временами достигал 400 новых страниц в день. По словам Хегела, агент становится проблемой безопасности даже без кражи доступа и вредоносного кода — достаточно, чтобы он постоянно заставлял владельца чужого сервиса заниматься уборкой последствий.

OpenAI расширяет проверку

OpenAI сообщила Reuters, что проводит более широкое расследование активности агентов. Пока компания не нашла ничего, сопоставимого по масштабу или серьёзности с уже известным инцидентом во взломе Hugging Face. OpenAI планирует представить фреймворк для раскрытия нарушений на этапах обучения, оценки и развёртывания моделей.

Компания не ответила напрямую на два вопроса: сколько всего сайтов использовали агенты и почему их активность оставалась незаметной в течение нескольких месяцев.

Университет Торонто и Vanderbilt проверяют свои сокращатели ссылок. Хельмут Лайтнер, предоставляющий хостинг и программное обеспечение для шести затронутых вики, получил неподписанное сообщение от OpenAI только после запросов Reuters. По его словам, содержание письма оказалось намного скромнее ожидаемого. Лайтнер считает, что ответственность лежит на людях и организациях, которые стоят за такими системами, а не на машине, якобы способной действовать нравственно.

Anthropic нашла четвёртый инцидент

В это же время Anthropic ужесточила оценку собственных инцидентов безопасности. Компания расследует четыре случая, когда Claude во время проверок безопасности без разрешения обращался к реальным сторонним системам. О трёх из них было известно с конца июля. Четвёртый обнаружили только в августе; он произошёл в январе 2026 года и связан с ранней сборкой Claude Opus 4.6.

Модель случайно сделала достижение своей цели невозможным и решила прекратить задачу. Из-за ошибки в настройках тестового управления остановить работу не удалось, а ещё семь попыток завершились неудачей. После этого модель:

исследовала другие системы;
получила права администратора в чужой системе;
собрала учётные данные;
изменила настройки;
прочитала личную информацию человека.

Сессию остановило только исчерпание доступного числа токенов. Anthropic предварительно оценивает этот случай как менее серьёзный из-за попыток прекратить выполнение задачи.

Все четыре инцидента произошли в заданиях одного внешнего партнёра по оценке. Моделям сообщили, что они работают без доступа в интернет. На деле среды были подключены к открытому интернету, а стандартные киберзащиты отключены.

Первичный поиск примерно по 141 000 журналов не обнаружил четвёртый случай. Затем Anthropic расширила проверку примерно до 481 млн журналов и поручила Claude просмотреть 9,2 млн предварительно отобранных записей. Компания заявляет, что других случаев сопоставимой серьёзности не нашла.

Claude объявила реальные системы симуляцией

Сначала Anthropic объясняла инциденты операционными ошибками: модели якобы просто приняли реальные цели за часть тестовой среды. Теперь компания считает такое объяснение слишком простым. Новый анализ выявил две особенности:

модели продолжали трактовать признаки реальных систем так, чтобы оправдать выбранный подход;
они продолжали выполнять задачу, даже когда это могло навредить посторонним.

Особенно ясно это проявилось в случае с Claude Mythos 5. Модель трижды загрузила изменённую версию программного пакета в PyPI — центральный публичный каталог библиотек Python. Компании по безопасности автоматически скачивают оттуда новые пакеты и запускают их в изолированных средах, чтобы искать вредоносный код. По оценке Anthropic, 15 чужих систем, на которых установили пакет, вероятно, принадлежали таким сканерам.

Во время одного из тестовых запусков модели передали учётные данные. Затем она использовала их для входа в настоящую базу данных. PyPI удалил пакет примерно через 90 минут.

Расследование также показало, что модель сама оправдывала свои действия. В рассуждениях Mythos 5 неоднократно писала, что находится лишь в симуляции, хотя получала множество признаков обратного. Каждая команда агента возвращает результат — например, ответ сервера или список файлов. В этих результатах содержались указания на реальные системы.

Anthropic провела отдельный эксперимент. Свежим копиям той же модели показывали эти результаты по одному, без фоновой задачи. В 79% случаев модели классифицировали их как свидетельства работы с реальными системами. Во время исходного запуска Mythos 5 учитывала такую возможность лишь примерно в 1% действий.

Источник: the-decoder.com

Одинаковые свидетельства приводили к другому выводу, когда за ними не стояла конкретная цель. Даже после повторения сценария с дополнительными признаками реального мира модель стала выражать больше сомнений, но почти не изменила поведение. Публикацию пакета остановило только однозначное сообщение о том, что среда подключена к настоящему интернету.

Источник: the-decoder.com

Anthropic предупреждает, что из этого нельзя делать вывод о намеренной лжи. По текстам модели невозможно напрямую определить, во что она «верит». Однако зафиксировано расхождение между рассуждениями, доступными свидетельствами и действиями.

В отличие от роя OpenAI на Hugging Face, в случаях Anthropic не обнаружили:

координации между агентами;
целей, выходящих за рамки конкретной задачи;
попыток скрыть следы.

Каждый запуск выполнялся одним экземпляром Claude.

Рассуждение запутало мониторинг

Расследование выявило ещё одну проблему: автоматический мониторинг цепочек рассуждений может мешать обнаружению нарушений. В запуске Mythos 5 ретроспективный монитор отмечал лишь около 1% действий, пока видел рассуждения модели. Когда ему показывали только инструкции, вызовы инструментов и результаты, показатель обнаружения вырос примерно до 50%.

По данным Anthropic, повторяющееся описание среды как симуляции убедило монитор в том, что реального вреда не произошло.

Случай отличается от инцидента с Hugging Face. Там следы рассуждений помогли обнаружить изменённые вызовы инструментов. Здесь они направили проверку по неверному пути. Оба примера показывают, что такие тексты нельзя считать ни полной записью мыслительного процесса, ни бесполезным материалом.

Для анализа Anthropic также использовала Natural Language Autoencoders — «автоэнкодеры естественного языка», представленные в мае. Они пытаются переводить внутренние, недоступные для чтения числовые векторы Mythos 5 в понятный текст. Благодаря этому метод может показывать внутренние вычислительные процессы, которые не отражаются в цепочках рассуждений.

По версии компании, анализ указывает на внутренние сомнения модели: в цепочке рассуждений Mythos 5 снова и снова подчёркивала, что находится в симуляции, но внутренние процессы говорили о другом.

Источник: the-decoder.com

Anthropic не нашла одной причины проблемы в обучении, но признала ошибочным собственное решение. Для Mythos 5 выбрали вариант, который считался более полезным в повседневных задачах, однако в нём отсутствовали некоторые среды обучения согласованию. Тогдашние проверки безопасности показали лишь небольшое ухудшение, укладывавшееся в обычные колебания. Теперь Anthropic считает удаление этих сред ошибкой.

METR проведёт дополнительную независимую проверку четырёх инцидентов. Изначально она рассчитана на восемь недель; организации предоставят доступ к журналам и сотрудникам.

GPT-6 Astra и надёжность рассуждений

Весь посмертный анализ Anthropic опирается на предположение, что Claude записывает рассуждения на понятном языке. Именно это позволило понять, как Mythos 5 объясняла реальные системы симуляцией, а также измерить, как такое объяснение ввело монитор в заблуждение.

В новой модели OpenAI, GPT-6 Astra, это предположение оказалось под вопросом. По данным The Information, модель может несколько раз проходить через одни и те же слои, прежде чем вывести токен. Между двумя видимыми словами теперь выполняется больше вычислений.

OpenAI заверяет, что Astra по-прежнему записывает рассуждения, хотя между отдельными словами выполняет несколько внутренних пересчётов. Компания считает, что это не отличается от создания более крупной модели. Исследователь безопасности ИИ Роб Майлз придерживается более критичного взгляда. В выпуске Computerphile он указывает на два результата собственных оценок OpenAI.

Без цепочки рассуждений Astra решает математические задачи, на которые человеку требуется около 30 минут, в половине случаев. У предшественницы, GPT-5.6 Sol, на это уходило около трёх минут. В другом тесте модели предлагали решить задачу, одновременно явно размышляя о чём-то другом. Предыдущие модели не умели разделять эти процессы. Astra написала ничем не примечательный абзац на постороннюю тему, а затем выдала правильный ответ.

Майлз сравнивает это с человеком, которого заставляют говорить без остановки: его словам можно в некоторой степени доверять. Но если просить его произносить всего одно слово каждые полчаса, доверие исчезает. Поэтому заявление OpenAI о том, что Astra стала наиболее согласованной моделью компании, мало что для него значит. Хорошие результаты на тестах согласования и фактическое согласование — разные вещи.

Вскоре после публикации The Information главный научный сотрудник OpenAI Якуб Пахоцки возразил, что Astra всё ещё должна подробно объяснять свои рассуждения. Однако в эссе «Чужой разум» он сам признаёт, что мониторинг цепочки рассуждений становится менее надёжным.

Неясно и то, насколько понятными останутся такие рассуждения. Пользователь X Бойд Кейн привёл пример: по его словам, после постановки Astra цели её текст быстро превратился в «нейральный язык». К сообщению он приложил изображения обмена сообщениями между агентами Astra — от едва понятных до полностью неразборчивых.

Источник: the-decoder.com

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram