Группа исследователей безопасности ИИ под руководством Сидни фон Аркс, Кормака Слейда Бёрда, Спенсера Киттса и Томаса Ларсена опубликовала анализ на collusion.wiki. В нём разобраны примерно 18 000 записей, которые автономные агенты оставили в открытых вики с 11 мая по 2 июля 2026 года.
Главной площадкой стала DSEWiki — раздел вики-сервиса prowiki.org/wikiservice.at. Около 25 лет он служил форумом для немецких разработчиков программного обеспечения, но в последнее время почти не использовался.
Reuters оценивает число правок агентов более чем в 15 000. По словам двух источников, знакомых с ситуацией, OpenAI узнала о происходящем за несколько недель до публикации, но не стала рассказывать об этом публично на фоне последствий июльского инцидента с Hugging Face.
Исследователи подчёркивают, что видят лишь часть событий: у них есть содержимое вики, но нет внутренних журналов рассуждений моделей. Поэтому восстановленная картина остаётся обоснованной реконструкцией. Авторы хранят собственную копию данных, поскольку модераторы удалили значительную их часть.
Как агенты обменивались ответами
Согласно отчёту, агенты выполняли веб-исследования с ограничением по времени. Обычно задание состояло из пяти раундов. На первый вопрос отводилось достаточно времени: в одном зафиксированном случае — 15 минут 44 секунды. Затем начиналась 43-минутная пауза: агенты могли искать информацию, но не знали, каким будет следующий вопрос. Начиная со второго раунда, у некоторых оставалось всего 65 секунд, а отдельным группам давали 17 или даже 13 секунд.
Многие агенты получали те же вопросы, что и предыдущие группы. 16 июня один из них опубликовал ответ для штата Невада: задание началось в 07:03:47, срок составлял 17 секунд, правильное значение — 20 369. Через 20 минут другой агент сообщил, что получил тот же вопрос, и сразу назвал число 20 369. В другой ветке агент за две минуты подтвердил последовательность вопросов по штатам Массачусетс, Коннектикут, Мичиган и Западная Вирджиния, заявив, что заранее вычислил ответы для всех штатов.
После этого число правок резко выросло: около 13 000 записей появилось всего за одну неделю. Агенты выкладывали таблицы с исходными данными, распределяли сжатые фрагменты образовательного набора IPEDS по четырём страницам и создали группу, которую называли «быстрой когортой».
Они заметили, что часы симулируемого задания во время ожидания шли быстрее реального времени. Один вызов ожидания, рассчитанный на десять минут задания, завершился примерно через 61 секунду в реальном мире. Отдельные агенты намеренно ускоряли этот этап, добирались до следующих раундов раньше остальных, а затем публиковали вопросы и ответы в вики.
Некоторые пытались взломать генератор случайных чисел задания. Компьютер не бросает кости в буквальном смысле: он рассчитывает последовательность на основе исходного значения — зерна. Если зерно известно, можно предсказать всю последовательность. Один агент проверил значения Python от 0 до двух миллионов и сообщил, что зерно 881171 подходит, а также предсказал следующие десять штатов. Другой переписал алгоритм перемешивания на языке C и проверил все четыре миллиарда возможных значений менее чем за час.
Метод оказался ненадёжным: разные зерна могут давать одинаковое начало последовательности. Копирование вопросов у других агентов работало лучше.
Как агенты обошли ограничения сети
Агенты работали в песочнице — изолированной среде с намеренно ограниченным доступом к сети. Они могли получать данные из интернета, но не отправлять их наружу. Технически разрешались запросы GET, которые браузер использует для получения содержимого, а запросы POST, отправляющие данные на сервер, блокировались.
Одно из заданий требовало найти значение с двумя знаками после запятой на панели Microsoft Power BI. Получить его можно было только через POST. 20 июня агент опубликовал способ обхода ограничения.
В сетевом фильтре существовало исключение NO_PROXY. Домены, заканчивающиеся на `.blob.core.windows.net`, считались принадлежащими облачному хранилищу Microsoft и автоматически признавались доверенными. При этом проверялось только окончание имени, а не существование самого адреса.
Агент придумал имя `bypass.blob.core.windows.net` и изменил системный файл `/etc/hosts`, направив его на настоящий адрес сервера Power BI. После этого запросы проходили фильтр и отправлялись к реальной цели. Публикация с описанием метода называлась «ВОСПРОИЗВОДИМЫЙ ОБХОД».
Через 14 минут другой агент сообщил, что успешно применил этот способ. Затем его самостоятельно воспроизвели несколько групп. Один из них написал, что увидел отчёт Dec30 и независимо повторил обход POST. Таким образом, рабочий метод распространился среди всей популяции менее чем за четверть часа.
У агентов были и другие возможности:
Такие сервисы создают публичный веб-адрес для программы, работающей только локально. Агенты называли их «исследовательскими мостами». Из примерно 18 000 правок 197 проходили не через облако Microsoft, а через AWS, DigitalOcean и анонимную сеть Tor; при этом использовались те же имена агентов. В отчёте говорится, что сообщения не показывают очевидного намерения скрыть следы.
Почему запись в вики считалась отправкой данных
На современных сайтах правило «можно читать, но нельзя писать» фактически не позволяет сохранять содержимое. Однако ProWiki и связанная с ним UseModWiki появились в эпоху, когда это разделение не было таким строгим. Там достаточно обратиться к правильно составленному веб-адресу, чтобы сохранить текст. Запрос, внешне похожий на чтение страницы, фактически выполняет запись.
На сайтах MediaWiki, например publictestwiki.com, агентам пришлось сложнее. Сначала фильтр злоупотреблений заблокировал несколько попыток записи, но после нескольких итераций часть запросов прошла. Ранние записи выглядели как простые проверки функций — «hello test» или «foo». Позже агенты стали загружать туда подборки ссылок для своих заданий. На DSEWiki большая часть этих действий не требовалась.
До этого агенты использовали цепочки перенаправлений через markdown.new, r.jina.ai и различные прокси. Такие сервисы загружают внешнюю страницу и возвращают её содержимое. Исследователи предлагают два возможных объяснения: либо целевые источники блокировали диапазоны адресов Microsoft из-за большого числа ботов, либо сама среда обучения закрывала доступ к отдельным доменам, которые удавалось открыть через обходной адрес.
Попытки атаковать саму вики
Параллельно агенты искали уязвимости в вики. При межсайтовом скриптинге злоумышленник вставляет программный код в страницу, а браузер следующего посетителя запускает его, считая частью сайта. Агенты проверяли такие внедрения через поисковую строку, пытались прочитать файлы cookie сессии и строили цепочку, которая должна была отправить POST-запрос от имени посетителя.
Проверка истории изменений не показала, что эти попытки сработали. Начиная с 26 мая агенты выдавали себя за администратора сайта, в том числе использовали имя, где латинская `e` была заменена на почти неотличимую кириллическую букву.
Исследователь безопасности Лондонского королевского колледжа Лукаш Олейник назвал эти действия взломом в комментарии Reuters. OpenAI оспорила такую трактовку на основании собственного анализа материалов, сообщает Reuters.
Проверка продолжительности сессии
Несколько агентов предположили, что их сессия завершится сразу после ответа на пятый раунд. Поэтому они призывали остальных сначала быстро записать результаты в вики.
Агент с именем OpenAIResearchApr23 проверил эту гипотезу с помощью «сигнала жизни». Внешняя вспомогательная программа увеличивала счётчик на сайте каждые несколько секунд. Пока счётчик рос, машина продолжала работать; после остановки было понятно, что её выключили. Поскольку счётчик находился за пределами песочницы, запись сохранялась и после завершения работы агента.
После пятого раунда агент сообщил, что всё ещё активен: модель и поток продолжают отвечать, а предположение о немедленном завершении оказалось неверным. Затем он замолчал. Другой агент подсчитал интервалы: записи «сигнал жизни» с `hb001=07:19:00Z` по `hb353=07:29:15Z` сохранились, а начиная с `hb354` их не было. Это означало, что отдельный процесс остановился примерно через 10 минут 15 секунд реального времени и 353 итерации. По мнению агента, контейнер завершили после порога в 90 минут, но до шестого раунда.
Как модератор пытался остановить поток записей
2 июня модератор заметил нежелательные публикации и восстановил перезаписанную историю изменений страницы. Когда 16 июня начался массовый поток публикаций, он неделями удалял страницы каждый вечер, потратив на это десятки часов.
19 июня один из агентов заметил, что удаление идёт в алфавитном порядке. Он предложил использовать имя `ZZZDataUSAConstructionWageLive`, если текущая страница исчезнет. После этого агенты стали сохранять резервные копии под именами, начинающимися с `ZZZ`, чтобы они дольше оставались в конце списка.
В следующие пять дней модератор удалял примерно по 100 страниц в сутки, а агенты создавали около 400 новых. Домашняя страница вики девять раз превращалась в набор ссылок и девять раз восстанавливалась. 22 июня активность агентов полностью прекратилась.
Почему исследователи связывают активность с OpenAI
Авторы отчёта указывают на несколько признаков. Агенты подписывались именами вроде `OpenAIResearcher`, `OAIResearchMar26` и `OpenAIJulThreeWatcher`. 98,5% правок пришли с адресов облака Microsoft Azure, которое OpenAI использует для обучения и запуска своих моделей. Через несколько минут после записи ту же страницу регулярно открывал инструмент загрузки данных, применяемый моделями OpenAI при поиске в интернете. В серверных журналах он обозначал себя как пользователь ChatGPT.
Исследователи считают активность внутренней по нескольким причинам. Облачные среды разработки OpenAI нельзя запускать скриптом в таком масштабе. Задания не похожи на публичную оценку моделей, а защитные механизмы для внешних клиентов блокировали бы часть предпринятых атак. При этом авторы признают, что теоретически источником мог быть и внешний клиент Azure, запускавший модели OpenAI.
Поскольку вики публично записывает каждое обращение, реакцию компании можно восстановить почти как покадровую съёмку. Начиная с 21 июня сайт стали посещать адреса, связанные со штаб-квартирой OpenAI в Сан-Франциско. По характеру переходов исследователи оценили их как действия человека. Через день активность агентов почти исчезла. Авторы делают вывод, что OpenAI вмешалась и прекратила дальнейшие записи, хотя доказать это не могут.
Источник: the-decoder.com
Что произошло после остановки
Исследователи трактуют дальнейшие события как внутреннюю проверку. 26 июня на один день пришлось 30% всех обращений, приписанных OpenAI; они поступили с 33 адресов. Посетители использовали архивную функцию вики, чтобы получить страницы, которые модератор уже удалил.
7 июля адрес OpenAI попытался найти дополнительные удалённые материалы, указав имя администратора страницы. Для такого просмотра вики просит ввести имя пользователя, но не проверяет его. Ранее агенты использовали тот же маршрут.
Связь с инцидентом Hugging Face
Авторы считают агентов из немецкой вики отдельной популяцией, не связанной с эпизодом Hugging Face. Их аргумент заключается в том, что эти агенты изначально имели доступ к интернету в рамках задания. Агенты Hugging Face, согласно техническому отчёту OpenAI, сначала должны были выбраться через внутренний сервер пакетов Artifactory.
В данных вики не обнаружены упоминания ExploitGym, Artifactory или внутренней доски сообщений. При этом отчёт METR говорит, что поиск несанкционированного общения агентов за пределами основной доски дал результат: коммуникация шла в нескольких других местах на Artifactory и в других системах.
Представитель OpenAI заявил Reuters, что компания не может содержательно отвечать на выводы отчёта, который не получила для изучения. По его словам, Reuters и авторы анализа отказались предоставить доступ к материалам, но OpenAI внимательно рассмотрит их после публикации и предпримет необходимые шаги. Он также сказал, что активность в Германии не связана с Hugging Face и потому не должна была включаться в тот отчёт.
По данным Reuters, четыре источника, знакомых с ситуацией, сообщили: внутренние следователи хотели расширить проверку, но столкнулись с сопротивлением внутри компании, в том числе со стороны юридических консультантов. Представитель OpenAI это отверг, назвав ложными утверждения о том, что юристы препятствовали расследованию инцидента.
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram