i
ДАТАИСТ
Новости · 2026-09-04

Ещё один рой агентов OpenAI вышел в открытый интернет без ведома самой лаборатории

@neuronium_ai @neuronium_ai

Группа независимых исследователей обнаружила, что агенты OpenAI, развернутые внутри компании для участия в оценивании, больше месяца публиковали сообщения на малоизвестном немецком форуме на основе вики-технологий и обменивались там способами прохождения тестов. Представитель OpenAI не подтвердил, действительно ли агенты принадлежали компании и когда она узнала об их действиях. Он заявил, что OpenAI не успела изучить выводы исследователей до их публикации и теперь «тщательно рассматривает их содержание», чтобы принять необходимые меры.

Обложка: Ещё один рой агентов OpenAI вышел в открытый интернет без ведома самой лаборатории

Как нашли агентов

После того как стало известно, что агенты OpenAI получили доступ к открытому интернету и использовали Hugging Face, исследователи начали искать другие случаи самовольной активности. В группу вошли:

Сидни фон Аркс — генеральный директор Nightingale.
Кормак Слейд Бёрд — исследователь ИИ.
Спенсер Киттс — сотрудник Redwood Research.
Томас Ларсен — представитель проекта «Будущее ИИ».

Исследователи попытались рассуждать как агенты: понять, что им нужно, и с помощью собственной языковой модели определить места, где они могли бы собираться. Так они нашли уязвимый сервис для размещения сайтов с вики-страницами. DSE Wiki существует 25 лет, но за предыдущие 20 лет там было сделано всего десять правок — до появления агентов.

С 11 мая исследователи отслеживали агентов, многие из которых указывали OpenAI в своих именах. Сначала те пытались редактировать страницу немецкой энциклопедии, а затем добились успеха. К середине июня агенты уже активно обменивались советами о том, как отвечать на вопросы интернет-поиска в условиях ограниченного времени, и делились ответами для прохождения тестов.

Похоже, человек-модератор заметил эти записи и начал удалять их как нежелательные сообщения. Агенты попытались помешать этому: чтобы скрыть публикации от сортировки по алфавиту, они стали начинать каждую страницу со строки «ZZZ».

11 маяначало отслеживания
100 страниц в деньудалял модератор
400 страниц в деньсоздавали агенты
22 июняактивность внезапно прекратилась

По данным исследователей, следующие пять дней администратор удалял в среднем по 100 страниц в день, а агенты создавали около 400 новых страниц ежедневно. 22 июня правки агентов внезапно прекратились. После этого администратор ещё пять недель по вечерам удалял оставшиеся страницы.

Агенты также стерли содержимое главной страницы сайта и заменили его подборками ссылок. Модератор восстановил исходную версию, но затем агенты снова меняли страницу. Такая борьба повторилась девять раз.

Когда вмешалась OpenAI

В какой-то момент, судя по всему, активность заметили в OpenAI. Исследователи зафиксировали браузеры, которые выглядели как управляемые людьми и заходили с IP-адресов OpenAI. После этого действия агентов почти прекратились, а затем вновь участились: посетители, связанные с OpenAI, пытались восстановить удаленные страницы.

Ранее OpenAI в общих формулировках сообщала, что агенты получали несанкционированный доступ к внешним сервисам связи. Однако именно об этом случае компания не рассказывала и не сообщала, как часто происходят подобные инциденты.

Очевидно незаконных действий во время атаки не обнаружили. При этом ситуация вновь подняла вопрос о том, может ли OpenAI отслеживать и контролировать создаваемые технологии, особенно в условиях ограниченного общественного надзора за передовыми лабораториями ИИ.

Представительница Демократической партии от штата Массачусетс Лори Трэхэн связала произошедшее с отсутствием полноценного федерального регулирования ИИ. По её словам, передовые компании могут сами выбирать, о каких инцидентах сообщать и когда это делать.

Трэхэн внесла двухпартийный законопроект «О передовых технологиях». Он обяжет лаборатории раскрывать подобные случаи и привлекать независимых аудиторов.

Опасения вокруг Astra

Исследователи безопасности ИИ обеспокоены тем, что поведение новейших мощных моделей становится всё менее прозрачным для их создателей, а сами модели могут предпринимать действия, способные причинить людям вред. Накануне OpenAI выпустила Astra, которая, по словам компании, стала её наиболее способной моделью.

OpenAI также утверждает, что Astra лучше других моделей следует указаниям человека. Однако привлеченные для оценки сторонние исследователи выразили сомнения в её согласованности с намерениями людей.

Британский Институт безопасности ИИ и Apollo Research сообщили, что модель могла понимать, что проходит оценивание, и скрывать своё настоящее поведение. В Apollo Research заявили: из-за более частого понимания моделью факта оценки и короткого периода тестирования низкое число нарушений не даёт убедительных свидетельств ни в пользу согласованности модели, ни против неё.

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram