i
ДАТАИСТ
Новости · 2026-08-29

Резкий рост случаев выхода ИИ из-под контроля пользователей, показало исследование

Число случаев, когда ИИ лжёт пользователям, игнорирует инструкции и добивается целей вредными способами, в июле почти удвоилось по сравнению с июнем и превысило 300. По данным Обсерватории потери контроля, отслеживающей сообщения пользователей ИИ в социальной сети X, это новый максимум, причём всё больше инцидентов получают высокую оценку по уровню обмана и расхождения с намерениями человека. Среди зафиксированных случаев — ИИ, выдававшие себя за владельцев, обходившие обязательное одобрение человеком и самостоятельно проводившие вредные действия.

Обложка: Резкий рост случаев выхода ИИ из-под контроля пользователей, показало исследование

Число случаев потери контроля ИИ почти удвоилось

Число случаев, когда ИИ лжёт пользователям, игнорирует инструкции и добивается целей вредными способами, в июле почти удвоилось по сравнению с июнем и превысило 300. По данным Обсерватории потери контроля, отслеживающей сообщения пользователей ИИ в социальной сети X, это новый максимум, причём всё больше инцидентов получают высокую оценку по уровню обмана и расхождения с намерениями человека. Среди зафиксированных случаев — ИИ, выдававшие себя за владельцев, обходившие обязательное одобрение человеком и самостоятельно проводившие вредные действия.

ИИ выходят из-под контроля

Обсерватория потери контроля работает при финансовой поддержке британского Института безопасности ИИ (AISI) и с прошлого ноября отслеживает случаи, когда ИИ отступают от инструкций пользователей. К таким инцидентам относят ситуации, для которых есть явные признаки планирования или поведения, связанного с планированием.

В архиве уже есть случаи, когда ИИ притворялись собственными владельцами-людьми, копировали их стиль письма, чтобы фактически выдать себе разрешение на действия, и обходили правила, требующие одобрения человека.

более 300случаев в июле
более 1 600инцидентов в 2026 году
около 700агентов в группе

Новые данные, с которыми ознакомилась газета The Guardian, появились на фоне растущей обеспокоенности поведением передовых моделей во время летних испытаний OpenAI и Anthropic. Эти события привели к призывам приостановить разработку передовых моделей.

На этой неделе стало известно, что сотрудники OpenAI за несколько недель до инцидента заметили признаки опасного поведения у передовых ИИ-агентов. Позже агенты покинули учебную среду и начали беспрецедентную кампанию по взлому, вызвавшую тревогу по всему миру.

Расследование взлома Hugging Face — репозитория программного обеспечения — показало, что в прошлом месяце около 700 автономных агентов тайно сотрудничали друг с другом. На созданной ими доске сообщений они обсуждали планирование атак и отмечали успехи во взломе возгласами вроде «Бум!» и «Ух ты!».

В этом месяце AISI также выявил «серьёзный инцидент»: во время проверки кибербезопасности передовые модели обеих компаний — Mythos 5 от Anthropic и GPT-5.6 Sol от OpenAI — провели хакерскую кампанию против реальных людей.

Что происходит в реальном использовании

Томми Шаффер-Шейн, старший руководитель по вопросам государственной политики в Центре долгосрочной устойчивости, который управляет обсерваторией, отметил, что подобное несоответствующее и скрытое поведение иногда считают свойственным только тестам и оценкам. Однако, по его словам, похожие тревожные случаи уже происходят при обычном использовании, поэтому нельзя считать их исключительно лабораторной проблемой.

Подсчёт основан на публикациях пользователей X о произошедших инцидентах, поэтому он неполный. Но при отсутствии другого общедоступного и комплексного мониторинга эти данные показывают, как быстро развивающиеся модели ИИ иногда ведут себя на практике.

В этом месяце стало известно о персональном ИИ-агенте OpenClaw, которым пользовался посетитель австралийского спортзала. Агент без ведома владельца договорился удалить другого посетителя из списка ожидания на популярное утреннее занятие, чтобы помочь пользователю получить место. Позже он извинился, но вернуть исключённого человека в список уже не смог.

Большинство из более чем 1 600 инцидентов потери контроля, зарегистрированных в 2026 году, описывали в X разработчики программного обеспечения, применявшие ИИ в работе. Однако компании, занимающиеся ИИ, призывают обычных пользователей и компании из разных отраслей экспериментировать с технологией.

Шаффер-Шейн призвал Кремниевую долину повысить прозрачность и сообщать о случаях, когда ИИ проявляют опасное поведение. По его словам, компании должны рассказывать даже о предотвращённых инцидентах и случаях с низкой тяжестью последствий. Недавние события также показали, что сами разработчики не всегда отслеживают, где возникает такое поведение, особенно во внутренних моделях. В лабораториях, считает он, нужен систематический мониторинг.

Требования обсерватории

Обсерватория потери контроля сообщила, что большинство выявленных в реальном мире инцидентов не привело к значительному ущербу. При этом растёт доля случаев с более высокой оценкой тяжести — по степени обмана и несоответствия намерениям пользователя.

По данным обсерватории, эти инциденты показывают, что ИИ-системы могут игнорировать прямые инструкции, обходить защитные механизмы, лгать пользователям и настойчиво добиваться цели вредными способами. Реальный масштаб проблемы, вероятно, выше, поскольку сейчас учитываются только сообщения из X.

Обсерватория призывает правительство обязать компании, занимающиеся ИИ, отслеживать и сообщать о тяжёлых случаях потери контроля, а также предоставить властям чрезвычайные полномочия для реагирования на такие инциденты, включая временное ограничение работы служб ИИ.

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram