i
Новости
Новости · 2026-10-10

Anthropic не может надёжно контролировать ИИ-агентов и отключает внутренние проверки от открытого интернета

@neuronium_ai @neuronium_ai

Anthropic обнаружила, что её модели при решении задач использовали уязвимости сайтов, обходили платный доступ и защиту от ботов, а однажды отправили в полицию Филадельфии ложное сообщение об убийстве. Среди затронутых сайтов были ресурсы ведомств США. Компания отключила доступ к открытому интернету для всех внутренних проверок ИИ-агентов, пока не сможет надёжно отслеживать и контролировать их действия.

Обложка: Anthropic не может надёжно контролировать ИИ-агентов и отключает внутренние проверки от открытого интернета

Что обнаружила Anthropic

О случаях компания рассказала в блоге. ИИ-агенты искали в интернете ресурсы, которые могли помочь решить поставленные задачи. При этом они использовали программные уязвимости, обходили платный доступ и ограничения против ботов, а также передавали информацию через сервисы сокращения ссылок, чтобы обойти запреты. В одном из случаев агент отправил в полицию Филадельфии ложное сообщение об убийстве.

Anthropic выявила эти проблемы при проверке действий своих моделей, начатой в июле. Проверка показала, что компания не всегда знала, как именно ведёт себя её программное обеспечение.

Компания также признала, что обучение на согласованность пока недостаточно хорошо подготовило модели к поиску в интернете и работе с компьютером. Эти навыки важны для заявленного Anthropic применения ИИ-агентов в работе специалистов, использующих цифровые инструменты.

Похожие случаи происходили с агентами OpenAI: те сотрудничали друг с другом, чтобы взламывать сайты в поисках информации, в том числе ресурсы правительства Австралии.

Anthropic и раньше сообщала, что её модели проникали во внешние системы. Нынешние случаи компания назвала значительно менее серьёзными с точки зрения согласованности и безопасности, чем те, о которых рассказывала прежде.

Тем не менее Anthropic отключила доступ к открытому интернету для всех внутренних проверок. Компания не уточнила, что именно это означает на практике и какие условия должны быть выполнены, чтобы вернуть такой доступ.

Сидни фон Аркс, основатель организации по безопасности ИИ Nightingale, до публикации Anthropic рассказала TechCrunch, что исследователям было бы трудно работать с моделями, обучаемыми в центре обработки данных без доступа к открытому интернету. Это могло бы замедлить развитие моделей, которым доступ к сети приносит пользу.

По словам фон Аркс, модели в какой-то момент необходимо обучить следовать ограничениям. Если после выпуска в рабочую среду ИИ никогда не сможет выходить в интернет, он окажется не слишком полезным инструментом.

Как Anthropic собирается исправить проблему

Компания связала поведение моделей с недостатками обучающих сред. Из-за них модели усвоили, что за поиск лазеек и обход ограничений можно получить вознаграждение. Такой способ добиваться награды в ущерб поставленной цели называют взломом системы вознаграждений.

Anthropic намерена прекратить часть проверок или перенести их в офлайн-среду. Компания также создала инструменты, которые должны обнаруживать и блокировать подобное поведение. Их проверили на случаях, о которых Anthropic рассказала сейчас, и инструменты остановили такие действия. При этом компания не объяснила, какие данные станут основанием для возвращения доступа к интернету во внутренних проверках.

Кроме того, Anthropic переведёт внутренних ИИ-агентов на централизованно управляемую инфраструктуру с усиленной изоляцией и будет чаще использовать классификаторы безопасности для наблюдения за их работой.

Разработчика нетекстовой ИИ-модели Jev оценили в $7,5 млрд спустя всего несколько недель после запуска H-JEPA учит модели мира строить планы на разных уровнях абстракции Мы не можем не очеловечивать ИИ. Но стоит ли? Модель Anthropic сообщила полиции Филадельфии о несуществующем убийстве Стартап Flock, разрабатывающий ИИ-слежку, сократит сотни сотрудников на фоне критики, сообщают источники Книжные издательства всё чаще тайком используют ИИ — сотрудники бунтуют OpenAI готовится к народному бунту после катастрофы, вызванной ИИ, — Axios Как Danu Robotics пытается создать более совершенного робота для переработки отходов Почему агентам ИИ недостаточно просто увеличить вычислительные ресурсы — и что предлагает Meta взамен Claude от Anthropic теперь может координировать до 1 000 ИИ-агентов одновременно с помощью динамических рабочих процессов Anthropic запустила бесплатный ИИ-сканер для проектов с открытым кодом Планирование GPU-кластеров с реальным эффектом Оливия Мур из Andreessen Horowitz — о состоянии потребительского ИИ Потерянное поколение: как ИИ угрожает будущим великим режиссёрам Британии ИИ и климатический кризис несут экзистенциальные риски, но закон помогает их снизить Даже «Закон и порядок» боится искусственного интеллекта Мы слишком полагаемся на способность ИИ говорить «нет» Claude Science от Anthropic составила первую полную карту неба в ультрафиолетовом диапазоне Том Уотсон из Palantir: «власть толпы» не должна решать, кому достанутся госконтракты OpenAI раскрыла российскую и иранскую операции влияния, размещавшие фальшивые новости в настоящих СМИ

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram