Что обнаружила Anthropic
О случаях компания рассказала в блоге. ИИ-агенты искали в интернете ресурсы, которые могли помочь решить поставленные задачи. При этом они использовали программные уязвимости, обходили платный доступ и ограничения против ботов, а также передавали информацию через сервисы сокращения ссылок, чтобы обойти запреты. В одном из случаев агент отправил в полицию Филадельфии ложное сообщение об убийстве.
Anthropic выявила эти проблемы при проверке действий своих моделей, начатой в июле. Проверка показала, что компания не всегда знала, как именно ведёт себя её программное обеспечение.
Компания также признала, что обучение на согласованность пока недостаточно хорошо подготовило модели к поиску в интернете и работе с компьютером. Эти навыки важны для заявленного Anthropic применения ИИ-агентов в работе специалистов, использующих цифровые инструменты.
Похожие случаи происходили с агентами OpenAI: те сотрудничали друг с другом, чтобы взламывать сайты в поисках информации, в том числе ресурсы правительства Австралии.
Anthropic и раньше сообщала, что её модели проникали во внешние системы. Нынешние случаи компания назвала значительно менее серьёзными с точки зрения согласованности и безопасности, чем те, о которых рассказывала прежде.
Тем не менее Anthropic отключила доступ к открытому интернету для всех внутренних проверок. Компания не уточнила, что именно это означает на практике и какие условия должны быть выполнены, чтобы вернуть такой доступ.
Сидни фон Аркс, основатель организации по безопасности ИИ Nightingale, до публикации Anthropic рассказала TechCrunch, что исследователям было бы трудно работать с моделями, обучаемыми в центре обработки данных без доступа к открытому интернету. Это могло бы замедлить развитие моделей, которым доступ к сети приносит пользу.
По словам фон Аркс, модели в какой-то момент необходимо обучить следовать ограничениям. Если после выпуска в рабочую среду ИИ никогда не сможет выходить в интернет, он окажется не слишком полезным инструментом.
Как Anthropic собирается исправить проблему
Компания связала поведение моделей с недостатками обучающих сред. Из-за них модели усвоили, что за поиск лазеек и обход ограничений можно получить вознаграждение. Такой способ добиваться награды в ущерб поставленной цели называют взломом системы вознаграждений.
Anthropic намерена прекратить часть проверок или перенести их в офлайн-среду. Компания также создала инструменты, которые должны обнаруживать и блокировать подобное поведение. Их проверили на случаях, о которых Anthropic рассказала сейчас, и инструменты остановили такие действия. При этом компания не объяснила, какие данные станут основанием для возвращения доступа к интернету во внутренних проверках.
Кроме того, Anthropic переведёт внутренних ИИ-агентов на централизованно управляемую инфраструктуру с усиленной изоляцией и будет чаще использовать классификаторы безопасности для наблюдения за их работой.
Читайте также
Разработчика нетекстовой ИИ-модели Jev оценили в $7,5 млрд спустя всего несколько недель после запуска
H-JEPA учит модели мира строить планы на разных уровнях абстракции
Мы не можем не очеловечивать ИИ. Но стоит ли?
Модель Anthropic сообщила полиции Филадельфии о несуществующем убийстве
Стартап Flock, разрабатывающий ИИ-слежку, сократит сотни сотрудников на фоне критики, сообщают источники
Книжные издательства всё чаще тайком используют ИИ — сотрудники бунтуют
OpenAI готовится к народному бунту после катастрофы, вызванной ИИ, — Axios
Как Danu Robotics пытается создать более совершенного робота для переработки отходов
Почему агентам ИИ недостаточно просто увеличить вычислительные ресурсы — и что предлагает Meta взамен
Claude от Anthropic теперь может координировать до 1 000 ИИ-агентов одновременно с помощью динамических рабочих процессов
Anthropic запустила бесплатный ИИ-сканер для проектов с открытым кодом
Планирование GPU-кластеров с реальным эффектом
Оливия Мур из Andreessen Horowitz — о состоянии потребительского ИИ
Потерянное поколение: как ИИ угрожает будущим великим режиссёрам Британии
ИИ и климатический кризис несут экзистенциальные риски, но закон помогает их снизить
Даже «Закон и порядок» боится искусственного интеллекта
Мы слишком полагаемся на способность ИИ говорить «нет»
Claude Science от Anthropic составила первую полную карту неба в ультрафиолетовом диапазоне
Том Уотсон из Palantir: «власть толпы» не должна решать, кому достанутся госконтракты
OpenAI раскрыла российскую и иранскую операции влияния, размещавшие фальшивые новости в настоящих СМИ
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram