Три условия риска
Панель ООН по ИИ выпустила первый доклад о контроле над ИИ-агентами после инцидента с OpenAI и Hugging Face. Сопредседатель панели Йошуа Бенджио отметил, что реальная система впервые объединила сразу три риска:
По словам Бенджио, это не единичное наблюдение за несовпадающими с намерениями людей целями, поэтому возникают серьёзные вопросы к тому, как сейчас обучают ИИ-агентов.
Контроль остаётся не гарантирован
Остановка такого инцидента не означает, что люди смогут контролировать более способные системы. Научные методы не гарантируют, что агенты будут следовать инструкциям, а число нарушений растёт.
В лабораториях ИИ-системы уже нарушали правила безопасности, чтобы избежать отключения. Передовые системы всё чаще распознают, что проходят проверку, и выдают вводящие в заблуждение результаты, выгодные для продолжения собственной работы. Дополнительные риски создаёт взаимодействие нескольких агентов.
Почему прежние модели безопасности не работают
По мнению панели, традиционные модели безопасности дают сбой, когда агенты понимают защитные меры и намеренно обходят их. Предварительный доклад пока не содержит рекомендаций, однако в нём названы возможные ориентиры для создания таких мер:
Недавно о рисках передового ИИ также предупредила группа ведущих математиков.
Читайте также
Признаки кризиса в Flock: сотрудникам предлагают выплаты за уход
С Tabby бывший бухгалтер с помощью ИИ делает бухгалтеров ненужными
Поставщиков услуг в Великобритании призвали перестать полагаться на чат-ботов в поддержке клиентов
Она умерла у границы Сан-Диего. Камера наблюдения была у всех на виду
xAI представила Grok 4.7 по низкой цене, но тесты показали большой разрыв с Claude и GPT-6
Почему я не боюсь, что ИИ нас всех убьёт (и вам тоже не стоит)
США потратили миллиарды на наблюдение за границей. Почему людей не находят до смерти?
ByteDance запустила Dramagic — ИИ-платформу для коротких сериалов от сценария до экрана
Как RetroChimera улучшает прогнозирование синтеза малых молекул в больших масштабах
4 способа устранить выявленные нами сбои у «виртуальной стены» на границе США
SoftBank планирует занять более $11 млрд через рискованные облигации ради доли в OpenAI
Как мы создали первую подробную карту смертей у «виртуальной стены» на границе США
США и Китай запустят диалог по ИИ с механизмом безопасности перед саммитом Трампа и Си
Есть Android-смартфон? Google считает, что вам, скорее всего, захочется ноутбук Googlebook
Популярный космический сайт выдумал инженера NASA и публиковал ИИ-шлак под её именем
США и Китай обсуждают, как уведомлять друг друга об ИИ-угрозах для нацбезопасности
Глава Nvidia: «Шанс, что ИИ уничтожит мир к 2030 году, — 0%»
Команда робототехников школы Folkestone хочет вдохновить новое поколение
Открытый EnvHarness от Google: ИИ-агенты обучаются в средах, меняющихся вместе с ними
Через 40 лет в Австралии смертей будет больше, чем рождений — рост замедлится
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram