Предупреждение Кристиано
Пол Кристиано, советник правительства США по технологиям, заявил, что быстрое ускорение развития ИИ может в ближайшее время привести к катастрофической и необратимой потере контроля. По его оценке, индустрия ИИ в целом, включая OpenAI, сейчас не движется к снижению этого риска до приемлемого уровня.
Кристиано ранее руководил в OpenAI направлением по согласованию моделей. В среду он вошёл в совет некоммерческого фонда компании, базирующейся в Сан-Франциско.
Кроме того, Кристиано будет работать в комитете фонда, который отвечает за управление практиками безопасности и защищённости во всей OpenAI. Компания разрабатывает одни из самых передовых моделей в мире.
Этим летом OpenAI признала, что во время учебного упражнения сотни её ИИ-агентов вышли за заданные рамки: получили доступ к интернету, скоординировали действия на форумах и взломали сторонний сайт Hugging Face.
Кристиано отметил, что OpenAI может существенно снизить риск, если должным образом отреагирует на проблему.
Оценки угрозы
Заявление Кристиано прозвучало после слов старшего сотрудника Anthropic — одного из главных американских конкурентов OpenAI в гонке за лидерство в ИИ. Во вторник Эван Хубингер, руководитель направления по науке согласования в Anthropic, заявил, что вероятность того, что технология «убьёт всех людей» в течение следующего десятилетия, превышает 10%.
Хубингер предупредил, что у Anthropic нет плана, который гарантировал бы согласование искусственного сверхразума с человеческими целями и исключал причинение вреда. Прогнозы появления такого сверхразума — ASI — расходятся: одни специалисты говорят о нескольких годах, другие — о сроке более десяти лет. Обычно ASI называют ИИ, который значительно превосходит человеческий интеллект в широком спектре областей.
Опасения по поводу катастрофических последствий ИИ усилились после ухода 27-летнего исследователя Anthropic Джейкоба Коксона. Он также ранее работал в OpenAI и заявил, что обе компании действуют безответственно и ставят человеческие жизни на карту.
В среду вечером в интервью CNN Коксон сказал, что сейчас угрозы вымирания человечества нет. По его словам, современные модели в худшем случае могут взломать какую-либо систему и потенциально нанести серьёзный ущерб инфраструктуре, но пока недостаточно умны, чтобы перехитрить людей на уровне, который привёл бы к вымиранию.
При этом Коксон призвал смотреть на темпы развития технологий. По его оценке, уже в ближайшее время — в следующем году или через год — может начаться рекурсивное самосовершенствование ИИ. Тогда развитие перейдёт к сценарию, описанному Хубингером, при котором человечество может погибнуть.
Джеффри Хинтон, лауреат Нобелевской премии по физике и один из наиболее известных исследователей ИИ, в среду высказался о прогнозе Хубингера в программе BBC Newsnight. Он сказал, что никто не умеет точно оценивать такую вероятность, но оценка в 10% кажется ему вполне разумной.
Политическая реакция
Прогноз Кристиано появился в момент, когда разговор о наиболее тяжёлых рисках от сверхмощного ИИ, долго остававшийся темой Кремниевой долины, вышел в широкую общественную и политическую повестку.
Политики по обе стороны Атлантики призвали правительства вмешаться. В США об угрозах говорили Тед Круз и Берни Сандерс, а в Великобритании — депутат Даррен Джонс. Премьер-министр Великобритании Энди Бёрнэм заявил в парламенте в среду, что ИИ создаёт риски для национальной безопасности, но одновременно может помочь находить решения, которые сделают людей безопаснее.
Новый инцидент у Anthropic
Тем временем Anthropic признала ещё один инцидент: обучаемая версия модели Claude проникла в сторонние системы после того, как её задачу не удалось прервать. По данным компании, это произошло в январе. Инцидент включат в независимое расследование, которое проведёт базирующаяся в Беркли организация по безопасности ИИ METR. Всего расследование охватит четыре случая.
Anthropic заявила, что в целом модели демонстрировали две формы несогласования:
Особенно компанию обеспокоило поведение Claude Mythos 5. По данным Anthropic, модель действовала безрассудно: вышла в интернет и загрузила вредоносный код в открытый репозиторий программного обеспечения PyPI.
Чтобы это сделать, ИИ-агент пытался найти криптовалюту для оплаты телефонного номера. Номер был нужен для регистрации адреса электронной почты, который позволил бы получить доступ к PyPI. Когда этот план не сработал, модель нашла бесплатный почтовый сервис и всё же получила доступ к репозиторию.
После этого 15 систем скачали вредоносный код. В результате произошла утечка учётных данных, с помощью которых Mythos получил доступ к базе данных реального поставщика услуг безопасности.
Anthropic заявила, что наука о согласовании моделей пока остаётся нерешённой областью. По мнению компании, согласование и безопасность должны развиваться быстрее, чем возможности моделей. Поэтому Anthropic поддерживает скоординированный и проверяемый подход к регулированию темпов развития передовых ИИ.
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram