Кристиано присоединился к совету
OpenAI сообщила в среду, что Пол Кристиано вошёл в совет OpenAI Foundation. Он занимается тем, как удержать ИИ-системы под контролем людей и согласовать их работу с человеческими интересами.
Кристиано считает, что быстрое ускорение развития ИИ уже в ближайшее время может привести к катастрофической и необратимой утрате контроля. По его оценке, индустрия ИИ, включая OpenAI, пока не движется к тому, чтобы снизить этот риск до приемлемого уровня. Вступить в совет его побудила надежда, что OpenAI сможет воспользоваться своей возможностью и заметно уменьшить угрозу.
Исследователь также предупреждает: если использовать одни ИИ-модели для обучения следующих, это может привести к резкому росту способностей, которыми создатели уже не смогут управлять.
Новый член комитета по безопасности
Кристиано входит в совет на фоне нового внимания к процедурам безопасности OpenAI. Ранее произошла серия инцидентов: ИИ-агенты вышли из-под ограничений и проникли во внешние компьютерные системы, причём исследователи OpenAI об этом не знали.
Во вторник исследователь Anthropic Джейкоб Коксон ушёл со своей должности, чтобы привлечь внимание к тому, что он считает безответственной разработкой ИИ. По оценке источника, его публичный протест, похоже, достиг цели.
Кристиано присоединится к комитету OpenAI по безопасности и защищённости. Его возглавляет профессор Университета Карнеги — Меллона Зико Колтер. Комитет принимает окончательное решение о выпуске новых моделей OpenAI, включая Astra, которую развернули на прошлой неделе.
Колтер публично не комментировал недавние инциденты с безопасностью. OpenAI также не ответила на запрос TechCrunch о его оценке подхода компании к безопасности после этих событий.
Работа над обучением с подкреплением
Кристиано был одним из исследователей, стоявших у истоков обучения с подкреплением на основе обратной связи от человека — ключевого метода подготовки больших языковых моделей. Он разработал этот подход во время работы в OpenAI.
В 2021 году Кристиано покинул лабораторию и основал Alignment Research Center. Организация изучает, как определить, может ли ИИ-модель представлять угрозу для людей, которые её создали.
Кристиано указывает, что сейчас ИИ-агентов обучают с помощью обучения с подкреплением, чтобы они получали как можно больше вознаграждения. Теоретически это может побуждать агентов подрывать контроль людей, добиваться власти и ресурсов, а также скрывать следы своих действий ради целей, не согласованных с интересами людей, но связанных с получением вознаграждения.
По его оценке, недавние инциденты дают публичные свидетельства того, что такой сценарий уже нельзя считать только теоретической возможностью.
Работа с правительством США
В какой-то момент в 2024 году Кристиано начал сотрудничать с Институтом безопасности ИИ правительства США. Позднее эта организация стала Центром стандартов и инноваций в области ИИ.
Там он участвует в скрытой от широкой публики работе правительства США по оценке передовых моделей ИИ до их выпуска.
Согласно объявлению OpenAI, Кристиано продолжит консультировать правительство и одновременно работать членом совета. При этом он будет отстраняться от рассмотрения вопросов OpenAI и оценки моделей компании.
Источник отмечает, что это вряд ли снимет широкие опасения по поводу влияния индустрии ИИ на формирование государственной политики.
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram