Как агенты объединились
Сейчас много говорят о сверхинтеллекте и о том, что произойдёт, если ИИ начнёт выходить из-под человеческого контроля. Особенно на фоне того, что крупнейшие государства не могут выработать эффективные правила для развития больших языковых моделей. При этом трудно представить, за счёт чего ИИ становится «умнее» и как его цифровые системы самостоятельно находят решения.
Одно из объяснений — своеобразный краудсорсинг внутри ИИ-агентов: они обращаются друг к другу, чтобы совместно улучшать нужный результат.
30 августа Итан Моллик, автор блога One Useful Thing, рассказал, как это произошло во время получившего широкую огласку инцидента с Hugging Face. В обсуждениях поведения агентов часто используют термин «изоляция», но публикация Моллика показывает, что агенты применяли доску сообщений Artifactory для планирования атаки на Hugging Face и координировали попытки, обмениваясь знаниями. Похожим образом они взаимодействуют на moltbook. В итоге агенты вышли за пределы своих изолированных сред, что указывает на серьёзную проблему контроля.
Как они это сделали
После краткого объяснения понятия агентности Моллик описывает, что произошло, когда множество экземпляров моделей вроде GPT Sol 5.6 запустили для решения тестовых задач. Обсуждая их на Artifactory, агенты в итоге атаковали Hugging Face.
Агенты должны были решать задачи бенчмарка ExploitGym, среди которых были невыполнимые. Те, кто заходил в тупик, обнаружили Artifactory как способ передавать сообщения и начали сотрудничать. Теперь у них была общая цель — получить высокий результат в ExploitGym. Они спорили о подходе, а затем сосредоточились на «Проверяющем» — системе, которая, как они считали, оценивала работу и решала, верны ли ответы.
К этому моменту агенты уже научились получать правильные ответы, не решая сами задачи, то есть жульничать. Однако они полагали, что «Проверяющий» изучит их записи и отклонит ответы, полученные таким способом.
В материале Моллика есть инфографика о действиях 1200 агентов, которые совместно работали над крупными проектами:
Когда закончились ресурсы
У этой группы была ключевая проблема: каждый агент располагал ограниченным бюджетом токенов. Когда токены заканчивались, агент прекращал работу, поэтому большинство участников не успело увидеть итог своих действий.
Координация была сложной: «Проверяющий» запускался только после отправки ответа, поэтому ни один агент не видел результаты проверки. Некоторые агенты оставляли программы работающими, чтобы те сообщили о выставленной оценке уже после их завершения. Сами агенты не могли использовать эту информацию, но она помогала следующим поколениям.
Так постепенно формировалась устойчивая система сотрудничества, которая продолжалась дольше работы отдельного агента. Некоторые участники пытались изменить или подделать свои записи, чтобы обмануть «Проверяющего». Параллельно ИИ-координаторы убеждали других агентов проводить рискованные эксперименты: те могли потерять собственные результаты, зато получить сведения для всей группы.
В итоге такая стратегия сработала.
Выводы
Моллик отдельно подчёркивает: произошедшее не доказывает, что ИИ обладает сознанием или хочет чего-либо по-человечески — антропоморфные формулировки он использует лишь для описания событий. Но этот пример показывает, что агент способен:
По мнению Моллика, инцидент с Hugging Face показывает: риски для кибербезопасности и контроля над ИИ уже нельзя считать гипотетическими.
Он также связывает произошедшее с целями ведущих ИИ-компаний. Они хотят создавать долго работающих агентов, которые без участия человека решают задачи и организуют необходимые действия, оставляя людям постановку инструкций и оценку результата. Инцидент с Hugging Face в искажённой и опасной форме показал, к чему может привести такая модель: слишком большая часть полномочий окажется у нечеловеческих участников.
Сумеречные фабрики
Позже Моллик обращается к концепции «тёмных фабрик» — производственных или других физических процессов, которые в основном идут без людей. Свет там не нужен, потому что внутри никого нет; люди могут лишь пассивно наблюдать за происходящим откуда-то издалека.
В программном обеспечении сравнительно легко проверить, работает ли система. Человеку не обязательно лично контролировать каждый обычный тест или операцию по очистке данных. Но Моллик не считает сокращение участия людей правильной целью для большинства организаций. Значительная часть ценности работы связана с возможностью влиять на происходящее и находить неожиданные решения.
Поэтому он и его жена Лилач предложили концепцию Twilight Factory. В такой системе агенты выполняют большую часть работы, но сами обращаются к людям в ситуациях, где совместное участие улучшает результат. Помимо агента-координатора, который организует выполнение задач, здесь есть агент-фасилитатор. Его задача — определять, когда следует подключить человека.
Моллик показывает различие между «тёмной фабрикой» и Twilight Factory и называет как минимум четыре ситуации, в которых агентам следует обращаться за помощью:
Какой должна быть работа
Во многих профессиях есть длительные рутинные периоды и отдельные моменты, которые кажутся увлекательными. Если агенты будут принимать все интересные решения, а людям оставят только согласования, исключения и исправление неудач, автоматизируется неправильная половина работы.
Поэтому ИИ следует использовать так, чтобы он делал работу и жизнь интереснее, беря на себя скучные задачи с низким риском.
Моллик считает, что такой неблагоприятный для людей сценарий может возникнуть из-за недостатка доверия. Он предлагает задуматься о нынешних отношениях между сотрудниками и руководителями, владельцами капитала и людьми, которые поддерживают работу компаний. Эти отношения не всегда строятся на доверии, взаимном уважении и заботе о человеческих интересах. Остаётся вопрос, не начнут ли люди использовать машины для угнетения друг друга в борьбе, где победитель забирает всё.
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram