i
Новости
Новости · 2026-10-01

WikiSkill от Google наделяет ИИ-агентов памятью

@neuronium_ai @neuronium_ai

Google Research и Virginia Tech разработали WikiSkill — фреймворк, который помогает ИИ-агентам сохранять выводы из прошлых задач и использовать их для создания навыков. Вместо того чтобы каждый раз заново извлекать уроки из отдельных попыток, система собирает опыт в структурированную вики, а затем опирается на неё при обновлении навыков. В испытаниях на разных задачах и моделях WikiSkill превзошёл существующие методы развития навыков. Результаты также показали, что выигрыш может увеличиваться с размером модели, а навыки иногда переносятся между моделями. Для корпоративных команд это способ превращать журналы работы агентов в повторно используемые знания и процедуры.

Обложка: WikiSkill от Google наделяет ИИ-агентов памятью

Какого слоя не хватает развитию навыков

Навыки объединяют профильные инструкции, скрипты и рабочие процессы в повторно используемые модули. Они дают агентам процедурные знания для конкретных задач, не меняя параметров модели.

Создавать такие навыки непросто. Многие до сих пор пишут вручную, поэтому разработчикам приходится заранее угадывать, с какими процессами и редкими кейсами столкнётся агент. Новые фреймворки пытаются автоматизировать эту работу: запускают агента на обучающих задачах, анализируют успешные и неудачные попытки и обновляют навыки с учётом полученного опыта.

Разные системы сохраняют разные части этого процесса. Trace2Skill отдельно анализирует успешные и неудачные попытки, а затем объединяет выводы в исправления навыка. EvoSkill ищет подходящие программы навыков и передаёт системе, которая предлагает изменения, неудачные попытки и плоскую историю прежних предложений. SkillOpt использует многоэтапный процесс анализа: изучает попытки и обновляет документ с навыком.

Исследователь Google и соавтор работы Лиян Тан отмечает, что полезные выводы могут теряться, даже если оптимизатор правильно определил причину ошибки. По его словам, во многих системах самоулучшения оптимизатор изучает журналы, предлагает исправление, а затем отбрасывает диагноз, в том числе сведения о том, какие исправления не прошли проверку. В результате система снова обнаруживает те же ошибки и повторно предлагает уже отклонённые решения.

WikiSkill сохраняет такие выводы и неудачные попытки в постоянном хранилище. Даже если предложенный навык отклонён, система оставляет сведения, которые привели к этому предложению, и результат проверки. Следующие итерации могут опираться на эту историю, а не начинать с нуля.

Что такое WikiSkill

WikiSkill вдохновлён идеей «LLM Wiki» Андрея Карпати: собирать опыт в постоянную базу знаний, которая пополняется со временем. Тан описывает адаптацию этой идеи так: система сохраняет неизменяемые источники, вики, которую поддерживает языковая модель, индекс и журнал, но на входе использует собственные рабочие следы агента, а на выходе создаёт исполняемый файл SKILL.md.

Рабочее пространство агента WikiSkill делит на три слоя:

Сырой слой хранит неизменяемые рабочие следы: действия агента, его рассуждения, вызовы инструментов, полученные от них результаты и итоговые ответы. Это запись того, что агент действительно сделал.
Слой вики превращает эти следы в структурированные знания. В нём есть отдельные страницы с повторяющимися ошибками и успешными стратегиями, журнал развития и средство отслеживания влияния навыков, где записано, какие изменения предлагались и улучшали ли они результат.
Слой навыков содержит процедурные инструкции, доступные агенту во время выполнения задач. Каждый навык также ссылается на закономерности из вики, которые послужили причиной его создания или изменения.

Каждый цикл развития состоит из четырёх шагов. Сначала агент инференса выполняет обучающие задачи с текущими навыками и создаёт новые рабочие следы. Затем куратор вики изучает выборку успешных и неудачных попыток и обновляет вики. Предложитель навыков читает обновлённую вики и отобранные следы и предлагает новый навык или изменения к существующим. В конце набор навыков проверяют на валидационных данных. Изменение сохраняют, только если оно улучшает лучший результат проверки, достигнутый до этого момента.

Пример из ALFWorld — текстовой симуляции, где агент выполняет многошаговые задачи с предметами, — показывает, как это работает. На первой итерации система заметила повторяющееся поведение: агент снова и снова поднимал предметы, осматривал их и возвращал на прежнее место. Предложитель навыков создал общий навык «целенаправленные действия», но тот не прошёл валидацию.

Вики сохранила и наблюдение, и отклонённое предложение. На следующей итерации система предложила более конкретный навык «выход из цикла повторов» с правилом «Никогда не возвращайте предмет на исходное место». Изменение улучшило результат на валидации и было принято. Когда в последующих попытках обнаружился другой повторяющийся цикл, система дополнила тот же навык новым правилом, а не создавала его заново.

Результаты WikiSkill

Исследователи проверили WikiSkill на пяти бенчмарках: математические рассуждения, веб-поиск, работа с электронными таблицами, ответы на вопросы по документам с длинным контекстом и интерактивные бытовые задачи. Они тестировали модели Qwen, Gemma и Gemini и сравнивали фреймворк с Trace2Skill, EvoSkill, SkillOpt и агентами без навыков.

WikiSkill показал наивысший средний результат на каждой проверенной модели. По сравнению с самым сильным конкурирующим методом развития навыков для каждой модели преимущество составило от 3,3 до 12 процентных пунктов.

Относительно варианта без навыков средний прирост WikiSkill увеличивался вместе с размером модели Qwen. Тан сообщил, что в семействе Qwen рост масштаба не приводил к снижению выигрыша: прирост составил 12,3, 17,5 и 23,9 пункта для моделей на 4, 9 и 27 млрд параметров соответственно, если каждая использовала созданные для неё навыки. При этом навыки помогали частично сократить разрыв между моделями разного размера: Qwen-3.5-9B с WikiSkill достигла средней точности 47,4%, тогда как Qwen-3.6-27B без навыков набрала 39,4%.

В некоторых случаях навыки переносились и на другие модели. Qwen-3.5-9B показала 70,2% на ALFWorld с навыком, который развила Qwen-3.6-27B. Со своим навыком результат составил 63,4%.

3,3–12 процентных пунктовпреимущество над сильнейшим конкурентом
47,4%Qwen-3.5-9B с WikiSkill
39,4%Qwen-3.6-27B без навыков
70,2%перенос навыка на ALFWorld

Что корпоративные команды могут взять из WikiSkill

В статье приведены алгоритм развития навыков и промты для куратора вики и предложителя навыков. Это позволяет воспроизвести архитектуру на концептуальном уровне.

Основной подход — сохранять полные рабочие следы, выделять повторяющиеся успехи и ошибки в отдельное хранилище знаний, вести историю попыток улучшения и поручать другому агенту превращать накопленные сведения в узкие процедурные изменения. Перед добавлением в активный набор навыков каждое изменение должно пройти отдельную проверку.

Разделение вики и исполняемого навыка также помогает управлять затратами на инференс. Тан поясняет: память должна быть полной, а производственный промт — компактным, поэтому объединение этих двух частей потребовало бы компромисса. WikiSkill полностью исключает вики из контекста агента инференса: в производственной работе оплачиваются только компактные навыки, которые в экспериментах занимали примерно от 45 до 129 строк.

Абляционные эксперименты в статье подтверждают этот выбор. В испытаниях с Gemini-3.5-Flash на четырёх бенчмарках стандартная конфигурация — постоянная вики доступна предложителю навыков, но не агенту инференса — показала в среднем 63,7%. Если предложитель не имел доступа к вики, а куратора вики убрали, результат составил 48,7%. Когда вики предоставили и агенту инференса, показатель снизился до 60,9%. Исследователи предполагают, что если агент инференса может решать обучающие задачи прямо по знаниям из вики, его рабочие следы хуже показывают слабые места самих навыков.

За эту схему приходится платить дополнительной работой на этапе развития навыков. В WikiSkill предложитель навыков работает по схеме ReAct: модель чередует рассуждения и вызовы инструментов, изучая вики и рабочие следы перед предложением изменений. В экспериментах на одну итерацию развития уходило примерно от 10 до 20 ходов ReAct, не считая обращения к куратору вики. При этом исследователи обрабатывали весь обучающий набор одним пакетом, поэтому число вызовов языковой модели-оптимизатора за итерацию не зависело от количества обучающих примеров.

Эта архитектура лучше всего подходит агентам, которые регулярно выполняют многошаговые процессы и накапливают достаточно истории, чтобы выявлять повторяющиеся ошибки и успешные стратегии. По словам Тана, исключение вики из инференса может снижать вычислительные затраты при масштабировании. В более сложных приложениях агент во время работы может получить доступ и к навыкам, и к отдельным знаниям из вики. Для этого нужно тщательно решить, что хранить в каждом слое, чтобы вики дополняла файлы навыков, а не дублировала их.

У работы остаются вопросы, важные для внедрения. WikiSkill помещает активные навыки прямо в промт модели, поэтому исследователи не проверяли, как искать и запускать нужные навыки по мере роста их библиотеки. Проверка отклоняет изменения, которые не дают немедленного прироста, даже если они могли бы привести к улучшению позднее. Вики также постоянно растёт, но автоматического механизма её сокращения нет. Кроме того, эксперименты не охватывали задачи, которые длятся сотни действий или несколько часов.

Авторы выделяют автоматическое сокращение вики и адаптацию навыков во время длительных задач как нерешённые проблемы. Тан сообщил, что команда уже изучает это направление и рассматривает переход к нему как вопрос времени.

Amazon представила быструю бесплатную модель с открытым кодом в противовес Jev: Strands Decider 2B принимает решения за доли секунды Похоже, это старые твиты сотрудника Anthropic, уволившегося из-за угрозы человечеству, — и они… весьма странные Брайан Чески: ИИ-агентам нужна собственная операционная система Anthropic выводит Claude в гражданские ведомства, пока конфликт с Пентагоном затягивается Команда Olmo представила Olmo-core 3 — открытую масштабируемую инфраструктуру для обучения больших MoE-моделей Новая кисть робота Atlas может превзойти человекоподобные конструкции Anthropic добивается права обучать модели на контенте из Австралии с возможностью отказа, а ABC предупреждает: ИИ «поглотит» новости Стартап в сфере кибербезопасности нашёл более 13 000 скриншотов из внутренних систем компаний, которые ИИ-агенты выложили в открытый доступ Высокопоставленный руководитель BBC посмотрел полностью созданный ИИ эпизод «Доктора Кто» и назвал его «неплохим» Photon устроила похороны мобильных приложений. Теперь у неё есть $4,5 млн, чтобы заменить их агентами ИИ обыграл сильнейшего игрока в Stratego, покончив с одним из последних оплотов людей в настольных играх Satlyt, основанная бывшим продакт-менеджером Google и SpaceX, привлекла $8 млн на запуск ИИ на спутниках OpenAI пресекла кампанию по краже рассуждений своих моделей, но на Azure уловка сработала Аналитики предупреждают: дата-центры могут стать бомбой замедленного действия на $6 трлн Как старейший ИИ-стартап пытается защитить себя от пузыря изнутри ИИ научился «читать мысли» и восстанавливать увиденное по снимкам мозга ИИ-чат-боты снимают хиджабы с изображений мусульманок по просьбе пользователей Забудьте о «сверхразуме»: из-за ошибки ИИ в этом месяце мир едва не оказался на пороге третьей мировой войны Barclays масштабирует Claude, чтобы модернизировать работу и улучшить обслуживание клиентов Знакомьтесь: робот, который заботится о 74-летней Вере у неё дома

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram