i
ДАТАИСТ
Обзор · 2026-09-04

Как собирать готовые навыки для ИИ-агентов из репозиториев с кодом

Обложка: Как собирать готовые навыки для ИИ-агентов из репозиториев с кодом

Когда агенту не хватает опыта

ИИ-агенты уже умеют писать код, запускать эксперименты и даже пытаться воспроизводить статьи. Но в длинных исследовательских задачах у них постоянно одна и та же проблема: они знают общие вещи, но плохо умеют доводить их до рабочего состояния.

Это разница между фразами «я слышал про этот метод» и «я понимаю, какой пакет поставить, какой формат данных нужен, где сломается дата-пайплайн и как это проверить до того, как вы сожжёте половину бюджета на GPU».

Авторы работы Repo-To-Skill: Distilling GitHub Repositories Into AI4AI Skills называют этот недостающий слой операционным знанием. Идея такая: у агента есть модель, есть обвязка, которая управляет шагами, памятью и проверками. Но между ними не хватает ещё одного слоя — готовых, проверенных навыков, собранных из репозиториев и статей так, чтобы ими можно было пользоваться прямо во время задачи.

На деле цифры у них заметные: если к одному и тому же агенту на базе GPT-5.5 добавить такую библиотеку навыков, качество на MLE-bench вырастает на 134,3%, на PaperBench — на 34,4%, на FrontierCS — на 9,2%, на PassNet — на 14,0%.

Разговор об агентах часто сводится к двум ручкам: взять модель помощнее или переписать обвязку поумнее. Здесь показывают третью ручку: дать агенту заранее собранный и проверенный рабочий опыт.

Что авторы называют навыком

В этой работе навык — это не абстрактная «способность к рассуждению». Это приземлённый артефакт, который агент может открыть и использовать.

У навыка три части:

🟠 Краткая инструкция: что это за навык, когда он нужен, как им пользоваться, какие есть типичные ошибки.

🟣 Справочные материалы: детали по API, настройкам, ограничениям, параметрам, примерам.

🟠 Скрипты: готовые исполнимые обёртки, чтобы агент не переписывал рутинные куски с нуля.

Ключевая мысль такая: агенту не нужно каждый раз заново выяснять, как устроен пакет, какой у него интерфейс и как правильно запускать типичный пайплайн. Это знание можно сжать, структурировать и проверить заранее.

Идея работы: навыки добавляют недостающий слой между моделью и обвязкой и улучшают результаты агента на нескольких бенчмарках.

Авторы ещё вводят различие между двумя частями знания:

🟠 Знание как способность: какие инструменты, методы, модели и API вообще доступны.

🟣 Знание как политика применения: когда именно это использовать, почему, в каком порядке и с какими проверками.

Без первого у агента нет инструмента. Без второго у него есть инструмент, но нет понимания, стоит ли брать его именно сейчас.

Что такое DisCo

Система называется DisCo. Это агент в двух ролях.

В первой роли он создаёт навыки. Во второй — использует их для решения исследовательской задачи.

Процесс сборки навыка состоит из четырёх шагов:

🟠 Выделить нужные способности: понять, какие рабочие возможности есть в репозитории или какие нужны конкретной задаче.

🟣 Собрать подтверждения: вытащить из исходников, документации, тестов и демки всё, что реально подтверждает эти возможности.

🟠 Упаковать в навык: оформить инструкцию, справочные материалы и скрипты.

🟣 Проверить: прогнать тесты, безопасные примеры, проверки интерфейсов, дымовые тесты, а если что-то не сходится — локально исправить и проверить снова.

Авторы не просто делают краткий пересказ репозитория. Они пытаются превратить человеческую документацию в рабочее, проверяемое знание для агента.

Схема DisCo: сначала агент извлекает и проверяет операционное знание, потом подгружает только нужную ветку навыков во время решения задачи.

Есть два режима сборки:

🟠 Независимый от задачи режим: заранее прогнать популярные репозитории и статьи, собрать из них библиотеку переиспользуемых навыков.

🟣 Ориентированный на задачу режим: под конкретную задачу понять, каких знаний не хватает, найти источники и быстро собрать нужные навыки.

Первая часть даёт долговременную библиотеку. Вторая позволяет добрать то, что нужно здесь и сейчас.

Библиотека из 1000 репозиториев

На базе этого пайплайна авторы собрали AREX-Skill Library — библиотеку из 5353 навыков, извлечённых из 1000 популярных репозиториев по машинному обучению.

Эти навыки разложены по:

🟠 20 областям

🟣 178 семействам способностей

То есть агент не получает в контекст всё сразу. Он проходит через маршрутизатор: сначала область, потом семейство, потом нужный граф навыков конкретного репозитория.

Устройство библиотеки навыков: более 5000 навыков из 1000 репозиториев и маршрутизатор, который помогает агенту подгружать только нужный фрагмент.

Это решает сразу две проблемы.

Первая: контекст не переполняется. Агенту не надо читать весь репозиторий или весь архив навыков.

Вторая: знание становится переиспользуемым. Если агент один раз получил аккуратно упакованный рабочий опыт по условному `vLLM`, `sentence-transformers` или `AlphaFold`, этот опыт можно потом использовать в десятках задач.

Короткая выжимка:

🟠 Не весь репозиторий в промт, а короткий входной навык и нужные ответвления.

🟣 Не разовая подсказка, а постоянный артефакт, который можно проверять и обновлять.

🟠 Не память о прошлом запуске, а библиотека операционного знания.

Что получилось на бенчмарках

Самый впечатляющий результат — MLE-bench, набор из 75 задач в духе соревнований по машинному обучению.

Авторы сравнили один и тот же агент Codex на GPT-5.5 в двух режимах: без навыков и с навыками. Бюджет на выполнение задачи оставили одинаковым. Меняли только доступ к заранее собранному операционному знанию.

Итог:

🟠 31,11% → 72,89% по метрике Any Medal на всём наборе.

🟣 +41,78 процентного пункта в абсолюте.

🟠 +134,3% относительно версии без навыков.

Особенно интересно, что на сложных задачах рост ещё сильнее:

🟣 13,33% → 62,22% на самом трудном поднаборе.

Чем сложнее задача, тем дороже агенту учиться методом проб и ошибок. Если он заранее знает, какие библиотеки смотреть, какие настройки обычно работают и где типичные ловушки, он быстрее попадает в рабочую область решений.

На PaperBench, где нужно воспроизводить статьи, средний результат вырос с 29,45% до 39,59%. Там улучшение не такое резкое, но устойчивое: навыки помогли в 18 из 20 задач.

На FrontierCS прирост составил 9,22%. По цифрам это скромнее, но там важен другой эффект: навыки особенно часто вытаскивали задачи, где агент без них застревал на слабом результате. Авторы отдельно показывают, что улучшение не объясняется просто большим числом токенов или шагов. Корреляции почти нет. То есть агент не просто «дольше думал», а думал более направленно.

На PassNet, где агенту нужно генерировать оптимизирующие преобразования для графового компилятора, навыки подняли главный счёт с 1,343 до 1,5313, а число проваленных примеров сократилось с 14 до 5. Здесь навык помогает не столько найти более хитрую оптимизацию, сколько не нарушить корректность и не потеряться в проверках.

Короткая выжимка по результатам:

🟠 MLE-bench: +134,3%

🟣 PaperBench: +34,4%

🟠 FrontierCS: +9,2%

🟣 PassNet: +14,0%

Почему это работает

Большая часть провалов исследовательских агентов — это дефицит прикладного рабочего знания.

Агент может понимать, что ему нужен дообученный трансформер, иной формат валидации или определённый режим инференса. Но дальше начинаются мелочи, на которых всё и разваливается:

🟠 неправильный формат входных данных;

🟣 неподходящая версия пакета;

🟠 неверный вызов API;

🟣 лишняя трата бюджета на нерабочий запуск;

🟠 отсутствие проверок, которые могли бы поймать ошибку раньше.

Люди в реальной работе тоже редко выводят всё это с нуля. Мы опираемся на накопленный опыт: читаем чужие репозитории, помним типичные пайплайны, копируем рабочие шаблоны, держим в голове список частых поломок. Авторы делают примерно то же самое, только пытаются превратить этот опыт в формат, пригодный для машинного использования.

Где у подхода границы

При всей силе результатов ограничения у идеи тоже видны.

Во-первых, сборка навыков стоит денег и времени. Для библиотеки репозиториев авторы тратят в среднем около 40 долларов на репозиторий. Это не космос, но на масштабе сумма заметная.

Во-вторых, качество зависит от маршрутизации. Если агенту подгрузили не тот навык или слишком общий навык, он может отвлечь от более удачной стратегии. На PaperBench были две задачи, где версия с навыками выступила хуже базовой.

В-третьих, знание устаревает. Репозитории меняются, API переезжают, лучшие практики обновляются. Значит, библиотеку навыков нужно поддерживать и периодически пересобирать.

Но всё это выглядит как инженерные ограничения, а не как опровержение идеи.

Вывод

Операционное знание — это то, чего давно не хватало разговорам об ИИ-агентах для исследований. Модель даёт общие способности. Обвязка управляет шагами. Навыки добавляют рабочий опыт: что запускать, в каком порядке, с какими проверками и какими типичными ловушками.

Из этого следует несколько вещей:

🟠 Улучшать агентов можно не только новой моделью и новой обвязкой. Отдельный слой переиспользуемого знания тоже даёт большой прирост.

🟣 Чем сложнее и длиннее задача, тем полезнее заранее собранные навыки. На трудных задачах цена проб и ошибок слишком высока.

🟠 Репозитории и статьи можно превращать в машиночитаемый рабочий опыт. Не в пересказ, а в инструкции, проверки и исполнимые обёртки.

🟣 Следующий этап для исследовательских агентов — библиотеки навыков, а не только рост модели. Если вы хотите, чтобы агент стабильно делал полезную работу, ему нужен не просто интеллект, а накопленный способ действия.

Это, по сути, сдвиг от «агент каждый раз учится жить заново» к «агент приходит на задачу уже с набором проверенных рабочих привычек». Для ИИ-исследований это может оказаться важнее, чем ещё один виток усложнения мультиагентной обвязки.

ИИ-обзоры простыми словами

Каждый день читаем свежие статьи об ИИ и пересказываем главное естественным языком — без хайпа и воды. Если хотите понимать, куда движутся ИИ-агенты раньше остальных, — подписывайтесь.

Новые обзоры — каждый день

В Telegram