i
Новости
Новости · 2026-10-07

Agent Lightning v1.0: лёгкий фреймворк для агентного обучения с подкреплением на 3 500 строк кода — с реальными агентскими пайплайнами

@neuronium_ai @neuronium_ai

Microsoft Research Asia выпустила Agent Lightning v1.0 — открытый фреймворк для обучения ИИ-агентов с подкреплением, который позволяет использовать тот же агентский пайплайн, что и при работе системы. Фреймворк занимает около 3 500 строк кода, поддерживает запуск агентов в Kubernetes без платных песочниц и включает готовый пример для программирования: обучение Qwen3.5-9B на примерно 6 000 образцах повысило результат на SWE-bench Verified с 41,8% до 56,4% Pass@1 — на 14,6 процентного пункта.

Обложка: Agent Lightning v1.0: лёгкий фреймворк для агентного обучения с подкреплением на 3 500 строк кода — с реальными агентскими пайплайнами

ИИ-агенты превратились из отдельных моделей в сложные системы, объединяющие модели, инструменты и среды выполнения. Их возможности всё больше зависят от внешнего пайплайна, который управляет работой модели. Обучение с подкреплением помогает улучшать агентов за счёт проб и ошибок с наградами и штрафами. Но во многих системах для такого обучения разработчикам приходится заново собирать агента внутри обучающего фреймворка. Это требует ресурсов и может привести к тому, что обученная версия будет вести себя не так, как агент, запущенный в рабочей среде.

Исследователи Microsoft Research Asia предложили подход Harnessed Agentic RL и открыли исходный код полностью переработанного Agent Lightning v1.0. По сравнению с предыдущей версией новая система рассчитана на компактную реализацию, работу с настоящими агентскими пайплайнами и воспроизводимый полный цикл обучения.

В Agent Lightning v1.0 исследователи выделяют несколько изменений:

Обучение с настоящим пайплайном агента — агент обращается к модели через прокси для больших языковых моделей (LLM), а его существующий код менять не нужно.
Поддержка Kubernetes — агенты запускаются как обычные задачи Kubernetes, без внешних коммерческих песочниц. Для масштабных запусков подходят собственные кластеры и локальная инфраструктура.
Пример обучения агента для программирования — полный пайплайн на Qwen3.5-9B повысил результат на SWE-bench Verified с 41,8% до 56,4% Pass@1. Для этого использовали около 6 000 обучающих образцов.

Ограничения традиционного обучения агентов

Традиционные системы обучения агентов с подкреплением предполагают, что цикл взаимодействия со средой контролирует сам обучающий фреймворк. В цикле типа ReAct модель предлагает действие, среда возвращает наблюдение, оно добавляется в контекст, после чего модель выбирает следующий шаг. Весь запуск при этом представляется одной непрерывной последовательностью токенов. Так были устроены ранние системы, включая verl, AReaL и slime: чтобы обучать агента, его цикл приходилось заново реализовывать внутри фреймворка.

Настоящие агентские пайплайны устроены сложнее. Инструменты для программирования — mini-SWE-agent, OpenHands, OpenCode, Claude Code и Codex — используют собственное управление контекстом, протоколы инструментов, логику выполнения и зависимости. То же относится и к универсальным агентским системам. Повторная реализация требует много работы, а её результат может отличаться от агента, который используют после обучения.

Agent Lightning предлагает другой подход: между агентом и моделью ставится прокси для LLM. Агент продолжает работать как раньше — достаточно направить в Agent Lightning конечную точку, которая прежде обращалась к API модели. Обучающий фреймворк сможет наблюдать за запросами агента к модели и записывать их. В версии 1.0 этот подход получил формальное название Harnessed Agentic RL: во время обучения с подкреплением используется тот же агентский пайплайн, что и при работе агента в реальной среде.

Традиционное агентное обучение с подкреплением в сравнении с агентным обучением с подкреплением под управлением harness. В традиционном агентном обучении с подкреплением обучающая система управляет средой и циклом агента. В агентном обучении с подкреплением под управлением harness harness управляет и тем и другим

Традиционное агентное обучение с подкреплением в сравнении с агентным обучением с подкреплением под управлением harness. В традиционном агентном обучении с подкреплением обучающая система управляет средой и циклом агента. В агентном обучении с подкреплением под управлением harness harness управляет и тем и другим

Источник: microsoft.com

Четыре сложности обучения с настоящими пайплайнами

В Harnessed Agentic RL цикл взаимодействия со средой контролирует агентский пайплайн, а не обучающий фреймворк. Поэтому обучающая система видит только последовательность запросов и ответов LLM, а один запуск агента может разделиться на разное число обучающих образцов. Это создаёт четыре сложности:

Повторная токенизация и объединение образцов — пайплайны хранят контекст в виде текста, а для обучения нужны идентификаторы токенов, использованные при запуске. Повторная обработка текста через шаблон чата и токенизатор может изменить границы токенов, поэтому соседние вызовы не всегда удаётся объединить в один образец.
Расчёт преимущества — повторная токенизация, субагенты и сокращение контекста могут разбить один запуск на несколько образцов. Если рассчитывать базовые значения и преимущества для каждого образца отдельно, запуски с большим числом образцов будут учитываться чаще. Это искажает статистические соотношения на уровне целого запуска.
Нормализация функции потерь — усреднение потерь по числу образцов придаёт больший вес запускам, которые дали больше образцов. Поскольку их количество часто зависит только от поведения агентского пайплайна, нормализация не должна от него зависеть.
Планирование работы обучающей системы — число и длина образцов становятся известны лишь после завершения работы пайплайна, тогда как количество GPU и настройки параллельной обработки данных и тензоров обычно заданы заранее. Обучающей системе нужно распределять переменную нагрузку по фиксированным ресурсам.

Полный управляющий контур за 3 500 строк кода

В Agent Lightning v1.0 простота заложена в основу архитектуры. Фреймворк занимает около 3 500 строк кода и состоит из трёх основных компонентов: API Gateway, Rollout Controller и Customized Trainer.

Архитектура системы Agent Lightning v1.0: шлюз API, контроллер выполнения и настроенный тренер

Архитектура системы Agent Lightning v1.0: шлюз API, контроллер выполнения и настроенный тренер

Источник: microsoft.com

API Gateway хранит запуски агентов, модели и события, а также работает как совместимый с OpenAI прокси для LLM. Он связывает каждый вызов модели с соответствующим запуском и записывает промты, ответы и логарифмы вероятностей, необходимые для обучения.

Rollout Controller запускает и управляет агентами — как локальными процессами или обычными задачами Kubernetes. Благодаря этому выполнение агентов отделено от обучающей системы.

Customized Trainer построен на verl. Он создаёт запуски, ждёт их завершения, собирает образцы и формирует итоговые обучающие данные через адаптер образцов. Поэтому для подключения существующего агентского пайплайна к обучению с подкреплением обычно достаточно направить конечную точку модели на прокси Agent Lightning.

Асинхронное обучение на общих GPU

Продолжительность запусков агентов сильно различается. При синхронном обучении система ждёт самого медленного агента в группе, а GPU простаивают. Полностью асинхронный режим повышает загрузку, но требует отдельных пулов GPU для запуска агентов и обучения. В Agent Lightning v1.0 эти задачи можно выполнять асинхронно на одном наборе GPU.

Когда система соберёт достаточно запусков, начинается обновление модели: API Gateway временно прекращает принимать новые запросы и ждёт завершения уже начатых. После обновления запуск агентов возобновляется. Для внешнего агентского пайплайна этот переход незаметен.

В экспериментах такой подход обеспечил примерно двукратное ускорение полного цикла по сравнению с синхронным обучением и потребовал меньше GPU, чем обычное асинхронное обучение.

Синхронное обучение с подкреплением, асинхронное обучение с подкреплением и совмещённое асинхронное обучение с подкреплением в сравнении. Совмещённое асинхронное обучение с подкреплением повышает загрузку, занимая меньше графических процессоров

Синхронное обучение с подкреплением, асинхронное обучение с подкреплением и совмещённое асинхронное обучение с подкреплением в сравнении. Совмещённое асинхронное обучение с подкреплением повышает загрузку, занимая меньше графических процессоров

Источник: microsoft.com

Запуск агентов в Kubernetes

Для сбора достаточного количества запусков нужно одновременно выполнять много агентов, что требует значительных ресурсов процессора, памяти и вычислений. Другие фреймворки Harnessed Agentic RL часто размещают агентов в коммерческих песочницах, таких как Modal Sandbox или E2B, где расходы быстро растут при масштабировании.

Agent Lightning v1.0 запускает агентов как обычные задачи Kubernetes. Для этого можно использовать собственные кластеры, облачный Kubernetes или локальную инфраструктуру. Такой способ эффективнее задействует имеющиеся ресурсы, снижает стоимость масштабных запусков и сохраняет весь пайплайн открытым и воспроизводимым.

Контроллер выполнения в Agent Lightning v1.0 поддерживает Kubernetes из коробки и запускает агентов напрямую как стандартные задания Kubernetes

Контроллер выполнения в Agent Lightning v1.0 поддерживает Kubernetes из коробки и запускает агентов напрямую как стандартные задания Kubernetes

Источник: microsoft.com

6 000 образцов и прирост на 14,6 процентного пункта

Чтобы проверить подход, исследователи собрали полный пайплайн на основе SWE-smith, mini-SWE-agent и Qwen3.5-9B. Он охватывает очистку данных, создание среды выполнения, защиту от поиска лазеек в системе вознаграждений и обучение с подкреплением. В обучающем наборе около 6 000 образцов; масштабные вычисления для этого не требуются.

Одно только обучение с подкреплением повысило результат Qwen3.5-9B на SWE-bench Verified с 41,8% до 56,4% — на 14,6 процентного пункта.

Эксперименты с агентом для программирования также подтвердили выводы исследователей о расчёте преимущества и нормализации функции потерь. По сравнению с обработкой на уровне отдельных образцов расчёт преимущества и нормализация на уровне запуска дают более высокую награду на проверке и помогают поддерживать стабильность энтропии политики во время обучения.

Доля успешных ответов и энтропия политики для Qwen3.5-9B на проверочном наборе SWE-smith

Доля успешных ответов и энтропия политики для Qwen3.5-9B на проверочном наборе SWE-smith

Источник: microsoft.com

Публикация и авторы

С работой связан материал Agent Lightning v1.0: Towards Harnessed Agentic RL.

Жиюань Хэ — инженер-исследователь по разработке программного обеспечения II.

Юйцин Ян.

Пентагон рассчитывает ускорить закупки ИИ для «цепочки поражения» с помощью пятиминутных видео Отставной полковник ВВС предупреждает: жизнь рядом с дата-центрами опасна — вас могут атаковать или убить Новый сайт Google распознаёт созданные ИИ изображения, видео и аудио с помощью SynthID Австралия строит всё больше жилья. Но не тормозит ли бум дата-центров стройку домов? Тэтчеризм через Walkman: культурологические исследования Стюарта Холла в Британии сохранили в цифровом архиве McDonald’s обвинили в нарушении антимонопольных законов из-за ИИ-инструмента для расчёта цен во франшизах OpenAI хочет поручить своему новому агенту всю вашу жизнь. Мой признался мне в любви Проверка выявила: ChatGPT for Teens от OpenAI — «небезопасная» неразбериха Ваша следующая любимая книга может получить знак «органическая» Достаточно ли регулирования, чтобы ИИ не уничтожил человечество? Теперь Claude можно открыть прямо в Google Docs, Sheets и Slides — и наоборот, файлы Google можно открывать и редактировать в Claude Сэм Альтман-миллиардер просит не бояться ИИ: риски достаются нам, деньги — ему Главное препятствие для ИИ-агентов — сайты, которые не пускают их внутрь Бывшие инженеры Ramp привлекли $20 млн на платформу Melius после отказа от первого продукта Qualcomm против Arm: продолжение истории — спор не только о лицензиях Австралийский регулятор по защите данных начал расследование компании из Китая, создавшей приложение для «очков извращенца» Kmart Moment Energy и морские контейнеры, набитые старыми батареями электромобилей LibreOffice: отсутствие ИИ становится преимуществом программы Трамп дал понять: его власть всё теснее переплетается с ИИ Новая модель Google Nano Banana 2.1 создаёт изображения лучше и дешевле

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram