i
ДАТАИСТ
Обзор · 2026-05-25

Улучшать нужно не модель, а интерфейс агента

Обложка: Улучшать нужно не модель, а интерфейс агента

В гонке за более умными агентами на базе LLM мы почти автоматически думаем о привычных рычагах: взять модель побольше, докрутить файн-тюнинг, добавить RL, переписать инструкцию. Но авторы работы Adapting the Interface, Not the Model предлагают неприятно простой вопрос: а что, если агент проваливается не потому, что «плохо думает», а потому что плохо встроен в среду?

Когда проблема не в модели, а в «проводке»

Агент — это не только сама LLM. Между моделью и миром стоит целый слой: как ей показывают наблюдения, как описывают инструменты, как исполняют действия, как возвращают ошибки и как останавливают зацикливание. Именно этот слой авторы называют рантайм-обвязкой, и именно его они предлагают адаптировать вместо весов модели.

Результат выглядит впечатляюще: система Life-Harness улучшает качество в 116 из 126 сочетаний «модель-среда» на семи детерминированных задачах, а средний относительный прирост достигает 88,5%. И всё это — без изменения весов модели.

Главная идея работы: адаптировать не модель, а рантайм-обвязку, через которую агент взаимодействует со средой.

Почему это вообще важно

Сегодня индустрия привыкла мыслить моделецентрично. Если агент плохо управляет операционной системой, ошибается в базе данных или путается в интернет-магазине, стандартный рецепт звучит так: дообучим его на похожих траекториях. В этом есть логика, но есть и цена: обучение дорого, зависит от конкретной модели и часто плохо переносится на другие среды.

Авторы показывают, что в детерминированных, строго регулируемых сценариях — там, где есть фиксированные правила, инструменты, форматы ответов и понятные критерии успеха, — многие сбои возникают на границе «модель-среда». Не потому, что у модели нет способности к рассуждению, а потому что:

она вызывает не тот инструмент;
передаёт аргументы не в том формате;
пишет действие в свободном тексте вместо структурированного вызова;
неверно интерпретирует обратную связь;
начинает крутиться в цикле и не замечает этого.

Это особенно интересно на фоне парадокса современных LLM: модель может хорошо решать сложную математику, но слабо справляться с простым на вид агентным сценарием, где надо не просто «понять задачу», а действовать по контракту среды.

Агент — это не только LLM: его поведение формируется всей интерфейсной прослойкой между моделью, инструментами, действиями и обратной связью.

Именно поэтому работа важна не только как ещё один способ поднять метрики. Она предлагает более практичный взгляд на агентные системы: прежде чем учить модель заново, стоит проверить, не ломается ли всё в «операционной прослойке».

Что такое Life-Harness

Life-Harness — это многоуровневая рантайм-обвязка, которая улучшает работу «замороженного» агента. Веса модели не меняются, тестовая среда не меняется, а сама обвязка эволюционирует по тренировочным траекториям и потом фиксируется для оценки на новых задачах.

Ключевая идея в том, что повторяющиеся провалы можно не «зашивать» в параметры модели, а превратить в переиспользуемые интерфейсные вмешательства.

Система устроена в виде четырёх слоёв жизненного цикла взаимодействия:

Слой контракта среды — уточняет правила до начала эпизода: какие инструменты допустимы, как их вызывать, какие есть ограничения и типичные ловушки.
Слой процедурных навыков — достаёт из памяти компактные инструкции и шаблоны действий, извлечённые из прошлых траекторий.
Слой реализации действий — проверяет, исполнимо ли действие модели, и при необходимости приводит очевидные ошибки формата к каноническому виду.
Слой регулирования траектории — следит за динамикой эпизода и вмешивается, если агент начал повторяться, топтаться на месте или сжигать бюджет шагов без прогресса.

На практике это значит, что Life-Harness может, например, напомнить модели, что поиск авиабилетов принимает только город отправления, назначения и дату; не дать отправить заведомо невалидный вызов; подсказать, что для задачи в интернет-магазине сначала надо выбрать размер и цвет, а уже потом нажимать покупку; или распознать бессмысленную петлю из одинаковых команд.

Как авторы пришли к этой архитектуре

Сильная сторона статьи — не только в результате, но и в том, что архитектура не взялась из воздуха. Авторы сначала вручную разобрали неудачные траектории базового агента и классифицировали типичные причины сбоев.

Они выделили четыре категории:

ошибки реализации действия;
несоответствие контракту среды;
деградация траектории;
остаточные ошибки рассуждения.

Это важный момент. В популярных обсуждениях агентных систем почти все проблемы любят сводить к «модель плохо рассуждает». Здесь картина иная: в детерминированных средах провалы очень разнородны, и значительная их часть не требует улучшения самой модели.

Обзор Life-Harness: четыре слоя вмешательства на разных этапах жизненного цикла агента — до действия, во время и после него.

Отсюда и дизайн Life-Harness: разные типы ошибок ловятся в разных местах. Где-то надо переписать контракт, где-то — подмешать процедурный навык, где-то — отфильтровать действие до исполнения, а где-то — остановить уже развернувшуюся деградацию.

Технически система эволюционирует по тренировочным траекториям с помощью агента для программирования: он анализирует журналы, находит повторяющиеся паттерны ошибок и предлагает обновления соответствующих слоёв. При этом тестовые задачи скрыты, а после завершения эволюции обвязка фиксируется. То есть это не онлайн-подстройка под тест, а именно отдельный этап разработки интерфейсного слоя.

Где тестировали и что получилось

Авторы проверили Life-Harness на семи средах из трёх наборов задач: сценарии с авиалиниями, розницей, телекомом, домашними интерактивными задачами, интернет-магазином, управлением операционной системой и базами данных. Это хороший набор: он охватывает и деловые рабочие процессы, и классические агентные бенчмарки.

Особенно примечательно, что обвязку эволюционировали только на траекториях Qwen3-4B-Instruct, а потом применяли ещё к 17 другим моделям. То есть авторы проверяли не «умеет ли система подогнать инструкцию под одну модель», а переносится ли найденная структура среды между разными семействами.

Главные цифры:

улучшение в 116 из 126 настроек;
средний относительный прирост 88,5%;
особенно заметные выигрыши в ALFWorld, WebShop, DBBench и телеком-сценариях.
Абсолютный прирост качества на 18 моделях и 7 бенчмарках: выигрыш наблюдается почти везде.

Если смотреть по средним результатам, картина такая:

ALFWorld: с 41,1% до 75,7%;
WebShop: с 31,4% до 44,0%;
OS: с 34,7% до 41,2%;
DBBench: с 48,4% до 64,6%;
Airline: с 49,7% до 62,6%;
Telecom: с 55,3% до 69,0%.

То есть выигрыш не декоративный. В ряде случаев это разница между «агент в целом ненадёжен» и «с ним уже можно работать».

Ещё один важный вывод: маленькие модели с хорошей обвязкой начинают конкурировать с гораздо более крупными. Для практики это, возможно, даже важнее, чем очередной рекорд SOTA. Если качество можно поднять без дообучения и без перехода на модель в разы дороже, это сразу меняет экономику агентных систем.

Почему это лучше, чем просто эволюция инструкции

Авторы отдельно сравнили Life-Harness с подходом, где эволюционируется только инструкция. Инструкция тоже помогает, но гораздо слабее. И это логично: инструкция работает только на входе, а большинство проблем агентов возникают по ходу взаимодействия.

Инструкция не может:

перехватить невалидный вызов инструмента перед исполнением;
исправить очевидную ошибку в формате действия;
обнаружить цикл из повторяющихся шагов;
встроить механическую защиту от заведомо провальных действий.

Именно поэтому рантайм-обвязка оказывается сильнее: она работает не только как текстовая инструкция модели, а как активный интерфейс между агентом и средой.

А как это соотносится с обучением моделей

Один из самых интересных фрагментов статьи — сравнение с моделями, которые уже прошли специализированное обучение на использование инструментов. На первый взгляд может показаться, что если модель уже доучили под агентные сценарии, дополнительная обвязка ей не нужна. Но результаты показывают более сложную картину.

Авторы сравнили базовую модель Qwen2.5-32B-Instruct, её специализированную производную xLAM-2-32B и обе версии с Life-Harness. Выводы получились такие:

рантайм-обвязка может обойти специализированное обучение даже без изменения весов;
после обучения обвязка всё равно остаётся полезной и даёт дополнительный прирост;
специализированное обучение не всегда хорошо переносится на новые среды вне тренировочного распределения.
Сравнение специализированного обучения работе с инструментами и рантайм-обвязки: обвязка не заменяет обучение полностью, но часто выигрывает и хорошо дополняет его.

Это, пожалуй, главный практический тезис статьи. Обучение и адаптация интерфейса решают разные задачи. Обучение подгоняет внутреннее поведение модели под распределение данных. Обвязка подгоняет взаимодействие под конкретную среду. Эти вещи не конкурируют напрямую — они дополняют друг друга.

Что особенно понравилось в работе

Во-первых, статья предлагает здравый инженерный взгляд на агентов. Вместо магического «надо больше рассуждения» — конкретный анализ того, где именно ломается цикл взаимодействия.

Во-вторых, у авторов получилась хорошая декомпозиция ошибок. Это не абстрактная философия про «системный уровень», а вполне прикладная схема, которая позволяет локализовать проблему и починить её без переобучения всего остального.

В-третьих, переносимость между 18 моделями — очень сильный аргумент. Он показывает, что Life-Harness действительно выучивает не повадки одной конкретной LLM, а структуру самой среды.

Наконец, работа хорошо попадает в реальность продакшена. В промышленной системе чаще хочется не переучивать модель на тысячи GPU-часов, а надёжно улучшить слой исполнения, валидации и обработки ошибок.

Ограничения и что дальше

Авторы честно оговаривают границы подхода. Life-Harness работает в детерминированных, формализованных средах, где есть стабильные правила, чёткие инструменты и воспроизводимые ошибки. Это идеальные условия для интерфейсной адаптации.

Но в открытых задачах, где меняются цели, инструменты и критерии успеха, такой подход будет применить намного труднее. Чем менее стабильна среда, тем сложнее построить фиксированный контракт и тем меньше шансов, что найденные вмешательства будут переиспользуемыми.

Тем не менее именно в «скучных» и строго регламентированных сценариях — работа с базами, внутренними API, операционными системами, бизнес-процессами — сегодня и живёт большая часть практической ценности агентных систем. Так что ограничение не обесценивает результат, а скорее очерчивает его наиболее продуктивную зону.

Вывод

Эта работа бьёт в очень точную цель: не каждый провал агента надо лечить новой моделью. Иногда достаточно починить интерфейс, через который модель видит мир и действует в нём.

Life-Harness показывает, что рантайм-обвязка — не второстепенная инженерная деталь, а самостоятельный объект оптимизации. Причём объект дешёвый, переносимый и практически полезный. В мире, где все соревнуются в обучении всё больших моделей, это звучит почти еретически — и именно поэтому так интересно.

Главный вывод статьи можно сформулировать так: будущее агентных систем, вероятно, зависит не только от того, насколько умна модель, но и от того, насколько грамотно устроен её контакт со средой. И, судя по этой работе, именно здесь сейчас лежит один из самых недооценённых резервов роста.

ИИ-обзоры статей

Каждый день читаем свежие статьи по ИИ и пересказываем главное человеческим языком — без хайпа и воды. Если хотите понимать, куда движутся ИИ-агенты раньше остальных, — подписывайтесь.

Новые обзоры — каждый день

В Telegram