Когда ИИ-агенту мало “решить задачу”
Почти все популярные бенчмарки для ИИ-агентов проверяют короткую дистанцию. Нажал кнопку. Вызвал инструмент. Заполнил форму. Дошёл до правильного ответа. Но в жизни многие задачи устроены иначе: вы принимаете решение сегодня, деньги списываются сразу, а ошибка всплывает через неделю. И к этому моменту она уже портит не только один заказ, но и весь бизнес.
Именно эту проблему решает MerchantBench — новый бенчмарк для проверки того, умеют ли LLM-агенты держать курс на длинной дистанции. Сохранять осмысленную стратегию месяцами. Авторы называют это Long-Term Coherence — долгосрочная согласованность поведения. Проще говоря: агент должен не забывать, чего он добивается, связывать поздние последствия со старыми решениями и не превращаться в хаотичный набор реакций.
Площадкой для проверки выбрали интернет-магазин со стороны продавца. Выглядит буднично. Но это хороший выбор. Здесь есть всё, на чём ИИ-агенты обычно начинают путаться: ограниченные деньги, отложенная обратная связь, сезонный спрос, штрафы, рейтинг магазина и постоянная необходимость менять решение.

Динамика на уровне заказа: деньги списываются сразу, а плохие последствия проявляются позже и бьют по рейтингу магазина.
Что такое MerchantBench
MerchantBench — это симулятор магазина на 365 дней. Внутри почти 99 тысяч реальных товарных записей и больше 36 тысяч поставщиков с данными, привязанными к китайской оптовой площадке 1688. Агент управляет магазином, где можно держать до 50 активных товаров, менять цены, добавлять и убирать позиции, следить за балансом, заказами и событиями у поставщиков.
Суть здесь в том, чтобы поставить ИИ-агента в среду, где решения сцеплены друг с другом.
Вот как это работает:
🟠 Агент выбирает товары и выставляет их в магазине.
🟠 Когда приходит заказ, закупка у поставщика происходит сразу, и деньги тут же уходят с баланса.
🟠 Дальше начинается длинный жизненный цикл заказа: отгрузка, доставка, возврат, отмена, жалоба, плохой отзыв.
🟠 Часть проблем видна быстро. Например, поставщик поднял цену или пропал из каталога.
🟠 Часть проблем видна поздно. Например, возвраты, возврат без возврата товара, плохие отзывы, задержки и штрафы.
🟠 Эти поздние события влияют на рейтинг магазина, а рейтинг влияет на будущий спрос.
То есть ошибка в одном товаре может потом просадить продажи во всём магазине.

Общая схема MerchantBench: агент управляет магазином через четыре компонента решений в среде с поставщиками, магазином и симуляцией заказов на 365 дней.
Почему это важно
Сегодня много разговоров про ИИ-агентов, которые смогут автономно работать в цифровых системах. Но короткие бенчмарки часто скрывают главный вопрос: что будет, если такого агента не выключать через 15 минут?
В реальном пайплайне почти всегда есть длинный хвост последствий. Особенно в бизнесе, операционной работе, логистике, закупках, поддержке, финансах. Вы можете принять вроде бы разумное решение, а потом:
🟣 обнаружить, что агент вывел весь кэш из оборота;
🟣 понять, что он не замечает медленно копящихся штрафов;
🟣 увидеть, что он продолжает продавать проблемный товар, хотя возвраты уже начались;
🟣 столкнуться с тем, что он просто перестал активно что-то делать и перешёл в режим пассивного наблюдения.
MerchantBench как раз проверяет это. Умеет ли агент жить с последствиями своих действий.
На чём обучали среду
Авторы не ограничились игрушечной экономикой. Они взяли реальные годовые траектории спроса по 98 843 товарам в 10 категориях: одежда, товары для дома, офиса, спорта, игрушки, техника и так далее. Для каждого товара есть история спроса на 365 дней. Плюс — реальные сигналы по поставщикам и рыночные ежедневные сводки.
Это даёт две вещи.
Первая: спрос меняется по сезону. Летом растут вентиляторы, зимой — другие категории, в праздники спрос прыгает. Если агент однажды нашёл удачные товары и потом просто держится за них, он проигрывает.
Вторая: риск не одинаковый. У товаров и поставщиков разные вероятности проблем. Где-то чаще случаются возвраты. Где-то поставщик склонен задерживать отправку. Где-то товар могут снять с продажи. Агент этого не видит напрямую. Он видит только последствия и должен по ним делать выводы.
Это уже не разовая задача на поиск лучшего товара. Это постоянное перераспределение внимания, денег и места на полках.

Реальные паттерны спроса и откалиброванные профили риска для 98 843 товаров в данных среды.
Как именно проверяли модели
Авторы прогнали 8 моделей в двух агентных фреймворках: ReAct и Hermes. Всего получилось 48 запусков, каждый длился 365 симулированных дней.
Список моделей знакомый: GPT-5.6 Sol, Claude Opus 4.8, Qwen3.7-Max, Qwen3.7-Plus, GLM-5.2, DeepSeek-V4-Pro, DeepSeek-V4-Flash и Kimi K2.6. Для сравнения добавили людей и простую систему на правилах.
Стартовые условия у всех одинаковые:
🟠 2000 юаней на закупки;
🟠 1000 юаней залога;
🟠 максимум 50 активных карточек товара;
🟠 26 инструментов для работы с магазином, заказами, балансом, каталогом и поставщиками.
Метрика тоже не про правильный ответ. Главное — финальные чистые активы. Плюс GMV, маржа, число заказов, штрафы, рейтинг магазина и активность по ходу года.
И здесь начинается самое интересное.
Главный результат: люди далеко впереди
Лучший ИИ-агент оказался очень далеко от людей. Самая успешная конфигурация LLM достигла только 27,3% от среднего финального уровня чистых активов у людей.
Это огромный разрыв. Особенно если помнить, что люди в эксперименте вообще не были опытными продавцами в электронной коммерции.
Если смотреть на таблицу результатов, у людей средние финальные чистые активы — 217,61 тысячи юаней. У лучшей конфигурации среди моделей, Qwen3.7-Max в Hermes, — 59,46 тысячи. У GPT-5.6 Sol в Hermes — 52,93 тысячи. У многих остальных — ещё ниже.
То есть модели не просто немного уступают. Они проигрывают в несколько раз.

Распределения итоговых чистых активов по конфигурациям в трёх повторных запусках.
Почему агенты проваливаются
Авторы разбирают провалы не как абстрактное «модель ещё слабая», а как два конкретных типа сбоев.
Первый — потеря операционной согласованности. Агент со временем просто становится менее активным. Реже заходит в окна принятия решений. Делает меньше вызовов инструментов. Меньше меняет ассортимент и цены. Меньше следит за заказами.
Второй — потеря стратегической согласованности. Агент остаётся активным, но начинает двигаться не к росту чистых активов, а куда-то в сторону. Например, зацикливается на одном локальном правиле, поздно реагирует на плохие сигналы или вообще делает неправильные выводы из накопленного опыта.
Это длинный горизонт проваливает ИИ-агентов не одной большой ошибкой, а накоплением мелких.
Например:
🟣 агент начинает всё чаще только проверять сбои у поставщиков, но почти перестаёт искать новые товары;
🟣 агент рано решает, что магазин уже “не спасти”, и почти прекращает действия;
🟣 агент замечает возвраты, но не снимает проблемный товар;
🟣 агент снижает ассортимент до нескольких позиций и сам душит себе рост;
🟣 агент путается во времени и ведёт себя так, как будто эпизод уже почти закончился, хотя впереди ещё месяцы.
У людей поведение другое. Они чаще сохраняют полный цикл управления: отслеживают спрос, убирают рискованные товары, ищут замены и подстраиваются под сезон. Не потому что они знают идеальную стратегию, а потому что лучше держат причинно-следственную цепочку.
Hermes против ReAct
В среднем Hermes заметно помогал. По восьми моделям он дал на 53,3% больше финальных чистых активов, на 71,5% больше GMV и на 71,2% больше заказов, чем ReAct.
Это логично. Hermes даёт модели дополнительные механики: память, встроенное планирование, возможность писать и запускать код, сохранять навыки. На длинной дистанции это помогает.
Но важная деталь: помогает не всем одинаково. Kimi K2.6, например, в Hermes выступил даже чуть хуже, чем в ReAct. А Qwen3.7-Max, наоборот, сильно вырос.
Из этого следует простая мысль: хороший агентный фреймворк не исправляет слабую долгосрочную стратегию автоматически. Он даёт инструменты. Но если модель плохо связывает поздние последствия со старыми решениями, дополнительные возможности не спасают.
Что видно по стратегиям моделей
Отдельно интересен разбор поведения конкретных моделей.
GPT-5.6 Sol и Kimi K2.6 в некоторых прогонах умели связывать плохие исходы с конкретным товаром и заменять его. Это уже похоже на осмысленную реакцию. Qwen3.7-Plus иногда оставлял рискованный товар “ещё понаблюдать”, а DeepSeek-V4-Pro бывало вообще не пересматривал позицию после возвратов.
Люди шли дальше. Если популярный товар оказывался проблемным, они не просто убирали его, а искали похожий по ключевым словам, чтобы сохранить спрос. Это тонкое, но важное различие. Надо не просто убрать источник штрафов. Надо заменить его чем-то, что продолжит приносить оборот.
Ещё одна деталь — работа с рейтингом магазина. Плохие исходы по отдельным заказам бьют по общей оценке магазина, а она снижает будущий спрос. Некоторые модели это понимали. Например, GPT-5.6 Sol пытался поднимать поток нормальных заказов на проверенных товарах, чтобы восстановить рейтинг. Qwen3.7-Max делал это агрессивнее и массово менял цены после раннего падения до трёх звёзд.
То есть зачатки длинной стратегии у моделей уже есть. Но удерживать её весь год они не умеют.
Что это меняет для оценки ИИ-агентов
MerchantBench показывает неприятную, но полезную вещь: на длинном горизонте агенту мало быть умным в моменте. Ему нужно уметь:
🟠 держать цель месяцами, а не только в одном окне действий;
🟠 помнить старые решения и связывать их с новыми последствиями;
🟠 управлять деньгами, когда прибыль и убытки приходят в разное время;
🟠 менять ассортимент вместе с сезонным спросом;
🟠 не снижать активность к середине длинного эпизода;
🟠 исправлять политику по накопленным данным, а не по одному яркому событию.
Для индустрии это важно по очень простой причине. Если вы хотите запускать ИИ-агентов в закупках, поддержке, операционной работе, торговле или администрировании, короткие демо и короткие бенчмарки вам мало что скажут. Настоящая проблема начинается после десятков и сотен шагов.
Вывод
MerchantBench меряет то, что долго оставалось в тени: может ли ИИ-агент не развалиться в задаче, где последствия растянуты на месяцы. Ответ пока скорее отрицательный.
LLM-агенты умеют действовать, вызывать инструменты и иногда даже адаптироваться. Но на длинной дистанции они часто снижают активность, запутываются в накопленных сигналах, поздно меняют стратегию и слишком слабо связывают локальные решения с итогом для всей системы.
Люди здесь побеждают за счёт более устойчивого управления циклом: заметил проблему, связал с товаром, убрал риск, нашёл замену, сохранил оборот.
Если смотреть шире, следующий этап в развитии ИИ-агентов — это не только лучшие модели и больше инструментов. Нужны механики, которые удерживают долгую цель, сохраняют рабочую память о последствиях и помогают агенту не терять управление собственным пайплайном решений. MerchantBench показывает это очень прямо: длинный горизонт — отдельная способность, и сейчас она у большинства агентов развита слабо.
ИИ-обзоры простыми словами
Каждый день читаем свежие статьи об ИИ и пересказываем главное естественным языком — без хайпа и воды. Если хотите понимать, куда движутся ИИ-агенты раньше остальных, — подписывайтесь.
Новые обзоры — каждый день
В Telegram