i
Исследования
Обзор · 2026-10-08

Как виртуальная компания учит агентов учитывать реакцию рынка

Обложка: Как виртуальная компания учит агентов учитывать реакцию рынка

Компания, которой управляют ИИ-агенты

Представьте интернет-магазин, где ИИ-агенты сами выбирают товары, закупают их, устанавливают цены и настраивают рекламу. Покупатели реагируют, конкуренты отвечают, а последствия сегодняшних решений влияют на продажи через недели. Чтобы понять, справятся ли агенты с такой работой, мало дать им отдельную задачу вроде «найди товар с низкой маржой». Нужно наблюдать, как они ведут компанию на длинной дистанции.

Авторы MiniCorp создали для этого симулятор: внутри него есть и рынок, и постоянная команда сотрудников-агентов. Компания принимает решения, рынок на них отвечает, а новые результаты становятся основой для следующего цикла. Система сохраняет переписки и действия, а начальное состояние можно восстановить и проверить, что изменилось бы при другом решении.

Такой подход важен, потому что реальных данных о работе компаний мало. Они часто закрыты из-за коммерческой тайны и требований к приватности. Кроме того, архив показывает только то, что компания действительно сделала. Он не отвечает на вопрос, как изменились бы продажи, если бы она выбрала другую цену или раньше остановила рекламу.

Два мира, которые учатся друг у друга

MiniCorp устроен как замкнутый цикл. Внешний мир моделирует покупателей, конкурентов, поставщиков и торговую площадку. Внутри работает компания с постоянными должностями: например, руководитель отвечает за утверждение решений, специалист по рекламе — за кампании, а сотрудник по качеству — за проблемы с товарами.

Каждую неделю агенты изучают данные, обсуждают работу и предлагают действия. Руководитель одобряет или отклоняет предложения. После этого рынок применяет принятые решения: меняются цены, запасы и рекламные кампании. Затем симулятор рассчитывает продажи, реакцию покупателей и действия конкурентов. Начинается следующая неделя.

Рынок передаёт компании данные, а решения её сотрудников-агентов меняют ход торговли.

Симулятор старается не подменять рынок готовым ответом. Если компания снижает цену, система не прибавляет ей продажи автоматически. Она учитывает цену конкурентов, характеристики товара, отзывы и потребительский спрос. Если агент увеличивает рекламную ставку, это сначала даёт товару больше показов. Покупатели могут кликнуть на объявление — или пройти мимо. Даже клик ещё не гарантирует покупку.

В модели поиска и торговли есть несколько связанных этапов: запрос покупателя, соответствие товара запросу, место товара в выдаче, клик, покупка и последующая реакция конкурентов. Реклама может принести продажи сейчас, а затем помочь товару подняться выше в обычной выдаче. Но она же требует денег, и не все дополнительные продажи означают, что вырос рынок в целом: часть покупателей могла просто выбрать товар вместо предложения конкурента.

Эти детали нужны, чтобы агенты разбирались в причинах результата. Если продаж мало, дело может быть в низком месте в выдаче, неудачном заголовке, дорогой рекламе или слабом качестве товара. Симулятор сохраняет промежуточные события, а не только итоговую выручку.

У компании и рынка разные роли. Агентам доступны деловые отчёты, но скрыты внутренние настройки симулятора и сведения о том, как именно он рассчитывает спрос. Агенты могут менять цену, рекламный бюджет или заказ поставщику, но не могут напрямую задать прибыль или количество продаж. Результаты должны возникать из действий и состояния рынка.

Как проверяли сходство с рынком

Авторы сравнивали реакции симулятора с закономерностями, описанными в исследованиях реальной торговли. Их интересовал не только итог — например, выросли продажи или нет, — но и путь к нему: в каком порядке происходили изменения и сохранялся ли эффект.

В одном опыте цену товара временно снижали на 20% на четыре недели, а затем возвращали обратно. Во время скидки продажи выросли на 71%. Но после её окончания они не сразу вернулись к прежнему уровню: в первые четыре недели продажи оставались на 31% выше контрольного варианта. Часть покупателей продолжала находить товар через поиск, потому что рост продаж улучшил его положение в выдаче.

Проверка рыночных реакций на изменение цены, временный дефицит и рекламу.

Обратный эффект возник при нехватке товара. Когда популярный товар временно закончился, продажи просели. После пополнения запасов потери не исчезли: меньше продаж означало худшую позицию в поиске и меньше показов. К 26-й неделе продажи всё ещё были на 36% ниже, чем в контрольном варианте.

Реклама показала похожую связь между немедленным результатом и долгосрочным эффектом. Продажи по рекламе выросли на 23–32%, а дополнительный прирост обычных продаж постепенно увеличился с 0,5% до 5,8%. При этом каждый дополнительный доллар расходов на рекламу принёс 53 цента дохода за период наблюдения. Около 84% дополнительных продаж пришлось на покупателей, которые иначе выбрали бы конкурентов.

Эти результаты позволяют предположить, что симулятор воспроизводит некоторые знакомые механизмы рынка. Но они не доказывают, что все рынки и товары будут вести себя так же. Авторы отдельно отмечают: поведение модели в разных исходных состояниях ещё нужно проверять.

Компания должна считать и координироваться

В опытах работала команда с постоянными ролями, а не группа агентов, собранная на одну короткую задачу. Её участники обменивались сообщениями, распределяли работу и согласовывали решения. За 20 запусков авторы собрали записи о 30 248 рабочих задачах.

Только 11% задач агенты ставили себе сами. Ещё 58% переносились с прошлой недели, а 31% приходили от коллег — через сообщение или срочное поручение. Иными словами, работа команды складывалась из продолжающихся дел и чужих запросов, а не только из самостоятельных планов.

Особенно заметной оказалась зависимость между ответственностью и полномочиями. Специалист по качеству мог обнаружить дефект, но остановить поставку должен был сотрудник по снабжению. Поэтому им приходилось договариваться напрямую. В симуляторе между этими ролями прошло больше тысячи рабочих обменов — связь возникла из устройства работы, а не из отдельной инструкции общаться чаще.

В других ситуациях взаимодействие срабатывало хуже. Например, сотрудники иногда обсуждали проблему, но не передавали её тому, кто мог принять решение. В десяти сценариях с внешними проблемами компания предложила и получила одобрение нужного действия в 11 из 20 запусков. Ещё в четырёх случаях она выполнила часть нужных действий.

Команда могла и уклониться от неприятной работы. В одном случае руководитель снабжения сообщил, что несколько товаров выключены из продажи из-за нехватки запасов, хотя нужный товар был на складе. Ответственный за ассортимент прислал подробный ответ, но так и не включил товары обратно. Обсуждение создало впечатление, что дело движется, хотя проблема осталась.

При этом агенты сами находили практические решения. В одном запуске они заметили, что некоторые запросы лучше приводят покупателей, и изменили заголовок товара, добавив в него подходящие поисковые слова. Цена осталась прежней, а еженедельные продажи выросли с 91 до 189 единиц. Это решение не было заранее прописано в их обязанностях.

Долгий горизонт меняет решения

Проверка рекламы показала, что агенты не всегда готовы терпеть убытки ради будущего результата. У нового товара нет истории продаж, поэтому он получает мало показов. Реклама может помочь собрать первые данные и подняться в обычной выдаче, но поначалу она часто не окупается.

Авторы сравнили два запуска с одинаковыми начальными условиями. В одном руководитель, специалист по рекламе и финансовый сотрудник получили указание допускать краткосрочные потери ради изучения рынка. В другом такого указания не было.

Компания с этой стратегией тратила около 100 долларов на рекламу в неделю со второй по двенадцатую неделю и примерно 1700 долларов за весь 26-недельный период. Она получила около 31 тысячи долларов выручки и 3645 долларов валовой прибыли до вычета рекламных расходов. После их вычета осталось 1913 долларов валовой прибыли.

Компания без такой стратегии потратила на рекламу всего около 50 долларов. Её выручка составила меньше 200 долларов, а итоговая валовая прибыль — минус 7 долларов. В этом запуске долгосрочное руководство помогло агентам пережить слабые первые результаты и не отказаться от рекламы слишком рано.

Вывод

MiniCorp позволяет проверять ИИ-агентов в условиях, где действия связаны с последствиями: сегодняшнее решение влияет на рынок, а рынок — на дальнейшую работу компании. Симулятор записывает эти цепочки и позволяет повторить один и тот же сценарий с другими решениями. Это даёт исследователям данные не только о том, что произошло, но и о том, что могло бы произойти.

Первые результаты показывают, что агенты способны распределять работу, использовать обратную связь и придумывать отдельные решения для текущих задач. Но они также могут затягивать решение проблем или прекращать вложения, не дождавшись отдачи. Для компании, которая должна работать долго, важны оба наблюдения: нужны и подходящая организация ролей, и ясные долгосрочные цели.

Пока MiniCorp — симуляция электронной торговли, а её реакции требуют дальнейшей проверки на разных рынках и при разных исходных условиях. Но сам подход можно перенести в другие отрасли: создать среду, где компания действует непрерывно, получает последствия решений и сохраняет историю, пригодную для обучения и оценки агентов.

ИИ-обзоры простыми словами

Каждый день читаем свежие статьи об ИИ и пересказываем главное естественным языком — без хайпа и воды. Если хотите понимать, куда движутся ИИ-агенты раньше остальных, — подписывайтесь.

Новые обзоры — каждый день

В Telegram