ИИ не может запустить стартап —
и вот почему
Агенты хорошо справляются с короткими задачами, но на длинной дистанции их подводят память, непоследовательность и неумение следовать стратегии.
ИИ‑агенты уже научились неплохо решать задачи, где нужно сделать десяток действий, вызвать пару инструментов и выдать ответ. Но стоит растянуть задачу на сотни шагов — как в реальной работе — и начинается самое интересное. Ранние ошибки накапливаются, обратная связь приходит с задержкой, а контекст переписки у модели не бесконечный. В итоге агент может вести себя так, будто забывает собственные правила.
Авторы работы ycbench: Benchmarking AI Agents for Long-Term Planning and Consistent Execution предлагают проверять именно способность сохранять стратегию и последовательно решать задачи.
Симулированный стартап
В ycbench агент управляет стартапом целый «год» симуляции. Есть стартовый капитал $200k, команда сотрудников с разными навыками по доменам (training, inference, research, data engineering), рынок контрактов, дедлайны и ежемесячный payroll, который растёт. Уже одно это заставляет думать наперёд: можно радоваться хорошему контракту сегодня, но через пару месяцев зарплатная ведомость догонит и утопит компанию.
Главная ловушка — примерно треть клиентов враждебные. Это не «плохие поставщики, о которых заранее известно», а контракты, которые выглядят нормально, но после принятия внезапно раздуваются по объёму работ и становятся почти невыполнимыми. Узнать это напрямую нельзя: агент должен вывести закономерность по серии провалов и… запомнить её.
История общения усечена до последних 20 ходов. Всё, что агент не записал в долговременные заметки, со временем исчезает. Поэтому ycbench тестирует не только рассуждение, но и цикл «заметил проблему — зафиксировал — использовал позже».
Как устроена проверка
Агент работает через CLI: смотрит рынок задач, принимает контракты, назначает сотрудников, продвигает время. Среда частично наблюдаемая: видны финансы и события, но многое нужно запрашивать отдельно. Награда — сколько денег осталось в конце года (или банкротство, если баланс уходит в минус).
Здесь эффект от решения может проявиться только спустя недели симуляции: например, стратегическое наращивание доверия к одному клиенту снижает будущую нагрузку и открывает более выгодные контракты, но сначала это выглядит как скучная рутина.
Что получилось у 12 моделей. Спойлер: выжили не все
Исследователи 3 раза запускали симуляцию на 12 моделях. Стабильно увеличить стартовый капитал смогли только три модели — Claude Opus 4.6, GLM‑5 и GPT‑5.4. Остальные либо еле-еле держатся на плаву, а некоторые банкротятся.
У Claude Opus 4.6: $1.27M, следом GLM‑5: $1.21M, причём GLM‑5 достигает близкого результата при заметно меньшей стоимости инференса (в работе подчёркивают разницу примерно на порядок).
Отрыв появляется рано — уже к февралю–марту симуляции: сильные модели быстрее «схлопывают неопределенность» в понятную стратегию. Они выбирают 1–2 надёжных клиента, накапливают доверие, снижают будущий объём работ и запускают эффект снежного кома. Слабые модели размазывают усилия по рынку, постоянно берут новые контракты, не успевают, и в итоге расчет зарплаты в конце месяца начинает работать против них.
Самый сильный фактор успеха — не «IQ», а заметки
Самый неожиданный и важный вывод статьи: использование долгосрочных заметок — сильнейший фактор успеха. То есть выигрывает не та модель, которая один раз блестяще рассуждает, а та, которая регулярно фиксирует правила и обновляет их по мере опыта: кого избегать, как оценивать выполнимость, каких сотрудников ставить в каких доменах.
Вторая причина провалов: нераспознавание враждебных клиентов. На их долю приходится около 47% банкротств. Многие модели берут такие контракты даже чаще, чем «естественная доля рынка» (32%), потому что не строят чёткой политики отбора клиентов и не сохраняют выводы в памяти.
Что это меняет в разработке агентов
Ycbench показывает, что «долгосрочная связность» — это конкретный конвейер: заметить сигнал → записать → достать позже → последовательно выполнить. И если в обычных тестах модель можно «протащить» за счёт разового рассуждения, то здесь победа больше похожа на управленческую устойчивость.
Бенчмарк при этом сделан так, чтобы быть полезным: он воспроизводимый, настраиваемый и открытый. А ещё он помогает честно сравнивать подходы к памяти и к исполнению (не просто план, а контроль выполнения в сотнях шагов).
В разборе ошибок авторы показывают разные режимы отказа: одна модель рассуждает верно, но перегружает сотрудников; другая понимает, что близка к банкротству, но почти не действует; третья действует много, но по механическому циклу, не обучаясь на провалах.
Вывод: ИИ может помочь построить стартап, но не запустить его самостоятельно: на длинной дистанции его подводят память, непоследовательность и неумение следовать общей стратегии.
ИИ-обзоры статей
Каждый день читаем свежие статьи по ИИ и пересказываем главное человеческим языком — без хайпа и воды. Если хотите понимать, куда движутся ИИ-агенты раньше остальных, — подписывайтесь.
Новые обзоры — каждый день
В Telegram