i
ДАТАИСТ
Обзор · 2026-04-03

ИИ не может запустить стартап —
и вот почему

Обложка: ИИ не может запустить стартап

Агенты хорошо справляются с короткими задачами, но на длинной дистанции их подводят память, непоследовательность и неумение следовать стратегии.

ИИ‑агенты уже научились неплохо решать задачи, где нужно сделать десяток действий, вызвать пару инструментов и выдать ответ. Но стоит растянуть задачу на сотни шагов — как в реальной работе — и начинается самое интересное. Ранние ошибки накапливаются, обратная связь приходит с задержкой, а контекст переписки у модели не бесконечный. В итоге агент может вести себя так, будто забывает собственные правила.

Авторы работы ycbench: Benchmarking AI Agents for Long-Term Planning and Consistent Execution предлагают проверять именно способность сохранять стратегию и последовательно решать задачи.

Обзор ycbench
Обзор ycbench. Агент общается со средой через CLI‑команды и получает структурированные наблюдения. Часть состояния видима (задачи, сотрудники, финансы, доверие), а часть скрыта — например, враждебные клиенты.

Симулированный стартап

В ycbench агент управляет стартапом целый «год» симуляции. Есть стартовый капитал $200k, команда сотрудников с разными навыками по доменам (training, inference, research, data engineering), рынок контрактов, дедлайны и ежемесячный payroll, который растёт. Уже одно это заставляет думать наперёд: можно радоваться хорошему контракту сегодня, но через пару месяцев зарплатная ведомость догонит и утопит компанию.

Главная ловушка — примерно треть клиентов враждебные. Это не «плохие поставщики, о которых заранее известно», а контракты, которые выглядят нормально, но после принятия внезапно раздуваются по объёму работ и становятся почти невыполнимыми. Узнать это напрямую нельзя: агент должен вывести закономерность по серии провалов и… запомнить её.

История общения усечена до последних 20 ходов. Всё, что агент не записал в долговременные заметки, со временем исчезает. Поэтому ycbench тестирует не только рассуждение, но и цикл «заметил проблему — зафиксировал — использовал позже».

Как устроена проверка

Агент работает через CLI: смотрит рынок задач, принимает контракты, назначает сотрудников, продвигает время. Среда частично наблюдаемая: видны финансы и события, но многое нужно запрашивать отдельно. Награда — сколько денег осталось в конце года (или банкротство, если баланс уходит в минус).

Здесь эффект от решения может проявиться только спустя недели симуляции: например, стратегическое наращивание доверия к одному клиенту снижает будущую нагрузку и открывает более выгодные контракты, но сначала это выглядит как скучная рутина.

Что получилось у 12 моделей. Спойлер: выжили не все

Исследователи 3 раза запускали симуляцию на 12 моделях. Стабильно увеличить стартовый капитал смогли только три модели — Claude Opus 4.6, GLM‑5 и GPT‑5.4. Остальные либо еле-еле держатся на плаву, а некоторые банкротятся.

Прибыльность моделей
Из 12 моделей прибыльны 5, а существенную прибыль дают только 3.

У Claude Opus 4.6: $1.27M, следом GLM‑5: $1.21M, причём GLM‑5 достигает близкого результата при заметно меньшей стоимости инференса (в работе подчёркивают разницу примерно на порядок).

Отрыв появляется рано — уже к февралю–марту симуляции: сильные модели быстрее «схлопывают неопределенность» в понятную стратегию. Они выбирают 1–2 надёжных клиента, накапливают доверие, снижают будущий объём работ и запускают эффект снежного кома. Слабые модели размазывают усилия по рынку, постоянно берут новые контракты, не успевают, и в итоге расчет зарплаты в конце месяца начинает работать против них.

Доля успешных задач
Доля успешных задач, где требуется доверие клиента: видно, кто умеет накапливать доверие и выходить на более выгодные контракты.
Завоевывание доверия
Более совершенные модели способны со временем завоевывать доверие клиентов за счет стратегического отбора клиентов.

Самый сильный фактор успеха — не «IQ», а заметки

Самый неожиданный и важный вывод статьи: использование долгосрочных заметок — сильнейший фактор успеха. То есть выигрывает не та модель, которая один раз блестяще рассуждает, а та, которая регулярно фиксирует правила и обновляет их по мере опыта: кого избегать, как оценивать выполнимость, каких сотрудников ставить в каких доменах.

Вторая причина провалов: нераспознавание враждебных клиентов. На их долю приходится около 47% банкротств. Многие модели берут такие контракты даже чаще, чем «естественная доля рынка» (32%), потому что не строят чёткой политики отбора клиентов и не сохраняют выводы в памяти.

Доля принятых задач от враждебных клиентов
Доля принятых задач от враждебных клиентов: пунктир — их доля на рынке.
Политика отбора клиентов
Политика отбора клиентов, зафиксированная в заметках агентов для каждого из 3 начальных точек.

Что это меняет в разработке агентов

Ycbench показывает, что «долгосрочная связность» — это конкретный конвейер: заметить сигнал → записать → достать позже → последовательно выполнить. И если в обычных тестах модель можно «протащить» за счёт разового рассуждения, то здесь победа больше похожа на управленческую устойчивость.

Бенчмарк при этом сделан так, чтобы быть полезным: он воспроизводимый, настраиваемый и открытый. А ещё он помогает честно сравнивать подходы к памяти и к исполнению (не просто план, а контроль выполнения в сотнях шагов).

В разборе ошибок авторы показывают разные режимы отказа: одна модель рассуждает верно, но перегружает сотрудников; другая понимает, что близка к банкротству, но почти не действует; третья действует много, но по механическому циклу, не обучаясь на провалах.

Эффективность затрат
Эффективность затрат измеряется как выручка на каждый доллар, потраченный на API.

Вывод: ИИ может помочь построить стартап, но не запустить его самостоятельно: на длинной дистанции его подводят память, непоследовательность и неумение следовать общей стратегии.

ИИ-обзоры статей

Каждый день читаем свежие статьи по ИИ и пересказываем главное человеческим языком — без хайпа и воды. Если хотите понимать, куда движутся ИИ-агенты раньше остальных, — подписывайтесь.

Новые обзоры — каждый день

В Telegram