i
ДАТАИСТ
Новости · 2026-08-30

ИИ-агенты не чувствуют времени и не осознают этого

Исследование двух независимых исследователей в рамках программы MATS показало, что популярные агенты для программирования плохо оценивают длительность задач и не умеют надёжно определять, сколько уже работают. Anthropic Claude Code и OpenAI Codex протестировали на 200 задачах из ProgramBench и ещё 18 собственных бенчмарках. Обе системы обычно завышали необходимое время: Claude в среднем ошибался втрое, а Codex — в 6–10 раз. На коротких задачах прогнозы были особенно неточными. Агенты также переоценивали качество своей работы, включая проваленные задания, что затрудняет их применение в длительных задачах на несколько часов.

Обложка: ИИ-агенты не чувствуют времени и не осознают этого

Агенты для написания кода сильно ошибаются в оценке времени выполнения задач. Точки выше тёмной диагональной отметки обозначают завышенную оценку: в среднем Fable 5 выполнял задачи примерно в три раза дольше фактического времени, а GPT-5.6 Sol — примерно в семь раз дольше. Разрыв особенно велик для коротких задач

Источник: the-decoder.com

ИИ-агенты не чувствуют время и не замечают этого

Исследование двух независимых исследователей в рамках программы MATS показало, что популярные агенты для программирования плохо оценивают длительность задач и не умеют надёжно определять, сколько уже работают. Anthropic Claude Code и OpenAI Codex протестировали на 200 задачах из ProgramBench и ещё 18 собственных бенчмарках. Обе системы обычно завышали необходимое время: Claude в среднем ошибался втрое, а Codex — в 6–10 раз. На коротких задачах прогнозы были особенно неточными. Агенты также переоценивали качество своей работы, включая проваленные задания, что затрудняет их применение в длительных задачах на несколько часов.

Оценка времени

Перед каждой задачей агентам нужно было назвать предполагаемую длительность, а после выполнения — оценить, сколько времени прошло на самом деле.

В ProgramBench обе модели в большинстве случаев указывали примерно 90 минут независимо от сложности задания. В дополнительной серии тестов Claude ошибался в среднем втрое, а Codex — в 6–10 раз. Хуже всего системы оценивали короткие задачи: их длительность они заметно завышали. Более близкие к реальности прогнозы появлялись только для задач, рассчитанных на несколько часов.

Claude и Codex оценивают свою работу слишком высоко. В среднем обе системы оценивали себя примерно на 20 процентных пунктов выше результатов, которых они фактически достигли в тестах. Пунктирная линия обозначает точную самооценку

Источник: the-decoder.com

На результат влияет программная среда, в которой работает модель. Claude Code продолжает работу, пока не решит, что задача завершена, — медианное время составляет около 90 минут. Codex останавливается примерно через полчаса почти независимо от сложности задания.

По данным исследования, одна и та же языковая модель в Claude Code в среднем делает в 2,5 раза больше шагов, чем в Codex. Поэтому длительность работы определяется самой моделью и во многом окружающим программным обеспечением — так называемой оболочкой.

200задач ProgramBench
18собственных бенчмарков
90 минутмедианное время Claude Code
2,5 разабольше шагов в Claude Code

Агенты переоценивают свою работу

С оценкой качества собственных результатов у агентов ситуация похожая. Более старые модели Opus 4.8 и GPT-5.5 в среднем завышали оценку на 20 процентных пунктов и ставили себе высокие баллы даже после провала.

В одном из тестов обе системы решили, что справились примерно на 70%. Фактические результаты составили 7% и 14,5%.

Контроль длительных задач

Исследователи считают, что способность к самооценке важна для надёжной работы агента в задачах, которые длятся часами. Если системе дают инструкцию вроде «работай над этой задачей два часа», она должна понимать, сколько времени уже прошло. Агент, который постоянно ошибается в таких оценках, плохо поддаётся управлению.

Следующим этапом авторы хотят проверить, способны ли агенты придерживаться заданной продолжительности работы. Когда системам предоставляли инструмент, показывающий прошедшее время, они почти всегда правильно оценивали длительность.

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram