i
ДАТАИСТ
Обзор · 2026-08-26

Как ИИ-агент восстанавливается после ошибок и меняет план

Обложка: Как ИИ-агент восстанавливается после ошибок и меняет план

Когда LLM уже мало

Если вы просите модель написать письмо, ответить на вопрос или даже решить задачу по программированию, всё выглядит неплохо. Но как только задача длится час, требует читать файлы, запускать код, искать источники, переживать сбои и в конце отдавать проверяемый результат, у большинства систем начинаются провалы.

Именно про это статья Apodex 1.1: масштабирование агентного интеллекта для сложной работы. Авторы предлагают смотреть на ИИ как на систему, которая должна доводить работу до конца. Система должна двигаться к цели шаг за шагом, сохранять состояние, не терять прогресс и сдавать результат, который можно проверить.

Сегодня гонка моделей всё чаще упирается в вопрос: можно ли доверить системе длинную задачу из реальной работы.

Что такое «рабочая способность»

Новый ключевой термин статьи — рабочая способность. Под ним авторы понимают не знания и не качество текста, а умение долго и проверяемо двигаться к реальной цели.

Проще говоря, хорошая система здесь должна уметь:

🟠 понять задачу и что именно считается готовым результатом

🟠 работать с файлами, поиском и исполняемым кодом

🟠 держать состояние между шагами

🟠 исправлять ошибки без потери уже сделанного

🟠 сдавать артефакты, которые можно проверить и использовать дальше

Именно здесь проходит граница между «умным чат-ботом» и рабочим ИИ-агентом. В статье постоянно повторяется одна мысль: единица измерения — завершённая работа, а не ответ.

Две оси масштабирования

Авторы строят Apodex 1.1 вокруг двух идей.

Первая — масштабирование среды. Модель учат не на абстрактных промтах, а в средах, где есть файлы, поисковые инструменты, репозитории, тесты, ограничения по времени и условия приёмки.

Вторая — масштабирование координации. Система учится разбивать длинную задачу на части, отдавать подзадачи другим агентам, собирать промежуточные результаты, менять план и закрывать лишние ветки.

Если упростить, логика такая:

🟣 одна ось отвечает за то, в каком мире агент учится работать

🟣 вторая — за то, как он организует работу во времени и между агентами

Это уже не очередная история про «дадим модели больше инструментов». Здесь инструменты, состояние, проверка и координация становятся частью общей обучаемой системы.

Что внутри системы

В центре — сама модель. Вокруг неё — общая обвязка исполнения и слой под названием AgentOS. Он хранит рабочее состояние: файлы, найденные источники, результаты запуска кода, артефакты, зависимости между ними и состояние задач.

Статья много внимания уделяет тому, что длинную работу нельзя держать только в переписке. Контекст можно сжать, куски истории можно потерять, а вот внешний мир задачи остаётся: файлы меняются, код создаёт новые данные, какие-то результаты уже проверены, какие-то ещё нет. Поэтому авторы выносят это в отдельное постоянное состояние.

Отсюда несколько решений:

🟠 отдельные пространства для входных файлов, рабочей зоны и финальных результатов

🟠 явная доска задач для мультиагентной координации

🟠 журнал происхождения артефактов: откуда что взялось и чем подтверждается

🟠 отдельный контроль публикации финальных файлов, чтобы агент не «сдал» пустышку или старую версию

Для тех, кто строит ИИ-агентов, это одна из самых прикладных частей статьи. Она напоминает: длинная задача — это проблема состояния и исполнения, а не только рассуждения.

Как работает мультиагентность

Apodex 1.1 использует режим Agent Team. Есть ведущий агент. Он смотрит на задачу целиком, раскладывает её на подзадачи и создаёт специализированных подагентов по необходимости.

Интересно, что авторы учат систему делать несколько конкретных вещей:

🟣 явно фиксировать план на доске задач

🟣 принимать вмешательство пользователя по ходу работы

🟣 проверять утверждения через отдельные узкие проверки

🟣 перераспределять вычисления только туда, где есть спорные или важные места

Особенно любопытен режим асимметричной проверки. Вместо того чтобы просить второго агента «реши всё заново», система отдаёт ему узкий вопрос: проверь вот это число, вот этот факт, вот этот вывод, вот это соответствие формату. Так меньше риск, что проверяющий просто повторит ошибки основного решения.

Во многих агентных системах проверка есть только по названию: модель сама себя перечитывает и соглашается с собой. Здесь авторы пытаются сделать проверку более независимой и прикладной.

Как систему дообучали

Обучение состоит из двух больших частей.

Сначала идёт дообучение с учителем на смешанном наборе траекторий: рассуждение, работа с инструментами, поиск, файлы, код, координация, восстановление после ошибок, сдача результата.

Потом — обучение с подкреплением на длинных агентных задачах. Причём авторы отдельно решают проблему размытых сигналов награды. В длинной задаче провал в конце не говорит, какой именно шаг всё испортил.

Для этого они используют подход, похожий на локальную правку траектории: находят поворотные точки, где агент свернул не туда, сохраняют полезный префикс и дообучают продолжение с коротким корректирующим промтом. На инференсе этого промта уже нет.

Это похоже на практичную идею: не наказывать всю длинную цепочку целиком, а учить агент лучше действовать в местах, где реально принимаются важные решения.

Что показали результаты

Главный тезис статьи: Apodex 1.1 попадает в ведущую группу на ряде сложных бенчмарков, хотя сама модель меньше многих передовых конкурентов.

Сравнение идёт в двух режимах:

🟠 ReAct — почти голая модель с минимальной обвязкой

🟠 Agent Team — та же модель, но с мультиагентной координацией и дополнительной организованной вычислительной работой

Это позволяет понять, где вклад самой модели, а где вклад координации.

По профессиональным и прикладным задачам цифры такие:

🟣 на APEX-Agents: 34.4 в ReAct и 38.5 в Agent Team

🟣 на GDPVal: 69.5 в ReAct и 78.8 в Agent Team

🟣 на FrontierFinance: 48.7 в ReAct и 54.3 в Agent Team

🟣 на FrontierScience-Research: 55.0 в ReAct и 63.3 в Agent Team

Коротко по результатам:

🟠 прирост от Agent Team над ReAct стабилен на разных классах задач

🟠 особенно заметен выигрыш в финансах, исследованиях и профессиональных пайплайнах

🟠 улучшение есть и у компактной версии на 35B параметров

Картина понятная: координация почти везде даёт прирост, но и режим ReAct сам по себе уже заметно сильнее предыдущей версии Apodex 1.0. Это значит, что авторы улучшали базовую рабочую политику, а не только внешнюю обвязку.

Зачем здесь важна компактная версия

Отдельный акцент статьи — Apodex 1.1 Mini на 35B параметров. Для рынка это едва ли не интереснее, чем рекорды большой модели.

Mini показывает:

🟣 40.0 на FrontierFinance в ReAct и 50.2 в Agent Team

🟣 45.0 на FrontierScience-Research в ReAct и 51.7 в Agent Team

🟣 24.2 на APEX-Agents в ReAct и 27.7 в Agent Team

Смысл в том, что авторы пытаются доказать: рабочую способность можно получить не только на гигантской закрытой модели. Если это воспроизводится, то локально разворачиваемые системы для компаний и лабораторий становятся намного реалистичнее.

Как они проверяют не только итог, но и процесс

Один из самых полезных фрагментов статьи — фреймворк HDS6. Он нужен, чтобы оценивать не просто финальный балл, а как именно агент шёл к результату.

Там шесть групп способностей:

🟠 согласованность состояния на длинной траектории

🟠 аккуратность работы с доказательствами

🟠 управление гипотезами

🟠 рассуждение о границах и сбоях

🟠 работа с инструментами и состоянием исполнения

🟠 исправление самой себя после проверки

Так устроен HDS6: шесть групп способностей, 24 пункта рубрики и отдельный фильтр на нарушения целостности процесса.

Есть и жёсткий фильтр: если агент выдумал вызов инструмента или сослался на действие, которого не было, вся траектория обнуляется. Это правило для эпохи, когда многие системы убедительно рассказывают о несуществующей работе.

По HDS6 у Apodex 1.1 больше всего выросли начальная декомпозиция задачи и финальная проверка. То есть система стала лучше и в планировании, и в том, чтобы не выпускать сырой результат.

Самое интересное — кейсы

В приложении к статье есть длинные кейсы. Именно они лучше всего показывают, о чём вообще этот проект.

Один кейс — подготовка пакета файлов для молекулярной симуляции. Там агент должен собрать 18 связанных файлов, починить несовместимости форматов, добиться, чтобы симулятор принял входы, и в итоге сдать весь комплект.

Другой — анализ микроскопических изображений. Два агента меряют одни и те же снимки по разным правилам и приходят к противоположным выводам. Третий агент выступает арбитром и выбирает определение, которое лучше соответствует задаче и устойчиво к смене порогов.

Третий кейс — WGCNA-анализ на данных РНК-секвенирования у свиней: 20 обязательных файлов плюс несколько вспомогательных.

Именно здесь становится видно, почему авторы так много говорят о доставке артефактов. Реальная длинная задача редко заканчивается фразой в чате. Обычно вы ждёте таблицы, графики, код, архив, журнал вычислений и воспроизводимый результат.

Где границы

Несмотря на хорошие цифры, статья честно показывает и ограничения.

На внутреннем бенчмарке FrontierResearchBench, где нужно полностью выполнить научный рабочий пайплайн и сдать все артефакты, результаты у всех низкие. У Apodex 1.1 с Agent Team — 12.4% полных проходов. У лучших внешних систем в этой таблице — 20.6%.

Это важно. Даже лучшие агентные системы всё ещё часто не доводят длинную научную задачу до конца без потерь. Они умеют многое по отдельности, но полный воспроизводимый исследовательский цикл пока остаётся трудной целью.

Почему это важно

Статья фиксирует простую вещь: следующая большая конкуренция в ИИ идёт за выполнение работы, а не за качество ответа.

Если вы делаете ИИ-агентов для аналитики, науки, корпоративных документов, финансов или задач по программированию, здесь есть несколько полезных идей:

🟣 длинную задачу надо проектировать вокруг состояния, а не вокруг чата

🟣 среда обучения так же важна, как размер модели

🟣 координация между агентами должна быть обучаемым поведением, а не набором жёстких скриптов

🟣 проверка должна быть узкой, независимой и привязанной к артефактам

🟣 финальный результат должен быть формально проверяемым

Вывод

Apodex 1.1 двигает разговор об ИИ-агентах в более прикладную сторону. Вместо вопроса «умеет ли модель рассуждать» авторы спрашивают: умеет ли система неделями, файлами, кодом и проверками двигаться к цели и сдавать результат.

Ответ пока промежуточный. На многих бенчмарках система уже выглядит как участник ведущей группы. Мультиагентная координация даёт заметный прирост. Компактная версия на 35B показывает, что рабочую способность можно переносить и на меньший масштаб. Но на по-настоящему длинных научных пайплайнах провалов всё ещё много.

Если вы хотите надёжных ИИ-агентов для реальной работы, вам нужно учить и мерить не ответы, а завершённые траектории работы. Именно в эту сторону сейчас и смещается поле.

ИИ-обзоры простыми словами

Каждый день читаем свежие статьи об ИИ и пересказываем главное естественным языком — без хайпа и воды. Если хотите понимать, куда движутся ИИ-агенты раньше остальных, — подписывайтесь.

Новые обзоры — каждый день

В Telegram