i
Новости
Новости · 2026-09-26

SoL-Pi от Nvidia почти вдвое сокращает расход токенов у кодинг-агентов, оптимизируя управляющий слой

@neuronium_ai @neuronium_ai

Nvidia представила SoL-Pi — систему, которая автоматически оптимизирует управляющий слой агентов для программирования, или пайплайн управления между моделью и рабочей средой. В тестах расход токенов снизился на 44,7–49%, а производительность в основном сохранилась. На бенчмарке EdgeBench самый экономный вариант использовал на 49% меньше токенов и набрал 93,7% от результата исходного пайплайна Pi. Экономия составила до $13,50 в час по сравнению с Codex и Claude Code.

Обложка: SoL-Pi от Nvidia почти вдвое сокращает расход токенов у кодинг-агентов, оптимизируя управляющий слой

Чем дольше ИИ-агенты работают без контроля, тем дороже обходятся: разовые предсказания превращаются в длинные цепочки рассуждений, вызовов инструментов и циклов обратной связи, а расход токенов растёт.

Исследователи Nvidia решили сократить эти расходы не на уровне модели, а в управляющем слое — пайплайне, который связывает модель с рабочей средой. Такой подход используют, например, Codex, Claude Code и OpenClaw.

Пайплайн определяет, как агент получает сведения о состоянии среды, выполняет действия и обрабатывает обратную связь. Большинство прежних методов экономии снижали цену токена: ускоряли механизмы внимания и инфраструктуру обслуживания моделей, сжимали модели с помощью квантования или заменяли их более дешёвыми.

SoL-Pi проверила 152 варианта управления

Оптимизировать пайплайн на практике сложно: использование инструментов, управление контекстом, проверка результатов и логика остановки тесно связаны. Изменение, которое экономит токены в одном месте, может вызвать ошибки в другом или лишь перенести расходы на следующий этап. Обычно люди изучают длинные журналы работы и превращают повторяющиеся сбои в изменения кода.

Система SoL-Pi автоматизирует эту работу. Исследовательский агент наблюдает за журналами действий другого агента, предлагает изменения и проверяет их в подготовленных средах. Затем кандидатов отбирают по результатам проверок производительности и эффективности. По словам авторов, подход опирается на рекурсивное самоулучшение.

На 535 исполняемых средах система проверила 152 направления оптимизации. В работу вошли 495 задач, полученных из пар GitHub «проблема — запрос на изменение», и 40 синтетических тестов. Всего процесс включал более 3000 запусков и свыше 60 000 взаимодействий агентов со средами. Исследователи отмечают, что масштаб показывает широту поиска, но больше проверок не обязательно означает лучший результат. Ранее было показано, что автоматически оптимизированные пайплайны склонны подстраиваться под обучающие задачи и мало помогают на незнакомых.

Чтобы снизить этот риск, SoL-Pi полностью отделяет обратную связь для поиска от оценки. В качестве бенчмарка исследователи использовали EdgeBench и не допускали его данные к поиску. Из 51 открытой задачи 11 оставили для однократной проверки готовых вариантов. Остальные 40 предназначались только для итоговой оценки, и их результаты не возвращались в процесс поиска.

Исследовательский ИИ анализирует трассировки агентов, предлагает изменения в harness и сохраняет только те, которые поддерживают производительность и снижают затраты. SoL-Pi экономит 50 процентов по сравнению с Codex и 54,3 процента по сравнению с Claude Code на EdgeBench

Исследовательский ИИ анализирует трассировки агентов, предлагает изменения в harness и сохраняет только те, которые поддерживают производительность и снижают затраты. SoL-Pi экономит 50 процентов по сравнению с Codex и 54,3 процента по сравнению с Claude Code на EdgeBench

Источник: the-decoder.com

Четыре механизма экономии

По результатам поиска система предложила четыре механизма.

Action Fusion объединяет два последовательных действия, например редактирование кода и запуск теста. Это позволяет избежать целого вызова языковой модели.
Online Context Compact запускается после каждого этапа планирования и сокращает накопленный контекст, если важная информация при этом не теряется.
ObservationPack сохраняет длинные выводы инструментов, а на следующих этапах подставляет краткое содержание вместо полного текста.
Evidence-Preserving Reducer передаёт большие журналы ошибок и тестов более дешёвой модели, которая оставляет только ключевые выводы. Автоматическая проверка помогает обнаружить важные сведения, случайно пропущенные при сокращении.
Оценка на отложенной выборке проводится только после фиксации harness и не влияет на процесс поиска

Оценка на отложенной выборке проводится только после фиксации harness и не влияет на процесс поиска

Источник: the-decoder.com

На 51 открытой задаче EdgeBench SoL-Pi показала примерно такой же результат, как исходный пайплайн Pi. Экономия токенов зависела от конфигурации. Самый экономный вариант объединял все четыре механизма: расходовал на 49% меньше токенов и набрал 93,7% результата Pi. Если важнее производительность, можно выбрать лучший одиночный механизм: такой вариант превзошёл Pi на 5,3%, одновременно сократив расход токенов. В двух вариантах он снизился на 44,7–49%.

44,7–49%экономия токенов
93,7%результат самого экономного варианта
5,3%преимущество лучшего одиночного механизма над Pi

В пересчёте на деньги авторы оценивают экономию в $8,75–13,50 в час по сравнению со встроенными пайплайнами Codex и Claude Code и в $4,36–5,71 в час по сравнению с Pi. Расчёты основаны на текущих ценах API.

Nvidia ищет механизмы в 535 исполняемых средах и оставляет EdgeBench для итоговой оценки

Nvidia ищет механизмы в 535 исполняемых средах и оставляет EdgeBench для итоговой оценки

Источник: the-decoder.com

Исследователи создали систему только с GPT-5.6 Sol, а затем без изменений применили её к Opus 5. Там SoL-Pi сохранила 94,3% производительности Pi при сопоставимой экономии. Однако механизмы срабатывали реже и действовали осторожнее. Исследователи связывают это с тем, что пайплайн оптимизировали только на траекториях GPT-5.6 Sol.

Вариант SoL-Pi, оптимизированный для эффективности, вдвое сокращает расход токенов по сравнению с Pi и обходится в $894 вместо $1,339 при немного более низкой оценке

Вариант SoL-Pi, оптимизированный для эффективности, вдвое сокращает расход токенов по сравнению с Pi и обходится в $894 вместо $1,339 при немного более низкой оценке

Источник: the-decoder.com

Результаты на других бенчмарках неоднозначны

На других тестах результаты были менее однозначными. Из 63 задач для процессоров на Terminal-Bench 4 SoL-Pi решила 15, тогда как Codex и Pi справились с 18 каждая. При этом общие расходы оказались примерно на четверть ниже, чем у Pi.

В задачах Lean 4 с формальной проверкой из Международной математической олимпиады 2026 года (IMO 2026) система решила три из шести задач и показала наименьшую стоимость в расчёте на одну решённую задачу. В эксперименте по оптимизации ядра группа из 20 агентов SoL-Pi снизила расходы на 26,8% по сравнению с сопоставимой группой Pi.

В тесте оптимизации ядер рой с работниками SoL-Pi достигает наилучшего результата и обходится примерно на четверть дешевле, чем рой с работниками Pi

В тесте оптимизации ядер рой с работниками SoL-Pi достигает наилучшего результата и обходится примерно на четверть дешевле, чем рой с работниками Pi

Источник: the-decoder.com

Экономия даётся с оговорками: более короткий контекст может снизить повторное использование кэша промтов. Но в одном тестовом запуске общие расходы всё же уменьшились с $1339 до $894. В будущем авторы предлагают предварительно обучать пайплайн на множестве задач — подобно тому, как предварительно обучают модели, — а для поиска его следующей версии использовать уже экономный пайплайн. Рекурсивное повышение эффективности они называют перспективой, а не результатом нынешнего исследования.

Насколько сильно пайплайн влияет на расходы агента, показал августовский тест компании Composio, разрабатывающей инструменты для ИИ. Компания запускала Deepseek V4 Flash на четырёх фреймворках для агентов, включая Claude Code и основанный на Pi Oh My Pi. Стоимость решения одной задачи различалась почти втрое, хотя во всех случаях работала одна и та же модель.

Давление на стоимость и оптимизацию растёт вместе с расходом токенов агентами. По данным аналитика OpenRouter Питера Уокера, с февраля 2026 года расход токенов в агентных системах увеличился в 14 раз. Почти 70% этого объёма приходится на кэшированные промты.

Сжатие контекста, которое использует SoL-Pi, может иметь побочные эффекты. Одно исследование показало, что после сжатия в среднем сохраняется только 17% пользовательских инструкций. Расходы увеличивает и параллельная работа агентов. Разработчик Codex Эрик Провеншер недавно предупредил: больше двух подчинённых агентов почти всегда означает лишние токены без повышения качества, поскольку большую часть времени они проверяют работу друг друга.

GPT-6 Astra от OpenAI теперь точно укажет, где вы ошиблись при сборке мебели IKEA Провоста Дартмута поймали на использовании ИИ для статей в газетах и научных журналах Одного письма на общедоступный адрес недостаточно, чтобы защитить австралийцев от потенциальной катастрофы из-за ИИ OpenAI приостанавливает работу с самыми мощными моделями после того, как агенты обошли ограничения и утекли данные OpenAI: агенты слили 53 изображения пользователей ChatGPT — новый случай самовольных действий ИИ Писателя обвинили в использовании ИИ при написании книги и сняли с длинного списка французской премии Перед IPO в США британская ИИ-облачная компания Nscale привлекла $3,36 млрд через конвертируемые облигации Взлом OpenAI правительственной системы Австралии обнажил тревогу в центре глобальной дилеммы искусственного интеллекта На Meta Connect умные очки компании были повсюду Борьба властей Нового Южного Уэльса с «подделанными ИИ» объявлениями об аренде упёрлась в мурал на стене Astra и Opus прошли ещё одно испытание Тьюринга Crusoe отказалась от плана на $1,25 млрд по использованию турбин Boom в ИИ-дата-центрах Незащищённые агенты OpenAI выложили в интернет 53 пользовательских изображения без ведома компании Трамп и председатель КНР Си завершили саммит, не договорившись о серьёзных мерах по ИИ Сооснователи Anthropic добиваются права контролировать голосование перед IPO Воры угнали трейлеры с логотипом Nvidia — а нашли 20 тонн песка Meta открыла ранний доступ к новым функциям Muse CLM-8B кэширует действия агента, чтобы быстрее выбирать Судьи предупреждают: сгенерированная ИИ юридическая халтура мешает судам работать OpenAI атакует систему здравоохранения Австралии и усугубляет собственную халатность. Хватит ждать и смотреть, что будет дальше

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram