i
ДАТАИСТ
Обзор · 2026-07-12

Как сократить расходы на ИИ без потери качества

Обложка: Как сократить расходы на ИИ без потери качества

Когда дело не в модели, а в «обвязке»

В ИИ-индустрии есть одно наблюдение: если агент не справляется, ему добавляют токенов. Делают подсказку длиннее. Добавляют больше шагов. Больше инструментов. Больше повторного воспроизведения истории. Больше «подумать». На бумаге это часто выглядит как прогресс. В счёте за инфраструктуру — как катастрофа.

Новая работа с говорящим названием The Harness Effect бьёт ровно по этой болевой точке. Её главная мысль проста: стоимость и скорость ИИ-агента определяет не только модель, но и слой оркестрации вокруг неё. То, как система собирает контекст, когда вызывает инструменты, как хранит историю, что повторяет на каждом ходе, а что нет, может менять экономику сильнее, чем выбор между самими моделями.

И это не теория. Авторы взяли шесть моделей, 22 корпоративные задачи и провели почти лабораторный эксперимент: оставили модели и задачи прежними, а поменяли только «обвязку» агента. Результат получился неприятно наглядным для всей индустрии: минус 38% токенов, минус 41% стоимости и минус 44% времени — без заметной потери качества.

Для рынка это очень важно. Мы привыкли обсуждать, какая LLM умнее. Эта статья напоминает: иногда правильный вопрос — насколько умно вы вообще запускаете эту LLM.

Что авторы называют «разгоном токенов»

Авторы вводят новый термин: разгон токенов. Это ситуация, когда полезность системы растёт медленнее, чем число токенов на задачу. Грубо говоря, вы покупаете чуть-чуть качества ценой сильно большего расхода.

У ИИ-агентов это происходит естественно. Одна пользовательская просьба — не один вызов модели, а целая цепочка. Системный промт. Схемы инструментов. Документы из поиска. Промежуточные ответы. Результаты работы инструментов. И если система устроена просто, всё это целиком снова отправляется модели на каждом следующем шаге.

Отсюда и главная проблема: стоимость растёт не линейно, а иногда почти квадратично. Чем больше шагов делает агент, тем больше он тащит за собой «хвост» прошлых сообщений.

Почему у ИИ-агентов так быстро раздувается счёт за токены: наивное повторное воспроизведение истории растёт почти квадратично, а аккуратная оркестрация — ближе к линейному сценарию.

Это, пожалуй, самый полезный концептуальный вклад статьи. Авторы показывают: токены «съедает» не только сама модель и не только её склонность к длинным ответам. Огромную часть счёта создаёт именно оркестрация — код вокруг модели. Он решает, что попадёт в контекст, что будет закэшировано, что нужно сжать, а что можно вынести за пределы текущего окна.

Последние два года рынок в основном искал оптимизацию внутри одного вызова модели: ужать подсказку, ускорить инференс, ограничить длину рассуждения. Здесь же фокус на другом уровне — между вызовами. На том, как из многих вызовов собирается работающий агент.

Как был устроен эксперимент

Авторы не сравнивали «нашу хорошую систему» с «чужой плохой системой» в общем виде. Они сделали контролируемую замену оркестрации.

Что именно сравнивали:

один и тот же набор из 22 задач;
одни и те же шесть моделей: Claude Sonnet 4.6, Gemini 3.1, Gemini Flash 3.5, Qwen 3.6, GLM 5.1 и Palmyra X6;
одни и те же правила оценки;
одна и та же таблица цен;
менялся только слой оркестрации.

С одной стороны был обычный производственный цикл агента: большой системный промт, повтор всей истории, не очень аккуратная работа с переполнением контекста, ожидание через опрос и другие привычные для индустрии компромиссы. С другой — Writer Agent Harness, то есть более строгая и экономная система исполнения.

Задачи тоже не игрушечные. Это корпоративный профиль: поиск и привязка к документам, создание контента, выполнение рабочих сценариев, работа с внешними инструментами, презентации, голос, изображения. То есть то, ради чего компании вообще и покупают ИИ-агентов.

Важно и то, как измеряли качество. Авторы честно пишут: при 22 задачах делать громкие выводы о небольшом росте качества нельзя. Поэтому итог 0,78 против 0,81 они называют не улучшением, а паритетом. Это хороший признак. В статье нет попытки выдать статистически шаткий плюс за прорыв.

Что именно изменили в оркестрации

Самая интересная часть работы — не цифры, а инженерные механизмы, которые эти цифры дали.

Первый ключевой приём — двухзонная подсказка. Всё, что может быть стабильным между ходами, складывается в устойчивый префикс: каталог инструментов, системная инструкция, долговечная часть переписки. А всё, что меняется на каждом шаге, уходит в изменчивый хвост.

Зачем это нужно? Ради кэширования. Если начало подсказки байт в байт одинаково, поставщики моделей часто отдают его из кэша по сильно сниженной цене. Авторы показывают, что в одном из вызовов 99,9% токенов подсказки пришли из кэша.

Двухзонная подсказка: стабильный префикс для кэширования и изменчивый хвост для всего, что меняется от шага к шагу.

Нельзя просто надеяться, что кэш «как-нибудь сработает». Нужно проектировать структуру подсказки так, чтобы почти всё дорогое и длинное оставалось неизменным.

Второй механизм — структурированное сжатие истории. Вместо тупого обрезания середины контекста система собирает контрольные сводки: что уже решено, какие ограничения есть, что пробовали и почему отказались, какие файлы затронуты, что делать дальше. Причём не каждый раз с нуля, а нарастающим итогом.

Третий — вынос тяжёлого контекста наружу. Большие результаты инструментов не обязательно держать внутри окна модели. Их можно сохранять в файлы, передавать в виде кратких выдержек, а при необходимости подгружать по ссылке. Аналогично работают и субагенты: дочерний агент может провести широкий поиск внутри своего локального контекста, а родителю вернуть только краткий итог.

Четвёртый — ожидание без токенов. Если агент ждёт одобрения человека или завершения долгой фоновой операции, он не должен бессмысленно опрашивать систему и жечь токены. Он должен «уснуть» и проснуться по событию.

Пятый — управление расходами при сбоях. Повторы, зацикливания, повторные неудачные вызовы инструментов — это скрытая чёрная дыра бюджета. Хорошая оркестрация должна различать типы ошибок и не позволять агенту трижды подряд покупать один и тот же провал.

Если всё это свести в одну фразу, получается очень практичный принцип: максимум токенов должен либо приходить из кэша, либо нести новую полезную информацию, либо тратиться только на действительно нужные шаги.

Главные результаты: экономия почти везде и для всех

Теперь к цифрам. В смешанном результате по всем шести моделям и 22 задачам замена оркестрации дала:

стоимость на задачу: минус 41% — с 0,21 до 0,12 доллара;
время выполнения: минус 44% — с 48 до 27 секунд;
токены на задачу: минус 38% — с 14,2 до 8,8 тысячи;
качество по завершению задач — примерно на том же уровне.

Главный итог статьи: при той же модели новая оркестрация заметно снижает стоимость, задержку и расход токенов.

Это уже само по себе сильный результат. Но ещё интереснее другое: эффект оказался почти независим от модели.

У всех шести моделей стоимость упала. Диапазон — от 33% до 61%. То есть выиграл не один удачный поставщик и не один конкретный класс моделей. Выиграла сама архитектура исполнения.

Снижение стоимости и задержки наблюдается у всех моделей: эффект идёт от слоя оркестрации, а не от конкретной LLM.

Это, возможно, самый неприятный вывод для команд, которые бесконечно спорят о выборе модели, но мало думают об инфраструктуре агента. Авторы прямо пишут: на их наборе задач слой оркестрации влиял на стоимость сильнее, чем переход от самой дорогой модели к самой дешёвой.

Очень отрезвляющая мысль. Можно неделями выбирать между поставщиками, экономя десятки процентов на цене токена, и при этом терять больше из-за небрежно устроенного цикла работы агента.

А что с качеством?

Здесь статья аккуратнее, и это правильно. В среднем качество не просело. Более того, в 48 ячейках «модель × способность» улучшений было больше, чем ухудшений: 30 улучшений, 11 без изменений, 7 ухудшений.

Но эти ухудшения распределены не случайно. Они почти все пришлись на более слабые модели и на те сценарии, где оркестрация особенно нагружает модель: сложные рабочие сценарии, работа с внешними инструментами, презентации.

Из этого авторы выводят интересную идею: сильные модели лучше извлекают пользу из хорошей оркестрации. Они называют это эффектом рычага оркестрации. То есть одна и та же инфраструктурная надстройка для мощной модели может дать и экономию, и рост качества, а для слабой — только экономию, а иногда даже дополнительную когнитивную нагрузку.

Это важный нюанс. Статья не говорит, что хорошая оркестрация автоматически делает любую модель лучше. Она говорит другое: хорошая оркестрация почти всегда делает систему дешевле, но качество сверху зависит от того, насколько модель вообще способна использовать эту структуру.

Для практики это очень полезно. Можно отдельно считать две вещи:

безусловный выигрыш в экономике;
условный выигрыш в качестве, зависящий от класса модели.

Почему это важно для рынка ИИ уже сейчас

У этой работы есть понятная бизнес-мораль. Пока индустрия радуется падению цен за токен, команды начинают тратить токенов ещё больше. Это классический эффект «стало дешевле — стали потреблять больше».

Поэтому снижение цены за токен само по себе не спасает. Если агент на каждую новую способность отвечает просто ростом длины контекста и числа шагов, общий счёт всё равно уедет вверх.

Отсюда главный практический вывод: метрикой зрелости ИИ-агента должно быть не только качество, но и «завершений задач на миллион токенов». Или, ещё проще, сколько полезной работы вы получаете на единицу расхода.

Авторы показывают хороший пример: число завершений на миллион токенов выросло с 54,9 до 92. Это уже не косметическая оптимизация, а смена экономического режима.

Для компаний с большим потоком задач выгода быстро становится материальной. Авторы оценивают, что на миллионе агентных задач в месяц разница между двумя подходами — порядка 90 тысяч долларов в месяц. Даже если относиться к этим оценкам осторожно, масштаб понятен: оркестрация перестаёт быть «внутренней инженерной деталью» и становится строкой в отчёте о прибылях и убытках.

Вывод

Мы привыкли думать об ИИ-агенте как о модели плюс инструменты. Авторы убедительно показывают: между моделью и продуктом есть ещё один критически важный слой — оркестрация. Именно он во многом решает, будет ли ваш агент разумно расходовать токены или бездумно их жечь.

Если вы хотите сделать ИИ-агента дешевле и быстрее, не спешите менять модель — сначала посмотрите, как устроен сам цикл её работы.

Конечно, у работы есть ограничения. Набор задач не огромный. Авторы сами представляют компанию, чью систему тестируют. Сравнение с внешними каркасами здесь в основном архитектурное, а не экспериментальное. Но даже с этими оговорками результат выглядит серьёзно.

И, возможно, это один из самых полезных текстов про ИИ-агентов за последнее время. Потому что он напоминает простую вещь: прорыв в ИИ — это не только новая LLM. Иногда это ещё и умение не платить дважды за один и тот же контекст.

ИИ-обзоры простыми словами

Каждый день читаем свежие статьи по ИИ и пересказываем главное человеческим языком — без хайпа и воды. Если хотите понимать, куда движутся ИИ-агенты раньше остальных, — подписывайтесь.

Новые обзоры — каждый день

В Telegram