Ваша LLM умнее, чем кажется —
вы просто используете ее неправильно
Когда важен не только мозг, но и «обвязка» вокруг него. Как Meta-Harness автоматизирует создание harness для LLM.
Когда важен не только мозг, но и «обвязка» вокруг него
В разговорах об ИИ мы почти всегда обсуждаем сами LLM: размер, качество данных, архитектуру и скорость. Но в реальных приложениях на итоговую полезность влияет ещё один слой — harness. Это кодовая «обвязка» вокруг модели, которая решает, что запоминать из прошлых шагов, как доставать нужные куски информации, что именно показывать модели в каждый момент и как организовать многошаговый процесс.
Авторы работы Meta-Harness: End-to-End Optimization of Model Harnesses начинают с наблюдения, которое многим инженерам знакомо по опыту: на одном и том же бенчмарке разница между удачным и неудачным harness может доходить до нескольких раз, даже при фиксированной модели. Проблема в том, что harness обычно «допиливают» руками. Это медленно, дорого и плохо масштабируется: нужно разбирать ошибки, придумывать эвристики, проверять гипотезы — и всё это по кругу.
Вроде бы напрашивается использование методов оптимизации промтов. Но здесь и возникает ключевой конфликт: большинство таких методов работают с очень «сжатой» обратной связью. Где-то оптимизатор видит только скалярную оценку, где-то — краткое резюме, где-то — короткий след того, что произошло. Для harness этого мало: решения о памяти и извлечении контекста проявляют эффект не сразу, а через много шагов. Ошибка в раннем выборе контекста может «аукнуться» ближе к концу траектории, и без подробных трасс трудно понять, что именно пошло не так.
Идея Meta-Harness: искать не текст, а исполняемый код — и помнить всё
Meta-Harness — это система, которая перебирает и улучшает код harness, а не отдельные формулировки. Внутри — агент для программирования, который умеет читать проект, редактировать файлы и предлагать новый вариант harness. Важная деталь: агенту дают доступ не к кратким итогам, а ко всей истории экспериментов через файловую систему. Для каждого кандидата сохраняются исходники, метрики и execution traces — буквально «как система жила»: какие промты собирались, какие инструменты вызывались, как обновлялось состояние, где пошли циклы или провалы.
Вместо того чтобы пытаться впихнуть весь опыт в контекстное окно, агент сам решает, что смотреть: использует привычные инструменты вроде grep и cat, сопоставляет разные кандидаты, находит повторяющиеся сбои и формулирует правки. На практике, как отмечают авторы, в одном из самых требовательных режимов агент за итерацию читает десятки файлов и регулярно опирается на множество прошлых попыток — то есть ведёт себя как инженер, который расследует причины и проверяет гипотезы.
Три полигона: классификация, математика с retrieval и агентное программирование
Авторы проверяют подход в трёх задачах, где harness действительно определяет поведение системы.
В онлайн-классификации текста LLM получает примеры по одному, пополняет память и затем классифицирует новые случаи. Здесь Meta-Harness находит стратегии, которые не просто точнее, но ещё и экономнее по контексту: лучшая версия превосходит сильный ручной baseline ACE на 7.7 пункта точности, используя примерно в четыре раза меньше контекстных токенов. Это особенно показательно: улучшение достигается не «переливанием» примеров в промт, а более умной политикой того, какие примеры доставать и как их раскладывать для модели.
Во втором сценарии — retrieval-augmented math reasoning — найденный harness улучшает точность на 200 задачах уровня IMO в среднем на 4.7 пункта сразу на пяти отложенных моделях. Meta-Harness находит более структурные решения: маршрутизацию по типам задач (например, геометрия или комбинаторика), разные правила отбора и ранжирования, и даже выбор того, когда агрессивно дедуплицировать, а когда оставить «сырые» соседние примеры.
Третий полигон — агентное программирование на TerminalBench-2. И здесь результат выглядит как инженерная находка: один из выигрышных ходов — сделать «снимок окружения» до начала основного цикла и добавить его в стартовый контекст.
Почему «богатая память» о прошлых прогонах оказалась решающей
Отдельно в работе любопытны абляции: если оставить агенту только числа (оценки) или даже оценки плюс краткие резюме, качество падает резко. А полный доступ к сырым трейсам даёт заметный прогресс. В сложных LLM-системах многое ломается на уровне процесса — неправильный retrieval или лишнее правило в промте, которое спустя 20 шагов приводит к циклу. Сводки часто «съедают» именно те детали, которые нужны для диагностики.
В итоге Meta-Harness выглядит как попытка автоматизировать harness engineering через реалистичный рабочий процесс: накопление артефактов, расследование причин, аккуратные правки кода и проверка на задачах. И, судя по результатам, этот подход действительно способен хорошо управлять контекстом.
ИИ-обзоры статей
Каждый день читаем свежие статьи по ИИ и пересказываем главное человеческим языком — без хайпа и воды. Если хотите понимать, куда движутся ИИ-агенты раньше остальных, — подписывайтесь.
Новые обзоры — каждый день
В Telegram