i
Новости
Новости · 2026-09-22

Как UK AISI и EvalEval делают результаты бенчмарков воспроизводимыми

@neuronium_ai @neuronium_ai

UK ИИ Security Institute (AISI) и EvalEval переводят в открытую инфраструктуру совместные наработки, начатые на воркшопе рядом с NeurIPS 2025. Через схему Every Eval Ever и платформу Evaluation Cards AISI публикует проверенные результаты, настройки и контекст оценивания для пяти бенчмарков, шести передовых моделей и двух кибероценок. Это позволит исследователям повторять эксперименты, сравнивать результаты при разных протоколах и лучше понимать, как настройки влияют на заявленную производительность моделей.

Обложка: Как UK AISI и EvalEval делают результаты бенчмарков воспроизводимыми

Зачем нужна воспроизводимость

По мере распространения ИИ оценки становятся одним из главных источников данных о возможностях моделей и систем. Но результаты публикуют в разных форматах, на разных площадках и часто без сведений, необходимых для повторения эксперимента. Сам повторный запуск может оказаться слишком дорогим.

EvalEval развивает эту экосистему с помощью общей схемы отчётности Every Eval Ever и открытой платформы Evaluation Cards. Она собирает результаты оценивания и сведения, необходимые для их интерпретации, в единую структуру.

Работа продолжает инициативы AISI:

OptStop делает оценивание эффективнее;
HiBayES повышает его статистическую строгость;
стандартизированные подходы применяются, в частности, к анализу расшифровок и выявлению способностей моделей.

AISI и EvalEval вместе выявляют пробелы в описании оценок и создают общую инфраструктуру, которая должна их закрыть.

Что публикует AISI

Прозрачность на уровне отдельных расшифровок нужна не только для воспроизводимости, но и для анализа и диагностики. На новом этапе сотрудничества AISI размещает в Evaluation Cards публично описанные методы оценивания и полученные результаты — там, где это уместно.

Выпуск содержит проверенные результаты, контекст и сведения о конфигурации для пяти бенчмарков из основного эксперимента статьи:

HealthBench
FrontierMath
Humanity's Last Exam
SWE-Bench Pro
Terminal-Bench 2.0
5бенчмарков
6передовых моделей
2кибероценки

Результаты относятся к шести передовым моделям:

Claude Opus 4
Claude Opus 4.5
Claude Opus 4.6
GPT-5
GPT-5.2
GPT-5.4

В выпуск также вошли результаты двух связанных кибернетических оценок — Cyber CTFs и The Last Ones. Для них использовался другой, частично пересекающийся набор моделей.

Данные сопровождают статью AISI How инференс Compute Shapes Frontier LLM Evaluation. В ней изучается, как производительность на бенчмарках зависит от вычислительных ресурсов на этапе инференса и от протокола оценивания.

На примере Humanity's Last Exam показано, что результат меняется в зависимости от протокола оценивания и объёма вычислений на этапе инференса. Для каждой кривой рассчитывалась совокупная доля решённых попыток в пределах заданного числа токенов, причём для каждой задачи учитывался самый ранний зафиксированный успех. Если после каждой попытки модель получала от оракула информацию о правильности ответа, с ростом числа использованных токенов она продолжала решать дополнительные задачи.

Когда результаты публикуют вместе с открытыми сведениями о настройках эксперимента, исследователи и разработчики могут детальнее изучать отдельные работы и сравнивать их с более широким набором данных. Если в других отчётах таких деталей нет, выпуски AISI дают проверенные ориентиры для интерпретации результатов. Например, они помогают понять, как выбор настроек мог повлиять на заявленную производительность.

По мере распространения EEE такие открытые сравнения могут поддержать более масштабные и надёжные исследования самих методов оценивания.

Результаты AISI для Terminal-Bench 2.0 также сопоставлены с другими опубликованными оценками тех же моделей, выполненными при разных настройках.

Организации заявляют, что рассчитывают на дальнейшую стандартизацию и совместную публикацию оценок вместе с AISI и другими организациями, изучающими ИИ.

Как участвовать

Разработчикам моделей предлагают публиковать проверенные результаты оценивания.
Разработчикам оценок — описывать бенчмарки и данные запусков с использованием схемы Every Eval Ever.
Исследователям оценивания, управления и политики — изучать Evaluation Cards по бенчмаркам или моделям либо анализировать состояние отчётности об оценках в целом.

Коалиция EvalEval

EvalEval Coalition — исследовательское сообщество, которое развивает научно обоснованные методы и инфраструктуру для экосистемы оценивания. Его цель — улучшать науку об оценках, решать проблему отсутствия согласованных подходов к описанию применимости и полезности оценок, а также расширять охват последствий, важных для научных исследований и анализа политики.

Ключевые проекты коалиции:

Every Eval Ever — общая схема и репозиторий результатов оценивания;
Evaluation Cards — система, объединяющая метаданные бенчмарков, данные запусков оценивания и метаданные моделей в интерпретируемые записи.

Вместе эти проекты помогают понять, почему внешне похожие результаты могли быть получены в существенно разных условиях.

UK ИИ Security Institute

UK ИИ Security Institute — исследовательская организация при британском Department for Science, Innovation and Technology. Её задача — дать правительствам научное понимание рисков, связанных с передовым ИИ.

AISI проводит исследования и создаёт инфраструктуру, чтобы изучать возможности и последствия применения передового ИИ, разрабатывать и проверять меры защиты, а также предоставлять данные для формирования политики.

AstroForge передаёт ИИ управление своим следующим космическим аппаратом Джордж Осборн из OpenAI: противники дата-центров тормозят развитие Британии Rabbit возвращается — теперь с приложением ИИ-агента OpenAI призывает к международным стандартам для ИИ, способного к самоулучшению Трамп в ООН: США теперь называют ИИ «сверхинтеллектом» во всех официальных документах IPO Nscale вновь проверит готовность Уолл-стрит к концентрированным ставкам на ИИ Техногиганты говорят: ИИ может найти лекарство от рака. Так где же оно? ИИ-модели на основе мозга крыс стали ближе к реальности Есть ли скрытая причина общего замедления развития ИИ? Новый чат-бот хочет раскрыть тайны ветхих древнегреческих текстов Крошечный слой ПО на основе лабораторных нейронов обещает ускорить и удешевить ИИ-видео Новый ИИ-агент Meta Muse может стать самым жутким из когда-либо выпущенных Барбара Маццолаи хочет создать новое направление в робототехнике У каждого найдётся причина не любить строительство дата-центров Очки Vonder от Viture призваны составить карту вашего сознания OpenAI: внутренняя модель за месяц обучения решила более 100 давних математических задач Новый безумный сайт позволяет стрелять в тире из турелей «менее смертоносными» боеприпасами ИИ и «разговоры с животными»: нам — умнее, а им что? Новый инструмент нашёл вредонос, которым руководит коллективный разум ИИ — без людей Не дайте себя обмануть этой летней шумихой вокруг ИИ

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram