Зачем нужна воспроизводимость
По мере распространения ИИ оценки становятся одним из главных источников данных о возможностях моделей и систем. Но результаты публикуют в разных форматах, на разных площадках и часто без сведений, необходимых для повторения эксперимента. Сам повторный запуск может оказаться слишком дорогим.
EvalEval развивает эту экосистему с помощью общей схемы отчётности Every Eval Ever и открытой платформы Evaluation Cards. Она собирает результаты оценивания и сведения, необходимые для их интерпретации, в единую структуру.
Работа продолжает инициативы AISI:
AISI и EvalEval вместе выявляют пробелы в описании оценок и создают общую инфраструктуру, которая должна их закрыть.
Что публикует AISI
Прозрачность на уровне отдельных расшифровок нужна не только для воспроизводимости, но и для анализа и диагностики. На новом этапе сотрудничества AISI размещает в Evaluation Cards публично описанные методы оценивания и полученные результаты — там, где это уместно.
Выпуск содержит проверенные результаты, контекст и сведения о конфигурации для пяти бенчмарков из основного эксперимента статьи:
Результаты относятся к шести передовым моделям:
В выпуск также вошли результаты двух связанных кибернетических оценок — Cyber CTFs и The Last Ones. Для них использовался другой, частично пересекающийся набор моделей.
Данные сопровождают статью AISI How инференс Compute Shapes Frontier LLM Evaluation. В ней изучается, как производительность на бенчмарках зависит от вычислительных ресурсов на этапе инференса и от протокола оценивания.
На примере Humanity's Last Exam показано, что результат меняется в зависимости от протокола оценивания и объёма вычислений на этапе инференса. Для каждой кривой рассчитывалась совокупная доля решённых попыток в пределах заданного числа токенов, причём для каждой задачи учитывался самый ранний зафиксированный успех. Если после каждой попытки модель получала от оракула информацию о правильности ответа, с ростом числа использованных токенов она продолжала решать дополнительные задачи.
Когда результаты публикуют вместе с открытыми сведениями о настройках эксперимента, исследователи и разработчики могут детальнее изучать отдельные работы и сравнивать их с более широким набором данных. Если в других отчётах таких деталей нет, выпуски AISI дают проверенные ориентиры для интерпретации результатов. Например, они помогают понять, как выбор настроек мог повлиять на заявленную производительность.
По мере распространения EEE такие открытые сравнения могут поддержать более масштабные и надёжные исследования самих методов оценивания.
Результаты AISI для Terminal-Bench 2.0 также сопоставлены с другими опубликованными оценками тех же моделей, выполненными при разных настройках.
Организации заявляют, что рассчитывают на дальнейшую стандартизацию и совместную публикацию оценок вместе с AISI и другими организациями, изучающими ИИ.
Как участвовать
Коалиция EvalEval
EvalEval Coalition — исследовательское сообщество, которое развивает научно обоснованные методы и инфраструктуру для экосистемы оценивания. Его цель — улучшать науку об оценках, решать проблему отсутствия согласованных подходов к описанию применимости и полезности оценок, а также расширять охват последствий, важных для научных исследований и анализа политики.
Ключевые проекты коалиции:
Вместе эти проекты помогают понять, почему внешне похожие результаты могли быть получены в существенно разных условиях.
UK ИИ Security Institute
UK ИИ Security Institute — исследовательская организация при британском Department for Science, Innovation and Technology. Её задача — дать правительствам научное понимание рисков, связанных с передовым ИИ.
AISI проводит исследования и создаёт инфраструктуру, чтобы изучать возможности и последствия применения передового ИИ, разрабатывать и проверять меры защиты, а также предоставлять данные для формирования политики.
Читайте также
AstroForge передаёт ИИ управление своим следующим космическим аппаратом
Джордж Осборн из OpenAI: противники дата-центров тормозят развитие Британии
Rabbit возвращается — теперь с приложением ИИ-агента
OpenAI призывает к международным стандартам для ИИ, способного к самоулучшению
Трамп в ООН: США теперь называют ИИ «сверхинтеллектом» во всех официальных документах
IPO Nscale вновь проверит готовность Уолл-стрит к концентрированным ставкам на ИИ
Техногиганты говорят: ИИ может найти лекарство от рака. Так где же оно?
ИИ-модели на основе мозга крыс стали ближе к реальности
Есть ли скрытая причина общего замедления развития ИИ?
Новый чат-бот хочет раскрыть тайны ветхих древнегреческих текстов
Крошечный слой ПО на основе лабораторных нейронов обещает ускорить и удешевить ИИ-видео
Новый ИИ-агент Meta Muse может стать самым жутким из когда-либо выпущенных
Барбара Маццолаи хочет создать новое направление в робототехнике
У каждого найдётся причина не любить строительство дата-центров
Очки Vonder от Viture призваны составить карту вашего сознания
OpenAI: внутренняя модель за месяц обучения решила более 100 давних математических задач
Новый безумный сайт позволяет стрелять в тире из турелей «менее смертоносными» боеприпасами
ИИ и «разговоры с животными»: нам — умнее, а им что?
Новый инструмент нашёл вредонос, которым руководит коллективный разум ИИ — без людей
Не дайте себя обмануть этой летней шумихой вокруг ИИ
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram