Google проверит ИИ-модель вслепую, чтобы защитить бенчмарки
Google DeepMind запускает пилотный проект с Сингапурским институтом безопасности ИИ и другими партнёрами: внешние бенчмарки для модели Gemini проверят в двойном слепом режиме. Тестовые данные будут находиться в криптографически защищённом контейнере, поэтому модель не сможет заранее увидеть вопросы и отдельно обучиться под них. В эксперименте участвует модель из линейки Gemini Flash Lite, а сама схема должна решить проблему загрязнения бенчмарков и повысить доверие к результатам оценки передовых моделей ИИ.
Если участник экзамена заранее знает вопросы, даже идеальный результат мало что говорит о его знаниях. По такой аналогии Google DeepMind описывает проблему загрязнения бенчмарков: если модель уже встречала тестовые задания во время обучения, её показатели можно считать достоверными лишь частично.
Чтобы этого избежать, Google DeepMind заявляет о запуске первой двойной слепой оценки закрытой передовой модели ИИ. Внешние тесты будут закрыты в криптографическом «контейнере», а модель не сможет впоследствии использовать эти вопросы для отдельной оптимизации под конкретный бенчмарк.
В рамках пилота Google проверяет модель из линейки Gemini Flash Lite на конфиденциальных бенчмарках.
Раньше для чувствительных внешних оценок приходилось выбирать один из двух вариантов. Либо проверяющие передавали поставщику модели свои запросы, и тот видел вопросы заранее, либо разработчик передавал проверяющим веса модели, рискуя раскрыть интеллектуальную собственность. Недавний пример такой дилеммы — отложенная оценка Fable 5 от Anthropic на бенчмарке ARC-AGI: компания соблюдает для своих наиболее мощных моделей политику хранения данных в течение 30 дней.
Двойная слепая оценка должна устранить этот компромисс. Для неё Google использует защищённое пространство из набора технологий конфиденциальных вычислений Google Cloud. Система с помощью криптографии подтверждает, что внешние тестовые данные и модель остаются закрытыми для их владельцев. Проверяющий не получает доступ к весам Gemini, а Google не видит тестовые запросы.
До сих пор конфиденциальность внешних запросов обеспечивали протоколы без журналирования и договорные ограничения. По словам компании, добавление технической и криптографической защиты расширяет возможности безопасной оценки моделей.
Криптографическое подтверждение должно предотвращать загрязнение бенчмарков и защищать чувствительные данные. DeepMind считает, что это особенно важно для проверок в сфере кибербезопасности и оценок, которые проводят государственные учреждения. Независимые организации смогут тщательно тестировать передовые модели, не отказываясь от контроля над данными и требований безопасности.
Google рассчитывает, что этот подход станет новым стандартом надзора за моделями и поможет отрасли создавать более надёжные и вызывающие доверие ИИ-системы. Подробности методики и результаты проекта компания изложила в техническом отчёте.
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram