Google проверит ИИ-модели без доступа к вопросам проверки
Google DeepMind запускает двойное слепое тестирование передовой ИИ-модели, чтобы исключить «загрязнение» бенчмарков — ситуацию, когда модель заранее видела вопросы проверки во время обучения. В пилотном проекте с Сингапурским институтом безопасности ИИ и другими партнёрами модель из линейки Gemini Flash Lite проверят по конфиденциальным бенчмаркам. Внешние проверки будут храниться в криптографическом контейнере: проверяющая организация не получит веса Gemini, а Google не увидит запросы с вопросами.
Если участник проверки знает вопросы заранее, даже идеальный результат теряет смысл. Google DeepMind использует этот пример, чтобы описать проблему оценки ИИ-моделей: когда модель уже встречала задания бенчмарка во время обучения, результатам можно доверять лишь частично.
Новый подход должен помешать модели заранее получить вопросы проверки и затем отдельно оптимизироваться под конкретную оценку. В пилоте Google сопоставит модель Gemini Flash Lite с закрытыми бенчмарками.
До сих пор при конфиденциальных внешних оценках приходилось выбирать между двумя неудобными вариантами. Проверяющие могли передать поставщику свои запросы — тогда компания узнала бы вопросы заранее. Либо поставщик передавал веса модели и рисковал своей интеллектуальной собственностью. Недавним примером такой проблемы стала отложенная оценка Fable 5 от Anthropic по бенчмарку ARC-AGI: компания применяет к своим наиболее мощным моделям правило хранения данных в течение 30 дней.
Двойное слепое тестирование должно убрать этот компромисс. Для него Google использует Confidential Space из набора решений Google Cloud для конфиденциальных вычислений. Система с помощью криптографии подтверждает, что внешние данные проверки и модель остаются закрытыми для их владельцев. Проверяющая организация не видит веса Gemini, а Google не получает доступа к запросам проверки.
Раньше конфиденциальность внешних запросов обеспечивали протоколы без журналирования и договорные ограничения. Теперь к ним добавляется техническая и криптографическая защита.
Криптографическое подтверждение должно предотвращать загрязнение бенчмарков и защищать чувствительные данные. По словам DeepMind, особенно полезным такой подход будет для проверок по кибербезопасности и оценок, которые проводят государственные учреждения. Независимые организации смогут тщательно проверять передовые модели, сохраняя контроль над данными и требованиями безопасности.
Google рассчитывает, что проект задаст новый стандарт надзора за моделями и поможет отрасли создавать более надёжные ИИ-системы, которым будет проще доверять. Подробности методики и результаты компания опубликовала в техническом отчёте.
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram