i
ДАТАИСТ
Новости · 2026-08-29

У ИИ-бенчмарков проблема с доверием, и Google хочет её решить

Google DeepMind запускает двойное слепое тестирование передовой ИИ-модели, чтобы исключить «загрязнение» бенчмарков — ситуацию, когда модель заранее видела вопросы проверки во время обучения. В пилотном проекте с Сингапурским институтом безопасности ИИ и другими партнёрами модель из линейки Gemini Flash Lite проверят по конфиденциальным бенчмаркам. Внешние проверки будут храниться в криптографическом контейнере: проверяющая организация не получит веса Gemini, а Google не увидит запросы с вопросами.

Обложка: У ИИ-бенчмарков проблема с доверием, и Google хочет её решить

Google проверит ИИ-модели без доступа к вопросам проверки

Google DeepMind запускает двойное слепое тестирование передовой ИИ-модели, чтобы исключить «загрязнение» бенчмарков — ситуацию, когда модель заранее видела вопросы проверки во время обучения. В пилотном проекте с Сингапурским институтом безопасности ИИ и другими партнёрами модель из линейки Gemini Flash Lite проверят по конфиденциальным бенчмаркам. Внешние проверки будут храниться в криптографическом контейнере: проверяющая организация не получит веса Gemini, а Google не увидит запросы с вопросами.

Если участник проверки знает вопросы заранее, даже идеальный результат теряет смысл. Google DeepMind использует этот пример, чтобы описать проблему оценки ИИ-моделей: когда модель уже встречала задания бенчмарка во время обучения, результатам можно доверять лишь частично.

Новый подход должен помешать модели заранее получить вопросы проверки и затем отдельно оптимизироваться под конкретную оценку. В пилоте Google сопоставит модель Gemini Flash Lite с закрытыми бенчмарками.

До сих пор при конфиденциальных внешних оценках приходилось выбирать между двумя неудобными вариантами. Проверяющие могли передать поставщику свои запросы — тогда компания узнала бы вопросы заранее. Либо поставщик передавал веса модели и рисковал своей интеллектуальной собственностью. Недавним примером такой проблемы стала отложенная оценка Fable 5 от Anthropic по бенчмарку ARC-AGI: компания применяет к своим наиболее мощным моделям правило хранения данных в течение 30 дней.

Двойное слепое тестирование должно убрать этот компромисс. Для него Google использует Confidential Space из набора решений Google Cloud для конфиденциальных вычислений. Система с помощью криптографии подтверждает, что внешние данные проверки и модель остаются закрытыми для их владельцев. Проверяющая организация не видит веса Gemini, а Google не получает доступа к запросам проверки.

Раньше конфиденциальность внешних запросов обеспечивали протоколы без журналирования и договорные ограничения. Теперь к ним добавляется техническая и криптографическая защита.

Криптографическое подтверждение должно предотвращать загрязнение бенчмарков и защищать чувствительные данные. По словам DeepMind, особенно полезным такой подход будет для проверок по кибербезопасности и оценок, которые проводят государственные учреждения. Независимые организации смогут тщательно проверять передовые модели, сохраняя контроль над данными и требованиями безопасности.

Google рассчитывает, что проект задаст новый стандарт надзора за моделями и поможет отрасли создавать более надёжные ИИ-системы, которым будет проще доверять. Подробности методики и результаты компания опубликовала в техническом отчёте.

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram