Что именно проверяли
Обычно ошибку модели диагностируют как нехватку знаний. Тогда разработчики увеличивают размер модели, добавляют обучающие данные или строят сложные системы поиска.
Исследователи предлагают разделять два процесса:
Для этого авторы предлагают оценивать не только правильность ответа на отдельный запрос, а профиль одного факта в разных условиях. Такая проверка показывает, записан ли факт в параметрах, можно ли получить его с помощью разных формулировок и сколько вычислений требуется для извлечения.
При обычных метриках ошибки кодирования и ошибки вспоминания выглядят одинаково, но требуют разных решений. Если факт не закодирован, нужны изменения на этапе предварительного обучения — например, увеличение модели или расширение данных. Если факт записан, но недоступен, помогают методы дообучения и инференса, которые улучшают использование уже имеющихся знаний.
Пять профилей знания
Исследователи объясняют подход на примере факта: группа Oasis впервые выступила в клубе Boardwalk.
Результаты на 13 моделях
Исследователи проверили 13 больших языковых моделей и получили более 4 миллионов ответов. Они использовали WikiProfile — бенчмарк с 2150 фактами из Wikipedia. Каждый факт проверяли в форматах от точного продолжения исходного контекста до вопросов с вариантами ответа.
У передовых моделей, включая GPT-5 и Gemini-3, кодирование фактов почти достигло насыщения: они успешно записывают 95–98% проверенных сведений. При этом без рассуждения модели не могут напрямую вспомнить 26–34% фактов, которые уже закодированы.
Дополнительные вычисления во время инференса возвращают 40–65% фактов, которые первоначально не удалось вспомнить напрямую. Исследователи сравнивают это с состоянием «вертится на кончике языка»: человек помнит информацию, но вспоминает её только после дополнительных усилий и мысленного восстановления контекста.
Масштабирование модели само по себе не устраняет разрыв между хранением и доступом. По словам научного сотрудника Google Нитая Кальдерона, разработчики часто увеличивают модель или добавляют данные, хотя при уже закодированном факте это не помогает.
На примере Gemma3 исследователи показали, что увеличение размера с 1 млрд до 27 млрд параметров действительно сокращает долю ошибок кодирования — с 85% до 23%. Но одновременно растёт доля ошибок вспоминания: без рассуждения она достигает 40%.
Получается, масштабирование в основном решает проблему хранения, но не проблему доступа. Чем больше фактов модель запоминает, тем больше знаний оказывается в состоянии «закодировано, но недоступно». Поэтому значительная часть ошибок смещается от отсутствующих данных к неудачному извлечению.
Зависимость от формулировки
Авторы связывают способность вспомнить факт с условиями, в которых он был выучен. Если запрос отличается от обучающих примеров, доступ к знанию ухудшается.
Редкие факты кодируются примерно с той же частотой, что и популярные. Но разрыв в способности их вспоминать между редкими и широко известными сведениями у передовых моделей превышает 25%.
Моделям также трудно отвечать на обратные вопросы — когда требуется назвать субъект, а не объект. Например, модель может легко сказать, что Oasis впервые выступила в клубе Boardwalk, но не ответить, какая группа дала свой первый концерт в этом клубе. При этом в формате вопроса с вариантами ответа та же модель выбирает правильный вариант.
Исследователи считают, что такие случаи указывают не на отсутствие запоминания или двунаправленного кодирования. Редкие факты часто уже записаны, но недоступны, а обратные связи модель может распознать, даже если не умеет сформулировать их самостоятельно. Оба явления относятся к ошибкам вспоминания.
Что менять в ИИ-системах
Высокая доля закодированных фактов требует изменить подход к проверке достоверности и архитектуре конвейера обработки данных.
Не считать любую фактическую ошибку проблемой поиска. Обычная реакция компаний на галлюцинации — внедрить поиск по внешним данным, увеличить векторные базы или загрузить больше документов в систему с дополненной генерацией. Для свежих или внутренних сведений это может быть правильным решением. Но если факт уже есть в параметрах модели, такой подход добавляет задержку и стоимость каждого запроса.
Нитай Кальдерон отмечает, что многие задачи, которые команды решают с помощью поиска с дополненной генерацией, модель уже способна выполнить по памяти. Если факт действительно отсутствует, поиск по внешним данным полезен. Если же он закодирован, но не вспоминается, поиск с дополненной генерацией и увеличение модели лишь увеличивают расходы, не устраняя настоящую причину ошибки.
Использовать рассуждение выборочно. Дополнительное мышление возвращает 40–65% закодированных фактов, которые модель не смогла вспомнить напрямую. Однако рассуждение требуется только для 10–20% фактов, поэтому его постоянное включение расходует вычислительный бюджет.
Задача — направлять запросы на дополнительное рассуждение динамически. Но современные модели пока недостаточно надёжно определяют, что обычный ответ вот-вот окажется неверным. Для этого им нужно заранее распознать собственную неуверенность и переключиться на более глубокое рассуждение. Google разрабатывает подходы вроде «достоверной неопределённости», которые должны помочь моделям точнее оценивать уверенность и запускать рассуждение до появления галлюцинации.
Строить конвейеры «сгенерировать, затем проверить». Модели лучше распознают правильный факт, чем создают его с нуля. Поэтому система может сначала сформировать ответ, а затем отдельно попросить модель проверить и осмыслить собственные утверждения. Такая проверка способна находить ошибки, которые пропускает обычная генерация, и повышать фактическую точность ответа.
Проверять доступ к смыслу, а не только точность на бенчмарке. Обычные метрики скрывают реальные способности модели. Наборы для оценки должны проверять один и тот же факт в разных формулировках, контекстах и направлениях. Это позволяет понять, что модель действительно знает, а к чему умеет надёжно обращаться.
Переформулировать запросы и повторять попытку. Поскольку вспоминание сильно зависит от контекста, структура запроса влияет на результат. Можно изменить формулировку, добавить связанный промежуточный контекст или попросить модель сначала построить цепочку рассуждений, а затем дать ответ. Такие приёмы помогают извлечь сведения, которые не удалось получить прямым запросом.
Ограничения и доступ к WikiProfile
WikiProfile построен на энциклопедических фактах из Wikipedia, поэтому результаты могут не полностью переноситься на закрытые или узкоспециализированные корпоративные области. Способность модели хранить и вспоминать внутренний показатель компании может отличаться от работы с общедоступными энциклопедическими сведениями.
Полное профилирование передовой модели с помощью WikiProfile стоит примерно $500. Снизить расходы можно, если убрать варианты с выбором ответа или сократить число образцов для каждого вопроса.
Команды могут получить бенчмарк WikiProfile на Hugging Face и проверить собственные системы. В комплект входят точные запросы, использованные при создании набора, поэтому инженеры могут воспроизвести тот же конвейер обработки данных на своих внутренних корпусах и выяснить, страдают ли их специализированные системы от отсутствующих данных или от недоступных фактов.
При переходе от энциклопедических данных к отраслевым ожидания нужно корректировать. По словам Нитая Кальдерона, конвейер рассчитан на новый корпус, но если на Wikipedia основной проблемой было вспоминание, то в конкретной предметной области факты могут действительно отсутствовать в модели.
Вывод
Для компаний, которые не обучают собственные модели с нуля, такой подход упрощает работу с ИИ-системами. Предварительное обучение требует огромных затрат и недоступно большинству организаций, тогда как постобучение можно проводить на небольших объёмах данных и за несколько шагов. Инструменты инференса — рассуждение, проверка ответа и поиск по внешним данным — уже используются большинством команд.
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram