i
ДАТАИСТ
Новости · 2026-08-31

Пустые полки или потерянные ключи? Узкое место — извлечение фактов

@neuronium_ai @neuronium_ai

Исследователи Google Research Nitay Calderon и Gal Yona изучили, почему большие языковые модели ошибаются в фактах. Их методика профилирования знаний показывает: передовые модели обычно кодируют почти все проверяемые сведения, но не всегда могут их вспомнить. В Gemini-3-Pro и GPT-5 закодировано 95–98% фактов, однако без режима рассуждения они не извлекают 26–34% из них, а с рассуждением ошибаются в 11–12% случаев. Узким местом становится использование уже сохранённых знаний, а не их получение.

Обложка: Пустые полки или потерянные ключи? Узкое место — извлечение фактов

Что именно измеряли

Фактическая достоверность нужна, чтобы сделать LLM надёжнее. Но обычные метрики точности не различают две причины ошибки: модель могла никогда не сохранить факт или сохранить его, но не суметь извлечь. В первом случае помогают увеличение размера модели и расширение обучающих данных. Во втором нужны методы дообучения и инференса, которые улучшают доступ к уже закодированным сведениям.

В работе «Пустые полки или потерянные ключи? Извлечение — узкое место фактических знаний в параметрах модели» исследователи представили профилирование знаний — поведенческую методику, которая отдельно измеряет кодирование и извлечение фактов. На её основе они изучили узкие места фактической достоверности передовых моделей, включая Gemini3 и GPT-5. Результат авторы описывают так: многие ошибки связаны не с «пустыми полками», где знаний нет, а с «потерянными ключами» — знания есть, но доступа к ним нет.

Под кодированием исследователи понимают представление факта в параметрах модели, под извлечением — воспроизведение сохранённого факта без внешних подсказок, а под распознаванием — выбор правильного факта среди предложенных вариантов. Для проверки этих свойств они создали бенчмарк WikiProfile: 2 150 фактов из Wikipedia, для каждого подготовлено по 10 вопросов, проверяющих кодирование, извлечение и распознавание.

Профилирование знаний переносит единицу анализа с отдельного вопроса на сам факт. Вместо того чтобы спрашивать, правильно ли модель ответила на конкретный запрос, исследователи определяют состояние факта. Всего выделено пять профилей:

1ошибка кодирования;
2ошибка извлечения;
3прямое извлечение;
4извлечение с рассуждением;
5вывод без кодирования факта.

Классификация зависит от того, сохранён ли факт и насколько легко его получить: модель может не извлечь его вообще, воспроизвести напрямую или получить только после рассуждения — например, после промежуточных вычислений, цепочки рассуждений или работы в моделях, оптимизированных для рассуждения.

Диаграмма, операционализирующая фактические знания в больших языковых моделях. В ней кодирование определяется как воспроизведение факта в контексте предварительного обучения, а знание — как правильный ответ на прямые или обратные вопросы о нём

Диаграмма, операционализирующая фактические знания в больших языковых моделях. В ней кодирование определяется как воспроизведение факта в контексте предварительного обучения, а знание — как правильный ответ на прямые или обратные вопросы о нём

Источник: research.google

Профилирование знаний строится на трёх поведенческих проверках. Сначала из Wikipedia извлекают факты — это один из основных источников данных для предварительного обучения. Затем модель просят воспроизвести факт в исходном контексте, чтобы проверить кодирование. После этого ей задают вопросы в разных формулировках и направлениях, с рассуждением и без него, чтобы измерить доступность знаний.

Как устроен WikiProfile

WikiProfile собрали с помощью полностью автоматизированного конвейера обработки данных на базе LLM Gemini-2.5-Pro с рассуждением. Запросы для него вручную оптимизировали на небольшой отложенной выборке.

Из страниц Wikipedia извлекали факты, представленные как утверждения об упорядоченной паре сущностей: субъект идёт первым в документе, объект — вторым. Каждый факт связывали с 10 заданиями: двумя на кодирование, четырьмя на проверку знаний и четырьмя вариантами вопроса с выбором ответа для проверки распознавания.

Прямые и обратные вопросы создавали в три этапа: генерация, доработка и фильтрация. Каждый вопрос должен был быть однозначным, конкретным, минимальным и иметь единственный ответ. Все варианты дополнительно проверяли через поисковую систему: случаи с несколькими ответами или необходимостью уточнения удаляли. После автоматической фильтрации и финальной ручной проверки в бенчмарке осталось 2 150 фактов.

Блок-схема, подробно иллюстрирующая конвейер WikiProfile для преобразования документов Википедии в проверенные вопросы с несколькими вариантами ответа

Блок-схема, подробно иллюстрирующая конвейер WikiProfile для преобразования документов Википедии в проверенные вопросы с несколькими вариантами ответа

Источник: research.google

В исследовании проверили 13 LLM. Каждую модель тестировали с рассуждением и без него. Для каждой комбинации модели, факта и задания получали по 8 ответов. Их автоматически оценивали ИИ-оценщики на базе LLM. Всего собрали около 4,5 млн ответов.

13языковых моделей
2 150фактов в WikiProfile
10заданий на факт
4,5 млнответов

Кодирование почти достигло предела

У передовых моделей Gemini-2.5-Pro, Gemini-3-Pro, Gemini-3-Flash и GPT-5 кодирование фактов близко к насыщению, а извлечение всё ещё отстаёт. Gemini-3-Pro и GPT-5 кодируют 95–98% фактов, но без рассуждения не могут напрямую вспомнить 26–34% из них. Даже с рассуждением модели не извлекают 11–12% фактов.

Получается, что фактические ошибки передовых моделей всё чаще связаны с недоступными знаниями, а не с их отсутствием. Узкое место смещается от накопления знаний к их использованию.

В семействе Gemma 3 масштабирование даёт заметное снижение ошибок кодирования: большие модели сохраняют гораздо больше фактов. Однако ошибки извлечения остаются существенными и занимают всё большую долю среди оставшихся ошибок. Увеличение размера модели сильнее улучшает объём сохранённых знаний, чем доступ к ним.

Столбчатая диаграмма с накоплением, показывающая распределение пяти состояний извлечения знаний в различных языковых моделях

Столбчатая диаграмма с накоплением, показывающая распределение пяти состояний извлечения знаний в различных языковых моделях

Источник: research.google

Редкие факты сохранены, но недоступны

Извлечение тесно связано с условиями, в которых факт был выучен. Если запрос отличается от контекста, формулировки или порядка слов, встречавшихся во время обучения, получить ответ становится сложнее.

Предыдущие исследования связывали проблемы LLM с редкими фактами с ограниченной ёмкостью моделей. Профилирование знаний показывает другую сторону проблемы. У редких фактов, относящихся к нижним 20% по популярности, доля кодирования близка к показателю популярных фактов из верхних 20%. Разрыв в кодировании сравнительно небольшой, зато в прямом извлечении он заметно шире.

Многие редкие факты, вероятно, уже присутствуют в параметрах модели, но их трудно вызвать запросом. Поэтому проблема редких фактов связана не только с получением знаний, но и с доступом к ним.

Столбчатые диаграммы, показывающие, что языковые модели лучше кодируют и вспоминают более популярные факты, чем менее популярные

Столбчатые диаграммы, показывающие, что языковые модели лучше кодируют и вспоминают более популярные факты, чем менее популярные

Источник: research.google

Исследователи сравнили два уровня популярности — нижние и верхние 20% — по доле закодированных фактов и доле фактов, которые модель может извлечь напрямую. Обозначение Δ показывает разницу между группами: для кодирования она небольшая, для извлечения — значительно больше.

Обратные вопросы выявляют проблему извлечения

Авторы также проверили «проклятие обращения»: модель знает, что «A — это B», но не может ответить на вопрос «Что такое B?». На первый взгляд это указывает на отсутствие двунаправленного знания.

Однако в генерации ответа без внешних материалов обратные вопросы стабильно сложнее прямых. В заданиях с выбором ответа обратные вопросы не уступают прямым и часто оказываются легче. Если модель узнаёт правильный вариант среди отвлекающих ответов, но не может сама сформулировать его при обратном запросе, двунаправленное знание не обязательно отсутствует. Скорее, факт закодирован и распознаётся, но плохо извлекается, когда направление вопроса отличается от того, в котором модель встретила его во время обучения.

Таким образом, «проклятие обращения» связано с извлечением.

Столбчатые диаграммы, сравнивающие результаты языковых моделей при прямом и обратном извлечении фактов в задачах проверки и генерации

Столбчатые диаграммы, сравнивающие результаты языковых моделей при прямом и обратном извлечении фактов в задачах проверки и генерации

Источник: research.google

Прямые и обратные вопросы сравнивали в двух режимах: распознавание с выбором ответа и генерация ответа без внешних материалов. В распознавании модели справляются с обратными вопросами, а в генерации испытывают заметные трудности.

Рассуждение возвращает часть знаний

Затем исследователи проверили, помогает ли режим рассуждения получить знания, которые не извлекаются напрямую. Наибольший эффект наблюдался там, где прямое извлечение было самым слабым. Особенно заметно рассуждение помогало с редкими фактами и обратными вопросами, сокращая разрывы и по популярности, и по направлению запроса.

Столбчатые диаграммы, показывающие, как этап рассуждения улучшает воспроизведение фактов разной популярности и при разных направлениях вопросов для различных моделей

Столбчатые диаграммы, показывающие, как этап рассуждения улучшает воспроизведение фактов разной популярности и при разных направлениях вопросов для различных моделей

Источник: research.google

В моделях, оптимизированных для рассуждения, этот режим возвращал примерно 40–65% фактов, которые были закодированы, но не извлекались напрямую. Для фактов, отсутствующих в параметрах, польза была гораздо меньше.

Это указывает на то, что рассуждение в первую очередь облегчает извлечение: помогает получить уже сохранённый факт, а не вывести ответ сложной многошаговой цепочкой. При этом рассуждение требует дополнительных вычислений, и пока неясно, как точно определять, в какой момент модели следует его включать.

Линейный график, показывающий, что факты значительно чаще извлекаются при рассуждении, если они уже закодированы в модели

Линейный график, показывающий, что факты значительно чаще извлекаются при рассуждении, если они уже закодированы в модели

Источник: research.google

Среди фактов, которые изначально считались неизвестными, рассуждение возвращало 40–65% закодированных сведений в моделях, оптимизированных для рассуждения. Для фактов, которые не были закодированы, показатель составлял лишь 5–15%.

Вывод

Профилирование знаний позволяет отдельно диагностировать разные причины фактических ошибок LLM. Результаты на фактах из Wikipedia указывают: если кодирование уже близко к насыщению, дальнейшее повышение достоверности может в меньшей степени зависеть от масштабирования моделей и объёма данных.

Рассуждение уже возвращает значительную долю фактов, которые сохранены в модели, но недоступны при прямом ответе. Поэтому улучшения могут быть связаны не только с накоплением новых знаний, но и с более эффективным использованием тех, что уже закодированы.

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram