i
ДАТАИСТ
Новости · 2026-09-04

GPT-5 и Gemini-3 вспоминают забытые факты благодаря рассуждению

@neuronium_ai @neuronium_ai

Когда большие языковые модели галлюцинируют, разработчики обычно считают, что им не хватает нужных знаний. Новое исследование Google Research и Technion показывает: во многих случаях факт уже записан в параметрах модели, но система не может извлечь его во время генерации. GPT-5 и Gemini-3 кодируют 95–98% проверенных фактов, однако без дополнительного рассуждения не вспоминают 26–34% из них. Дополнительные вычисления помогают восстановить 40–65% таких фактов. Это означает, что для повышения точности иногда нужны не более крупные модели или внешние базы, а способы лучше использовать уже имеющиеся знания.

Обложка: GPT-5 и Gemini-3 вспоминают забытые факты благодаря рассуждению

Что именно проверяли

Обычно ошибку модели диагностируют как нехватку знаний. Тогда разработчики увеличивают размер модели, добавляют обучающие данные или строят сложные системы поиска.

Исследователи предлагают разделять два процесса:

Кодирование — факт записан в параметрах модели. Это проверяют, предлагая продолжить исходный фрагмент текста, на котором модель, вероятно, обучалась.
Вспоминание — модель стабильно отвечает на вопросы о факте в разных формулировках и с разных направлений.

Для этого авторы предлагают оценивать не только правильность ответа на отдельный запрос, а профиль одного факта в разных условиях. Такая проверка показывает, записан ли факт в параметрах, можно ли получить его с помощью разных формулировок и сколько вычислений требуется для извлечения.

При обычных метриках ошибки кодирования и ошибки вспоминания выглядят одинаково, но требуют разных решений. Если факт не закодирован, нужны изменения на этапе предварительного обучения — например, увеличение модели или расширение данных. Если факт записан, но недоступен, помогают методы дообучения и инференса, которые улучшают использование уже имеющихся знаний.

Пять профилей знания

Исследователи объясняют подход на примере факта: группа Oasis впервые выступила в клубе Boardwalk.

Прямое вспоминание — факт записан в модели и сразу извлекается для ответа без дополнительных вычислений.
Ошибка кодирования, или «пустые полки» — модель не записала факт и не знает его. Она не может продолжить энциклопедическое предложение о ранних выступлениях Oasis и не отвечает на вопросы о событии. Здесь нужны дополнительные данные для предварительного обучения или большая ёмкость модели.
Ошибка вспоминания, или «потерянные ключи» — факт есть в параметрах, но модель не может его достать. Она без проблем продолжает исходный обучающий текст об Oasis, но не отвечает, где группа дала свой первый концерт, даже если ей дать время на размышление.
Вспоминание через рассуждение — факт закодирован, но недоступен при прямой генерации. Модель извлекает его только после дополнительных вычислений во время инференса, например с помощью цепочки рассуждений. Сначала она может не ответить на прямой вопрос, а затем рассуждения о ранней истории группы в Манчестере помогают ей найти нужный факт.
Вывод без кодирования — конкретный факт не записан, но модель угадывает ответ, связывая другие известные сведения. Например, она может объединить данные о том, что Oasis сформировалась в Манчестере, Boardwalk был известным музыкальным клубом 1990-х, а начинающие группы часто выступали там.

Результаты на 13 моделях

Исследователи проверили 13 больших языковых моделей и получили более 4 миллионов ответов. Они использовали WikiProfile — бенчмарк с 2150 фактами из Wikipedia. Каждый факт проверяли в форматах от точного продолжения исходного контекста до вопросов с вариантами ответа.

13больших языковых моделей
4 млн+ответов
2150фактов в WikiProfile

У передовых моделей, включая GPT-5 и Gemini-3, кодирование фактов почти достигло насыщения: они успешно записывают 95–98% проверенных сведений. При этом без рассуждения модели не могут напрямую вспомнить 26–34% фактов, которые уже закодированы.

Дополнительные вычисления во время инференса возвращают 40–65% фактов, которые первоначально не удалось вспомнить напрямую. Исследователи сравнивают это с состоянием «вертится на кончике языка»: человек помнит информацию, но вспоминает её только после дополнительных усилий и мысленного восстановления контекста.

Масштабирование модели само по себе не устраняет разрыв между хранением и доступом. По словам научного сотрудника Google Нитая Кальдерона, разработчики часто увеличивают модель или добавляют данные, хотя при уже закодированном факте это не помогает.

На примере Gemma3 исследователи показали, что увеличение размера с 1 млрд до 27 млрд параметров действительно сокращает долю ошибок кодирования — с 85% до 23%. Но одновременно растёт доля ошибок вспоминания: без рассуждения она достигает 40%.

1 млрд параметров85% ошибок кодирования
27 млрд параметров23% ошибок кодирования и до 40% ошибок вспоминания

Получается, масштабирование в основном решает проблему хранения, но не проблему доступа. Чем больше фактов модель запоминает, тем больше знаний оказывается в состоянии «закодировано, но недоступно». Поэтому значительная часть ошибок смещается от отсутствующих данных к неудачному извлечению.

Зависимость от формулировки

Авторы связывают способность вспомнить факт с условиями, в которых он был выучен. Если запрос отличается от обучающих примеров, доступ к знанию ухудшается.

Редкие факты кодируются примерно с той же частотой, что и популярные. Но разрыв в способности их вспоминать между редкими и широко известными сведениями у передовых моделей превышает 25%.

Моделям также трудно отвечать на обратные вопросы — когда требуется назвать субъект, а не объект. Например, модель может легко сказать, что Oasis впервые выступила в клубе Boardwalk, но не ответить, какая группа дала свой первый концерт в этом клубе. При этом в формате вопроса с вариантами ответа та же модель выбирает правильный вариант.

Исследователи считают, что такие случаи указывают не на отсутствие запоминания или двунаправленного кодирования. Редкие факты часто уже записаны, но недоступны, а обратные связи модель может распознать, даже если не умеет сформулировать их самостоятельно. Оба явления относятся к ошибкам вспоминания.

Что менять в ИИ-системах

Высокая доля закодированных фактов требует изменить подход к проверке достоверности и архитектуре конвейера обработки данных.

Не считать любую фактическую ошибку проблемой поиска. Обычная реакция компаний на галлюцинации — внедрить поиск по внешним данным, увеличить векторные базы или загрузить больше документов в систему с дополненной генерацией. Для свежих или внутренних сведений это может быть правильным решением. Но если факт уже есть в параметрах модели, такой подход добавляет задержку и стоимость каждого запроса.

Нитай Кальдерон отмечает, что многие задачи, которые команды решают с помощью поиска с дополненной генерацией, модель уже способна выполнить по памяти. Если факт действительно отсутствует, поиск по внешним данным полезен. Если же он закодирован, но не вспоминается, поиск с дополненной генерацией и увеличение модели лишь увеличивают расходы, не устраняя настоящую причину ошибки.

Использовать рассуждение выборочно. Дополнительное мышление возвращает 40–65% закодированных фактов, которые модель не смогла вспомнить напрямую. Однако рассуждение требуется только для 10–20% фактов, поэтому его постоянное включение расходует вычислительный бюджет.

Задача — направлять запросы на дополнительное рассуждение динамически. Но современные модели пока недостаточно надёжно определяют, что обычный ответ вот-вот окажется неверным. Для этого им нужно заранее распознать собственную неуверенность и переключиться на более глубокое рассуждение. Google разрабатывает подходы вроде «достоверной неопределённости», которые должны помочь моделям точнее оценивать уверенность и запускать рассуждение до появления галлюцинации.

Строить конвейеры «сгенерировать, затем проверить». Модели лучше распознают правильный факт, чем создают его с нуля. Поэтому система может сначала сформировать ответ, а затем отдельно попросить модель проверить и осмыслить собственные утверждения. Такая проверка способна находить ошибки, которые пропускает обычная генерация, и повышать фактическую точность ответа.

Проверять доступ к смыслу, а не только точность на бенчмарке. Обычные метрики скрывают реальные способности модели. Наборы для оценки должны проверять один и тот же факт в разных формулировках, контекстах и направлениях. Это позволяет понять, что модель действительно знает, а к чему умеет надёжно обращаться.

Переформулировать запросы и повторять попытку. Поскольку вспоминание сильно зависит от контекста, структура запроса влияет на результат. Можно изменить формулировку, добавить связанный промежуточный контекст или попросить модель сначала построить цепочку рассуждений, а затем дать ответ. Такие приёмы помогают извлечь сведения, которые не удалось получить прямым запросом.

Ограничения и доступ к WikiProfile

WikiProfile построен на энциклопедических фактах из Wikipedia, поэтому результаты могут не полностью переноситься на закрытые или узкоспециализированные корпоративные области. Способность модели хранить и вспоминать внутренний показатель компании может отличаться от работы с общедоступными энциклопедическими сведениями.

Полное профилирование передовой модели с помощью WikiProfile стоит примерно $500. Снизить расходы можно, если убрать варианты с выбором ответа или сократить число образцов для каждого вопроса.

Команды могут получить бенчмарк WikiProfile на Hugging Face и проверить собственные системы. В комплект входят точные запросы, использованные при создании набора, поэтому инженеры могут воспроизвести тот же конвейер обработки данных на своих внутренних корпусах и выяснить, страдают ли их специализированные системы от отсутствующих данных или от недоступных фактов.

При переходе от энциклопедических данных к отраслевым ожидания нужно корректировать. По словам Нитая Кальдерона, конвейер рассчитан на новый корпус, но если на Wikipedia основной проблемой было вспоминание, то в конкретной предметной области факты могут действительно отсутствовать в модели.

Вывод

Для компаний, которые не обучают собственные модели с нуля, такой подход упрощает работу с ИИ-системами. Предварительное обучение требует огромных затрат и недоступно большинству организаций, тогда как постобучение можно проводить на небольших объёмах данных и за несколько шагов. Инструменты инференса — рассуждение, проверка ответа и поиск по внешним данным — уже используются большинством команд.

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram