i
ДАТАИСТ
Обзор · 2026-01-01

Как измерить «общий научный интеллект» у LLM

Как измерить «общий научный интеллект» у LLM

Сегодня LLM умеют многое: объяснять сложные темы, писать код, держать длинную нить рассуждений. Но наука — это не только вызубрить ответы. Это исследовательский цикл: разобраться в литературе, придумать гипотезу, проверить ее экспериментом, а потом честно интерпретировать результаты и скорректировать план. И вот здесь у сообщества долго не было общего языка и измерителя: что именно считать «научным интеллектом» ИИ и как проверять его не на отдельных задачках, а на рабочем процессе, похожем на реальную работу исследователя.

Ученые из Шанхайского ИИ-университета выпустили исследование Probing Scientific General Intelligence of LLMs with Scientist-Aligned Workflows, в котором предлагают ответ: они вводят практичное определение Scientific General Intelligence (SGI) и строят бенчмарк, который проверяет не «эрудицию», а способность модели проходить этапы научного исследования.

Пайплайн SGI-Bench: четыре стадии научного цикла — размышление, концепция, действие и восприятие — и соответствующие им типы задач.

Научный цикл как измеримая рамка

Вместо абстрактных разговоров о «почти AGI» авторы опираются на Practical Inquiry Model — модель практического исследования с четырьмя связными стадиями. В человеческой науке они постоянно повторяются: сначала мы собираем и критически оцениваем знания, затем формируем идею, дальше делаем эксперимент, а после пытаемся понять, что на самом деле произошло.

Этот фреймворк ученые превращают в четыре типа задач, максимально похожих на то, что делает исследователь:

  1. глубокое научное исследование по источникам, где важны не общие слова, а точные выводы, часто численные;
  2. генерация исследовательских идей, но с требованием продуманной реализации;
  3. эксперименты — от дописывания научного кода до планирования лабораторного протокола;
  4. рассуждение по данным и изображениям, включая сравнение условий и причинные выводы.
10 научных областей SGI-Bench: от астрономии и химии до нейронаук и материаловедения.

Как собран SGI-Bench и почему это важно

Сам бенчмарк SGI-Bench — это больше тысячи междисциплинарных примеров. Темы вдохновлены списком Science’s 125 Big Questions, а данные и вопросы проходят многоступенчатую проверку. В сборке участвовали исследователи уровня магистров и PhD, а затем вопросы дополнительно чистились правилами, проверялись моделями и доменными экспертами.

Отдельно любопытен ход с «фильтрацией сложности»: авторы прогоняли задания на нескольких сильных моделях, и то, что оказывалось слишком легким, выкидывали. Это заметно меняет характер бенчмарка: он меньше похож на «экзамен на память» и больше — на стресс‑тест устойчивости.

Как устроены данные SGI-Bench: распределения по дисциплинам и типам задач, включая виды функций в dry-экспериментах и типы рассуждений по изображениям.

Как оценивают модели: недостаточно просто спросить «кто прав»

Проблема научных заданий в том, что «LLM-судья» часто дает слишком шумные оценки: разные домены требуют разных метрик, а иногда нужно реально выполнить код или проверить формат протокола. Поэтому авторы строят агентную оценку: не один «судья‑текстогенератор», а система, которая может подключать инструменты вроде интерпретатора Python, парсера PDF и специализированных метрик.

Схема оценки: агентный пайплайн с настройкой метрик, прогоном моделей и генерацией отчета.

Что получилось: сильные фрагменты вместо цельного научного поведения

Картина в итоге довольно трезвая. Даже лучшие модели набирают около 30 из 100 по сводному SGI‑Score. И это важный сигнал: сегодня LLM могут выглядеть уверенно на отдельных умениях, но «склеить» их в надежный научный рабочий процесс пока не выходит.

В «глубоком исследовании» пошаговое рассуждение иногда выглядит разумно, но финальный точный ответ часто неверен — exact match держится в районе 10–20%. То есть модель может искать информацию корректно, но плохо работать с числами, единицами измерений, интеграции источников или на последнем переходе.

Deep Research: сравнение точного совпадения финального ответа и пошаговой точности рассуждений.

Генерация идей выглядит хорошо: модели действительно предлагают необычные комбинации подходов. Но у идей хронически слабое место — реализуемость. Часто не хватает приземленных деталей: откуда берутся данные, как устроен пайплайн, в каком порядке запускать шаги, какие ресурсы нужны, как проверять гипотезу так, чтобы эксперимент можно было повторить.

Генерация идеи как структура: не просто гипотеза, а план реализации со шагами и связями.

В "сухих" экспериментах вскрывается типичная боль «код пишется, но наука не считается». Исполняемость может быть высокой, а вот научная корректность — низкой. Особенно часто модели ошибаются в численных методах и симуляциях: где важен не синтаксис, а выбор устойчивого алгоритма.

"Сухой" эксперимент: как выбор численного интегрирования меняет результат в задаче про гравитационные волны.

С "мокрыми" экспериментами все еще интересней: протоколы требуют порядка действий, таймингов, ветвлений, учета образцов. Модели нередко «схлопывают» сложный процесс в линейный список шагов и теряют логику эксперимента.

"Мокрый" эксперимент: сборка лабораторного протокола из пула действий и типичные ошибки порядка и параметров.

Наконец, в мультимодальном экспериментальном рассуждении модели лучше справляются с распознаванием сигналов и причинными подсказками, но стабильно проседают в сравнительном анализе: когда нужно аккуратно сопоставить несколько условий и не перепутать, что именно отличается.

Экспериментальное рассуждение: точность выбора ответа и валидность объяснений по моделям.

Попытка усилить «научную креативность» прямо на инференсе

Отдельный интересный кусок — Test-Time Reinforcement Learning. Авторы пробуют улучшать генерацию идей без «правильных ответов»: модель получает награду за новизну относительно найденных публикаций (через retrieval) и постепенно учится предлагать менее тривиальные гипотезы. Это не решает проблему реализуемости автоматически, но показывает направление: научные навыки можно прокачивать динамически, когда разметка невозможна.

TTRL: обучение на инференсе с наградой за новизну относительно найденных related works.

Что это меняет в научном ИИ

Главная ценность работы — в честной «приземленной» постановке вопроса. SGI здесь не мистическое свойство и не философия, а проверяемая способность проходить научный цикл: от литературы до интерпретации результатов. И результаты довольно ясно говорят: сегодняшние LLM сильны в отдельных компонентах, но пока недостаточно надежны там, где наука требует точности, процедурной дисциплины и устойчивых численных методов.

Для разработчиков это означает простую вещь: следующий прогресс, вероятно, будет не только в размере моделей, а в связке использования инструментов, проверках, самокоррекции, доменных симуляторах и обучении.

💾 Код

ИИ-обзоры статей

Каждый день читаем свежие статьи по ИИ и пересказываем главное человеческим языком — без хайпа и воды. Если хотите понимать, куда движутся ИИ-агенты раньше остальных, — подписывайтесь.

Новые обзоры — каждый день.

В Telegram