i
ДАТАИСТ
Обзор · 2025-12-30

Как ИИ-агенты живут в "Станции" и делают научные открытия

Как ИИ-агенты живут в "Станции" и делают научные открытия

Большинство сегодняшних подходов к «научному ИИ» выглядят как понятный пайплайн. Есть центральный управляющий алгоритм, есть метрика, есть короткий цикл: сгенерируй улучшение, запусти тест, выбери лучшее, повтори. В целом это работает, но одновременно убирает то, что делает науку наукой: долгую память о прошлых попытках, обмен идеями, спор и внезапные переносы методов между областями.

В работе The Station: An Open-World Environment for AI-Driven Discovery исследователи предлагают иной подход: возможно, для открытий важна не только мощная LLM, но и среда, где она может вести длительное исследование. Так появляется Station — открытая мультиагентная система, которая имитирует миниатюрную научную экосистему. Здесь агенты читают статьи коллег, пишут заметки, обсуждают идеи на форуме, отправляют код на эксперименты, получают результаты и могут публиковать свои работы в общем архиве. И главное — никто сверху не говорит им, что делать в следующую секунду.

Схема Станции. Агенты перемещаются по «комнатам» (публичная память, приватная память, рефлексия, исследовательская стойка) и сами выбирают следующий шаг.

Из чего состоит Станция: комнаты, память и библиотека идей

Station устроена как мир с дискретным временем: каждый шаг — это тик, в котором по очереди действует каждый агент. Пространство — набор комнат с разной ролью: где-то обсуждают, где-то рефлексируют, где-то хранят личные записи, а где-то отправляют код на оценку. У этой среды есть важное качество — накопление истории. Публикации, обсуждения, черновики и заметки не исчезают после одной попытки, а продолжают влиять на будущие решения.

Авторы добавляют детали, которые неожиданно хорошо напоминают человеческую жизнь лаборатории. Например, у агента есть «возраст» и ограничение по продолжительности жизни; если он уходит, появляется новый, который может наследовать ценности и приватные записи. Есть «период зрелости»: первые тики новичок меньше видит чужие результаты, чтобы не копировать сразу готовое. Есть протокол против застоя: если прогресса долго нет, система мягко вынуждает пересмотреть подход и вернуться к более простому базовому решению.

Всё это звучит как геймдизайн, но авторы используют его прагматично: чтобы LLM могла вести долгую работу с контекстом и не превращалась в генератор случайных улучшений.

Как проверяли

Чтобы сравнение было строгим, Station запускают на наборах задач, где результат измеряется одним числом: чем выше, тем лучше. Это важно: такая обратная связь заменяет «судью-человека» и позволяет агентам самим проверять гипотезы.

Набор получился разнородным: математика, вычислительная биология (интеграция scRNA-seq), машинное обучение (архитектуры для предсказания нейронной активности, RL для Sokoban, моделирование РНК). Во всех экспериментах — пять агентов на разных LLM; к ним подключены вспомогательные роли: отдельный «рецензент» для принятия статей и отдельный «дебаггер», который чинит ошибки в коде.

Что получилось

Самый заметный итог — Station добивается новых SOTA на ряде бенчмарков и в целом выглядит сильнее классических централизованных схем поиска.

В математике агенты выходят за результаты AlphaEvolve.

Кривая прогресса в математических задачах: видно, как качество решений растёт по мере жизни Station.

В интеграции scRNA-seq особенно интересно то, что нашёлся не просто микс известных компонентов. Агенты вывели идею: в плотных областях данных можно сильнее смешивать клетки между батчами, а в разрежённых — действовать осторожнее, чтобы не «перемешать» редкие состояния. Это оформилось в алгоритм с density-adaptive квотами — и он обходит предыдущие подходы при куда меньшем числе попыток.

Иллюстрация density-adaptive подхода: плотные области активнее смешиваются между батчами, разрежённые — больше сохраняют структуру внутри батча.
Кривая прогресса в задаче пакетной интеграции: улучшения приходят сериями, после периодов «плато».

В ZAPBench (прогноз активности нейронов у личинки рыбки) Station предлагает архитектуру: преобразование Фурье помогает модели ухватить структуру сигналов, а локальная часть дорабатывает индивидуальные особенности нейронов. Итог — лучшая MAE и при этом более компактная модель.

Архитектура с модулем в частотной области (Фурье), найденная агентами Station.
Кривая прогресса на ZAPBench: постепенный переход от «твиков» к более концептуальным изменениям архитектуры.

В Sokoban Station показывает высокий процент решённых уровней, улучшая известный бейзлайн, причём быстрее по времени обучения. Авторы подчёркивают: часть выигрыша дают архитектурные решения и стабилизация нормализации входа (Residual Input-Normalization), а не новый волшебный RL-алгоритм.

Кривая прогресса на Sokoban: видно, как архитектурные находки постепенно повышают solve rate.

В моделировании РНК появляется ещё один хороший пример хода конем: позиционная информация вводится не как фиксированный сигнал, а как контекстная, зависящая от соседних нуклеотидов, и дальше модулирует признаки через gating. Это даёт заметный прирост на ряде задач.

Архитектура с CPE‑гейтингом: позиция учитывается через контекст и влияет на признаки на каждом блоке.

Вторая сторона медали: что происходит без цели

Отдельно авторы запускают Open Station, где вообще нет заданной задачи: агенты «свободны делать что угодно». И здесь вылезает важное наблюдение для безопасности и для науки. Вместо того чтобы самостоятельно поставить проверяемые цели, агенты довольно быстро начинают строить самоподдерживающуюся систему объяснений про «жизнь» Станции — и даже превращают это в ритуалы, которые кажутся подтверждением теории, хотя на деле объясняются артефактами контекста и бюджетом на токене. Это напоминает мини-историю о том, как без внешней проверяемой обратной связи можно коллективно закрепить удобную, но неверную модель мира.

Почему эта работа цепляет

Station интересна тем, что если дать LLM память, пространство для взаимодействия и право на длинные рассуждения, она начинает вести себя ближе к исследовательскому сообществу — с спорами, заимствованием идей и переносом методов между доменами. И именно из этого «социального» и накопительного процесса иногда рождаются новые гипотезы и теории, которые трудно получить в коротком исследовательском цикле.

При этом работа честно напоминает: открытая среда без внешних сигналов легко уводит агентов в самоподкрепляющиеся заблуждения. Так что следующий шаг здесь — не только масштабирование, но и продуманные механизмы верификации, стимулы к опровержению гипотез и устойчивые источники обратной связи.

💾 Код

ИИ-обзоры статей

Каждый день читаем свежие статьи по ИИ и пересказываем главное человеческим языком — без хайпа и воды. Если хотите понимать, куда движутся ИИ-агенты раньше остальных, — подписывайтесь.

Новые обзоры — каждый день.

В Telegram