Google Deepmind научила Co-Scientist ставить эксперименты и писать статьи
Google Deepmind расширила мультиагентную систему Co-Scientist: теперь она не только формулирует гипотезы, но и планирует эксперименты, управляет лабораторным оборудованием, анализирует результаты и пишет научные статьи. Систему проверили в материаловедении, биологии и информатике — с разной степенью автономности. В двойном слепом исследовании с 150 автоматически созданными работами Co-Scientist выдумывала ключевые результаты в 4% случаев с включёнными модулями проверки и в 46% без них; у сравнительной системы этот показатель достиг 90%.
Что умеет Co-Scientist
Система построена на актуальных моделях Gemini. Теперь она превращает научный вопрос в гипотезы, составляет планы экспериментов, пишет код или машиночитаемые протоколы для лаборатории, анализирует полученные данные и готовит научную рукопись.
Новый элемент — замкнутый исследовательский цикл. Специальные модули проверки сопоставляют числовые утверждения в тексте с журналами выполнения сгенерированного кода. Это должно уменьшить количество выдуманных результатов.
Google впервые представила Co-Scientist в феврале 2025 года. Тогда система работала на базе Gemini 2.0 и испытывала проблемы с проверкой фактов и анализом научной литературы.
Co-Scientist проходит три этапа: генерацию идей, экспериментирование и подготовку научных статей (слева). Три приложения (справа) варьируются от синтеза материалов под руководством человека до совместной работы в биологии и полностью автономной разработки архитектуры ИИ
Источник: the-decoder.com
Систему проверили в трёх дисциплинах, постепенно увеличивая уровень автономности:
🧪 в материаловедении Co-Scientist разрабатывала рецепты синтеза, которые выполняли люди;
🧬 в биологии строила конвейер прогнозирования с обратной связью от экспертов;
💻 в информатике полностью работала самостоятельно.
Эксперименты в лаборатории
В эксперименте с синтезом материалов Co-Scientist подключили к полуавтоматической высокотемпературной печи. Система нашла более безопасный способ получить востребованный двумерный материал, который раньше в основном производили с помощью опасного травления, и подготовила подробные рецепты выращивания с учётом оборудования конкретной лаборатории.
После 25 циклов доработки с участием людей исследователи получили слоистые структуры со свойствами, похожими на свойства целевого материала. Однако окончательно подтвердить их атомную структуру пока не удалось.
Во втором эксперименте исследователи с первой попытки синтезировали три полупроводниковые тонкие плёнки. Co-Scientist использовала Gemini 3 Deep Think для прямого управления оборудованием и сократила разработку рецептов с нескольких дней до нескольких минут.
Людям всё ещё приходилось вручную загружать образцы и исходные материалы. Кроме того, быстрый режим дал более мелкие и менее однородные кристаллы, чем тщательно оптимизированные рецепты. По словам ведущего автора работы Samuel Schmidgall, пока неизвестно, будут ли эти рецепты работать в других лабораториях.
В биологическом эксперименте Co-Scientist самостоятельно собрала конвейер анализа изображений. Он прогнозировал, какие формы будут принимать колонии генетически модифицированной E. coli при разных концентрациях химических веществ.
Прогнозы Gemini 3 Pro Image совпали с неопубликованными результатами лаборатории для трёх из четырёх признаков формы. Исследователи признают, что система рассуждает только в пределах уже известных условий и не умеет предсказывать поведение полностью новых систем.
Архитектура Agent_H
Эксперимент по информатике прошёл без участия людей после первоначальной настройки. Co-Scientist разработала архитектуру медицинского ИИ Agent_H. Она классифицирует входящие запросы, параллельно создаёт десятки вариантов ответа и затем дорабатывает их.
После исправления проблемы с чрезмерно длинными ответами Agent_H превзошла шесть передовых моделей на медицинских бенчмарках, включая GPT-5 и Claude Opus 5.
Однако при проверке людьми этот результат не подтвердился. Три сертифицированных врача оценили ответы по девяти категориям. Статистически значимое преимущество Agent_H над базовой моделью Gemini 3.1 Pro обнаружилось только по одному критерию — более низкому риску потенциально вредных ответов.
Три врача оценили Agent_H и базовую модель Gemini 3.1 Pro в слепом сравнении по девяти категориям (слева). Только в снижении вреда была выявлена значимая разница. Согласие между автоматизированным оценщиком Gemini 3.5 Flash и суждениями врачей (справа) оставалось стабильно низким
Источник: the-decoder.com
Автоматические оценщики бенчмарков также лишь слабо совпадали с оценками врачей. По словам исследователей, высокий результат на бенчмарке ещё не означает, что система действительно даёт более качественные ответы с клинической точки зрения. Это ставит под вопрос, что именно измеряют такие тесты.
Проверка выдуманных результатов
Одна из основных проблем автономных исследовательских систем на базе больших языковых моделей — склонность ИИ выдумывать данные. Если агент ИИ получает награду за хороший результат, у него появляется стимул подделывать содержание. Предыдущие анализы показывали, что доля выдумок в существующих системах составляла от 80 до 100%.
Co-Scientist борется с этим двумя способами. Систему штрафуют за выдуманные или заимствованные материалы, а отдельный модуль проверки сопоставляет каждое числовое утверждение с результатами реально выполненного кода.
В двойном слепом исследовании 30 экспертов в разных областях провели 450 независимых оценок 150 статей, созданных автономно. При включённых модулях надёжности Co-Scientist выдумывала ключевые результаты в 4% случаев. Без этих модулей показатель вырос до 46%, а у сравнительной системы составил 90%.
Полностью выдуманные данные не встретились среди работ Co-Scientist, но были обнаружены в 44% статей сравнительной системы. Доля почти дословно заимствованного материала снизилась с 60% до 16%.
Встроенная архитектура безопасности отклонила 98,7% потенциально вредных направлений исследований.
Даже после этого у системы остались ошибки. Она склонна выборочно отчитываться о результатах и, как отмечает Schmidgall, описывать в статье правдоподобные методы, которые не совпадают с фактически выполненным кодом.
Вывод
Исследователи рассматривают эти результаты как шаг к замкнутым мультиагентным системам ИИ, которые улучшаются благодаря экспериментальной обратной связи и могут ускорить научные исследования.
При этом, по словам Schmidgall, до систем, способных ориентироваться в физических реалиях науки, ещё далеко. Исследователи рассчитывают, что большие языковые модели смогут помогать людям и ускорять практический прогресс.
Автоматизированные исследования сейчас относятся к наиболее обсуждаемым применениям ИИ. OpenAI планирует этой осенью представить систему агентов ИИ, способную проводить исследования как минимум на уровне стажёра.
Одновременно продолжается спор о том, могут ли современные системы на базе больших языковых моделей действительно открывать новые знания или лишь явно формулируют то, что уже скрыто в их обучающих данных.
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram