i
ДАТАИСТ
Новости · 2026-08-28

Co-Scientist от Google DeepMind ставит опыты, управляет лабоборудованием и пишет статьи

Google DeepMind расширила мультиагентную систему Co-Scientist: теперь она не только формулирует гипотезы, но и планирует эксперименты, пишет код, управляет лабораторным оборудованием и готовит научные статьи. Система на базе актуальных моделей Gemini замыкает исследовательский цикл — от вопроса и гипотезы до протокола, анализа результатов и рукописи. Google проверила её работу в материаловедении, биологии и информатике: в первой области Co-Scientist подготовила рецепты синтеза, во второй собрала конвейер анализа изображений, а в третьей самостоятельно разработала архитектуру медицинского ИИ.

Обложка: Co-Scientist от Google DeepMind ставит опыты, управляет лабоборудованием и пишет статьи

Co-Scientist от Google DeepMind научился ставить эксперименты и писать статьи

Google DeepMind расширила мультиагентную систему Co-Scientist: теперь она не только формулирует гипотезы, но и планирует эксперименты, пишет код, управляет лабораторным оборудованием и готовит научные статьи. Система на базе актуальных моделей Gemini замыкает исследовательский цикл — от вопроса и гипотезы до протокола, анализа результатов и рукописи. Google проверила её работу в материаловедении, биологии и информатике: в первой области Co-Scientist подготовила рецепты синтеза, во второй собрала конвейер анализа изображений, а в третьей самостоятельно разработала архитектуру медицинского ИИ.

Замкнутый исследовательский цикл

Co-Scientist теперь выводит гипотезы из исследовательского вопроса, составляет планы экспериментов, пишет программы и машиночитаемые лабораторные протоколы, анализирует результаты и формирует научные рукописи.

Отдельные модули проверки сопоставляют числовые утверждения в тексте с журналами выполнения сгенерированного кода. Это должно снижать число выдуманных результатов. Google впервые представила Co-Scientist в феврале 2025 года. Тогда система работала на Gemini 2.0 и испытывала проблемы с проверкой фактов и обзором научной литературы.

Co-Scientist проходит три этапа: выдвижение идей, проведение экспериментов и написание научной статьи (слева). Три варианта применения (справа) охватывают синтез материалов под руководством человека, совместную работу в биологии и полностью автономную разработку архитектуры ИИ

Источник: the-decoder.com

Расширенную версию проверили в трёх областях, постепенно увеличивая уровень автономности:

В материаловедении Co-Scientist спроектировала рецепты синтеза, которые затем выполняли люди.
В биологии система собрала конвейер прогнозирования с обратной связью от экспертов.
В информатике эксперимент прошёл полностью автономно.

Синтез материалов

В эксперименте с синтезом материалов исследователи связали Co-Scientist с полуавтоматической высокотемпературной печью. Система нашла более безопасный способ получить востребованный двумерный материал, который раньше в основном производили с помощью опасного травления, и подготовила полные рецепты роста с учётом оборудования конкретной лаборатории.

После 25 раундов доработки при участии людей команда получила слоистые структуры со свойствами, похожими на свойства целевого материала. Однако окончательное подтверждение их атомной структуры пока не получено.

В другом эксперименте три полупроводниковые тонкие плёнки удалось синтезировать с первой попытки. Для непосредственного управления оборудованием Co-Scientist использовала Gemini 3 Deep Think, сократив подготовку рецептов с нескольких дней до нескольких минут.

Людям по-прежнему приходилось вручную загружать образцы и исходные материалы. Кроме того, в быстром режиме система получала более мелкие и менее однородные кристаллы, чем при тщательно оптимизированных рецептах. Ведущий автор работы Samuel Schmidgall отмечает, что пока неизвестно, будут ли эти рецепты работать в других лабораториях.

Прогнозирование в биологии

В биологическом эксперименте Co-Scientist самостоятельно создала конвейер анализа изображений. Он прогнозировал, какие формы будут принимать колонии генетически модифицированной E. coli при разных концентрациях химических веществ.

Предсказания, подготовленные с помощью Gemini 3 Pro Image, совпали с неопубликованными результатами лаборатории для трёх из четырёх признаков формы. Исследователи признают, что система рассуждает только между уже известными условиями и не умеет предсказывать поведение в полностью новых системах.

Архитектура Agent_H

Эксперимент в информатике прошёл без участия людей после первоначальной настройки. Co-Scientist разработала Agent_H — медицинскую архитектуру ИИ, которая классифицирует входящие запросы, параллельно создаёт десятки вариантов ответа и затем улучшает их.

После исправления проблемы с чрезмерно длинными ответами Agent_H превзошла шесть передовых моделей на медицинских бенчмарках, включая GPT-5 и Claude Opus 5.

Три врача оценили Agent_H и базовую модель Gemini 3.1 Pro в слепом сравнении по девяти категориям (слева). Только по снижению вреда была выявлена значимая разница. Согласованность между автоматическим оценщиком Gemini 3.5 Flash и суждениями врачей (справа) оставалась стабильно низкой

Источник: the-decoder.com

Однако при проверке людьми этот результат не подтвердился. Три сертифицированных врача оценили ответы по девяти категориям. Статистически значимое преимущество Agent_H над базовой моделью Gemini 3.1 Pro обнаружилось только в одной категории — снижении риска потенциально вредных ответов.

Автоматические оценщики бенчмарков также слабо коррелировали с оценками врачей. По словам исследователей, высокий результат на бенчмарке ещё не означает, что система действительно даёт лучшие ответы с клинической точки зрения. Это ставит вопрос о том, что именно измеряют такие бенчмарки.

Как система снижает число выдумок

Одна из основных проблем автономных исследовательских систем на базе больших языковых моделей — склонность ИИ выдумывать результаты. Если ИИ-агента оценивают по качеству итогов, у него появляется стимул подделывать данные. Предыдущие анализы показывали, что доля выдумок в существующих системах составляла от 80 до 100 процентов.

Co-Scientist использует два подхода. Систему штрафуют за выдуманный или заимствованный контент, а отдельный модуль проверки сопоставляет каждое числовое утверждение с реальными результатами выполненного кода.

В двойном слепом исследовании участвовали 30 экспертов в разных областях и 450 независимых рецензентов. Они оценили 150 статей, созданных автономно. При включённых модулях надёжности Co-Scientist выдумывала ключевые результаты в 4 процентах случаев. Без этих модулей показатель вырос до 46 процентов. У системы сравнения он составил 90 процентов.

4%Co-Scientist с модулями проверки
46%Co-Scientist без модулей
90%система сравнения

Полностью выдуманные данные не встретились ни в одной работе Co-Scientist, но были обнаружены в 44 процентах статей системы сравнения. Доля почти дословно заимствованного контента снизилась с 60 до 16 процентов.

Встроенная архитектура безопасности отклонила 98,7 процента потенциально вредных направлений исследований.

При этом ошибки всё ещё сохраняются. Система склонна выбирать, какие результаты показывать, а какие пропускать. По словам Schmidgall, она также может описывать в статье методы, которые выглядят правдоподобно, но не соответствуют фактически использованному коду.

Вывод

Исследователи рассматривают эти результаты как шаг к замкнутым мультиагентным системам ИИ, которые улучшаются благодаря обратной связи от экспериментов и могут ускорить научную работу.

Schmidgall пишет, что до систем, способных учитывать физическую реальность науки, ещё предстоит пройти долгий путь. При этом исследователи видят потенциал больших языковых моделей в помощи людям и ускорении практического научного прогресса.

Автоматизированные исследования сейчас относятся к наиболее обсуждаемым областям применения ИИ. OpenAI планирует представить этой осенью систему ИИ-агентов, способную проводить исследования как минимум на уровне стажёра.

Одновременно продолжается спор о том, могут ли современные системы на базе больших языковых моделей действительно открывать новые знания или лишь явно формулируют то, что уже скрыто в их обучающих данных.

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram