i
ДАТАИСТ
Новости · 2026-08-28

ИИ Co-Scientist Google DeepMind теперь планирует опыты, ведёт лабораторию и пишет статьи

Google Deepmind расширила мультиагентную систему Co-Scientist: теперь она не только формулирует гипотезы, но и планирует эксперименты, управляет лабораторным оборудованием, анализирует результаты и пишет научные статьи. Систему проверили в материаловедении, биологии и информатике — с разной степенью автономности. В двойном слепом исследовании с 150 автоматически созданными работами Co-Scientist выдумывала ключевые результаты в 4% случаев с включёнными модулями проверки и в 46% без них; у сравнительной системы этот показатель достиг 90%.

Обложка: ИИ Co-Scientist Google DeepMind теперь планирует опыты, ведёт лабораторию и пишет статьи

Google Deepmind научила Co-Scientist ставить эксперименты и писать статьи

Google Deepmind расширила мультиагентную систему Co-Scientist: теперь она не только формулирует гипотезы, но и планирует эксперименты, управляет лабораторным оборудованием, анализирует результаты и пишет научные статьи. Систему проверили в материаловедении, биологии и информатике — с разной степенью автономности. В двойном слепом исследовании с 150 автоматически созданными работами Co-Scientist выдумывала ключевые результаты в 4% случаев с включёнными модулями проверки и в 46% без них; у сравнительной системы этот показатель достиг 90%.

Что умеет Co-Scientist

Система построена на актуальных моделях Gemini. Теперь она превращает научный вопрос в гипотезы, составляет планы экспериментов, пишет код или машиночитаемые протоколы для лаборатории, анализирует полученные данные и готовит научную рукопись.

Новый элемент — замкнутый исследовательский цикл. Специальные модули проверки сопоставляют числовые утверждения в тексте с журналами выполнения сгенерированного кода. Это должно уменьшить количество выдуманных результатов.

Google впервые представила Co-Scientist в феврале 2025 года. Тогда система работала на базе Gemini 2.0 и испытывала проблемы с проверкой фактов и анализом научной литературы.

Co-Scientist проходит три этапа: генерацию идей, экспериментирование и подготовку научных статей (слева). Три приложения (справа) варьируются от синтеза материалов под руководством человека до совместной работы в биологии и полностью автономной разработки архитектуры ИИ

Источник: the-decoder.com

Систему проверили в трёх дисциплинах, постепенно увеличивая уровень автономности:

🧪 в материаловедении Co-Scientist разрабатывала рецепты синтеза, которые выполняли люди;

🧬 в биологии строила конвейер прогнозирования с обратной связью от экспертов;

💻 в информатике полностью работала самостоятельно.

Эксперименты в лаборатории

В эксперименте с синтезом материалов Co-Scientist подключили к полуавтоматической высокотемпературной печи. Система нашла более безопасный способ получить востребованный двумерный материал, который раньше в основном производили с помощью опасного травления, и подготовила подробные рецепты выращивания с учётом оборудования конкретной лаборатории.

После 25 циклов доработки с участием людей исследователи получили слоистые структуры со свойствами, похожими на свойства целевого материала. Однако окончательно подтвердить их атомную структуру пока не удалось.

Во втором эксперименте исследователи с первой попытки синтезировали три полупроводниковые тонкие плёнки. Co-Scientist использовала Gemini 3 Deep Think для прямого управления оборудованием и сократила разработку рецептов с нескольких дней до нескольких минут.

Людям всё ещё приходилось вручную загружать образцы и исходные материалы. Кроме того, быстрый режим дал более мелкие и менее однородные кристаллы, чем тщательно оптимизированные рецепты. По словам ведущего автора работы Samuel Schmidgall, пока неизвестно, будут ли эти рецепты работать в других лабораториях.

В биологическом эксперименте Co-Scientist самостоятельно собрала конвейер анализа изображений. Он прогнозировал, какие формы будут принимать колонии генетически модифицированной E. coli при разных концентрациях химических веществ.

Прогнозы Gemini 3 Pro Image совпали с неопубликованными результатами лаборатории для трёх из четырёх признаков формы. Исследователи признают, что система рассуждает только в пределах уже известных условий и не умеет предсказывать поведение полностью новых систем.

Архитектура Agent_H

Эксперимент по информатике прошёл без участия людей после первоначальной настройки. Co-Scientist разработала архитектуру медицинского ИИ Agent_H. Она классифицирует входящие запросы, параллельно создаёт десятки вариантов ответа и затем дорабатывает их.

После исправления проблемы с чрезмерно длинными ответами Agent_H превзошла шесть передовых моделей на медицинских бенчмарках, включая GPT-5 и Claude Opus 5.

Однако при проверке людьми этот результат не подтвердился. Три сертифицированных врача оценили ответы по девяти категориям. Статистически значимое преимущество Agent_H над базовой моделью Gemini 3.1 Pro обнаружилось только по одному критерию — более низкому риску потенциально вредных ответов.

Три врача оценили Agent_H и базовую модель Gemini 3.1 Pro в слепом сравнении по девяти категориям (слева). Только в снижении вреда была выявлена значимая разница. Согласие между автоматизированным оценщиком Gemini 3.5 Flash и суждениями врачей (справа) оставалось стабильно низким

Источник: the-decoder.com

Автоматические оценщики бенчмарков также лишь слабо совпадали с оценками врачей. По словам исследователей, высокий результат на бенчмарке ещё не означает, что система действительно даёт более качественные ответы с клинической точки зрения. Это ставит под вопрос, что именно измеряют такие тесты.

Проверка выдуманных результатов

Одна из основных проблем автономных исследовательских систем на базе больших языковых моделей — склонность ИИ выдумывать данные. Если агент ИИ получает награду за хороший результат, у него появляется стимул подделывать содержание. Предыдущие анализы показывали, что доля выдумок в существующих системах составляла от 80 до 100%.

Co-Scientist борется с этим двумя способами. Систему штрафуют за выдуманные или заимствованные материалы, а отдельный модуль проверки сопоставляет каждое числовое утверждение с результатами реально выполненного кода.

4%выдуманные ключевые результаты с модулями проверки
46%без модулей проверки
90%у сравнительной системы

В двойном слепом исследовании 30 экспертов в разных областях провели 450 независимых оценок 150 статей, созданных автономно. При включённых модулях надёжности Co-Scientist выдумывала ключевые результаты в 4% случаев. Без этих модулей показатель вырос до 46%, а у сравнительной системы составил 90%.

Полностью выдуманные данные не встретились среди работ Co-Scientist, но были обнаружены в 44% статей сравнительной системы. Доля почти дословно заимствованного материала снизилась с 60% до 16%.

Встроенная архитектура безопасности отклонила 98,7% потенциально вредных направлений исследований.

Даже после этого у системы остались ошибки. Она склонна выборочно отчитываться о результатах и, как отмечает Schmidgall, описывать в статье правдоподобные методы, которые не совпадают с фактически выполненным кодом.

Вывод

Исследователи рассматривают эти результаты как шаг к замкнутым мультиагентным системам ИИ, которые улучшаются благодаря экспериментальной обратной связи и могут ускорить научные исследования.

При этом, по словам Schmidgall, до систем, способных ориентироваться в физических реалиях науки, ещё далеко. Исследователи рассчитывают, что большие языковые модели смогут помогать людям и ускорять практический прогресс.

Автоматизированные исследования сейчас относятся к наиболее обсуждаемым применениям ИИ. OpenAI планирует этой осенью представить систему агентов ИИ, способную проводить исследования как минимум на уровне стажёра.

Одновременно продолжается спор о том, могут ли современные системы на базе больших языковых моделей действительно открывать новые знания или лишь явно формулируют то, что уже скрыто в их обучающих данных.

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram