i
Новости
Новости · 2026-09-21

Как RetroChimera улучшает прогнозирование синтеза малых молекул в больших масштабах

@neuronium_ai @neuronium_ai

Команда разработчиков представила RetroChimera — модель для автоматического планирования синтеза малых молекул, о которой вышла статья в журнале Nature. Система предлагает маршруты получения молекул из более простых соединений и объединяет два дополняющих друг друга подхода. В слепых испытаниях химики с докторской степенью чаще выбирали отдельные предсказания RetroChimera, чем результаты прежних моделей и реакции из научной литературы. Реализацию и веса модели открыли на GitHub, чтобы исследователи могли быстрее разрабатывать лекарства и новые материалы.

Обложка: Как RetroChimera улучшает прогнозирование синтеза малых молекул в больших масштабах

Ключевые результаты

В Nature опубликована статья о модели ретросинтетического анализа RetroChimera.
В ней описаны архитектура системы и масштабная проверка, включая способность находить редкие типы реакций, переносить знания на новые данные без дополнительного обучения и проходить файн-тюнинг на закрытых наборах данных.
Реализация RetroChimera и её веса опубликованы в открытом доступе, чтобы ускорить разработку молекул для медицины и передовых материалов.

Разработка новых лекарств и материалов требует создания новых молекул, однако планирование их получения по-прежнему в основном выполняется вручную, занимает много времени и обходится дорого. RetroChimera автоматически предлагает качественные маршруты синтеза. Модель объединяет два сильных подхода с разными преимуществами и учится ранжировать их варианты, чтобы получать более точные предсказания, чем каждый из них по отдельности. В слепых испытаниях химики с докторской степенью предпочитали отдельные предсказания RetroChimera результатам предыдущих моделей и реакциям, описанным в литературе.

Почему синтез сложно автоматизировать

Молекулы, созданные под конкретную задачу, помогают развивать современную медицину, умные материалы и устойчивое сельское хозяйство. Но прогресс замедляет химический синтез — трудоёмкий процесс получения новых молекул из более простых исходных соединений в лаборатории. Синтез также заметно увеличивает стоимость разработки лекарств. Поэтому даже при наличии вычислительных методов, позволяющих исследовать большое число новых молекул, поиск практичных способов их получения остаётся сложной задачей.

Ретросинтетический анализ решает её обратным движением: от целевой молекулы к исходным соединениям. Системы шаг за шагом разбирают сложную структуру на более простые предшественники. Этот процесс можно сравнить со стратегическими настольными играми вроде шахмат или го: нужно рассматривать множество возможных ближайших ходов — отдельных разрывов связей — и одновременно выстраивать общий план синтеза. При этом число вариантов в ретросинтезе намного больше, чем в настольных играх, а доступность конкретного хода для данной молекулы заранее неочевидна.

Существующие системы сталкиваются с несколькими проблемами:

они не всегда находят редкие, но стратегически важные реакции;
хуже работают за пределами распределения данных, на которых обучались;
не всегда предлагают решения, соответствующие ожиданиям химиков.

Из-за этого ретросинтез часто требует узкоспециализированных знаний, что мешает масштабировать и автоматизировать научные разработки.

Планирование синтеза методом обратного движения. Ретросинтез начинается с целевой молекулы и предлагает последовательные разъединения, ведущие к более простым предшественникам, пока не будут достигнуты доступные для покупки строительные блоки. Выделенный путь показывает полный маршрут синтеза; бледные ветви иллюстрируют исследованные по ходу альтернативы.

Планирование синтеза методом обратного движения. Ретросинтез начинается с целевой молекулы и предлагает последовательные разъединения, ведущие к более простым предшественникам, пока не будут достигнуты доступные для покупки строительные блоки. Выделенный путь показывает полный маршрут синтеза; бледные ветви иллюстрируют исследованные по ходу альтернативы.

Источник: microsoft.com

Как устроена RetroChimera

В статье, недавно опубликованной в Nature, разработчики представили RetroChimera — новый фреймворк для предсказания ретросинтеза. В его основе лежат две модели.

R-SMILES 2 — модель на базе Transformer, которая напрямую предсказывает молекулы-предшественники по входной молекуле. Такой подход позволяет ей самостоятельно находить закономерности реакций в данных. Однако свободная генерация ограничений не имеет, поэтому модель может выдавать несуществующие варианты — галлюцинации.

NeuralLoc устроена иначе. Это модель на базе графовой нейронной сети, которая представляет и целевую молекулу, и шаблоны реакций в виде графов. Она выбирает подходящие шаблоны и определяет, где их нужно применить к целевой молекуле. Её предсказания опираются на шаблоны реакций, извлечённые из обучающих данных, поэтому модель обычно выдаёт более точные и надёжные результаты. При этом она сильнее ограничена, если сталкивается с реакциями, которых нет в библиотеке шаблонов.

Наш фреймворк для ансамблевого ретросинтеза с обучаемым переупорядочиванием, лежащий в основе RetroChimera. Ансамбль получает на вход целевую молекулу, которая затем обрабатывается субмоделями. Выходные данные моделей агрегируются с использованием стратегии обучения ранжированию

Наш фреймворк для ансамблевого ретросинтеза с обучаемым переупорядочиванием, лежащий в основе RetroChimera. Ансамбль получает на вход целевую молекулу, которая затем обрабатывается субмоделями. Выходные данные моделей агрегируются с использованием стратегии обучения ранжированию

Источник: microsoft.com

Различия между моделями оказались полезными. Они не повторяют одни и те же предсказания, а улавливают разные химические закономерности и специализируются на разных типах реакций:

R-SMILES 2 особенно хорошо работает с реакциями, которые сильно меняют молекулу;
NeuralLoc лучше справляется с реакциями низкой распространённости и реакциями с более локальными изменениями.

RetroChimera объединяет ранжированные предсказания двух подмоделей с помощью обучаемой стратегии ансамблирования. Каждая модель назначает каждому набору предполагаемых реагентов голос, зависящий от его позиции в ранжировании. Если обе модели предлагают одну и ту же реакцию, их голоса складываются. Система учится определять, насколько доверять каждой модели на разных позициях, и благодаря этому использует их взаимодополняющие преимущества. В разных классах реакций RetroChimera примерно достигает уровня той подмодели, которая работает лучше.

Результаты проверки

RetroChimera хорошо показывает себя как на распространённых, так и на редких классах реакций, а её предсказания ретросинтеза лучше соответствуют оценкам химиков. В слепых испытаниях эксперты предпочитали варианты разрыва связей в сложных молекулах, предложенные RetroChimera:

результатам входящих в неё подмоделей;
более устоявшимся подходам;
даже вариантам из тестового набора.
Экспертная оценка многостадийных маршрутов синтеза. Слева: оценки отдельных реакционных стадий. Справа: полные маршруты, принятые или отклонённые для десяти сложных целевых молекул. RetroChimera успешно справилась с девятью целевыми молекулами, тогда как de novo-модель — с пятью, модель редактирования — с четырьмя, а NeuralSym, сильная базовая модель, — с двумя

Экспертная оценка многостадийных маршрутов синтеза. Слева: оценки отдельных реакционных стадий. Справа: полные маршруты, принятые или отклонённые для десяти сложных целевых молекул. RetroChimera успешно справилась с девятью целевыми молекулами, тогда как de novo-модель — с пятью, модель редактирования — с четырьмя, а NeuralSym, сильная базовая модель, — с двумя

Источник: microsoft.com

Разработчики считают, что RetroChimera поможет исследователям быстрее находить перспективные маршруты синтеза и ускорит цикл «разработка — получение — проверка» в разных областях молекулярной науки, включая создание лекарств и умных материалов. Модель может позволить химикам проверять больше молекул-кандидатов, в том числе более сложных, в большом масштабе.

В сочетании с дальнейшей автоматизацией лабораторий это, по мнению авторов, может ускорить создание замкнутых самоулучшающихся систем для планирования и выполнения синтеза.

Доступ к модели

RetroChimera опубликована на GitHub по лицензии MIT и доступна через Microsoft Foundry. Инструкции по работе с контрольной точкой находятся в репозитории GitHub.

Разработчики приглашают химическое сообщество испытать RetroChimera на разных целевых молекулах, чтобы выявить сильные и слабые стороны системы и улучшить её в будущем.

Подробные результаты, включая эксперименты вместе с внешними научными партнёрами, опубликованы в полной статье Nature и сопроводительном материале Microsoft Source.

4 способа устранить выявленные нами сбои у «виртуальной стены» на границе США SoftBank планирует занять более $11 млрд через рискованные облигации ради доли в OpenAI Как мы создали первую подробную карту смертей у «виртуальной стены» на границе США США и Китай запустят диалог по ИИ с механизмом безопасности перед саммитом Трампа и Си Есть Android-смартфон? Google считает, что вам, скорее всего, захочется ноутбук Googlebook Популярный космический сайт выдумал инженера NASA и публиковал ИИ-шлак под её именем США и Китай обсуждают, как уведомлять друг друга об ИИ-угрозах для нацбезопасности Глава Nvidia: «Шанс, что ИИ уничтожит мир к 2030 году, — 0%» Команда робототехников школы Folkestone хочет вдохновить новое поколение Открытый EnvHarness от Google: ИИ-агенты обучаются в средах, меняющихся вместе с ними Через 40 лет в Австралии смертей будет больше, чем рождений — рост замедлится Трамп и Си: смогут ли они провести человечество через революцию ИИ? От этого зависит всё Компании, создающие модели мира, многое держат в секрете Кольцо Vocci добавляет новый форм-фактор для заметок на встречах Действительно ли индустрия ИИ готова сбавить темп? ScrollEd хочет превратить учебники в TikTok The Guardian: люди по-прежнему необходимы математике, но технокомпании этого не видят Alibaba: открытая Qwen-Image-2.1 превосходит закрытые модели при 7 млрд параметров Gander от Tencent стремится не замолкать, работая в фоне Британский стартап привлёк $20 млн, чтобы воссоздавать концерты с «гиперреалистичными» цифровыми аватарами

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram