Ключевые результаты
Разработка новых лекарств и материалов требует создания новых молекул, однако планирование их получения по-прежнему в основном выполняется вручную, занимает много времени и обходится дорого. RetroChimera автоматически предлагает качественные маршруты синтеза. Модель объединяет два сильных подхода с разными преимуществами и учится ранжировать их варианты, чтобы получать более точные предсказания, чем каждый из них по отдельности. В слепых испытаниях химики с докторской степенью предпочитали отдельные предсказания RetroChimera результатам предыдущих моделей и реакциям, описанным в литературе.
Почему синтез сложно автоматизировать
Молекулы, созданные под конкретную задачу, помогают развивать современную медицину, умные материалы и устойчивое сельское хозяйство. Но прогресс замедляет химический синтез — трудоёмкий процесс получения новых молекул из более простых исходных соединений в лаборатории. Синтез также заметно увеличивает стоимость разработки лекарств. Поэтому даже при наличии вычислительных методов, позволяющих исследовать большое число новых молекул, поиск практичных способов их получения остаётся сложной задачей.
Ретросинтетический анализ решает её обратным движением: от целевой молекулы к исходным соединениям. Системы шаг за шагом разбирают сложную структуру на более простые предшественники. Этот процесс можно сравнить со стратегическими настольными играми вроде шахмат или го: нужно рассматривать множество возможных ближайших ходов — отдельных разрывов связей — и одновременно выстраивать общий план синтеза. При этом число вариантов в ретросинтезе намного больше, чем в настольных играх, а доступность конкретного хода для данной молекулы заранее неочевидна.
Существующие системы сталкиваются с несколькими проблемами:
Из-за этого ретросинтез часто требует узкоспециализированных знаний, что мешает масштабировать и автоматизировать научные разработки.
Планирование синтеза методом обратного движения. Ретросинтез начинается с целевой молекулы и предлагает последовательные разъединения, ведущие к более простым предшественникам, пока не будут достигнуты доступные для покупки строительные блоки. Выделенный путь показывает полный маршрут синтеза; бледные ветви иллюстрируют исследованные по ходу альтернативы.
Источник: microsoft.com
Как устроена RetroChimera
В статье, недавно опубликованной в Nature, разработчики представили RetroChimera — новый фреймворк для предсказания ретросинтеза. В его основе лежат две модели.
R-SMILES 2 — модель на базе Transformer, которая напрямую предсказывает молекулы-предшественники по входной молекуле. Такой подход позволяет ей самостоятельно находить закономерности реакций в данных. Однако свободная генерация ограничений не имеет, поэтому модель может выдавать несуществующие варианты — галлюцинации.
NeuralLoc устроена иначе. Это модель на базе графовой нейронной сети, которая представляет и целевую молекулу, и шаблоны реакций в виде графов. Она выбирает подходящие шаблоны и определяет, где их нужно применить к целевой молекуле. Её предсказания опираются на шаблоны реакций, извлечённые из обучающих данных, поэтому модель обычно выдаёт более точные и надёжные результаты. При этом она сильнее ограничена, если сталкивается с реакциями, которых нет в библиотеке шаблонов.
Наш фреймворк для ансамблевого ретросинтеза с обучаемым переупорядочиванием, лежащий в основе RetroChimera. Ансамбль получает на вход целевую молекулу, которая затем обрабатывается субмоделями. Выходные данные моделей агрегируются с использованием стратегии обучения ранжированию
Источник: microsoft.com
Различия между моделями оказались полезными. Они не повторяют одни и те же предсказания, а улавливают разные химические закономерности и специализируются на разных типах реакций:
RetroChimera объединяет ранжированные предсказания двух подмоделей с помощью обучаемой стратегии ансамблирования. Каждая модель назначает каждому набору предполагаемых реагентов голос, зависящий от его позиции в ранжировании. Если обе модели предлагают одну и ту же реакцию, их голоса складываются. Система учится определять, насколько доверять каждой модели на разных позициях, и благодаря этому использует их взаимодополняющие преимущества. В разных классах реакций RetroChimera примерно достигает уровня той подмодели, которая работает лучше.
Результаты проверки
RetroChimera хорошо показывает себя как на распространённых, так и на редких классах реакций, а её предсказания ретросинтеза лучше соответствуют оценкам химиков. В слепых испытаниях эксперты предпочитали варианты разрыва связей в сложных молекулах, предложенные RetroChimera:
Экспертная оценка многостадийных маршрутов синтеза. Слева: оценки отдельных реакционных стадий. Справа: полные маршруты, принятые или отклонённые для десяти сложных целевых молекул. RetroChimera успешно справилась с девятью целевыми молекулами, тогда как de novo-модель — с пятью, модель редактирования — с четырьмя, а NeuralSym, сильная базовая модель, — с двумя
Источник: microsoft.com
Разработчики считают, что RetroChimera поможет исследователям быстрее находить перспективные маршруты синтеза и ускорит цикл «разработка — получение — проверка» в разных областях молекулярной науки, включая создание лекарств и умных материалов. Модель может позволить химикам проверять больше молекул-кандидатов, в том числе более сложных, в большом масштабе.
В сочетании с дальнейшей автоматизацией лабораторий это, по мнению авторов, может ускорить создание замкнутых самоулучшающихся систем для планирования и выполнения синтеза.
Доступ к модели
RetroChimera опубликована на GitHub по лицензии MIT и доступна через Microsoft Foundry. Инструкции по работе с контрольной точкой находятся в репозитории GitHub.
Разработчики приглашают химическое сообщество испытать RetroChimera на разных целевых молекулах, чтобы выявить сильные и слабые стороны системы и улучшить её в будущем.
Подробные результаты, включая эксперименты вместе с внешними научными партнёрами, опубликованы в полной статье Nature и сопроводительном материале Microsoft Source.
Читайте также
4 способа устранить выявленные нами сбои у «виртуальной стены» на границе США
SoftBank планирует занять более $11 млрд через рискованные облигации ради доли в OpenAI
Как мы создали первую подробную карту смертей у «виртуальной стены» на границе США
США и Китай запустят диалог по ИИ с механизмом безопасности перед саммитом Трампа и Си
Есть Android-смартфон? Google считает, что вам, скорее всего, захочется ноутбук Googlebook
Популярный космический сайт выдумал инженера NASA и публиковал ИИ-шлак под её именем
США и Китай обсуждают, как уведомлять друг друга об ИИ-угрозах для нацбезопасности
Глава Nvidia: «Шанс, что ИИ уничтожит мир к 2030 году, — 0%»
Команда робототехников школы Folkestone хочет вдохновить новое поколение
Открытый EnvHarness от Google: ИИ-агенты обучаются в средах, меняющихся вместе с ними
Через 40 лет в Австралии смертей будет больше, чем рождений — рост замедлится
Трамп и Си: смогут ли они провести человечество через революцию ИИ? От этого зависит всё
Компании, создающие модели мира, многое держат в секрете
Кольцо Vocci добавляет новый форм-фактор для заметок на встречах
Действительно ли индустрия ИИ готова сбавить темп?
ScrollEd хочет превратить учебники в TikTok
The Guardian: люди по-прежнему необходимы математике, но технокомпании этого не видят
Alibaba: открытая Qwen-Image-2.1 превосходит закрытые модели при 7 млрд параметров
Gander от Tencent стремится не замолкать, работая в фоне
Британский стартап привлёк $20 млн, чтобы воссоздавать концерты с «гиперреалистичными» цифровыми аватарами
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram