i
ДАТАИСТ
Новости · 2026-09-09

AlphaGenome Atlas от DeepMind картирует все возможные изменения ДНК в геноме человека

@neuronium_ai @neuronium_ai

DeepMind предсказала, к чему могут привести примерно девять миллиардов возможных замен одной буквы в человеческом геноме. AlphaGenome Atlas помогает исследователям находить среди огромного числа генетических вариантов те, что связаны с болезнями. Для каждой замены система оценивает влияние на молекулярные процессы в сотнях типов клеток и тканей. Объём набора данных достиг одного петабайта — это более чем в 30 раз больше базы AlphaFold со структурами белков. В одном случае с тяжёлой эпилепсией атлас помог поднять ранее неясный вариант в гене DNM1 на первое место среди кандидатов.

Обложка: AlphaGenome Atlas от DeepMind картирует все возможные изменения ДНК в геноме человека

Геном человека содержит около трёх миллиардов букв ДНК. У каждого человека есть миллионы небольших отличий от эталонной последовательности — обычно это замена одной буквы. Большинство таких вариантов безвредны, но некоторые вызывают заболевания. Определить это непосредственно по последовательности ДНК нельзя, а проверить в лаборатории все варианты практически невозможно: потенциальных замен около девяти миллиардов.

AlphaGenome Atlas заполняет этот пробел прогнозами. Для каждой из девяти миллиардов замен он оценивает, как изменение может повлиять на молекулярные процессы в сотнях типов клеток и тканей. Набор данных занимает один петабайт — более чем в 30 раз больше базы AlphaFold со структурами белков.

9 млрдвозможных замен
1 петабайтобъём набора данных
27 000прогнозов на вариант

Атлас создан на основе модели AlphaGenome, которую представили в 2025 году. Она анализирует участки ДНК длиной в один миллион букв и предсказывает:

насколько активно считывается ген;
могут ли регуляторные белки связываться с ДНК;
как происходит вырезание участков из транскрипта гена.

Раньше модель приходилось запускать отдельно для каждого варианта. Теперь прогнозы рассчитаны заранее. Согласно исследованию, на один вариант в среднем приходится около 27 000 отдельных значений.

Это особенно важно для примерно 98% генома, где нет схем белков. Некодирующие участки работают как переключатели и регуляторы: они определяют, когда и в какой ткани активируется ген. Именно в них находится большинство вариантов, связанных с заболеваниями, а их влияние труднее всего интерпретировать.

Одна цифра для каждой мутации

Тысячи значений для одного варианта неудобны для повседневной работы, поэтому DeepMind создала AlphaGenome Variant Impact Score — AVI. Этот показатель сводит прогнозы к одному числу.

Небольшая нейросеть объединяет данные AlphaGenome с моделью белков AlphaMissense и двумя показателями сохранности участка ДНК на протяжении миллионов лет эволюции. AVI использует 18 входных признаков. Для сравнения, распространённый инструмент CADD — более 150.

Почти ни для одного варианта неизвестно наверняка, вызывает ли он вред. Команда решила проблему косвенным способом: очень редкие варианты в популяции считает, вероятно, вредными, а распространённые — вероятно, безвредными. Вредные мутации реже передаются следующим поколениям и поэтому не получают широкого распространения.

Несмотря на такое непрямое обучение, AVI превзошёл существующие инструменты в тестах на вариантах с уже установленным клиническим статусом, особенно в некодирующих участках. На некоторых задачах другие инструменты показывали лучший результат. Для каждого варианта атлас также показывает, какой процесс повлиял на итоговую оценку: например, изменение вырезания участков транскрипта или работы генетического переключателя.

Случай эпилепсии

Практическую пользу системы показывает случай из консорциума GREGoR, который изучает редкие заболевания без установленной причины. У ребёнка с тяжёлой эпилепсией не было диагноза, хотя ему провели секвенирование генома. AVI поднял вариант в гене DNM1, ранее считавшийся неопределённым, на первое место в списке кандидатов.

Прогнозы AlphaGenome также указали возможный механизм. Вариант создаёт неправильный участок вырезания при обработке транскрипта гена и удлиняет белок на 13 строительных блоков. Однако это происходит только в версии гена, которая считывается исключительно в мозге. Поэтому предыдущий анализ образцов крови ничего не показал.

Лабораторный эксперимент подтвердил прогноз, и исследователи рекомендовали отнести вариант к вероятно вызывающим заболевание. При проверке уже разгаданных случаев консорциума AVI поместил причинный вариант в первые 50 кандидатов в 29,5% случаев. Для CADD этот показатель составил 12,5%.

Больше сигнала среди шума

Атлас должен помочь и популяционным исследованиям. Чтобы понять, влияют ли редкие варианты в определённой области генома, например, на показатель состава крови, нужно анализировать их вместе: каждый отдельный вариант встречается слишком редко для статистически надёжного вывода. Если объединить безвредные варианты с теми, что действительно влияют на признак, полезный сигнал теряется в шуме.

Гарет Хокс из Эксетерского университета использовал атлас, чтобы объединить только те варианты, которым система предсказывала одинаковое действие. Для этого он взял генетические данные более чем 54 000 участников британского биобанка UK Biobank. Такой подход выявил на 22% больше связей между некодирующими вариантами и уровнем белков в крови, чем обычные фильтры.

На основе прогнозов команда также выделила 2 601 повторяющийся короткий мотив ДНК — фактически «слова» генома, к которым присоединяются регуляторные белки.

Исследовательский инструмент

У AlphaGenome есть ограничения. Модель знает не обо всех типах клеток и не учитывает эффекты, возникающие из-за изменения количества других регуляторных белков. DeepMind подчёркивает, что атлас и AVI предназначены для исследований и могут быть только одним из звеньев цепочки доказательств при постановке диагноза.

Атлас доступен для некоммерческого использования через веб-портал, API и в виде навыка в Google Antigravity. Коммерческая версия должна появиться в Google Cloud.

Источник: the-decoder.com

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram