i
ДАТАИСТ
Новости · 2026-09-03

Перенос обучения для геномного прогнозирования в недопредставленных популяциях

@neuronium_ai @neuronium_ai

Исследователи Google Research проверили, как улучшить прогноз генетических рисков для недопредставленных популяций. Они перенесли модели, обученные на данных европейцев из UK Biobank, на почти 200 тысяч участников японского Biobank Japan и сравнили результаты для восьми клинических признаков. Европейские данные повышают точность, когда японская выборка мала, но после примерно 15 000 участников начинают снижать её. Порог зависит от признака: для генетически сходных между популяциями характеристик польза внешних данных сохраняется дольше, а для липидов и глюкозы исчезает раньше. Модели PRS-CSx требуют ещё больших выборок, тогда как метаанализ помогает при небольшом числе локальных данных.

Обложка: Перенос обучения для геномного прогнозирования в недопредставленных популяциях

Данные для сравнения

Полигенные риск-скоры (PRS) используют генетические варианты для оценки вероятности заболевания. Обычно в них учитывается влияние от сотен до миллионов вариантов.

В клинической практике такие оценки применяются ограниченно. Одна из причин — исторически исследования полногеномных ассоциаций (GWAS) в основном проводились на европейских группах. При переносе результатов на неевропейские популяции точность заметно падает из-за различий в генетической архитектуре признаков, структуре популяций и частотах вариантов.

Проводить новые GWAS на сотнях тысяч человек дорого для большинства систем здравоохранения. Поэтому возможный подход — взять крупные GWAS европейцев и дополнить их результатами, полученными для целевой популяции.

Исследователи изучили, как меняется переносимость PRS при разном размере европейской и целевой выборок. В качестве европейского источника использовали UK Biobank (UKB), где собраны данные сотен тысяч участников. Целевой популяцией стали участники Biobank Japan (BBJ) — почти 200 тысяч японцев с подробными генетическими и медицинскими данными.

Для экспериментов выбрали восемь признаков, измеренных в обеих базах:

индекс массы тела (BMI);
систолическое артериальное давление;
диастолическое артериальное давление;
количество эритроцитов;
количество лейкоцитов;
холестерин липопротеинов высокой плотности (HDL);
холестерин липопротеинов низкой плотности (LDL);
уровень глюкозы в крови.

В UKB доля вариативности признаков, объясняемая измеренными генетическими вариантами, оценивалась в диапазоне от 0,07 до 0,28.

Для систематического сравнения авторы использовали две крупные базы с генетическими и фенотипическими данными и проводили эксперименты с уменьшением размера выборок. Во всех случаях качество PRS проверяли на одном и том же отложенном наборе участников BBJ.

Блок-схема, показывающая три модели геномного прогнозирования — ElasticNet, Meta-Analysis и PRS-CSx — с использованием наборов данных BBJ и UKB

Блок-схема, показывающая три модели геномного прогнозирования — ElasticNet, Meta-Analysis и PRS-CSx — с использованием наборов данных BBJ и UKB

Источник: research.google

В работе сравнили три подхода:

обучение модели Elastic Net на вариантах, найденных в крупном европейском GWAS;
метаанализ, объединяющий результаты европейского и японского GWAS, с последующим обучением Elastic Net;
PRS-CSx, который объединяет модели, построенные для разных популяций.

Качество оценивали по корреляции Пирсона между прогнозами и наблюдаемыми значениями признаков.

Когда европейские данные помогают

Европейская выборка давала полезную базовую точку, если данных для целевой популяции было мало или не было вовсе. Но при размере японской выборки от 15 000 человек модели, обученные только на данных BBJ, начинали работать лучше.

Авторы связывают это с тем, что добавление европейских участников ограничивает прирост точности, который даёт увеличение японской выборки.

Таблица с размерами выборок в наборах данных UKB и BBJ для восьми физических и гематологических признаков

Таблица с размерами выборок в наборах данных UKB и BBJ для восьми физических и гематологических признаков

Источник: research.google

Для холестерина HDL исследователи построили кривую, показывающую, как меняется точность при разных размерах выборок BBJ и UKB. После переходной точки примерно в 15 000 японских участников добавление более 5 000 европейских участников уже ухудшало прогноз по сравнению с обучением только на данных целевой популяции.

Небольшая выборка BBJпомогают данные UKB
Более 15 000 участников BBJдополнительные данные UKB могут снижать точность

Такая закономерность проявилась у всех исследованных признаков. При очень маленькой целевой выборке, например в 5 000 человек, объединение с европейскими данными даёт прирост точности. По мере роста выборки BBJ польза от данных другой популяции уменьшается.

Переходная точка зависит от конкретного признака. Чтобы оценить степень «общности генетики», авторы использовали генетическую корреляцию одного и того же признака между двумя популяциями.

Для признаков с высокой генетической корреляцией польза европейских данных сохранялась дольше. При таких характеристиках, как BMI, объединение с UKB могло оставаться полезным до выборок BBJ размером 25–40 тысяч и более, пока обучение только на данных японцев не достигало сопоставимой точности.

Линейный график, показывающий улучшение корреляции прогнозирования HDL и пересечение значений по мере увеличения размеров выборок BBJ и UKB

Линейный график, показывающий улучшение корреляции прогнозирования HDL и пересечение значений по мере увеличения размеров выборок BBJ и UKB

Источник: research.google

Когда размер выборки BBJ превышал 40 000 человек, оптимальный размер европейской выборки UKB начинал уменьшаться по сравнению с максимальным доступным.

Иная картина наблюдалась для липидов — HDL и LDL — и уровня глюкозы в крови. Для них переходная точка наступала при меньшем числе участников BBJ, а оптимальный объём данных UKB также был меньше. Эти признаки сильнее зависят от популяции, поэтому европейские данные хуже соответствуют японской выборке.

Метаанализ и PRS-CSx

В первых экспериментах в модель включали только варианты, найденные в европейском UKB. Поэтому из анализа выпадали варианты, связанные с признаками исключительно у участников BBJ.

Чтобы учесть такие варианты, авторы добавили два метода. Сначала они проводили GWAS для каждой подвыборки BBJ. Затем первый метод объединял полный GWAS из UKB с GWAS соответствующего размера из BBJ, чтобы найти подходящие варианты, после чего на них обучалась модель Elastic Net.

Второй метод использовал PRS-CSx для объединения сводных статистик двух GWAS.

При разных размерах выборки BBJ методы показывали неодинаковую динамику. Для генетически сходных признаков влияние метаанализа было небольшим: в небольших японских выборках ему не хватало статистической мощности.

Для популяционно-специфичных признаков, прежде всего HDL и LDL, а в меньшей степени — глюкозы, метаанализ заметно превосходил поиск вариантов только в одной популяции.

Основной прирост точности возникал за счёт изменения набора вариантов, подаваемых в Elastic Net. При размере выборки BBJ до 10 000 человек добавление европейских участников немного улучшало прогноз. В более крупных выборках BBJ такого улучшения уже не наблюдалось.

PRS-CSx теоретически должен быть менее чувствителен к различиям между генетически общими и популяционно-специфичными признаками, поскольку динамически меняет вклад моделей для разных популяций. Однако на практике этому методу требовалось больше данных.

При размере целевой выборки менее 25 000 человек PRS-CSx уступал самой точной модели Elastic Net для всех признаков, кроме BMI. Когда выборка приближалась к 100 000 участников, PRS-CSx сравнивался с лучшей моделью или превосходил её для всех признаков, кроме уровня глюкозы в крови.

Восемь линейных графиков, сравнивающих корреляцию Пирсона для трёх прогностических моделей при различных размерах выборок признаков

Восемь линейных графиков, сравнивающих корреляцию Пирсона для трёх прогностических моделей при различных размерах выборок признаков

Источник: research.google

Вывод

Эксперименты показали, что крупная внешняя выборка не всегда улучшает прогноз полигенного риска для недопредставленных популяций. Данные европейцев из UK Biobank давали прирост точности при размере японской выборки менее 15 000 человек, но при дальнейшем росте BBJ могли снижать точность.

Для генетически сходных признаков, например BMI, польза объединения сохранялась до более крупных выборок. Для липидов и глюкозы она исчезала раньше.

PRS-CSx начинал превосходить более простые подходы только при значительном объёме данных целевой популяции. Метаанализ, напротив, давал заметный эффект для популяционно-специфичных признаков уже при небольших выборках.

Авторы считают, что повышение точности прогнозов для разных популяций потребует расширения локальных биобанков и выбора метода с учётом конкретного признака и размера доступной выборки.

В исследовании участвовали Biobank Japan, RIKEN и The Institute of Medical Science The University of Tokyo. Google Research также поблагодарила Бабака Бехсаза, Эндрю Кэрролла, Фархада Хормоздиари и Тэдонга Юна, а также Хироки Каяму и Джо Ледсама за институциональную поддержку и Майкла Бреннера и Кэтрин Чоу за поддержку руководства.

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram