i
ДАТАИСТ
Новости · 2026-08-29

GlucoFM: базовая модель для непрерывного мониторинга глюкозы

Исследователи Google Research представили GlucoFM — лёгкую самообучаемую базовую модель для непрерывного мониторинга глюкозы. Она разделяет медленные изменения уровня сахара и кратковременные отклонения, чтобы строить переносимые представления для оценки риска диабета, инсулинорезистентности, дисфункции бета-клеток и других метаболических состояний. На 14 проверках в четырёх когортах GlucoFM повысила средний PR-AUC на 5,8 процентного пункта относительно лучшей версии GluFormer, обученной на том же наборе данных. В прогнозировании реакции на еду модель также показала минимальную среднюю ошибку.

Обложка: GlucoFM: базовая модель для непрерывного мониторинга глюкозы

Google Research создала модель GlucoFM для анализа глюкозы

Исследователи Google Research представили GlucoFM — лёгкую самообучаемую базовую модель для непрерывного мониторинга глюкозы. Она разделяет медленные изменения уровня сахара и кратковременные отклонения, чтобы строить переносимые представления для оценки риска диабета, инсулинорезистентности, дисфункции бета-клеток и других метаболических состояний. На 14 проверках в четырёх когортах GlucoFM повысила средний PR-AUC на 5,8 процентного пункта относительно лучшей версии GluFormer, обученной на том же наборе данных. В прогнозировании реакции на еду модель также показала минимальную среднюю ошибку.

Потребительские носимые устройства используют датчики движения и физиологических показателей для оценки активности и сна, но лишь косвенно отражают регуляцию глюкозы. Непрерывный мониторинг глюкозы дополняет эти данные: небольшой сенсор под кожей измеряет содержание глюкозы в межклеточной жидкости каждые несколько минут и фиксирует показатели натощак, ночью и после еды.

Интерпретировать такие записи сложно. Клинические метки, необходимые для их расшифровки, часто бывают редкими и дорогими.

Многие существующие базовые модели для непрерывного мониторинга глюкозы, включая CGMformer, GluFormer и CGM-JEPA, обрабатывают сигнал через один поток представлений. При этом данные мониторинга содержат относительно медленные базовые закономерности и кратковременные отклонения, связанные с едой, активностью или артефактами сенсора.

Исследователи Google Research — Ahmed A. Metwally, научный сотрудник, и Zechen Li, исследователь, — создали GlucoFM, чтобы по ежедневным данным мониторинга оценивать риск диабета, инсулинорезистентность и дисфункцию бета-клеток при небольшом количестве размеченных примеров.

Обзорная схема фреймворка GlucoFM с подробным описанием предварительной обработки данных, архитектуры предварительного обучения в стиле JEPA и приложений для клинического прогнозирования

Источник: research.google

GlucoFM использует двухпотоковую архитектуру: один поток выделяет медленные изменения гликемии, другой — кратковременные отклонения. При этом модель сохраняет информацию о времени суток и пропусках в измерениях. Задачи предсказания скрытых представлений помогают ей выучивать ежедневный контекст и временную динамику.

Модель проверили на данных четырёх когорт по семи клиническим задачам: оценке риска диабета, инсулинорезистентности, дисфункции бета-клеток, гиперлипидемии, гипогликемии, ожирению и глюкотипу. Всего исследователи провели 14 оценок «когорта — задача».

Средний PR-AUC GlucoFM оказался на 5,8 процентного пункта выше, чем у лучшего варианта GluFormer, который также предварительно обучали на том же корпусе. По этому показателю GlucoFM лидировала во всех проверках риска диабета и дисфункции бета-клеток, а также в трёх из четырёх проверок инсулинорезистентности.

Отдельно модель испытали в прогнозировании постпрандиальной гликемической реакции — изменения уровня глюкозы после еды. При одинаковых входных данных и протоколах оценки GlucoFM показала минимальную среднюю абсолютную ошибку на двух устройствах непрерывного мониторинга: Dexcom и Libre.

Модель предварительно обучили на 109 066 часах неразмеченных данных мониторинга глюкозы из Wear-CGM и четырёх опубликованных наборов. Всего в обучении использовали 477 записей участников и сессий.

109 066часов неразмеченных данных
477записей участников и сессий
4когорты
7клинических задач

Что такое GlucoFM

Записи непрерывного мониторинга могут содержать пропуски, разные интервалы между измерениями и артефакты сенсора. GlucoFM приводит каждый сигнал к 24-часовой сетке с шагом пять минут и сохраняет маску наблюдений, различая измеренные и отсутствующие значения.

Двухпотоковый кодировщик отделяет низкочастотное состояние, описывающее медленные изменения гликемии, от остаточного потока событий. Второй поток фиксирует кратковременные отклонения, которые могут быть вызваны физиологией, поведением или ошибками измерения.

Вместо восстановления точных исходных значений глюкозы, на которые влияют шум и артефакты сенсора, GlucoFM использует предварительное обучение с предсказанием скрытых представлений и двумя дополнительными задачами.

Для большей реалистичности в обучение добавили преобразования, характерные для записей мониторинга: дрейф базового уровня, резкие провалы, похожие на артефакты сжатия, более редкую частоту измерений и короткие разрывы связи. Так модель сталкивается с пропусками и вариативностью, которые встречаются в реальных данных.

Подробная архитектурная схема модели GlucoFM, отображающая эмбеддинги потоков, трансформерный энкодер и моделирование временной динамики

Источник: research.google

Клинические проверки

GlucoFM оценивали на данных когорт CGMacros, Stanford, Hall и ShanghaiT2DM. Кроме семи клинических задач, исследователи отдельно проверили прогноз двухчасовой постпрандиальной реакции.

Они выясняли, насколько информативны замороженные представления модели для отдельных 24-часовых окон новых участников, помогают ли они учитывать историю при прогнозировании траектории глюкозы после еды, улучшается ли результат при объединении нескольких дней, как представления переносятся между когортами и насколько хорошо адаптируются при нехватке размеченных данных.

Сначала использовали линейное зондирование на уровне окон с разделением участников. Кодировщик каждой модели замораживали, а на отдельных 24-часовых представлениях обучали линейный классификатор. Один и тот же участник не мог попасть одновременно в обучающую и тестовую выборки. Такой подход проверяет, насколько представление одного дня отражает особенности организма нового участника, сохраняя при этом различия между днями.

GlucoFM получила наивысший усреднённый по задачам PR-AUC среди проверенных методов. В 14 оценках средний показатель вырос с 54,7 у лучшей специализированной базовой модели, переобученной на тех же данных, до 58,8 у GlucoFM. Это означает абсолютный прирост на 4,1 пункта, или примерно на 7,5% относительно базовой модели.

Наивысший PR-AUC GlucoFM показала во всех проверках риска диабета и дисфункции бета-клеток, а также в трёх из четырёх проверок инсулинорезистентности.

Радиальная диаграмма линейного пробирования, показывающая, что GlucoFM превосходит четыре базовые модели в шести категориях оценки метаболического здоровья

Источник: research.google

Затем модель проверили на динамической задаче. По данным, доступным до зарегистрированного приёма пищи, она должна была предсказать полную двухчасовую траекторию изменения глюкозы относительно уровня в начале еды.

В исследование вошли 874 связанных с приёмом пищи события от 34 участников. Проверку проводили с разделением участников, а Dexcom и Libre моделировали отдельно при одинаковом разбиении данных.

К замороженному представлению модели постепенно добавляли:

🕐 один час измерений глюкозы перед едой;

🍽️ пищевую ценность приёма пищи — энергию, углеводы, жиры, белки и пищевые волокна;

🧬 данные участника — уровень глюкозы натощак, индекс массы тела и статус диабета.

При полном контексте средняя абсолютная ошибка GlucoFM составила 21,88 мг/дл. У лучшей базовой модели этот показатель был равен 22,90 мг/дл, а у базовой линии со средним значением обучающей выборки — 27,69 мг/дл.

Это указывает на то, что GlucoFM добавляет к текущим измерениям полезный исторический контекст для прогнозирования изменений глюкозы после еды.

Линейный график, демонстрирующий, что GlucoFM достигает наименьшей средней абсолютной ошибки по мере добавления прогрессивных контекстных переменных

Источник: research.google

1Представление модели
2Глюкоза за час до еды
3Питательная ценность еды
4Глюкоза натощак, ИМТ и статус диабета

Одного 24-часового сигнала может быть недостаточно, чтобы описать индивидуальный характер изменений глюкозы. Поэтому исследователи проверили, улучшится ли прогноз на уровне участника при объединении нескольких дней.

GlucoFM кодировала каждый день отдельно, после чего усредняла представления максимум за семь дней. Каждый участник имел одинаковый вес при таком объединении.

Добавление дней улучшало PR-AUC в большинстве сценариев и наборов данных. Прирост составил 9,6 пункта для дисфункции бета-клеток в Stanford и 14,0 пункта для прогноза диабета в Hall. В CGMacros улучшения в основном также были положительными для данных Dexcom, Libre и объединённого сигнала от двух сенсоров.

Главным исключением стала инсулинорезистентность в ShanghaiT2DM: при простом усреднении результат не улучшился. Это показывает, что оптимальный способ объединения данных может зависеть от конкретной задачи. В целом ежедневные замороженные представления GlucoFM можно объединять для усиления прогноза на уровне участника без повторного обучения кодировщика.

Столбчатые диаграммы, отображающие улучшение показателей PR-AUC на нескольких дневных интервалах в шести различных клинических наборах данных

Источник: research.google

Перенос между наборами данных

Далее исследователи проверили, способны ли выученные моделью физиологические закономерности обобщаться на другие когорты. Например, классификатор, обученный распознавать риск диабета по данным одной клинической группы, должен был работать на пациентах из другого исследования.

В 12 проверках переноса между наборами данных GlucoFM показала лучший результат в 11 случаях. Её преимущество над сильнейшим конкурентом составило от 0,5 до 8,6 пункта PR-AUC. В одном случае модель уступила на 0,6 пункта.

Абсолютный PR-AUC GlucoFM находился в диапазоне от 61,6% для обеих задач Stanford → Hall до 90,0% для задачи инсулинорезистентности Hall → CGMacros. Исследователи связывают это с тем, что представления модели могут отбрасывать специфичный для отдельной когорты шум и выделять общие метаболические закономерности.

Столбчатая диаграмма, показывающая процентное улучшение модели в сценариях переноса без обучения между различными наборами данных когорт

Источник: research.google

Размеченные клинические данные дороги, поэтому GlucoFM также проверили в двух сценариях обучения на малом количестве примеров. В первом меняли число размеченных участников в каждом классе, во втором — долю доступных наблюдений для каждого участника.

При любом проверенном объёме данных, включая самые ограниченные сценарии с одним участником на класс и 1% наблюдений, GlucoFM показывала наивысший усреднённый по задачам PR-AUC. Преимущество особенно заметно при небольшом числе размеченных участников.

Две столбчатые диаграммы, иллюстрирующие стабильно более высокие средние показатели PR-AUC у GlucoFM при обучении на небольшом числе примеров по сравнению с конкурирующими моделями

Источник: research.google

Два потока

Исследователи отдельно проверили, влияет ли разделение сигнала на два потока. Полную двухпотоковую архитектуру сравнили с более простыми вариантами: моделью, которая напрямую обрабатывает исходную глюкозу, моделью с акцентом на медленные тренды и моделью с акцентом на быстрые кратковременные отклонения.

Вариант, использующий только поток событий, показал худший результат. Одних кратковременных колебаний оказалось недостаточно для устойчивого описания метаболического состояния. Модели на исходных данных и только на потоке состояния выступили лучше, но полная двухпотоковая версия стабильно занимала первое место.

Результаты поддерживают подход, при котором медленная и быстрая динамика глюкозы сначала организуются в дополнительные потоки, а затем объединяются.

Столбчатая диаграмма, сравнивающая методы ввода и показывающая, что предложенный двухпоточный подход достигает наивысших средних показателей по трём различным метрикам

Источник: research.google

Вывод

По результатам исследования, модели непрерывного мониторинга глюкозы могут выигрывать от явного учёта нескольких масштабов динамики: медленных трендов, кратковременных отклонений, времени суток и пропусков в данных.

Обучаясь на неразмеченных записях, GlucoFM сформировала переносимые представления, которые показали хорошие результаты в задачах прогноза, межкогортного переноса и обучения на малом числе примеров. Это позволяет эффективнее использовать ограниченные размеченные клинические данные.

Метаболические реакции различаются у людей, между когортами и даже между устройствами мониторинга. Кроме того, нынешняя обучающая выборка GlucoFM остаётся небольшой. В дальнейшем исследователи планируют обучать модель на более крупных и разнообразных группах, перейти от независимой обработки 24-часовых окон к нативному моделированию нескольких дней, чтобы отслеживать изменения, разворачивающиеся на протяжении недель и месяцев, а также изучить работу представлений при изменениях в реальном времени.

В исследовании участвовали Zechen Li, Keerthana Natarajan, Weizhi Zhang, Simon A. Lee, Yuwei Zhang, Maxwell A Xu, Menglian Zhou, Zeinab Esmaeilpour, Flora D. Salim из Университета Нового Южного Уэльса, Mark Malhotra, Lindsey Sunden, Shwetak Patel, Yuzhe Yang и Ahmed A. Metwally.

Bobak J. Mortazavi и Ricardo Gutierrez-Osuna из Техасского университета A&M предоставили набор данных CGMacros.

Два исследования Wear-CGM получили одобрение комитета по этике Advarra — IRB Pro00059582 и Pro00069880. Участники дали письменное согласие на обезличенное вторичное исследование и разработку алгоритмов. Опубликованные наборы данных собирались в соответствии с собственными этическими разрешениями и процедурами получения согласия.

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram