От текста к видео
Когда врач общается с пациентом, консультация состоит не только из сказанных слов. Специалист наблюдает за походкой, замечает признаки дискомфорта, оценивает дыхание и объясняет, как выполнить физические действия во время осмотра. Эти зрительные и слуховые сигналы постоянно объединяются с устной историей болезни и помогают ставить диагноз, выстраивать доверие и поддерживать клинический диалог.
Системы ИИ, способные рассуждать о клинических случаях и вести диалог, могут расширить доступ к медицинской экспертизе. В ранних исследованиях Articulate Medical Intelligence Explorer, или AMIE, показала результаты уровня врачей в текстовом диагностическом диалоге и помогала клиницистам составлять дифференциальный диагноз. Позже систему научили работать не только с постановкой диагноза, но и с лечением и длительным ведением заболеваний.
AMIE также проверяли в задачах уровня специалистов по онкологии, кардиологии и офтальмологии, а ещё — в мультимодальном рассуждении по изображениям и клиническим документам. Эти испытания проходили в имитационных условиях с актёрами пациентов. Параллельно Google начала переносить результаты исследований в клиническую практику: разработала систему контроля со стороны врачей, провела исследование реализуемости вместе с Beth Israel Deaconess Medical Center и запустила общенациональное рандомизированное исследование совместно с Included Health.
Текстовый интерфейс при этом отбрасывает зрительную и слуховую составляющие медицинской практики. Пациенту приходится описывать сложные физические симптомы словами, из-за чего теряется диагностическая информация, а людям с низкой цифровой или медицинской грамотностью может быть сложнее объяснить своё состояние. Текстовые системы также не могут самостоятельно наблюдать за визуальными и слуховыми признаками или проводить пациента через физические действия, которые помогают уточнить дифференциальный диагноз.
В исследовании «На пути к медицинскому ИИ экспертного уровня для видеоконсультаций в реальном времени» Google представила AMIE в конфигурации для видеосвязи — AMIE (Video). Система, построенная на Gemini и Project Astra, проводит синхронные клинические видеоконсультации, замечает невербальные признаки, направляет актёров пациентов во время виртуального осмотра и одновременно рассуждает над диагнозом. В многоуровневом рандомизированном исследовании с 100 сценариями, 300 консультациями и группой из 30 сертифицированных врачей общей практики это стало первой проверкой ИИ-системы с результатами уровня специалистов в клинических видеоконсультациях в реальном времени.
Во время видеоконсультации системе нужно отвечать с естественной скоростью, параллельно проводить клиническое рассуждение и непрерывно обрабатывать зрительный и слуховой потоки. Один агент пока не может одновременно выполнять все эти задачи: глубокое рассуждение требует времени, а паузы в разговоре снижают доверие и нарушают контакт с пациентом.
Для решения проблемы AMIE (Video) использует асинхронную мультиагентную архитектуру. Работа разделена между тремя специализированными агентами, которые непрерывно действуют параллельно.
Такое разделение позволяет системе сохранять естественную задержку в разговоре и одновременно выполнять диагностическое рассуждение и аудиовизуальное восприятие, которые иначе могли бы привести к неприемлемым паузам. Автоматические проверки показали, что каждый из трёх агентов вносит вклад в улучшение клинических показателей — полноты сбора анамнеза, качества рассуждения и рекомендаций по лечению, — а также характеристик диалога, включая ориентированное на пациента общение и задержку ответа.
Как проходило исследование
При создании медицинского ИИ, работающего с аудио и видео, нужно оценивать его восприятие и рассуждение в большом масштабе. Для этого исследователи вывели из медицинской литературы таксономию аудиовизуальных клинических компетенций, важных для телемедицины. Она охватывает невербальные зрительные признаки, слуховые сигналы и действия во время физического осмотра. На этой основе разработали автоматический набор проверок.
Система объединила точечные однократные аудиовизуальные тесты и многоходовые имитационные аудиоконсультации. Первые проверяли отдельные навыки восприятия и рассуждения — например, способность определить сторону тела или распознать признаки дыхательной недостаточности. Вторые оценивали весь разговор целиком, добавляя зрительные признаки в виде текстовых описаний. Например, в сценарии с пациентом с болезнью Паркинсона симулятор мог передать фразу о том, что пациент показывает в камеру лист бумаги с очень мелким и тесным почерком. Эти проверки помогли быстро менять архитектуру системы и подробно описать способности и ошибки AMIE (Video) до участия людей в оценке.
Чтобы проверить клиническую компетентность в более реалистичной консультации от начала до конца, исследователи провели крупное рандомизированное исследование по формату объективного структурированного клинического экзамена (OSCE) с синхронным интерфейсом видеоконсультации.
В исследование вошли 100 клинических сценариев по пяти системам организма:
Пятнадцать обученных актёров пациентов провели 300 стандартизированных консультаций в трёх исследовательских группах. Все консультации оценивала независимая комиссия из 20 опытных врачей общей практики. Эксперты использовали утверждённые клинические шкалы общей компетентности и подробные критерии, составленные отдельно для каждого сценария.
Результаты
По основным клиническим компетенциям AMIE (Video) получила от экспертов оценки на уровне врачей общей практики. Это касается полноты сбора анамнеза, точности диагноза, уместности тактики ведения и качества общения. По тем же параметрам система также не уступила AMIE (Text) и в некоторых случаях превзошла её.
При наблюдении за физическими признаками и проведении осмотра AMIE (Video) в среднем получила значительно более высокие оценки, чем врачи общей практики и AMIE (Text). Система чаще выявляла физические признаки и сама направляла актёров пациентов во время виртуальных осмотров. Преимущество отразилось и в оценках восприятия и осмотра, привязанных к отдельным клиническим сценариям.
Актёры пациентов в целом предпочли видеоконсультации. Синхронный видеоинтерфейс они назвали значительно более удобным и эффективным для описания проблем со здоровьем по сравнению с текстовой перепиской. По эмпатии, установлению контакта и уверенности в оказываемой помощи AMIE (Video) также получила более благоприятные оценки, чем врачи общей практики и AMIE (Text).
Ограничения
Исследование полностью проходило в имитационной клинической среде с профессиональными актёрами пациентов, а не с людьми, обратившимися по поводу собственных заболеваний. Даже хорошо подготовленные актёры не могут полностью воспроизвести сложность и непредсказуемость реальных медицинских встреч. Кроме того, сценарии ограничивались состояниями, которые можно достоверно сыграть, поэтому в них не вошли важные клинические случаи, где аудиовизуальное восприятие особенно сильно влияет на диагностику.
Дополнительные автоматические проверки выявили отдельные ошибки восприятия и рассуждения, хотя в целом система поддерживала качественный разговор и часто ставила правильный диагноз. У AMIE (Video) также время от времени возникают технические сбои, нарушающие естественность диалога. Из-за прототипного характера Project Astra часть таких вопросов может решаться на уровне всей системы, а не конкретного медицинского применения.
До выводов о практической пользе AMIE необходимо проверить результаты на реальных пациентах и настоящих клинических состояниях.
Следующие исследования
Работа показывает, что переход от текстового к аудиовизуальному медицинскому ИИ возможен при качестве уровня специалистов. AMIE (Video) учитывает особенности настоящей клинической практики: наблюдает за невербальными признаками, направляет физический осмотр и ведёт естественный разговор голосом, приближаясь к формату телемедицинской видеоконсультации.
Перед внедрением в реальную практику систему нужно проверить на реальных пациентах, расширить набор клинических случаев за пределы тех, что можно разыграть, и дополнить её надёжными механизмами безопасности. Google уже начала эту работу: исследование реализуемости с Beth Israel Deaconess Medical Center дало первые данные о безопасности и пользе текстовой AMIE в клинической практике, а продолжающееся общенациональное рандомизированное исследование с Included Health проверяет применение ИИ в реальной виртуальной медицине.
Исследователи рассчитывают, что эти проекты помогут определить, как безопасно встроить аудиовизуальные способности в клиническую практику. Работа выполнена совместно командами Google Research и Google DeepMind.
Авторы исследования: Махвиш Нагда, Джихён Ли, Мэттью Томпсон, Си Джей Парк, Тим Стротер, Валентин Льевен, Рома Рупарел, Акшай Гоэл, Тея Бергамаски, Сухана Беди, Мит Шах, Павел Дубов, Ливиу Панайт, Тосиюки Фукузава, Сэм Шмидгалл, Крейг Шифф, Джозеф Сюй, Алия Рысбек, Яна Лунтс, Ян Фрейберг, Ребекка Хеменуэй, Санни Вирмани, Дэвид Рац, Кэри Ридбо, Жоэль Барраль, Кави Гоэл, Дейл Р. Уэбстер, Кэтрин Чоу, Авинатан Хассидим, Йосси Матиас, Джеймс Маньика, Грегори Уэйн, Тао Ту, Юнь Лю, Итан Го, Кристина Чэнь, Рютаро Танно и Кэмерон Чэнь.
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram