i
ДАТАИСТ
Обзор · 2026-07-01

Как ИИ научился читать мысли без имплантов

Обложка: Как ИИ научился читать мысли без имплантов

Когда мозг уже пишет текст, а руки нам больше не нужны

Идея “читать мысли” обычно звучит как что-то из фантастики. Но у этой фантастики есть очень практическая цель: помочь людям, которые не могут говорить или двигаться, снова общаться с миром. Сегодня лучшие интерфейсы мозг—компьютер умеют довольно неплохо превращать нейронную активность в текст или речь. Проблема в том, что почти все по-настоящему сильные системы инвазивные. То есть требуют операции на мозге.

Новая работа Meta и академических партнеров предлагает другой путь. Исследователи показали, что текст можно декодировать из активности мозга без операции — по сигналам ЭЭГ и МЭГ, пока человек печатает запомненное предложение на клавиатуре. Их модель называется Brain2Qwerty. И это один из самых сильных результатов для неинвазивного декодирования именно порождения текста, а не просто распознавания простых команд или реакций на стимулы.

Важно сразу не завышать ожидания. Это не устройство, которое уже сегодня “читает мысли” у пациента в реальном времени. Но это очень заметный шаг. Разрыв между инвазивными и неинвазивными системами все еще большой, однако он стал меньше.

Что именно сделали исследователи

Эксперимент был устроен довольно изящно. Участникам — всего их было 35 — показывали короткие предложения по словам на экране. Потом предложение исчезало. После небольшой паузы человек должен был напечатать его по памяти на клавиатуре, почти без зрительной обратной связи. В этот момент исследователи записывали активность мозга с помощью ЭЭГ или МЭГ.

Почему такой сценарий интересен? Потому что он ближе к реальному порождению языка, чем типичные задачи интерфейсов мозг—компьютер. Тут человек не просто воображает движение рукой и не выбирает буквы глазами в медленном меню. Он вспоминает фразу, удерживает ее в памяти, планирует печать и нажимает клавиши. То есть в сигнале смешиваются и моторика, и языковые процессы, и контроль ошибок.

Схема эксперимента и архитектуры Brain2Qwerty: от сигналов ЭЭГ/МЭГ к тексту через сверточный блок, трансформер и языковую модель.

Сама система состоит из трех частей.

Первая — сверточный модуль. Он берет короткие окна сигнала мозга длиной 500 миллисекунд вокруг каждого нажатия клавиши и пытается извлечь полезные признаки.

Вторая — трансформер. Он смотрит уже не на отдельную клавишу в вакууме, а на целое предложение. Это важно: в реальном языке соседние символы и слова помогают друг другу. Если модель сомневается между несколькими буквами, контекст часто подсказывает правильный вариант.

Третья часть — отдельная языковая модель символьного уровня. Она исправляет результат, используя статистику языка. Грубо говоря, если нейросеть выдала что-то шумное, а рядом есть более правдоподобная последовательность символов, языковая модель может подтолкнуть ответ в правильную сторону.

Качество измеряли через частоту символьных ошибок: сколько вставок, удалений и замен нужно, чтобы превратить предсказанный текст в правильный.

Почему это важно

Главный смысл работы не в красивом трюке, а в клинической перспективе. Сегодня лучшие нейропротезы общения обычно строятся на имплантах. Они дают отличный сигнал, но требуют нейрохирургии, а значит несут риски: инфекция, кровоизлияние, деградация импланта со временем.

Неинвазивные подходы безопаснее, но до сих пор слишком сильно уступали по качеству. Особенно если речь не о выборе одного из нескольких вариантов, а о свободном тексте. Поэтому вопрос звучал так: можно ли вообще приблизить неинвазивные системы к чему-то полезному, если взять хорошие датчики и современные модели?

Эта статья отвечает: да, можно. Пока не до уровня имплантов, но уже далеко не на уровне старых ЭЭГ-спеллеров.

Есть и второй важный момент. Работа показывает, что декодировать можно не только восприятие речи или текста, но и активное порождение. Это намного интереснее для будущих средств общения.

Главные результаты: МЭГ сильно лучше ЭЭГ

Самая яркая цифра статьи — разница между МЭГ и ЭЭГ.

В среднем Brain2Qwerty получил:

для МЭГ — 32% символьных ошибок;
для ЭЭГ — 67% символьных ошибок.

Разница огромная. По сути, МЭГ оказался примерно вдвое полезнее для этой задачи. У лучших участников результат на МЭГ доходил до 19% ошибок. Это уже уровень, на котором часть предложений декодируется очень хорошо, иногда вообще без ошибок.

Сравнение качества декодирования: МЭГ заметно обгоняет ЭЭГ, а полная версия Brain2Qwerty — базовые модели и упрощенные варианты.

Прежде чем запускать большую модель, авторы проверили более простой вопрос: видно ли в сигнале мозга хоть что-то, связанное с печатью? Да, видно. Даже линейные классификаторы могли различать, нажата клавиша левой или правой рукой, а также угадывать символ заметно лучше случайного уровня. И здесь МЭГ снова выигрывал.

Потом исследователи сравнили Brain2Qwerty с базовыми моделями — линейной моделью и EEGNet, популярной архитектурой для интерфейсов мозг—компьютер. Новая система обошла обе. Причем не слегка, а уверенно. Особенно на МЭГ.

Еще интереснее — разбор по частям. Если оставить только сверточный модуль, уже получается лучше, чем у базовых систем. Если добавить трансформер, качество растет еще. Если сверху подключить языковую модель, становится лучше еще раз. Это хороший признак: архитектура не случайная, каждая ее часть реально приносит пользу.

Что модель на самом деле декодирует

Самый тонкий вопрос в таких работах: что именно читает модель из мозга? Собственно язык? Движение пальцев? Память? Смесь всего сразу?

Авторы аккуратно показывают, что очень многое завязано на моторный компонент. Если модель ошибается, она часто путает буквы, которые физически расположены рядом на клавиатуре. Чем ближе клавиши, тем чаще путаница между ними.

Ошибки модели связаны с раскладкой клавиатуры: близкие клавиши путаются чаще, а опечатки человека ухудшают декодирование.

Это важный результат. Он говорит, что система в значительной степени опирается на мозговые сигналы, связанные с движениями при печати. То есть пока это скорее “мозг в процессе набора текста”, чем прямое чтение абстрактной языковой мысли.

Но картина не сводится только к моторике. Исследователи посмотрели на опечатки. Когда человек ошибался при наборе, интервалы между нажатиями заметно увеличивались — типичный признак колебания или внутреннего контроля ошибок. И в такие моменты качество декодирования падало. Это логично: если моторная программа выполнена нечетко, по мозгу ее тоже труднее восстановить.

В то же время языковая модель иногда умела исправлять даже реальные опечатки участника. То есть система не просто копирует нажатые клавиши, а использует знание структуры языка, чтобы восстановить более правдоподобный текст.

Где модель сильна, а где пока спотыкается

Авторы подробно разобрали, от чего зависит качество.

Частые слова декодируются лучше редких. Частые символы — лучше редких. Например, редкие для испанского буквы вроде “k” или “w” распознаются заметно хуже. Это неудивительно: модели банально не хватает примеров.

Качество зависит от типа и частоты слов и символов, а также заметно улучшается с ростом объема обучающих данных.

Еще один ожидаемый, но важный вывод: чем больше данных для обучения, тем ниже ошибка. Для таких систем это почти всегда главный ресурс. Исследователи записывали примерно по часу данных на человека, и уже этого хватило для заметного результата. Но статья ясно показывает: если данных станет больше, качество должно расти дальше.

Есть и приятный момент: система иногда справлялась со словами, которых не было в обучении. Да, хуже, чем со знакомыми. Но сам факт важен. Значит, модель не просто запоминает набор готовых фраз, а действительно учится работать на уровне символов и последовательностей.

На уровне конкретных предложений разброс между участниками большой. У лучших — почти чистые фразы. У худших — текст может сильно расползаться. Это тоже типично для нейродекодирования: качество сигнала и индивидуальные различия пока играют огромную роль.

Ограничения, о которых нельзя забывать

Работа сильная, но до готового продукта еще далеко.

Во-первых, система не работает в реальном времени. Трансформер и языковая модель обрабатывают предложение целиком, уже после завершения набора. Кроме того, входные окна привязаны к моментам нажатия клавиш. В настоящем интерфейсе для пациента нужно уметь декодировать непрерывный поток и сразу.

Во-вторых, все эксперименты сделаны на здоровых участниках, которые реально печатали на клавиатуре. Это важное ограничение. Для полностью парализованного человека такой сценарий не подходит. Значит, в будущем придется либо переходить к воображаемой печати, либо строить модели, которые хорошо переносятся между людьми и требуют минимум персональной калибровки.

В-третьих, лучший сигнал здесь дает МЭГ. А МЭГ сегодня — это не носимое устройство, а большая и дорогая лабораторная система. Для клиники и тем более дома это неудобно. В статье, правда, есть разумный мостик в будущее: новые датчики МЭГ на оптически накачиваемых магнитометрах могут со временем сделать такие системы компактнее и практичнее.

И наконец, даже лучший результат здесь все еще хуже, чем у инвазивных систем. Для сравнения: у имплантов уже есть работы с очень высокой скоростью и гораздо меньшей ошибкой. Так что это не замена, а скорее новый класс компромисса между безопасностью и качеством.

Что в итоге

Brain2Qwerty — это не магическое “чтение мыслей”, а очень конкретный инженерный шаг вперед. Исследователи показали, что неинвазивное декодирование текста из мозговой активности может быть содержательным, масштабируемым и удивительно сильным, если сочетать хороший сигнал, аккуратно поставленный эксперимент и современную архитектуру модели.

Главный вывод простой: МЭГ плюс глубокое обучение уже позволяют восстанавливать предложения из активности мозга заметно лучше, чем многие ожидали. Ошибок еще много. До реального общения пациентов в живом режиме еще далеко. Но направление стало гораздо серьезнее.

Если смотреть шире, эта работа хороша именно своей приземленностью. Авторы не обещают телепатию. Они честно показывают: вот где система сильна, вот где она упирается в моторику, вот что мешает переносу в клинику. И именно поэтому результат выглядит убедительно.

Для области интерфейсов мозг—компьютер это важный сигнал. Похоже, безопасные системы общения без операции больше не выглядят как вечная мечта. Теперь это уже инженерная задача. Сложная, дорогая, местами сырая — но вполне реальная.

ИИ-обзоры простыми словами

Каждый день читаем свежие статьи по ИИ и пересказываем главное человеческим языком — без хайпа и воды. Если хотите понимать, куда движутся ИИ-агенты раньше остальных, — подписывайтесь.

Новые обзоры — каждый день

В Telegram