Чтение мыслей по снимкам мозга: ИИ-декодер из Weizmann
Декодер из института Вейцмана смотрит на снимок фМРТ и восстанавливает картинку, которую человек видел в этот момент. Работает и в обратную сторону: по изображению предсказывает активность мозга. Звучит как сюжет фантастики, но за этим стоит инженерная задача, которую команда решала годами.
Что показали в институте Вейцмана
Михаэль Ирани, компьютерный исследователь из института Вейцмана в Реховоте (Израиль), вместе с коллегами собрала инструмент, который по данным фМРТ восстанавливает зрительный образ. В тестах он заметно обошёл предыдущие подходы. Первые попытки такого рода давали мутные пятна, в которых угадывалось что-то общее с оригиналом. Здесь результат другой: по восстановленному кадру видно и объект, и его положение в кадре.
«Чтение мыслей» Ирани называет «милым и броским названием». По сути речь о том, чтобы вытащить из активности мозга структуру и содержание увиденного. Именно это и делают исследователи, которые уже несколько десятилетий работают с фМРТ.
Как работает декодер: структура, содержание и диффузия
Модель состоит из двух ветвей. Первая предсказывает структуру кадра: где какие цвета, как расположены объекты. Вторая отвечает за содержание: что именно изображено, скажем, связка бананов на тарелке. Их предсказания попадают в диффузионную модель, ту самую, что известна по генераторам картинок и видео. Диффузия постепенно очищает шум до правдоподобного изображения, а подсказки декодера задают ей направление.
Обучение началось с открытых данных: восемь человек, каждый просмотрел около 9000 изображений внутри высокопольного сканера. Важная деталь про разрешение. В типичной фМРТ один воксель покрывает примерно три кубических миллиметра, а в кубическом миллиметре около 16 тысяч нейронов. Чем крупнее воксель, тем грубее картинка активности. Команда взяла датасеты с вокселем около одного кубического миллиметра: детализация в разы выше.
Банан на таком снимке перестаёт быть абстрактным «фруктом». Другие модели, по словам Ирани, могут дорисовать банан, но он будет другим: не та форма, не то положение в кадре. Её декодер держится за реальную композицию увиденного.
Тренировка на синтетике: 70% данных, которых не было в сканере
Живых данных не хватало, их сбор упирается в деньги и время. Тогда исследователи обучили ещё одну модель, энкодер, который предсказывает активность мозга по картинке. Дальше энкодер и декодер учат друг друга. Берём, например, фотографию леопарда, энкодер строит предполагаемый отклик мозга, декодер пытается восстановить по нему исходный кадр. Первая попытка похожа на леопарда едва-едва, но повторение цикла вытягивает качество.
Побочный эффект важнее самого трюка: обучаться можно на любых изображениях, даже тех, которые человеку в сканере не показывали. Около 70% обучающих данных команды это картинки без парного снимка фМРТ. Идея снимает главный барьер жанра: раньше всё упиралось в то, сколько дорогих сканирований удалось провести.
Совмещение нескольких исследований дало ещё один результат. Исследователи нашли зоны, которые отвечают за одни и те же вещи у разных людей: одна область реагирует на еду, другая на спорт. Это уже не прикладная реконструкция, а способ проверять гипотезы о том, как мозг раскладывает мир по полочкам.
Час калибровки вместо сорока
Раньше инструменту для нового человека требовалось около 40 часов данных фМРТ, прежде чем он начинал предсказывать зрительные образы. У декодера Вейцмана порог другой: примерно один час. Экономия более чем в сорок раз, и она прямо переводится в деньги. Час работы на сканере стоит от 600 до 1000 долларов, и нейроучёные редко могут позволить себе 40 часов на одного испытуемого.
«Никто из нас не может позволить себе 40 часов визуализации на нового участника», говорит нейроучёный Томми Спраг из Калифорнийского университета в Санта-Барбаре. По его мнению, такие инструменты ускоряют исследования.
Результаты представили на конференции Cognitive Computational Neuroscience в Нью-Йорке в прошлом месяце. Джуди Иллес, нейроэтик из Университета Британской Колумбии, назвала работу «великолепной» и отметила терапевтический потенциал подхода для людей с неврологическими заболеваниями.
Где модель ошибается
Идеальных реконструкций нет. Ирани показала два провала. На одном изображении был торт, а модель собрала стопку из трёх сэндвичей. На другом собака в ванне превратилась в козу похожего окраса, зато в той же ванне. Общее построение кадра удержано, конкретный объект подвёл.
Это честная иллюстрация того, где сейчас граница. Декодер восстанавливает сцену в целом и часто угадывает категорию, но путает похожие объекты. Для медицинских и исследовательских задач такой уровень уже полезен, для юридических или допросных сценариев его явно недостаточно.
ЭЭГ меняет правила игры
Сейчас речь о фМРТ, а это большая машина и неподвижность внутри неё. Добровольно согласиться на такой сеанс несложно, заставить сложно. Спраг напоминает: если бы его спросили о скрытом чтении мыслей десять лет назад, он бы посмеялся. Но команды работают над декодированием сигналов ЭЭГ, а это уже шапочка с электродами, которую в перспективе можно носить.
Марчелло Иенка, нейроучёный и философ из Мюнхенского технического университета, называет переход к ЭЭГ сменой правил игры. Гарнитуру можно откалибровать под конкретного человека, а потом вытягивать из его мозга дополнительную информацию, иногда без явного согласия. Иенка допускает, что однажды суд сочтёт реконструкцию зрительного образа доказательством.
«У меня нет сомнений, что это исследование с добрыми намерениями, но очевидно и то, что его могут приспособить под коммерческое использование с этическими и социальными проблемами», говорит он. Ирани риск при использовании ЭЭГ признаёт. «Я стараюсь думать только о хорошем», отвечает она.
Что это даёт, кроме красивых картинок
Первое применение лежит в медицине. Для людей с синдромом запертого состояния, полностью парализованных, декодер может стать каналом общения: мозговая активность вместо движений. Ещё одно направление это психиатрия. Если модель умеет восстанавливать зрительный опыт, она может показать, как выглядят флешбэки при посттравматическом стрессовом расстройстве, а это уже путь к измерению того, что раньше описывали только словами.
Ирани планирует двигаться дальше картинок: видео, звук, содержимое снов. «Этого у нас пока нет, но мы стремимся», говорит она. Отдельная интрига в том, сможет ли модель восстанавливать не только увиденное, но и воображаемое. Спраг считает, что подход «неплохо сработает» и на образах, которые человек держит в голове, не глядя на них.
Если это подтвердится, применение расширится за пределы лаборатории. Пока модель привязана к тому, на что человек смотрит, её ценность для клиники ограничена задачами восприятия. Как только она начнёт читать внутренние образы, откроется другой слой: работа с памятью, навязчивыми картинками, воображением. Там же начинается и зона самых острых вопросов о том, кому человек доверяет содержимое своей головы.
Почему это не телепатия
Полезно обозначить границы. Декодер читает не мысли вообще, а зрительный опыт в конкретных условиях. Человек должен лежать в сканере и смотреть на изображения, фМРТ-сигнал запаздывает на секунды, потому что отражает приток крови, а не разряд нейронов. Плюс нужны данные калибровки под конкретного человека, пусть и один час вместо сорока.
Из этого набора ограничений следует простой вывод: извлечь пароль или номер карты таким способом нельзя. Модель научена на парах «картинка и отклик», и её вывод это не текст, а визуальная сцена. Даже в лабораторных тестах, где человек смотрит на картинку по заданию, похожие объекты путаются. Именно поэтому нейроучёные говорят о зрительном образе, а не о мыслях в бытовом смысле.
От мутных пятен к узнаваемым сценам
Реконструкция изображений из данных фМРТ занимается не первый год. Ранние эксперименты давали размытые кадры, по которым можно было угадать разве что общий контур и примерную палитру. Сдвиг произошёл с двух сторон одновременно: сканеры научились видеть мельче, а генеративные модели стали собирать правдоподобные изображения из шума.
Разница в детализации здесь решает. Воксель в один кубический миллиметр против трёх это не про красоту картинки, а про то, сколько информации вообще попадает на вход декодеру. Чем грубее сетка, тем меньше деталей остаётся на долю модели: цвет, крупные пятна, направление движения тёмных зон. На высоком разрешении в сигнале уже читается композиция, и тогда диффузионная модель достраивает сцену до узнаваемой. Поэтому главный вклад Вейцмана не в самой диффузии, а в том, как из ограниченного числа дорогих сканов выжать обучающий объём.
Что смотреть дальше
Ближайшая проверка это воспроизведение на новых людях и других сканерах. Команда заявляет универсальность энкодера, а значит должна показать, что часовая калибровка работает не только на участниках, чьи данные участвовали в обучении. Дальше по плану видео, звук и внутренние образы: Ирани прямо говорит, что хочет дойти до реконструкции снов.
Отдельный вопрос, что даст подхода с ЭЭГ. Если декодер из шапочки с электродами покажет хотя бы часть того же качества, разговор о ментальной приватности перейдёт из философского в практический: носимые устройства дешевле томографа, распространены шире, а калибровка под конкретного пользователя там уже встроена в сам продукт.
Часто задаваемые вопросы
Нужна ли операция или импланты, чтобы прочитать мысли?
Нет. Речь о неинвазивной фМРТ: человек лежит в сканере, никаких электродов в мозге нет. Именно поэтому порог входа так низок для исследователей. Дальше исследователи смотрят в сторону ЭЭГ, это шапочка с электродами на голове, но и она не требует операции.
Насколько точно декодер сейчас восстанавливает изображение?
Точнее предыдущих методов, но не идеально. Модель хорошо держит композицию кадра и часто угадывает категорию объекта, а похожие предметы путает: торт превращается в стопку сэндвичей, собака в козу. Для исследований этого достаточно, для доказательств в суде нет.
Может ли кто-то прочитать мои мысли без моего согласия?
Сегодня для этого нужен доступ к фМРТ и неподвижность человека внутри сканера, поэтому сценарий выглядит нереалистично. Риск появится вместе с носимыми ЭЭГ-гарнитурами: если устройство откалибровано под вас, извлекать из него дополнительные данные становится проще. Это и есть главный этический нерв работы.
Итог
Декодер из института Вейцмана показывает, что восстановление зрительного образа по активности мозга перестало быть демонстрацией и превратилось в рабочую методику с понятной ценой вопроса. Экономика важна не меньше точности: час калибровки вместо сорока делает инструмент доступным для лабораторий, где раньше не было бюджета на такие эксперименты. Дальше решается вопрос не инженерный, а общественный: кому и на каких условиях будет доступна расшифровка чужих мыслей.
Следить за развитием этой темы удобнее по нашему разбору энцефалографии на краю: Brain-to-text.