Модель возраста мозга решает 6 задач МРТ при Альцгеймере
Семь миллионов замороженных весов, обученных предсказывать возраст человека по снимку мозга, оказались фундаментной моделью для целого спектра задач при болезни Альцгеймера. Причём для каждой новой задачи понадобилось дообучить всего около одного процента параметров, а на данных, которые модель никогда не видела, она сохранила AUC 0.871 без единой итерации обучения.
Работа Резы Раджабли и Луи Коллинза из Монреальского неврологического института (McGill University), опубликованная на arXiv в сентябре 2026 года, бьёт сразу по двум устоявшимся допущениям в медицинской нейровизуализации. Первое: для построения foundation-модели нужен масштаб, десятки миллионов параметров и self-supervised предобучение на огромных корпусах снимков. Второе: перенос на новый датасет обязательно требует дообучения хотя бы классификатора на целевых данных. Авторы показывают, что оба допущения можно обойти.
В чём суть подхода
Модель возраста мозга (brain age model) это нейросеть, обученная предсказывать хронологический возраст человека по структурному МРТ. Разница между предсказанным и реальным возрастом давно используется как маркер патологии, но сама такая модель почти никогда не рассматривалась как самостоятельный источник признаков для других задач. Авторы берут компактную 3D CNN, псевдо-полносверточную резидуальную сеть из шести блоков с 7.18 миллионами параметров, ранее обученную предсказывать возраст на 26 512 снимках UK Biobank и MCSA, и полностью замораживают её веса. Для каждой новой задачи поверх каждого слоя добавляют LoRA-адаптеры (Low-Rank Adaptation) плюс небольшую линейную голову. Всего это даёт 72 249 обучаемых параметров на задачу, то есть примерно один процент от размера базовой модели.
Для сравнения: энкодеры foundation-модели BrainSegFounder содержат от 19 до 27 миллионов параметров, а типичные U-Net для морфометрии около 20 миллионов. Модель из McGill со всеми адаптерами для шести задач весит меньше 7.5 миллиона параметров суммарно.
Шесть экспериментов, один энкодер
Числа здесь важнее слов, поэтому пройдусь по результатам. Первый эксперимент, классификация когнитивно здоровых участников против деменции на когорте ADNI: pooled out-of-fold AUC 0.964 при доверительном интервале 0.947–0.978, сбалансированная точность 0.889, чувствительность 0.842, специфичность 0.935 на 547 участниках. Это уровень лучших специализированных моделей, обученных именно под эту задачу.
Второй эксперимент, и авторы называют его самым важным: ту же самую модель, без какого-либо дообучения, рекалибровки или подгонки, применили к когорте OASIS-3, 1 150 участников, снятых на другом сканере, по другому протоколу, в другом учреждении. Результат: AUC 0.871 (0.844–0.896). Просадка около 0.09 относительно внутренней кросс-валидации честно показывает out-of-distribution разрыв, и именно такие числа в литературе почти не публикуют. Для контекста: foundation-модель BrainFound в работе Mazher и коллег на внешних когортах NACC, OASIS и AIBL без дообучения давала AUC от 0.71 до 0.77.
Третий эксперимент самый элегантный. Выходной логит модели из первого эксперимента, по сути одно число «насколько мозг похож на дементный», объединили с возрастом и когнитивным баллом ADAS-Cog-13, чтобы предсказать, какие пациенты с лёгкими когнитивными нарушениями (MCI) перейдут в деменцию в ближайшие два года. AUC 0.828, сбалансированная точность 0.753. Это статистически неотличимо от опубликованного результата Shafiee и коллег (0.759) на той же когорте, но там использовался трудоёмкий конвейер ручной инженерии признаков SNIPE: сегментация гиппокампа и энторинальной коры для каждого участника, построение библиотек эталонных случаев. Здесь весь вклад от изображения это одно число от модели, которая вообще не видела MCI-пациентов.
Четвёртый эксперимент: предсказание амилоид-позитивности, то есть молекулярной патологии, только по структурному T1w-снимку. AUC 0.804 на 865 участниках. Это верхняя часть опубликованного диапазона для моделей на чистом T1w (в литературе от 0.61 до 0.857), и выше неё только vision transformer, обученный end-to-end специально под эту задачу. Показательно, что в предобучении на возраст нет ничего, что было бы связано с молекулярной патологией: замороженное представление тем не менее содержит структурный сигнал, коррелирующий с амилоидной нагрузкой.
Пятый и шестой эксперименты заменяют сегментационные конвейеры. Модель напрямую, без всякой сегментации, предсказала нормированный на внутричерепной объём объём гиппокампа с R² 0.797 и объём гипоинтенсивностей белого вещества с R² 0.913, на 2 092 участниках. Это задачи, которые классически решают большими U-Net сетями, обученными с нуля. Маленький, анатомически фиксированный гиппокамп и диффузные, разбросанные по мозгу поражения белого вещества восстанавливаются из одного и того же замороженного представления.
Стоит подчеркнуть и сам дизайн валидации, потому что именно он делает цифрам доверие. Данные делились на пять фолдов строго по идентификатору участника, так что снимки одного человека никогда не попадали одновременно в обучение и в тест. Каждый фолд трижды становился тестовым с разными случайными сидами, итого пятнадцать обученных адаптеров на эксперимент, объединяемых мягким голосованием. Все отчётные метрики это агрегаты out-of-fold предсказаний, а не лучший чекпоинт на удачном сплите. Доверительные интервалы посчитаны сабжект-бутстрэпом на пяти тысячах ресемплов, и во всех шести экспериментах распределения метрик узкие и далеко отстоят от случайного уровня.
Почему заморозка работает лучше, чем полный fine-tuning
Здесь авторы опираются на известный, но недооценённый результат Kumar и коллег: полный fine-tuning деформирует предобученные признаки. На десяти датасетах полное дообучение давало примерно на два процента больше точности внутри распределения, но на семь процентов меньше вне его, потому что нижние слои начинают меняться, пока голова ещё не обучена. LoRA снимает эту проблему конструктивно: база не трогается вообще. Бенчмарк 17 параметрически эффективных методов на шести медицинских датасетах подтверждает закономерность: чем меньше целевых данных, тем больше преимущество PEFT-подходов. В нейровизуализации, где размеченная когорта в несколько сотен человек это норма, это преимущество становится решающим.
Есть и более тонкий момент, который авторы вытаскивают из чужих статей. И Dufumier с коллегами, и создатели AnatCL включали в свои работы baseline, обученный с обычной супервизией предсказывать возраст, и в обоих случаях этот baseline работал наравне с предлагаемым контрастивным методом, а местами и лучше. Но ни одна из работ не развивала это наблюдение: age-supervised модель оставалась «контрольной группой» в статьях, написанных ради чего-то другого. Работа из McGill по сути отвечает на вопрос, который поле отказывалось задавать: как далеко можно зайти с простым супервизорным предобучением на возраст, если отнестись к нему всерьёз.
Что это меняет на практике
Ключевой практический аргумент в доступности разметки. Метка «возраст» есть практически у каждого МРТ-снимка в мире, она бесплатна и не требует экспертизы. Диагностические метки, наоборот, дороги, редки и неравномерно распределены по популяциям. Если супервизия на возрасте даёт представление, достаточное для диагностики, прогноза и морфометрии, то порог входа для новой клиники или исследовательской группы резко снижается: не нужен кластер для обучения foundation-модели, достаточно скромного железа и одного процента параметров на задачу.
Второй вывод касается методологии оценки. Авторы предлагают два стандарта, которых полю не хватает. Первый: включать age-supervised модель как baseline в любую работу про brain foundation models, потому что иначе неясно, что именно даёт модное self-supervised предобучение. Второй: публиковать результат на внешней когорте без какой-либо подгонки на целевых данных, потому что именно это число описывает, что получит новая клиника, внедряющая модель, а не цифра из кросс-валидации.
Свежий препринт BrainDINO показывает, как выглядит альтернативный путь и где он уязвим. Это self-supervised модель, предобученная примерно на 6.6 миллионах двумерных срезов из двадцати датасетов, тоже с замороженным энкодером и обновлением лишь 0.6% параметров, с macro-AUC 0.850 на задаче CN против AD внутри ADNI. Но её внешняя оценка на OASIS построена иначе: обучение на 195 участниках и тест на 40 из той же когорты. Работа из McGill применяет неизменённую модель сразу к 1 150 участникам OASIS-3, не подгоняя под этот датасет ничего. Разница в протоколе принципиальна: первое число говорит, чего можно достичь, собрав и разметив новые данные, второе говорит, что получит клиника завтра, без сбора данных вовсе.
Есть и вывод для разработчиков моделей вне медицины. Связка «компактный супервизорный энкодер плюс PEFT-адаптеры» это тот же паттерн, который в NLP давно вытеснил полный fine-tuning для большинства прикладных задач. Нейровизуализация пришла к нему позже, но с более чистой экспериментальной демонстрацией: когда размеченных данных сотни, а не миллионы, экономия на обучаемых параметрах перестаёт быть оптимизацией и становится условием обобщения.
Ограничения, которые авторы признают сами
Гиперпараметры не тюнились вообще: один конфиг (LoRA rank 2, alpha 4.0, learning rate 1e-3) для всех шести экспериментов. Значит, опубликованные числа это консервативная нижняя граница. Все задачи лежат внутри альцгеймеровского континуума, и предобучение на возраст правдоподобно кодирует те же паттерны атрофии, на которые эти задачи опираются. Перенос на опухоли, демиелинизацию или психиатрические расстройства не проверялся. Энкодер предобучался на 26 512 снимков, что больше, чем у конкурентов (3 984 у AnatCL, около 10 000 у Dufumier), поэтому строгое заявление работы звучит так: дело в ёмкости модели и методе адаптации, а не только в объёме данных.
Часто задаваемые вопросы
Что такое модель возраста мозга?
Это нейросеть, обученная предсказывать хронологический возраст человека по структурному МРТ. Так как старение мозга имеет устойчивые структурные паттерны, модель вынуждена выучить богатое представление анатомии, которое затем можно переиспользовать для других задач, например диагностики деменции.
Зачем нужна LoRA, если можно дообучить всю модель?
Полный fine-tuning деформирует предобученные признаки: исследования показывают, что он выигрывает около двух процентов точности внутри распределения, но проигрывает до семи процентов на новых данных. LoRA замораживает базу и добавляет около одного процента обучаемых параметров, что сохраняет обобщающую способность и резко снижает требования к данным и железу.
Можно ли уже применять такую модель в клинике?
Нет, это исследовательская работа, а не медицинское изделие. Результаты получены в кросс-валидации и на одной внешней когорте, без проспективной клинической валидации и регуляторного одобрения. Практическая ценность работы в методологии: она показывает, как строить и честно оценивать переносимые нейровизуализационные модели.
Почему AUC падает с 0.964 до 0.871 на OASIS-3?
Это типичный out-of-distribution разрыв: другой сканер, другой протокол, более молодая и менее отобранная популяция. Важно, что модель при этом не дообучалась на целевых данных вообще, тогда как большинство публикаций такую просадку маскируют, обучая классификатор на целевой когорте.
Итог
Работа из McGill демонстрирует неудобную для индустрии foundation-моделей вещь: компактная модель возраста мозга с LoRA-адаптерами решает шесть разнородных задач по МРТ при Альцгеймере на уровне или выше специализированных решений, требуя один процент параметров на задачу и ни одного примера из целевой когорты для внешней валидации. Если вы строите модели для медицинской визуализации, самый дешёвый следующий шаг это не масштабирование, а честный age-supervised baseline и внешний тест без подгонки. Проверьте свой пайплайн на этих двух пунктах, прежде чем заказывать кластер побольше.