SPEX: интерпретируемость LLM на масштабе тысяч компонентов
Модифицированную задачу о вагонетке, где моральной неоднозначности нет и правильный ответ очевиден, GPT-4o mini решает правильно только в 8% случаев. Стандартный SHAP показывает: виновато слово «вагонетка». Заменяешь его на «трамвай» или «дрезину», и модель ошибается с той же частотой. Исследователи из Berkeley применили свой метод SPEX и увидели совсем другую картину: предсказание ломает не одно слово, а синергия четырёх, два упоминания вагонетки плюс «тянет» и «рычаг». Замена всех четырёх слов на синонимы свела частоту ошибок почти к нулю. Этот эксперимент из свежего поста BAIR Blog хорошо показывает, почему интерпретируемость, которая смотрит только на отдельные компоненты, слепа к тому, как модель рассуждает на самом деле.
Что такое SPEX
SPEX (Spectral Explainer) и его младший брат ProxySPEX это алгоритмы поиска влиятельных взаимодействий внутри нейросетей, разработанные командой BAIR и опубликованные на ICML 2025 и NeurIPS 2025. Они отвечают на вопрос: какие комбинации признаков, обучающих примеров или компонентов модели совместно определяют конкретное предсказание. В отличие от методов атрибуции, которые оценивают каждый элемент по отдельности, SPEX находит именно связки, и делает это на масштабе тысяч компонентов, где прежние методы справлялись с десятками.
Почему это вообще сложно? Поведение LLM почти никогда не результат работы одного нейрона, одного слова или одного примера из датасета. Оно emergent-но: возникает из зависимостей между множеством элементов. Но количество возможных взаимодействий растёт экспоненциально. Для входа из тысячи токенов число кандидатов на «влиятельную комбинацию» превышает любые вычислительные бюджеты. Перебрать все пары ещё куда ни шло, все тройки уже нереально, а ведь важные взаимодействия могут быть и четвёртого, и пятого порядка.
Атрибуция через абляцию: общая рамка
Команда Berkeley описывает три линзы, через которые исследователи смотрят на модели. Feature attribution выясняет, какие части входа двигают предсказание: маскируем куски промпта и смотрим, как смещается выход. Data attribution связывает поведение модели с обучающими примерами: переобучаем на подмножествах данных и измеряем, что меняется на тестовой точке. Механистическая интерпретируемость вмешивается в forward pass и убирает вклад отдельных слоёв или attention-голов. Во всех трёх случаях принцип один: убрать компонент, измерить разницу, сделать вывод о влиянии.
Проблема в цене измерения. Каждая абляция это либо дорогой инференс, либо переобучение модели. Поэтому центральный вопрос методологии звучит так: как вычислить атрибуции за минимальное число абляций, не потеряв при этом взаимодействия, которые и составляют суть поведения модели.
Два структурных наблюдения, которые всё меняют
Главный трюк SPEX в том, что он не пытается победить экспоненту в лоб. Авторы заметили: хотя полное число взаимодействий запретительно велико, число действительно влиятельных мало. Это формализуется через два свойства. Разреженность: лишь немногие комбинации реально двигают выход модели. Низкая степень: влиятельные взаимодействия обычно включают лишь небольшое подмножество признаков, а не сотни сразу.
Если принять эти два свойства, задача поиска превращается в хорошо изученную проблему sparse recovery, восстановление разреженного сигнала. Тут SPEX берёт на вооружение инструменты из обработки сигналов и теории кодирования. Вместо того чтобы проверять кандидатов по одному, алгоритм выполняет стратегически выбранные абляции, каждая из которых «упаковывает» множество кандидатных взаимодействий в один измеренный сигнал. Затем эффективный декодер распутывает суммарные сигналы и выделяет конкретные комбинации, ответственные за поведение. По сути, это тот же трюк, что позволяет восстановить сигнал из горстки измерений в compressed sensing, только применённый к атрибуции.
ProxySPEX добавляет третье структурное наблюдение: иерархичность. Если важно взаимодействие высокого порядка, то его подмножества меньшего порядка, скорее всего, тоже важны. Это позволяет искать снизу вверх и отсекать целые ветви дерева кандидатов. Результат: качество SPEX примерно в 10 раз меньшим числом абляций. На практике это разница между «посчитать за ночь на одной машине» и «нужен кластер на неделю».
Почему маржинальные методы слепнут в принципе
Стоит понять механику провала, потому что она объясняет, когда SPEX незаменим, а когда хватит и простых инструментов. Маржинальная атрибуция усредняет вклад признака по множеству контекстов. Если признак работает только в паре с другим, его усреднённый вклад размывается: в половине контекстов он критичен, в половине безразличен, итог выглядит скромно. Эффект разбавления особенно жесток к взаимодействиям высоких порядков: чем больше участников комбинации, тем меньше доля контекстов, где они собрались все вместе, и тем сильнее занижается оценка каждого по отдельности. Задача о вагонетке это демонстрирует в чистом виде: четыре слова поодиночке казались почти безвредными.
Есть и обратная сторона. Если поведение модели в вашей задаче действительно аддитивно, ранние слои из эксперимента Berkeley тому пример, то маржинальные методы дешевле и их оценок достаточно. SPEX нужен там, где логика модели комбинаторна: многошаговое рассуждение, RAG с синтезом нескольких документов, отрицания и двойные отрицания, идиомы, моральные дилеммы с зависимыми условиями. Как раз те места, где ошибки дороже всего.
Задача о вагонетке: где SHAP сдаётся
Вернёмся к эксперименту с trolley problem, потому что он самый наглядный. Исследователи убрали из классической дилеммы моральную неоднозначность так, что ответ «True» стал объективно верным. GPT-4o mini всё равно отвечал правильно лишь в 8% случаев. Стандартная атрибуция через SHAP указала на отдельные вхождения слова «trolley» как главный фактор ошибки. Логичная проверка, заменить «trolley» на «tram» или «streetcar», почти ничего не изменила.
SPEX выявил доминирующую синергию высокого порядка между четырьмя словами: двумя вхождениями «trolley», а также «pulling» и «lever». Именно эта четвёрка якорила модель на неправильный ответ, что хорошо согласуется с человеческой интуицией о ядре дилеммы: вагонетка, рычаг, действие. Когда все четыре слова заменили синонимами одновременно, частота ошибок упала почти до нуля. По отдельности каждое слово выглядело почти безобидно, вместе они ломали рассуждение. Это и есть та слепая зона маржинальных методов: они оценивают вклад каждого признака в изоляции и принципиально не видят комбинаторных эффектов.
Сравнение по метрике faithfulness (насколько точно восстановленные атрибуции предсказывают выход модели на новых абляциях) показывает похожую картину. На коротких входах SPEX совпадает по качеству с лучшими интеракционными методами Faith-Shap и Faith-Banzhaf. Но при росте контекста до тысяч признаков те перестают быть вычислимыми, а SPEX сохраняет точность. Маржинальные подходы вроде LIME и Banzhaf на таком масштабе работать умеют, но их faithfulness заметно ниже именно потому, что они игнорируют взаимодействия.
Атрибуция данных: синергии и избыточности в датасете
Второе применение, ProxySPEX на ResNet, обученной на CIFAR-10, показывает, что взаимодействия между обучающими примерами бывают двух разных типов, и путать их вредно. Синергетические взаимодействия это комбинации семантически разных примеров, которые вместе формируют границу решения, недоступную ни одному из них по отдельности. Для сложного тестового изображения автомобиля синергию образовали: спорткар с низким шасси, кубический жёлтый грузовик и красный фургон с горизонтальной полосой. Каждый вносил свой визуальный признак, и только вместе они давали правильную классификацию.
Избыточные взаимодействия работают иначе: это визуальные дубликаты, которые многократно усиливают один концепт. Классический пример из статьи: предсказание «лошадь» сильно зависело от кластера изображений собак с похожими силуэтами. Такой анализ открывает прямой путь к новым методам селекции данных: сохранять синергии, без которых границы решений рассыпаются, и безопасно вычищать избыточности, которые лишь раздувают датасет и закрепляют ложные корреляции. Для всех, кто занимается дата-центричным ИИ, это практический инструмент, а не академическое любопытство.
Attention-головы: прунинг, который улучшает модель
Третья линза, механистическая интерпретируемость, дала, пожалуй, самый контринтуитивный результат. На задаче MMLU (highschool us history) команда применила ProxySPEX для поиска взаимодействий между attention-головами и использовала результат для прунинга. Стратегия удаления голов, выбранных через ProxySPEX, не просто обошла конкурирующие методы: она улучшила качество модели на целевой задаче. Прунинг, который повышает accuracy, звучит как оксюморон, но логика понятна: если метод точно знает, какие головы работают на задачу, а какие добавляют шум, удаление шума помогает.
Попутно выяснилась содержательная деталь о структуре вычислений. В ранних слоях модель работает в почти линейном режиме: головы вносят вклад независимо друг от друга. В поздних слоях картина меняется, взаимодействия между головами становятся значимыми, и большая часть вклада приходится на взаимодействия внутри одного слоя. Для исследователей схем это подсказка, где искать «коллективное поведение» компонентов, а где достаточно поэлементного анализа.
Почему это важно сейчас
Интерпретируемость давно упиралась в неудобный выбор: либо точные интеракционные методы на игрушечных масштабах, либо масштабируемые маржинальные методы, которые не видят главного. SPEX с ProxySPEX впервые показывают, что разреженность, низкая степень и иерархичность, три свойства, эмпирически присущие реальным моделям, позволяют получить оба преимущества сразу. Диапазон применений накрывает весь жизненный цикл модели: аудит промптов на длинных контекстах, чистка датасетов, архитектурные вмешательства.
Практический бонус: код обоих алгоритмов уже интегрирован в популярный репозиторий SHAP-IQ, так что попробовать их на своей модели можно без переписывания пайплайна с нуля. Авторы также указывают направление, которое выглядит особенно интересным: проверка методов поиска взаимодействий против существующих научных знаний в геномике и материаловедении, где интеракции изучались задолго до нейросетей. Это могло бы одновременно валидировать методы и порождать новые проверяемые гипотезы для науки.
Часто задаваемые вопросы
Чем SPEX отличается от SHAP?
SHAP в стандартном виде оценивает вклад каждого признака отдельно и не видит комбинаторных эффектов. SPEX специально ищет взаимодействия, используя разреженность и низкую степень как структурные предпосылки, и остаётся точным на входах с тысячами признаков, где интеракционные версии SHAP вычислительно невозможны.
Нужен ли доступ к весам модели?
Зависит от линзы. Для feature attribution достаточно API: метод маскирует вход и измеряет сдвиг предсказаний. Data attribution требует переобучения на подмножествах данных. Атрибуция компонентов вроде attention-голов требует доступа к forward pass, то есть открытых весов.
Где взять код?
Оба алгоритма интегрированы в открытый репозиторий SHAP-IQ на GitHub. Статьи опубликованы на OpenReview: SPEX на ICML 2025, ProxySPEX на NeurIPS 2025.
Итог
SPEX и ProxySPEX переносят интерпретируемость из режима «смотрим на отдельные детали» в режим «смотрим на связи между деталями», и делают это на масштабах, реальных для современных LLM. Задача о вагонетке с её 8% правильных ответов и четырьмя словами-виновниками это лучшая иллюстрация: самое важное в поведении модели происходит между компонентами, а не внутри них. Если вы аудируете промпты, чистите датасеты или режете attention-головы, загляните в SHAP-IQ и проверьте, не прячется ли поведение вашей модели в синергии, которую маржинальные методы не увидят никогда.