Мультимодальные нейроны: что OpenAI нашла внутри CLIP

Мультимодальные нейроны: что OpenAI нашла внутри CLIP

В 2005 году журнал Nature опубликовал статью о нейронах, которые срабатывают на конкретных людей. Одна клетка в мозге пациентов отзывалась на фотографии Дженнифер Энистон, другая на Холли Берри, причём неважно, что именно показывали человеку: снимок, рисунок или просто набранное текстом имя актрисы. Нейроны реагировали на концепт, а не на картинку.

Через шестнадцать лет команда интерпретируемости OpenAI нашла такие же клетки в искусственной нейросети. В CLIP, модели, которая учится связывать изображения с подписями, обнаружился нейрон Дональда Трампа: он срабатывает на фотографии, карикатуры, рисунки и надпись «Make America Great Again». Есть нейроны эмоций, регионов мира и отдельных слов. Работа вышла в Distill в марте 2021 года, и её выводы до сих пор остаются одной из самых наглядных демонстраций того, что именно выучивают большие модели.

Что такое мультимодальные нейроны

Мультимодальными нейронами называют клетки, которые реагируют на один смысл в любой форме подачи. Человеку достаточно услышать имя Дженнифер Энистон, увидеть её фото или прочитать подпись, чтобы узнать актрису, и нейрон ведёт себя так же. В CLIP такие клетки нашлись на зрительной стороне модели, но реагируют они и на текст, нарисованный прямо в изображении.

От «бабушкиных нейронов» из старых нейрофизиологических споров их отличает ассоциативная природа: авторы описывают такие клетки как карту ассоциаций, где сам объект только самая высокая вершина. Это визуальная версия тематических признаков, которые лингвисты находят в векторных представлениях слов.

Как искали нейроны

CLIP состоит из двух частей: зрительной (ResNet) и языковой (трансформер). Обе обучали на парах «картинка плюс подпись» с контрастивной функцией потерь, поэтому модель вынуждена строить общее пространство смыслов для изображений и текста. Исследователи работали со средней по размеру моделью RN50-x4.

Для поиска использовали три инструмента: визуализацию признаков, примеры из датасета, которые сильнее всего активируют нейрон, и слова, отрисованные в виде картинок. Из случайной выборки в 50 нейронов последнего свёрточного слоя 76% оказались интерпретируемыми (доверительный интервал от 64% до 88%), ещё 18% были полисемантичными, но с понятными гранями, и лишь 6% не поддались объяснению.

Люди: нейрон Дональда Трампа

Самое известное семейство, это нейроны конкретных людей. В каждом проверенном CLIP нашёлся нейрон Трампа: он сильнее всего реагирует на портреты и карикатуры в любых техниках, слабее на соратников вроде Майка Пенса и Стива Бэннона, а также на символику кампании. Зато максимально подавляется на Эминема, Ники Минаж, игру Fortnite, Мартина Лютера Кинга и радужные флаги.

Кроме Трампа в модели нашлись нейроны Иисуса Христа, Человека-паука (он «знает», что под маской Питер Паркер) и Гитлера. Набор таких клеток случаен, но связан с частотой персонажа в обучающих данных и силой эмоциональной реакции на него. Данные собирали в 2019 году, и авторы замечают: будь датасет собран в 2016-м, вероятно, существовал бы и нейрон Хиллари Клинтон.

Важная деталь: у большинства людей выделенного нейрона нет, их образ собирается из комбинации клеток. А сам нейрон устроен как ландшафт ассоциаций, где человек только самая высокая вершина: рядом с ним слабее активируются связанные люди и символы.

Эмоции: ревность как сумма признаков

Эмоциям модель выделяет десятки нейронов. Они реагируют и на мимику, и на слова: нейрон радости отзывается на улыбки и слово «joy», нейрон удивления срабатывает даже когда лицо почти скрыто, а на сленг вроде «OMG» и «WTF», нейрон творчества оживает на художественных мастерских. Есть и нейрон, который авторы называют нейроном психических расстройств: он отзывается на слова «depression», «anxiety», «therapy» и «psycho», а сильнее всего подавляется на спорт, фитнес и музыкальные события.

Слов для эмоций в английском куда больше, чем нейронов у модели, поэтому сложные чувства собираются из простых как сумма или разность векторов. Ревность собирается как успех плюс ворчливость, скука как расслабленность плюс ворчливость, интимность как мягкая улыбка плюс сердце минус болезнь, а удивление как праздник плюс шок. Такие уравнения авторы проверили: усиливали нужный нейрон и убеждались, что логит соответствующего слова растёт.

Если сжать получившуюся карту эмоций до двух факторов, получаются классические оси валентности и возбуждения из психологии. Семь факторов почти воспроизводят базовые категории вроде радости, удивления, грусти и страха, но с одной заменой: место отвращения занимает категория привязанности со словами «valued», «loving» и «lonely».

Среди тревожных находок: в векторе эмоции «accepted» (принятый) сильнее всего выделяется нейрон ЛГБТ-символики, «confident» (уверенный) опирается на признак лишнего веса, «pressured» (под давлением) на азиатскую культуру. Это ложные корреляции из обучающих данных, и они напрямую влияют на то, как модель описывает людей на фотографиях.

Регионы мира и скрытые предубеждения

Отдельное семейство образуют региональные нейроны. Они реагируют на названия стран и городов, архитектуру, национальную одежду, животных, лица типичной внешности и местную письменность. Покажите модели карту мира без подписей, и нейрон Австралии подсветит нужный континент, сильнее всего в районе узнаваемых географических ориентиров.

Регионы выстроены в иерархию: от целых полушарий до отдельных штатов. Примерно 4% нейронов связаны с географией, а у части остальных она влияет на активации вторично: нейрон предпринимательства тяготеет к Калифорнии, нейрон холода к Арктике.

Африке, которая занимает около 20% суши и 15% населения планеты, досталось лишь около 4% региональных нейронов, зато модель различает внутри континента три региона, а не один. У нейрона Восточной Африки обнаружился слом режима: сильные активации дают флаги и названия стран, а средние, которые встречаются куда чаще, работают на этничность. Авторы честно признают, что их культурных знаний не хватило для понимания разницы между тремя африканскими нейронами, зато модель в одном из экспериментов сама «рассказала» о южноафриканском сериале Imbewu: это слово появилось в визуализации нейрона.

Предубеждения тоже на месте. Нейрон «терроризм/ислам» реагирует на слова «Terrorism», «Attack» и «Muslim», а в образных эмбеддингах сходство слова «Terrorist» со словом «Muslims» достигает 0,52, максимума среди слов без корня «terror». Нейрон «нелегальной иммиграции» указывает на страны Латинской Америки. Это те же смещения, что находили в векторных представлениях слов, только теперь их видно на уровне отдельных клеток.

Как модель хранит слова

Из зрительной части CLIP можно достать подобие словных эмбеддингов: слово рисуют на картинке, прогоняют через модель и вычитают среднюю активацию по десяти тысячам слов. Соседи в таком пространстве семантически близки, и даже арифметика работает: «King» минус «Man» плюс «Woman» даёт «Queen», если замаскировать нейроны буквенных сочетаний вроде детектора «-ing».

Мультиязычность у модели ограниченная: нейрон позитива отзывается на английское «Thank You», французское «Merci», немецкое «Danke» и испанское «Gracias», но с нелатинскими письменностями смыслы не связываются, хотя арабский или китайский текст модель распознаёт как таковой.

Полисемантичность тоже никуда не ушла, и у неё есть забавная грань. Некоторые нейроны отвечают на пары понятий, связанных поверхностным совпадением: Филадельфия, Филиппины и имя Филип, или Christmas и Ass, или актёр и велоцираптор с общим слогом «tor». Авторы называют такие признаки сросшимися и связывают их с гипотезой суперпозиции, где нейронов меньше, чем понятий, поэтому модели приходится упаковывать концепты плотно.

Иерархия понятий возникает сама

Отдельный сюрприз ждал авторов в задаче ImageNet. Они взяли разреженную линейную модель поверх нейронов CLIP, где на каждый класс приходится в среднем три нейрона, и получили скромные 56,4% точности в топ-5. Зато устройство этой модели оказалось осмысленным: нейроны сами выстроились в подобие таксономии WordNet, где лабрадор это собака, собака это млекопитающее, млекопитающее это животное. Иерархию никто не размечал вручную, и на ImageNet CLIP вообще не обучали.

Авторы делают осторожный, но сильный вывод: склонность к иерархиям может быть универсальным свойством обучающихся систем, а не особенностью конкретной архитектуры. Тот же порядок виден в региональных нейронах: мир, полушарие, страна, побережье.

Типографические атаки: подпись, которая обманывает модель

Практическое следствие из всей этой многомодальности неприятное. Если нейрон яблока реагирует на слово «apple», значит, надпись на предмете может перебить его внешний вид. Так и вышло: яблоко с приклеенной этикеткой «iPod» модель классифицирует как плеер. Авторы прочесали все названия классов ImageNet и нашли десятки работающих подписей: «rifle», «pizza», «shark», «library» и другие.

В отличие от классических состязательных примеров, здесь не нужно ничего вычислять: хватит ручки, маркера и немного фантазии. В автоматизированном тесте лучшие атаки достигали 97% успеха, изменив около 7% пикселей изображения. Авторы отдельно отмечают, что такая атака доступна любому, включая шестилетнего ребёнка, а устойчивость моделей к ней почти никто не проверял.

Параллель с человеком тоже нашлась, и это эффект Струпа: людям сложнее назвать цвет, если слово написано несогласующимся цветом. CLIP в похожем тесте не умеет замедлиться и просто чаще ошибается.

Почему это важно сегодня

Работа 2021 года объясняет и возможности, и уязвимости современных мультимодальных моделей. Внутри них есть понятная структура: концепты, их ассоциации, иерархии и смещения из данных. Интерпретируемость даёт инструменты, чтобы эту структуру читать: визуализацию признаков, анализ активаций, условные вероятности по уровням срабатывания. Если вы строите продукт на мультимодальной модели, эти методы помогают заранее находить и предвзятости, и странные уязвимости вроде типографических атак.

Часто задаваемые вопросы

Что такое мультимодальные нейроны простыми словами?

Это нейроны, которые реагируют на один смысл в разной форме: на фото, рисунок и написанное слово. Человеческий мозг хранит так образы знакомых людей, а CLIP выучил похожие клетки для знаменитостей, эмоций и целых регионов мира.

Чем опасны типографические атаки?

Достаточно подписать предмет от руки, чтобы модель ошиблась: яблоко с надписью «iPod» она принимает за плеер. Лучшие атаки срабатывают в 97% случаев, меняя около 7% пикселей. Повторить их может кто угодно, никаких специальных знаний не нужно.

Почему статья Distill до сих пор актуальна?

Мультимодальные модели лежат в основе современных ИИ-продуктов, а вопросы их интерпретируемости стали только острее. Работа показывает, что внутри модели есть понятные человеку концепты, и даёт конкретные методы их поиска, от визуализации признаков до условных вероятностей по активациям.

Итог

Мультимодальные нейроны показывают, что большая модель строит внутреннюю карту понятий, отчасти похожую на человеческую: с людьми, эмоциями, регионами и иерархиями. Эта карта объясняет и впечатляющие обобщения CLIP, и уязвимости вроде надписи, ломающей классификацию. Понимать её устройство значит уметь проверять модели на предвзятость и хрупкость до того, как они попадут в продукт.

Оригинальная статья «Multimodal Neurons in Artificial Neural Networks» доступна на Distill, а продолжить разбираться в интерпретируемости можно с нашими материалами про SPEX и графовые нейросети из той же серии Distill.

← Все записи