Внутренность несправедливого судьи: как учёные нашли геометрию предвзятости в нейросетях
Вы когда-нибудь задумывались, почему одна и та же ответ получает оценку 8 от одной модели и 4 от другой — хотя содержание не меняется? Может, дело не в «характере» модели, а в чём-то более простом: в том, как ответ оформлен. Новая работа группы исследователей (arXiv, июль 2026) впервые заглянула внутрь нейросети-судьи и показала, что предвзятость — это не абстрактный статистический артефакт. Это конкретное направление в пространстве скрытых состояний, которое можно потрогать, повернуть и даже отключить.
Зачем вообще нужны LLM-судьи
Большие языковые модели всё чаще выполняют роль арбитра. Они оценивают ответы в бенчмарках вроде MMLU и GPQA, сравнивают кандидатов при ранжировании, дают сигнал награды в RLHF — процессе, который делает модели «выровненными» с человеческими предпочтениями. Если судья ошибается, ошибка молча проникает в сами модели, которые на этом сигнале обучаются. Это как если бы экзаменатор ставил оценки не за знание, а за длину ответа или эмоциональный тон — и все студенты подстроились бы под эти критерии.
Предыдущие работы уже документировали поверхностные смещения: модели-судьи сдвигают оценки в ответ на объявленное авторство («этот ответ от GPT-4»), многословность, заявленный консенсус экспертов, эмоциональный тон и метакогнитивные заявления («этот ответ был тщательно проверен»). Но все эти исследования смотрели на вход и выход — что подали и что получили. Что происходит между ними, оставалось чёрным ящиком.
Семь видов предвзятости: от престижа до социального ярлыка
Исследователи сконструировали контролируемые тройки данных: базовый ответ, позитивно модифицированная версия и негативно модифицированная версия. Фактическое содержание и логическая структура оставались идентичными — менялась только «рамка». Семь типов модификаций покрывали весь спектр известных смещений.
Prestige (престиж) — ответ помечался как пришедший от модели с высокой репутацией («GPT-4: …») или от устаревшей («GPT-2: …»). Содержание не менялось ни на байт.
Verbosity (многословность) — в ответ добавлялось несколько пояснительных фраз или, наоборот, убирались несущественные слова. Смысл тот же, длина другая.
Bandwagon (эффект толпы) — к ответу приписывалось «92% рецензентов нашли это полезным» или «87% рецензентов нашли это бесполезным».
Authority (авторитет) — в текст вставлялась академическая ссылка и библиографическое описание или, наоборот, маркер «[цитата нужна]» с замечанием об отсутствии доказательств.
Sentiment (эмоциональный тон) — ответ переписывался в более объективном и научном стиле или, наоборот, с субъективными и эмоциональными выражениями.
Refinement (статус обработки) — добавлялось «этот ответ был тщательно пересмотрен и профессионально отредактирован» или «это сырой вывод ИИ без человеческой проверки».
Diversity (социальная идентичность) — указывалось, что ответ предоставлен человеком из позитивно или негативно воспринимаемой социальной группы.
Эксперимент охватил 4 500 вопросов из девяти бенчмарков (GSM8K, MMLU, TruthfulQA, CommonsenseQA, PubMedQA, GPQA, ARC-Challenge, SocialMaze, BBQ), шесть моделей-источников для базовых ответов и семь моделей-судей — от GPT-4.1 и GPT-4o-Mini до Llama-3.1-8B, Qwen3-14B, Gemma-3-12B и DeepSeek-V3. Суммарно более 63 000 оценок. Человеческая валидация (коэффициент Каппа = 0.73) подтвердила, что модификации действительно не меняют качество ответа — только рамку.
Асимметрия: негатив бьёт сильнее, чем позитив хвалит
Первый крупный результат — асимметричная реакция. Негативные модификации стабильно снижали оценки: Cohen's d от −0.35 до −0.65 у всех семи судей, p < 10⁻³. Позитивные модификации в совокупности давали околонулевой эффект. Но «околонулевой» — это не «равномерно нулевой». Разбор по типам показал, что Refinement++ (метка «тщательно пересмотрен») действительно раздувает оценки, а Bandwagon++ и Diversity++ ведут себя парадоксально — направление смещения меняется на противоположное.
Содержательно судьи ведут себя так, словно «заякорены» на некотором дефолтном балле и гораздо охотнее штрафуют за плохое оформление, чем награждают за хорошее. Это аналог негативного смещения из когнитивной психологии, только теперь локализованный внутри модели. Базовая средняя оценка при строгом режиме (без chain-of-thought) составляла около 5.5, при мягком — около 8.5, но паттерн асимметрии сохранялся в обоих режимах.
Геометрия предвзятости: направление в скрытом пространстве
Второй и главный результат работы — представление. Исследователи извлекали скрытые состояния последнего токена на каждом слое декодера и строили пространство активаций. Базовые ответы формировали компактный многомерный кластер. Смещённые ответы смещались в другую область — и это смещение было типоспецифичным и низкоразмерным.
Проще говоря, для каждого типа предвзятости существует конкретное направление в пространстве скрытых состояний, вдоль которого модель «сдвигается», когда видит триггер. Это направление становится чётким по мере прохождения сигнала через слои — в ранних слоях смещение размыто, к последним слоям оно кристаллизуется в практически одномерный вектор.
Это не корреляция. Это геометрическая структура — устойчивая, воспроизводимая, одинаковая по форме у трёх разных открытых моделей (Llama-3.1-8B, Qwen3-14B, Gemma-3-12B). И она независима от домена вопроса: смещение, вызванное «GPT-4:» на математической задаче, живёт в том же подпространстве, что и смещение, вызванное тем же триггером на вопросе по медицине.
Каузальный контроль: предвзятость можно включать и выключать
Самый впечатляющий результат — двунаправленное управление. Если взять чистый (базовый) вход и искусственно сдвинуть его скрытое состояние вдоль найденного вектора предвзятости, модель начинает оценивать ответ так, как если бы тот был смещён — хотя никакого триггера во входе нет. А если взять смещённый вход и вычесть из его скрытого состояния тот же вектор, оценка возвращается к базовой.
Это не артефакт нормы: контрольные направления случайной ориентации той же длины давали эффект на порядок меньше. Это не подмена: переключение между типами предвзятости (вычесть вектор Verbosity, прибавить вектор Sentiment) тоже работает — модель меняет один тип смещения на другой. Двунаправленный контроль на одном и том же векторе подтверждает: найденное подпространство — это достаточный интервенционный инструмент для предвзятого скоринга, а не пассивный коррелят.
По сути, исследователи доказали, что предвзятость LLM-судьи — это манипулируемая внутренняя переменная. Её можно включать, выключать и переключать между типами, не меняя ни слово во входе.
Кросс-доменное предсказание: AUC 0.82 на невиданных бенчмарках
Практическое применение найденной геометрии — предиктор деградации судьи. Линейная проекция активаций на векторы предвзятости обучалась на шести бенчмарках и тестировалась на трёх удержанных (SocialMaze, BBQ, GPQA). Результат: AUC 0.82 для предсказания того, где судья даст смещённую оценку. Текстовый базовый классификатор, работающий только с входным текстом, показал AUC около 0.63 — существенный разрыв.
Это значит, что внутренние состояния модели заранее знают, когда судья собирался быть несправедливым — ещё до того, как это отразилось в выходной оценке. И это знание переносится на домены, которые модель не видела при обучении предиктора. На практике такой предиктор мог бы работать как «детектор несправедливости» в пайплайнах оценки — флагировать случаи, где оценка судьи потенциально смещена, и отправлять их на перепроверку.
Что это значит для RLHF и бенчмарков
RLHF — процесс выравнивания моделей по человеческим предпочтениям — критически зависит от качества оценок. Если LLM-судья систематически занижает баллы за краткие, но точные ответы (многословность--) или завышает за ответы с академическими ссылками (authority++), то и обучаемая модель подстраивается под эти искажения. Получается петля: предвзятый судья обучает предвзятую модель, которая потом сама становится судьёй — и усиливает те же смещения.
Бенчмарки тоже страдают. Таблица результатов из статьи показывает, что предвзятость взаимодействует с доменом — одни типы смещения сильнее проявляются на математических задачах, другие на вопросах о социальных ситуациях. Это значит, что «чистый» бенчмарк без модификаций не гарантирует справедливость — даже нейтрально оформленные ответы могут быть оценены неровно в зависимости от предметной области.
Открытие геометрической природы предвзятости открывает путь к методам защиты на уровне активаций, а не на уровне промптов. Вместо того чтобы просить модель «не быть предвзятой» (что работает плохо), можно напрямую нейтрализовать направление смещения в скрытом состоянии — так же, как это делали исследователи в обратную сторону.
Три вещи, которые стоит запомнить
Во-первых, предвзятость LLM-судей — это не случайный шум и не «характер модели». Это конкретная, локализуемая геометрическая структура в пространстве скрытых состояний, которая стабилизируется по мере прохождения сигнала через слои трансформера.
Во-вторых, этой структурой можно управлять каузально — сдвигать активации вдоль найденного направления, чтобы включать или выключать предвзятость, не меняя входного текста. Эффект на порядок превосходит случайные направления той же нормы.
В-третьих, та же геометрия переносится на невиданные домены — линейный предиктор на основе найденных векторов достигает AUC 0.82 на бенчмарках, которых не было в обучающей выборке. Это практический инструмент для мониторинга справедливости оценок в реальных пайплайнах.
Часто задаваемые вопросы
Можно ли применить эти методы для «починки» коммерческих моделей вроде GPT-4.1?
Напрямую — нет, потому что для механистического анализа нужны открытые веса, чтобы извлекать скрытые состояния на каждом слое. Но косвенно — да. Знание о том, какие поверхностные триггеры вызывают смещение (престиж, многословность, эффект толпы), позволяет конструировать промпты, нейтрализующие эти эффекты. А для открытых моделей (Llama, Qwen, Gemma) интервенция на уровне активаций — это уже работающая техника.
Почему негативные модификации влияют сильнее позитивных?
Исследователи интерпретируют это как аналог негативного смещения из когнитивной психологии: системы оценки «заякорены» на дефолтном балле и охотнее штрафуют за плохое оформление, чем награждают за хорошее. Геометрически это выражается в том, что отрицательные направления смещения чётче отделены от базового кластера, чем положительные.
Семь типов предвзятости — это все возможные?
Нет, это канонические типы, описанные в предыдущей литературе, и авторы сознательно воспроизводят их для сравнимости. Существуют и другие — например, self-preference (модель предпочитает ответы, сгенерированные ею же), position bias (в A/B-тестах первый вариант получает больше), recency bias. Методология статьи применима к любому типу, где можно сконструировать контролируемые пары «то же содержание — другая рамка».
Итог
Работа «Inside the Unfair Judge» превращает дискуссию о предвзятости LLM-судей из эмпирического каталога симптомов в инженерную задачу. Когда предвзятость — это конкретное направление в пространстве активаций, её можно детектировать, измерять и нейтрализовать. Это не решает проблему целиком — остаются вопросы о том, как масштабировать интервенции на проприетарные модели и как комбинировать множественные смещения — но переводит разговор из плоскости «модели несправедливы» в плоскость «вот механизм несправедливости, вот инструмент для его отключения». Для всех, кто строит системы оценки на базе LLM, это практический ориентир: начинайте с геометрии, а не с промптов.