Статистическая согласованность LLM: модель нарушает закон полной вероятности
Когда вы спрашиваете LLM «каков процент X среди всех Y?», вы ожидаете, что ответ будет согласован с ответами на более узкие вопросы. Если модель знает долю X среди женщин и долю X среди мужчин, то加权 по размеру подгрупп должно давать ту же долю, что и прямой вопрос про «всех Y». Это не сложная математика — это закон полной вероятности, которому учат на первом курсе статистики. Но фронтальные языковые модели с ним систематически не справляются.
Исследование «Partition, Prompt, Aggregate» (arXiv, июль 2026) показало, что state-of-the-art модели нарушают базовые вероятностные тождества при агрегации оценок по подгруппам. Хуже того: обнаружен эффект, который авторы назвали макро-фоллаком — реконструкция общей статистики через детальную декомпозицию оказывается точнее, чем прямой ответ модели о целом.
Суть эксперимента: проверка на вшивость без эталона
Авторы построили элегантный протокол проверки. Берут популяцию (например, «все работники США»), рекурсивно делят её по бинарному дереву на всё более мелкие подгруппы — по полу, возрасту, образованию, региону. Затем промптят LLM двумя способами: (1) прямая оценка для всей популяции и (2) оценка для каждой подгруппы с последующим взвешенным агрегированием обратно в общую цифру.
Если модель действительно понимает распределение, оба пути должны сходиться. Это не вопрос точности — вопрос внутренней согласованности. Не нужно знать правильный ответ, чтобы проверить, не противоречит ли модель сама себе.
Исследователи протестировали несколько фронтальных моделей на различных задачах: демографические распределения, медицинские статистики, экономические показатели. Результат — масштабные нарушения базовых свойств согласованности. Разброс между «прямой оценкой целого» и «агрегатом оценок частей» достигает десятков процентных пунктов.
Макро-фоллак: целое хуже суммы частей
Самый контринтуитивный вывод — то, что авторы назвали macro fallacy. Когда модель отвечает на вопросы о мелких подгруппах (например, «доля курящих среди женщин 25–34 лет с высшим образованием на Среднем Западе»), а потом эти ответы агрегируются с весами, итоговая оценка оказывается ближе к реальным данным, чем когда модель напрямую отвечают «какова доля курящих среди всех взрослых американцев?».
Это парадоксально. Казалось бы, прямой вопрос о всей популяции — более простая задача: не нужно удерживать в голове десятки подгрупп, не нужно знать их пропорции. Но модель, декомпозировав задачу на части, даёт более точный ответ.
Авторы интерпретируют это так: релевантное знание у модели есть — она знает факты о конкретных демографических ячейках. Но при прямом вопросе о популяции это знание не надёжно извлекается. Модель не умеет «мысленно интегрировать» то, что знает о частях, в корректную оценку целого.
Эффект устойчив к вариациям структуры дерева, задачам и моделям. Частично его можно ослабить через имплицитный промптинг — когда модель просят явно рассуждать о подгруппах перед финальным ответом, — но полностью не убрать.
Почему это важно для промпт-инжиниринга
Для практиков это означает несколько конкретных вещей.
Декомпозиция — не просто приём структурирования, а способ повысить точность. Разбивая вопрос «какая доля X в популяции Y?» на подвопросы по сегментам и агрегируя вручную, вы получаете ответ, который с большей вероятностью будет корректен. Это работает именно потому, что модель лучше знает конкретные подгруппы, чем абстрактные агрегаты.
Прямые запросы о «среднем по больнице» — источник скрытых ошибок. Когда вы спрашиваете «какова средняя зарплата программистов в России?» — модель даёт число, которое выглядит уверенным, но может систематически отклоняться от истинного. И вы не узнаете, насколько сильно, потому что эталона под рукой нет. А вот если спросить отдельно про Москву, СПб, регионы — и посчитать взвешенное среднее — результат будет надёжнее.
Агрегация — слабое место архитектуры. Трансформер обрабатывает промпт целиком через внимание. Когда запрос касается абстрактной популяции, модели нужно одновременно удерживать множество факторов (демография, география, временные тренды) и неявно их взвешивать. Это не то, для чего self-attention оптимален — он лучше работает с конкретными локальными зависимостями, чем с глобальной статистической интеграцией.
Конкретные примеры нарушения согласованности
Чтобы понять масштаб проблемы, рассмотрим типичный сценарий из исследования. Модель просят оценить долю курящих среди взрослого населения страны. Прямой ответ — скажем, 18%. Затем её просят оценить долю курящих отдельно среди мужчин и женщин, отдельно по возрастным группам (18–24, 25–34, 35–44, 45–54, 55+), отдельно по уровням образования. Если агрегировать эти подгрупповые оценки с учётом реальных демографических весов (пропорции мужчин/женщин, распределение по возрасту и образованию), получается, например, 22%. Разница в 4 процентных пункта — это не статистический шум, это систематическое расхождение.
Ещё более показательный пример: когда декомпозиция идёт до очень мелких ячеек (скажем, «женщины 25–34 с высшим образованием в городских агломерациях»), модель даёт оценки, которые при точном агрегировании дают 21%, а прямой вопрос о всей популяции даёт 17%. Четыре процента разницы — это миллионы людей в масштабах страны.
Авторы также проверяют более абстрактные задачи: вероятность наступления событий, распределения непрерывных величин, условные вероятности. Во всех случаях обнаруживается тот же паттерн — модель не соблюдает базовые вероятностные тождества при агрегации.
Технический протокол: бинарные деревья и взвешенная агрегация
Ключевая методологическая инновация — использование бинарных деревьев для контролируемой декомпозиции. Исследователи строят дерево разбиений: корень — вся популяция, каждый внутренний узел — бинарное разбиение на две подгруппы (например, «мужчины/женщины», затем «моложе 30/старше 30», затем «с высшим образованием/без высшего»). Глубина дерева варьируется от 1 до 4–5 уровней, что даёт от 2 до 16–32 конечных ячеек.
Для каждой конечной ячейки модель просят оценить целевую величину (долю, среднее, вероятность). Затем оценки агрегируются вверх по дереву с весами, соответствующими реальным пропорциям подгрупп. Если модель статистически согласна, агрегат на любом уровне детализации должен давать ту же оценку, что и прямой ответ о корне.
Исследователи измеряют расхождение как абсолютную разницу между прямым ответом и агрегатом. Среднее расхождение по всем задачам и моделям составляет 5–15 процентных пунктов, а в отдельных случаях достигает 25–30 пунктов. Это не случайные флуктуации — это систематическое нарушение базового математического тождества.
Нарушение статистической согласованности — не изолированный баг. Оно вписывается в общую картину ограничений современных моделей.
Якорение (anchoring). При прямом вопросе о популяции модель может «зацепиться» за один заметный факт — скажем, высокую долю курящих среди мужчин — и недостаточно скорректировать в сторону остальных подгрупп. Декомпозиция принудительно разводит якоря по разным ячейкам, снижая эффект.
Систематическая самоуверенность. Прямые ответы модели калиброваны плохо — они выдаются с уверенностью, не соответствующей точности. Но когда модель отвечает про конкретную подгруппу, калибровка часто лучше, потому что знания о конкретной ячейке более локализованы.
Sycophancy и социальная желательность. При вопросе о «среднем» поведение модели может сдвигаться в сторону того, что звучит социально приемлемо как общий ответ. При вопросе о конкретной демографической ячейке этот эффект ослабевает — социальное давление абстракции меньше.
Как использовать на практике
Несколько конкретных приёмов, вытекающих из результатов исследования.
При оценке любых агрегированных величин — декомпозировать. Не «каков рынок X?», а «каков рынок X в сегменте A, B, C?» с последующим суммированием. Работает для рынков, демографии, статистик, вероятностей.
При оценке вероятностей событий — проверять через комплемент. Если модель оценивает вероятность события P(A), спросить также P(не-A). Сумма должна быть 100%. Расхождение — индикатор ненадёжности.
При работе с персона-промптингом — не агрегировать напрямую. Если вы просите модель ответить «от лица» разных типов пользователей и потом свести ответы в общую рекомендацию, итоговая картина может быть точнее, чем один прямой ответ «от себя». Это прямо следует из эффекта макро-фоллака.
Использовать рассогласование как метурику уверенности. Если агрегат подгрупповых оценок сильно отличается от прямого ответа — это сигнал, что модель «не уверена» на структурном уровне. Такие вопросы стоит проверять дополнительными источниками.
Часто задаваемые вопросы
Какие модели тестировались?
Исследование использует state-of-the-art фронтальные модели 2025–2026 года. Конкретные названия в препринте не раскрываются для всех конфигураций, но эффект воспроизводится кросс-модельно, что говорит о системной проблеме архитектуры, а не о баге конкретной реализации.
Можно ли «дообучить» модель на согласованность?
Авторы не исследуют файн-тюнинг, но отмечают, что эффект частично ослабляется имплицитным промптингом. Это намекает, что знание есть, но извлечение ломается на уровне инференса. RLHF-тренировка на консистентность — логичное направление, но потребует специфического reward-сигнала, основанного на вероятностных тождествах.
Почему бинарные деревья, а не произвольные разбиения?
Бинарные деревья позволяют контролируемо наращивать глубину декомпозиции и сравнивать согласованность на разных уровнях детализации. Каждое удвоение глубины — это проверка, сохраняется ли тождество при более мелком гранулировании. Это чище, чем произвольные разбиения с разным числом ветвей.
Имеет ли это значение для продакшн-приложений?
Да. Любое приложение, где LLM генерирует численные оценки (прогнозы, статистики, вероятности), подвержено этим ошибкам. Особенно критично в аналитических дашбордах, финансовых отчётах, медицинских рекомендациях. Если ответ получается прямым промптом — он менее надёжен, чем тот же ответ, полученный декомпозицией.
Что это значит для бенчмарков и оценки моделей
Современные бенчмарки LLM (MMLU, ARC, GSM8K, HumanEval) измеряют точность на фиксированных задачах с известными правильными ответами. Но они не проверяют внутреннюю согласованность модели. Результат исследования «Partition, Prompt, Aggregate» предлагает принципиально иной подход — reference-free evaluation, где не нужно знать эталон.
Если модель нарушает закон полной вероятности, это можно обнаружить без доступа к правильным ответам. Достаточно построить дерево декомпозиции, получить прямые и агрегированные оценки, и измерить расхождение. Это открывает возможность оценивать модели на данных, для которых нет ground truth — а таких данных в реальном мире большинство.
Авторы предлагают использовать степень нарушения согласованности как дополнительную метрику при оценке фронтальных моделей. Модель, которая лучше соблюдает вероятностные тождества, вероятно, лучше калибрована и более надёжна в продакшн-сценариях. Это не замена традиционным бенчмаркам, а дополнение — проверка на структурную целостность мышления, а не на запоминание фактов.
Итог
Языковые модели знают больше, чем показывают, — но только если спросить их правильно. Закон полной вероятности тривиально выполняется людьми, владеющими базовой статистикой. Для LLM он становится тестом на структурную согласованность, который модели проваливают систематически. Макро-фоллак переворачивает интуицию: декомпозиция не усложняет задачу, а облегчает её для модели. Для практиков это прямой сигнал — всегда дробить агрегированные вопросы на части и собирать ответ вручную. Модель знает лес, но только если спросить её про конкретные деревья.