Макро-парадокс: LLM знают больше, чем говорят
Попросите GPT-4 оценить средний доход населения страны, и он ответит. Попросите оценить доход по возрастным группам, сложите результаты — и получите цифру, которая окажется ближе к реальности. Парадокс? Не совсем. Швейцарские исследователи из ETH Zürich только что опубликовали работу, которая объясняет этот феномен и даёт ему название: macro fallacy — макро-парадокс.
Что такое статистическая самосогласованность
Любая оценка, которую выдаёт языковая модель, в идеале должна подчиняться базовым законам теории вероятностей. В частности — закону полной вероятности: если вы разбили популяцию на непересекающиеся подгруппы, то взвешенная сумма оценок по подгруппам должна совпадать с оценкой по всей популяции. Это не вопрос точности модели — это вопрос внутренней логики. Модель либо согласована сама с собой, либо нет.
Закон полной вероятности — один из самых фундаментальных результатов теории вероятностей, доказанный ещё Колмогоровым в 1933 году. Если событие A может произойти только в рамках одной из непересекающихся групп B₁, B₂, ..., Bₙ, то P(A) = Σ P(A|Bᵢ) × P(Bᵢ). Для языковой модели это означает: если она «знает» распределение признака внутри каждой подгруппы, то её популяционная оценка должна быть взвешенным средним этих знаний. Если это не так — модель внутренне противоречива.
Исследователи Patrik Wolf, Thomas Kleine Buening, Andreas Krause и Celestine Mendler-Dünner решили проверить эту согласованность у современных LLM. Krause — профессор машинного обучения в ETH Zürich, один из самых цитируемых исследователей в области оптимизации и обучаемости моделей. Mendler-Dünner — специалист по статистическому обучению. Команда не случайно выбрала именно теоретико-вероятностный критерий: он не требует знания ground truth и работает как reference-free метрика качества.
Эксперимент: бинарные деревья разбиения
Методика элегантно проста. Берётся популяция, для которой нужно оценить какой-то параметр (например, процент людей с определённым признаком). Затем популяция рекурсивно делится на подгруппы с помощью бинарного дерева — сначала на две части, потом каждая на две, и так до четырёх-восьми уровней детализации.
На каждом уровне исследователи промптят модель: «Оцени параметр X для подгруппы Y», где Y описывается вербально (например, «женщины 25–34 лет с высшим образованием»). Затем ответы агрегируются обратно в оценку для всей популяции — с учётом веса каждой подгруппы. Результат сравнивается с прямым ответом модели на вопрос «Какой процент людей в популяции обладает признаком X?» и с референсными данными.
Оценочный протокол охватывает несколько проблемных доменов одновременно: демографические параметры (возрастное распределение, уровень образования), экономические показатели (медианный доход, процент бедности), а также поведенческие паттерны (распространённость определённых привычек). Для каждого домена строятся бинарные деревья глубиной от 2 до 8 уровней — это даёт от 4 до 256 подгрупп на лист дерева.
Результат оказался одинаков для всех протестированных моделей: оценки, восстановленные из мелкозернистых подгрупп, систематически ближе к реальности, чем прямые популяционные оценки. Разрыв достигает десятков процентных пунктов в зависимости от задачи и глубины разбиения. Причём эффект нелинейный: первые 2–3 уровня дробления дают наибольший прирост точности, а после 5–6 уровней прирост замедляется, а в некоторых случаях начинает снижаться из-за накопления ошибок вербального описания.
Макро-парадокс: почему дробление работает
Почему так происходит? Исследователи выделяют несколько механизмов.
Во-первых, LLM обладают релевантными знаниями о подгруппах — они «знают», что демографические, экономические и социальные параметры распределены неравномерно. Но когда их просят оценить параметр для всей популяции сразу, эти знания теряются. Модель усредняет внутри себя, не имея возможности явно учесть структуру. Это похоже на ситуацию, когда эксперт знает тонкости по каждому региону, но при вопросе «что в среднем по стране?» даёт приблизительную оценку, теряя нюансы.
Во-вторых, вербальное описание подгруппы работает как неявный chain-of-thought. Когда модель получает конкретное описание («молодые выпускники вузов в мегаполисах»), она активирует более специфические паттерны из обучающей выборки, чем при запросе «средний человек». Конкретика в промпте сужает пространство активаций и уменьшает шум от нерелевантных паттернов.
В-третьих, эффект частично обратим через implicit prompting — если модель попросить сначала подумать о подгруппах, а потом дать общий ответ, прямой популяционный ответ тоже становится точнее. Но не настолько, насколько точна явная агрегация. Разница между implicit и explicit подходами составляет примерно половину общего выигрыша от декомпозиции.
Исследователи также протестировали влияние структуры дерева: одинаковое количество подгрупп, но разная топология разбиения (сбалансированное дерево против несбалансированного) даёт различный прирост точности. Сбалансированные деревья, где каждая подгруппа примерно равна по размеру, работают лучше, чем «глубокие» деревья с очень узкими листьями.
Что это значит для практики
Практические последствия макро-парадокса обширны и выходят далеко за рамки академического любопытства.
Опросы и прогнозирование. Если вы используете LLM для оценки рыночных параметров, демографических трендов или распространённости явлений — разбейте задачу на подгруппы. Не спрашивайте «какой процент пользователей предпочтёт фичу X» — спросите отдельно про возрастные когорты, географические регионы, уровни дохода. Сложите результаты. Это даст более точную оценку практически бесплатно. В маркетинговом исследовании это может означать разницу между запуском успешного продукта и провалом — а цена: лишние 4–5 запросов к API.
Агрегация мнений. Macro fallacy объясняет, почему ensemble-подходы к оценке LLM работают лучше одиночных запросов. Разные промпты активируют разные «экспертизы» модели. Если эти промпты ещё и структурированы по подгруппам — выигрыш удваивается. Это перекликается с классическим результатом из теории принятия решений: диверсифицированные прогнозы точнее усреднённого прогноза одного эксперта.
Бенчмарки и оценка моделей. Исследователи предлагают статистическую самосогласованность как reference-free критерий оценки LLM. Не нужно знать правильный ответ — достаточно проверить, согласована ли модель сама с собой при разных уровнях детализации. Модель, которая нарушает закон полной вероятности, в принципе не может давать надёжные популяционные оценки, даже если отдельные ответы выглядят правдоподобно. Это открывает путь к автоматическим бенчмаркам, которые не требуют ручной разметки ground truth. Более того, такой бенчмарк невозможно «подготовить» через fine-tuning на конкретные вопросы — согласованность является структурным свойством модели, а не результатом запоминания фактов.
Безопасность и alignment. Если модель внутренне противоречива при оценке социальных параметров — насколько она надёжна при оценке более критичных вещей? Макро-парадокс ставит вопрос о calibration LLM в широком смысле: если модель не может правильно агрегировать знания о демографии, стоит ли доверять её оценкам рисков, этических дилемм, вероятностей отказов в критических системах? В контексте safety-аудита это особенно тревожно: если модель выдаёт разную оценку вероятности вредоносного поведения для «взрослых мужчин» и для «взрослых мужчин 25–34 лет с доходом выше среднего», а затем усредняет это в популяционную оценку, которая не совпадает ни с одним из подгрупповых ответов — мы получаем систематическую ошибку агрегации, которую невозможно детектировать без декомпозиции.
Фундаментальный вопрос о природе LLM. Макро-парадокс поднимает вопрос, на который пока нет ответа: действительно ли языковые модели «понимают» статистику и вероятности, или они лишь аппроксимируют паттерны в обучающих данных без истинного понимания базовых законов? Если модель «знает» правильные ответы для подгрупп, но не может их агрегировать — это может означать, что вероятностное мышление не является частью её внутренних представлений. Модель может быть статистическим попугаем: способна воспроизводить правильные числа в правильном контексте, но не способна применять абстрактные математические принципы к новым ситуациям. Это перекликается с дебатами о «понимании» vs «паттерн-матчинге» в философии ИИ и имеет практические последствия для того, как мы проектируем системы, использующие LLM. В контексте safety-аудита это особенно тревожно: если модель выдаёт разную оценку вероятности вредоносного поведения для «взрослых мужчин» и для «взрослых мужчин 25–34 лет с доходом выше среднего», а затем усредняет это в популяционную оценку, которая не совпадает ни с одним из подгрупповых ответов — мы получаем систематическую ошибку агрегации, которую невозможно детектировать без декомпозиции.
Ограничения и открытые вопросы
Исследование не лишено ограничений, и исследователи честно о них заявляют.
Во-первых, эксперимент проводился на задачах, где существует ground truth (демография, экономика). Насколько хорошо макро-парадокс работает для задач, где «правильного ответа» нет (прогнозы будущего, гипотетические сценарии, субъективные оценки), пока неизвестно. Возможно, в этих доменах декомпозиция вносит больше шума, чем сигнала.
Во-вторых, глубина разбиения имеет предел. Исследователи использовали деревья до 4–8 уровней. При большей детализации вербальные описания подгрупп становятся слишком специфичными, и модель начинает галлюцинировать — знаний о таких узких подгруппах просто нет в обучающих данных. Возникает парадокс: дробление помогает до определённого предела, за которым оно превращается в источник ошибок.
В-третьих, выбор моделей не включает open-source. GPT-4, Claude и Gemini — это проприетарные frontier-модели. Непонятно, проявляют ли Llama, Qwen и Mistral тот же эффект, или макро-парадокс специфичен для масштаба и обучения с RLHF. Есть гипотеза, что модели меньшего масштаба, обученные без RLHF, могут демонстрировать менее выраженную (или более выраженную) несогласованность — но данных пока нет.
Наконец, остаётся открытым вопрос архитектуры. Может ли следующая волна моделей (Mamba, state space models, hybrid architectures) быть по своей природе более согласованной? Или это фундаментальное свойство авторегрессионных генераторов текста?
FAQ
Почему «макро-парадокс» — это не ошибка модели?
Потому что модель отвечает логично на каждом уровне отдельно. Парадокс возникает не из-за глупости модели, а из-за структурного разрыва: знания о подгруппах и знания о популяции хранятся и извлекаются по-разному. Модель не «ошибается» в обычном смысле — она просто не умеет агрегировать. Это свойство не конкретного веса или слоя, а всей архитектуры трансформера с её attention-механизмом, который не имеет явного механизма суммирования по подмножествам.
Можно ли исправить макро-парадокс промпт-инжинирингом?
Частично. Implicit prompting (попросить модель сначала подумать о подгруппах, потом дать общий ответ) улучшает прямую популяционную оценку примерно наполовину от полного выигрыша. Но явная агрегация всё равно точнее. Промпт-инжиниринг смягчает проблему, но не решает её. Для критических приложений (медицинские оценки, финансовые прогнозы) явная декомпозиция остаётся необходимостью.
Как использовать макро-парадокс в продакшене?
Для любых задач, где нужно оценить параметр популяции: разбейте задачу на 3–5 подгрупп, получите оценку для каждой, агрегируйте с весами. Это бесплатно (те же токены), но даёт прирост точности, который невозможно получить улучшением промпта для прямого запроса. Конкретный рецепт: выберите 1 демографический параметр (возраст, регион, доход), попросите модель оценить ваш целевой метрический параметр для 3–5 категорий, взвесьте по известным пропорциям популяции — готово.
Связан ли макро-парадокс с галлюцинациями?
Не напрямую, но косвенно — да. Галлюцинации возникают, когда модель генерирует правдоподобный, но фактически неверный текст. Макро-парадокс показывает, что модель иногда «знает» правильный ответ, но не может его выдать в нужной форме. Это не галлюцинация в классическом смысле, а скорее «анти-галлюцинация» — модель занижает качество своей оценки, усредняя то, что могло бы быть точным. Понимание этого помогает отделить проблемы «модель не знает» от проблем «модель знает, но не может правильно сказать».
Итог
Макро-парадокс — это не просто академическое наблюдение. Это практичная инструкция: если LLM знает больше, чем говорит, — заставьте её говорить. Дробите задачу, спрашивайте про подгруппы, агрегируйте результаты. Статистическая самосогласованность станет новым стандартом оценки — не потому что это модно, а потому что внутренняя логика важнее внешней правдоподобности.
Работа Wolf et al. (2026) «Partition, Prompt, Aggregate: Statistical Self-Consistency in Language Models» доступна на arXiv (2607.15277). Авторы — исследователи ETH Zürich, одной из ведущих технических школ Европы. Результаты ставят под сомнение простую парадигму «задай вопрос — получи ответ» и открывают путь к более осмысленному взаимодействию с языковыми моделями.