RAG и идеология: как температура генерации усиливает скрытые предубеждения
Представьте, что вы построили RAG-систему для медицинского чат-бота. Пользователь спрашивает про лечение COVID-19, система извлекает документы и генерирует ответ. Казалось бы, всё под контролем — retrieval grounding должен обеспечивать фактическую точность. Но есть проблема: если в retrieved-документах содержится идеологическая позиция, модель не просто её «прочитает» — она воспроизведёт её в собственном ответе.
Исследование группы авторов из Wichita State University и Institut national de la recherche scientifique (июль 2026) впервые количественно оценило этот эффект. Результаты показывают: RAG — это не нейтральный конвейер фактов, а канал передачи дискурсивных рамок. И температура сэмплирования — ключевой рычаг, определяющий силу этой передачи.
Что такое идеологический дискурс в контексте LLM
Идеологический дискурс — это не про политику в узком смысле. Это скрытые оценочные рамки, которые формируют как подаётся информация. Какие слова выбираются для описания пациентов, какие аспекты лечения акцентируются, а какие опускаются, — всё это формирует конкретную позицию.
Авторы исследования использовали корпус из 1 117 научных статей о COVID-19 (5,5 миллиона слов). Корпус намеренно разделили на две группы: 116 статей, продвигающих спорные методы лечения (гидроксихлорохин, азитромицин), и 991 статью с доказательными подходами. Разница в лексике оказалась систематической и измеримой.
Например, спорные статьи рядом со словом «patients» используют collocates вроде «hospitalized», «intensive», «cardiac», «mortality» — лексика тревоги и драматизма. Доказательные статьи — «efficacy», «safety», «statistical», «data», «therapeutic» — лексика научной строгости. Эти паттерны не случайны: они отражают фундаментально разные дискурсивные рамки.
Методология: как измерить то, что нельзя увидеть
Для выявления скрытых идеологических измерений авторы применили Lexical Multidimensional Analysis (LMDA) — расширение классического метода Biber, адаптированного для работы с большими корпусами. Пайплайн выглядит так: извлечение ключевых слов через log-likelihood, определение коллокаций с порогом LogDice ≥ 7, построение тетрахорной корреляционной матрицы и факторный анализ.
Результат — три латентных измерения:
Измерение 1 противопоставляет «фармацевтический мессианизм» (продвижение спорных препаратов с риторикой срочности) и исследования психического здоровья (анализ тревоги, депрессии, изоляции через эмпирическую оптику).
Измерение 2 разделяет тексты о научной этике и прозрачности (данные, воспроизводимость, рецензирование) и тексты, конструирующие аргументы в пользу спорных препаратов через риторическую селекцию данных.
Измерение 3 противопоставляет продвижение репозиционированных препаратов с минимизацией рисков и критическую оценку результатов с акцентом на open science.
Эти три измерения стали осевой системой координат, по которой измерялась идеологическая позиция каждого ответа LLM.
Эксперимент: четыре модели, пять температур, три измерения
Авторы протестировали четыре модели (GPT-4o-mini, GPT-3.5-turbo, Gemini-2.0 и Qwen) на шести тематических вопросах по каждому измерению. Каждая модель отвечала при пяти температурах сэмплирования (0.1, 0.3, 0.5, 0.7, 0.9) в двух конфигурациях: LLM-only (без контекста) и RAG (с retrieved-документами).
Выравнивание измерялось тремя метриками: семантическая косинусная близость (embeddings), лексическая косинусная близость (TF-IDF) и гибридная метрика. Каждая метрика сравнивала сгенерированный ответ с референсными текстами из каждого полюса дискурса.
Ключевые цифры:
RAG повышает идеологическое выравнивание. В режиме RAG семантическая близость с референсными текстами стабильно выше, чем без retrieval. Для Qwen на измерении 1 с enhanced-промптом разница достигает 0.905 (RAG) против 0.765 (LLM-only) при температуре 0.3 — прирост в 0.14 пункта от одного лишь retrieval.
Температура 0.5–0.7 — зона максимального эффекта. При умеренных температурах модели достигают пикового выравнивания с дискурсивными референсами. Для GPT-3.5-turbo в RAG-режиме на измерении 3 гибридная метрика достигает 0.865 при T=0.887 при T=0.3, что на 0.14–0.21 пункта выше, чем при T=0.1. При низкой температуре (0.1) детерминированный sampling подавляет передачу дискурса.
Qwen наиболее чувствителен к retrieval-контексту. Среди четырёх моделей Qwen демонстрирует наибольшую разницу между RAG и LLM-only на всех трёх измерениях. На измерении 3 гибридная метрика подскакивает с 0.713 (LLM-only) до 0.932 (RAG) при T=0.7 — увеличение на 0.22 пункта. GPT-4o-mini, напротив, показывает наименьшую восприимчивость к контексту.
RAG генерирует более длинные ответы. Средняя длина ответов в RAG-режиме — 260–270 токенов против 150–152 токенов для LLM-only. При этом длина растёт с температурой (от 259.5 при T=0.1 до 268.9 при T=0.9), тогда как LLM почти не чувствителен к этому параметру (150.9–152.1).
Counterintuitive finding: почему «средняя» температура опасна
Самый неожиданный результат исследования — нелинейная зависимость между температурой и идеологическим выравниванием. Можно было бы ожидать, что высокая температура (больше случайности) приведёт к большей вариативности и снижению согласованности с retrieved-документами. Или что низкая температура (больше детерминизма) усилит влияние контекста, поскольку модель будет точнее следовать retrieved-инструкциям.
Реальность оказалась сложнее. При T=0.1 модель настолько детерминирована, что «зажимается» — она воспроизводит общие паттерны обучения, но не активно интегрирует дискурсивные рамки из retrieved-документов. При T=0.5–0.7 модель балансирует между стохастичностью и grounding — достаточно свободы, чтобы воспроизводить стилистические и оценочные паттерны из контекста, но достаточно структуры, чтобы оставаться в рамках retrieved-тематики.
Это означает, что RAG-системы, настроенные на «умеренную креативность» (что типично для production-конфигураций), фактически максимизируют передачу скрытых идеологических рамок из документов в ответы.
Механизм влияния: от слов к дискурсу
Чтобы понять, как именно retrieved-документы формируют ответы, полезно посмотреть на конкретные лексические паттерны. Авторы выделяют три типа сигналов, которые модель извлекает из контекста.
Первый тип — collocates, то есть устойчивые словосочетания. В спорных статьях слово «patients» окружено лексикой кризиса: «hospitalized», «intensive», «mortality», «cardiac». В доказательных статьях те же «patients» сочетаются с «efficacy», «safety», «statistical», «data». Модель не просто копирует эти слова — она усваивает оценочную рамку, в которой пациенты представляются либо как объекты драматического вмешательства, либо как субъекты научно обоснованного лечения.
Второй тип — синтаксические конструкции. Спорные тексты чаще используют пассивный залог и безличные конструкции («was observed», «it was suggested»), что создаёт эффект объективности и дистанцирования от ответственности. Доказательные тексты чаще применяют активные конструкции с явными агентами («the study demonstrates», «researchers found»), что подчёркивает научную строгость и воспроизводимость.
Третий тип — тематическая селекция. Даже при обсуждении одних и тех же фактов разные дискурсы акцентируют разные аспекты. Спорные тексты фокусируются на отдельных случаях успеха, эмоциональных нарративах и срочности действия. Доказательные тексты — на статистической значимости, ограничениях исследований и систематических обзорах.
Когда RAG извлекает документы, модель получает не только фактическую информацию, но и весь этот дискурсивный контекст. И температура сэмплирования определяет, насколько активно модель будет воспроизводить эти паттерны в собственном ответе.
Enhanced vs Regular prompting: мета-данные усиливают эффект
Авторы протестировали два типа промптов: regular (просто вопрос + retrieved-документы) и enhanced (вопрос + документы + мета-данные об идеологической позиции текстов).
Результат: enhanced-промпт не снижает, а усиливает идеологическое выравнивание. Для Qwen на измерении 1 с enhanced-промптом гибридная метрика достигает 0.821 при T=0.3 против 0.822 при regular-промпте — разница минимальна. Но на измерении 2 разрыв значительнее: enhanced даёт 0.768 против 0.757 у regular. Мета-информация о дискурсивной позиции документов, парадоксальным образом, делает модель более восприимчивой к ним.
Это важный сигнал для разработчиков RAG: добавление мета-данных и тегов к retrieved-документам — распространённая практика для улучшения relevance — может непреднамеренно усиливать передачу нежелательных дискурсивных рамок.
Negative prompting: работает, но не устраняет
Для проверки устойчивости эффекта авторы добавили третий вариант промпта — negative prompting, явно инструктирующий модель избегать идеологически окрашенных формулировок.
Результат: negative prompting снижает выравнивание по всем трём метрикам, но не устраняет его. Лексическая метрика показывает наибольшее снижение (лексический выбор более чувствителен к полярности промпта), тогда как семантическая метрика — наименьшее (ядерные семантические структуры устойчивее к изменениям формулировок).
Пик выравнивания при negative prompting смещается с T=0.7 (regular/enhanced) на T=0.9, что указывает на более сложный паттерн взаимодействия между ограничениями промпта и температурой.
Практические последствия
Для инженеров, строящих RAG-системы в высокорисковых доменах (медицина, юриспруденция, образование), результаты исследования дают конкретные ориентиры.
Если retrieval-корпус содержит идеологически неоднородные документы (а в реальности это почти всегда так), RAG будет передавать доминирующие дискурсивные рамки в ответы модели. Это не баг — это структурное свойство retrieval-grounded генерации.
Настройка температуры как «компромисс между креативностью и точностью» — упрощённая модель. Температура влияет не только на фактическую вариативность, но и на силу дискурсивного выравнивания с retrieved-документами. Production-системам стоит тестировать разные температуры на репрезентативных вопросах и оценивать не только accuracy, но и framing bias.
Мета-данные и negative prompting — не панацея. Оба инструмента снижают, но не устраняют идеологический transfer. Для критических применений необходим многоуровневый контроль: фильтрация документов на уровне retriever, аудит сгенерированных ответов на дискурсивную согласованность, и, возможно, явная debiasing-прослойка между retrieval и generation.
Часто задаваемые вопросы
Влияет ли температура на фактическую точность RAG-ответов?
Исследование фокусируется на идеологическом выравнивании, а не на factual accuracy. Однако авторы отмечают, что при T=0.1 модель генерирует более короткие ответы (150 токенов) и демонстрирует меньшее разнообразие — это может указывать на «зажатость», при которой модель воспроизводит усреднённые паттерны обучения вместо детальной работы с retrieved-контентом. Фактическая точность и дискурсивная нейтральность — связанные, но не тождественные свойства.
Применимы ли результаты COVID-19 к другим доменам?
Авторы честно указывают это как ограничение. Корпус 2020–2022 годов характеризуется острой публичной неопределённостью и политической поляризацией — условия, которые могли усилить выявленные эффекты. Однако структурный механизм (retrieval → conditioning → generation) универсален для RAG-архитектуры. Похожие паттерны ожидаются в любом домене с идеологически неоднородным корпусом: климат, экономика, образовательная политика.
Какую температуру использовать в production RAG?
Универсального ответа нет, но исследование даёт ориентир: если retrieval-корпус идеологически неоднороден, температуры 0.5–0.7 максимизируют передачу дискурсивных рамок из документов. Для снижения этого эффекта можно тестировать T=0.1–0.3 (снижение transfer, но возможная потеря деталей) или T=0.9 (повышение вариативности, снижающее систематическое смещение). Выбор зависит от того, что для вашей системы критичнее: согласованность с источниками или дискурсивная нейтральность.
Итог
RAG — это не просто «модель + поиск». Это система, в которой retrieved-документы структурно формируют не только что говорит модель, но и как она это подаёт. Температура сэмплирования — не просто ручка креативности, а параметр, определяющий силу идеологического влияния контекста на выход.
Для инженеров это означает: настройка RAG-системы — это не только выбор embedding-модели и chunking-стратегии, но и осознанный выбор того, какие дискурсивные рамки допустимо передавать пользователю. И температура — один из инструментов этого выбора.
Исследование открыто доступно на arXiv (2607.11783). Данные, код и детальные таблицы результатов — в supplementary materials статьи.