GEAR: как заставить LLM не копировать промпт, а думать
Когда языковая модель получает на вход сто тысяч токенов и начинает «рассуждать» над задачей, она иногда делает странную вещь — буквально переписывает куски промпта в свои цепочки рассуждений. Не парафразирует, не анализирует, а копирует дословно. Причём чем длиннее контекст, тем хуже: доля копирования растёт от 20% на 8 тысячах токенов до 70% на 64 тысячах. Это не баг конкретной модели — такое поведение обнаруживается у всех семи протестированных frontier-моделей, от Claude Opus 4.5 до Qwen3.5-9B.
Исследование «Copy Less, Ground More» (arXiv, июль 2026) не просто описывает этот паттерн — оно показывает, что корень проблемы не в объёме контекста как таковом, а в неспособности модели отличать релевантные доказательства от нерелевантного шума. И предлагает конкретное решение: GEAR, Grounding Evidence-Aware Reward — метод обучения с подкреплением, который возвращает до +4.6 пунктов точности на длинных контекстах, одновременно сокращая объём бесполезного копирования.
Что такое repetitive copying и почему это проблема
Термин звучит академично, но явление вполне узнаваемо. Представьте, что вы поручили стажёру найти ответ на вопрос в трёхсотстраничном документе. Стажёр вместо того, чтобы читать и думать, переписывает целые абзацы в свой отчёт — иногда релевантные, иногда совершенно посторонние. В конце он выдаёт ответ, но вы не понимаете, рассуждал ли он вообще или просто транскрибировал текст.
Исследователи измерили это явление количественно через n-gram overlap rate — долю n-грамм из reasoning trace модели, которые встречаются в исходном промпте. На бенчмарке GSM-Infinite (арифметические задачи, вплетённые в большие массивы числовых описаний) результаты получились впечатляющие. На контексте 8K токенов трёхграммный overlap варьирует от 20% (Claude) до 43.7% (Qwen3.5-9B). На 64K — от 29.7% (Claude) до 70.8% (Qwen-3.5-Plus). А если считать не трёхграммы, а десятиграммы — то есть длинные непрерывные фрагменты, — Qwen3.5-9B на 64K контексте достигает 52.7% overlap. Это значит, что более половины reasoning trace модели — дословные копии из промпта.
Связь с качеством ответов прямая: образцы с высоким overlap значительно чаще оказываются неправильными. Модель тратит свой токен-бюджет на транскрипцию вместо рассуждения, и чем больше она копирует, тем меньше места остаётся для собственно логики. Более того, длинные копии раздувают reasoning length — модель генерирует больше токенов, но не лучше. Это тупик: больше контекста → больше копирования → больше токенов впустую → ниже точность.
Корень проблемы — не длина контекста, а отсутствие grounding
Ключевое открытие работы — копирование само по себе не всегда вредно. Проблема в том, что модели копируют без разбора: они одинаково охотно воспроизводят и релевантные условия задачи, и совершенно нерелевантные фрагменты. Исследователи разделили промпт на ключевые доказательства (key evidence) и нерелевантный контекст (distractor context), и обнаружили, что правильно решённые задачи характеризуются селективным копированием — модель фокусируется на важном, игнорируя шум. Неправильные решения, напротив, сопровождаются неразборчивым переписыванием всего подряд.
Это тонкий, но принципиальный момент. Если бы модель просто «забывала» релевантные части длинного контекста, решением было бы улучшить attention к дальним токенам. Но модель не забывает — она видит всё, просто не умеет фильтровать. Root cause — insufficient grounding: модель не различает, что в промпте является доказательством, а что — фоном.
GEAR: награда за фокус, штраф за шум
Формула GEAR лаконична и точна. Полная награда складывается из трёх компонентов: стандартный accuracy reward (правильный ли ответ), grounding reward (насколько reasoning trace перекрывается с ключевыми доказательствами) и distractor penalty (насколько trace перекреляется с нерелевантным контекстом). На уровне n-грамм это выглядит так: модель получает бонус за каждый фрагмент рассуждения, совпадающий с релевантными частями промпта, и штраф за каждый фрагмент, совпадающий с нерелевантными частями.
Две компоненты не симметричны — они взаимодополняющие. Grounding reward одна не работает, потому что модель научилась бы просто копировать всё, включая ключевые доказательства, и получала бы максимум бонусов. Distractor penalty одна тоже не работает — без направляющего сигнала модель просто перестала бы обращаться к промпту вообще, подавив и полезное, и вредное копирование. Только вместе они создают давление в нужную сторону: «смотри сюда, но не смотри туда».
Важная практическая деталь: reward вычисляется целиком на n-gram статистике и не требует ни внешнего верификатора, ни ретривера. Это делает GEAR дешёвым в реализации — достаточно иметь размеченные support indices (позиции релевантных фрагментов в промпте), которые для синтетических бенчмарков генерируются автоматически.
Автоматический pipeline: от произвольного документа к обучающим данным
Для синтетических задач вроде GSM-Infinite ключевые доказательства известны заранее — они встроены в генератор. Но для реальных длинных документов нужна автоматическая разметка. Исследователи разработали трёхстадийный pipeline. На первом этапе языковая модель анализирует документ и определяет его информационные характеристики — факты, числа, причинные связи. На втором этапе документ разбивается на чанки по 1024 символа, из которых случайным образом выбираются 1–3 чанка как designated evidence region. Вопросы генерируются строго в рамках этой области, что гарантирует точные support annotations by construction. На третьем этапе извлекаются финальные аннотации — где именно в документе находятся доказательства для каждого вопроса.
Это элегантный разворот обычного workflow: вместо «сначала вопрос, потом размечаем доказательства» подход говорит «сначала designate что является доказательством, потом генерируй вопрос». Получается гарантированная разметка без ручной работы и без неточностей.
Результаты: +4.6 очка и растущая польза на длинных контекстах
GEAR обучали на трёх моделях Qwen3.5 (9B, 35B-A3B, 27B) с использованием GSPO и смеси из 3200 long-context примеров. Оценивали на пяти бенчмарках, полностью непересекающихся с обучающей выборкой: Ruler (синтетический ретривер), LongBench-v2 (комплексное понимание), BrowseComp-LC (веб-браузинг), GraphWalks (графовое рассуждение) и AA-LCR.
На 32K контексте GEAR даёт +2.8 пункта для 9B, +2.1 для 35B-A3B и +1.5 для 27B. На 128K контексте выигрыш ещё больше: +4.6, +2.8 и +2.1 соответственно. Это важное наблюдение — метод обучался на контекстах 16K–32K, но его преимущества проявляются сильнее на контекстах в 4 раза длиннее. Evidence-grounding behavior обобщается на ранее невиданные длины.
Самый удивительный результат — из аблиционного исследования. Добавление одного только grounding reward (без distractor penalty) не просто не помогает — оно устойчиво ухудшает результаты. На 128K контексте деградация достигает 8.3 очков по сравнению с accuracy-only baseline. На GraphWalks и BrowseComp-LC падение особенно серьёзное. Причина: без штрафа за копирование дистракторов grounding reward поощряет модель копировать вообще всё, что хоть как-то связано с доказательствами — а это, как мы помним, означает и нерелевантный контекст, ведь модель не умеет различать.
Наоборот, distractor penalty один тоже ухудшает результаты — модель подавляет любое копирование, включая полезное. Только полная формула GEAR с обеими компонентами даёт стабильный выигрыш.
Почему attention не справляется с длинным контекстом
Современные трансформеры теоретически могут «видеть» все токены в контексте одновременно — механизм self-attention вычисляет связи между каждой парой позиций. Но на практике эта способность деградирует по мере роста длины. Причины три.
Во-первых, dilution effect — когда релевантная информация размазана по огромному контексту, внимание распределяется слишком широко, и ни один фрагмент не получает достаточной массы для полноценной обработки. Модель видит всё понемногу, но ничего глубоко.
Во-вторых, positional bias — трансформеры систематически уделяют больше внимания началу и концу контекста, игнорируя середину. В длинных документах это создаёт слепые зоны: доказательства, спрятанные в середине промпта, остаются необработанными.
В-третьих, noise accumulation — чем больше контекст, тем больше нерелевантных токенов конкурируют за внимание с релевантными. Signal-to-noise ratio падает, и модель начинает полагаться на поверхностные эвристики вместо систематического анализа.
GEAR не пытается чинить attention напрямую. Вместо этого он обходит проблему через reward: даже если модель формально «видит» все токены, reward-сигнал вынуждает её стратегически выбирать, на что обращать внимание. Это архитектурный обходной путь, а не архитектурное исправление — и именно поэтому он работает поверх существующих моделей без модификации их внутренностей.
Практические выводы
Для разработчиков, работающих с long-context LLM, результаты предлагают несколько конкретных инсайтов. Во-первых, мониторинг overlap rate может служить ранним индикатором деградации качества: если reasoning trace модели начинает выглядеть как копия промпта, точность скоро упадёт. Во-вторых, reward shaping через grounding — это не просто академический приём, а практически реализуемая техника: n-gram overlap вычисляется дёшево, без дополнительных моделей или API-вызовов. В-третьих, комбинация «поощряй полезное + наказывай вредное» работает, а каждая компонента по отдельности — нет. Это важный урок для дизайна reward-функций в RL-обучении reasoning models.
Для исследователей работа ставит интересный вопрос о природе grounding. Если модель может научиться различать релевантное и нерелевантное через n-gram overlap, значит, это различение не требует сложного семантического понимания — достаточно статистических сигналов. Это одновременно обнадёживающе (задача проще, чем казалось) и тревожно (может быть, модели вообще не нужны глубокие семантические репрезентации для long-context reasoning?).
Наконец, тот факт, что обучение на 16–32K контекстах даёт лучший результат на 128K, чем на 32K, говорит о том, что evidence-grounding — это навык, а не memorization паттерна. Модель учится стратегически относиться к контексту, и этот навык масштабируется. Это открывает путь к экономному обучению: тренируй на коротких контекстах, применяй на длинных.
Часто задаваемые вопросы
Чем GEAR отличается от LongTraceRL и других методов RL для long-context?
LongTraceRL использует entity-level рубрики и строит данные из поисковых траекторий агента. GEAR работает на другом уровне — он не отслеживает сущности, а разделяет весь контекст на релевантные и нерелевантные фрагменты, и формирует reward напрямую из n-gram overlap. GEAR проще в реализации (не нужна агентная траектория) и сфокусирован на конкретном failure mode — repetitive copying.
Работает ли GEAR для проприетарных моделей типа GPT или Claude?
В текущей формулировке — нет, потому что GEAR требует RL-обучения с модифицированным reward. Однако принцип применим: любой провайдер, обучающий reasoning-модели, может интегрировать grounding reward в свой training pipeline. Для end-users полезен сам мониторинг: можно измерять overlap rate собственных промптов и reasoning traces, чтобы оценивать качество работы модели.
Почему grounding reward одна вредит, а в комбинации с penalty — помогает?
Grounding reward говорит модели «копируй релевантное». Но модель не умеет идеально различать релевантное и нерелевантное — без штрафа она копирует и то, и другое, получая максимум бонусов за «случайное» совпадение с доказательствами. Distractor penalty создаёт контрдавление: «не копируй нерелевантное». Вместе они вынуждают модель учиться различению — то есть именно тому навыку, которого ей не хватает.
Итог
Копирование промпта в reasoning trace — это не особенность какой-то одной модели и не неизбежное следствие длинного контекста. Это симптом отсутствия grounding: модель видит всё, но не умеет фокусироваться. GEAR решает эту проблему через reward shaping, который одновременно поощряет связь с доказательствами и подавляет копирование шума. Результат — до +4.6 очков на бенчмарках при сокращении длины рассуждений. Для сообщества, которое строит всё более сложные reasoning-системы на длинных контекстах, это практический сигнал: дело не в том, чтобы подать модели больше данных, а в том, чтобы научить её отличать важное от постороннего.