IdeaGene: почему ИИ пишет наукообразно, но не понимает наследование идей
Научная идея никогда не рождается с чистого листа. Она наследует механизмы, чинит известные ограничения и рекомбинирует куски более ранних работ — во многом как биологический геном передаёт признаки через поколения. И вот парадокс 2026 года: LLM-системы пишут статьи, которые звучат убедительно, проводят эксперименты, генерируют графики. Но понимают ли они, от какой именно идеи наследуют и что именно модифицируют?
Исследователи из Шанхайского университета Цзяо Тун (SJTU) под руководством Yifan Zhou представили IdeaGene-Bench (IG-Bench) — бенчмарк, который впервые ставит этот вопрос в измеряемой форме. Результаты неутешительны: даже самая сильная система (GPT-5.5 с обвязкой Claude Code) достигает лишь 27,3% точности на задачах научного наследования. Разрыв между правдоподобным текстом и подлинным пониманием структуры идей оказался фундаментальным.
Что такое «геном идеи»
Центральная концепция фреймворка — Idea Genome (геном идеи). Это минимальная типизированная структура, извлекаемая из научной работы. Каждый геном содержит четыре компонента: функциональную роль (тип), описание содержания, указатель на доказательство в исходной статье и опциональные ограничения.
Ролей шесть: niche (проблемная среда), mechanism (наследуемый метод или дизайн), observation (мотивирующий эмпирический паттерн), limitation (дефект или узкое место), delta (починка или изменение относительно предшественников) и claim (заявленный результат). Эта типизация превращает размытое «статья продолжает линию X» в конкретный инвентарь объектов, каждый из которых можно отследить, сравнить и верифицировать.
Для сравнения двух работ — предшественника и преемника — фреймворк вводит GenomeDiff. Это запись о выравнивании геномов: какие объекты унаследованы, мутировали, потеряны, импортированы извне или вставлены заново. Каждая запись также хранит главный драйвер перехода и обоснование, подкреплённое цитатами из текста.
Шесть эволюционных динамик
Аналогия с биологией не остаётся просто метафорой — она даёт рабочую таксономию. Исследователи определяют шесть операционных категорий для классификации переходов между работами.
Мутация — драйверный механизм унаследован или локально модифицирован, ниша остаётся той же. Классический пример: YOLO → YOLOv2, где одностадийное обнаружение сохраняется, а якорные боксы, батч-нормализация и мультимасштабное обучение чинят локальные ограничения.
Адаптивная радиация — механизм сохраняется, но перемещается в новую задачу или домен. Transformer → ViT: self-attention унаследован из обработки токенов, но перенесён на патчи изображений.
Гибридизация — преемник импортирует драйверные объекты из двух или более различных линий. CLIP-энкодер + instruction-tuned LLM → LLaVA: визуальное выравнивание и чат-поведение импортированы из двух независимых линий.
Специация — ниша та же, но драйверный механизм заменён на новый, формирующий отдельную линию. Faster R-CNN → DETR: CNN-предложения регионов уступают место set-предсказанию на Transformer'ах.
Нишевая конкуренция — общая экология, но без наследования драйвера. Faster R-CNN и YOLO решают одну задачу обнаружения, но используют конкурирующие механизмы (region proposals vs. одностадийная регрессия).
Изоляция — ни общей экологии, ни наследования. BERT и YOLO не пересекаются ни по задаче, ни по механизму.
Эта классификация решает ключевую проблему: она отделяет наследование от тематического соседства. Две статьи могут разделять задачу, не наследуя друг от друга, и выглядеть текстово далёкими, неся при этом один и тот же базовый механизм. Заголовки, абстракты, цитатные рёбра и эмбеддинги смешивают эти случаи, и модели делают то же самое.
Бенчмарк: 1961 линий, 10 доменов, 42 типа задач
IG-Bench содержит 1961 золотую линию наследования в 10 научных доменах (NLP, компьютерное зрение, мультимодальное обучение, биология, химия, физика, материаловедение, медицина, математика и другие). Это 1085 курированных объектов Idea Genome и 920 парных записей GenomeDiff. Для построения привлекали 50 аспирантов и докторантов, межэкспертное согласие по меткам динамики составило 84,7% до арбитража.
Бенчмарк поддерживает две оценки. IG-Exam — закрытый тест с 42 типами задач и 1029 инстансами на четырёх осях способностей. T1 (абстракция генома) проверяет, может ли модель прочитать один геном — определить тип поля, драйверный геном, роль вклада или позицию в линии. T2 (трассировка наследования) требует восстановления упорядоченных линий и выравнивания унаследованных объектов. T3 (эволюционное рассуждение) просит объяснить переход по критериям GenomeDiff. T4 (верификация линии) —closest к генерации: нужно проверить предложенную линию на когерентность.
IG-Arena оценивает открытую генерацию с помощью Population-Evolution Score (PES) — метрики, разлагающей качество предложения на три измерения по аналогии с условиями Дарвина для эволюции путём естественного отбора. Heredity (наследование) — унаследовало ли предложение правильные родительские геномы. Variation (варьирование) — вводит ли оно осмысленную новизну относительно соседних работ. Selection (отбор) — конкурентоспособно ли предложение в заявленной линии. Каждое измерение оценивается по шкале 0–100, PES — среднее арифметическое.
Результаты: композиционный боттлнек
На IG-Exam лучшая прямая LLM (GPT-5.5) достигает 23,1% точности, лучшая система с обвязкой (GPT-5.5 + Claude Code) — 27,3%. Ошибки редко бывают простыми промахами: модель может определить родительскую работу, но присвоить неверную метку динамики, или вывести драйверный геном, но неправильно классифицировать его судьбу. Точная метрика обнажает именно те провалы согласованности, которые критичны для генерации.
Деградация по осям способностей показательна. T1 (абстракция) — 34,4%, T2 (трассировка) — 37,9%, T3 (эволюционное рассуждение) — 25,3%, T4 (верификация) — 17,4%. Градиент от T1 к T4 отслеживает добавляющуюся композиционную нагрузку. T1 требует прочитать один геном; T4 требует, чтобы одновременно совпали идентичность родителя, совместимость геномов, согласованность драйвера и валидность доказательств. T4 — это и есть ближайший проксимакс к генерации: система, не способная верифицировать линии, не может надёжно генерировать когерентных преемников.
Инструментальные обвязки помогают ретривалу больше, чем согласованности. CLI-харнессы (Codex, Claude Code) существенно улучшают T2 (GPT-5.5: с 25,7% до 37,9% с Claude Code), где итеративное использование инструментов помогает извлекать и сравнивать объекты. Но приросты сжимаются на T3 и почти исчезают на T4. Текущие обвязки усиливают зависящие от ретривала способности, оставляя композиционное рассуждение практически нетронутым. Исследовательские агенты (AI Scientist v2 и CoI-Agent) остаются близки к прямому GPT-5.5 на большинстве осей, что означает: многошаговые пайплайны сами по себе не добавляют компетенции в рассуждении о линиях.
Масштаб эксперимента: 14 систем, 1260 предложений
Эксперимент покрывает 30 фронтальных задач в 10 доменах и генерирует 1260 предложений от 14 LLM-систем в трёх настройках информации (Question, Library, Lineage). Участники включают восемь прямых LLM (включая GPT-5.5, Claude Opus 4.7, Kimi-K2-Thinking), два исследовательских агента на базе GPT-5.5 (AI Scientist v2 и CoI-Agent) и четыре CLI-харнеса, оборачивающих GPT-5.5 или Claude Opus 4.7 в workflows Codex или Claude Code.
Такое разделение позволяет отделить способность базовой модели от retrieval-heavy агентских workflow и от лёгких инструментальных обвязок. Радарный график по пяти осям способностей для пяти систем на базе GPT-5.5 показывает: исследовательские агенты практически перекрываются с прямой LLM, а CLI-харнессы перераспределяют сильные стороны вместо равномерного улучшения всех способностей.
Умеренная положительная корреляция между точностью на IG-Exam (закрытые задачи) и Heredity на IG-Arena (открытая генерация) подтверждает: понимание линий и качество генерации связаны, но не избыточны. Системы с более сильным верификационным пониманием сохраняют Heredity лучше в режиме Lineage, но корреляция не настолько сильна, чтобы одно заменяло другое.
Почему правдоподобие ≠ когерентность
На IG-Arena структурный контекст линии не просто повышает все оценки — он перемешивает рейтинги, отделяя системы, способные использовать структуру генома, от тех, кто выигрывает просто от большего объёма текста. GPT-5.5 уже хорошо работает в режиме Question-only (PES 85,2) и получает лишь +2,3 от контекста линии. Более слабые системы, такие как Kimi-K2-Thinking, выигрывают больше (+6,9), но медианный прирост составляет +4,4.
Главное открытие: прирост PES движется исключительно Heredity. Variation и Selection остаются почти константными (82,7–84,7 и 79,7–82,2) по всем настройкам и режимам динамики. А вот Heredity объясняет весь разрыв: Question-only Mutation (параметрическое изобретение без валидного родительского механизма) даёт Heredity 61,9 и PES 69,2. Lineage-setting Hybridization (рекомбинация, привязанная к явным родительским геномам и доказательствам GenomeDiff) достигает Heredity 84,2 и PES 83,6.
Это значит: сгенерированные идеи звучат ново и полезно до того, как они сохраняют точный родительский механизм или связь limitation-delta. Ungrounded комбинация может быть высокой по Variation, но низкой по Heredity. Genome-grounded рекомбинация одновременно нова и когерентна.
Расхождение PES и ELO-рейтингов (Spearman ρ = 0,82) подтверждает этот разрыв: иногда более гладкое, но lineage-некогерентное предложение побеждает в парных баттлах против менее отполированного, но лучше обоснованного. Pairwise preference улавливает поверхностную привлекательность; PES измеряет lineage-grounded population insertion.
Что это значит для автоматических исследований
Результаты указывают на конкретное направление дизайна: системам авто-исследований нужны модули композиционной верификации, а не только лучший ретривал. Когда модель может извлечь правильные статьи, но не определить, какой механизм унаследован, какое ограничение починено и какой драйвер перенесён — сгенерированное предложение остаётся тематическим соседом, а не когерентным преемником.
Фреймворк IdeaGenome даёт уровень представления ниже статьи — тот, где наследование становится явным, аудируемым и тестируемым. Это не биологическая теория науки, а операционный выбор: фиксированная гранулярность и доказательный контракт, необходимые для сравнения. Бенчмарк предоставляет substrate для измерения того, могут ли будущие системы перейти от ретривала статей и производства правдоподобного текста к верификации и расширению научных линий.
Пока что пропасть между звучанием и структурой остаётся фундаментальной. 27,3% — это не просто низкий балл; это демонстрация того, что текущие LLM оптимизированы для правдоподобия на уровне текста, а не для когерентности на уровне идей. Следующий шаг — не больше данных и не более длинные контексты, а явное моделирование того, как идеи наследуют друг друга.
Часто задаваемые вопросы
Почему 27% — это плохо, если модель «понимает» статью?
Точная метрика требует, чтобы все поля были правильными одновременно: родитель, драйвер, судьба объекта, верификация. Модель может определить статью-родителя, но присвоить неверную метку динамики или неправильно классифицировать судьбу генома. Для научного наследования частичное понимание — это всё ещё ошибка, потому что неверная атрибуция механизма ведёт к некогерентным предложениям.
Чем IG-Bench отличается от SciEval и других научных бенчмарков?
Существующие бенчмарки оценивают retrieval quality, фактичность, плавность письма, новизну, компетентность workflow. IG-Bench тестирует другую способность: когда предложение заявляет о расширении направления, наследует ли оно правильный механизм, чинит ли правильное ограничение и остаётся когерентным с линией. Это не замена, а дополнение — проверка того, что находится ниже уровня текста.
Как идея «генома» применяется на практике?
Каждая статья представляется как множество объектов Idea Genome (mechanism, limitation, delta, claim и т.д.). При сравнении двух работ GenomeDiff выравнивает эти объекты и фиксирует: унаследовано, мутировало, потеряно, импортировано, вставлено. Это превращает качественное суждение «статья продолжает линию X» в аудируемый инвентарь с доказательствами из текста.