SciDiagramEdit: AI-агент научился редактировать научные диаграммы как живой редактор

SciDiagramEdit: AI-агент научился редактировать научные диаграммы как живой редактор

Научная диаграмма — это не просто картинка в статье. Это концентрированное визуальное доказательство, которое рецензенты и читатели считывают за секунды. Авторы статей знают: прежде чем диаграмма станет финальной, она проходит 10–20 итераций правок — перестановка панелей, переименование подписей, перекраска блоков. Каждый раунд — микро-решения о композиции, смысловых акцентах и визуальной иерархии.

Проблема в том, что все существующие инструменты ИИ для научных иллюстраций работают только «с нуля» — генерируют диаграмму по текстовому описанию. А вот режим редактирования — когда нужно взять существующую фигуру и внести точечные изменения по естественной инструкции — оставался полностью закрытым. До сих пор.

Команда исследователей представила SciDiagramEdit — первый фреймворк, который обучает агента редактировать научные диаграммы через эволюцию навыков, используя реальные пары правок из пересмотров статей на arXiv.

Что такое SciDiagramEdit и почему это сложно

Научная диаграмма — это плотный инфографический объект, где смешаны схемы, графики, фотографии, подписи и стрелки. Редактировать такую фигуру по текстовой инструкции означает выполнять локализованные композиционные операции: сдвинуть панель, переименовать элемент, перекрасить блок, переложить компоновку — не задев остальное.

Коммерческие растровые редакторы вроде GPT-Image-2 или Nano Banana Pro умеют перерисовать сложную фигуру по промпту, но делают это в один проход на уровне пикселей. Результат — растрированное изображение, которое нельзя дальше править по слоям. Для научной работы это критично: после ИИ-правки автору всё равно нужно двигать мелочи, менять числа в осях, подправлять подписи.

SciDiagramEdit решает эту проблему радикально: агент работает на уровне SVG-кода. Каждая правка — это модификация векторных примитивов. Выходной файл остаётся редактируемым в Inkscape, Illustratorе или любом SVG-редакторе. Структура, слои и группы сохраняются.

Архитектура: три агента в цикле улучшения

Система состоит из трёх компонентов, которые работают в итеративном цикле.

Editor (ℰ) — центральный агент. Получает на вход исходную SVG-фигуру и текстовую инструкцию («поменяй панели 1×4 на 2×2», «убери процентные подписи», «перекрась блок A в синий»). Работает с code-level инструментами — выполняет Python-код, манипулирующий SVG-деревом. Editor опирается на текущую «спецификацию навыков» — набор правил, которые он усвоил из предыдущих итераций.

Judge (𝒥) — оценивает результат по двум осям. Семантическая точность (semantic faithfulness) измеряется через чек-лист из атомарных утверждений — каждая правка из инструкции должна быть выполнена. Эстетическое качество (aesthetic quality) оценивается pairwise-сравнением с эталонной правкой автора через модель UniPercept.

Coach (𝒞) — анализирует execution trace агента (какие команды вызывал, какие ошибки допустил), сравнивает результат с эталоном автора и генерирует «патч» к спецификации навыков. Например: «после структурного перелоja всегда сжимай viewBox», «при перекраске блока сохраняй толщину контура».

Цикл повторяется: Editor → Judge → Coach → обновлённые навыки → снова Editor. На каждой итерации агент накапливает библиотеку правил, закреплённых за конкретными типами сбоев.

Бенчмарк: 364 реальные пары правок из arXiv

Главная сложность в создании такого бенчмарка — достать «до/после» пары с реальными намерениями автора. Synthetically сгенерированные инструкции плохо отражают практику: настоящие правки диаграмм редко формулируются как «измени цвет блока на #FF0000», они выглядят как «давай сделаем этот компонент более заметным, чтобы рецензент сразу увидел основной pipeline».

Исследователи решили это элегантно: они взяли 364 пары фигур из двух версий одних и тех же статей на arXiv. Автор статьи сам правил свою диаграмму между версиями — это и есть ground truth. Аннотаторы затем формулировали естественные инструкции, описывающие намерение каждой правки.

Статистика датасета: 2628 атомарных утверждений, распределённых по четырём категориям — Content (добавление/удаление элементов), Structure (перекомпоновка), Visual (стилизация, цвета), Misc. Фигуры покрывают 23 категории arXiv, при этом 73.6% приходятся на машинное обучение (cs.LG, cs.CL, cs.CV, cs.RO).

Как создавался датасет: от сырого diff'а до осмысленной инструкции

Процесс кураторства — отдельная история. Сырой визуальный diff между двумя версиями одной и той же фигуры на arXiv часто содержит шум: перерендер растра, замену шрифта, незначительные изменения позиционирования без смысловой нагрузки. А иногда авторы полностью заменяют фигуру — это уже не редактирование, а перерисовка с нуля.

Команда SciDiagramEdit оставила только «среднюю полосу» — случаи, где автор добавил панель, переименовал подпись, перенаправил стрелку или перекомпоновал элементы, сохранив достаточно оригинальной структуры, чтобы изменение читалось как edit, а не как redraw. Даже в этой «средней полосе» визуальный diff сам по себе не раскрывает намерение автора: одна и та же поверхностная правка может выражать разные интенты. Поэтому инструкции не извлекались автоматически — их формулировали аннотаторы вручную через Gradio-интерфейс с поддержкой vision LLM для итеративного уточнения.

Результат: 2628 атомарных утверждений, каждое привязано к конкретной паре «до/после» и конкретной текстовой инструкции. Это первый бенчмарк, который одновременно закрывает четыре условия: режим редактирования, домен научных диаграмм, paired before/after данные и естественно возникшие авторские инструкции.

Результаты: GPT-5.5 с эволюцией навыков обходит GPT-5.5 без неё

Ключевой эксперимент — сравнение одного и того же backbone-модели с эволюционированными навыками и без них. На GPT-5.5:

Без навыков: semantic win rate 0.745, aesthetic 0.466. С evolved skill: semantic 0.756 (+0.011), aesthetic 0.515 (+0.049).

Прирост в эстетике особенно показателен — почти 5 процентных пунктов. Агент научился не делать типовые ошибки вроде «оставить пустые полосы после перекладки панелей» — это ровно то, что фиксирует правило «сжимай viewBox после структурного переложа».

Ещё более интересный результат — трансфер навыков. Навыки, эволюционировавшие на GPT-5.5, применяются к GPT-5.3 без переобучения. Semantic score GPT-5.3 прыгает с 0.659 до 0.706 (+0.047), aesthetic — с 0.285 до 0.358 (+0.073). Это означает, что накопленные правила редактирования — не специфичны для одной модели, а представляют собой универсальную библиотеку знаний о том, как правильно редактировать SVG.

В прямом сравнении с растровым редактором GPT-Image-2 система достигает паритета по семантике, но сохраняет векторную редактируемость — качество, которого растровые модели не имеют в принципе.

Библиотека навыков: что агент усвоил

Эволюционированная спецификация навыков — это не один общий промпт, а структурированная библиотека файлов:

SKILL/
├── SKILL.md
└── workflows/
    ├── safe-string-replace.md
    ├── math-notation.md
    ├── post-restructure-compactness.md
    ├── deliverable.md
    └── ...

Каждый файл описывает триггер и правило. Например, post-restructure-compactness.md срабатывает всякий раз, когда агент выполнил структурную перекладку — и указывает пересчитать viewBox. safe-string-replace.md учит, как безопасно заменять текстовые подписи в SVG без поломки атрибутов. math-notation.md контролирует корректность LaTeX-формул внутри диаграмм.

Это похоже на то, как живой редактор накапливает чек-листы типовых правок: «всегда проверяй alignment после перемещения», «не забудь обновить легенду при смене цветовой схемы». Разница в том, что эти правила выводятся автоматически из execution traces и паттернов ошибок.

Место в экосистеме: как SciDiagramEdit соотносится с существующими работами

До появления SciDiagramEdit в этой области были два непересекающихся направления. Первое — генерация научных диаграмм с нуля: системы вроде AutoFigure, PaperBanana и SciFig, которые строят SVG по текстовому описанию. Второе — instruction-based редактирование, но на generic SVG-объектах: SVGEditBench V2 работает с эмодзи-иконками, AutoFigure-Edit — подмножество AutoFigure с 200 парами.

SciDiagramEdit находится на пересечении: это именно научные диаграммы, именно режим редактирования, именно пары до/после с естественно возникшими инструкциями. Ни один из предыдущих бенчмарков не закрывал все четыре условия одновременно. При этом система оценки заимствует идеи из rubric-based протоколов AIBench и SridBench — чек-листов с атомарными утверждениями, адаптированных под задачу редактирования.

Практические импликации: что это меняет для исследователей

Представьте типичный сценарий: вы получили reviewer comments с просьбой «перекладывать pipeline diagram, чтобы подчеркнуть contribution B». Сегодня это означает открыть Inkscape, вручную двигать блоки, следить за выравниванием, обновлять подписи, перекрашивать стрелки. Каждый раунд правок — 30–60 минут работы, и это повторяется 3–5 раз до camera-ready.

SciDiagramEdit предлагает альтернативу: описать правку текстом, получить SVG-результат, который остаётся полностью редактируемым. Если результат не идеален — повторить с уточнённой инструкцией. Навыки, накопленные в процессе эволюции, означают, что типичные ошибки (оставшиеся пустые полосы, сломанные viewBox, неправильная толщина контуров) агент уже знает и исправляет preemptively.

Это не заменяет human judgment — автор всё равно принимает финальное решение. Но оно превращает 30-минутный цикл ручной работы в 2-минутный цикл «напиши инструкцию → проверь результат → подтверди или скорректируй».

Ограничения и что дальше

Авторы честно отмечают три ограничения. Первое: бенчмарк охватывает только правки, где намерение явно сформулировано в инструкции. Случаи, где нужно вывести намерение из контекста всей статьи — это следующий уровень сложности.

Второе: цикл эволюции всё ещё оркестрируется извне. Полностью автономная система должна была бы самостоятельно решать, когда навыки достаточно хороши и какие компромиссы между эстетикой и семантикой считать приемлемыми.

Третье: масштаб эксперимента скромен — 364 тренировочные пары и несколько десятков шагов эволюции. Авторы предполагают, что масштабирование может выявить эмерджентные поведения и более абстрактные правила, чем текущий бюджет позволяет.

FAQ

Почему именно SVG, а не растровая графика? SVG — это векторный формат с явной структурой: группы, слои, текстовые элементы. Агент может точечно модифицировать отдельный компонент, не затрагивая остальное. Результат остаётся редактируемым в любом векторном редакторе, что критично для научной работы, где автор продолжает править после автоматической обработки.

Можно ли применить этот подход к другим типам графики? Да, архитектура достаточно общая. Coach-агент анализирует execution traces и извлекает правила — этот механизм не привязан к научным диаграммам. Адаптация потребует другого набора инструментов Editor'а и другого бенчмарка с до/после парами, но цикл эволюции навыков переносим.

Какие модели поддерживаются как backbone? В экспериментах использованы GPT-5.1, GPT-5.3, GPT-5.4 и GPT-5.5. Навыки трансферируются между моделями — библиотеку правил, выученную на GPT-5.5, можно применить к более ранним версиям и получить улучшение без переобучения.

Итог

SciDiagramEdit закрывает пробел между генерацией и редактированием научных иллюстраций. Вместо одноразовой генерации «с нуля» — итеративный процесс правок, в котором агент накапливает навыки из собственных ошибок. 364 реальные пары из arXiv-пересмотров дают беспрецедентный бенчмарк для режима редактирования. Эволюция навыков даёт +5% к эстетике и переносится между моделями. А главное — результат остаётся SVG, а не растром, что сохраняет рабочий процесс исследователя нетронутым.

Если вы публикуете научные статьи и тратите часы на итеративные правки диаграмм по комментариям соавторов — это тот класс инструментов, за которым стоит следить. Открытый код и бенчмарк обещают под лицензией CC BY-NC 4.0.

← Все записи