SciDiagramEdit: AI-агент научился редактировать научные диаграммы как живой редактор
Научная диаграмма — это не просто картинка в статье. Это концентрированное визуальное доказательство, которое рецензенты и читатели считывают за секунды. Авторы статей знают: прежде чем диаграмма станет финальной, она проходит 10–20 итераций правок — перестановка панелей, переименование подписей, перекраска блоков. Каждый раунд — микро-решения о композиции, смысловых акцентах и визуальной иерархии.
Проблема в том, что все существующие инструменты ИИ для научных иллюстраций работают только «с нуля» — генерируют диаграмму по текстовому описанию. А вот режим редактирования — когда нужно взять существующую фигуру и внести точечные изменения по естественной инструкции — оставался полностью закрытым. До сих пор.
Команда исследователей представила SciDiagramEdit — первый фреймворк, который обучает агента редактировать научные диаграммы через эволюцию навыков, используя реальные пары правок из пересмотров статей на arXiv.
Что такое SciDiagramEdit и почему это сложно
Научная диаграмма — это плотный инфографический объект, где смешаны схемы, графики, фотографии, подписи и стрелки. Редактировать такую фигуру по текстовой инструкции означает выполнять локализованные композиционные операции: сдвинуть панель, переименовать элемент, перекрасить блок, переложить компоновку — не задев остальное.
Коммерческие растровые редакторы вроде GPT-Image-2 или Nano Banana Pro умеют перерисовать сложную фигуру по промпту, но делают это в один проход на уровне пикселей. Результат — растрированное изображение, которое нельзя дальше править по слоям. Для научной работы это критично: после ИИ-правки автору всё равно нужно двигать мелочи, менять числа в осях, подправлять подписи.
SciDiagramEdit решает эту проблему радикально: агент работает на уровне SVG-кода. Каждая правка — это модификация векторных примитивов. Выходной файл остаётся редактируемым в Inkscape, Illustratorе или любом SVG-редакторе. Структура, слои и группы сохраняются.
Архитектура: три агента в цикле улучшения
Система состоит из трёх компонентов, которые работают в итеративном цикле.
Editor (ℰ) — центральный агент. Получает на вход исходную SVG-фигуру и текстовую инструкцию («поменяй панели 1×4 на 2×2», «убери процентные подписи», «перекрась блок A в синий»). Работает с code-level инструментами — выполняет Python-код, манипулирующий SVG-деревом. Editor опирается на текущую «спецификацию навыков» — набор правил, которые он усвоил из предыдущих итераций.
Judge (𝒥) — оценивает результат по двум осям. Семантическая точность (semantic faithfulness) измеряется через чек-лист из атомарных утверждений — каждая правка из инструкции должна быть выполнена. Эстетическое качество (aesthetic quality) оценивается pairwise-сравнением с эталонной правкой автора через модель UniPercept.
Coach (𝒞) — анализирует execution trace агента (какие команды вызывал, какие ошибки допустил), сравнивает результат с эталоном автора и генерирует «патч» к спецификации навыков. Например: «после структурного перелоja всегда сжимай viewBox», «при перекраске блока сохраняй толщину контура».
Цикл повторяется: Editor → Judge → Coach → обновлённые навыки → снова Editor. На каждой итерации агент накапливает библиотеку правил, закреплённых за конкретными типами сбоев.
Бенчмарк: 364 реальные пары правок из arXiv
Главная сложность в создании такого бенчмарка — достать «до/после» пары с реальными намерениями автора. Synthetically сгенерированные инструкции плохо отражают практику: настоящие правки диаграмм редко формулируются как «измени цвет блока на #FF0000», они выглядят как «давай сделаем этот компонент более заметным, чтобы рецензент сразу увидел основной pipeline».
Исследователи решили это элегантно: они взяли 364 пары фигур из двух версий одних и тех же статей на arXiv. Автор статьи сам правил свою диаграмму между версиями — это и есть ground truth. Аннотаторы затем формулировали естественные инструкции, описывающие намерение каждой правки.
Статистика датасета: 2628 атомарных утверждений, распределённых по четырём категориям — Content (добавление/удаление элементов), Structure (перекомпоновка), Visual (стилизация, цвета), Misc. Фигуры покрывают 23 категории arXiv, при этом 73.6% приходятся на машинное обучение (cs.LG, cs.CL, cs.CV, cs.RO).
Как создавался датасет: от сырого diff'а до осмысленной инструкции
Процесс кураторства — отдельная история. Сырой визуальный diff между двумя версиями одной и той же фигуры на arXiv часто содержит шум: перерендер растра, замену шрифта, незначительные изменения позиционирования без смысловой нагрузки. А иногда авторы полностью заменяют фигуру — это уже не редактирование, а перерисовка с нуля.
Команда SciDiagramEdit оставила только «среднюю полосу» — случаи, где автор добавил панель, переименовал подпись, перенаправил стрелку или перекомпоновал элементы, сохранив достаточно оригинальной структуры, чтобы изменение читалось как edit, а не как redraw. Даже в этой «средней полосе» визуальный diff сам по себе не раскрывает намерение автора: одна и та же поверхностная правка может выражать разные интенты. Поэтому инструкции не извлекались автоматически — их формулировали аннотаторы вручную через Gradio-интерфейс с поддержкой vision LLM для итеративного уточнения.
Результат: 2628 атомарных утверждений, каждое привязано к конкретной паре «до/после» и конкретной текстовой инструкции. Это первый бенчмарк, который одновременно закрывает четыре условия: режим редактирования, домен научных диаграмм, paired before/after данные и естественно возникшие авторские инструкции.
Результаты: GPT-5.5 с эволюцией навыков обходит GPT-5.5 без неё
Ключевой эксперимент — сравнение одного и того же backbone-модели с эволюционированными навыками и без них. На GPT-5.5:
Без навыков: semantic win rate 0.745, aesthetic 0.466. С evolved skill: semantic 0.756 (+0.011), aesthetic 0.515 (+0.049).
Прирост в эстетике особенно показателен — почти 5 процентных пунктов. Агент научился не делать типовые ошибки вроде «оставить пустые полосы после перекладки панелей» — это ровно то, что фиксирует правило «сжимай viewBox после структурного переложа».
Ещё более интересный результат — трансфер навыков. Навыки, эволюционировавшие на GPT-5.5, применяются к GPT-5.3 без переобучения. Semantic score GPT-5.3 прыгает с 0.659 до 0.706 (+0.047), aesthetic — с 0.285 до 0.358 (+0.073). Это означает, что накопленные правила редактирования — не специфичны для одной модели, а представляют собой универсальную библиотеку знаний о том, как правильно редактировать SVG.
В прямом сравнении с растровым редактором GPT-Image-2 система достигает паритета по семантике, но сохраняет векторную редактируемость — качество, которого растровые модели не имеют в принципе.
Библиотека навыков: что агент усвоил
Эволюционированная спецификация навыков — это не один общий промпт, а структурированная библиотека файлов:
SKILL/
├── SKILL.md
└── workflows/
├── safe-string-replace.md
├── math-notation.md
├── post-restructure-compactness.md
├── deliverable.md
└── ...
Каждый файл описывает триггер и правило. Например, post-restructure-compactness.md срабатывает всякий раз, когда агент выполнил структурную перекладку — и указывает пересчитать viewBox. safe-string-replace.md учит, как безопасно заменять текстовые подписи в SVG без поломки атрибутов. math-notation.md контролирует корректность LaTeX-формул внутри диаграмм.
Это похоже на то, как живой редактор накапливает чек-листы типовых правок: «всегда проверяй alignment после перемещения», «не забудь обновить легенду при смене цветовой схемы». Разница в том, что эти правила выводятся автоматически из execution traces и паттернов ошибок.
Место в экосистеме: как SciDiagramEdit соотносится с существующими работами
До появления SciDiagramEdit в этой области были два непересекающихся направления. Первое — генерация научных диаграмм с нуля: системы вроде AutoFigure, PaperBanana и SciFig, которые строят SVG по текстовому описанию. Второе — instruction-based редактирование, но на generic SVG-объектах: SVGEditBench V2 работает с эмодзи-иконками, AutoFigure-Edit — подмножество AutoFigure с 200 парами.
SciDiagramEdit находится на пересечении: это именно научные диаграммы, именно режим редактирования, именно пары до/после с естественно возникшими инструкциями. Ни один из предыдущих бенчмарков не закрывал все четыре условия одновременно. При этом система оценки заимствует идеи из rubric-based протоколов AIBench и SridBench — чек-листов с атомарными утверждениями, адаптированных под задачу редактирования.
Практические импликации: что это меняет для исследователей
Представьте типичный сценарий: вы получили reviewer comments с просьбой «перекладывать pipeline diagram, чтобы подчеркнуть contribution B». Сегодня это означает открыть Inkscape, вручную двигать блоки, следить за выравниванием, обновлять подписи, перекрашивать стрелки. Каждый раунд правок — 30–60 минут работы, и это повторяется 3–5 раз до camera-ready.
SciDiagramEdit предлагает альтернативу: описать правку текстом, получить SVG-результат, который остаётся полностью редактируемым. Если результат не идеален — повторить с уточнённой инструкцией. Навыки, накопленные в процессе эволюции, означают, что типичные ошибки (оставшиеся пустые полосы, сломанные viewBox, неправильная толщина контуров) агент уже знает и исправляет preemptively.
Это не заменяет human judgment — автор всё равно принимает финальное решение. Но оно превращает 30-минутный цикл ручной работы в 2-минутный цикл «напиши инструкцию → проверь результат → подтверди или скорректируй».
Ограничения и что дальше
Авторы честно отмечают три ограничения. Первое: бенчмарк охватывает только правки, где намерение явно сформулировано в инструкции. Случаи, где нужно вывести намерение из контекста всей статьи — это следующий уровень сложности.
Второе: цикл эволюции всё ещё оркестрируется извне. Полностью автономная система должна была бы самостоятельно решать, когда навыки достаточно хороши и какие компромиссы между эстетикой и семантикой считать приемлемыми.
Третье: масштаб эксперимента скромен — 364 тренировочные пары и несколько десятков шагов эволюции. Авторы предполагают, что масштабирование может выявить эмерджентные поведения и более абстрактные правила, чем текущий бюджет позволяет.
FAQ
Почему именно SVG, а не растровая графика? SVG — это векторный формат с явной структурой: группы, слои, текстовые элементы. Агент может точечно модифицировать отдельный компонент, не затрагивая остальное. Результат остаётся редактируемым в любом векторном редакторе, что критично для научной работы, где автор продолжает править после автоматической обработки.
Можно ли применить этот подход к другим типам графики? Да, архитектура достаточно общая. Coach-агент анализирует execution traces и извлекает правила — этот механизм не привязан к научным диаграммам. Адаптация потребует другого набора инструментов Editor'а и другого бенчмарка с до/после парами, но цикл эволюции навыков переносим.
Какие модели поддерживаются как backbone? В экспериментах использованы GPT-5.1, GPT-5.3, GPT-5.4 и GPT-5.5. Навыки трансферируются между моделями — библиотеку правил, выученную на GPT-5.5, можно применить к более ранним версиям и получить улучшение без переобучения.
Итог
SciDiagramEdit закрывает пробел между генерацией и редактированием научных иллюстраций. Вместо одноразовой генерации «с нуля» — итеративный процесс правок, в котором агент накапливает навыки из собственных ошибок. 364 реальные пары из arXiv-пересмотров дают беспрецедентный бенчмарк для режима редактирования. Эволюция навыков даёт +5% к эстетике и переносится между моделями. А главное — результат остаётся SVG, а не растром, что сохраняет рабочий процесс исследователя нетронутым.
Если вы публикуете научные статьи и тратите часы на итеративные правки диаграмм по комментариям соавторов — это тот класс инструментов, за которым стоит следить. Открытый код и бенчмарк обещают под лицензией CC BY-NC 4.0.