Rubric-CEPR: AI-редактор изображений улучшает себя сам

Rubric-CEPR: AI-редактор изображений улучшает себя сам

Попросите сильный редактор изображений «изолируй красную рубашку», и вы получите аккуратную, фотореалистичную картинку. Вот только человек на ней останется в рубашке: модель сохранит внешний вид и провалит саму операцию. Такие ошибки авторы статьи arXiv 2610.12469 называют правдоподобными провалами, plausible failures. Заметить их по картинке почти невозможно, а цена у них высокая: именно они чаще всего превращаются в мусорные обучающие данные.

Проблема глубже, чем кажется. Инструкция к редактору всегда состоит из двух частей: выполнить запрошенное изменение и не тронуть всё остальное. Скалярная оценка «насколько результат похож на промпт» различает эти части плохо: неизменённый исходник, частичная правка и красивая картинка с потерянным содержимым получают приличные баллы. Дообучать редакторы сейчас можно либо на парах «до/после», которые размечают люди, либо на внешних reward-моделях и мультимодальных судьях. И то, и другое дорого масштабируется, а лояльный скалярный сигнал легко закрепляет провал как эталон.

Исследователи предложили Rubric-CEPR: фреймворк, в котором pretrained-редактор улучшает сам себя на собственных генерациях. Ни человеческих пар, ни внешней reward-модели: проверка идёт внутренними представлениями самого редактора.

Что такое Rubric-CEPR

Rubric-CEPR это метод самообучения редакторов изображений: планировщик предлагает структурированные инструкции из неразмеченных картинок, редактор сэмплирует несколько вариантов правки, а замороженный критик оценивает каждый вариант по декомпозированной рубрике. Лучший кандидат, прошедший все проверки, становится целью для self-distillation, то есть дообучения на собственном отобранном результате.

Как редактор изображений учится сам: цикл propose-edit-verify-distill

Первую роль играет планировщик, Qwen2.5-VL с LoRA-адаптером. Из неразмеченного изображения он генерирует инструкцию и машиночитаемую спецификацию: тип правки, сущности источника и цели, регион, обязательные и запрещённые состояния после правки, контент для сохранения. «Изолируй красную рубашку» превращается в список проверок: полная рубашка обязана появиться в результате, человек и фон считаются запрещённым содержимым, внешний вид рубашки нужно сохранить. Спецификация не является второй картинкой-эталоном, она лишь задаёт атомарные вопросы для критика.

Вторую роль исполняет редактор, MMDiT-ветка Qwen-Image-Edit, и на каждую инструкцию он сэмплирует K = 4 кандидата. Третья роль у критика: замороженные компоненты того же бэкбона, а именно фичи Qwen-VL, VAE-латент и статистики изображения, возвращают каждому кандидату награду и флаг feasibility. Выживает один, кандидат с максимальной наградой среди прошедших ворота. Если не прошёл никто, предложение не даёт обучающего примера вообще.

Дальше лучший кандидат дистиллируется в редактор через лёгкий LoRA-адаптер: ранг 16, 400 шагов обучения, нативная flow-matching цель денойзинга. В обучающую смесь добавляются identity-пары для воспроизведения, а сам адаптер пришпилен к warm-start чекпойнту штрафом за отклонение. Внешних моделей в этом контуре нет: авторы отдельно подчёркивают, что основной прогон не запрашивает ни человеческих целей, ни внешнего судьи.

Награда, которую трудно обмануть

Ключевая деталь метода, награда CEPR (Contrastive Edit-Preservation Reward), работает на двух уровнях. Контрастная часть сравнивает поддержку запрошенной правки с поддержкой неправильных альтернативных инструкций: кандидат обязан выигрывать у дистракторов, а не просто «нравиться» модели. Preservation-часть награждает сохранение содержимого, которое инструкция не трогает, причём сразу на двух уровнях, семантическом и латентном. Рубрика добавляет явные проверки для обязательных состояний, удаления старого состояния и сохранения.

Агрегация намеренно некомпенсирующая. Скаляр собирается как геометрическое среднее, а feasibility-ворота требуют, чтобы прошла каждая применимая проверка: реализация правки, отсутствие старого состояния, сохранение, валидность, плюс общий порог на итоговый балл. Провал одной проверки нельзя отыграть другими. Именно эта деталь не пускает правдоподобные провалы в обучающую выборку.

Насколько это важно, видно по замерам. Скалярная награда присваивает мусорным кандидатам (no-op, повреждённым, неверным правкам) баллы от 0,39 до 0,60, то есть держит их в зоне «нормально». Полный верификационный банк принимает 50,5% валидных правок и ноль процентов из трёх негативных контролей. Когда селектор выбирает лучшую правку из пары, CEPR угадывает в 84,8% случаев против 36,7% у наивного произведения тех же компонент, при случайном шансе 50%. Наивный композит рушится на семействах, где базовая модель уже сильна: 0,13 на action change, потому что переоценивает сохранение в ущерб правке.

Результаты: +5,5% на ImgEdit и +24,9% на изоляции объектов

Базовая модель, Qwen-Image-Edit-2509, на бенчмарке ImgEdit набирает 4,36. После self-distillation 4,60, рост +5,5%, и он воспроизводится на трёх сидах: 4,58, 4,60, 4,62 (±0,02 SD). Самое слабое семейство, изоляция объектов, выросло с 3,41 до 4,26, это +24,9%. Композиция прибавила 8,4%, остальные семь семейств от +2,8% до +4,3%. Если считать от потолка 5,0, метод закрывает от 22% до 53% оставшегося разрыва в каждом семействе.

Перенос на другие бенчмарки идёт без дополнительной адаптации. Тот же чекпойнт поднимает GEdit-Bench с 7,39 до 8,31 (+12,4%) и Complex-Edit с 8,77 до 8,97 (+2,3%), включая identity preservation +1,8% и perceptual quality +4,9%.

Процедура не привязана к одному бэкбону. На Step1X-Edit, с его собственными VLM и VAE фичами и без весов Qwen, она даёт ImgEdit 3,86 → 4,16 (+7,8%) и GEdit-Bench 6,69 → 7,24 (+8,2%). Для сравнения: UniWorld, дообучающий тот же Qwen-Image-Edit внешней мультимодальной reward-моделью, сообщает +3,0% над своим базисом. Правда, протоколы оценки у работ различаются, так что сравнивать надо осторожно.

Почему верификация решает

Самый показательный блок статьи, сравнение с наивными схемами. Ungated self-training, где в обучение уходят все кандидаты подряд, даёт +2,0% на ImgEdit. Pairwise DPO на сгенерированных парах, +0,7%. Rubric-CEPR, +5,5%. Разница не в архитектуре и не в объёме вычислений, а в качестве целей.

Манифест обучения объясняет механику провала наивного цикла: к последнему раунду отклонённых кандидатов накопилось 546 против 302 принятых, а среди принятых доминируют простые цветовые правки. Удаление и замена, самые нужные операции, почти не получают целей. Ворота решают именно эту асимметрию: пропускают меньшую долю кандидатов, зато каждый оставшийся выдерживает декомпозированную проверку.

Диагностика по числу сэмплов добавляет важный нюанс. На пробе из шести семейств изоляция объектов выигрывает от роста K сильнее всех: с 2,97 в базе до 4,15 при K = 2, 4,68 при K = 4 и 4,82 при K = 5, то есть +1,86 к базе. Это в шесть-семь раз больше, чем у семейств, где базовая модель уже подпирает потолок 5,0. Закономерность прозрачная: self-distillation выигрывает там, где у редактора есть большой нереализованный запас, а критерий успеха проверяется внутренне.

Второй источник прироста, планировщик. Обученный Planner поднимает долю источников, у которых находится хотя бы один прошедший ворота кандидат, с 12,5% до 20,3%, это +62,4% относительно, и добавляет +0,10 SD на ImgEdit сверх версии с замороженным планировщиком. Слепой аудит подтверждает: предложения корректно заземлены для 58 из 64 источников (κ = 0,82). Качество предложений, а не только отбор целей, двигает self-distillation вперёд.

Границы метода

Раздел с ограничениями честный. Метод усиливает только то поведение, у которого уже есть ненулевая вероятность в распределении редактора: шанс найти цель среди K кандидатов равен 1 − (1 − p)^K, и при p = 0 рост K не поможет. Если базовая модель вообще не умеет операцию, из неё её не вытянуть.

Дальше граница проверяемости. Прирост концентрируется там, где критерий успеха вычислим внутренними сигналами: на adjustment-правках, то есть изменении атрибутов, тестируемые внутренние сигналы восстанавливают не больше 30% оракульного headroom. Похожая картина в диагностике отбора: для object removal внутренний критик захватывает 61% доступного прироста, для изоляции 30%.

Ещё ограничения: нужен доступ к мультимодальным фичам и латентам редактора, доказательства собраны на двух редакторах, и показан один проход адаптации. Расширение охвата на четыре типа правок не даёт накопления: общий выигрыш +5,3% против +5,5%, а выигрыш на композиции падает с +8,4% до +3,2%.

Почему это важно

За последний год идея self-evolving моделей перебралась из текстовой моды в мультимодальную. LLM уже умеют генерировать себе обучающие данные, когда корректность проверяется по тексту: согласие ответов, цепочки рассуждений, обученный судья. Rubric-CEPR переносит рецепт туда, где проверять сложнее, в редактирование изображений, и делает ставку на внутренние представления вместо внешнего арбитра.

Экономический смысл понятен: пост-тренировка редакторов перестаёт зависеть от дорогой разметки пар «до/после». Исследовательский смысл тоньше. Некомпенсирующие рубричные ворота это, по сути, инженерный ответ на проблему reward hacking: скалярная награда почти всегда вознаграждает суррогат, и авторы обходят это декомпозицией на атомарные проверки, которые нельзя обменять одну на другую. Тот же принцип, который в LLM-литературе обсуждается как борьба с наградным обманом, здесь встроен прямо в контур обучения.

Но граница self-verifiability остаётся. Метод работает не вместо внешних сигналов, а там, где успех операции можно проверить внутренне. Где нельзя, где нужно внешнее знание, ворота молчат, и никакое увеличение числа сэмплов этого не исправит.

Для практиков вывод двойной. С одной стороны, рецепт снижает зависимость от разметки: вместо тысяч человеческих пар «до/после» нужны неразмеченные картинки и запас вычислений на сэмплирование кандидатов. С другой, метод требует доступа к внутренним представлениям редактора, то есть открытых весов или собственного пайплайна, а чёрный ящик через API так не улучшить. И финальная оценка в статье опирается на автоматических судей, что авторы честно записывают в ограничения.

Часто задаваемые вопросы

Что такое self-distillation в этом контексте?

Self-distillation здесь означает обучение редактора на его же лучших результатах. Критик отбирает кандидата, который прошёл все рубричные проверки и набрал максимальную награду, и этот отобранный результат становится целью для дообучения через LoRA. Модель учится на своих успехах, отфильтрованных собственной внутренней верификацией.

Может ли редактор улучшаться так бесконечно?

Нет. Если операция не имеет ненулевой вероятности в распределении модели, сэмплирование её не найдёт, сколько кандидатов ни генерируй. Плюс прирост ограничен границей self-verifiability: там, где успех нельзя проверить внутренними сигналами, метод восстанавливает лишь часть доступного улучшения. Авторы прямо называют многократную самоэволюцию направлением будущих работ.

Нужна ли внешняя reward-модель?

Для обучения нет: основной прогон использует только внутренние фичи редактора, VAE-латенты и статистики изображений. Внешние судьи (GPT-скоринг ImgEdit и подобные) применяются только на этапе оценки бенчмарков. Ограничение в другом: у редактора должен быть доступ к своим мультимодальным представлениям, что верно не для всех архитектур.

Итог

Rubric-CEPR показывает, что редактор изображений способен улучшать себя без разметки и внешних судей, если разложить критерий успеха на атомарные проверки и запретить их взаимную компенсацию. +5,5% на ImgEdit, +24,9% на изоляции объектов, перенос на GEdit-Bench и второй бэкбон Step1X-Edit, при том что все цели для обучения модель добыла из собственных генераций. Код открыт на странице проекта, сама статья на arXiv.

Тренд на самоэволюционирующие модели получил ещё одно подтверждение: следующий большой рывок может прийти не от новых данных, а от более честной проверки того, что модель уже умеет. Если тема самообучения интересна, посмотрите наши разборы WorldEvolver про самоэволюционирующие модели мира и reward hacking в LLM. А вы бы доверили модели проверять собственные правки, или оставили бы последнее слово человеку?

← Все записи