SpectraReward: как MLLM становятся бесплатными судьями для генерации изображений
Оценка качества сгенерированной картинки — одна из самых дорогих задач в обучении с подкреплением для генеративных моделей. Нужны либо тысячи человеко-размеченных предпочтений, либо отдельная reward-модель на миллионах пар «промпт-изображение», либо сложная цепочка верификации через VQA-декомпозицию. Группа исследователей из China proposed SpectraReward — метод, который обходит все три подхода. Достаточно одного forward pass мультимодальной языковой модели, чтобы получить численную оценку качества генерации. И никаких preference-лейблов не нужно.
Проблема: reward-модели — самое узкое место в RL для генерации
В последние два года генерация изображений перешла от специализированных диффузионных моделей вроде Stable Diffusion 3 и FLUX к унифицированным мультимодальным моделям (UMM), которые одновременно понимают и генерируют картинки в одной архитектуре. Параллельно reinforcement learning стал стандартным post-training этапом — методы вроде FlowGRPO и DanceGRPO стабильно улучшают композиционную точность и следование инструкциям.
Успех RL-рецепта опирается на два компонента: алгоритм оптимизации определяет стабильность обучения, а reward-модель задаёт потолок, до которого.policy может дорасти. И вот здесь начинаются проблемы.
Первый подход — собирать масштабные датасеты человеческих предпочтений и обучать на них reward-модели (PickScore, ImageReward, HPSv2). Это работает, но стоит дорого: аннотации, итерации, смещение распределения относительно предобученных знаний. Второй подход — пропустить preference-обучение и использовать pretrained MLLM напрямую: либо скалярная оценка, либо разложение промпта на атомарные вопросы с последующей проверкой каждого (AlphaGRPO). Скалярные оценки чувствительны к калибровке «судьи», а VQA-пайплайны требуют серьёзной инженерии.
SpectraReward предлагает третий путь, который не требует ни preference-лейблов, ни дообучения reward-модели, ни многоступенчатых пайплайнов.
Идея: прочитать картинку обратно в текст
Ключевая интуиция проста. Если текстовый промпт «рыжий кот сидит на подоконнике» успешно воплощён в изображение, то мультимодальная модель, глядя на это изображение, должна с высокой вероятностью генерировать те же слова обратно. Не нужно просить модель оценить картинку по шкале от 1 до 10. Не нужно разбивать промпт на части и проверять каждую отдельно. Достаточно измерить, насколько хорошо исходный промпт восстанавливается из сгенерированного изображения.
Технически SpectraReward работает так. Берётся frozen pretrained MLLM — например, Qwen3-VL-30B. Сгенерированное изображение подаётся на вход вместе с исходным промптом. Модель проходит один teacher-forced forward pass, генерируя промпт токен за токном в условиях картинки. Для каждого токента вычисляется log-likelihood — насколько модель ожидала именно этот токен, глядя на изображение. Усреднение этих log-likelihood по всем токенам промпта даёт скалярную награду.
Получается «семантический спектр» — распределение вероятностей по токенам промпта. Ключевые слова («рыжий», «кот») получают высокие вероятности, если они визуально присутствуют. Функциональные слова («на», «и») дают менее информативный сигнал, но тоже учитываются. Всё это — один forward pass, никаких дополнительных моделей, никаких размеченных данных.
Self-SpectraReward: модель судит саму себя
Для унифицированных мультимодальных моделей, которые одновременно генерируют и понимают изображения, исследователи пошли ещё дальше. В таких архитектурах есть «ветка понимания» (understanding branch) и «ветка генерации» (generation branch). Self-SpectraReward использует ветку понимания той же самой модели как reward-функцию для ветки генерации.
Это создаёт замкнутый цикл самоусовершенствования. Генерационная часть создаёт картинки, понимающая часть их оценивает через prompt-likelihood, и градиенты обновляют обе части одновременно. Не нужны внешние reward-модели вообще. Модель использует собственные предобученные знания о связях «текст-изображение» без какого-либо внешнего знания или дообучения.
Такая архитектура решает одну из фундаментальных проблем RL для генерации — рассогласование между reward-моделью и генеративной policy. Когда reward приходит от внешней модели, обученной на другом распределении данных, возникает distribution shift. Self-SpectraReward устраняет этот разрыв полностью: reward и policy живут в одном пространстве представлений.
Масштаб эксперимента: от 4 до 235 миллиардов параметров
Исследователи не ограничились демонстрацией на одной модели. Экспериментальная валидация SpectraReward покрывает два диффузионных бэкбона (BAGEL и Show-o), три RL-алгоритма (AWM, FlowGRPO, DanceGRPO), девять reward MLLM-бэкбонов из четырёх семейств — от 4 до 235 миллиардов параметров, и пять out-of-distribution бенчмарков (GenEval, TIIF-Bench, DPG-Bench, GenEval2, WISE). Для сравнения привлекаются state-of-the-art генеративные модели: SD3 Medium, FLUX.1 dev, а также унифицированные мультимодели Show-o, JanusPro и базовая BAGEL.
Базовая модель — BAGEL, нативная AR-Diffusion унифицированная мультимодель, предобученная одновременно для понимания и генерации. Обучение SpectraReward велось на 32 GPU A100, batch size 32 промпта на шаг с gradient accumulation 8, group size 16, 380 шагов обучения, разрешение 512×512, classifier-free guidance scale 4, timestep shift 3. При тренировке используется 16 шагов сэмплирования с стохастическим выбором 6 из первых 10 denoising steps. Тренировочный датасет — AlphaGRPO20k, 20 тысяч промптов.
Результаты показывают, что SpectraReward и Self-SpectraReward стабильно и значительно улучшают качество генерации по сравнению с базовыми моделями и превосходят предыдущие методы reward-обучения на основе MLLM, включая AlphaGRPO с его VQA-декомпозицией. При этом AWM показывает лучшую общую производительность среди трёх протестированных RL-алгоритмов, что согласуется с выводами авторов оригинальной работы AWM об устойчивости к variance в reward-сигнале.
Практические последствия для open-source сообщества
Тренировочная бесплатность SpectraReward особенно ценна в контексте open-source генераторов. Сообщества, развивающие open-source модели генерации изображений, часто не имеют ресурсов для сбора масштабных preference-датасетов или обучения специализированных reward-моделей. SpectraReward даёт им возможность применять RL с качественной reward-функцией, используя любой доступный pretrained MLLM — от 4-миллиардной модели для edge-устройств до 235-миллиардной для серверных кластеров.
Особый интерес представляет Self-SpectraReward. В сценарии, когда команда развивает собственную унифицированную модель, им не нужно привлекать внешние модели для оценки качества. Вся инфраструктура замкнута внутри одной архитектуры. Это упрощает деплой, снижает latency при inference-time evaluation и устраняет зависимость от сторонних API.
Сюрприз: большие reward-модели — не всегда лучшие
Один из самых неожиданных результатов — отсутствие прямой корреляции между размером reward MLLM и качеством награды. Модели на 235 миллиардов параметров не обязательно дают лучший reward-сигнал, чем модели на 30 миллиардов. Критическим фактором оказывается не масштаб, а выравнивание (alignment) между reward-моделью и генеративной policy.
Self-SpectraReward, использующий собственную ветку понимания генеративной модели, достигает результатов на уровне или выше внешних reward-моделей, существенно превосходящих по размеру. Это означает, что в RL для генерации изображений важнее не «какую модель взять судьёй», а «насколько судья говорит на том же языке, что и генератор».
Этот вывод имеет практические последствия. Инженерам, работающим с RLHF для генерации, не обязательно гоняться за самыми большими MLLM в качестве reward-моделей. Вместо этого стоит обратить внимание на архитектурное совпадение между генератором и оценщиком — и, возможно, использовать self-rewarding подход, где модель сама себя оценивает.
Контекст: почему это важно именно сейчас
Сдвиг к унифицированным мультимодельным архитектурам — не случайность. BAGEL, JanusPro, Chameleon, Emu3 и другие модели последнего поколения стирают границу между пониманием и генерацией. Это создаёт естественную почву для self-rewarding подходов: если одна модель умеет и то, и другое, почему бы не использовать одну ветку для оценки другой?
Тренировочная бесплатность SpectraReward особенно ценна в контексте open-source генераторов. Сообщества, развивающие open-source модели генерации изображений, часто не имеют ресурсов для сбора масштабных preference-датасетов. SpectraReward даёт им возможность применять RL с качественной reward-функцией, используя любой доступный pretrained MLLM — от 4-миллиардной модели для edge-устройств до 235-миллиардной для серверных кластеров.
Сам метод «прочитай картинку обратно» перекликается с более широким трендом в evalution AI: использование генеративных моделей как верификаторов. Если модель может сгенерировать решение, она должна уметь и распознать хорошее решение. Этот принцип уже работает в текстовых LLM через self-critique и self-reflection. SpectraReward переносит его в визуальную область.
Ограничения и направления развития
Авторы честно указывают на слабые места подхода. Prompt-likelihood reward зависит от качества визуального мышления MLLM: если модель не способна распознать объект на изображении, она не сможет и оценить его присутствие через likelihood. Пространственные отношения («справа от», «между»), атрибуты, привязанные к конкретным объектам, и counting — всё это остаётся сложным для текущих MLLM и, соответственно, для их reward-сигнала.
Физические и общечеловеческие импликации тоже проблематичны. Промпт «человек пьёт кофе» подразумевает не только визуальные паттерны, но и понимание физики жидкостей, анатомии, контекста. Prompt-likelihood хорошо работает для явно визуальных атрибутов, но может не улавливать неявные смыслы.
Авторы также отмечают, что prompt-likelihood — не единственно возможная reward-функция. Комбинация с другими сигналами — эстетической оценкой, детекцией артефактов, human-preference proxy — может дать синергию. SpectraReward задаёт базовый уровень, но не закрывает вопрос полностью.
Часто задаваемые вопросы
Чем SpectraReward отличается от CLIP-оценки?
CLIP-подобные методы измеряют косинусное сходство между эмбеддингами текста и изображения в общем пространстве. SpectraReward использует совсем другой механизм — условную вероятность текста при условии изображения через авторегрессионный forward pass. Это даёт более богатый сигнал: не одно число сходства, а распределение вероятностей по каждому токену промпта, отражающее, какие части промпта воплощены, а какие нет.
Почему размер reward-модели не коррелирует с качеством?
Ключевой фактор — alignment, совпадение распределений. Когда reward-модель и генератор обучались на разных данных или имеют разную архитектуру, их представления о «качественном изображении» расходятся. Self-SpectraReward устраняет это расхождение, используя ту же модель для обеих ролей. Большой внешний MLLM может давать более «умные» оценки, но они менее полезны для конкретной генеративной policy, чем точные оценки от aligned модели.
Можно ли использовать SpectraReward для видео или 3D-генерации?
Принцип «прочитай обратно» теоретически применим к любому модальному pair. Для видео нужен MLLM, принимающий видеовход и способный генерировать текстовое описание. Для 3D — модель, работающая с трёхмерными представлениями. Препятствие техническое, не концептуальное: нужны мультимодальные модели достаточного качества в соответствующих доменах. Исследователи упоминают это как направление future work, и с учётом прогресса в видео-моделях типа Sora и 3D-генераторах типа TripoSR, адаптация SpectraReward может появиться в ближайшие месяцы.
Итог
SpectraReward показывает, что для эффективного RL в генерации изображений не нужны ни preference-датасеты, ни обученные reward-модели, ни сложные VQA-пайплайны. Достаточно frozen pretrained MLLM, одного forward pass и простой идеи: хорошая картинка — та, из которой легко восстановить исходный текст. Самоусовершенствующийся вариант Self-SpectraReward идёт дальше, замыкая цикл внутри единой модели. Результаты на пяти бенчмарках, девяти бэкбонах и трёх RL-алгоритмах подтверждают универсальность подхода. Главный практический вывод: при выборе reward-модели смотрите не на размер, а на совместимость с генератором.