Swift-Image: как 6B-модель обходит 20B редакторы изображений
Третье место в общем зачёте по редактированию изображений, впереди всех открытых моделей и позади только GPT-Image-2 и Seedream5 Pro. При этом у модели всего 6 миллиардов параметров, а на её обучение ушло 243 тысячи GPU-часов. Это Swift-Image, новая работа Alibaba Group, опубликованная на arXiv 20 августа 2026 года, и её главный вывод неприятен для тех, кто меряет модели размером: десятки миллиардов параметров для сильного визуального генератора не обязательны.
Что такое Swift-Image
Swift-Image: компактная унифицированная модель от Alibaba, которая в одном наборе весов совмещает три задачи: генерацию изображений по тексту, редактирование одного изображения и редактирование сразу нескольких. Вместо отдельных моделей под каждую задачу используется единый генеративный бэкбон на 6B параметров, а семейство сжатых вариантов на 3B и с ускоренным сэмплированием сохраняет тот же интерфейс почти без потери качества.
Исследователи сформулировали задачу предельно прагматично: как далеко можно протолкнуть небольшой визуальный генератор за счёт системного инжиниринга обучения при жёстком бюджете вычислений. Никаких принципиально новых компонентов в статье не заявлено. Ценность работы в другом: авторы собрали известные техники в единый конвейер, показали, как они взаимодействуют, и честно описали, что сработало, а что нет.
Архитектура: один поток вместо двух
В основе лежит однопоточный Diffusion Transformer на 6B параметров, который получает мультимодальные представления от vision-language энкодера. Авторы использовали разделяемую между блоками модуляцию по временному шагу, параллельное вычисление attention и MLP, четырёхмерное роторное позиционное кодирование и единое представление текстовых и визуальных условий.
Здесь есть деталь, которую легко пропустить. Разделяемая модуляция слегка уменьшает ёмкость отдельной ветви, но освобождает параметры для ядра модели, то есть для attention и MLP слоёв. По опыту команды, такая глобальная перераспределённость бюджета даёт больше, чем локальное наращивание каждого компонента по отдельности.
Для текста, который должен появиться на картинке, применяется посимвольная токенизация, что критично для рендеринга надписей. Мультиизображенческие позиционные сдвиги и формат «изображение перед условием» поддерживают редактирование по референсам. Всё это работает в одних весах без задачеспецифичных голов.
Ещё одно наблюдение из статьи бьёт по популярной интуиции. Более сильная мультимодальная модель понимания не даёт автоматически лучшие условия для обучения DiT. Представления, заточенные под вопросно-ответное рассуждение, сходятся медленнее, когда их используют как плотные генеративные условия. Компонент, который хорош на своём бенчмарке, не обязательно лучший компонент для генеративной системы.
Прогрессивное обучение: сначала смысл, потом пиксели
Обучение построено как курс от грубого к тонкому по трём осям сразу: пространственное разрешение, сложность задач и качество данных. Центральный принцип: сначала поднимать разрешение и только потом вводить разнородные задачи редактирования, чтобы не сдвигать одновременно и масштаб, и распределение задач.
Фундаментальный претрейн занимает 500 тысяч шагов. Он начинается с текст-в-картинку на низком разрешении, поднимает его с 256 до 512 пикселей и лишь затем добавляет совместные данные для генерации и редактирования. На этом этапе приоритет: масштаб, разнообразие, семантическое покрытие, причём агрессивная фильтрация по качеству здесь контрпродуктивна. Визуально несовершенные картинки всё равно несут ценный семантический сигнал, а если несовершенство точно описано в подписи, модель учится распознавать такой концепт и не воспроизводить его.
Continual pre-training идёт ещё 200 тысяч шагов, поднимая разрешение с 512 до 1024 пикселей и смещая распределение к более чистым источникам. Авторы подчёркивают тонкий эффект: фильтрация по качеству сама по себе сдвигает распределение, потому что профессиональные источники уже веб-масштабных корпусов по семантике и стилю. Поэтому каждое повышение качества данных они сопровождают явной семантической ребалансировкой, чтобы не выбросить длинный хвост знаний. Финальный SFT занимает всего 10 тысяч шагов на компактном, проверенном людьми подмножестве, причём самые ценные образцы не глобально лучшие, а те, что закрывают конкретные оставшиеся провалы модели. Оценка здесь работает как активный сигнал управления обучением, а не как финальное измерение.
Параллельный RL: специалисты сначала, объединение потом
Классическая проблема RL для генерации картинок: цели конфликтуют. Текст-в-картинку требует разнообразия и глобальной структуры, редактирование требует точного следования референсу и сохранения нетронутых областей. Смешанная политика страдает от интерференции градиентов и эффекта качелей: улучшаешь одну категорию задач, проседает другая.
Решение Alibaba: разделить специализацию и унификацию. Смешанная политика остаётся якорем-генералистом, а поверх неё параллельно обучаются эксперты под связные группы задач с маршрутизацией наград: отдельный эксперт для T2I, отдельный для общего редактирования, плюс доменные эксперты для проседающих подобластей. Затем их улучшения консолидируются в единого студента через мульти-учительскую on-policy дистилляцию. Награды покрывают выравнивание текста и картинки, эстетику, следование инструкции, консистентность референса, сохранение лиц через ArcFace и точность рендеринга текста через PP-OCRv6.
Тот же принцип «не смешивай конфликтующее» повторяется и в few-step дистилляции: T2I и редактирование дистиллируются раздельно, каждый со своим распределением состояний, и объединяются только на финальном этапе.
Prompt Enhancer: компилятор в родной язык генератора
Самый неожиданный по эффекту компонент: Prompt Enhancer, отдельная модель, которая переводит сырой запрос пользователя в развёрнутую визуальную спецификацию, понятную рендереру. Авторы настаивают, что это не «улучшатель промптов», а компилятор в условный язык, на котором DiT видел подписи при обучении. Рассуждение и рендеринг разведены: PE разбирает неоднозначные инструкции, подтягивает знания и строит план, а DiT просто честно рисует результат.
PE обучается через GRPO с замороженным рендерером, причём награда двойная: текстовая проверяет корректность переписанного промпта, а изображенческая проверяет, реально ли итоговая картинка исполняет запрос. Промпт, который выглядит полным для человека, может быть неисполним для конкретного генератора, поэтому оценивать только текст недостаточно.
Цифры говорят сами за себя. На CPI-Intelligent, бенчмарке редактирования, требующего знаний и планирования композиции, Prompt Enhancer поднимает Swift-Image-3B с 2.02 до 4.10, а 6B версию с 2.26 до 4.23. Без PE модели выглядят посредственно, с PE обгоняют все открытые альтернативы. Это, пожалуй, самый большой одиночный прирост во всей статье.
Сжатие без потерь
3B-версия получена структурным прунингом: число голов внимания сократили с 32 до 24, выжившие параметры унаследованы напрямую, а затем студент заново прошёл курс continual pre-training с дистилляцией от замороженного 6B учителя. По совокупности бенчмарков потерь почти нет: Swift-Image-3B с PE набирает 4.31 против 4.33 у 6B версии, и стабильно обходит сопоставимый по размеру FLUX.2-klein-4B на GEdit, ImgEdit и REDEdit.
Вторая ось сжатия: число шагов сэмплирования. Distribution matching distillation сокращает траекторию денойзинга с 50 шагов до 8, причём обучающие состояния берутся из собственных роллаутов студента, а не из прямого зашумления данных, что снижает exposure bias. Примечательно, что few-step вариант не просто сохраняет качество, а показывает лучший совокупный результат по редактированию при заметно меньшем числе шагов.
Результаты: где 6B обходит 20B
В сводной таблице редактирования по пяти бенчмаркам (GEdit, ImgEdit, REDEdit, CPI-General, CPI-Practical) картина такая. Первое место у GPT-Image-2 с 4.61, второе у Seedream5 Pro с 4.57. Третье: Swift-Image-6B с API-версией Prompt Enhancer, 4.41. Четвёртое: Swift-Image-3B, 4.40. Лучший из открытых конкурентов, FireRed-Image-Edit на 20B параметров, набирает лишь 4.10, а Qwen-Image-Edit-2511 с теми же 20B: 4.07. FLUX.2-klein-9B останавливается на 4.05.
То есть 3B модель Alibaba обходит открытые системы почти в семь раз крупнее себя, а 6B версия в общем зачёте опережает Nano Banana Pro (4.34) и Qwen Image 2.0 Pro (4.37). В текст-в-картинку на Qwen-Image-Bench Swift-Image-6B с PE показывает лучший результат среди открытых моделей по всем пяти измерениям: качество, эстетика, выравнивание, реалистичность, креативность. На собственном бенчмарке Pi-ExpertVerse-T2I из тысячи рассуждательных промптов по десяти экспертным доменам модель с PE набирает 4.63 и лидирует в девяти доменах из десяти.
Контекст: гонка унифицированных моделей
Swift-Image не появился в вакууме. Последний год индустрия движется к моделям, которые одинаково хорошо понимают и создают изображения: Qwen-Image 2.0, HiDream-O1-Image, LongCat-Image-Edit и FLUX.2-klein играют в ту же игру. Разница в ставках. Большинство участников решают проблему наращиванием параметров и бюджета, а Alibaba пошла в противоположную сторону и показала, что при дисциплинированном обучении планку держит даже 3B вариант. Это важный сигнал для локального и on-device сценариев: редактирование уровня фронтирных API перестаёт требовать облака.
Есть и честные оговорки. Часть лучших результатов получена с API-версией Prompt Enhancer, то есть качество зависит от внешней сильной языковой модели, и это уже не совсем «одна компактная модель». Проприетарные лидеры в лице GPT-Image-2 и Seedream5 Pro всё ещё впереди, пусть и с небольшим отрывом. А собственные бенчмарки авторов, Pi-Benchmark и Pi-ExpertVerse, пока не прошли независимую проверку сообществом, поэтому к цифрам на них стоит относиться аккуратнее, чем к результатам на публичных GEdit и ImgEdit.
Что это значит на практике
243 тысячи GPU-часов: это бюджет, доступный не только гиперскейлерам. Для сравнения, фронтирные визуальные модели требуют на порядки больше. Вывод работы звучит почти как манифест: разрыв между компактными и гигантскими генераторами закрывается не архитектурной магией, а дисциплиной обучения. Качественная организация данных как куррикулума способностей, покрытие раньше предпочтений, параллельная специализация с последующей консолидацией, разведение рассуждения и рендеринга: каждый из этих приёмов по отдельности известен, но вместе они дают модель, которая играет в лиге систем на десятки миллиардов параметров.
Для прикладных команд практический смысл прямой. 3B модель с почти нулевой потерей качества и 8 шагами сэмплирования: это редактирование изображений, которое реально крутится на одной потребительской карте, а единый интерфейс на генерацию и редактирование убирает необходимость держать зоопарк специализированных моделей.
Часто задаваемые вопросы
Swift-Image открыта для скачивания?
В статье заявлены результаты среди открытых моделей, а семейство описано как открытое. Технический отчёт опубликован на arXiv под номером 2608.20334, там же приведены детали архитектуры, обучения и полные таблицы результатов.
Чем Swift-Image отличается от FLUX или Qwen-Image?
Главное отличие: единый бэкбон на 6B параметров для генерации и редактирования вместо отдельных моделей, плюс Prompt Enhancer, который переводит запросы пользователя в условный язык генератора. По совокупности пяти бенчмарков редактирования 6B версия обходит открытые модели до 20B параметров.
Зачем нужен Prompt Enhancer, если модель и так понимает промпты?
Пользовательские запросы и подписи, на которых обучался генератор, принадлежат разным распределениям. PE работает как компилятор между ними. На задачах, требующих знаний и планирования, он поднимает результат 6B модели с 2.26 до 4.23, то есть почти вдвое.
Итог
Swift-Image: редкий случай, когда технический отчёт читается как учебник по инжинирингу обучения. 6B параметров, 243K GPU-часов, третье место в общем зачёте по редактированию среди всех систем, включая закрытые, и 3B вариант почти без деградации. Если вы строите продукт на генерации или редактировании изображений, возьмите на заметку три приёма из этой работы: куррикулум данных вместо фиксированного датасета, параллельные RL эксперты с последующей дистилляцией и Prompt Enhancer как компилятор запросов. Они переносимы далеко за пределы визуальных моделей.