OpenCoF: как видео-генерация учится рассуждать через кадры

OpenCoF: как видео-генерация учится рассуждать через кадры

Представьте, что вы решаете шахматную задачу. Вы не просто смотрите на доску — вы мысленно проигрываете ходы один за другим, визуализируя, как фигуры перемещаются. Именно так работает Chain-of-Frame (CoF) рассуждение: модель рассуждает не текстом, а последовательностью кадров, генерируя видео, в котором разворачивается логика решения.

До недавнего момента видео-генераторы учились на YouTube и кинохрониках — красивых, но бесполезных для рассуждений. OpenCoF меняет правило: берёт 17 тысяч специально сконструированных видео по 11 типам задач и заставляет модель мыслить кадрами, как шахматист — ходами.

Что такое Chain-of-Frame reasoning

Chain-of-Thought (CoT) — знакомый подход, когда языковая модель раскладывает рассуждение на текстовые шаги. Но для задач, связанных с пространством, физикой и визуальной логикой, текст — плохой инструмент. Попробуйте о словами, как сложится бумага в оригами, или как изменится позиция фигур на доске после трёх ходов. Текстовое описание либо слишком длинное, либо теряет критичные детали.

Chain-of-Frame решает эту проблему иначе: рассуждение разворачивается в виде видео-последовательности. Каждый кадр — промежуточное состояние. Модель буквально видит, как меняется мир, и использует эту визуальную цепочку для вывода ответа. Это аналог того, как человек решает геометрическую задачу — не формулами, а рисунком, на котором видно, что происходит.

Проблема в том, что существующие видео-генераторы (Wan2.2, HunyuanVideo, Sora, Veo) тренировались на общих видео. Они отлично рисуют закаты и танцы, но не умеют рассуждать. На бенчмарке VIPER базовый Wan2.2-I2V-A14B набирает 3.3 из 100 — практически нулевой уровень. После fine-tune на OpenCoF-17K тот же базовый апскейлится до 7.5, а с reasoning-токенами — до 8.8.

Датасет OpenCoF-17K: 11 типов задач, 17 312 видео

Сердце работы — датасет, покрывающий задачи, которые невозможно решить без понимания визуальной динамики. В него вошли шахматы (1000 видео), судоку (1000), двумерная геометрия (1162), соединение точек (1000), танграм-пазлы (800), складывание кубов (800), вращение 3D-полимима (800), физическое движение (1000), лабиринты (1000), роботизированная манипуляция (1000), и 30 подзадач из VBVR-набора (7750 видео).

Все видео стандартизованы: 480p, 15 кадров в секунду, ровно 81 кадр. Средняя длина промпта — 53.2 слова. Это не случайно: единый формат позволяет модели учиться на любых задачах одновременно, без необходимости перенастраивать пайплайн под каждую.

Данные собирались четырьмя путями. Первый — рендеринг конкретных инстансов: шахматные позиции генерировались движком, геометрия строилась процедурно. Второй — экспертно-управляемый рендеринг, где люди определяли ключевые переходы. Третий — процедурный синтез сцен: лабиринты, траектории движения, физические симуляции. Четвёртый — переиспользование готовых видео из внешних датасетов, особенно для VBVR-подзадач.

Wan-CoF: что даёт fine-tune на reasoning-данных

Исследователи взяли Wan2.2-I2V-A14B — 14-миллиардную open-source видео-модель — и дообучили через LoRA (rank 32, learning rate 2×10⁻⁵) на всём OpenCoF-17K за 2 эпохи. Заморозили текст-энкодер umT5 и VAE, трогали только DiT-денoйзер. Результат назвали Wan-CoF.

На бенчмарке MME-CoF (главная метрика — общее качество рассуждения) базовый Wan2.2 набрал 0.304, а Wan-CoF — 0.325. Прирост скромный в абсолютных числах, но статистически значимый: модель, натренированная только на reasoning-видео, начинает переносить навыки на задачи, которых никогда не видела.

На VIPER картина драматичнее: с 3.3 до 7.5 (Pass Rate), то есть +4.2 пункта. На RULER-Bench — с 71.2 до 69.3 (небольшой спад, но внутри шума). На Gen-ViRe — с 1.80 (Sora-2) против 0.85 у Wan-CoF. Разрыв с Sora-2 и Veo-3.1 сохраняется, но open-source модель впервые демонстрирует, что целенаправленное обучение на reasoning-данных работает.

Особенно показателен разрыв по подкатегориям. На абстрактных задачах Wan-CoF прыгает с 0.220 до 0.326 — прирост почти 50%. На алгоритмических и логических — с 0.359 до 0.415. А вот на планировании (Planning) прирост нулевой — 0.519 и у базовой, и у fine-tuned модели. Это важный сигнал: данные учат визуальной логике, но не долгосрочному планированию.

Reasoning-токены: визуальные и текстовые

Самое интересное начинается на втором этапе. Fine-tune на данных — это лишь половина истории. Модель всё ещё выражает рассуждение через пиксели, что крайне неэффективно. Исследователи добавили два механизма, дающих модели явное пространство для «мыслей».

Визуальные reasoning-токены (vt) — 16 обучаемых векторов, вставленных в визуальную последовательность DiT. Они проходят через self-attention вместе с обычными визуальными токенами и захватывают низкоуровневые рассуждения: направления движения, геометрические соотношения, физические траектории.

Текстовые reasoning-токены (tt) — 16 токенов, добавленных к текстовому условию. Они проходят через cross-attention и несут высокоуровневую семантику: «сейчас конь бьёт ферзя», «куб поворачивается вокруг оси X». Модель учится явно формулировать промежуточные шаги.

Результаты на VIPER:

Модель Overall Temporal Structural Symbolic Spatial
Wan2.2 (baseline) 3.3 5.6 6.2 0.0 0.0
Wan-CoF (data only) 7.5 18.8 10.0 0.0 5.3
Wan-CoF + vt 8.2 12.8 11.3 0.0 4.0
Wan-CoF + tt 8.8 14.8 15.0 0.0 8.0

Текстовые токены дают больший прирост, чем визуальные — особенно на структурных задачах (15.0 vs 11.3) и пространственных (8.0 vs 4.0). Это говорит о том, что для видео-рассуждений высокоуровневая семантика важнее низкоуровневых визуальных сигналов.

На MME-CoF картина другая: vt даёт 0.327, tt даёт 0.330 — практически одинаково. А вот на Gen-ViRe vt показывает 0.92 против 0.85 у tt. Разные бенчмарки требуют разных типов рассуждений, и универсального решения пока нет.

Сколько reasoning-токенов нужно?

Исследователи проверили 16 vs 32 токенов и обнаружили неочевидный результат: удвоение не даёт равномерного улучшения. На трёх из четырёх бенчмарков 16 токенов работают лучше, чем 32. При этом 32 токенов примерно удваивают количество обучаемых параметров.

Это важный практический вывод: reasoning-токены — не просто «больше ёмкость = лучше». Они работают как специализированный канал для промежуточных состояний, и этот канал имеет оптимальный размер. Слишком много токенов — и модель начинает тратить ресурсы на избыточное представление, не получая выигрыша в качестве рассуждений.

Бенчмарки: как измеряли reasoning-способности

Исследователи протестировали модели на четырёх независимых бенчмарках, каждый из которых оценивает разные аспекты видео-рассуждений.

MME-CoF — эталонный бенчмарк для Chain-of-Frame. Оценивает общее качество рассуждения, абстрактные задачи, алгоритмическую логику, аналогии, перцептивные задачи, планирование и пространственно-временное понимание. Главная метрика — Overall score от 0 до 1.

VIPER — бенчмарк с метрикой POC@1.0 (Percentage of Correct predictions). Оценивает темпоральные, структурные, символические, пространственные, физические и планировочные способности. Шкала от 0 до 100.

RULER-Bench — оценивает четыре аспекта: Instruction Following (следование инструкциям), Visual Consistency (визуальная согласованность), Visual Fidelity (визуальная точность), Rule Coherence (логическая связность). Шкала 0–100 для каждой подкатегории.

Gen-ViRe — оценивает выравнивание с условиями, темпоральную согласованность, визуальную стабильность, визуальную точность и релевантность контента. Шкала от 0 до 3.

На каждом бенчмарке использовался официальный judge-модель, что обеспечивает сопоставимость результатов. Для RULER-Bench ограничили оценку image-to-video случаями, поскольку базовая модель не поддерживает text-to-video генерацию.

Ограничения и что дальше

OpenCoF — первая работа, которая системно показывает: видео-генерация может быть не просто инструментом создания контента, а substrate для визуального рассуждения. Но у неё есть ограничения.

Первое: vt и tt исследованы по отдельности. Как их комбинировать — открытый вопрос. Можно было бы предположить, что сложение двух механизмов даст синергию, но авторы сознательно не проверяли это, чтобы изолировать вклад каждого. Это направление для будущих работ.

Второе: модель не поддерживает text-to-video генерацию (только image-to-video), что ограничивает применение. Начальное изображение — обязательный.condition, без него модель не работает. Для полного reasoning-пайплайна нужна модель, способная генерировать рассуждения из чистого текста.

Третье: датасет покрывает 11 типов задач, но не все возможные области рассуждений. Нет задач на социальное взаимодействие, эмоциональное понимание, или сложные причинно-следственные цепочки в реальном мире. Расширение датасета — следующий шаг.

Четвёртое: разрыв с Sora-2 и Veo-3.1 на reasoning-задачах сохраняется. На VIPER Sora-2 набирает 23.3 против 8.8 у Wan-CoF+tt. На MME-CoF Sora-2 — 0.560 против 0.330. Это показывает, что проприетарные модели, обученные на vastly larger корпусах, всё ещё доминируют. Но тренд ясен: целенаправленное обучение на reasoning-данных сокращает разрыв быстрее, чем просто масштаб.

Что это значит для индустрии

Для индустрии это означает несколько вещей. Во-первых, reasoning-видео — это новый класс моделей, отдельный и от LLM-рассуждений, и от обычных видео-генераторов. Он занимает нишу между «модель генерирует красивое видео» и «модель решает задачи». Во-вторых, open-source решение (Wan-CoF + OpenCoF-17K) доступно для экспериментов — код, датасет и веса опубликованы на GitHub. В-третьих, это показывает, что для reasoning-задач не обязательно нужна проприетарная модель с триллионами параметров — целенаправленный fine-tune на специализированных данных даёт значительный прирост даже на open-source базе.

Это открывает путь для нишевых применений: образовательные платформы, где модель объясняет физику через анимацию; робототехника, где визуальное планирование критично; игровые движки, где NPC должны рассуждать о пространственных задачах. Во всех этих случаях не нужна универсальная видео-модель — нужна модель, умеющая рассуждать через кадры в конкретном домене.

Часто задаваемые вопросы

Чем Chain-of-Frame отличается от Chain-of-Thought?

Chain-of-Thought раскладывает рассуждение на текстовые шаги, а Chain-of-Frame — на визуальные кадры. CoF лучше подходит для пространственных и физических задач, где текстовое описание теряет информацию. Модель буквально «видит» промежуточные состояния вместо того, чтобы описывать их словами.

Можно ли использовать OpenCoF с другими видео-моделями?

Архитектура reasoning-токенов универсальна для любой DiT-модели. В статье показано, как vt и tt добавляются к Wan2.2-I2V-A14B, но тот же принцип применим к HunyuanVideo, CogVideo и другим DiT-архитектурам. Датасет тоже модель-агностик — любой генератор можно дообучить на OpenCoF-17K.

Почему Sora-2 и Veo-3.1 всё ещё лучше на бенчмарках?

Закрытые модели обучались на vastly larger корпусах, включая reasoning-подобные данные, которые могут быть встроены в их общее обучение. OpenCoF показывает, что целенаправленный fine-tune на reasoning-данных даёт значительный прирост даже на open-source модели, но разрыв с проприетарными системами пока сохраняется, особенно на задачах планирования.

Итог

OpenCoF — это первый системный подход к обучению видео-моделей рассуждению через последовательность кадров. Датасет из 17 тысяч видео, fine-tune 14-миллиардной модели и два типа reasoning-токенов дают конкретные цифры: +4.2 пункта на VIPER, +50% на абстрактных задачах MME-CoF, и явный сигнал, что reasoning-данные работают лучше, чем просто масштаб. Код и данные открыты — экспериментировать может кто угодно. Следующий шаг — комбинация визуальных и текстовых токенов, и это направление, за которым стоит следить.

← Все записи