Видеомодели завалили экзамен по физике: лучший балл 57,76 из 100
Видеомодели научились генерировать сцены, которые почти не отличить от съёмки: вода течёт, предметы падают, ткани мнутся под ветром. Но когда такое видео подают роботу или планировщику как предсказание будущего, красота картинки перестаёт что-либо значить. Нужно, чтобы движение подчинялось физике, а с этим у генераторов проблемы. Свежий препринт World Models' Last Exam in Physics устроил восьми ведущим видеомоделям экзамен из 40 контролируемых физических экспериментов. Лучший результат: 57,76 балла из 100.
Что такое World Models' Last Exam in Physics
Это бенчмарк, который измеряет физическую консистентность видеомоделей. Авторы собрали 40 контролируемых задач по девяти разделам физики: механика и столкновения, качение и трение, маятники, оптика, гидростатика, фазовые переходы, электромагнетизм, сыпучие среды и поверхностное натяжение. Каждая задача проверяет одно конкретное соотношение по величинам, которые можно измерить прямо в видео: траекториям, периодам, углам, уровням жидкости. Всего в бенчмарке 65 метрик: по одной основной на задачу и по дополнительной для 25 из них.
Как устроен экзамен по физике
Главная идея в том, чтобы не требовать ни эталонных видео, ни абсолютной калибровки. Авторы формулируют проверки как отношения, в которых неизвестные множители сокращаются. Мяч, запущенный под 45 градусов и вернувшийся на ту же высоту, должен иметь отношение максимальной высоты к дальности, равное одной четверти. Два маятника одинаковой длины обязаны качаться с одинаковым периодом, как бы ни различались массы грузов. Катящийся без проскальзывания шар подчиняется равенству линейной скорости и произведения угловой скорости на радиус. Такие тесты не требуют ни референсных роликов, ни точных метров и секунд: достаточно пикселей и кадров.
Задачи охватывают самые разные явления. В механике это свободное падение, где пройденный путь обязан расти как квадрат времени, и упругое столкновение двух шаров равной массы, где суммарный импульс до и после удара должен совпадать. В оптике лазерный луч обязан отражаться от зеркала под тем же углом, под которым пришёл, а в гидростатике уровни жидкости в сообщающихся сосудах должны выравниваться независимо от диаметра колен. Есть даже капиллярный подъём: в узкой трубке жидкость обязана стоять выше, чем в широкой, как предписывает закон Жюрена.
Каждая задача начинается с опорного кадра, который генерирует GPT-Image-2.5, и промпта с описанием хода эксперимента. Пары «кадр плюс промпт» авторы отшлифовали вручную через пилотные прогоны: если сцена плохо показывает нужную величину, её переписывают. Каждую задачу каждая модель решает четыре раза, всего получается 1280 видео при фиксированных сидах.
Оценка идёт в два слоя. Сначала Qwen3.6-27B выставляет оценку временной связности от 0 до 100: остаются ли объекты узнаваемыми, нет ли разрывов и подмен. Если оценка ниже 80, физический балл не идёт в итоговую сумму, но всё равно измеряется и сохраняется для диагностики. Затем экстракторы с помощью CoTracker3, SAM 2, геометрической подгонки и анализа областей интереса достают из видео нужные величины: периоды колебаний, углы отражения, уровни жидкости. Измеренные значения сравнивают с физическими критериями задачи, а итоговый балл собирается по формуле, где физика весит 85 процентов, а связность 15.
Средний балл: 38,95 из 100
Экзамен сдавали восемь моделей: CogVideoX 1.5-5B, Cosmos3-Super, HunyuanVideo-1.5, LingBot-Video, MiniMax H3, Seedance 2.5, VBVR-Wan2.2 и Wan 2.2. Разброс огромный. Вперёд вырвалась Seedance 2.5 с результатом 57,76 балла, следом идёт MiniMax H3 с 54,89. Дальше начинается отставание: Cosmos3-Super набирает 42,46, VBVR-Wan2.2 37,79, Wan 2.2 35,66, LingBot-Video 32,25, HunyuanVideo-1.5 31,97, а замыкает список CogVideoX 1.5-5B с 18,81.
Средний балл по всем восьми моделям: 38,95 из 100. При этом средняя оценка временной связности держится на 78,44, а средний физический балл всего 34,77. Разрыв между «выглядит гладко» и «подчиняется физике» и есть главный вывод работы.
Как читать эти баллы? Каждая метрика устроена так, что половину очков модель получает при ошибке, равной характерному масштабу задачи, а дальше баллы растут по мере приближения к точному соотношению. Порога «сдал или не сдал» здесь нет, а физика в итоговой оценке весит 85 процентов. Поэтому 57,76 у Seedance означает не «почти отлично», а середину пути: устойчивое правдоподобие при систематических физических ошибках.
Что получается, а что нет
Разница между задачами огромная, и это интереснее средних чисел. Равновесные сцены модели решают хорошо: сообщающиеся сосуды правильно ведут себя у всех восьми моделей с баллами от 93,09 до 99,01, углы песчаных горок и висящая цепь тоже даются большинству (у цепи от 68,85 до 76,95). А всё, что требует событий во времени, разваливается.
Самый показательный провал: лёд с вмороженным камнем. Когда лёд тает, камень опускается на дно, и уровень воды обязан понизиться. Ни одна из восьми моделей не справилась: средний балл 3,45, максимум 15. Физические оценки у всех нулевые, а ненулевые баллы набраны только за счёт связности картинки.
Похожая история с оптикой. Отражение луча от зеркала получилось только у Seedance 2.5 и VBVR-Wan2.2 (96,15 и 95,75 балла), остальные шесть моделей не набрали и 50: отражённый луч либо отсутствует, либо уходит не туда. Симметричное отталкивание заряженных шариков на нитях удалось только Seedance и MiniMax (98,34 и 97,24), у остальных не выше 15: модели рисуют лишние шары или не показывают расхождение вовсе.
Есть и задачи, которые расслаивают поле. Начало скольжения брусков разной массы MiniMax и Cosmos3-Super решают почти идеально (97,89 и 98,46), а CogVideoX едва набирает 43,62. Вязкое оседание шариков в глицерине, где скорость связана с квадратом радиуса, всем даётся средне: от 50,86 до 69,85 балла. А чистое качение шара по наклонной плоскости до конца доводит только Seedance с 75,56, большинство же моделей путает связь линейной и угловой скорости.
Отдельный сюжет: свободное падение. Его прошли все: каждый ролик миновал фильтр связности. Но средний итоговый балл всего 26,61, потому что траектории не совпадают с равноускоренным движением. Формально модель нарисовала падающий мяч, а физически он падал неправильно. Авторы подчёркивают: прохождение фильтра не доказывает физическую корректность, оно лишь означает, что измерения возможны.
Есть и градация по сложности. Среди лёгких задач фильтр проходят 89,4 процента роликов, среди сложных только 56,9. На лёгких впереди MiniMax H3, а на сложных вырывается Seedance 2.5 с 37,76 против 19,87 у MiniMax, и даже это немного. Труднее всего даются контактные взаимодействия и последовательности событий: столкновения, разворот на наклонной плоскости, фазовые переходы. Иными словами, чем длиннее причинно-следственная цепочка в сцене, тем быстрее модели теряют физику.
Насколько оценщику можно верить
Вопрос справедливый: если баллы ставит автоматика, кто проверяет автоматику? Авторы проверили двумя способами. Первый: 480 синтетических роликов, собранных кадр за кадром так, чтобы заведомо подчиняться нужным соотношениям. Измерительный модуль поставил им в среднем 97,53 из 100, то есть корректную физику он видит, когда она есть. Синтетика удобна тем, что истина известна заранее: если бы оценщик ставил низкие баллы заведомо корректным роликам, слабое место методики вылезло бы сразу.
Второй способ: люди. Десять аннотаторов оценили 320 роликов, и согласие оценщика с людьми оказалось выше, чем у прямого судьи на базе той же Qwen3.6-27B: 51,58 против 43,40 процента в ранжировании внутри задач и 53,12 против 45,62 в попарных сравнениях. До людей оценщик не дотягивает (у них между собой 56,60 и 58,54 процента), но он заметно ближе к ним, чем языковая модель-судья.
Важная деталь: авторы отделяют провал измерения от физического нарушения. Если объект в кадре потерялся и величину извлечь нельзя, метрика получает операциональный ноль, но это не считается доказанным нарушением физики. Такой разбор честнее: видно, где модель ошиблась физически, а где просто не дала данных для проверки.
Почему это важно
Видеомодели всё чаще называют кандидатами в симуляторы для роботов и агентов, а также основой для world action models, где предсказание будущего сцеплено с выбором действий. Планировщик, который учится на физически неверных роликах, будет ошибаться и в реальном мире, причём ошибки заметят только после столкновения с ним. Прежние бенчмарки либо полагались на судей из числа языковых моделей (а те сами слабы в физике: по данным PQSG, GPT-5.5 отвечает на физические вопросы FinePhyEval с точностью 64,6 процента против 88,4 на вопросах об объектах), либо требовали эталонных видео и калибровки, либо проверяли только механику.
Здесь измерение идёт напрямую и сразу по девяти разделам физики, а результаты остаются интерпретируемыми: видно, какое именно соотношение нарушено и насколько. Это делает бенчмарк не просто рейтингом, а диагностическим инструментом.
Авторы честно перечисляют ограничения: оценка зависит от видимости объектов и надёжности извлечения величин, а 40 задач покрывают не все явления природы. В будущем они обещают расширять каталог и делать измерения устойчивее в сложных сценах. Но и текущая версия даёт то, чего не хватало: воспроизводимый протокол для сравнения моделей и отслеживания прогресса.
Часто задаваемые вопросы
Что такое World Models' Last Exam in Physics?
Бенчмарк из 40 контролируемых задач для оценки физической консистентности видеомоделей. Каждая задача проверяет измеримое физическое соотношение в сгенерированном видео, от падения мяча до таяния льда, без эталонных роликов и калибровки. Всего в нём 65 метрик по девяти разделам физики.
Какая видеомодель лучше всех сдала экзамен?
Seedance 2.5 с результатом 57,76 из 100, второе место у MiniMax H3 с 54,89. Но даже лидер проваливает целые разделы: таяние льда, часть задач оптики и магнитной индукции. Авторы считают такие баллы доказательством того, что до надёжных симуляторов физики моделям ещё далеко.
Почему видеомодели генерируют физически невозможные видео?
Модели учатся воспроизводить пиксели, а не законы природы, поэтому оптимизируют правдоподобие картинки, а не корректность движения. Особенно тяжело даются события с контактами и фазовыми переходами: они редко встречаются в обучающих данных и требуют согласованного поведения сразу нескольких величин.
Итог
Экзамен по физике показал, где проходит граница возможностей видеомоделей. Равновесие они держат, простые движения имитируют, но стоит добавить время, контакты и превращения вещества, как картинка расходится с физикой. Лучший балл 57,76 из 100 не приговор, а честная точка отсчёта: бенчмарк с измеримыми метриками позволяет следить за тем, как быстро модели учатся понимать мир, а не только рисовать его. Практический вывод для команд, которые строят роботов и агентов на видеомоделях: проверять физику на своих сценариях стоит до того, как планировщик начнёт учиться на сгенерированных роликах.
Препринт и каталог всех 40 задач лежат на arXiv. А как вы думаете, что случится раньше: видеомодели научатся честной физике или индустрия перестанет называть их моделями мира?