Нейросеть научили рисовать невозможные картины Эшера
«Кажется, я никогда не делал ничего более странного», говорил Мориц Корнелис Эшер про литографию «Галерея эстампов» 1956 года. На ней картина содержит мир, который содержит картину: юноша рассматривает гравюру с видом города, а взгляд, проследив за домами и улицами, возвращается в ту самую галерею, где он стоит. «Как это может быть?»
Почти полвека спустя математики Барт де Смит и Хендрик Ленстра разобрали геометрию гравюры по формулам и восстановили пропущенный центральный фрагмент. А теперь невозможные картины Эшера научилась строить нейросеть. Свежая работа «Moore, Escher, Penrose: A Conformal Golden Braid» вынуждает обычную диффузионную модель собирать самовложенные сцены с точной геометрией, не меняя ни одного веса модели.
Что такое рекурсивная геометрия Эшера
Рекурсивная сцена это изображение, которое содержит уменьшенную копию себя, и так по цепочке внутрь. Без поворота такой повтор называется эффектом Дросте: его все видели на коробке какао, где нарисована няня с той же коробкой в руках. Эшер добавил к повтору медленный поворот, и вложенность закрутилась спиралью.
За математику спирали отвечает преобразование плоскости в комплексных числах: степенная функция w = z^α. Оно конформно, то есть сохраняет углы, и превращает простой повтор в закрученный вихрь. Условие, которое сшивает сцену воедино, звучит так: один полный оборот вокруг центра на выходе соответствует полному обороту плюс один шаг масштаба на входе.
В классическом анализе «Галереи эстампов» 2003 года главные числа такие: вложенная копия примерно в 22,6 раза меньше оригинала и повёрнута на 157,63 градуса по часовой стрелке. Именно это семейство спиралей и стало отправной точкой для новой работы.
Почему промпт и постобработка не работают
Попросить у диффузионной модели «рекурсивную картину в стиле Эшера» можно уже сегодня, и результат получится даже красивым. Беда в том, что между областями изображения не возникает точной связи: внутренняя копия окажется похожей, но не той же самой. Геометрия здесь не стиль, а уравнение, и подсказкой в промпте его не задать.
Следующая идея напрашивается сама: сгенерировать картинку как обычно, а потом применить преобразование как фильтр. Повтор появится, но связи будут сломаны. Денозер не знал, что его рисунок собираются скручивать, и не подстроил сцены друг под друга: дома на внутренней копии просто обрежутся по краю полосы.
Можно пойти дальше и вмешаться прямо в процесс генерации. Но и здесь модель мешает сама себе: увидев искажение, денозер считает его артефактом и «починяет» обратно, а иногда просто уезжает из заданной геометрии. Вся соль задачи в том, что дефект здесь и есть замысел.
Ключевая идея: обобщённая обратная операция
Авторы ведут работу сразу в двух представлениях картинки. Первое, «прямое», подчиняется повтору без поворота: уменьшил вокруг центра, и всё совпало. Второе, эшеровское, получается из первого спиральным преобразованием. Мост между ними строится из пары операторов.
Прямой оператор забирает из картинки выбранную полосу и размножает её по всей сцене уже в эшеровской геометрии. Такое преобразование безвозвратно теряет всё, что не попало в полосу, поэтому обычная обратная операция для него не существует. Здесь и пригождается математика обобщённых обратных, та, из-за которой в названии статьи соседствуют фамилии Мура (1920) и Пенроуза (1955).
Авторы конструируют парный оператор, согласованный с прямым. Для правильных картинок пара ведёт себя как единица: применил преобразование, потом обратное, потом снова прямое, и изображение больше не сдвигается. Формально выполнено тождество Пенроуза, а композиция операций идемпотентна: повторное применение ничего не меняет. Интуиция простая: у картинки забирают одну полосу и заново достраивают по ней всю сцену. Правильную структуру это сохраняет, а неправильную чинит, не накапливая искажений.
Но проекций мало: сцена должна быть не только корректной, но и красивой. Поэтому денойзинг «плетут» между двумя представлениями. Несколько шагов модель развивает прямую сцену, преобразование переносит её в спиральную геометрию, ещё несколько шагов работают там, обратная операция возвращает изменения назад, и цикл повторяется. В статье это называется braided sampling, плетёный сэмплинг: две нити, прямая сцена и её искажённая версия, тянут друг друга, как пряди в косе. Модель при этом всё время одна и та же: меняется только система координат, в которой она смотрит на холст.
Подход перекликается с целым классом методов, которые сшивают несколько «взглядов» на изображение прямо во время денойзинга. Так устроены Visual Anagrams с оптическими иллюзиями, LookingGlass с анаморфозами и Tiled Diffusion с бесшовными мозаиками. Но у них сопрягаемые виды связаны обратимыми или почти обратимыми преобразованиями. Рекурсивная геометрия устроена жёстче: её операция безвозвратно отбрасывает всё, что не попало в полосу, поэтому без согласованного обобщённого обратного здесь не обойтись.
Как это устроено на практике
Пайплайн собран вокруг открытой модели FLUX.1-dev, которая сама не меняется ни на один параметр. Генерация идёт в 128 шагов. Первые двадцать два шага работают как разминка: к картинке на каждом шаге применяют преобразование без поворота, чтобы в сцене прижилась вложенная копия. Затем включается полная спираль на уровне шума 0,87, девять шагов спустя срабатывает обратная операция, а на уровне 0,5 финальное прямое преобразование. Дальше модель дочищает результат уже в эшеровской геометрии.
Технически шаг с преобразованием выглядит так: модель предсказывает чистую картинку, её декодируют из латентного представления, геометрию применяют прямо в пикселях, результат кодируют обратно и заново зашумляют до следующего уровня шума.
На каждом переключении между представлениями есть неочевидная деталь: картинку на мгновение увеличивают вчетверо нейросетевым апскейлером Real-ESRGAN, применяют преобразование и возвращают к рабочему разрешению. Без этого мелкие копии теряют резкость, ведь сжатым областям достаётся мало пикселей на деталь. На разминке супер-разрешение отключено: многократное усиление зашумлённых предсказаний затемняет картинку. Ещё одна тонкость касается шума: после геометрической операции его добавляют заново. Переносить шум через преобразование нельзя, иначе его статистика перестаёт быть корректной и следующие шаги денойзинга идут вразнос.
Меняя преобразование, авторы получают целую галерею геометрий: конформные спирали с разным числом витков, несколько центров рекурсии сразу, мёбиусову связку двух центров, квадратную вложенность и «кольца», где повторяющиеся полосы собираются у внешнего круга плотными слоями. В последнем случае обратную операцию не применяют: она численно неустойчива, а видимые стыки между слоями авторы оставили как художественный приём.
Цена вопроса: одна картинка 1024 на 1024 собирается примерно две минуты на GPU Blackwell с 96 гигабайтами памяти, пик потребления около 45 гигабайт. Чтобы проверить, что рецепт не привязан к латентному пространству, его повторили на пиксельном диффузионном трансформере PixelDiT, который денойзит изображение напрямую в пикселях. Там та же сцена строится за двадцать секунд на RTX 5090.
Что показали сравнения
Главный эксперимент проверяет, что каждый элемент пайплайна необходим. Промпт как есть даёт правдоподобные, но геометрически произвольные сцены. Расширенный промпт прямым текстом просит «рекурсию Дросте, где сцена содержит уменьшенную копию себя», но добавляет только антураж, а не структуру. Постфактум-преобразование даёт правильный повтор с изломанными связями. И только полный плетёный сэмплинг собирает сцену, где внутренняя копия осмысленно продолжает внешнюю. На увеличенных фрагментах видно, как вместе с вложенностью прорастают детали: в коробке с хлопьями появляется настоящая миниатюра, а в зеркалах библиотеки отражается ещё одно зеркало.
Геометрию можно крутить: число витков спирали на оборот задаётся отдельным параметром, а его отрицательные значения разворачивают закрутку в противоположную сторону. Все пять семейств проверяются на одинаковых промптах и сидах, так что разница на картинках отражает именно разницу геометрий, а не сюжетов.
Финальный штрих называется «путешествие во времени»: готовую картинку слегка зашумляют и прогоняют через денозер ещё раз, чтобы сгладить стыки. Приём помогает не всегда и может, наоборот, подчеркнуть шов, поэтому в основной конвейер он не входит.
Что получилось не идеально
Идеальными тождества остаются только на бумаге. В реальном растре конечное разрешение и последующий денойзинг оставляют погрешность: на проверке идемпотентности остаток между двумя последовательными проекциями составил от 0,011 до 0,014, то есть ровно на уровне шума билинейной интерполяции. Внутренние копии заметно мягче внешней картинки.
Второе ограничение: центр рекурсии фиксирован. Если в сцене есть более выразительный объект в стороне, вложенность может уцепиться не за него. В примере из статьи гнездо построилось вокруг окна в стене, хотя задумывался холст художника, стоящий в стороне от центра. Это скорее тема для будущих работ, чем фатальный изъян: сам рецепт от выбора центра не зависит.
Почему это больше, чем трюк
Идея шире одной гравюры. Здесь геометрия становится активным участником генерации: не фильтр поверх готовой картинки и не пожелание в промпте, а ограничение, внутри которого модель выращивает сцену. В перспективе так можно будет заказывать точное строение изображения: заданные симметрии, замощения, повторяющиеся структуры, оптические иллюзии.
У истории красивый круг. Пенроуз придумал свои невозможные фигуры под впечатлением от гравюр Эшера, а фигуры, опубликованные Пенроузами в 1958 году, вдохновили «Водопад» и «Восхождение и спуск» уже самого Эшера. Больше двадцати лет назад де Смит и Ленстра вернули долг, разобрав математику «Галереи эстампов». Теперь эстафету принимает машинное обучение. Название статьи отсылает к «Гёделю, Эшеру, Баху» Хофштадтера: там вечная золотая коса плетётся из логики, искусства и математики, здесь коса сплетена из Мура, Эшера и Пенроуза. А вдохновило авторов, по их признанию, видео 3Blue1Brown про то, как и зачем брать логарифм изображения.
Часто задаваемые вопросы
Что такое эффект Дросте?
Это бесконечный повтор изображения внутри себя. Классический пример: коробка какао Droste, на которой нарисована няня с той же коробкой в руках. Формально изображение не меняется при увеличении вокруг центра. Эшер соединил такой повтор с поворотом, и получилась спираль «Галереи эстампов».
Почему нельзя просто написать «картина в стиле Эшера» в промпте?
Слова не задают уравнение. Модель нарисует похожую по духу сцену, но без точной связи между внешними и внутренними областями: копии получатся «по мотивам», а не продолжением друг друга. В экспериментах версии только с промптом выглядят правдоподобно, но настоящей вложенной структуры в них нет.
Получится ли повторить это дома?
Пока метод живёт в статье и на проектной странице авторов. Чтобы его повторить, нужна своя модификация сэмплера поверх открытой модели. Ничего экзотического не требуется: судя по переносу на PixelDiT, сцена собирается за двадцать секунд на одной потребительской RTX 5090.
Итог
Нейросеть научили строить то, что раньше было территорией гравёров и математиков: точные самовложенные картины в духе «Галереи эстампов». Секрет не в обучении, а в аккуратном переплетении денойзинга с геометрическим преобразованием, где искажение не чинится, а становится частью замысла. Метод пока исследовательский, с оговорками по резкости и центру рекурсии, но направление он показывает ясно: следующий уровень контроля генерации будут задавать не слова, а уравнения. А пока загляните на проектную страницу авторов: анимации, где одна и та же сцена разворачивается спиралью, затягивают не хуже оригинала.
Первоисточники: статья Moore, Escher, Penrose: A Conformal Golden Braid на arXiv и проектная страница с анимациями.