PEARL: когда физика помогает обучению с подкреплением — новый алгоритм PEARL

PEARL: когда физика помогает обучению с подкреплением — новый алгоритм PEARL

Обучение с подкреплением — это универсальный молоток. Задача не важна: агент просто максимизирует награду. Но когда среда подчиняется известным физическим законам — управлению жидкостями, робототехнике, климатическому моделированию — этот молоток работает плохо. Миллионы шагов симуляции, нестабильная сходимость, жадные стратегии, которые оптимизируют награду сегодня и разрушают систему завтра. Новая работа предлагает решение: вместо того чтобы игнорировать физику, встроить её прямо в градиенты политики. Алгоритм называется PEARL — Physics-EnhAnced Reinforcement Learning — и он обходит PPO, TD3, BPTT и SHAC на задачах, где физика определяет динамику среды.

В чём проблема классического RL

Model-free RL — это парадигма, в которой агент не знает, как устроена среда. Он взаимодействует с ней, получает награду и постепенно учится действовать лучше. Подход универсален: от Atari до LLM-агрегаторов. Но у универсальности есть цена — sample efficiency. Агенту нужны миллионы взаимодействий со средой, чтобы выучить приемлемую политику.

Model-based RL пытается решить эту проблему: агент строит суррогатную модель среды и учится внутри неё. Но обучение точной модели — само по себе сложная задача, особенно для систем с тысячами степеней свободы. Модель может быть неточной, и агент выучит политику, которая работает на модели, но проваливается на реальной среде. Это называется sim-to-real gap — разрыв между обучением и применением.

Есть и третья проблема: когда среда описывается дифференциальными уравнениями, классический RL теряет доступ к самой ценной информации — о том, как малое изменение действия влияет на всю траекторию системы. Эта информация существует в виде производных, и её можно вычислить точно через автоматическое дифференцирование. Классические алгоритмы, включая PPO и TD3, этой информацией не пользуются — они работают со скалярной наградой и не видят структуру среды.

Мост между RL и оптимальным управлением

Оптимальное управление — это математическая дисциплина, которая решает ту же задачу, что и RL: найти последовательность действий, максимизирующих целевую функцию. Но делает это по-другому. Вместо того чтобы учить политику на данных, оптимальное управление использует структуру дифференциальных уравнений среды и вычисляет точные градиенты через сопряжённые переменные (adjoint variables). Этот подход работает десятилетиями в аэрокосмической инженерии, робототехнике и энергетике.

Сопряжённые переменные — это тензор, который описывает, как малое возмущение состояния системы влияет на итоговую целевую функцию. Они вычисляются через обратный проход по динамике — от финального момента времени к начальному. В оптимальном управлении это называется принципом максимума Понтрягина, и это один из краеугольных камней прикладной математики XX века.

PEARL делает то, что до этой работы никто не делал систематически: он берёт сопряжённые переменные из оптимального управления и встраивает их в RL как замену value-функции. Вместо того чтобы нейросеть учила «насколько хорош данный стейт» (value), она учит «как возмущение стейта влияет на финальную цель» (adjoint). Это фундаментально другой сигнал обучения, и он несёт информацию о физике среды.

Как устроен PEARL: три ключевые идеи

Первая идея — short-horizon optimization. Вместо того чтобы бэкпропагировать через всю траекторию (что приводит к vanishing/exploding gradients), PEARL обновляет политику каждые h шагов, где h значительно меньше общей длины траектории T. Это решает проблему затухающих градиентов, которая мучает backpropagation through time (BPTT) на длинных горизонтах.

Вторая идея — adjoint network вместо value network. В классических RL-алгоритмах критик учит value-функцию: сколько награды агент получит из данного состояния. В PEARL критик учит сопряжённые переменные: как чувствительна итоговая награда к возмущению состояния. Сопряжённые переменные вычисляются через adjoint-уравнение из оптимального управления — это дифференциальное уравнение, описывающее обратную эволюцию чувствительности. Нейросеть учится аппроксимировать решение этого уравнения, и этот сигнал используется для обновления политики.

Третья идея — automatic differentiation через дифференцируемый симулятор. PEARL требует, чтобы симулятор среды был дифференцируемым — то есть чтобы можно было вычислять производные действий по состояниям через все промежуточные шаги. Это не ограничение, а требование, которое выполняется для огромного класса физических задач: дифференциальные уравнения в частных производных, механика твёрдого тела, гидродинамика. Современные фреймворки (JAX, PyTorch) поддерживают автоматическое дифференцирование через симуляторы из коробки. Более того, именно возможность бэкпропагировать через физические уравнения делает PEARL применимым — без этого сопряжённые градиенты пришлось бы аппроксимировать численно, что свело бы на нет все преимущества метода.

Эксперименты: лидер-последователь в нестационарном потоке

Авторы протестировали PEARL на двух задачах оптимальной навигации в нестационарном потоке двойного вихря (double gyre flow) — классической тестовой задаче из вычислительной гидродинамики.

В первой задаче, leader-follower game, один агент (follower) должен преследовать цель (leader), пассивно переносимую потоком. Оба агента находятся в нестационарном вихревом поле с амплитудой 0.1 и частотой осцилляции π. Начальные позиции обоих варьируются, поэтому политика должна быть параметрической — способной адаптироваться к разным сценариям. Управляющая скорость ограничена интервалом (-0.2, 0.2), горизонт — 100 секунд.

PEARL сравнивали с PPO (стандартный policy gradient), TD3 (twin delayed DDPG), BPTT (backpropagation through time), truncated BPTT и SHAC (short-horizon actor-critic с value-функцией). На плотной награде (dense reward) PEARL показал стабильно лучшую сходимость — агент выучил стратегию преследования, которая компенсирует возмущения потока. На разреженной награде (sparse reward, награда только в конце траектории) разрыв стал ещё больше: PPO и TD3 практически не обучились, тогда как PEARL нашёл работающую стратегию благодаря информативным сопряжённым градиентам.

Вторая задача — mean-field leader-follower game, высокомерный вариант первой. Вместо управления одним агентом нужно управлять гауссовской плотностью распределения частиц — это распределённое управление с тысячами степеней свободы. PPO и TD3 не справились вовсе (проклятие размерности), BPTT работал, но хуже PEARL по сходимости. PEARL показал, что встраивание физики через сопряжённые переменные масштабируется на задачи с большой размерностью без деградации.

Почему adjoint лучше value-функции

Ключевое различие между PEARL и SHAC (ближайшим конкурентом) — в том, что учить. SHAC использует short-horizon optimization, как и PEARL, но аппроксимирует value-функцию терминального состояния. То есть нейросеть отвечает: «насколько хорош стейт в момент h?» Это стандартный TD-обучение, просто на коротких горизонтах.

PEARL заменяет value на adjoint. Вместо «насколько хорош стейт» он учит «как малое возмущение стейта повлияет на финальную цель». Это принципиально другой сигнал: он несёт информацию о градиенте физики, а не только о накопленной награде. На практике это означает, что PEARL получает более информативные градиенты для обновления политики — особенно в задачах, где награда разрежена или отложена.

Авторы показывают это на двух уровнях. Во-первых, обучение стабильнее: кривые PEARL имеют меньшую дисперсию между запусками. Во-вторых, sample efficiency выше: PEARL достигает того же уровня производительности за меньшее число взаимодействий со средой. В высокомерном mean-field эксперименте это отличие стало решающим — value-based методы не сошлись, adjoint-based сошёлся.

Архитектура нейросети и гиперпараметры

Для параметрических задач авторы использовали специфическую архитектуру: две ветви feed-forward сетей (по 2 слоя каждая) для кодирования состояния и параметров сценария, конкатенация эмбеддингов и третья 2-слойная сеть для финальной обработки. Это разделение важно: параметры сценария (начальные позиции лидера и последователя) меняются между эпизодами, и сети нужно научиться их учитывать.

Гиперпараметры стандартизированы: discount factor γ = 0.99, TD-scheme с λ = 0.95, target network update с α = 0.995 для SHAC и PEARL. Для PEARL длина короткого горизонта h — критический гиперпараметр: слишком короткое h даёт шумные градиенты, слишком длинное — возвращает к проблеме vanishing gradients. Авторы подобрали h эмпирически для каждой задачи, но точные значения не приведены в статье.

Что это значит для RL в физике

Результаты PEARL показывают направление, в котором reinforcement learning перестаёт быть чёрным ящиком и начинает использовать структуру среды. Это не просто «добавить индустриальный prior» — это фундаментально другой способ вычисления градиентов, основанный на математике оптимального управления.

Для практических применений это означает: если ваша среда описывается дифференцируемыми уравнениями (гидродинамика, робототехника, климат, финансовая математика), PEARL предлагает способ получить на порядок лучшую эффективность обучения без дополнительных данных. Стоимость — дифференцируемость симулятора, но для большинства физических задач это требование уже выполнено. Современные фреймворки автоматического дифференцирования (JAX, PyTorch) делают дифференцируемые симуляторы доступными — нужно лишь правильно сформулировать задачу.

Авторы планируют масштабировать PEARL на задачи активного управления потоками (active flow control) и частично наблюдаемые среды (POMDP). Оба направления — это задачи, где классические RL-методы работают плохо из-за высокой размерности и сложной динамики. PEARL может изменить баланс в сторону physics-informed подходов — там, где они действительно имеют преимущество. Особенно интересно применение к active flow control: управление турбулентностью в реальном времени требует именно той sample efficiency, которую даёт PEARL.

Часто задаваемые вопросы

Чем PEARL отличается от Physics-Informed Neural Networks (PINNs)?

PINNs решают дифференциальные уравнения, встраивая физические законы как loss-функцию. PEARL решает задачу оптимального управления, встраивая физику в градиенты политики. PINNs — это про решение уравнений, PEARL — про принятие решений в среде, описываемой этими уравнениями. Оба используют дифференцируемость, но для разных целей.

Нужен ли дифференцируемый симулятор для применения PEARL?

Да, это обязательное требование. PEARL использует автоматическое дифференцирование через симулятор для вычисления сопряжённых градиентов. Если симулятор недифференцируем (например, содержит дискретные события или стохастические переходы без перепараметризации), PEARL неприменим. Для таких задач подходят классические model-free методы (PPO, SAC) или model-based RL с суррогатной моделью.

Масштабируется ли PEARL на задачи размерностью выше 10,000?

В эксперименте mean-field leader-follower game PEARL работал с распределённым управлением гауссовской плотностью — это фактически высокая размерность. Авторы показали, что PEARL масштабируется лучше, чем value-based методы, потому что сопряжённые переменные несут информацию о структуре задачи, а не только о накопленной награде. Точный предел масштабирования пока не исследован — это будущая работа.

Итог

PEARL — это не очередная модификация PPO с новым лосс-функцией. Это принципиально другой способ обучать политики в средах с известной физикой: вместо скалярной награды использовать сопряжённые градиенты из оптимального управления. Результат — лучшая sample efficiency, стабильность и способность работать на задачах, где классический RL проваливается. Для сообщества reinforcement learning это сигнал: игнорировать структуру среды больше не обязательно. Если физика известна и дифференцируема — встройте её в градиенты. Это работает.

← Все записи