精读笔记
Problem Setting
论文标题:SKooP: Symmetric Koopman Predictions for Faster and More Generalizable Legged Robot Locomotion with Reinforcement Learning(arXiv preprint / 2026)。
这篇论文真正处理的不是“如何用 Koopman 学机器人动力学”,也不是“如何做对称 RL”,而是 actor-critic locomotion 中一个更具体的问题:critic 在高维、接触丰富、非线性强的状态空间里很难学到平滑且可泛化的 value function,导致 PPO 训练慢、容易专门化到训练场景,尤其在左右镜像任务上失败。
关键矛盾是:model-free RL 可扩展到大规模仿真,但缺少结构先验;model-based / Koopman 方法有动态结构,但在复杂腿式机器人上直接作为 controller 或 policy input 容易不稳;symmetry prior 能改善泛化,但可能限制表达能力并损失训练任务性能。SKooP 的设定正是试图在不改变部署 actor 输入的情况下,把动态先验和对称先验压进训练过程。
Motivation
已有路线的缺口很清楚。纯 PPO 在 push door 这类非对称训练任务上会学到右侧任务的高度专门化行为,镜像任务几乎不泛化。对称 RL 如 PPOeqic 可以强制左右泛化,但 reward 和 success rate 可能明显掉下来,说明单纯缩小函数类不一定带来更强控制能力。Koopman-RL 过去要么停留在低维 benchmark,要么把 encoded state 直接喂给 policy,难以说明在真实机器人高维接触任务中是否带来实际训练收益。
作者的核心观察是:如果 Koopman latent 的价值不在于部署时做 model-based control,而在于训练时帮助 critic 估计未来 return,那么它就不需要成为 actor 的负担。critic 本来就是预测未来累积回报的函数,给它一个短期 dynamics prediction 是结构上合理的。进一步,如果这个 latent space 保持机器人形态对称性,那么 value learning 的预测特征也不会破坏镜像泛化。
Core Idea
SKooP 的核心不是“Koopman + symmetry + PPO”的模块拼接,而是重新组织 actor-critic 中的信息流:actor 保持 reactive,只接收当前 state;critic 接收由对称 Koopman autoencoder 预测出的未来 latent state。这样,Koopman 模型不直接控制机器人,也不承担长期 planning,而是作为 value estimation 的 inductive bias。
这个设计在直觉上成立,因为 value function 要拟合的是未来回报,而原始状态到未来回报之间跨越了接触、姿态演化和动作后果。Koopman latent prediction 相当于给 critic 提供一个经过 dynamics-aligned smoothing 的未来状态特征,使 Bellman regression 更接近线性或低曲率问题。对称约束则把左右镜像等价性直接写进 actor、critic 和 latent dynamics,避免 learned representation 在对称方向上任意分裂。
和 prior 的本质区别在于:它没有把 Koopman 当成显式 controller,也没有只把 symmetry 当作 data augmentation;它把二者合成 critic-side privileged dynamics representation。这是一个训练时结构先验,而不是部署时复杂模型。
Method
关键机制可以压缩为四个。
第一,actor equivariant、critic invariant。它解决的是形态对称机器人在镜像状态下策略和价值应满足的函数约束问题。actor equivariance 保证镜像输入产生镜像动作;critic invariance 保证镜像状态具有同一价值。这不是装饰性约束,而是直接限制 policy/value 的 hypothesis class。
第二,ecDAE 学一个受控 Koopman latent:z_{k+1}=Az_k+Bu_k,并通过 encoder/decoder 保持对称等变。它解决的是原始机器人状态空间中 dynamics 非线性太强、critic 特征不够平滑的问题。核心变化是把状态预测问题转成 latent 线性演化问题,同时让 latent 的 mode decomposition 尊重群表示。
第三,critic 使用预测 latent z_{k+1} 作为 privileged observation。它解决的是 value learning 缺少未来动态信息的问题。重要的是 actor 不使用该预测,因此 deployment 不增加额外模型依赖;这个预测只改变训练时 advantage/value 的质量。
第四,ecDAE 在线随 PPO 一起训练,并使用 replay buffer 维护 dynamics 数据。它解决的是预训练 Koopman 模型和 policy-induced state distribution 错位的问题。这里也引入了一个需要警惕的因素:部分收益可能来自额外数据复用和 representation learning,而不完全来自 Koopman 线性化本身。
Key Insight / Why It Works
最可能真正有效的部分是 critic-side predictive representation,而不是 Koopman 理论本身的完整威力。论文中的 Koopman prediction horizon 很短,且没有用于 MPC 或长期 rollout;它更像是一个 dynamics-aware feature generator,让 critic 看到“当前动作作用后的 latent 后果”。这会降低 value fitting 的局部复杂度,进而改善 policy gradient 信号。
symmetry 是泛化的核心来源,这一点实验很清楚:无 symmetry 的方法即使训练任务 success rate 高,也几乎不能泛化到镜像 door。换句话说,mirror generalization 不是 Koopman 带来的,而是 explicit equivariance 带来的。Koopman prediction 的作用更像是在已经具备对称泛化的基础上,提高任务性能、降低方差、改善 learned motion quality。
ecDAE 的贡献在于 representation alignment:它让 Koopman latent 与机器人形态对称群一致,避免 critic privileged feature 和 actor/critic 的对称结构互相冲突。文中关于 invariant eigenvalue 接近 1 的分析有启发性,但更像 post-hoc evidence;它说明模型可能捕捉到跨 symmetry group 不变的动态成分,但还不足以证明这是性能提升的因果来源。
需要直接判断:这不是一个真正的 planning 方法,也不是证明 Koopman linearization 可以解决复杂 locomotion 控制。它更接近 better inductive bias + privileged critic + representation smoothing + replay-based data reuse 的组合。增益来源不清的部分包括:额外 autoencoder loss 是否起到 auxiliary task regularization;PER 是否改善了数据覆盖;latent dimension 扩大三倍是否提供了更强 critic 表达;预测 z_{k+1} 相比 z_k 的收益在早期甚至较弱,说明 Koopman prediction 本身并非无条件主导因素。
Relation To Prior Work
最接近的谱系有三条:equivariant RL for legged locomotion、Koopman autoencoder / DAE dynamics learning、Koopman-assisted RL。SKooP 的新意不是提出新的 Koopman 学习算法,也不是新的群等变网络,而是把 symmetric Koopman dynamics 作为 actor-critic 中 critic 的 privileged predictive feature。
相对 PPOeqic,SKooP 的实质新增信息是动态预测 latent;对称结构本身基本沿用已有 morphological symmetry RL。相对 Koopman-RL 或 KIPPO,SKooP 的不同点是它不让 actor 直接依赖 Koopman state,而是把 Koopman prediction 用于 value learning,这更适合机器人部署。相对 eDAE / dynamics harmonic analysis,SKooP 把对称 Koopman 模型从 dynamics characterization 推进到 policy optimization,但并没有把它变成可解释 controller。
因此这篇属于“physics-informed actor-critic”而非 classical model-based RL。它更像把结构化 representation learning 嵌入 PPO,而不是替代 PPO。
Dataset / Evaluation
实验覆盖三个 Cyberdog 2 四足机器人双足化任务:stand dance、walk slope、push door。任务选择是有针对性的:它们都涉及高维接触 locomotion,其中 push door 还带有显式左右不对称,可用于检验 mirror generalization。论文做了多种 ablation,能大致区分 symmetry、latent state 和 prediction 的作用。
评估支持的 claim 有两个:第一,显式 symmetry 约束确实显著改善镜像任务泛化;第二,在这些仿真任务中,Koopman latent / prediction 能改善训练回报和部分运动质量。比较有价值的是 push door 的 right/left success rate 和 SI,因为它直接暴露了纯 PPO 的专门化问题。
但 evaluation 的边界也很明显。没有真机实验,只有 Isaac Gym 到 MuJoCo 的 sim-to-sim;这只能说明一定的 simulator transfer robustness,不能说明 sim-to-real。OOD 初始姿态范围较窄,镜像任务也和训练任务高度结构同源,因此所谓泛化主要是 symmetry-induced generalization,不是开放世界泛化。benchmark 是否充分验证“faster and more generalizable locomotion”中的 generalizable,需要谨慎:它验证的是预定义群作用下的泛化,而不是对新 terrain、新 morphology、新 contact regime 的泛化。
Limitation
最大前提是 symmetry 必须已知且有效。机器人 morphology、state/action representation、reward 和环境都要在 C2 reflection 下近似一致;一旦任务本身强非对称,或者硬件存在不可忽略的左右差异,强制 equivariance 可能限制最优策略。
第二,Koopman 模型的上限受 policy distribution 限制。在线训练虽然避免预训练错位,但它学到的是当前 policy 访问区域内的短期 predictive latent,不是全局 dynamics model。所谓 Koopman linearity 在复杂接触 locomotion 中很可能只是局部、经验性、短 horizon 的 representation smoothing。
第三,增益归因不完全清楚。SKooP 相比 PPO 改了很多东西:网络约束、critic 输入、auxiliary dynamics loss、PER 数据复用、latent 扩维、额外训练计算。文中 ablation 有帮助,但仍不足以排除“主要来自 auxiliary representation learning / critic privilege / scaling”的解释。
第四,方法把一部分问题转移到了表示设计上:如何定义 group action,如何选择 latent representation,如何保证 encoder/decoder 与真实 robot state 的物理含义一致。对熟悉机器人系统的人来说,这些不是免费先验,而是需要工程和领域知识维护的结构假设。
第五,sim-to-sim 结果没有失败,但 yaw tracking 在 MuJoCo 明显退化,说明 learned policy 对接触和 actuator modeling 仍敏感。没有真机结果时,不能把 robustness claim 读得太强。
Takeaway
- 1. 最值得迁移的 insight 是:不要急着把 learned dynamics model 用作 controller;把短期预测作为 critic-side privileged information,可能是更稳定、更低风险的用法。
- 2. 对称性在机器人 RL 中仍然是非常强的泛化先验,但它需要和任务性能之间做 trade-off。
- SKooP 的价值在于用 dynamics-aligned latent 缓解纯 equivariant policy 可能带来的性能损失。
- 3. Koopman 在这里的实际角色不是“发现全局线性系统”,而是提供一个更平滑、更结构化的 value feature space。
一句话总结
SKooP 是一篇把形态对称性和 Koopman 短期预测重组为 critic-side inductive bias 的 physics-informed RL 工作,真正贡献在于改善 value learning 与镜像泛化,而不是证明 Koopman 模型可以直接解决高维腿式机器人控制。
