精读笔记
Problem Setting
这篇论文的真实问题不是“让四足机器人过障碍”,而是把高速 locomotion、perceptive obstacle negotiation、多 gait / multi-skill selection 和真实 onboard deployment 放进一个控制器里。难点在于这些要求互相冲突:高速要求强周期动力学和高能量动作,复杂地形要求非周期、terrain-conditioned 调整,多 gait 切换又会制造接触相位和身体姿态的分布断裂。
以前方法卡住的位置很清楚:model-based controller 在复杂接触和野外地形上建模成本高;vanilla RL 可以靠 reward 和 curriculum 学到行为,但多 gait、多地形、高速同时出现时 sample complexity 和 reward tuning 压力很大;perceptive parkour 类方法通常速度较低或技能较专;motion-prior 方法常把 prior 放在状态模仿或 reward 层,最后仍需要一个额外 controller 把 reference 变成 torque。这里的关键矛盾是:策略必须足够受约束,才能在高速接触动力学中稳定;又必须足够自由,才能处理 prior 从未覆盖的 3D terrain。
Motivation
作者的核心观察是,高速四足运动中最难学的部分不是“看见障碍”,而是找到物理上合理的接触节律、身体动量变化和 torque pattern。复杂地形上的很多 skill 变化可以看作对这些基础动态结构的变形,而不是从零生成全新的控制律。
已有路线缺的是 torque-level reusable prior。动物 mocap 或状态轨迹 prior 能提供运动形态,但不直接提供可部署动作;AMP 把 prior 变成 imitation pressure,容易限制策略离开 reference distribution;HRL/MoE 技能库能复用 expert,但 transition 往往是离散拼接,遇到未见地形时分布错位明显。APT-RL 的动机就是把 prior 从“要模仿什么”改成“动作空间本身长什么样”,并给 RL 留一个可以越界修正的通道。
Core Idea
论文最核心的想法是:用便宜的 2D trajectory optimization 生成大量带 torque 的 trot/bound 运动,把这些运动压缩成共享 latent action manifold;随后让 RL 不直接输出 torque,而是在这个 manifold 上选 latent action,并通过 gait-specific decoder 生成 feedforward torque,再用 auxiliary action 做 terrain-conditioned residual correction。
这个思路直觉上成立,是因为高速四足 locomotion 的主要结构高度低维:COM 动量、pitch dynamics、接触时序和前后腿协同占了大部分解释力。2D sagittal dynamics 虽然简化,但正好覆盖了高速跑跳中最关键的 sagittal-plane 动力学。RL 阶段则不被要求重新发现这些结构,只需要学习什么时候调用哪类 gait、latent 往哪里偏、以及如何用 residual torque/PD target 补偿 3D effect。和 prior work 的本质区别是,APT-RL 不是 reference tracking,也不是 expert selection,而是把 action parameterization 本身换成了一个可复用的动力学先验。
Method
关键机制可以压缩为四个层次。
第一,TO 数据生成解决“高速周期动态难探索”的问题。作者用 2D SRBD/impulse planning 生成 flat-terrain trot/bound 数据,并保留 torque。这里重要的不是 2D 模型精确,而是它足够便宜、足够覆盖速度和接触相位,并且能给出 action label。
第二,TVAE 解决“多 gait 之间需要共享坐标系”的问题。共享 latent 让 trot 和 bound 不再是两个孤立 expert,而是在一个连续空间中组织;gait-specific decoder 保留每种 gait 的 torque 结构。这个设计服务于 transition,而不只是压缩数据。
第三,RL policy 解决“先验无法覆盖真实 3D 地形”的问题。policy 输出 latent action、gait selection 和 auxiliary action。latent decoder 提供主运动模式,auxiliary action 提供偏离 2D prior 的自由度,尤其是 HAA、yaw、落地修正和意外扰动恢复。
第四,perception distillation 解决“真实高速部署时 privileged heightmap 不可用”的问题。depth 提供局部密集几何,2D LiDAR 提供更远 lookahead;student 模仿 heightmap teacher。这个部分更像系统工程上的必要闭环,保证控制器能在真实传感器延迟、视距和震动条件下工作。
Key Insight / Why It Works
最可能的核心贡献是 torque-level action prior,而不是 Transformer、VAE 或具体 perception encoder。把 prior 放进 action decoder 后,policy 的探索不再在 12D torque / joint target 空间里乱搜,而是在一组已经满足接触节律和动量结构的 torque primitive 上搜索。这比 AMP 的 reward-level prior 更硬,也比 HRL 的 skill-level prior 更连续。
第二个有效点是“允许离开先验”。论文没有把 RL latent 强行对齐 pretrained encoder distribution,而只用很弱的 KL;同时 auxiliary action 可以补偿 2D prior 没覆盖的 3D dynamics。这个选择很关键。如果把策略锁死在 flat-terrain TO manifold 上,它大概率只能跑得像参考数据,不能跳 log、上 high step 或处理 leg breakage。换句话说,这篇的成功不是因为 prior 很完整,而是因为 prior 足够强、但没有强到堵死 adaptation。
第三个有效点是 gait transition 被连续化了。传统 HRL 的 expert switch 是 policy distribution 的硬切换,容易出现相位不一致;这里虽然 decoder 是 gait-specific,latent space 和训练过程让 policy 在同一 action interface 下学习切换,且切换频率被限制在 2 Hz,相当于给 transition 一个低频决策层和高频连续控制层。
哪些可能只是 scaling / engineering:大规模 TO 数据、curriculum terrain、style reward、传感器组合、LiDAR 减振、部署线程和推理栈都非常重要。真实世界结果很强,但不能把全部增益归因于 APT architecture。特别是 perception 部分的提升,很可能主要来自 depth + long-range LiDAR 的互补覆盖和硬件减振,而不是 representation 本身。
所谓“autonomous skill selection”更像 reactive terrain-conditioned retrieval / interpolation,而不是显式 planning。policy 根据局部几何、速度命令和 proprioception 选择 gait/latent;没有证据表明它形成了长期状态建模或多步策略推理。对这类 locomotion 任务这未必是缺点,但需要避免把它解读成高层规划能力。
Relation To Prior Work
它最接近几条线的交叉:TO/imitation-based locomotion prior、AMP/ASE/CoMic 类 reusable motion representation、VAE-Loco/Gaitor 类 gait latent、ANYmal Parkour / Robot Parkour 类 perceptive locomotion,以及 residual RL。看似新的是 APT-RL 名字和 Transformer VAE;真正新增的信息是把 TO 生成的 torque action label 直接做成 reusable decoder,并在 downstream RL 中把 latent action 和 auxiliary action 联合优化。
相对 AMP,差异不是“有没有 motion prior”,而是 prior 的作用位置不同。AMP 用 discriminator 约束行为像数据;APT 用 decoder 让动作天然带有数据中的 torque dynamics。前者容易在需要 out-of-distribution motion 时变成束缚,后者更像 action-space preconditioning。
相对 HRL/MoE,差异是 transition 不是在多个完整 policy 之间切换,而是在共享 latent/action interface 中切换 decoder 并持续调整 latent。这样降低了 expert boundary 的分布断裂。
相对 VAE-Loco/Gaitor,差异是它不依赖 WBC 或额外 tracking layer 来落地参考 motion,而是直接在 torque/action 层复用 prior。这个点对高速接触尤其重要,因为 WBC/tracking 在快速落地、跳跃和野外冲击下容易成为瓶颈。
所以这篇属于“action-space prior + residual adaptation + perceptive RL deployment”的技术谱系,而不是纯 representation learning 或纯 parkour RL。
Dataset / Evaluation
数据侧有两个层次:pretraining 数据是 2D flat-terrain TO 生成的 trot/bound trajectory/torque,大规模但物理范围受限;evaluation 数据/环境是仿真多地形 curriculum 加真实城市、森林、室内障碍部署。这个组合基本支撑了论文的主要 claim:flat 2D torque prior 可以被 RL repurpose 到复杂 3D terrain,并在真机高速运行中有效。
真实世界验证是本文强项。同一 onboard policy 跑城市道路、森林地形、楼梯、高台、log、gap、stepping stone,这比只在室内 obstacle course 或 mocap 环境中展示更有说服力。尤其是高速 drop-down / high-step 场景,确实说明控制器不是低速谨慎爬障。
但 evaluation 也有明显边界。第一,benchmark 是作者自定义,不是社区标准任务;和 prior work 的对比主要在仿真中重建,无法完全排除 reward、terrain curriculum 和 implementation 差异。第二,真实部署更多是 demonstration + descriptive statistics,没有系统的失败率、长尾地形、不同机器人硬件上的严格对照。第三,任务主要还是 fore-aft locomotion,yaw/turning/lateral agility 没有被同等强度验证。总体上,实验足以支持“这个系统在该 robot 和该任务族上有效”,但还不足以证明通用野外运动智能。
Limitation
最核心限制是先验覆盖假设。方法把复杂 3D locomotion 建立在 2D sagittal-plane TO prior 上,因此对前后向跑跳、楼梯、gap、高台非常合适;但对急转弯、侧向避障、斜坡横切、非对称支撑、复杂足端选择和长时 horizon navigation,上限会很快暴露。作者自己也承认目前 focus 在 sagittal fore-aft locomotion。
第二,泛化可能主要来自数据和 curriculum,而不是抽象 skill reasoning。TO 数据覆盖速度和 gait,仿真 terrain curriculum 覆盖障碍族,真实环境又与这些 obstacle primitives 有较强结构相似性。所谓 unseen terrain 更像组合和扰动上的泛化,而不是语义级或几何拓扑级泛化。
第三,增益来源不完全清楚。ablation 显示 decoder torque、auxiliary action、shared latent、RL latent optimization 都有贡献,但真实系统还叠加了 style reward、velocity estimator、teacher-student perception、LiDAR lookahead、硬件减振和平台动力性能。文中未充分说明这些工程因素在真实 success 中占多大比例。
第四,auxiliary action 是双刃剑。它让 policy 能突破 2D prior,但也可能让方法退化为“强 prior 初始化 + residual RL”。如果 auxiliary 容量继续增大,prior 的边际贡献可能下降;如果 auxiliary 受限,3D 适应能力会下降。这个 tradeoff 文中没有系统展开。
第五,没有真正的 long-horizon planning。gait selection 以局部感知和速度命令驱动,2 Hz 切换更像 reactive mode selection。对高速连续多障碍,这足够实用;但它不解决路线选择、不可见区域、语义地形判断和任务级决策。
Takeaway
- 1. 最值得迁移的 insight 是:对动态机器人控制,motion prior 放在 action parameterization 里通常比放在 reward/discriminator 里更直接、更稳定,也更适合高接触频率任务。
- 2. 简化模型生成的数据不必覆盖最终任务,只要覆盖核心动力学不变量。
- 这里 2D TO 捕获了高速四足最关键的 sagittal momentum/contact rhythm,RL 负责把它变形成 3D 行为。
- 3. 好的 prior 必须有逃逸通道。
一句话总结
这篇论文把高速四足野外运动从“端到端 RL 学动作”推进到“TO-derived torque action prior + RL residual adaptation”的范式,是一次以动作空间重参数化为核心的 multi-skill perceptive locomotion 系统化整合。
