精读笔记
Problem Setting
这篇论文解决的是连续极端坡面上的 humanoid blind locomotion,而不是一般复杂地形 locomotion。真正困难点在于斜坡带来持续的重力偏置:CoM 投影、支撑面法向、接触力分布和关节负载都被系统性改变。离散障碍主要考验 foothold selection 和短时恢复,斜坡则要求整段运动都处在偏置动力学下。
以前方法卡住的地方是把坡面当作 terrain randomization 的一个维度,reward 仍然是通用 tracking、survival、energy、stability 组合。这样的目标在陡坡上容易找到一个“低 CoM 保守稳定”的局部解:看似稳,实则慢、蹲、关节负载高,而且会污染平地和缓坡姿态。关键矛盾是:越陡的坡越需要稳定裕度,但单纯追求稳定会诱导 crouched gait;真正目标是稳定性和姿态/效率之间的 slope-conditioned trade-off。
Motivation
作者的核心观察很准确:generic RL 在坡面上学到的低 CoM 策略不是能力,而是 reward misspecification 的症状。它把“不要摔倒”解决成了“长期蹲着走”,这在短 horizon 成功率上可能有利,但会牺牲速度、CoM 高度、髋膝负载,并压低极限坡度。
已有路线缺的不是更大的网络或更多 terrain types,而是两个结构性先验。第一,稳定性评价需要尊重斜坡支撑几何;用世界水平面看 ZMP/CoM deviation 在坡面上物理上就是错位的。第二,上坡和下坡不是同一种 gait 的符号翻转,而是不同的 joint work distribution:上坡更偏 propulsion,下降更偏 braking。论文的动机就是把这两个 slope-specific bias 注入 RL,而不是期待 model-free policy 从 reward sparse signal 里自己发现。
Core Idea
论文真正的核心不是“两阶段框架”这个形式,而是改变了 locomotion reward 的参考系和条件变量。Stage I 把 balance prior 从 world-horizontal reference 改为 local inclined support plane,使策略在学习稳定性时看到的误差与真实接触几何一致。这个改变很小,但物理含义重要:它避免 policy 为了满足错误参考系下的稳定指标而形成不自然姿态。
Stage II 则把坡面宏观结构作为训练期 privileged signal,用来 gate 软的 biomechanical priors。这里的本质是 representation alignment:terrain descriptor 不直接进入部署 actor,而是通过 critic 和 reward shaping 改变训练梯度,让 proprioceptive actor 最终学到“遇到这种身体反馈时应采用这种坡面姿态”。这比在线依赖 exteroception 更简单,也更适合 blind sim-to-real;但它的泛化上限取决于训练中 slope descriptor 与 proprioceptive feedback 的覆盖关系。
Method
关键机制可以压缩成三点。
第一,terrain-aligned ZMP regularization 解决的是稳定性参考系错配。传统 ZMP reward 默认水平地面,坡面上支撑面与重力方向不再匹配,导致 balance deviation 的测量带系统偏差。作者用局部支撑平面和 apparent force 近似得到 terrain-aligned ZMP,再相对 contact-force-weighted support anchor 做 dense reward。它带来的核心变化是:平衡奖励不再惩罚一个与真实接触几何无关的投影误差。
第二,BSGA 解决的是低 CoM 局部最优。它不是 imitation,也不是显式 gait library,而是用坡度方向调制 CoM height、上下坡下肢协调和摆腿参考。需要它的原因是 Stage I 只能给稳定 prior,仍可能保守;BSGA 把“稳定”重新约束到更高 CoM、更符合坡向的姿态空间里。
第三,PCA terrain descriptor 解决的是训练期坡面结构可见、部署期不可见之间的信息组织问题。critic 和 reward gate 看 slope descriptor,actor 不看。这相当于 privileged learning / asymmetric actor-critic 的一种 slope-specific 用法:把外部几何信息用作训练监督,而不是部署依赖。
Key Insight / Why It Works
最可能的核心贡献是 reference-frame correction 加 descriptor-conditioned reward shaping,而不是某个具体 reward 公式。斜坡任务中很多 failure 不是 policy capacity 不足,而是 reward 在错误几何下诱导了错误局部最优。把 ZMP deviation 放到局部斜面上,相当于修正了稳定性信号的坐标系;把 CoM 和关节先验按坡向 gate,相当于修正了 posture prior 的条件性。这两个改动共同把 RL 的搜索空间从“所有能不倒的 gait”压缩到“符合坡面力学的 gait”。
BSGA 有效的原因更像 better inductive bias + privileged supervision,而不是 discovery。作者把人类 slope biomechanics 转成低权重软约束,让 policy 不必从零探索上坡髋主导、下坡膝制动这类结构。这里的有效性来自先验对局部最优的排除:它并不保证最优,但能阻止 crouched gait 这种廉价解占据训练。
两阶段训练也很可能贡献很大。Stage I 先给出能走的稳定 prior,Stage II 再改姿态和速度,本质上是 curriculum / warm start。文中没有完全隔离 two-stage curriculum、terrain distribution、ZMP reward、BSGA reward、critic cue 的交互贡献,因此“增益来源不清”的部分仍存在。尤其 w/o BSGA 完全失败,而 Stage I only 又能成功但更慢更低 CoM,说明 Stage II objective 的训练稳定性可能强依赖 BSGA,不只是最终 gait prior。
这不是 test-time compute,也不是 planner,也没有真正长期地形推理。部署 actor 的适应更可能是基于 observation history / projected gravity / joint-contact response 的 implicit slope inference。说它“blind generalization”可以,但不应解读成 policy 在部署时理解了地形;更像训练期用 hidden slope label 塑造了一个可由本体反馈触发的 gait response manifold。
Relation To Prior Work
这篇最接近三条线:model-free humanoid sim-to-real locomotion、ZMP/CoM stability reward shaping、privileged learning / terrain-adaptive reward conditioning。它和 RMA 式 rapid motor adaptation 的共同点是训练期有 privileged terrain/dynamics 信息、部署期靠本体感知;不同点在于这里不是显式估计 latent dynamics,而是用 terrain descriptor gate reward 和 critic,让 actor 间接吸收 slope-conditioned gait prior。
和 perceptive humanoid locomotion 的本质区别是部署不依赖 depth / height map,因此不能预判,但也避免了视觉栈带来的噪声和延迟。和通用 terrain RL 的区别是它没有把 slope 当作随机地形样本,而是显式改变稳定性几何和 gait prior。和 classical ZMP 方法的区别是它没有回到 model predictive control 或精确 contact wrench feasibility,而是把 ZMP 几何压缩成 RL 可用的 dense surrogate。
哪些看似新其实是重组:asymmetric actor-critic、privileged terrain cues、reward shaping、curriculum 都是已有思想。实质创新在于把这些工具针对“连续斜坡的持续重力偏置”重新组织,并明确指出 crouched gait 是 slope locomotion 的主要 failure mode,而不是简单调 reward weight 就能自然解决的问题。
Dataset / Evaluation
评估覆盖了 compound slope track,包含上坡、下坡、平台、波浪、banked、rough、striped 等变体,并且有不同摩擦层级和真机草坡/湿滑坡实验。相比只在单一 ramp 上展示,这更能支持“不是 memorizing one ramp”的 claim。真机结果尤其重要,因为盲策略能在户外草坡上连续行走,说明至少在该机器人和地形分布下 sim-to-real 成立。
但 evaluation 仍主要验证 slope-family generalization,而不是开放地形泛化。held-out track 和训练地形虽然不同,但仍共享同一类宏观结构:连续坡面、局部可近似平面、坡度变化不需要远距离预判。真实世界实验也更像 capability demonstration,而不是系统性 outdoor benchmark。文中没有充分说明失败案例、坡度突变、软/变形地面、横坡耦合强扰动下的上限。
消融支持核心机制,但不够干净。BSGA reward priors 是联合消融,无法判断 CoM height、hip propulsion、knee braking、swing guidance 哪个是主因。critic cue 与 reward gate 的相互作用也没有完全拆开。结论可以相信“这组 slope-specific priors 有效”,但不能精确归因到某个 biomechanical term。
Limitation
第一,部署 actor 是盲的,不能预判坡度转换。它的姿态变化只能在身体已经接触地形后通过本体反馈产生,因此对 abrupt transition、坑洼、台阶接坡、松软地面会天然滞后。这不是小缺点,而是 blind policy 的结构上限。
第二,方法依赖训练期 terrain descriptor 的质量。PCA slope descriptor 假设局部 height scan 可被一个主平面解释;在强非平面、可变形、局部滑移或多接触复杂地形上,这个 descriptor 可能不再代表真实支撑几何。训练期 gate 学到的先验也会随之失真。
第三,泛化可能主要来自数据覆盖和 reward engineering。论文显示了 held-out track 和真机迁移,但没有证明 policy 学到了可组合的 slope reasoning。更保守的判断是:它在覆盖充分的 slope distribution 上学到了一个良好的 proprioceptive response manifold。
第四,ZMP surrogate 是近似。作者有意避开 centroidal angular momentum rate 和 contact wrench support region,这在大规模 RL 中合理,但也意味着所谓 ZMP regularizer 不是严格稳定性约束。它更像有物理解释的 dense shaping signal,而不是保证稳定的 criterion。
第五,增益归因不完全清晰。两阶段训练、critic reset、terrain distribution 切换、PCA critic cue、reward priors 同时作用,部分提升可能来自 curriculum 和优化稳定性,而不完全来自 biomechanical insight。
Takeaway
- 1. 对持续物理偏置的任务,reward 的参考系比 reward 项数量更重要。
- 坡面 locomotion 的关键不是再加一个 stability term,而是把 stability term 放到正确的支撑几何里。
- 2. Biomechanical prior 的价值不在模仿人,而在排除 RL 的廉价局部最优。
- 上坡/下坡的关节做功不对称可以作为低维、可迁移的 gait regularizer。
一句话总结
HumoSlope 是一篇把 humanoid slope locomotion 从通用地形 RL 中单独剥离出来、用斜坡一致的稳定性参考系和训练期 biomechanical reward conditioning 修正低 CoM 局部最优的 physics-guided RL 工作。
