精读笔记
Problem Setting
GaitSpan 处理的不是普通 humanoid locomotion,而是“从已学会 walking 的 policy 出发,扩展到连续速度下的 walking-to-running family”。难点在于 walking、jogging、running 不是简单速度缩放:它们涉及接触时序、支撑相压缩、摆腿高度、腾空、身体姿态和能量注入方式的重组。
以前方法卡在两个极端:稳定 walking reward 往往压制高速动态行为;跑步或高动态 reward 又容易破坏低速稳定性。多专家/切换方法可以绕过这个矛盾,但会把连续速度问题离散化,导致边界行为、专家干扰和训练成本。模仿路线能给出自然动作,但把 gait prior 外包给人类数据,未必匹配机器人形态和执行器。
这篇的关键矛盾是:如何允许 policy 足够偏离 walking,产生真实动态 gait,同时又不丢掉 walking 中已经学到的 balance/contact/motor coordination 结构。
Motivation
作者真正抓住的观察是:walking policy 里并不只有“低速动作”,还隐含了周期性接触、相位相关关节协同、支撑转换和稳定反馈结构。这些结构在更高速 gait 中仍然有复用价值,只是不能按原始节奏直接执行。
已有路线缺的是一种“内部技能展开”机制。fine-tuning 会覆盖 seed;residual learning 如果只在原始 seed action 上加修正,所有高速结构都要由 residual 学,负担太重;multi-expert 没有共享 gait family 的连续结构;human imitation 给的是外部动作分布,而不是机器人自己的 motor prior。
因此作者把问题重新表述为:不是学习 running,而是让 walking seed 在新的 rhythm、stride dynamic 和 residual correction 下生成更大的 gait span。
Core Idea
GaitSpan 的核心思想是把 frozen walking policy 当作可查询的 motor prior,而不是一个待微调的初始权重或固定 base controller。通过改变 seed policy observation 中的 phase encoding,同一个 walking policy 可以生成多种 phase-scaled action waves。这些 waves 不是专家,也不是 demo,而是 seed 内部周期结构在不同节奏下的投影。
然后,policy 学的不是从零输出动作,而是学习在不同速度命令下如何组合这些 walking-derived waves,并在必要处添加 residual。这样信息流发生了变化:原始 RL 不再独自发现 gait 周期和接触结构,而是在 seed 已有的周期结构上做连续重组。H-SLIP 再提供物理事件级 inductive bias,把“节奏变快”推向“压缩-回弹-腾空-触地”这类 running-like 结构。
本质区别是:它不是 gait switching,也不是 motion imitation,而是把一个已有 closed-loop skill 变成生成式 basis。scalability 的希望也在这里:如果 seed skill 足够好,后续新 regime 可以通过结构化重组而不是重训专家获得。
Method
Seed reuse:冻结 walking policy,并把目标速度映射回 seed 可处理的 walking command range。这样 seed 始终提供稳定的 closed-loop walking scaffold。必要性在于避免 fine-tuning 破坏低速稳定性,也避免从零探索 balance/contact。
GaitWave:对 seed 的 phase input 做多尺度变换,查询同一个 seed 得到一组 canonical action waves,再用速度条件的层级 memory 生成组合系数。它解决的是“walking rhythm 如何被连续改写”的问题。核心变化是动作生成从单一路径变成 seed-derived rhythm basis 的组合,残差压力显著降低。
H-SLIP:用 root-foot、root-knee、knee-foot 三层 virtual leg 的压缩/回弹/触地/腾空 reward 引导动态 stride。它解决的是 GaitWave 只改变节奏但不保证形成物理合理高速 gait 的问题。重要的是它是 event-level prior,不是硬轨迹模板,因此保留了 embodiment-specific adaptation。
Residual + self-anchoring:残差捕捉 wave composition 与 H-SLIP 无法解释的动作细节;self-anchored regularization 保持低速接近 seed、限制残差规模、维持相位一致性和动作时间连续性。它更像稳定器,不是主要 gait emergence 来源。
Key Insight / Why It Works
我认为最核心的贡献是 GaitWave 的建模方式:它把 walking policy 中的相位依赖动作结构显式展开为一组可组合 basis。这比普通 residual learning 更强,因为 residual 不再需要自己发明高速 gait 的周期骨架;它只需要在 seed-derived manifold 附近修正。
H-SLIP 是第二个关键点,但更像必要 inductive bias。仅有 phase scaling 很可能得到“快走”或不稳定抖动,而不是 running-like gait。H-SLIP 把 reward 从 generic tracking/energy 转向动态事件,使 policy 有动机产生 flight、rebound 和 touchdown control。它的贡献不是 SLIP 本身新,而是把 SLIP 降级成 relaxed reward prior,避免模板控制的刚性。
层级 memory 的作用更偏 engineering,但不是无关紧要。单一速度到系数映射容易被高速命令主导,硬分区又会产生 gait boundary artifact;multi-resolution soft blending 是一个合理的连续函数近似器。这里的 insight 更像 representation smoothing / retrieval over command space,而不是新的 locomotion theory。
增益来源并不完全清晰。论文同时使用强 seed、phase prior、SLIP reward、self-anchor、多分辨率 memory、FastSAC、大规模并行训练、high-speed sampling bias 和 domain randomization。最终效果很可能来自“better inductive bias + sufficient scaling + careful reward shaping”的组合,而不是某个单独模块。文中 ablation 支持组件互补,但还不足以严格分离算法创新和训练 recipe 的贡献。
这不是 test-time compute,也不是长期 planning;也不是严格意义上的 continual learning。所谓 skill growth 更接近 frozen prior-conditioned policy expansion。它的 reasoning 成分很弱,主要是从 seed motor manifold 中 retrieval / recombination,再由 RL reward 把行为推到目标动态区间。
Relation To Prior Work
最接近的路线有四类:residual policy learning、phase-conditioned gait control、SLIP/model-based dynamic prior、multi-skill distillation/mixture-of-experts。GaitSpan 的新意不是这些部件单独出现,而是把它们组织成“frozen walking skill as generative basis”的框架。
相对 model-based SLIP 控制,它没有用 SLIP 规定轨迹或 contact schedule,而是把 SLIP 事件转成 reward bias;这保留了 RL 对 embodiment 和环境的适应性。相对 imitation learning,它不从人类 motion data 导入 gait distribution,因此更 robot-native,但也牺牲了人类动作自然性。相对 multi-expert,它不训练 walking/jogging/running 专家再拼接,而是在一个 seed skill 的内部相位结构上连续扩展。
看似新的部分里,phase scaling、residual adaptation、reward shaping、memory bank 都有已有思想影子。实质创新在于把 walking policy 的 phase-conditioned action response 当作可重用 action-wave basis,并用 command-conditioned composition 学 gait family。这属于 skill prior / policy reuse / physics-guided RL 的交叉谱系,而不是纯粹的新 RL 算法。
Dataset / Evaluation
评估覆盖五种 humanoid 配置,包括 Unitree G1、Booster T1、Booster K1 的不同 DoF;训练在 IsaacGym,sim-to-sim 到 MuJoCo,并展示 unseen real-world terrain 的 zero-shot deployment。任务覆盖从低速 walking 到 2m/s 以上的 OOD high-speed command,指标主要看 tracking error、flight time、energy 和接触模式。
这些实验基本支持核心 claim:单一策略确实能随速度产生连续 gait reorganization,并且不是简单 seed extrapolation。跨 embodiment 的 contact pattern 差异也说明方法没有强行套同一个 gait schedule。
但 evaluation 的限制也明显。真实世界部分主要是视频/定性展示,缺少系统统计、失败率、长时稳定性和扰动恢复。baseline 多为作者适配版本,multi-expert 和 AMP 的训练质量是否达到强 baseline 水平不完全可验证。flight time 被用作 dynamic gait emergence 的 proxy,但 flight 多不等于跑得好;它可能奖励某些不必要的跳跃式运动。benchmark 是否充分证明“generalizable skill growth”仍有限,更准确地说是证明了在该训练 pipeline 与速度命令分布下的有效扩展。
Limitation
最大前提是 seed walking policy 必须已经包含可复用的周期结构,并且 observation 中有可操作的 phase encoding。如果 seed 是非周期隐式策略,或者 walking 本身不稳定/覆盖窄,GaitWave 的 basis 质量会直接受限。论文也承认弱 seed 会限制 emergent behavior。
第二个上限是 skill growth 目前是单步的。walking seed 被扩展到 running-like policy 后,并没有把新能力重新内化成下一代 seed,也没有展示从 running 再扩展到跳跃、急停、转向、复杂地形奔跑的递归机制。因此“skill growth”更像一次结构化 transfer,而不是真正 lifelong skill acquisition。
第三,泛化 claim 需要谨慎。跨 morphology 是在同一训练框架下分别训练多个 embodiment,并不是一个 policy zero-shot 控制所有机器人。真实 terrain zero-shot 也建立在 domain randomization 和相对温和地形上,不能直接推到复杂户外高速奔跑。
第四,增益归因不清。H-SLIP reward、flight reward、feet phase reward、速度采样 bias 和 self-anchor 之间耦合很强。某些 improvement 可能主要来自 reward engineering 和大规模训练,而不是 GaitWave 本身。文中未充分说明没有 GaitWave 但使用更强 curriculum/reward tuning 时能否接近结果。
最后,方法把一部分难题转移到了 seed policy 和 reward design:不用人工 gait schedule,不等于没有人工 inductive bias;SLIP event、phase basis、速度分区、anchor 权重本身都是强结构假设。
Takeaway
- 1. 最值得迁移的 insight 是:不要只把 pretrained policy 当 initialization 或 fixed base action;可以通过 perturb/query 它的内部 conditioning,把它展开成一组可组合 behavioral basis。
- 2. 对连续技能族,显式专家切换不是唯一解。
- 若已有技能里包含共享动力学结构,学习“如何重组 prior”可能比学习多个 endpoint 更可扩展。
- 3. Physics prior 的有效形式可能不是模板控制,而是 event-level reward shaping:保留压缩、回弹、触地、腾空这类结构,但不规定具体轨迹。
一句话总结
GaitSpan 是一篇把 humanoid walking policy 从训练终点改造成可组合 motor prior 的工作,其实质贡献是用 seed-derived rhythm basis 加物理事件 reward 实现 walking-to-running 的结构化 policy expansion。
