精读笔记
Problem Setting
这篇论文解决的不是一般意义上的 LiDAR obstacle avoidance,而是端到端 RL 导航策略在部分可观测、障碍密集、传感器输入高维且随时间变化的环境中,如何用有限计算维持稳定 temporal state。关键矛盾是:避障需要对最新 LiDAR 变化高度敏感,目标导航又要求策略不要被瞬时障碍、远场墙面或噪声打断。以前方法的问题在于把 LiDAR、goal、velocity 放进同一个 temporal encoder,默认它们共享同一种记忆衰减和状态更新机制。LSTM 容易遗忘或训练不稳,Transformer 对短序列尚可但实时性和样本效率差,vanilla Mamba 虽然线性高效,但仍然是 single-state mixer,所有信息都竞争同一隐状态容量。真正困难点是避免 temporal representation 被“反应性信号”持续污染,同时又保留足够快的安全响应。
Motivation
作者的出发点是一个合理但常被端到端 RL 忽略的结构事实:导航决策天然是 multi-rate 的。障碍距离、行人相对位置、碰撞风险是快变量;目标方向、任务意图、全局进展是慢变量。已有路线不够的地方不是 temporal modeling 能力绝对不足,而是缺少对这两类变量的结构隔离。Mamba 提供了一个合适底座,因为它比 Transformer 更适合实时控制,又比 LSTM 更适合长序列压缩;但 vanilla Mamba 仍然把所有模态统一写入一个 SSM state。论文想补的缺口是:给高频 reactive memory 和低频 strategic memory 不同的信息入口和更新方式,让模型不要自己从数据里完全学出这种分工。
Core Idea
StratMamba 的核心思想是把“时间建模”从一个统一序列压缩问题,改写成一个带先验的信息路由问题:哪些信号应该快速改变 policy,哪些信号应该稳定保持并参与长期目标对齐。proximity stream 接收完整 observation,承担局部反应和动态避障;goal stream 只接收 goal / distance,承担目标方向和任务进展的慢变量记忆。两者最后融合给 PPO actor-critic。
本质区别在于它不是简单把 Mamba 换进导航,也不是靠更长 history 做 implicit planning,而是给 temporal state 加了一个“语义-时间尺度”分解的 inductive bias。这个 bias 理论上能提升 scalability:当 LiDAR range 变长、远场结构变复杂时,模型不必把所有空间信息都写进同一个策略记忆;goal stream 提供一个相对不受 LiDAR 噪声影响的稳定 anchor,proximity stream 则通过 LiDAR gate 负责快速修正。它更像 representation factorization,而不是新的 planning algorithm。
Method
关键机制可以压缩为三件事。
第一,dual-stream state partitioning 解决的是单一隐状态里的语义干扰问题。goal 信息低维、慢变、任务相关;LiDAR 高维、快变、风险相关。把它们拆开处理,相当于降低不同变量在 SSM state 中互相覆盖的概率。
第二,proximity-gated SSM update 解决的是 reactive signal 需要直接影响 temporal dynamics 的问题。LiDAR gate 不是只作为输入 embedding 的一部分,而是注入每层 SSM state update,使近场障碍能改变记忆更新路径。这个设计让 obstacle cue 不必经过普通 encoder 慢慢传播到最后表示,因而更适合低频控制下的避障。
第三,zero-initialized gate / fusion 解决的是 RL 训练稳定性问题。新增结构初始时近似 vanilla Mamba,随后逐渐学习偏离。这一点很工程,但在 PPO 这种对表示漂移敏感的训练中可能很重要。论文里的 reward、Gaussian action head、PPO 框架不是主要贡献,更多是为了固定控制变量。
Key Insight / Why It Works
最可能有效的核心不是“Mamba 比 Transformer 快”,而是 explicit factorization of memory。导航策略失败时常见的问题不是看不到障碍,而是看到了太多东西之后失去目标一致性:远场墙、家具边界、动态人、近场障碍都写进同一个 hidden state,policy 变得保守、绕行或停滞。StratMamba 通过 goal-only stream 保留一个低熵目标表示,相当于给 policy 一个不被 LiDAR 全量上下文扰动的导航基准。
proximity gate 可能是第二个关键点。它把 LiDAR 从普通 observation 变成 SSM update 的调制信号,这更接近“风险条件下改变记忆动态”,而不是“把 LiDAR 编码成一个 token”。如果 gate 学到的是近场危险权重或远场抑制,那么 3m LiDAR 下的 robustness 就有合理解释:模型不会让完整房间结构持续污染状态。
但需要直接指出:论文目前无法干净证明这一点。增益来源不清。StratMamba 相比 vanilla Mamba 不只是多了结构先验,也多了参数、分支、gate、zero-init residual path 和不同优化路径。部分提升可能主要来自 engineering / scaling,尤其是训练收敛和轨迹平滑。所谓 strategic planning 也可能并不是规划,而是 goal vector 在独立通道中被更稳定地保留;这是一种 representation alignment,不是显式 long-horizon reasoning。若要证明 planning,需要更强的 delayed decision、不可见障碍记忆、拓扑选择或动态预测测试。
Relation To Prior Work
技术谱系上,它属于 Mamba / SSM for embodied control 的结构化改造,而不是传统 planner 或 hybrid planning。和 LSTM / Transformer 的差异主要是计算复杂度和状态压缩方式;和 vanilla Mamba 的实质差异是从 uniform temporal encoding 变成 semantically partitioned temporal encoding。
看似新的部分里,多流结构、模态分流、gated fusion 都不是新思想,在视觉多模态和机器人感知里已有大量先例。真正新增的信息是把这种分流明确绑定到导航中的 reactive vs strategic temporal asymmetry,并嵌入 Mamba 的 SSM state update,而不是只在 feature level 做 late fusion。
它和 classical navigation 的关系较远:没有显式地图、轨迹优化、碰撞约束或可解释 planner。论文借用了“strategic”这个词,但实际更像把 goal-conditioned policy 的内部记忆做了结构化正则。和 PRM-RL、DWA-RL 等 hybrid 方法相比,它没有引入外部规划器,因此泛化和安全性仍然主要依赖训练分布与 learned representation。
Dataset / Evaluation
评估覆盖了 IsaacLab 训练/测试、Gazebo 跨仿真平台、Go1 真机部署,强于许多只做单仿真的 navigation RL 工作。真机部分尤其有价值,因为 1.5m 到 3.0m LiDAR range 的变化暴露了 single-stream 方法的脆弱性,这个实验确实更贴近论文的核心 claim:输入上下文变复杂时,分流记忆更稳。
但 evaluation 仍然不足以完全支撑“long-horizon strategic reasoning”。训练和主要评估仍是相对短程目标导航,真实场景空间只有室内小范围,动态障碍速度和交互模式简单,目标由 VICON 提供,且策略运行在 offboard laptop。Gazebo sim-to-sim 展示了平台迁移,但缺少系统性 domain randomization 分析。成功率、path efficiency、smoothness 能说明控制效果,却不能区分是更好规划、更好局部避障,还是更适合该 reward 的行为偏置。
最明显的 evaluation gap 是缺少严谨 ablation。没有同参数量 Mamba、无 gate StratMamba、无 goal stream、共享/独立 stream 对照,也没有测试 LiDAR range distribution shift 是否训练中已覆盖。核心 claim 大体被现象支持,但机制归因仍偏弱。
Limitation
方法成立依赖几个前提。第一,observation 中必须存在可明确拆分的慢变量和快变量;如果任务的战略信息也高度依赖感知历史,例如未知地图探索、遮挡后目标推断、多房间拓扑导航,goal-only stream 可能不够。第二,goal position 是外部直接给出的低维信号;这绕开了很多真实导航中 localization、mapping、semantic goal grounding 的难题。
scalability 上限也很清楚:StratMamba 没有显式 world model 或 planning search,长程能力主要来自 SSM state compression。对于需要记忆拓扑、选择绕行路线、处理死胡同、预测多智能体意图的任务,所谓 strategic stream 可能只是稳定目标条件,不是真正规划。reasoning 很可能是 learned retrieval / reactive policy reuse,而不是可组合的 long-horizon reasoning。
泛化是否真实存在仍有疑问。真机实验场景有限,障碍类型简单,速度范围低,且使用 VICON。核心能力可能主要来自数据覆盖和 reward shaping;论文没有排除 benchmark overlap 或训练分布接近测试分布的影响。另一个问题是方法把单一状态污染问题转移成了路由设计问题:一旦输入分流假设错了,或者任务中 LiDAR 同时承担 strategic map memory,固定 partition 可能限制性能。
Takeaway
- 1. 最值得记住的是:在 embodied RL 里,temporal encoder 的结构先验可能比换更强的 sequence model 更重要。
- 把快变量和慢变量写进同一个隐状态,是很多导航策略不稳的根源。
- 2. Mamba 用在机器人控制时,真正有潜力的方向不是直接替代 Transformer,而是利用 SSM state 可调制、可分区的特性,做 task-structured memory。
- StratMamba 是这个方向的一个早期实例。
一句话总结
StratMamba 是一篇把 Mamba 从通用序列编码器改造成多速率导航记忆结构的工作,实质贡献在于用 reactive / strategic 信息分流缓解端到端 LiDAR-RL 中的隐状态污染,而不是提出新的规划算法。
