精读笔记
Problem Setting
[MAMMOTH: A Multi-Modal End-to-End Policy for Off-Road Mobility Robust to Missing Modality](arXiv preprint / 2026-07-15)
这篇论文实际面对的是越野移动中的一个系统级问题:局部策略不能假设感知模态稳定存在,也不能只在白天 RGB 外观可用时工作。困难点在于越野环境同时破坏了两个常见假设:视觉外观不稳定,几何可通行性也不能完全由障碍物检测解释。沟、根、碎石、坡面和软硬地形会让“看起来能走”的路径在动力学上很差。
以前方法卡在两端:视觉导航策略通常学的是 appearance-conditioned waypoint prior,遇到夜间、眩光、阴影就退化;traversability/costmap 方法能表达地形代价,但依赖显式中间表示、较完整传感器和较重的推理栈。MAMMOTH 的任务矛盾是:既要端到端反应快、能部署,又要保留多模态和地形物理信息,还要在缺模态时不崩。
Motivation
作者真正抓住的缺口不是“越野需要多模态”,这个已经是共识;缺口是已有多模态方法通常是 rigid multimodal,即训练和推理都默认模态齐全。对越野机器人来说,这个假设很弱,因为传感器退化本身就是环境的一部分:低照影响 RGB,振动影响图像和点云质量,天气和遮挡影响单个传感器。
因此论文动机可以概括为:需要一个 fleximodal policy,而不是一个 full-modality policy。它要在模态完整时利用互补信息,在模态缺失时退化得可控。另一个动机是地形安全不应只作为外部 costmap 或后处理 guidance,而应进入轨迹生成分布本身,否则 policy 仍可能生成几何上合理但物理上差的路径。
Core Idea
核心思想是把越野局部导航建模为“可缺失多模态上下文条件下的物理轨迹分布生成”。这和 NoMaD 一类 RGB diffusion navigation 的差别不只是多了传感器,而是改变了信息组织方式:输入不再是单一视觉历史,而是一组可被 mask 的模态 token;输出也不只是局部 waypoint,而是 waypoint 加一个内生 traversability heuristic。
这个设计直觉上成立,因为越野场景中不同模态的可靠性是条件性的。白天 RGB 提供语义和纹理,夜间热成像提供照明不变线索,LiDAR 提供几何障碍,速度/IMU 相关信号提供动力学反馈。模态 dropout 使模型在训练中反复经历“某些证据不存在”的条件,MoE routing 则给不同模态组合提供条件计算路径。相比固定拼接或 dense fusion,它更像是在学习一组传感器组合下的共享 policy family。
Method
方法中值得保留的机制只有三类。
第一是 fleximodal fusion。模态特定 encoder 之后进入带 per-modality router 的 sparse MoE。它解决的是跨模态信息既要共享又要分化的问题:如果所有 token 走同一个 dense transformer,模型容易学到固定模态耦合;如果只是 late fusion,则跨模态交互太弱。MoE 的核心变化是让不同模态在不同场景下选择不同专家,形成 conditional reliance。
第二是 modality dropout。它解决部署时传感器缺失和训练时传感器完整之间的分布错位。这里作者没有做 masked reconstruction,而是直接 mask-and-ignore,这个选择是对的:导航策略关心的是缺模态条件下动作分布是否稳定,不是重建被遮蔽模态。重建目标反而可能把容量花在不必要的感知补全上。
第三是 physically-aware diffusion trajectory。作者把 IMU Z 轴加速度 PSD 导出的 heuristic 放进轨迹表示,让 diffusion 学 waypoint 与物理代价的联合条件分布。它解决的是纯几何轨迹无法表达“走起来是否糟糕”的问题。推理时通过候选轨迹 ranking 使用 heuristic,本质上是把轻量 cost reasoning 嵌进生成模型,而不是额外跑 costmap/planner。
Key Insight / Why It Works
最可能真正有效的是“缺模态训练分布 + 多传感器覆盖”这件事,而不是 diffusion 或 MoE 单独带来的魔法。端到端导航策略在真实部署中常见失败不是因为动作头不够强,而是因为感知条件偏离训练分布。整模态 dropout 把这个偏移显式训练进去,因此缺 RGB、缺热成像、缺点云时不会立刻落入未见状态。
第二个核心贡献是把 traversability 作为 trajectory attribute,而不是作为独立 costmap。这个选择减少了系统复杂度,也让代价信号和动作生成共享表示。它的效果更像 representation alignment:把视觉/点云/热成像观测对齐到 IMU 观测到的动力学后果。若这个对齐成立,policy 就能偏好更平滑、更稳的路径。
MoE 的作用我会看得相对谨慎。它可能提供了更好的 conditional computation 和模态专化,但也可能主要是更大容量、更好优化、更多参数带来的收益。文中虽然做了 concat、Modified-NoMaD、router/gating ablation,但仍不足以完全拆开 routing inductive bias 和 capacity scaling。这里的增益来源不清。
Diffusion policy 也更像一个稳定的多候选局部轨迹生成器,而不是高级推理。它没有形成长期状态建模,长期导航仍靠 topological memory。所谓 terrain-aware planning 主要发生在局部候选轨迹和 heuristic ranking 上,不应解读为模型具备显式越野规划能力。
Relation To Prior Work
这篇最接近 NoMaD/ViNT 系列的 goal-conditioned diffusion/navigation policy,同时吸收了 traversability learning 和 fleximodal fusion 的思想。和 NoMaD 的本质差异是:NoMaD 是视觉历史到轨迹的 general navigation prior,MAMMOTH 是多模态可缺失上下文到物理轨迹的越野 policy。和 FlowNav 的差异也不是生成器不同,而是 FlowNav 的 depth prior 仍然派生自 RGB,低照下根基不稳;MAMMOTH 引入了真正独立的热成像和 LiDAR 证据。
和 costmap/traversability 方法相比,MAMMOTH 没有显式构建全局或局部 costmap,而是把可通行性压进 trajectory distribution。这是实质差异:它牺牲了一部分可解释性和可组合性,换取端到端部署效率和缺模态容忍度。
看似新的部分中,modality dropout、MoE fusion、diffusion policy、IMU-derived traversability 都不是新概念;实质创新在于把这些机制组合到越野真实部署问题中,并把 missing modality 作为一等公民来训练和评估。它属于 E2E navigation policy 向 robust multimodal deployment 演化的一支,而不是纯算法范式突破。
Dataset / Evaluation
评估的强点是真机部署而非只做离线 benchmark,并且覆盖了白天、夜间、无清晰 trail、林下遮挡等更接近越野失败模式的环境。作者也不仅比较 RGB baseline,还做了缺模态实验和模态贡献分析,这确实支撑“多模态 + dropout 提升部署鲁棒性”的主 claim。
但 evaluation 仍有明显边界。数据总量约 9 小时,其中热成像来自 in-house 数据,夜间能力很可能强依赖这部分数据覆盖。五个真实环境和每个消融约十几分钟级别的部署能说明系统可工作,但不足以证明广义越野泛化。SR 整体不高,作者归因于越野环境缺少 distinct features,这也暴露出 visual-goal navigation 仍受外观检索/距离估计限制。
缺模态实验是有价值的,但更像 controlled sensor removal,而不是真实 degradation:真实传感器失败往往是噪声、延迟、局部遮挡、校准漂移和间歇丢帧,不一定等价于整模态 mask。论文对这类 failure mode 验证不足。
Limitation
第一,方法强依赖传感器套件。MAMMOTH 的鲁棒性不是从单模态中学出不变量,而是利用互补传感器冗余;没有热成像或 LiDAR 的平台可以运行,但性能上限会明显下降。这是 deployment flexibility,不是传感器无关泛化。
第二,核心能力可能主要来自数据覆盖。夜间和低照表现如果主要由 in-house thermal/night data 支撑,那么方法在新地貌、新季节、新天气下的泛化仍未充分说明。尤其热成像跨设备、跨温度分布、跨季节的 domain shift 可能很大。
第三,IMU PSD heuristic 的可迁移性有限。它与底盘结构、轮胎、悬挂、速度、载荷和控制器都有耦合。换机器人后,同一路径的振动谱可能完全不同。文中没有充分说明 heuristic 如何跨平台归一化或校准。
第四,规划能力可能被高估。模型生成的是短 horizon 局部轨迹,长期任务依赖 topological memory;它没有解决越野长程探索中的地图一致性、风险累积、死路回退或不确定性管理。
第五,增益归因不干净。多模态传感器、更大模型、MoE、dropout、heuristic、in-house 数据同时引入。虽然消融覆盖了一部分,但仍难判断最小必要组件是什么。MoE 相比合理设计的 dense fleximodal transformer 是否仍有优势,文中证据不够。
Takeaway
- 1. 对真实机器人导航,missing modality 不应是测试时补丁,而应进入训练分布;这比事后做鲁棒性评估更重要。
- 2. 越野 traversability 可以不必显式 costmap 化。
- 把自监督物理反馈作为轨迹属性学习,可能是更轻量、更容易端到端部署的路线。
- 3. 多模态 fusion 的关键不是“融合所有信息”,而是学习在场景条件下相信谁。
一句话总结
MAMMOTH 是把 NoMaD 式端到端导航策略推进到越野多模态、缺模态鲁棒部署的一次系统化组合,真正贡献在于 fleximodal 训练和物理代价内生化,而不是单个模型模块的算法突破。
