精读笔记
Problem Setting
这篇论文处理的不是常规 multimodal policy learning,而是多模态 diffusion policy 在真实机器人闭环部署时的异步组合问题。视觉、语言、力、触觉等模态在论文里不是等价条件变量:它们的主要差异在时间结构。视觉提供低频、全局、语义/几何约束;力/扭矩提供高频、局部、接触状态反馈。真正困难点在于,这两类信息都必要,但它们不应该被同一个控制频率约束。
以前的同步融合方法隐含假设所有模态在同一时刻、同一 reference frame、同一 diffusion step 被查询。这在图像生成或离线 trajectory generation 里问题不大,但在 contact-rich control 中会直接把高频反馈废掉。慢速视觉 pipeline 一旦成为瓶颈,force/tactile 的优势就不再是“信息更多”,而只是低频条件的一部分。另一类 slow-fast architecture 虽然承认频率差异,但通常把模态和调度写死,扩展到新模态组合时缺少模块性。
所以这篇的关键矛盾是:如何同时保留视觉的长时域规划能力和力反馈的短时域反应能力,而不把二者硬塞进同步多模态网络。问题本质上是异步 guidance alignment,而不是增加一个 force encoder。
Motivation
作者的动机是合理的:multimodal diffusion policy 过去主要关注“把哪些条件喂进网络”,而不是“这些条件什么时候到达、还能否用于当前控制”。在机器人里,latency 不是工程细节,而会改变信号的控制含义。一个 200ms 前的视觉 embedding 仍可能提供场景级目标,一个 200ms 前的 force reading 则可能已经失效。
核心观察是 diffusion policy composition 给了一个天然接口:不同 policy 不必在输入层融合,而可以在 denoising prediction 层作为 guidance 被组合。这样,多模态融合从训练期 architecture design 变成 inference-time composition。缺口在于,已有 policy composition 基本是同步设定,默认所有 guidance 已经在同一动作坐标系和同一物理时间下,因此无法直接处理 delayed relative actions。
这篇论文想补的就是这个缺口:让低频 policy 的 guidance 可以被缓存和复用,让高频 policy 随时插入当前反馈,同时保证两者在 diffusion variable 层面是同一对象的预测。
Core Idea
核心思想可以概括为:把异步多模态控制重写成 latency-aware denoising guidance fusion。每个模态策略独立运行在自己的 native rate;当某个高频模态产生新 guidance 时,系统只在与低频长 horizon trajectory 重叠的 action segment 上做组合,而不是重新等待所有模态同步。
这个建模方式改变了信息流。传统 joint fusion 是 observation -> shared policy -> action;LAG-Fusion 是 modality-specific observation -> modality-specific denoising guidance -> aligned test-time composition -> action。新的 inductive bias 是:视觉负责全局轨迹先验,力反馈负责局部接触修正;二者不需要共享同一个网络时钟,也不需要在训练时学出所有跨模态交互。
本质区别在于它把“多模态一致性”从 representation fusion 问题转成 reference-frame alignment 问题。只要各模态 policy 的输出都能解释为同一 action distribution 的 noise prediction,并且可以变换到同一 relative frame,就能组合。这比手写 slow-fast policy 更 modular,也比同步 composition 更符合真实控制链路。
Method
方法里真正关键的机制只有几个。
第一,使用 modality-specific diffusion policies,而不是一个统一多模态 policy。它解决的是频率和延迟耦合问题:vision policy 可以低频给出 full-horizon guidance,force policy 可以高频给出短 horizon contact guidance。核心变化是 inference schedule 从全局同步变成局部异步。
第二,reference-frame rebasing 是方法能成立的数学支点。relative action chunk 绑定于查询时刻的机器人位姿;如果视觉 policy 在 t1 查询,force policy 在 t2 查询,二者输出的 relative action/noise 不在同一坐标系。直接融合会混合不同参考系下的 denoising direction。论文推导了 affine action transform 下 clean action、noisy action、noise prediction 的变换规则:clean action 用完整仿射变换,noisy sample 的 offset 需要乘以 sqrt(alpha_bar),noise 只应用正交线性部分。这一点是实质贡献,因为它让 delayed diffusion variables 在概率噪声结构上保持一致。
第三,组合只发生在 horizon overlap segment。视觉 policy 维持 full horizon noisy trajectory,force policy 只处理当前局部窗口。系统先把选中的 noisy segment rebase 到当前 force frame,得到 force guidance;再把对应 vision guidance 也 rebase 到同一 frame;融合后再映回 vision frame 更新 full trajectory。这解决的是不同 horizon 和不同查询时间的对齐问题。
第四,latency-aware weighting 用 freshness 近似 reliability。早期 segment 更信视觉,后期或局部接触修正更信 force。这里是合理但手工的 heuristic;它不是严格 uncertainty estimation,也没有证明是最优 fusion。
Key Insight / Why It Works
最重要的 insight 是:在 contact-rich manipulation 中,force/tactile 的价值不是“额外模态信息”,而是“低延迟局部闭环修正”。如果把它当成普通条件输入并降到视觉频率,它的主要价值就被破坏了。因此 LAG-Fusion 的增益很可能主要来自 preserving native high-frequency inference,而不是 diffusion fusion 本身带来的神秘组合能力。
真正有效的部分应当是 representation alignment + asynchronous test-time compute。reference-frame rebasing 解决了 relative action diffusion 中 delayed guidance 不可直接相加的问题,这是比简单 engineering 更有迁移价值的机制。它说明在 robot generative policy composition 里,输出空间的几何一致性比输入层 multimodal fusion 更关键。
Latency-aware weights 可能是辅助项。线性从 vision 到 force 的权重切换符合直觉,但文中没有充分说明它相比常数权重、uncertainty-based weight、contact-state-gated weight 的独立贡献。它更像一个合理的 control heuristic,而不是核心理论贡献。
这篇不是 scaling paper,也不是靠更大模型解决问题。它更接近 better inductive bias + test-time composition + representation alignment。它把已有的 diffusion composition 思想搬到异步控制,并补上 relative-frame rebase 这个机器人特有的缺口。若要挑剔,实验增益也可能部分来自 force policy 以 25Hz 执行这个 engineering/scaling 维度;同步 baseline 如果也有额外低层控制器或更强 contact prior,差距是否仍然存在,文中未充分说明。
另一个判断是:这里没有真正的长期状态建模。视觉 guidance 被复用,高频 force 做局部修正,本质上是短时 reactive composition,不是 planner 学会了长程动态推理。对于需要长时程 belief update、遮挡后目标变化、非接触阶段策略切换的任务,这种缓存式 guidance 可能不够。
Relation To Prior Work
这篇最接近三条线:diffusion policy composition、multimodal/contact-rich manipulation、slow-fast reactive policy。
相对 PoCo、General Policy Composition、Policy Consensus 等 policy composition 工作,它的新增点不是“多个 diffusion policies 可以加权组合”,这个思想已有;新增点是 composition 不再假设 same-time/same-frame。它把 policy composition 从静态分布组合推进到异步控制组合,关键补丁是 reference-frame rebasing。
相对 RDP、Force Policy、FoAR、TA-VLA 等 force-aware manipulation 工作,它的差异也不是使用力反馈,而是力反馈不被纳入一个固定多模态架构,而是作为可插拔 high-frequency guidance source。RDP 这类 slow-fast 方法更像专门设计的系统结构;LAG-Fusion 更像一个 composition interface,可以复用已有视觉 policy 和 force policy。
看似新的部分中,weighted guidance fusion 本身并不新,frequency-aware scheduling 也不新;实质创新在于把 diffusion variables 的参考系变换推导清楚,并将其嵌入异步 inference loop。技术谱系上,它属于 test-time policy composition / modular generative control,而不是 end-to-end multimodal representation learning。
Dataset / Evaluation
评估是在真机 contact-rich manipulation 上做的,这一点比纯仿真 benchmark 更能支撑 latency claim。两个任务 Flip 和 Polish Curve 都需要视觉定位和力反馈调节,确实覆盖了作者想强调的矛盾:全局视觉 guidance 与局部接触反应的协调。
但任务覆盖仍然很窄。每个任务 50 demonstrations,主结果每个 policy 每任务 20 trials,规模不足以证明一般 multimodal scalability。任务都围绕 parallel gripper 和局部接触,不涉及更复杂的 dexterous manipulation、多阶段装配、强遮挡下状态估计或跨场景语义泛化。
实验基本支持“异步高频 force guidance 对 contact-rich tasks 有帮助”这个 claim。频率消融也支持“force policy 不应被低频 bottleneck”。但它没有充分证明更强的 claim:LAG-Fusion 是通用异步多模态 diffusion composition 框架。当前只展示 vision + force 两模态,且 force horizon 被假设包含在 vision horizon 内,组合结构比较规整。
baseline 选择有意义,但增益归因还不够干净。LAG-Fusion 同时改变了频率、模块化方式、参考系表示、fusion schedule 和 policy composition 时机。虽然同步 composition 与 Policy Consensus 提供了控制,但文中未充分拆开 rebasing、asynchrony、weight schedule、force policy capacity 各自贡献。
Limitation
核心前提之一是 action representation 必须支持稳定的 frame transformation。论文选择 3D translation + 6D rotation + gripper,并要求线性部分正交,使 Gaussian noise covariance 不被破坏。这个设定很适合 SE(3) relative action,但不自然适用于更复杂 action spaces,例如 joint-space torque、impedance parameters、contact mode、multi-finger high-dimensional tactile-conditioned commands。扩展时未必还能保持同样干净的 rebase rule。
第二,方法假设不同 policy 的 denoising guidance 在组合后是兼容的。实际上,两个 independently trained policies 可能对应不同 data support、不同 action smoothness、不同 failure modes。简单加权 noise prediction 不保证得到有效策略分布。文中没有给出强概率保证,实验也没有覆盖严重 policy conflict 的情况。
第三,latency 被当作 confidence proxy,但 freshness 不等于 reliability。新的 force reading 可能是噪声、碰撞瞬态或无接触漂移;旧视觉 guidance 也可能在静态场景中长期有效。手工线性 schedule 可能在当前任务上够用,但不是通用 uncertainty fusion。
第四,所谓 modular scalability 还没有被充分验证。当前组合是低频视觉 + 高频力的二元结构,且两者角色非常清晰。多模态多频率场景下,例如 vision、language、audio、tactile、proprioception 同时异步到达,如何解决冲突、选择 horizon、校准权重、处理 stale guidance,文中未充分说明。
第五,增益可能主要来自高频控制这个 engineering/scaling 因素。换句话说,LAG-Fusion 的优势也许不是“更好的多模态推理”,而是避免把 force branch 降频。如果给 baseline 加一个强低层 force controller、hybrid force-position prior 或更高频 residual controller,差距可能缩小。论文自己也承认未来需要引入控制先验,这说明当前控制稳定性上限仍有限。
第六,泛化证据有限。虽然 standalone force policy 测了不同物体,但主实验仍是小规模真机任务。很难判断方法是否真的学到了跨场景 contact strategy,还是主要依赖 demonstration coverage 与局部 force-response retrieval。
Takeaway
- 1. 多模态机器人策略的关键不只是融合语义,而是处理模态的时间价值;latency 应该进入 policy composition 的建模层,而不是部署后的工程补丁。
- 2. 对 diffusion policy 而言,denoising guidance 是比 feature fusion 更自然的 modular interface;只要输出空间对齐,已有 policy 可以在 inference time 被重新组合。
- 3. Relative action representation 下的 reference-frame rebasing 是可迁移 insight。
- 未来任何 asynchronous generative control、policy reuse、cached trajectory guidance,都需要认真处理 diffusion variables 的坐标系一致性。
一句话总结
LAG-Fusion 是把 diffusion policy composition 从同步多模态融合推进到异步机器人控制的一步,真正贡献在于用参考系对齐和时延感知 guidance fusion 让低频全局策略与高频接触反馈可以模块化共存。
