精读笔记
Problem Setting
论文标题:Never Too Late for Force: Accelerating VLA Post-Training with Reactive Force Injection(arXiv preprint / 2026)。
这篇论文不是在解决一般的“VLA 加多模态输入”问题,而是在解决一个更窄但更真实的 deployment 问题:已有 vision-only VLA 在进入接触阶段后,视觉观测不足以判定物理状态,而 force 又很难像图像/语言/轨迹那样参与大规模预训练。问题的关键矛盾是:VLA 的通用能力来自大规模视觉先验,但接触执行的可靠性来自平台相关、在线诱发、低延迟的物理反馈。
以前方法卡在两个地方。一类 force-aware policy 能用力,但通常缺少大 VLA 的泛化先验;另一类 VLA post-training 能适配任务,但仍主要把 action chunk 当成视觉条件下的近似开环计划。接触任务里真正难的是状态不可见且分布会随策略改变:一次空抓、轻微卡住、插入到底后继续推,都会把机器人带到离线数据没有覆盖的 force regime。
Motivation
作者的核心观察是:force 不适合作为 foundation pretraining 的通用模态,却非常适合作为 post-training 阶段的机器人平台适配信号。它低维、便宜、直接反映接触,但硬件相关、坐标系相关、控制器相关,跨平台收集成本高。因此合理路线不是重训 Force-VLA foundation model,而是在已有 VLA 上晚期接入 force。
已有路线不够的原因在于它们通常忽略了 force 的时间结构和策略依赖性。单帧 force 只能告诉模型“现在受力是多少”,但很多接触决策依赖 force 的演化:这是正在插入时的阻力,还是已经到底后的过推?这是正常滑入,还是侧向卡住?同时,离线 force 数据不能覆盖 learner 自己制造的失败状态,所以仅靠 offline fine-tuning 很容易在真实执行时失效。
因此这篇的 motivation 不是“force improves manipulation”这个老结论,而是:force 必须以 reactive memory 的形式接入,并且必须和在线纠错一起训练,否则它只是另一个脆弱的输入通道。
Core Idea
LIFT 的核心思想是把 VLA 的动作生成重新组织成“慢语义上下文 + 快接触反应”的双通道结构。视觉-语言前缀仍然负责提供任务、物体和场景语义;新增 reactive action expert 负责在执行过程中根据近期 force memory 刷新动作。这样,force 不再只是 action chunk 生成前的静态条件,而是 chunk 内持续进入控制回路的反馈。
这个 inductive bias 很明确:视觉负责全局语义和粗轨迹,力觉负责局部接触相位和微调。它比把 force token 直接拼到 VLA 输入里更合理,因为接触信息的时标和语义信息不同;force 的价值在于低延迟纠偏,而不是参与高层语言理解。
和 prior 的本质区别在于,LIFT 不是从头训练一个 visual-force policy,也不是简单给 VLA 加 force conditioning,而是在保留 pretrained VLA 行为的前提下,把 action expert 改造成可因果更新的 reactive stream。这更像给 foundation policy 加一个平台特定的 contact adaptation layer。
Method
关键机制可以压缩成三点。
第一,reactive action expert 解决 chunk-level open-loop 问题。原 VLA action expert 对整段动作联合建模,执行时容易在接触变化后继续沿旧计划走。LIFT 复制一个 action expert,并通过 shifted causal attention 让 reactive token 在保留原 chunk 信息的同时,按时间因果地产生动作。核心变化是:动作不再只是预先生成的一段轨迹,而可以在 chunk 内被接触反馈刷新。
第二,force memory cross attention 解决单帧 force 不足的问题。近期 6D wrench 被编码成 causal memory,再通过带 latency mask 的 cross attention 注入 reactive branch。它的必要性在于接触状态通常不是 Markov 的:同样大小的力,在不同历史阶段意味着不同动作。force memory 提供的是 contact phase inference,而不是简单的碰撞检测。
第三,prior-preserving initialization 解决“加 force 破坏 VLA”的问题。拷贝原 action expert、设计初始化等价的 shifted causal attention、并把 force cross attention 的输出投影置零,使新模型初始时等价于原 π0.5。这个设计很重要,因为它让 post-training 从已有能力出发,而不是重新学习任务。
训练上,在线 DAgger 的作用不是附属工程,而是 force learning 的条件。force distribution 由当前策略和真实接触共同决定,离线数据天然缺覆盖;在线人类修正提供 learner-induced failure states 上的监督。
Key Insight / Why It Works
最可能真正有效的部分是“reactive force memory + online correction”的组合,而不是单个模块。force memory 给了模型短期物理状态估计;online DAgger 给了它当前策略会遇到的失败分布;prior-preserving init 则避免为了学接触而丢掉原 VLA 的视觉泛化。这三者缺一不可,尤其是在接触任务中,数据分布比模型容量更关键。
从机制上看,LIFT 本质上是 better inductive bias 加 data coverage,而不是更强 reasoning。它没有形成显式物理模型,也没有长期规划;它学习的是在特定接触历史下如何修正局部动作。所谓“反应性”更接近 test-time compute / memory reuse:缓存慢视觉前缀,反复用新 force 更新动作输出。这个设计在工程上很对,因为接触反馈的价值随时间快速衰减。
哪些部分可能只是辅助?zero-init cross attention 和 shifted causal equivalence 主要是稳定训练和保护 prior,它们重要但不一定是性能提升的直接来源。单独看,它们更像让 late injection 可行的工程护栏。真正提升性能的来源可能是:在线纠错覆盖了 failure states,加上 force memory 让模型能区分接触相位。
增益归因仍不完全清楚。towel folding 中单帧 force baseline 甚至优于 full LIFT,说明并非所有任务都需要复杂 reactive memory;有些收益可能只是 force 直接暴露 grasp/contact 成功与否。book insertion 和 Hanoi 更支持 memory 的必要性,因为这两个任务需要判断“阻力的历史含义”。因此 LIFT 的核心贡献更准确地说是:为需要接触相位判断的 VLA post-training 提供了合适的信息流结构。
Relation To Prior Work
这篇处在三条技术谱系的交叉处:force-aware manipulation policy、VLA post-training、DAgger-style interactive imitation learning。
和 FoAR、RDP、ImplicitRDP 等 force/reactive policy 相比,LIFT 的新增点不是“力觉能帮助接触”,而是把这套 slow-fast/reactive 思想嫁接到 pretrained VLA 上,并尽量不破坏原有 visual-language prior。它继承的是 foundation policy 的语义与泛化,而不是从一个较小的 visuomotor policy 开始学。
和 ForceVLA、ForceVLA2、TA-VLA 这类 force/torque-aware VLA 相比,LIFT 更强调 late injection 和 chunk 内 reactivity。前者更像把 force 作为训练/推理观测的一部分,后者强调执行过程中 force 会不断改变动作。真正差异在信息流时序,而不是有没有 force token。
和 CR-DAgger、HG-DAgger 等在线纠错方法相比,LIFT 的不同点在 policy class 和 force integration:它不是学一个 residual controller 或小策略,而是在 VLA action expert 旁边加 reactive branch。看似新的部分有不少是已有思想重组:zero-init residual、causal memory、online DAgger、slow-fast separation 都不是新概念;实质创新在于这些机制被组合成一个适合 VLA post-training 的 force injection pattern。
Dataset / Evaluation
评估的优点是用了真实机器人、真实 6D 末端力传感器、在线 DAgger、以及三个具有不同接触特征的任务:薄布抓取/折叠、受限插入、精密套环。这比纯离线 benchmark 更能验证 force distribution shift 和在线修正的必要性。
但 evaluation 的覆盖面仍然窄。三类任务都在单臂、同一机器人、同一传感器和相近控制频率下完成,不能证明跨平台或跨末端泛化。每个 checkpoint 只有 10 次 rollout,统计稳定性有限。泛化实验主要是物体颜色、桌布、光照这类视觉扰动,支持的是“没有明显破坏原 VLA 的视觉鲁棒性”,而不是 force-reactive 能力本身的泛化。
实验基本支持核心 claim:force-aware online post-training 能加速并提升接触任务性能,reactive memory 在需要判断接触相位的任务上优于单帧 force。但它没有完全回答增益来自哪里:是 force modality、online data、reactive inference、还是更长训练/更多有效纠错数据。文中未充分说明这些因素是否被严格等量控制。
Limitation
最重要的限制不是作者列的“需要人类纠错”和“只测单臂”,而是方法的适用边界。
第一,LIFT 依赖 force 可观测性。若关键状态不是末端 wrench 能反映的,比如物体内部形变、远端接触、多点接触或视觉外的拓扑变化,force memory 未必足够。它学到的是局部接触反应,不是通用物理推理。
第二,scalability 受在线 DAgger 限制。force distribution 是 policy-dependent,所以越复杂的任务越需要在线覆盖失败状态。核心能力可能主要来自数据覆盖,而不是架构自动泛化。把问题从“大规模 force pretraining”转移成了“平台内高质量在线纠错”。
第三,跨平台泛化未验证。不同机器人刚度、控制器、末端、传感器安装、滤波和坐标系都会改变 wrench 分布。LIFT 的 late injection 很适合单平台适配,但不等价于学到了平台无关的 force representation。
第四,长期 planning 仍然薄弱。reactive branch 在 chunk 内更新动作,但没有证明它能维护长时程任务状态或做策略级重规划。所谓接触推理更像短期 force-history retrieval,而不是显式状态估计。
第五,增益归因不清。towel folding 中 single-frame force baseline 表现很强,说明 full reactive design 并非总是必要;对于某些任务,force 只是提供了一个简单 contact detector。文中对何时需要 memory、何时单帧足够,没有形成清晰边界。
Takeaway
- 最值得记住的不是某个架构细节,而是这个方向判断:force 不一定要进入 VLA 预训练;更现实的路线是在 deployment/post-training 阶段作为平台相关的 reactive adaptation signal 接入。
- 对接触任务,action chunk 的开环假设是 VLA 的关键短板。
- 未来 VLA manipulation 很可能会继续走 slow semantic policy + fast physical feedback 的结构,而不是把所有模态都塞进同一个大 transformer 里统一处理。
- force memory 的价值在于 contact phase disambiguation。
一句话总结
LIFT 是一篇把 force-aware reactive control、VLA post-training 和 online DAgger 组合起来的实用型工作,它的真正贡献是证明 late reactive force injection 可以在保留 pretrained VLA 先验的同时,把接触反馈变成部署阶段可学习的闭环修正通道。
