精读笔记
Problem Setting
[论文标题] FM-VLA: Force-based Memory for Vision-Language-Action Models in Contact-Rich Manipulation(arXiv preprint / 2026)
这篇论文实际解决的是 VLA 在 contact-rich manipulation 中的非马尔可夫状态缺失问题:当前视觉观测和当前 proprioception 不足以决定下一步动作,必须知道过去接触事件的累计历史。真正困难点不是动作生成能力,而是 task progress 的可观测性:按钮是否已经按了两次、碗是否已经擦了一轮、哪个杯子已经被检查过,这些状态要么视觉变化极小,要么场景会回到相似外观。
以前路线卡在两个地方。视觉记忆能保存过去帧,但保存的是弱相关甚至歧义的信息;短窗口 force/tactile VLA 能做当前接触调节,但窗口太短,不能作为 episode-level memory。关键矛盾是:任务需要长期历史,但有效历史信号不是视觉 token,而是物理交互事件;模型需要压缩长程高频信号,但 imitation 数据又不足以让 policy 端到端学出稳定压缩。
Motivation
已有 memory-augmented VLA 主要沿视觉或语言路线扩展上下文,本质上假设过去图像中保留了决策所需状态。但在接触任务里,视觉经常不是 sufficient observation:按钮 travel 很小,擦拭轨迹视觉上近似重复,遮挡和复位会让历史帧也难以 disambiguate。
作者真正抓住的缺口是:force stream 天然记录 contact events,但现有 force-augmented VLA 通常把它当即时反馈或局部 correction signal,而不是长期记忆。也就是说,领域里缺的不是“让 VLA 感知力”,而是“让 VLA 把力觉历史当作任务进度的状态变量”。
Core Idea
FM-VLA 的核心不是多模态融合,而是重新定义 memory 的载体:对 contact-rich、visually ambiguous 的任务,历史 wrench 序列比历史图像更接近任务隐状态的充分统计量。它把 force history 压缩成少量 latent tokens,再把这些 token 作为 action expert 的条件,使策略在生成动作 chunk 时能访问累计接触事件。
这个建模方式引入了很强的 inductive bias:重复接触、力峰、接触持续时间、接触强弱和 onset timing 是任务进度的主要变量,应当被直接编码成低维时序 latent。和 visual memory 相比,它不是扩大上下文窗口,而是换了记忆的信息源;和 TA-VLA / ForceVLA 相比,它不是用力觉修正当前动作,而是把力觉作为跨 episode 的 memory state。这个区别是实质性的。
Method
方法层面可以压缩成三个机制。
第一,长程 wrench memory:持续收集 wrist 6-axis wrench,并对历史做平滑和归一化,目标是保留接触事件结构而不是保留原始噪声。这解决的是“任务进度在视觉中不可见,但在力觉中可见”的问题。
第二,VAE force encoder:先用 reconstruction objective 预训练一个时序压缩器,再冻结后接入 VLA。它的作用不是生成,而是把长、高频、噪声 force history 映射到结构化 latent space。这里的关键变化是把 force-memory representation learning 从 policy learning 中解耦,降低小规模 imitation 数据下端到端学习长期记忆的难度。
第三,短窗口 state token:force history 只知道接触累计,不稳定表达当前 arm pose 和运动相位;短期 joint-state history补上“现在在哪里、正在怎么动”。这个 token 更像控制稳定性的必要补丁,而不是长期记忆的核心。
memory token 只注入 action expert,而不是重训整个 VLM 记忆体系,这也是一个重要选择:它把新增信息限制在动作生成侧,减少对视觉语言 backbone 的扰动。
Key Insight / Why It Works
最核心的有效性来源大概率是 better inductive bias,而不是 scaling。论文把非马尔可夫性具体化为 contact-event history,并选择了最直接可观测该 history 的传感器。对按钮和擦拭,force signal 近似就是 event counter;视觉 memory 即使增加 token,也是在错误或弱相关的信息源上做 attention。
VAE 预训练可能是第二个关键贡献。GRU 和 Q-Former 的失败说明问题不只是“需要一个能看长序列的 encoder”,而是需要一个在 policy fine-tuning 前已经形成可用时序结构的 latent space。重建目标迫使 latent 保留宏观 contact pattern;这类 latent 对 action expert 来说比 raw force sequence 或 end-to-end query 更容易对齐。这里更像 representation alignment + latent structure,而不是 retrieval 或 test-time compute。
短 state history 是辅助但很关键。force-only 很差,说明 long force memory 本身不是完整 policy state;它能告诉模型“发生过什么接触”,但不能告诉模型“当前运动阶段是否该接触”。FM-VLA 的成功其实来自长程 contact memory 和短期 proprioceptive stabilizer 的组合。
需要警惕的是,所谓 temporal reasoning 可能主要是 contact-count template matching。按钮和擦拭任务的目标 N 只有 1/2/3,force pattern 与成功动作高度绑定;模型未必学到了通用长期状态更新机制。这里的 reasoning 更像把 wrench latent 映射到离散进度,再由 imitation policy replay 对应阶段动作。这个判断不削弱论文贡献,但限制了 claim 的外推范围。
Relation To Prior Work
它最接近三条线:memory VLA、force/tactile VLA、时序表示压缩。和 MemoryVLA/MEM 的本质差异是 memory source 不同:FM-VLA 认为对一类任务,历史图像不是合适记忆介质,物理交互信号才是。和 ForceVLA/TA-VLA 的本质差异是 temporal scope 不同:已有方法多是 short-horizon force conditioning,用于局部接触响应;FM-VLA 把 force stream 提升为 long-horizon progress memory。
看似新的部分里,VAE 压缩时序信号、Perceiver latent tokens、action expert token injection 都不是新思想;真正新增的是把这些组件组织成“force-as-memory for VLA”的系统,并在真机接触计数任务上证明视觉 memory 的信息源不足。实质创新在问题重分解和 inductive bias,而不是网络结构本身。
技术谱系上,它属于 memory-augmented VLA,但不是扩大视觉上下文的路线,而是 sensor-grounded memory route。这个分支未来可能会和 tactile/force world model、explicit belief state、event abstraction 结合。
Dataset / Evaluation
评估是三类真实双臂接触任务,使用真机数据和真机 rollout,这比纯仿真或离线 loss 更有说服力。任务设计也确实对准了论文 claim:当前视觉不足、历史接触事件决定动作进度,因此能检验 force memory 是否比 visual memory 更合适。
但 benchmark 覆盖面窄,基本围绕“检查过哪个对象”与“接触次数/往返次数”展开。它验证了 force memory 对 contact-counting 和弱视觉变化任务有效,但没有验证开放长程操作、复杂多物体接触、跨材质/跨几何/跨机器人泛化。每任务 18 次评估也偏小,成功率差距很大时方向可信,但细粒度结论不能过度解读。
baseline 设计总体合理:无记忆、短期 wrench、视觉 memory 都覆盖到了。但增益归因仍不完全干净,尤其 Cups 中 state-only 已经很强,说明该任务未必需要 force memory;Buttons/Wipe 才是核心证据。
Limitation
最大前提是任务隐状态必须能从 wrist wrench history 中稳定读出。如果接触信号弱、传感器漂移大、接触路径多样、外力干扰多,force memory latent 可能不再是可靠状态。方法也默认有高频力/力矩传感器,这限制了部署范围。
scalability 上限不清。8 个 latent tokens 对 1-3 次接触事件足够,但对几十到上百个事件、多阶段任务、多接触对象身份绑定,固定瓶颈可能丢失细节。作者提到需要 hierarchical/adaptive compression,这不是小问题,而是该路线能否扩展的核心。
泛化证据不足。VAE 在同一演示数据分布上预训练,policy 也在同一任务族上 fine-tune;所谓 task-agnostic force latent 还没有被跨任务、跨物体、跨 embodiment 证明。核心能力可能主要来自数据覆盖和任务模板,而不是通用 force reasoning。
增益来源也有未解释部分。文中未充分说明 VAE latent 具体编码了哪些变量,是否线性可读出 press count / wipe count / contact phase。Q-Former 被说成 overfit peaks,GRU 被说成长程梯度问题,但证据主要来自 task success,机制诊断不足。
Takeaway
- 第一,contact-rich VLA 的 memory 不应该默认等同于 visual history;应先问任务隐状态在哪个传感通道中最可观测。
- 第二,把 force/tactile 从 short-term feedback 升级为 long-horizon memory 是一个值得发展的方向,尤其适合计数、进度跟踪、接触确认、隐状态消歧。
- 第三,长程低维传感器流直接端到端接 policy 未必有效;先用自监督目标学 latent structure,再做 action conditioning,可能是小数据机器人任务里更稳的范式。
- 第四,下一步真正值得做的不是再调 token 数,而是显式评估 force latent 的可组合性、跨任务迁移、层级记忆,以及与视觉语义状态的绑定。
一句话总结
FM-VLA 是把 force/tactile VLA 从“即时接触反馈”推进到“接触事件记忆”的一次清晰演化,真正贡献在于为非马尔可夫接触操作引入了比视觉历史更合适的 sensor-grounded memory inductive bias。
