精读笔记
Problem Setting
[NativeMEM: Native Memory Compression for Long-Horizon Robotic Manipulation](arXiv preprint / 2026)
这篇论文处理的不是一般意义上的 long-context VLA,而是 pretrained single-frame VLA 在长程 manipulation 中的“历史欠定”问题:当前图像、proprioception 和 instruction 不足以决定动作,policy 必须知道过去发生过什么。典型场景包括按键序列、物体原始位置、已扫描物品、失败尝试、操作计数等。
关键矛盾是 memory fidelity 与 VLA context efficiency 的冲突。直接保留 dense visual history 会让 token 数、attention cost、GPU memory 和 latency 爆炸;压缩过强或压缩空间不对,又会丢掉动作相关细节。已有方法卡在两个地方:外部 VLM/planner memory 把视觉历史离散成文本或子任务,信息瓶颈很重;内部 memory module 虽然端到端,但通常是新引入结构,和 pretrained VLA 的 token prior 不天然对齐,容易变成重新训练一个 history-aware policy。
Motivation
作者真正抓住的缺口是:VLA 已经有一套被预训练校准过的视觉 token 空间和 action head,但现有 memory 方法没有充分复用这个空间。它们要么绕开 VLA 的 native representation,用语言或 planner 管理历史;要么在 VLA 旁边外挂 latent memory,让模型在 finetuning 阶段学习如何解释一个从未在预训练中见过的状态变量。
因此动机不是简单“加记忆”,而是把历史压缩成 VLA 原本就比较容易消费的视觉证据。核心观察是:如果 memory token 来自 VLA 自己的视觉编码路径,并且通过原 action loss 对齐,那么它比任意外部 latent 更可能被 pretrained policy attention 正确使用。缺的是一种同时满足三件事的表示:足够短、足够视觉化、足够 action-aligned。
Core Idea
论文的核心思想是把历史建模从“外部记忆管理”改成“native token augmentation”。每个历史 frame-view 不再作为完整图像 patch sequence、文本 note、retrieved subtask 或 recurrent state 输入,而是被压缩成一个 native memory token,追加到原 VLA token sequence 末尾。policy 仍然用原来的 transformer attention 访问这些 token,因此 memory 的使用方式被约束在 pretrained VLA 已经熟悉的信息流里。
这个做法引入的 inductive bias 很明确:历史不是另一个模块维护的状态,而是一组极稀疏、动作监督过的视觉证据点。它牺牲了 reconstruction fidelity,换取 action relevance 和 context scalability。和 prior 的本质区别在于,NativeMEM 不试图让一个 planner 或 memory bank 显式维护任务状态,而是让 VLA 在低成本历史 token 上做隐式检索与条件化。它更 scalable 的原因主要来自 token budget:M=1 使 horizon 和 update frequency 可以上去;更 generalizable 的原因则来自 native visual space alignment,而不是 memory architecture 本身更强。
Method
方法上真正必要的机制只有几块。
第一,one-token-per-frame-view compression。它解决的是历史长度不可扩展的问题。公式上 memory 长度随 camera views、时间、频率和每帧 token 数线性增长;把每帧 token 数压到 1,是让 minute-level dense memory 可行的关键工程-建模结合点。这个选择很激进,也意味着它只保留 action loss 认为有用的信息。
第二,memory tokenizer 从 VLA vision encoder 初始化,并用 learnable query 聚合 patch tokens。它解决的是 memory token 与 VLA token space 不匹配的问题。这里的重点不是 query 结构多新,而是 tokenizer 继承了视觉编码器的表征坐标系,使输出更像“压缩视觉 token”而不是外部 latent state。
第三,stage-1 冻结 VLA,只训练 memory branch,并用原 action prediction loss。这个设计非常关键:如果 VLA 不冻结,模型可以通过改 backbone 降 loss,而不是迫使 memory token 变得可解释。冻结带来的核心变化是把学习压力集中到 memory tokenizer,使 token 必须在固定 VLA 的读出机制下变得有用。
第四,stage-2 冻结 tokenizer、微调 VLA 和 memory projection。它解决的是输入分布变化和任务适配问题。stage-1 让 token 大致落在可用空间,stage-2 让 policy 学会在具体任务中查询这些 token。这里更像把 single-frame VLA 改造成 history-conditioned VLA,而不是训练一个独立 memory system。
Key Insight / Why It Works
最重要的 insight 是 representation alignment 比 memory module capacity 更关键。长程 manipulation 中很多所谓 memory failure,并不是模型完全没有能力处理历史,而是历史信息以错误形式进入模型:文本 note 丢细节,external latent 不对齐,完整视频太贵。NativeMEM 把历史压缩成 VLA 原本视觉-token机制能处理的对象,降低了“学会读 memory”的难度。
我判断核心贡献是 frozen-VLA action-supervised tokenizer,而不是 one-token query 本身。one-token compression 是效率抓手;真正让它不崩的是 action supervision + native visual encoder initialization + frozen reader。这个组合把压缩目标从“保留图像内容”改成“保留 frozen VLA 需要但当前帧没有的动作条件”。这比 reconstruction 或 generic pooling 更贴近 manipulation。
它本质上更像 action-conditioned latent retrieval,而不是显式长期状态建模。policy 在推理时 attention 到历史 token,可能是在从密集事件日志中检索关键视觉瞬间,而不是形成稳定的 symbolic task state。对 Click Buttons、Put Back Block、Checkout 这类任务,这已经足够,因为关键变量往往对应某些历史帧中的局部视觉事件。
哪些部分可能只是辅助:memory BOS、缓存、当前帧也进入 tokenizer、offline preprocessing 等主要是 workflow 和训练稳定性;它们不是 conceptual novelty。哪些部分可能来自 scaling / data:stage-1 混合标准操作和 memory-demanding 数据会显著影响 tokenizer 学到什么,论文没有充分隔离数据覆盖与方法结构的贡献。真机高成功率很强,但也可能反映任务分布与训练 demonstrations 的结构一致性。
最值得警惕的是,论文展示的“memory understanding”更可能是 dense visual event retrieval 加 pretrained manipulation prior,而不是抽象推理能力。attention visualization 支持模型使用相关历史帧,但不能证明它学到了可组合的长期状态表示。
Relation To Prior Work
它最接近 compressed-history VLA、recurrent memory VLA 和 retrieval-augmented memory bank,而不是 VLM-planner 系统。和 MemER / Mem-0 / MEM 这类方法相比,NativeMEM 的差异不是“也有 memory”,而是 memory 的载体不同:它不把历史升格为语言 plan,也不构建显式 memory bank schema,而是压回 VLA native visual token space。
和 HAMLET、ReMem-VLA、MEM-short 这类内部 memory 方法相比,它的新增信息在于“复用 pretrained vision encoder + frozen reader supervision”。很多 prior 也做历史压缩、query pooling、moment token、recurrent query;这些思想本身不是新的。实质创新是把压缩表示的坐标系和训练目标都绑定到原 VLA:token 要能被 frozen VLA 读懂,且只为 action loss 服务。
从技术谱系看,它属于 memory-augmented pretrained policy adaptation,而不是 planner-based long-horizon reasoning。它把长期记忆问题转化为 token budget 和 representation alignment 问题,这个定位很清楚。
Dataset / Evaluation
评估覆盖了仿真和真机,任务类型主要是长程视觉回忆与进度追踪:按钮序列、物体原位置、扫描记录、RMBench 中若干 memory-dependent tasks。这个选择基本对准了论文 claim:当前观测不足、需要历史证据、且要求实时控制。
真机实验是有价值的,尤其 Grocery Checkout Scanning 在 stage-1 tokenizer 训练中未出现,能部分检验 memory tokenizer 的迁移。但这里的“unseen”仍然是同一类 manipulation progress tracking,不等于开放域泛化。任务都比较短程、事件明确、视觉证据局部可见,适合 dense memory retrieval。
实验支持 NativeMEM 在这些 memory-dependent benchmarks 上有效,也支持它的效率 claim。消融中 unfrozen stage-1、无 stage-1、低频更新、短 horizon 都下降,说明核心机制不是单纯加历史 token。但 evaluation 仍没有完全回答:一个 token 压缩在复杂场景中能承载多少语义;stage-1 数据覆盖是否决定了泛化;是否存在 benchmark overlap 或 task template memorization。文中未充分说明 baseline 复现质量、训练预算等因素对差距的影响,尤其部分 prior 被作者复现且不一定处在最佳训练 regime。
Limitation
方法成立依赖几个隐含前提。第一,动作相关历史必须能从单帧局部视觉证据中压缩出来;如果任务需要跨帧关系、复杂计数、隐藏变量更新或语言级规则推理,一个 token per frame 可能不够。第二,action loss 必须提供足够密集的监督信号;如果关键记忆只在很晚才影响动作,credit assignment 会很弱。第三,VLA attention 必须能在追加 token 后学会稳定检索历史,这在 hundreds frames 内可行,不代表 hours / days persistent memory 可行。
scalability 的上限也明显:token 数虽然大幅降低,但 attention 仍然随 memory token 数增长;5000 frames 是效率展示,不等于真实长期部署中的状态管理方案。它没有解决 memory selection、遗忘、跨 episode consolidation、身份绑定、长期知识更新等系统问题。
泛化方面需要谨慎。所谓 unseen 真机任务更像相近机制下的任务迁移,而不是抽象 memory generalization。核心能力可能主要来自数据覆盖和任务结构相似性。所谓推理更像 retrieval:找到过去关键帧,然后让 pretrained VLA prior 决定动作。这个机制有效,但不要把它解释成形成了显式长期状态模型。
增益归因仍不完全清晰。Native token alignment、dense update、long horizon、stage-1 数据、task finetuning、π0.5 backbone 都可能贡献很大;论文消融覆盖了一部分,但还不足以量化这些因素。
Takeaway
- 1. 对 pretrained VLA 加 memory,最值得优先考虑的不是更复杂的 memory module,而是 memory representation 是否在 pretrained policy 可读的 token space 里。
- 2. 长程操作中的很多 memory 需求可以被建模成 dense visual event retrieval:保留足够长、足够细的历史证据,再让 action model 在其中查找关键时刻。
- 这比显式 planner 更轻,也更适合实时控制。
- 3. Action-supervised compression 是一个可迁移 insight:如果最终目标是控制,不应默认用 reconstruction 或 generic video representation 来学 memory;压缩目标应该直接对齐 policy 的决策损失。
一句话总结
NativeMEM 是一类把 VLA 长程记忆问题重新表述为 native visual-token 压缩与对齐的 memory-augmented policy adaptation 方法,真正贡献在于用 action-supervised native memory token 以很低成本复用 pretrained VLA 的历史检索能力。
