精读笔记
Problem Setting
[CLAP: Direct VLM-to-VLA Adaptation via Language-Action Grounding](arXiv preprint / 2026)
这篇论文不是在做一个更强的通用机器人 foundation model,而是在研究一个更干净的问题:如果尽量不改 VLM,只靠 fine-tuning 和输出格式设计,能不能把 VLM 直接变成可执行 VLA,并且保留 VLM 的语言/视觉语义能力。
关键矛盾是:机器人控制需要精确、低层、连续动作;VLM 预训练则让模型擅长生成语义结构化语言。把连续动作离散成整数 token 后,虽然可以复用 autoregressive LM objective,但目标序列变成“408 980 166 ...”这种几乎无语言结构的 token 流。对 VLM 来说,这不是自然的 next-token continuation,而是强行迁移到一个贫语义、强数值化的输出分布。
以前方法卡在两端:action expert / diffusion head 提供了更合理的控制接口,但引入新模块后很难判断到底是 VLM 贡献了语义能力,还是 action head / robot pretraining 在起作用;language-only action 表达更贴近 VLM 分布,但本身不够精确,通常还需要额外 action generator。CLAP 试图填的是这两者之间的空位。
Motivation
作者的核心观察是:VLM-to-VLA 的 bottleneck 不只在输入 grounding,也在输出分布。很多 VLA 工作默认“把 action token 当作语言 token 预测”是自然的,但从预训练模型角度看,这是非常不自然的 target distribution。
已有路线缺的是一个同时满足三点的接口:第一,不破坏 VLM backbone;第二,不牺牲可执行动作精度;第三,让训练目标仍尽量像语言生成。CLAP 的动机就是把 low-level action prediction 重新嵌入 VLM 熟悉的语言上下文里,而不是让模型直接从图像和指令跳到裸数字。
这个方向成立的前提是:动作 chunk 存在一个相对低维、语言可表达的中间结构,例如“向上移动、向左倾斜、闭合夹爪”。如果这种 chunk-level intent 对后续精确动作有预测价值,那么它就能作为 VLM 与控制之间的 representation bridge。
Core Idea
CLAP 的真正核心不是“加了一个 think 标签”,而是把动作建模从 direct action-token prediction 改成 causal language-conditioned action generation。模型先生成一个模板化的自然语言动作摘要,再生成精确的离散动作 token。由于是同一条 autoregressive 序列,numeric tokens 可以 attend 到前面的 language-action prefix,所以 prefix 是条件变量,不是旁路解释。
这引入了一个很明确的 inductive bias:先预测 chunk-level motion semantics,再预测 per-dimension low-level control。它把原本高维、离散、语义贫乏的动作序列拆成“粗语义计划 + 精细数值残差”。这有点像给行为克隆加了一个低频 latent plan,只不过这个 latent plan 被强制写成 VLM 熟悉的自然语言。
和 prior 的本质区别在于:LAP / language-action pretraining 更像用语言作为预训练或监督信号,最终执行还依赖额外 action module;VLA-0 则是最纯的裸 action token 预测。CLAP 把二者合到同一个 generation path 中:语言不是替代 action,也不是外部 planner,而是 action token 的 causal prefix。
Method
方法层面最重要的是 output representation,而不是 architecture。
第一,language-action prefix 解决的是 output-distribution mismatch。它把“纯数字动作序列”前面接上一个自然语言动作摘要,使模型在生成动作前先经过一个更接近预训练语言分布的区域。核心变化是:VLA fine-tuning 不再完全把 LM head 推向非语言 token 流。
第二,prefix 由 ground-truth action chunk 用固定模板自动生成,解决的是监督来源问题。它不需要人工标注,也不需要额外 planner。但这也意味着所谓 language grounding 很大程度是动作的 deterministic re-description,而不是从环境语义中自由推理出的 plan。
第三,numeric action tokens 仍然保留,解决的是可执行性问题。语言只负责提供粗结构,真正控制仍由离散动作 token 承担。CLAP 没有用语言替代控制,而是用语言约束控制。
第四,action masking 是可选 augmentation。它试图减少模型对相邻动作 token 的 shortcut 依赖,但实验显示小模型受损、大模型受益,因此它不是核心机制,更像规模相关的正则化。
Key Insight / Why It Works
我认为 CLAP 的主要有效性来自 representation alignment 和 latent structure 两点,而不是 scaling。
第一,language prefix 把动作预测变成了一个更接近 VLM 预训练任务的 continuation。VLM 本来就擅长从图像和指令生成语言描述;CLAP 先让它做一个熟悉的子任务,再让数字动作在这个上下文中生成。这降低了 fine-tuning 初期的优化难度,也可能减少对 backbone 语义表示的破坏。
第二,prefix 是一个低频动作摘要,相当于显式引入 chunk-level latent plan。裸 action token 序列里,模型必须同时学习“要做什么”和“每个维度输出多少”;CLAP 把“要做什么方向的运动”先显式写出来,再预测数值细节。这是一种很强的 inductive bias,尤其适合 LIBERO 这类短 horizon manipulation benchmark。
第三,模板语言可能起到了 curriculum / regularization 的作用。训练时模型先预测容易的、离散语义稳定的动作描述,再预测高熵 numeric tail。这个顺序本身就可能改善 optimization。文中把它解释为 output-distribution mismatch,但不能排除增益主要来自这种分层监督。
第四,所谓 reasoning 不应过度解读。prefix 是由动作反推的模板,不是模型自主形成的任务级 planner。它更像 compressed action summary,而不是 long-horizon reasoning trace。对 LIBERO 的提升说明这种压缩有用,但不证明模型学到了更强的因果推理或长期状态建模。
第五,2B 优于 4B 很有意思,但文中未充分说明原因。可能是 Qwen3.5 各 scale 的视觉能力、instruction following、tokenization behavior 或 fine-tuning stability 不同,也可能是 4B 在一 epoch/full fine-tune 下欠优化或更易被动作分布干扰。不能简单得出“中等规模最适合 VLA transfer”的一般结论。
Relation To Prior Work
CLAP 最接近三条线:VLA-0 式 architecture-free autoregressive action tokenization、LAP/VLM2VLA 式 language-action representation、以及 embodied reasoning / trace-based intermediate supervision。
相对 VLA-0,CLAP 的实质新增信息是:裸动作 token 前面加了一个可语言化的 chunk summary,使 action prediction 不再完全脱离语言分布。这个差异很小,但机制上很关键,因为它改变了 target sequence 的统计结构。
相对 VLM2VLA / actions-as-language,CLAP 没有把动作完全语言化,因此没有丢掉低层执行精度。它保留 numeric action tail,这一点是工程上必要的,也是它能直接部署的原因。
相对 ECoT、TraceVLA 等 reasoning-intermediate 方法,CLAP 更轻,也更不“认知化”。它不依赖额外 trace supervision、prompting 或 inference-time reasoning,而是把 intermediate 固定成动作模板。因此它的创新不在推理能力,而在把 language intermediate 放进最终 policy output 的 causal path。
相对 action expert / diffusion / flow head 系列,CLAP 属于“最小改动 VLM adaptation”谱系。它牺牲了一部分并行解码效率和连续控制建模能力,换来更干净的 attribution:如果有提升,更可能来自 representation 设计而非新模块容量。
Dataset / Evaluation
评估设计基本支持论文的核心 claim,但支持范围有限。
最有说服力的是 matched VLA-0 对照:同 backbone、同 LIBERO 数据、同训练步数,只改输出 representation。这个实验能比较清楚地说明 language-action prefix 对 learning efficiency 有贡献。
LIBERO-PRO 的 OOD 结果支持“不是只提升 ID imitation”的说法,尤其 object / semantic perturbation 上的提升与语言化 prefix 的假设相容。但 Position perturbation 整体仍很弱,说明 spatial generalization 并没有被根本解决;Task perturbation 也不能证明真正 compositional planning。
VLABench 分析更像辅助证据,而不是强因果证据。它展示 base VLM capability 与 downstream VLA 表现并非单调随参数增长,但没有建立具体 capability 到 policy success 的机制映射。
真实机器人实验是有价值的,但样本太小,任务也相对窄。2B 在 120 demos 下能做 cluttered pick-and-place,说明方法可落地;但成功率距离 simulation 很远,也提醒 LIBERO 上的高分不能外推到真实世界泛化。
Limitation
CLAP 的核心前提是:短 horizon 低层动作可以被模板语言有效概括,并且这个概括对精确控制有帮助。这个前提在 pick-place、移动、夹爪开合这类任务中成立,但对 contact-rich manipulation、工具使用、非刚体、双臂协作、长时序 subgoal switching 未必成立。
方法可能只是把问题从“如何预测动作”转移到“模板是否覆盖动作结构”。如果模板表达不了关键控制变量,语言 prefix 就会变成无效甚至误导的上下文。文中未充分说明模板设计对结果的敏感性,也没有系统比较不同 prefix 粒度、不同语言风格、是否需要 learned prefix。
增益来源不清。CLAP 的提升可以被解释为 output-distribution alignment,也可以被解释为额外 supervised target、chunk-level smoothing、action denoising、teacher forcing 下的 intermediate curriculum。论文没有做足够强的 ablation 来拆分这些因素,例如随机但结构化 prefix、非语言符号 prefix、只预测 prefix 不喂给 action、oracle prefix vs generated prefix 等。
泛化 claim 需要谨慎。LIBERO/LIBERO-PRO 仍然是模拟 benchmark,任务分布有限,且 demonstration/task templates 可能让模型通过 retrieval-like behavior 获益。所谓语义泛化可能部分来自 benchmark overlap 和数据覆盖,而不是形成了可迁移的 robot reasoning。
推理和 planning 能力不能从这篇中得出强结论。CLAP 的 prefix 是动作摘要,不是长期计划;它没有 memory,没有显式 state estimation,也没有 closed-loop subgoal refinement。h=8 open-loop chunk 在真实部署中还带来控制频率和误差累积问题。
Takeaway
- 1. 对 VLM-to-VLA,output representation 可能和 architecture 同样重要。
- 直接让 VLM 生成裸 action tokens 是一个很强的分布错配假设,CLAP 说明只改 target sequence 就能显著改善 adaptation。
- 2. 语言作为 control intermediate 的价值不一定在“推理”,而在提供一个 VLM 熟悉的低维结构化 latent。
- 这个 insight 可以迁移到其他 embodied policy:先让模型生成可语言化的粗动作意图,再预测高精度控制变量。
一句话总结
CLAP 是一类最小架构改动的 VLM-to-VLA 方法演化:它真正贡献的是把低层动作预测重新嵌入语言生成分布中,用模板化 language-action prefix 作为 causal latent bridge,而不是提出新的机器人控制架构。
