精读笔记
Problem Setting
【Steering Robustness into World Action Models via Mechanistic Interpretability and Optimal Control】(arXiv preprint / 2026)
这篇论文解决的不是一般意义上的 robot policy learning,而是 WAM 已经训练好之后,在 camera shift、initial gripper perturbation、visual noise 等部署扰动下如何做 inference-time robustness repair。关键矛盾是:WAM 的视频生成式 backbone 可能已经含有关于世界动态和任务成功的丰富表示,但这些表示在 OOD 输入下未必被激活到正确区域;重新训练成本高,prompt steering 又很弱。
真正困难点在于,WAM activation 不是干净的语义 embedding。它混合了去噪 timestep、空间 token、未来视觉、动作 chunk、任务 prompt 和模型内部动态。要想 steering 成立,失败模式必须在 hidden space 中对应某种可识别、可移动、且不会破坏动作生成的方向。以前的鲁棒性方法主要卡在数据覆盖和 fine-tuning:它们能提高某些扰动上的表现,但不能告诉你模型是否已有可利用的 robustness representation,也不能做到轻量的 test-time 修正。
Motivation
已有路线缺的是一个“可诊断、可控、无需训练”的鲁棒性接口。WAM 的 brittleness 并不必然意味着模型不知道正确行为;更可能是扰动把内部状态推到了错误 activation regime。作者的核心观察是:在某些 WAM 中,成功/失败或 clean/perturbed rollout 的 activations 在很低维的 contrastive subspace 中可线性分开。这给了一个很直接的假设:如果鲁棒性相关因素在 activation space 中近似线性,那么可以像 LLM activation steering 一样在推理时操控它。
但简单 ActAdd 不够,因为 WAM 推理本身是一个多层、多 denoising timestep 的动态过程。固定加一个方向无法知道当前状态是否已经足够接近目标,也无法处理不同 layer/timestep 中 steering 对后续状态的传播。因此论文的动机不是“把 MI 用到机器人上”这么简单,而是把 MI 得到的 feature direction 变成一个 optimal control 问题。
Core Idea
核心思想是:先用 mechanistic analysis 判断某个 WAM 是否存在可控的 robustness feature,再在这个 feature subspace 中对 WAM hidden dynamics 做 feedback steering。这里最重要的建模转变是把 transformer block 间的 activation propagation 看成局部线性系统,把 activation injection 看成控制输入,把 nominal/robust feature strength 看成 setpoint。
这个方法理论上可能有效,是因为它利用了三个结构性假设:第一,扰动影响主要落在低维 contrastive subspace;第二,在这个子空间内,DiT block 的状态转移近似线性;第三,目标任务之间共享一部分扰动表征。相比 prior 的本质区别在于,它不是只做 open-loop representation editing,而是把 activation editing 放进模型自身的推理动力学里,用 feedback 抑制过度 steering。可扩展性的来源也在这里:它不需要 full activation-space control,而只在低维 SVD/PCA 子空间中求解 LQR。
Method
方法可以压缩成几个机制层面的步骤。
首先,contrastive feature discovery 解决“鲁棒性因素在哪里”的问题。作者收集 clean vs perturbed,或 successful vs unsuccessful rollout 的 hidden states,构造 activation difference。这个步骤的本质不是监督训练,而是用成对样本把 nuisance factor 从复杂任务语义中剥离出来。
其次,low-dimensional separability test 解决“这个方向是否可用”的问题。作者不在原始高维空间里看线性可分,因为那几乎必然可分而没有信息量;而是投到 top PCs 后用 SVM hinge loss 衡量是否存在低维线性结构。这个 diagnostic 是论文里很关键的一步:它把 steering 从盲试超参数变成先判断模型是否具备可控结构。
第三,ActAdd 是最小 baseline:平均 contrastive direction 后直接加到 activation。它验证了线性方向确实能改变行为,但也暴露了 open-loop 的问题:强度敏感、容易 oversteer、无法适应当前 activation。
第四,WA-LQR 是核心机制:把 contrastive directions 压到低维 latent basis,估计 block-to-block 的局部线性动力学,然后用 LQR 在每个 denoising timestep 内计算反馈增益。它带来的核心变化是 steering 量由当前 feature tracking error 决定,而不是由固定 gamma 决定。这样 steering 从“静态向量加法”变成“状态依赖的最小干预”。
Key Insight / Why It Works
这篇最重要的 insight 是:WAM 的鲁棒性失败在某些架构中可以表现为 activation geometry 的偏移,而不是必须通过权重更新才能修复的能力缺失。换句话说,模型内部可能已经有“成功模式”和“扰动模式”的区分,只是推理时需要把状态推回正确 manifold。
真正有效的部分大概率是低维 latent structure + feedback modulation。低维结构让 contrastive direction 不只是噪声平均;feedback modulation 让 intervention 避免 ActAdd 的强度灾难。WA-LQR 的控制理论包装并不是单纯形式主义:如果 block dynamics 的局部线性实验证据成立,那么 Riccati feedback 确实比固定方向加法更符合这个系统。
但也要直接说,论文的增益并不完全能归因于“optimal control”。在 Gaussian noise 上 ActAdd 反而强于 WA-LQR,说明当 feature separability 很强时,简单 activation injection 已经足够。WA-LQR 的主要价值更像是 regularized steering / adaptive damping,而不是发现了新的鲁棒策略。它是在利用已有 representation alignment,而不是创造新能力。
这不是 scaling paper,也不是 retrieval paper;它更接近 representation alignment + test-time control。模型规模和训练数据仍是隐性前提:如果 WAM 没有学到可分的 perturbation representation,例如 LingBot-VA,WA-LQR 基本无能为力。所谓泛化也更像是在共享 latent feature cluster 内的 transfer,而不是开放世界泛化。
Relation To Prior Work
它最接近三条线:LLM/VLM activation steering、VLA mechanistic interpretability、以及 diffusion/video model steering with control。ActAdd、contrastive directions、linear representation hypothesis 都不是新的;把 activations 当动态系统并做反馈控制,在 LLM/T2V 中也已有先例。
实质新增的信息在于把这套思路落到 WAM:WAM 的 activation 不只影响生成语义,还会影响机器人动作,因此 steering 的目标从“改变输出属性”变成“提高闭环任务成功率”。这使得可控性诊断比普通生成模型更关键,因为错误 steering 会直接破坏 action chunk。
和 robustness fine-tuning / RL post-training 的本质差异是,它不试图扩大训练分布,而是假设模型内部已有可用表征,并在推理时重排 activation trajectory。和 prompt steering 的差异更明显:prompt 只改输入条件,WA-LQR 直接作用于模型内部状态。和普通 WAM robustness benchmark 的区别是,它提供了一个 mechanistic predictor:hinge loss 可以预估 steering 是否可能有效。
Dataset / Evaluation
评价主要基于 LIBERO-10 仿真任务,扰动覆盖 camera orientation、initial gripper position、Gaussian sensor noise,模型覆盖 Cosmos-Policy、DiT4DiT、LingBot-VA。任务有一定多样性,也测试了从一个 task 构造 steering subspace 转移到另一个 task,但仍然是同一 benchmark family 内的 transfer。
实验支持了核心 claim 的弱到中等版本:当低维可分性强时,steering 通常有效;当可分性弱时,steering 弱或退化。这比单纯报 success rate 更有说服力,因为它验证了 diagnostic 与 intervention 的对应关系。
但 evaluation 没有充分证明真实部署鲁棒性。没有真机实验,没有长 horizon real-world closed-loop stress test,也没有证明 task grouping 能自动扩展到新环境。benchmark 是否存在视觉布局、任务模板或训练数据 overlap 带来的 implicit memorization,文中未充分说明。30 trials 或 20 trials 的规模也使得部分 task-level 差异不应过度解读。
Limitation
核心限制是适用条件窄。WA-LQR 只有在目标扰动形成低维线性表征、该表征跨任务共享、且局部线性动力学近似有效时才成立。LingBot-VA 的结果已经说明这不是 WAM 的普遍性质,而是架构和训练过程诱导出的偶然结构。
第二,方法把数据问题转移成 contrastive set construction 问题。你仍然需要收集扰动/成功/失败样本来发现方向,只是不做 weight update。对于真实机器人,新扰动、新相机、新物体组合是否能快速构造高质量 contrastive pairs,文中未充分说明。
第三,泛化上限不清。论文中的 transfer 更像 shared representation cluster 内的迁移,不是跨 domain 的鲁棒泛化。task grouping 目前依赖 mechanistic analysis,缺少自动判定机制。
第四,增益来源不完全清晰。WA-LQR 的提升可能来自低维滤波、控制强度正则化、早期 action chunk 更强干预,或模型原本已有 clean-behavior prior;这些因素没有被充分拆开。ActAdd 在部分设置更强,说明 closed-loop optimal control 不是所有提升的必要条件。
第五,这并没有证明 WAM 形成了更强 planning 或 world modeling。它修正的是 hidden activation regime,任务成功可能来自把模型拉回训练分布附近,而不是产生新的长期状态推理能力。
Takeaway
- 最值得记住的有三点。
- 第一,activation steerability 应该先诊断再干预。
- 低维 separability / hinge loss 作为 steering predictor,比盲调 injection strength 更有研究价值。
- 第二,WAM 鲁棒性可以被看成 representation control 问题:如果扰动导致 hidden trajectory 偏离成功 manifold,那么 test-time feedback steering 是一条比 fine-tuning 更轻量的路线。
一句话总结
这篇论文把 WAM 鲁棒性从数据增强/微调问题重新表述为低维可分表征上的 test-time feedback control,真正贡献是证明“可解释的 activation geometry 可以预测并驱动机器人策略的鲁棒性 steering”。
