精读笔记
Problem Setting
论文标题:FlowWAM: Optical Flow as a Unified Action Representation for World Action Models(arXiv preprint / 2026-07-15)。
这篇论文真正处理的不是一般意义上的 robot policy learning,也不是单纯提升 video prediction,而是 WAM 中最核心的接口问题:如何把“可执行动作”表示成预训练视频生成器能够自然建模的东西。
现有 WAM 的困难在于动作和视频先验之间存在结构性错位。低维 joint/action token 对机器人控制很直接,但对视频 DiT 来说是异质条件,需要额外 tokenizer、head、adapter 或 cross-modal bridge;静态 image-space action cue 虽然进入了视觉空间,但大多只说明“哪里发生动作”,没有显式表达“每个可见点如何随时间移动”。
因此关键矛盾是:控制需要 precise executable action,视频生成器需要 video-native spatiotemporal signal。以前方法要么保留动作精度但牺牲与视频先验的对齐,要么进入视觉空间但丢掉 temporally dense motion structure。FlowWAM 的切入点就是把 action representation 改成 dense optical-flow video,让动作以视频生成器本来擅长的形式存在。
Motivation
作者不满足于 numerical action token 的原因很明确:它们是 embodiment-specific 的,并且不能直接利用视频模型预训练得到的 motion prior。把一个 14D 或 7D action vector 塞进 DiT,并不等价于告诉模型图像中哪个部件会怎么动。
learned latent action 的问题则相反:它确实弱化了 embodiment dependency,但 latent 太抽象,未必保留控制需要的空间可定位运动信息。对 manipulation 来说,很多关键差异不是语义层面的,而是局部接触、末端轨迹、双臂相对运动这些细粒度动态。
静态视觉 action 表示,如 masks、ray maps、多视角 action image,虽然比数值 action 更接近视觉空间,但本质上还是 frame-level cue。它们通常告诉 generator action 的位置或对象,而不是提供连续时间里的位移场。作者看到的缺口是:WAM 缺少一种同时满足 video-native、dense motion、可解码、可从无动作视频学习的 action representation。
optical flow 正好卡在这个缺口上。它不是新的感知信号,但在这里被重新定义为 action modality,而不是 auxiliary loss、intermediate planner variable 或 perception feature。
Core Idea
核心思想是把动作从“控制命令”改写为“像素运动计划”。FlowWAM 不直接让模型预测 joint action,也不只预测 future RGB,而是联合生成 RGB video 和 optical-flow video。flow video 承担 action representation:policy mode 中它被生成出来,随后解码成低层机器人动作;world-model mode 中它作为条件输入,引导模型生成遵循该运动的未来视频。
这个改变的本质是信息流重组。传统 action-conditioned video model 是 action → video;传统 policy 是 observation → action;FlowWAM 变成 observation → visual motion plan → action,同时也支持 observation + visual motion plan → future video。动作不再是视频模型旁边的异质 stream,而是视频 latent space 内部的一条运动 stream。
它引入的 inductive bias 是:控制相关的信息应当先以 dense, spatially grounded, temporally continuous 的方式组织,再映射到 actuator space。这个 bias 对 manipulation 特别合理,因为大部分可见控制后果表现为 robot/object 的局部位移,而不是抽象符号变化。
和 prior 的本质区别在于,FlowWAM 不是“用 flow 辅助训练 policy”,也不是“先预测 flow 再单独做 planning”,而是把 flow 纳入预训练视频生成器的主生成空间。这个设计让无动作视频也能训练 action representation 的一部分,因此比依赖 action labels 的 WAM 更 scalable。
Method
方法里真正关键的是三类机制。
第一,flow RGB encoding。把 RAFT 等方法得到的二维位移场用 HSV 编码成 RGB-like 图像,使其能直接通过冻结 VAE 和视频 DiT。它解决的是 modality mismatch,而不是简单可视化。raw uv tensor 的 ablation 变差说明,这里的重点不是 flow 信息本身,而是 flow 被包装成 pretrained video generator 熟悉的 image manifold。
第二,RGB-flow dual-stream generation。RGB 与 flow 各自有 patch embedding / output head,但共享主 transformer block,并在 self-attention 中联合交互。这让外观和运动不是两个后处理模块,而是在同一个 denoising process 中共同成形。它的核心变化是把 action prediction 和 world modeling 都变成 video-to-video generation 问题。
第三,action expert。flow 本身不能直接执行,因此仍需要一个 decoder 从生成器 hidden states 映射到 action chunk。这里 action expert 的意义是把 video-native representation 接回 embodiment-specific control space。它并没有消除 embodiment-specific decoding,只是把 embodiment-specific 部分推迟到最后一层接口。
motion-aware reweighting 解决 flow 中静态背景占主导的问题,stochastic latent conditioning 解决 action expert 训练时读 clean latent、推理时读 generated latent 的分布偏移。这些是必要的工程补丁,但不是论文的概念核心。
Key Insight / Why It Works
最重要的 insight 是 representation alignment。FlowWAM 的收益大概率主要来自把 action 表示放到 pretrained video prior 的原生输入/输出格式里,而不是来自某个复杂的新架构。HSV-flow 之所以有效,是因为它同时满足三个条件:保留像素级运动、与 RGB 视频同构、能从无动作视频中自动生成 pseudo-label。
这本质上是 better inductive bias + scaling path 的组合。better inductive bias 来自 dense motion field:相比 numerical action,它直接告诉模型空间上哪里动、朝哪里动、动多远;相比 mask/ray map,它有时间方向和幅度。scaling path 来自无动作视频预训练:只要能抽 flow,就能学习 manipulation-like motion prior,不依赖机器人 action labels。
最可能的核心贡献是“flow as primary action stream inside video generator”,而不是 action expert、双流结构或 flow matching objective。后者基本是当代 video diffusion / policy diffusion 的标准组合。真正改变的是 action 的建模单位:从 low-dimensional motor command 或 learned latent,换成 dense visual displacement sequence。
但也要直接说,部分增益来源不清。FlowWAM 建在 Wan2.2-TI2V-5B 上,使用 EgoDex 预训练,并在 RoboTwin 中用 robot-only replay 生成更干净的 flow target。这些都可能显著提高结果。尤其 robot-only flow supervision 把背景和物体 motion artifact 去掉,相当于提供了强结构化的 embodiment motion label;这是否公平等价于普通 optical flow 监督,文中未充分说明。
所谓 world modeling 的“action reliability”也可能更像 conditional rendering:给定 dense flow 后,视频模型沿着位移场补 appearance。这是合理能力,但不等价于模型理解了因果动力学或能做长期规划。Trajectory Accuracy 的提升支持 controllability,但不能证明它学到了可组合的 action dynamics。
Relation To Prior Work
FlowWAM 最接近三条线:WAM / video-action co-generation、latent action from video、pixel-motion / optical-flow-for-control。
相对 DreamZero、Cosmos Policy、UWM、CoVAR、Fast-WAM 这类 WAM,FlowWAM 的不同点是 action stream 不再是附着在 video latent 旁边的 token 或 head,而是被改造成一个与 RGB 同构的视频 stream。这个差异是实质性的,因为它改变了预训练视频生成器能否直接复用自身 motion prior。
相对 Motus / latent action pretraining,FlowWAM 不把 action 压成不可解释 latent,而是保留显式 dense motion。这里的优势是 decodability 和 spatial grounding,劣势是依赖 optical flow 质量,并且可能对不可见状态建模不足。
相对 LangToMo、DAWN、FlowVLA、future-flow prediction、flow-to-action pipeline,FlowWAM 的新意不是发现 flow 有用,而是把 flow 放进 WAM 的主生成过程:policy 时生成 flow,world model 时条件化 flow,同一个表示连接无标签视频预训练、控制和视频预测。
因此它属于“把 action representation 视觉化 / 视频化”的技术谱系。看似新的一些部分,如 diffusion backbone、flow matching、action chunk decoder、unlabeled video pretraining,其实是已有组件重组;实质创新在于把 optical flow 提升为统一 action interface。
Dataset / Evaluation
评估覆盖比较完整:RoboTwin 2.0 用于多任务双臂仿真控制,WorldArena 用于 action-conditioned world modeling,另有 Franka 和 ARX 真机小规模验证。这个组合基本对应论文的三条 claim:可解码控制、无动作视频预训练可扩展、flow conditioning 提高 world model 的动作可靠性。
RoboTwin 的 50 个任务和 Clean/Random 设置能检验多任务与视觉扰动下的鲁棒性,且与 VLA 和 WAM baseline 比较较充分。不过它仍是仿真 benchmark,且训练使用大量 Random demonstration,泛化更多是 benchmark 内分布泛化,不应过度解释为开放世界泛化。
WorldArena 确实更直接验证了 flow conditioning 的价值,因为最大提升集中在 trajectory accuracy,而不是 aesthetic / appearance 指标。这支持“dense motion condition 比 text/action token 更能约束轨迹”的判断。
真机实验有价值,但规模偏小:7 个任务、每任务 100 demos、10 trials,更多是 sanity check 而非强泛化证据。它说明方法没有只在仿真中工作,但不足以证明跨 embodiment 或长程开放任务能力。
Ablation 是论文里比较关键的证据:numerical action、raw uv flow、mask/image action 都不如 full HSV-flow;flow error 与 success 的相关性也支持 decodability。不过增益归因仍受 backbone、数据、pseudo-label pipeline 影响,不能完全归因于 flow representation 本身。
Limitation
第一个核心前提是 optical flow 必须是足够好的 action surrogate。这个前提在很多 manipulation 场景不稳:遮挡、接触力、物体内部状态、被遮挡后的物体运动、非刚体形变、工具-物体隐式约束,都不是 dense visible flow 能完整表达的。flow 表达的是表面运动,不是完整物理状态。
第二,所谓 unified action representation 并没有真正消除 embodiment-specific action space。FlowWAM 仍需要 action expert 从 flow/RGB hidden states 解码到具体机器人 action。跨 embodiment 的可迁移部分主要是 motion prior,最终控制接口仍然依赖机器人数据重新学习。
第三,scalability 依赖 flow extraction pipeline。无动作视频可以用,但质量、视角、相机运动、手/机器人外观差异都会影响 flow 的可迁移性。EgoDex 到 RoboTwin 的迁移有效,不代表 internet-scale 视频一定有效;大量 ego-video 中的 human hand motion 是否能稳定迁移到 robot morphology,文中未充分说明。
第四,robot-only flow target 是强假设。RoboTwin 中通过 replay robot joint action 渲染 robot-only flow,过滤掉背景和物体 motion artifact,这给了模型非常干净的 embodiment motion supervision。真实世界无法轻易得到同等质量的 robot-only flow,除非有分割、重建或仿真辅助。这里可能把一部分难题转移到了数据构造。
第五,world model 的长期推理能力没有被证明。给定 dense flow 后生成视频,本质上可能是 trajectory-conditioned rendering;它未必学到了可以反事实组合、搜索或规划的 dynamics model。若没有 closed-loop planning evaluation,把它称为更可靠 world model 需要保留。
第六,增益可能主要来自 representation alignment + data coverage,而不是新的 reasoning。论文没有充分剥离 backbone scale、EgoDex pretraining、flow pseudo-label 质量、action expert 容量这些因素。可能主要来自 scaling / data 的部分不能排除。
Takeaway
- 最值得记住的第一点:对 WAM 来说,action representation 的形态可能比 action decoder 结构更重要。
- 把 action 变成视频模型原生能处理的时空对象,会比在低维 action token 上堆 adapter 更有效。
- 第二点:optical flow 是一个很强的中间层接口,因为它同时连接无标签视频、可视化运动计划、条件视频生成和低层动作解码。
- 这个 insight 可以迁移到其他 embodied model:先找与 foundation model prior 同构的 action/state representation,再谈控制。
一句话总结
FlowWAM 是 WAM 从“用视频模型辅助动作预测”走向“把动作本身视频化”的代表性工作,真正贡献在于把 optical flow 作为与 RGB 同构的统一 action interface,从而改善视频先验对控制与 world modeling 的可用性。
