精读笔记
Problem Setting
这篇论文解决的不是从零训练机器人策略,而是对已有 flow-based policy/VLA action head 做低成本后训练:base policy 已经有一定行为能力,但在新任务或分布偏移下成功率低,同时多步 ODE/SDE 采样让 real-time deployment 和 RL 训练都昂贵。
真正困难点在于 policy improvement 和 fast inference 在 flow/diffusion policy 中通常相互冲突。RL 需要不断从当前策略采样 next action 来做 critic backup;如果每次 action 都要 10+ NFE,训练本身会被采样拖慢。另一方面,直接压缩成 one-step policy 往往需要 distillation 或牺牲多模态建模。关键矛盾是:要保留 flow policy 对复杂 action distribution 的表达能力,又要让 post-trained policy 在少步积分下仍然落到高价值动作区域。
Motivation
已有方法缺的是一个同时作用于“目标分布”和“采样几何”的机制。Advantage-weighted / critic-weighted flow matching 可以改变哪些动作更重要,但不保证低 NFE 下积分路径好走;consistency、distillation、one-step acceleration 可以降低采样成本,但通常不直接利用机器人交互得到的 Q 信号来做 policy improvement。
作者的观察是:CFM 中 coupling 的选择不只是训练技巧,而是在决定噪声到动作的传输几何。OT/COT coupling 会使路径更直,从而少步 Euler 更可靠。如果再把 advantage 写进 OT 的 target marginal,那么 RL 信号就不只是 loss 上的标量权重,而是改变了 transport plan 本身。这是论文的关键缺口定位。
Core Idea
OTQL 的核心思想是把 KL-regularized policy improvement 的 tilted distribution π(a|s) exp(λA(s,a)) 变成一个条件最优传输目标。具体说,它不是先学原始 action distribution 再用 Q 做 guidance,也不是在 flow matching loss 外面简单乘权重;它在 minibatch COT 中直接把高 advantage 样本赋予更大 target mass,让 OT solver 重新决定噪声样本应该配到哪些动作样本。
这个改变引入的 inductive bias 很清楚:高价值动作不仅更常被学习,而且被学习为从噪声出发的短而直的传输终点。也就是说,policy improvement 和 inference acceleration 被合并到同一个 coupling 几何里。与 prior 的本质差异在于,prior 多数把 reward/Q 当作采样后筛选、loss reweighting 或 guidance;OTQL 把 Q 信息前置到 transport coupling,使数据配对结构本身带有价值偏置。
Method
OTQL 保留的关键机制只有几个。
第一,使用 conditional OT coupling 来训练 CFM。它解决的是低 NFE 采样时曲线路径误差大的问题;通过让噪声-动作配对近似 Wasserstein/COT plan,flow 学到的路径更直,少步积分更可用。
第二,用 advantage 改写 target marginal。它解决的是 post-training 中“哪些动作应该被强化”的问题;高 Q/advantage 动作在 OT 问题中获得更多质量,flow 的终点分布被推向 KL-regularized policy improvement 解。
第三,条件通过 cost augmentation 和 source condition resampling 进入 OT。它解决的是 conditional generative policy 中错误跨状态配对的问题;如果只在 action space 做 OT,可能把不同 observation 下的动作硬配对,破坏 COT 的条件一致性。
第四,critic 仍按常规 TD 训练,并在 action chunk 设定下估计 chunk-level value。这不是论文的核心创新,但决定了方法能接到现有 diffusion/flow robot policy 上。
第五,weight clipping 和小规模 rejection sampling 是稳定性机制。它们处理的是 advantage 分布过尖导致 effective batch size 下降、以及 sparse high-value action 难采样的问题。这里更偏 engineering,但在真实任务中可能对最终结果很关键。
Key Insight / Why It Works
最核心的有效性来自两个因素叠加:一是 COT 给 flow 一个更适合少步积分的路径几何;二是 advantage-weighted marginal 让这些直路径指向高价值动作,而不是平均行为动作。这个组合比单独 advantage weighting 更强,因为它同时改变了训练分布和生成动力学。
我认为实质贡献是“value-aware coupling”,不是 Q-learning 本身,也不是 action chunking/rejection sampling。critic、TD backup、candidate selection 都是已有 RL policy improvement 工具;新东西在于把 Q 信号放进 OT plan,使 sample pairing 成为 policy improvement 的载体。
它本质上更像 better inductive bias + memory reuse,而不是强泛化或规划。OTQL 主要从已有 demo、base policy rollout 和少量 online data 中筛出/放大高价值行为 mode。它没有显式形成长期规划模型,critic 只是给 action/chunk 打分。所谓 adaptation 很大程度上依赖 buffer 中已经出现过足够接近成功的行为;如果成功 mode 从未被探索到,OT reweighting 不能凭空创造。
低 NFE 增益也可能部分来自分布变窄。高 advantage weighting 会让目标分布更集中,这本身就降低了生成难度;因此“路径变直”与“目标更单峰/更窄”对加速的相对贡献文中未充分说明。Figure 1 和 NFE ablation 支持 COT 几何有效,但真实任务中的增益来源仍不完全可分。
rejection sampling 是辅助而非核心,但不能忽略。尤其在 action chunk 和尖锐 Q 场景,N=5 的筛选可能显著提高早期 rollout 质量,进而改善 buffer 分布。这意味着部分 online improvement 可能来自 test-time compute 和更好的 data collection loop,而不完全是 actor loss 本身。
Relation To Prior Work
OTQL 位于三条技术线的交叉处:advantage-weighted offline/online RL、flow matching policy、OT/COT-based flow acceleration。
和 EWFM / advantage-weighted FM 最接近。区别在于 EWFM 多是在 loss 权重层面表达 energy/Q,而 OTQL 把权重放入 target marginal 并重新求 transport coupling。这个差异不是表面实现差异,而是决定了训练向量场的几何结构:OTQL 试图同时学到 tilted distribution 和 low-curvature transport path。
和 Q-Chunking、DSRL、guided diffusion/flow RL 相比,OTQL 没有把 base policy 当作需要反复昂贵采样或外部筛选的黑盒,而是直接改写 flow 的生成过程。它牺牲了黑盒适配性,换来对 action head 内部几何的控制。
和 consistency/distillation acceleration 相比,OTQL 的新意是 acceleration 不来自 teacher-student 压缩,而来自训练 coupling 的选择。它不是追求严格 one-step generation,而是接受 2-3 NFE 的实用折中。
看似新的部分里,KL-regularized tilted policy、advantage weighting、critic ensemble、rejection sampling都不是新思想;实质创新是把这些 policy improvement 信号嵌入 conditional OT coupling,并把它用于机器人 flow policy 的后训练。
Dataset / Evaluation
评估覆盖面比较完整:offline OGBench、offline-to-online simulation、online MuJoCo manipulation、真实 KUKA 单任务 flow policy 和 SmolVLA action head。它确实验证了论文的主要 claim:OTQL 可以在少量交互/rollout 下提升 suboptimal flow policy,并把 inference NFE 降到 2-3。
真实世界部分是有价值的,因为不是只在离线 benchmark 上抽取数据集行为,而是面对真实机器人执行频率、人工监督和部署 latency 的约束。SmolVLA 实验也说明方法能接到 VLA action head,但这里只冻结 VLM、只调 action head,因此验证的是 flow head adaptation,不是完整 VLA 语义泛化。
明显 limitation 是实验没有完全隔离各机制贡献。OTQL 与 baselines 在 NFE、candidate sampling、chunking、critic ensemble、offline/online data mixing 上并非总能做到概念上完全等价。结果支持“系统有效”,但不完全支持“主要增益都来自 weighted COT coupling”。此外,真实任务数量少,且都属于短程 manipulation;不能外推到长时序任务、强语义推理或复杂多阶段规划。
Limitation
OTQL 成立的第一前提是 base policy 已经覆盖了可改进行为。它优化的是 π exp(λA) 这一类保守改进分布,本质上不鼓励远离 base/data distribution 的探索。核心能力可能主要来自数据覆盖,而不是从 sparse reward 中发现全新策略。
第二个上限是 minibatch OT 在高维条件/action 空间中的近似质量。论文承认维度升高后收益变弱;在视觉 VLA 中,虽然 condition 是高维 representation,但 OT cost 如何在 representation space 中保持语义合理,文中未充分说明。α 的选择实际上控制了“按状态配对”与“按动作几何配对”的权衡,可能非常脆弱。
第三,critic 质量是隐含瓶颈。Sparse reward、少量 rollouts 和高维 action chunk 会让 Q function 很容易产生尖峰或错误排序。OTQL 把 critic 的排序直接写进 target marginal,因此 critic bias 会被 transport plan 放大。weight clipping 缓解了方差,但也说明方法对 Q scale 很敏感。
第四,所谓 acceleration 可能部分是把问题转移到训练期 OT solver 和 critic/rejection pipeline。部署时确实快,但训练过程仍要求反复解 minibatch entropic OT、训练 critic、维护 buffer。对于大规模 VLA/WAM action head,LoRA 等参数高效训练只是可能方案,论文没有展示真正大模型端到端后训练。
第五,真实部署仍依赖人工 reset、episode labeling、少量 expert demo 和任务特定奖励。它离 fully autonomous robot RL 还有距离。泛化也主要是 target-task adaptation,不是跨任务抽象能力的证明。
Takeaway
- 1. 最值得迁移的 insight 是:在 flow matching 中,coupling 是可以承载 policy improvement 信号的结构变量,不只是降低 variance 的训练技巧。
- 2. 对机器人 action generation 来说,少步可用不一定要靠 distillation;通过改变 transport geometry,可以得到更实际的 2-3 NFE 折中。
- 3. Advantage weighting 如果只做 loss reweighting,容易忽略生成路径;OTQL 提醒我们,RL signal 应该尽早进入 generative process 的几何层,而不是只在采样后筛选。
- 4. 未来真正值得做的是把 value-aware transport 扩展到更高维、更语义化的 latent action/condition space,并更干净地区分“路径变直”“分布变窄”“rejection sampling 改善 data collection”三类增益来源。
一句话总结
OTQL 是一类 value-aware conditional OT flow matching 方法,它把 RL 后训练从简单的 advantage reweighting 推进到 coupling-level policy improvement,从而在保守数据覆盖内同时获得 flow policy steering 和少步推理加速。
