精读笔记
Problem Setting
AeroAct 处理的不是传统意义上的“语言导航”,而是语言目标驱动的四旋翼局部闭环飞行控制。问题的关键矛盾是:语言目标通常是语义和稀疏的,但四旋翼执行需要连续、平滑、短时稳定且动力学可行的控制参考;同时,第一视角观测会被自己的动作立即改变,单帧语义识别不足以决定安全动作。
以前方法卡住的地方在于 action abstraction。离散动作和高层 waypoint 对 benchmark 友好,但把四旋翼最难的连续控制问题推给了下游;瞬时速度命令虽然连续,却缺少对未来视觉后果和轨迹平滑性的约束。AeroAct 试图把语义 grounding、视觉后果和可执行局部轨迹放到同一个训练信号里。
Motivation
已有 aerial VLN / VLA 的核心缺口不是“语言模型不够大”,而是动作学习缺少 consequence supervision。模型可以学到某个物体在哪里、应该往哪里飞,但不一定学到这个动作会怎样改变目标在相机中的位置、是否会丢失视野、是否导致局部轨迹震荡。
作者选择 WAM 的动机是合理的:视频模型天然携带时间和几何先验,未来 egocentric video 是比 sparse success label 更密的监督。但飞行场景不能承受 test-time future imagination 的成本和错误累积,所以他们转向 action-centered WAM:保留视频预测作为训练约束,部署时只输出动作。这是论文最清楚的技术缺口。
Core Idea
论文真正的核心不是“把 Wan 接到无人机上”,而是重新组织了 WAM 的信息流:未来视觉不再是部署时的中间规划结果,而是训练期约束 action distribution 的 dense label。动作 token 在 causal mask 下只能看历史视觉、状态、语言和动作自身,不能看未来帧;未来帧 token 则可以看动作,从而学习“动作导致的视觉后果”。这使得 action head 被迫和视觉 dynamics 对齐。
这个建模方式引入的 inductive bias 是:可执行动作应该位于那些能解释未来第一视角变化的轨迹分布上。相比直接 VLA,它多了一个视觉后果一致性约束;相比传统 world model,它不把未来视频生成放进控制闭环;相比 waypoint-based VLN,它把动作空间下沉到局部动态可执行轨迹。可扩展性主要来自复用大视频模型和大规模仿真/3DGS数据,而不是一个新的规划算法。
Method
关键机制可以压缩成四个。
第一,历史视觉条件化。它解决的是 egocentric 单帧不可观测问题:目标相对速度、相机运动趋势、遮挡风险和飞行方向都需要时间信息。实验中单帧失败明显,说明这里不是 minor ablation,而是任务成立的必要条件。
第二,action-centered WAM。训练时 action prediction 和 future-frame prediction 共享 video DiT 表示,但通过 mask 防止未来帧泄漏到动作。它的核心变化是把视频预测从 inference-time planning object 改成 representation regularizer。
第三,五阶局部轨迹 chunk。它解决的是动作可执行性和平滑性问题。模型不是输出低层电机控制,也不是输出高层 waypoint,而是输出局部轨迹端点、速度、加速度等参数,再交给轨迹控制器执行。这个动作空间本身已经注入了强动力学先验。
第四,self-guidance。它约束相邻 chunk 的重叠部分一致,主要解决 diffusion/flow chunk 独立采样导致的 temporal jitter。这个机制更像部署稳定性补丁,不是核心智能来源。
Key Insight / Why It Works
我认为最核心的有效性来源是 representation alignment,而不是“世界模型推理”。未来帧预测迫使模型把动作和视觉后果绑定起来,尤其适合第一视角飞行:动作一变,画面流立刻变。这个 dense supervision 比只模仿 action 更强,因为它约束了哪些动作在当前视觉上下文中是物理和几何上合理的。
第二个关键来源是动作空间的强先验。五阶局部轨迹 chunk 显著降低了学习难度:模型只需在一个已经平滑、局部、控制器可跟踪的参数空间里采样,而不是学习完整飞行动力学。很多“安全”和“稳定”能力可能来自这个 action parameterization + OM-MPC,而不完全来自 WAM。
第三,时间历史可能比 WAM 标签本身更重要。表格中最大跃迁来自 1 frame 到 9 frames,而不是不同 backbone 或 loss 的对比。也就是说,论文最强证据支持的是“飞行策略需要视觉历史”,而不是严格证明“future visual prediction 是不可替代的”。文中未充分说明去掉 visual loss、只保留相同 backbone 和 trajectory chunk imitation 的表现,因此 WAM 增益来源不清。
第四,数据覆盖是很大的隐性贡献。900K simulation clips、320M frames、Isaac + 3DGS + handheld real data,这很可能解释了相当一部分泛化和稳定性。这里可能主要来自 scaling / data,而不是模型结构本身。3DGS 分支提升多样性、Isaac 提升视觉真实性、DiffAero 保证动作可行,这套数据机器本身就是方法的一半。
第五,所谓语言能力看起来更接近 grounded retrieval / local servoing,而不是复杂 instruction reasoning。任务主要是 tracking、object reaching/searching,真实演示是“fly to the yellow foam mat”这类单阶段目标。没有证据表明模型形成了长期任务状态、子目标分解或失败恢复策略。
Relation To Prior Work
AeroAct 位于三条线的交汇处:aerial VLN/VLA、robot WAM、learning-based quadrotor control。和 aerial VLN 相比,它的本质差异是动作层级更低、更贴近控制可执行性;和 VLA-AN / OnFly 这类方法相比,它不是只把视觉语言表示接到动作头,而是用未来视觉后果约束动作学习;和 Dreamer/Genie/UniSim 这类 world model 相比,它不以 latent dynamics planning 为主,而是直接生成 deployable action chunk。
它与 GigaWorld-Policy、Fast-WAM 的关系最接近:都是 action-centered、试图避免 test-time video generation。AeroAct 的新增点主要不是 WAM 理论,而是把这套范式落到四旋翼飞行:egocentric fast-motion、局部轨迹动作空间、DiffAero/Isaac/3DGS 数据生成、真机闭环。换句话说,方法思想有明显继承,实质创新在 domain-specific action representation 和 data/control integration。
Dataset / Evaluation
数据覆盖了三类场景:仿真 tracking、仿真 object reaching/searching、handheld real-world adaptation。Isaac 和 3DGS 的组合是务实的:一个补视觉真实性,一个补场景/物体多样性;DiffAero 保证动作和动力学一致。这个数据设计比单纯收集视频或单纯仿真 VLN 更贴近 flight WAM 的监督需求。
评估支持了两个 claim:第一,历史视觉对闭环飞行非常关键;第二,action-centered WAM 输出可以被真机轨迹控制器执行。但它没有充分支持更强的 claim,比如 open-vocabulary aerial intelligence、长程语言规划、复杂动态环境泛化。仿真 episode 数量较小,真实实验是短室内轨迹,且依赖 motion capture / offboard inference。未见强 baseline:例如同等数据、同等 Wan backbone、无 visual consequence loss 的纯 action policy;因此 evaluation 对“WAM 机制本身”的归因不够干净。
Limitation
核心限制不是作者列出的“短室内轨迹”和“offboard inference”这么简单,而是能力边界尚未被真正压力测试。
第一,方法强依赖数据分布。目标类型、室内布局、相机运动、轨迹专家和渲染域如果变化较大,模型是否还能保持稳定未知。所谓泛化可能依赖 benchmark overlap 或仿真数据覆盖,而不是语义组合能力。
第二,planner 实际没有形成长期状态建模。9 帧历史约 2.4 秒,适合局部 servoing 和 target approach,但不足以处理多阶段指令、绕障恢复、目标重新搜索、策略级记忆。长程能力仍被转移给数据和闭环 replanning。
第三,动作可执行性部分来自轨迹参数化和控制器。模型输出的是局部轨迹 chunk,低层稳定性由 OM-MPC 承担。因此论文证明的是 WAM 可以生成有用的 trajectory references,不是证明 WAM 学会了完整四旋翼控制。
第四,visual consequence loss 的独立贡献文中未充分说明。没有足够 ablation 区分 video auxiliary supervision、temporal history、large-scale data、pretrained video backbone 和 trajectory action space 的作用。当前增益归因不清。
第五,推理延迟在真机中约 0.8s,对更高速、更拥挤或需要快速避障的飞行任务可能是硬上限。self-guidance 能减少 chunk discontinuity,但也可能在状态快速变化时延续过时动作。
Takeaway
- 最值得记住的不是“WAM 可以飞无人机”,而是:飞行 VLA 的关键动作接口不应是离散 action 或瞬时 velocity,而应是控制器可执行的局部轨迹分布。
- 未来 aerial foundation policy 很可能沿着 action-centered world model 演化:训练时用 dense sensory consequence 约束动作,部署时只输出低延迟控制参考。
- 这篇论文可迁移的 insight 是把 world modeling 从 inference-time imagination 改成 training-time regularization。
- 对于安全关键机器人,这比闭环里显式生成未来视频更现实。
一句话总结
AeroAct 是把 action-centered WAM 从桌面机器人迁移到四旋翼语言飞行的一次系统落地,真正贡献在于用未来第一视角视觉作为训练期后果监督来塑造可执行局部轨迹策略,而不是在于提出新的通用规划机制。
