精读笔记
Problem Setting
Traj-VLN: Learning Pixel-Space Interaction via Autoregressive Trajectory Generation(arXiv preprint / 2026)。这篇论文解决的不是 VLN-CE 的完整规划问题,而是 VLM fine-tuning 时监督信号应该落在哪里的问题。已有 VLM-based VLN 通常在两端摇摆:要么直接预测离散动作/action chunk,要么引入 depth、RGB-D、3D prior 来补足空间能力。前者的问题是动作序列对 VLM 来说语义弱、分布外、局部误差累积严重;后者的问题是 3D 表示并不是通用 VLM 预训练时熟悉的输入空间,往往需要额外 encoder/alignment,收益不稳定。
真正困难点在于,VLN 指令描述的是一连串空间交互过程,例如绕过物体、穿过门、沿通道前进,而不是一个静态识别目标。单个 pixel-goal 虽然比低层动作更接近 VLM 的图像 grounding 能力,但它仍然把“过程”压缩成一个端点。这里的关键矛盾是:执行需要连续几何,学习却最好发生在 VLM 熟悉的 2D 图文空间;论文的主张是把 3D 轨迹投影成 2D 像素轨迹,用过程监督替代单点监督。
Motivation
已有路线不够的原因不只是“VLM 不懂 3D”。更准确地说,VLM 的视觉 encoder 和语言 decoder 对 RGB 图像区域、文本坐标、局部关系有较强 prior,但对机器人低层动作、depth token、显式 3D geometry 的使用没有足够预训练经验。因此把 VLN 直接建模为 action prediction,会让模型学习一个与预训练分布错位的接口;把 depth/3D 强塞进 VLM,则需要额外对齐,且不保证模型真的学会使用几何。
作者抓住的缺口是:pixel-goal 证明了“落到图像平面”是有效方向,但它没有监督中间交互过程。一个最终点可能由数据分布猜出来,也可能由局部 affordance 记忆出来,并不要求模型理解“从近到远如何穿过可通行区域”。所以论文选择监督一串 2D 坐标,让模型在熟悉的像素空间里学习导航过程的投影。这不是补充更多传感器,而是改变监督粒度。
Core Idea
核心思想是把 VLN 的 3D trajectory planning 改写成 image-plane trajectory generation。模型给定 instruction、历史观测和当前观测后,不直接预测 primitive action,也不只预测一个目标像素,而是自回归生成一串规范化像素坐标,从图像底部中心附近向远处画出一条可执行路径。最终执行时再用 depth 将这些像素点反投影为 3D waypoint。
这个改变引入了一个很强的 inductive bias:导航被表示为“图像区域上的连续交互序列”。这比 action chunk 更贴近 VLM 的视觉 grounding 能力,也比 pixel-goal 更有过程结构。和 prior 的本质区别在于,它不是问模型“终点在哪里”,而是让模型生成一条从当前位置到目标方向的中间路径;信息流从 endpoint classification/regression 变成 sequential grounding。理论上它更 scalable 的原因是轨迹 token 仍是文本坐标,能复用 LLM 的自回归建模能力,而不需要训练一个新的几何 planner 或 3D encoder。
Method
方法层面真正必要的机制只有几个。
第一,未来 pose 到当前 overhead image 的投影。它解决的是监督信号构造问题:把专家轨迹从 simulator/数据集里的 3D pose 序列转成 VLM 可生成的 2D coordinate string。这里的核心变化是监督从稀疏端点变成密集路径,模型每次训练看到的不只是“去哪”,还包括“沿哪些可见区域过去”。
第二,turn/STOP 与 forward trajectory 的分离。第一阶段只输出左转、右转、向前触发或停止;当输出向前符号后才进入第二阶段生成 overhead image 上的轨迹。这解决的是动作模式混杂问题:转向主要是视角选择,前进才需要路径形状。这个分解让 VLM 不必在同一个输出空间里同时处理姿态调整、停止判断和连续路径生成。
第三,自回归坐标生成。它的作用不是为了更复杂的 decoding,而是把轨迹中的中间点变成条件上下文,使后续点依赖前序点。这个机制提供了一种弱形式的过程建模,类似显式中间变量;是否真的构成 reasoning 仍需谨慎,但它确实改变了训练目标的因果结构。
第四,执行时用 depth 反投影。论文表面上绕开了让 VLM 学 3D,但系统并没有摆脱几何;depth 被推迟到 control interface 使用。也就是说,几何依赖从 representation learning 转移到了 post-processing/execution。
Key Insight / Why It Works
最可能有效的核心不是“VLM 学会了 3D 推理”,而是 supervision alignment。VLM 预训练时习惯的是 RGB 图像、区域关系、文本序列和局部视觉 grounding;把导航动作写成像素坐标序列,比让它预测 move-forward/turn-left chunk 更接近其原生建模空间。这是 representation alignment,而不是几何能力的凭空涌现。
第二个有效来源是 dense process supervision。单个 pixel-goal 给每个状态一个终点标签,而轨迹给出多个中间点,相当于在图像平面上提供了一条弱可达性/affordance 曲线。模型不需要完整构建 3D map,也可以学习“通道中心线”“绕障方向”“门口穿越路径”等数据驱动模式。这个贡献比论文中 CoT 的说法更实在。
第三个来源可能是 test-time compute 和 re-planning frequency。论文发现执行更少 waypoint、增加重新推理次数会提升 SR,这说明性能并不完全来自一次性长程轨迹规划,而部分来自频繁闭环修正。换句话说,Traj-VLN 的强点可能是短程 pixel affordance + 高频重规划,而不是长程全局 planning。
第四,所谓 Traj-CoT 需要降温理解。把最终轨迹点当 pixel-goal 更好,确实说明中间轨迹监督改善了端点预测;但这不证明模型进行了可解释的空间推理。更可能的机制是:中间坐标作为训练时的 latent structure,使模型学到更平滑、更受可通行区域约束的目标分布。它像 curriculum / structured supervision,而不是语言 CoT 那种显式推理链。
可能只是辅助或 engineering 的部分包括:更新 backbone 到 Qwen3-VL、冻结 vision encoder 节省训练、历史帧均匀采样、具体 chat template、坐标格式。这些会影响最终数值,但不是论文的本质贡献。SOTA 表中的部分增益来源不清,因为不同方法的 backbone、训练样本、视觉 encoder 冻结状态并不完全可比。
Relation To Prior Work
这篇最接近 InternVLA-N1 和 Goal2Pixel 这条 pixel-grounded VLN 路线,而不是 NaVid/NaVILA 那种 action prediction 路线,也不是 JanusVLN/NaVid-4D 那种显式补 3D/depth 的路线。它的谱系可以概括为:action supervision → pixel-goal supervision → pixel-trajectory supervision。
和 pixel-goal 方法的本质差异是监督对象从 endpoint 变成 path。Goal2Pixel 已经说明“目标落到像素上”比动作更合适;Traj-VLN 进一步说“只给目标不够,过程也要落到像素上”。这是真正新增的信息:中间 waypoint 作为结构化监督,编码了可通行区域与语言子任务的局部展开。
和 3D-enhanced VLM 方法相比,Traj-VLN 的差异不是完全不用 3D,而是不让 VLM 直接学习 3D 表示。它把 3D 轨迹压缩成 2D projection 供 VLM 学,再在执行时用 depth 还原。这是一种接口设计创新:把几何从模型内部移到监督生成和控制后端。
看似新的部分中,“坐标作为文本生成”“自回归输出中间点”“final point 作为 goal”都可看作已有 grounding 与 chain-of-thought 思想的重组;实质创新在于把这些组合成 VLN-CE 的过程级监督范式,并通过同设置对比显示 trajectory supervision 比 pixel-goal 更有效。
Dataset / Evaluation
训练和评估主要围绕 R2R-CE、RxR-CE 与 ScaleVLN 派生数据,覆盖的是室内模拟环境中的语言导航,具有跨 unseen scene 的 benchmark 意义,但仍是标准 Habitat/Matterport 风格分布。任务覆盖没有扩展到更开放的 household manipulation、动态场景或真实长程部署;真实世界结果在给定正文中证据不足,不能支撑强 sim-to-real claim。
最有价值的 evaluation 是 Table II:同 backbone、同数据、同 LoRA 设置下比较 pixel-goal 和 trajectory supervision。这部分较干净地支持“轨迹监督优于单点监督”。尤其 final-pixel evaluation 更强,因为它排除了“执行完整轨迹本身带来额外控制收益”的一部分影响,说明训练时的过程监督会改善端点预测。
SOTA 对比支持的 claim 要弱一些。Traj-VLN 在相近训练规模下表现强,但与 InternVLA-N1、Goal2Pixel、JanusVLN 等比较时存在 backbone 代际、训练样本数量、vision encoder 冻结/解冻、数据构造策略等差异。不能从这些表直接得出 trajectory supervision 是全部增益来源。benchmark 也更验证短程闭环 VLN 能力,而不是开放世界空间推理。
Limitation
最大隐含前提是:专家未来 pose 可以可靠投影到当前视角,且这些投影轨迹在图像上足够可见、可学、可执行。这个前提在模拟数据里成立,在真实机器人里会受到深度噪声、相机姿态误差、遮挡、动态障碍、地面非平面、机器人 footprint 等因素影响。方法把一部分 3D 难题转移到了数据生成和执行反投影,而不是消除了它。
第二,长期状态建模仍然薄弱。历史图像只是均匀采样输入,轨迹生成主要发生在当前 overhead view 上。模型更像在做局部 affordance prediction + instruction-conditioned re-planning,而不是维护一个稳定的长期地图或任务状态。对于需要跨房间记忆、回溯、处理不可见目标的任务,上限不清。
第三,所谓 reasoning 可能主要来自数据覆盖。轨迹监督会让模型学到常见室内布局中的路径先验,这在 R2R/RxR/ScaleVLN 分布内非常有效;但如果遇到 out-of-distribution layout、非典型障碍、语言表达偏移,模型是否真的能组合式泛化,文中未充分说明。所谓 CoT 更像 supervised latent path,不应过度解释为 emergent spatial reasoning。
第四,增益归因不完全清楚。轨迹标签相比 pixel-goal 带来更多 token、更密集 loss、更长输出、更强正则,也可能改变 decoding 和 re-planning 行为。文中没有充分消融轨迹点数量、坐标噪声、随机中间点、只训练 final point 但增加 token budget 等控制项,因此无法排除部分收益来自 training signal density 或 optimization,而非 trajectory semantics。
第五,执行依赖 depth map。论文批评 VLM 直接使用 depth/3D 不自然,但系统执行仍需要 depth 将像素点变成 3D waypoint。这是合理工程选择,但意味着方法不是纯 RGB VLN,也限制了在无可靠深度传感器场景中的适用性。
Takeaway
- 第一,VLM-based embodied navigation 的关键可能不是继续往模型里塞 3D,而是设计更贴合 VLM 预训练分布的 action interface。
- Traj-VLN 的价值在于证明“过程级 pixel supervision”比“端点级 pixel supervision”更有训练信号。
- 第二,轨迹可以作为一种中间 latent structure,用来约束模型的目标预测分布。
- 这一 insight 可迁移到 manipulation、driving、UI automation 等任务:不要只监督 final target,监督 image-space interaction trace 可能更有效。
一句话总结
Traj-VLN 是 pixel-grounded VLN 从“预测目标点”走向“生成交互轨迹”的一次监督范式推进,真正贡献在于用 2D 自回归轨迹把 VLM 的图文 grounding prior 转化为局部导航过程建模,而不是证明 VLM 已经具备完整 3D 空间推理能力。
