精读笔记
Problem Setting
APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts(arXiv preprint / 2026)
这篇论文处理的是长时程机器人任务规划里语义规划和几何可行性之间的耦合问题。真正困难点不是让 VLM 输出 open/pick/place 这类动作,而是某个当前看似合理的放置决策会改变后续对象是否还能放进去、是否会碰撞、是否需要先清障,以及最终是否存在可执行布局。
以前的 LLM/VLM planner 大多把几何问题放在外部:先生成语义计划,再由 motion planner、feasibility checker、dynamics model 或 replanning loop 纠错。这能提高执行成功率,但 planner 本身仍然主要在语言空间里做推理。结果是模型可以知道“应该把碗放进冰箱”,却不稳定知道“现在这样放会不会挡住下一个更大的碗”。
这个任务的关键矛盾是:语言适合表达任务结构、前置条件和对象角色,但不适合压缩表达连续空间布局;视觉表示适合承载空间关系、形状和自由空间,但成本更高,也不是每一步都需要。APIVOT 试图解决的不是单纯的视觉 grounding,而是 planner 内部何时、如何把未来几何状态纳入决策。
Motivation
已有路线不够的原因在于它们通常把几何作为外部反馈,而不是作为生成计划时的内部状态。外部 verifier 可以告诉你计划失败,但它不会让模型在生成第一个放置动作时自然考虑下游空间约束。对于长时程任务,这种后验纠错会非常低效,并且很容易陷入局部可行、全局不可行的计划。
作者的核心观察是:不同推理步骤需要不同表示。语义前置条件、对象分类、任务分解用文本就够;容量、碰撞、剩余空间、未来可放置性更应该用视觉/空间表征。关键缺口不是“VLM 看不见图”,而是当前 VLM 缺少一种在 reasoning trace 内部生成并复用的未来视觉状态。
因此 APIVOT 的动机可以概括为:让 planner 在输出动作前先构造可被后续推理访问的 imagined future state,并学习只在几何敏感步骤触发这种表示。这里缺的是 modality-level abstraction selection,而不是更长的 chain-of-thought。
Core Idea
论文真正的核心思想是把视觉 thought 作为一种 latent planning state,而不是作为输入图像理解或外部 rollout 的结果。模型在推理 trace 中插入一段固定长度 visual tokens,这些 token 的 hidden states 被训练去对齐某个子目标完成后的真实未来图像编码。后续语言 token 和最终动作 token 可以 attend 到这些 hidden states,相当于 planner 在内部上下文中持有一个“如果我执行到这里,场景大概会变成什么样”的压缩表示。
这个建模方式改变了信息流:prior 的典型路径是 observation -> text reasoning -> plan -> verifier/simulator -> replan;APIVOT 的路径更接近 observation -> interleaved language/future-visual latent states -> plan。几何信息不再只是计划后的失败信号,而是生成计划时的条件变量。
它引入的 inductive bias 是:语义结构用语言链组织,空间后果用视觉 latent state 组织,并且两者在同一个 autoregressive context 内交替出现。这比纯文本 CoT 更适合表达高维空间布局;比 always-image 或外部 rollout 更可控,因为模型可以学习在约束紧的时候才调用视觉 thought。若这个假设成立,它比外部 verifier 更 scalable 的地方在于几何推理成本被内化并可选择性分配,而不是每个候选计划都做昂贵验证。
Method
APIVOT 的方法本质上有三个机制。
第一,reference trace construction 解决的是监督信号缺失问题。作者从 simulator 中的成功轨迹出发,把动作序列拆成子目标,并给每个子目标标注约束类型、用途和是否需要视觉 thought。这一步不是普通数据整理,而是在给模型提供“何时需要几何抽象”的 teacher signal。没有这个信号,模型很难仅从最终成功计划中学会模态选择。
第二,visual alignment 解决的是 visual thought 不能只成为空占位符的问题。visual thought 在文本序列里表现为特殊 image tokens,但真正承载信息的是这些 token 对应的 decoder hidden states。作者用冻结视觉编码器提取未来 ground-truth observation 的特征,并用 cosine loss 对齐 hidden states。这使 visual thought 至少被约束为未来状态的视觉特征近似,而不是任意 latent scratchpad。
第三,三阶段 curriculum 解决的是学习顺序问题。先让模型在给定真实视觉 latent 的情况下学习如何利用它规划,再让模型学习自己生成这种 latent,最后才学习什么时候不用它。这个顺序是合理的:如果一开始同时要求生成、使用和选择,credit assignment 会混在一起。这里 curriculum 很可能是方法能稳定工作的关键工程条件,而不是可有可无的训练 recipe。
需要注意的是,closed-loop receding horizon 也很重要。APIVOT 每步只执行计划的第一个动作,再基于新 observation 重规划。这减轻了长期开放环预测压力,也让 visual thought 更像局部未来状态辅助,而不是完整长期世界模型。
Key Insight / Why It Works
我认为这篇最核心的有效性来自 representation alignment + abstraction selection,而不是单纯更强 VLM 或更长推理。纯语言 trace 在空间约束任务里需要把二维/三维几何关系离散化成文本描述,这既冗长又容易丢失连续信息。visual thought 提供的是一种压缩的空间 memory,后续动作生成可以直接利用其 latent features,而不必把“剩余空间形状”翻译成语言。
最可能的核心贡献是把 future-state representation 放进 planner 的 autoregressive context。它和普通 VLM 看当前图不同:当前图只告诉你现在有什么,future visual thought 试图表达某个子目标后的状态,从而影响后续规划。这一点针对的是 downward refinability failure:早期高层选择局部可行,但导致后续连续参数不可行。APIVOT 的 visual thought 正是在早期放置时提供对后续可行性的隐式检查。
第二个关键点是 adaptive modality selection。Always-image 性能更高但成本大,text-only 成本低但几何弱,APIVOT 试图学习一个中间策略。这个策略如果真的由约束触发,就说明模型学到了一种 task-conditioned computation allocation。实验中有限自由空间和下游可行性步骤更常触发 visual thought,支持这个方向,但这也可能主要来自 heuristic-labeled SFT,而非自主发现。
哪些部分可能只是辅助:LoRA、具体 K=16 visual tokens、Qwen3-VL backbone、token budget 对比形式都不是本质创新。三阶段训练虽然重要,但更像让 latent visual planning 可训练的工程支架。真正值得迁移的是“中间推理表示不必全是语言;不同决策应使用不同抽象层级”。
哪些地方可能主要来自 data / scaling:reference plans 来自 PDDLStream/FastDownward,modality labels 来自 simulator geometric heuristics,future images 来自 replay。模型学到的很可能是强监督下的 geometric pattern imitation,而不是从交互中学出的规划能力。尤其是 adaptive 策略的监督本身已经编码了何时用图,因此把它解释为 emergent modality selection 要谨慎。
增益归因仍不完全干净。Text-only SFT 控制了一部分 domain finetuning,但没有完全排除 visual trace 数据本身带来的更强 supervision、future observation alignment 的 oracle 信息、以及 closed-loop execution 对错误恢复的贡献。Oracle visual thought 仍明显更强,说明当前瓶颈在生成的未来视觉 latent 质量。
Relation To Prior Work
APIVOT 最接近三条谱系:LLM/VLM task planning、TAMP/VLM-TAMP 类外部几何验证、以及 multimodal CoT / latent visual reasoning。它不是从零提出“视觉中间推理”,也不是第一个让模型生成视觉 token;真正的区别是把 latent visual reasoning 放到长时程机器人高层规划里,并让它对应未来子目标状态。
相对 SayCan、Inner Monologue、ProgPrompt、Code-as-Policies 这类语言 planner,APIVOT 的差异在于它不把空间可行性压成语言 affordance 或 textual critique,而是引入视觉 latent 作为中间规划变量。相对 VLM-TAMP、Reflect-VLM、LLM3、CoPAL 等外部 verifier/replanner,APIVOT 的差异在于几何反馈不是计划后才出现,而是在生成计划前进入内部上下文。
相对 CoT-VLA、Embodied CoT、BagelVLA 等 VLA/embodied reasoning 方法,APIVOT 更偏 high-level planning 而非低层动作策略。它预测的是 open/pick/place 及放置点,不是端到端控制。这个定位很重要:论文的贡献不在 robot policy learning,而在 planner-level representation design。
看似新的部分中,curriculum SFT、用 expert trajectory 生成 reasoning trace、用 simulator heuristic 标注模态,其实都是已有思想的重组。实质创新是把“未来视觉状态作为可 attend 的 latent thought”与“按约束选择模态”结合到一个规划 trace 中,并在实验上显示这种信息组织方式优于纯文本或外部规划基线。
Dataset / Evaluation
评估集中在 KitchenWorlds 模拟器中的 Containment、Sorting 和 held-out Storing Leftovers。任务设计覆盖了语义前置条件、容量约束、障碍清除、有限自由空间、排序后再存储等组合结构,确实对“语义 + 几何耦合”这个 claim 有针对性。held-out Storing Leftovers 也提供了一定组合泛化证据。
但 evaluation 的边界很清楚:没有真实世界,没有视觉真实感很强的模拟器,没有感知噪声主导的设置。对象检测列表和图像空间中心点直接提供给模型,规划和感知被刻意解耦。这有利于验证 planner 表征,但不能证明真实机器人系统端到端可用。
benchmark 支持“在这个受控模拟分布中,interleaved visual thoughts 提升几何受限规划”这个 claim;不充分支持“泛化到开放世界长时程机器人规划”。OOD 结果显示 APIVOT 仍有竞争力,但 ID-OOD drop 也较大,特别是物体更多、布局更密时 visual thought 需要编码更复杂状态,当前监督覆盖开始吃紧。
另一个 evaluation limitation 是成功轨迹、约束标签和视觉 thought target 都来自同一 simulator 管线。训练和评估虽然实例 held-out,但任务生成机制、动作空间、几何 heuristic 与 benchmark failure mode 高度同源。因此不能排除模型主要学到了 benchmark-specific geometric priors。
Limitation
第一个根本限制是 oracle supervision 依赖很重。APIVOT 需要成功 demonstrations、PDDLStream 生成的可行轨迹、未来状态渲染图、几何 tightness heuristic 和模态标签。真实场景中这些信号很难获得。方法把一部分规划难题转移成了“如何为视觉 thought 提供高质量未来状态监督”。
第二,所谓 visual thought 未必等价于可组合世界模型。它被对齐到未来图像 encoder features,但没有显式保证物体身份、接触关系、可达性、遮挡、动力学约束或不确定性被正确建模。它可能只是训练分布内对 placement outcome 的 latent regression。文中未充分说明这些 visual thoughts 在分布外是否保留可解释、可组合、可迭代的状态语义。
第三,adaptive modality selection 是监督学出来的,不是由任务成功或计算成本优化出来的。低 visual-thought rate 下出现使用崩塌,说明策略很依赖标注密度和 curriculum。这个现象反过来表明所谓“学会何时看图”还不够稳健,更像模仿 heuristic policy。
第四,planner 可能没有真正形成长期状态建模。由于采用 receding horizon,每次只执行首个动作后重新观察,系统可以通过闭环纠错减少长期预测要求。这是合理工程选择,但也意味着论文对 long-horizon internal planning 的证明有限:它更像局部未来状态辅助的闭环高层 planner,而不是完整长期 imagination planner。
第五,增益来源不清。APIVOT 同时改变了数据、训练目标、中间表示、推理格式和模态预算。虽然 ablation 做得不少,但仍难完全分离 representation alignment、future-state oracle、heuristic trace、curriculum 和 domain-specific SFT 的贡献。核心能力可能主要来自数据覆盖与 simulator-derived latent supervision。
Takeaway
- 最值得记住的第一点:对于具身规划,chain-of-thought 不应该默认是纯语言。
- 空间约束不是语言推理的弱版本,而是需要不同表示承载的信息类型。
- 第二点:future-state latent representation 是比 post-hoc verifier 更有潜力的方向。
- 真正有价值的不是让模型“看更多图”,而是让它在生成决策前持有可被后续推理访问的未来状态。
一句话总结
APIVOT 是一篇把 multimodal latent CoT 推进到机器人高层规划中的工作,真正贡献在于把未来视觉状态作为 planner 内部中间变量并学习选择性调用,但当前能力很大程度仍建立在 simulator 监督和数据覆盖之上。
