精读笔记
Problem Setting
这篇论文真正处理的是端到端自动驾驶模型的“决策表征不可审计”问题,而不是一般意义上的可解释性。现代 planner 往往把 perception、prediction、planning 和 scoring 压进一个大模型,最终输出多个 candidate trajectories 及其质量分数。问题在于:当模型选错轨迹时,我们不知道错误来自哪里,是看错了前车、错误理解车道、过度追求 progress,还是某个训练数据相关性污染了 traffic-light / collision head。
真正困难点是端到端 planner 的 latent space 同时编码场景、ego state、trajectory proposal 和 scoring-relevant information,而且这些信息高度纠缠。传统模块化系统至少有 perception / prediction / planning 的接口可以分别测试;端到端模型没有这样的 natural boundary。以前的 saliency、attention 或输入扰动方法最多说明输入区域重要,但不能把内部表征拆成“前车”“左转黄线”“交叉口”“保守/激进 progress bias”这类可追踪因素,更不能说明这些因素分别如何影响 collision、drivable area、traffic light compliance 等 scoring components。
关键矛盾是:端到端模型性能来自表征融合,但可验证性需要表征可分解。论文的切入点就是在不重训原模型的前提下,寻找一个足够靠近决策头、又仍可被语义化分解的 latent bottleneck。
Motivation
已有解释路线不够的原因很直接:它们解释输入显著性,而不是解释 decision logic。自动驾驶里“看见某个物体”不是最终问题,关键是模型如何把这个物体转化为 trajectory ranking。比如前方车辆可能影响 collision head、progress head、lane-keeping head,甚至由于数据共现影响 traffic-light compliance head。单张 heatmap 无法表达这种多头、多目标、proposal-dependent 的作用结构。
作者的核心观察是,当前 trajectory-scoring planner 本身已经提供了一个适合解释的结构:每个 candidate trajectory 在进入 scoring head 前都有一个压缩 latent 表示,而 scoring head 往往预测 PDM 或 PDM 子分数。如果在这里加入 SAE,就可以把“场景理解到分数”的黑箱路径改写成“场景/轨迹 latent -> 稀疏概念 -> 子分数”的可审计路径。
关键缺口不是缺一个新的 driving model,而是缺一个 post hoc、model-agnostic-ish、能连接 internal concept 与 downstream score 的工具。论文试图证明 interpretability 不只是事后可视化,而可以成为模型调试和 inference-time control 的接口。
Core Idea
核心思想是把 planner 决策前的 dense latent 表示重参数化为稀疏概念坐标。SAE 在冻结模型的 latent activations 上学习一个 overcomplete dictionary,使原始 latent 可以由少量 dictionary atoms 重构。直觉上,如果原模型 latent 中存在可线性组合的 driving factors,稀疏约束会迫使这些 factors 分离到不同 neuron 上,从而把原本纠缠的表征变成可命名、可归因、可编辑的概念基。
这改变的不是 planner 架构本身,而是分析和干预的建模方式:不再把模型解释为 input pixels 到 output trajectory 的端到端映射,而是把决策拆成 latent concepts 对不同 score heads 的贡献。新的 inductive bias 是稀疏性和局部可编辑性:一次决策应该由少量概念驱动,而错误行为可能对应少数可抑制的 concept directions。
和 prior 的本质区别在于它不是只做 saliency,也不是设计一个天然可解释的 driving architecture,而是在已有 SOTA planner 的内部插入一个 post hoc concept layer,并进一步把 concept 与 PDM 子目标建立可干预连接。这使方法理论上更容易迁移到不同端到端模型,只要模型存在合适的 trajectory-level latent 和可访问 scoring heads。
Method
方法里最关键的是 latent 选择。作者选择 scoring module 前、每个 trajectory proposal 对应的 1D latent,因为这里已经聚合了输入信息,又直接决定 trajectory score。这个位置比早期 vision feature 更接近决策,比最终 score 更有结构;如果概念解释发生在这里,就能避免只解释 perception 而解释不到 planning。
第二个机制是 SAE 分解。TopK SAE 用稀疏激活重构原 latent,目标是在尽量保持原模型行为的同时获得更可分离的 concept coordinates。这里 SAE 不是为了提高表征能力,而是为了制造一个可读、可控的中间坐标系。reanimation / dead neuron 控制等只是让 dictionary 更可用,核心不在这些工程细节。
第三个机制是语义赋值。作者用 activation maximization、neuron clustering 和 CRP attribution 给 SAE neurons 或 neuron clusters 命名。重要点不是 heatmap 本身,而是把“某个 neuron 在哪些场景触发”和“它对最终 selected trajectory 的 relevance”区分开:高 activation 表示概念存在,高 attribution 才表示该概念被用于当前决策。
第四个机制是 concept-to-head linking。通过 attribution patching、activation patching 和稀疏 circuit pruning,作者估计 SAE neurons 对 PDM 子头的影响。这个步骤把解释从“模型有某概念”推进到“该概念如何改变 collision / progress / compliance 的打分”。
最后是 concept-level intervention:对被判定为有害或 spurious 的 neurons 做 zero-ablation,再用客观评价器评估轨迹。这个机制的意义在于把 interpretability 变成 test-time model editing,而不是只生成诊断图。
Key Insight / Why It Works
这篇论文最有价值的 insight 是:端到端 driving planner 的错误不一定需要通过数据重采样或整体重训来修,可以先在决策前 latent 中寻找少数支配 scoring bias 的 concept directions。若这些 directions 对多个 penalty / compliance heads 产生系统性负面影响,那么抑制它们可能直接改变 trajectory ranking。
方法有效的根本原因更像 representation alignment,而不是更强 planning。SAE 把 planner 已经学到的 latent structure 投影到稀疏坐标里;如果原 latent 中确实存在稳定的驾驶因素,SAE 会让这些因素更容易被发现和编辑。性能提升来自对已有模型决策边界的局部重塑,而不是新增环境理解能力。
最可能的核心贡献是“concept layer + score-head circuit + intervention”这一闭环。单独训练 SAE 或做 neuron visualization 并不新;真正有用的是把 SAE neuron 映射到 trajectory scoring heads,并用这个映射指导 ablation。这个闭环使解释具备可检验性:如果删掉某个概念后行为系统性改变,说明它至少在模型内部具有功能作用。
但需要直说:最终性能提升很可能有相当部分来自风险偏好校准,而不是精确 causal repair。ablation 后 ego progress 下降,drivable-area 和 direction compliance 上升,说明模型变保守了。NAVSIM / EPDMS 可能奖励这种保守性,因此 gain 不必然证明发现了“错误概念”,也可能只是删掉了促进激进 progress 的 latent factors。增益来源不清。
这不是 scaling 论文,也不是 data coverage 论文;它主要依赖 latent structure 和 post hoc representation editing。辅助成分包括 CRP 可视化、clustering、SAE variants 对比等,但这些更多是让概念命名更方便。真正决定上限的是 SAE neuron 是否 monosemantic、所选 latent 是否线性可分、以及 scoring heads 是否给了足够清晰的监督结构。
Relation To Prior Work
这篇工作属于 mechanistic interpretability / dictionary learning 向自动驾驶 planner 的迁移,而不是自动驾驶模型结构创新。它最接近三条路线:SAE monosemantic feature decomposition、concept relevance / CRP、以及 sparse feature circuits。论文的新意在于把这些工具落到 trajectory-scoring planner,并围绕 PDM 子分数构建解释和编辑流程。
相对 saliency / attention,它的本质差异是解释对象从 input focus 变成 latent concept 和 score causality。saliency 只能回答图像哪里影响输出;这里试图回答某个 learned concept 如何影响具体 driving objective。对自动驾驶来说,这是更接近 debug 的粒度。
相对可解释架构设计,例如显式中间语义图、BEV affordance 或模块化 planner,它不要求重新设计模型,也不强迫 latent 对齐到人工定义的 perception labels。优点是 post hoc 和较通用,缺点是语义质量不可保证,解释仍需人工验证。
相对 LLM 中的 SAE / circuit 工作,这篇并没有提出新的 dictionary learning 原理,更多是已有思想的 domain transfer。实质创新在于选择 trajectory-level latent 作为解释层,并把 SAE concepts 与 multi-head PDM scoring 连接起来。这个 domain-specific connection 比 SAE 本身更重要。
Dataset / Evaluation
实验主要围绕 NAVSIM、GTRS 和 iPAD 这类开放环或 pseudo-simulation benchmark。覆盖了 trajectory scoring、PDM 子指标、部分跨模型分析,以及针对 selected neurons 的 intervention。它能验证的核心 claim 是:在这些模型和数据上,SAE concepts 可以被提取、部分语义化,并能通过 ablation 改变 benchmark score。
但 evaluation 没有充分证明真实部署意义上的安全改进。NAVSIM 的 EPDMS 是离线评价器,不能替代闭环交互、长时序恢复能力、rare event robustness 或真实交通参与者反应。ablation 让模型更保守,在离线 benchmark 上可能受益,但在真实驾驶中可能引入犹豫、阻塞、低效率或交互失败。
跨场景泛化证据也有限。文中展示了 SAE 参数选择、概念可视化、单场景分析和少量 neuron ablation 的 aggregate gain,但没有充分说明这些 neurons 在不同城市、天气、传感器配置、训练 seed、模型版本中的稳定性。benchmark 是否真正验证了“causal concept understanding”这个强 claim,还不够。
一个值得注意的观察是 backward camera 在 iPAD 上似乎没有梯度贡献。这说明框架能发现模型利用输入的缺失,但也反过来暴露 NAVSIM-style 数据和训练目标可能不足以迫使模型使用所有传感器。
Limitation
第一,SAE concept 的语义不是自动保证的。论文依赖 activation maximization、clustering 和 attribution 来命名 neurons,但这些证据可能混合了场景共现、时间片、颜色、道路布局、ego command 和 benchmark-specific artifacts。文中未充分说明概念命名的一致性和可复现性。
第二,所谓因果主要是模型内部局部干预意义上的因果。zero-ablation 改变输出不等于该 concept 是真实世界 causal factor。比如“前车”影响 traffic-light compliance,很可能是数据共现;作者也承认这类相关性不具备真实因果。方法能够揭示这种问题,但未必能系统修复它。
第三,性能增益归因不清。删掉三个 neurons 后 EPDMS 提升,但同时 progress 明显下降,这更像将 planner 从激进策略推向保守策略。这个变化在 benchmark 上更好,不代表在真实交通中更优。若评价器偏好低风险、短视合规,ablation 可能只是利用 metric bias。
第四,scalability 上限取决于人工 concept auditing。论文展示了若干可解释 cluster 和 selected neurons,但如果要部署到大模型、大数据、多城市、多任务,需要自动发现、验证和版本化 concepts。否则 SAE 只是高维 debug interface,把原来的黑箱问题转移成“哪些 neurons 可信”的问题。
第五,方法依赖模型结构。GTRS 有分离的 PDM 子头,因此特别适合 head-level attribution;iPAD 这类整体 score 模型可解释性会弱一些。若未来 planner 不输出可分解子分数,concept-to-objective mapping 会更难。
第六,长期 planning / interaction reasoning 没有被真正验证。这里的概念多是局部场景和短时轨迹 scoring 因素,不足以证明模型形成了长期状态建模或交互推理。所谓 reasoning 更可能是 latent retrieval 和 score calibration。
Takeaway
- 最值得记住的不是 SAE 用在自动驾驶上,而是解释层应该放在 planner 决策前、trajectory proposal 相关的 latent 上;这个位置比输入 saliency 更接近真实失败机制。
- 端到端自动驾驶的可解释性需要从“看哪里”转向“什么 latent factor 改变了哪个 objective”。
- 多头 score decomposition 对 interpretability 很有价值,未来模型设计应保留或显式构造可审计的 objective heads。
- Concept-level intervention 是一个有潜力的 debugging / deployment-time control 工具,但必须和严格的 distributional validation 绑定。
一句话总结
这篇论文把 SAE-based mechanistic interpretability 接到端到端自动驾驶 trajectory scoring 的决策前 latent 上,真正贡献是把概念发现、score-head attribution 和 test-time editing 连成闭环,属于从输入级解释走向 latent concept-level model debugging 的方法演化。
