精读笔记
Problem Setting
论文标题:Dynamical Optimal Transport with so(d)-Invariance: From Theory to Computation(arXiv preprint / 2026)。
这篇论文实际处理的是 quotient OT 的动态实现问题:给定两个概率测度,如果它们只差一个环境刚体运动,普通 W2/BB 仍然给正成本;Procrustes-Wasserstein 可以在静态端点上消掉这部分,但没有一个对应的 Benamou-Brenier 动态解释。
困难不在于“加一个旋转变量”本身,而在于刚体运动同时是连续性方程里的真实速度,又应该是 action 里的零成本方向。也就是说,质量路径仍由总速度 V+Ex+C 推动,但代价只应计算非刚体 deformation V。这会立即带来退化:E,C 不是唯一的,某些密度下甚至完全不可辨识。以前的静态 PW 方法绕开了这个问题;本文选择正面处理这个 quotient tangent geometry。
Motivation
已有路线的缺口很明确:静态 PW 能表达 invariance,但它把几何对齐放在 coupling 层面,无法解释中间路径,也不能自然导出 BB/PDE 形式的 optimality conditions。controlled OT 文献虽然允许控制进入动力学,但通常不是为了 quotient out Euclidean group,也没有把 rigid motion 当作零成本 gauge direction。
作者的核心观察是:如果 invariance 是 Wasserstein space 上群作用的 quotient,那么它应该首先出现在 tangent norm 里,而不是只出现在 endpoint objective 里。换句话说,旋转和平移不是要被“学习成 transport”,而是应从 transport cost 中投影掉。这个观察使得 static Procrustes alignment、dynamic BB flow、Gaussian closed form 和数值 saddle solver 可以落在同一个数学对象上。
Core Idea
核心思想是重定义 BB kinetic energy:总速度写成 V(x)+Ex+C,其中 Ex+C 是 infinitesimal Euclidean motion,V 是真正的 deformation。连续性方程使用总速度,action 只惩罚 V。等价地,在每个测度 mu 的 L^2_mu 速度空间中,把 rigid velocity subspace R_mu = {Ex+C} 投影掉,只计算正交补上的能量。
这改变的是建模层级。prior 静态 PW 是“先找一个全局对齐,再做 OT”;本文的 MBB 是“在动态过程中允许全局刚体 gauge 自由移动,但只为非刚体部分付费”。这给模型引入了很强的 inductive bias:如果差异能由全局 Euclidean motion 解释,就不要让 transport field 去用剪切、扩散或复杂 potential flow 近似它。理论上它有效,是因为 rigid flow pullback 可以把含刚体漂移的连续性方程变成普通 BB 问题,从而把 MBB 的最优值精确还原为静态 Procrustes-Wasserstein。
Method
第一,定义刚体速度子空间与 MBB seminorm。它解决的是“零成本方向如何在 tangent space 中表示”的问题。R_mu 是 L^2_mu 中有限维闭子空间,因此可以做正交分解;MBB norm 就是把候选速度对 R_mu 做 projection 后的最小能量。核心变化是 BB norm 变成 quotient seminorm,kernel 正是 infinitesimal rigid motions。
第二,证明 dynamic-static equivalence。通过由 E,C 生成的 rigid flow g_t,把原路径 pull back:含 V+Ex+C 的连续性方程变为只含变形速度的普通连续性方程,能量保持不变。因此 MBB 等于 inf_{(Q,b) in SE(d)} W2^2(mu0,(Q,b)#mu1)。translation 可由均值显式消去,full O(d) 通过 reflection branch 补齐。
第三,Gaussian closed form。对 Gaussian,PW distance 只依赖协方差特征值谱:距离等于 ordered eigenvalues 的平方根向量之间的欧氏距离。这里真正消掉的是 covariance eigenbasis 的方向信息,只保留 shape spectrum。这是 quotient geometry 在 Gaussian 子流形上的一个非常干净的表现。
第四,计算框架。把问题写成 density-momentum saddle problem,固定 E 后是 convex-concave 的 BB-like saddle;外层用 skew field 的 proximal update。这个设计不是为了全局优化优雅性,而是为了在退化 E 方向上有稳定 selection rule,避免 affine E 子问题因 inner solve 不精确而无界。
Key Insight / Why It Works
最核心贡献是 dynamic-static equivalence,而不是数值算法。只惩罚 V 看似改变了动态问题,但 rigid flow pullback 说明它没有产生一个任意的新距离,而是精确实现了 Procrustes-Wasserstein quotient metric。这一点让整个框架成立:MBB 不是 heuristic invariant BB,而是 PW 的动态 realization。
Gaussian 公式也很有价值,因为它说明 quotient 后 Gaussian 的几何量退化为 covariance spectrum 的比较。普通 Bures-Wasserstein 比较的是 covariance matrices;PW quotient 掉 orthogonal basis 后只剩 eigenvalue magnitudes。这个 insight 可迁移:当群作用主要改变表示坐标而不改变内在形状时,最合理的距离应落在 orbit invariant statistics 上。
计算部分的增益主要来自 better inductive bias,而不是 scaling。MBB 给 solver 一个显式 rigid channel,因此旋转不必由 potential transport field 通过形变、剪切、扩散来近似。实验里能量降低和形状保持更好,基本就是这个归因。PDHG、多层迭代、H1 preconditioning 更多是把这个 formulation 跑起来的 engineering,不是概念创新。
收敛理论的价值在于诚实地处理退化:作者没有声称全局收敛,而是给出 local branch + residual reliability + inexact outer descent。这是合理的,因为 E 的非唯一性不是技术证明不够,而是问题本身的 gauge pathology。Section 8 的例子说明,全局 identification 不可能免费得到。
Relation To Prior Work
最接近的是 Procrustes-Wasserstein / invariant OT 和 Benamou-Brenier dynamic OT。和 Alvarez-Melis/Jegelka/Jaakkola、Grave/Joulin/Berthet 这类静态 PW 路线相比,本文的本质不同在于把 orthogonal alignment 从 endpoint optimization 提升为动态切空间中的零成本方向。静态上最后仍等价于 PW,所以距离本身不是全新对象;新的是它的 dynamical realization 和 PDE/saddle interpretation。
和 controlled OT 相比,本文不是泛化 state dynamics 来表达复杂控制系统,而是针对 Euclidean group 的 quotient structure 做 control-in-energy。这个区别很重要:E,C 不是额外动力学能力,而是被设计成不计费的 gauge variable。
看似新的部分中,静态 PW、BB momentum formulation、PDHG、Procrustes alignment 都是已有思想;实质创新是把它们通过 rigid velocity projection 和 pullback argument 连接起来,并给 Gaussian case 一个谱层面的闭式表达。算法收敛部分属于 local analysis of parameter-dependent saddle problems,技术上严谨但不是突破性的全局优化理论。
Dataset / Evaluation
实验覆盖三个二维合成场景:纯旋转、无旋转有效 transport、旋转加形变。它们验证的是 formulation 的基本 sanity:有 rigid structure 时 MBB 把一部分运动吸收到 E 中;没有 rigid structure 时接近普通 BB;混合情形中两者分工。
但 evaluation 很窄。没有真实数据、没有高维分布、没有复杂 shape matching、没有 empirical PW/Sinkhorn baseline,也没有系统的网格/步长/inner iteration sensitivity。纯旋转实验中重建角度明显低于生成角度,作者归因于离散化和有限 inner solves,但没有定量拆解。因此实验支持“机制方向正确”,不支持“solver 已经稳健可扩展”。
理论 claim 的核心其实不依赖实验;实验更多是 illustration。若要支撑 computation claim,还需要跨分辨率 convergence、与静态 PW solver 的数值一致性、复杂非对称密度下 E 的稳定性,以及 runtime/scaling 对比。
Limitation
最大限制是 E 的可辨识性和 gauge degeneracy。径向密度下任意旋转场都零成本且可行;近径向密度下 smallest singular value 按扰动幅度退化;闭合旋转 loop 还能改变中间路径和 E_t 而不改变端点和 action。这说明局部性不是证明保守,而是问题结构决定的。
收敛结论很弱但诚实:固定网格、局部 regularity neighborhood、strict positivity、小 effective velocity 条件、inner residual 可控、outer step 合适,并且只到 subsequential block stationary point。没有全局最优保证,没有离散到连续的一致性,没有 mesh refinement 收敛。
计算上,外层 E update 是 proximal selection rule,用来稳定本来退化的 affine 子问题。它可能对 step size、inner accuracy 和 discretization 很敏感。数值中 recovered rotation 不精确,说明 rigid/deformational split 并不自动可解释;一部分旋转仍可能被 m 吸收。增益来源在复杂任务中是否来自正确 quotient geometry,还是来自额外自由度带来的 fitting flexibility,文中未充分说明。
Gaussian closed form 的上限也明显:它只说明 orbit-invariant covariance spectrum 的情况,对非 Gaussian 高阶结构没有类似闭式简化。对于真实形状分布,最优 orthogonal action 与 transport coupling 的相互作用仍可能很难。
Takeaway
- 1. 最值得记住的是:Euclidean-invariant OT 可以从 tangent norm 层面建模,而不是只在 endpoint coupling 上做 Procrustes alignment。
- 这给 invariant OT 一个真正的 dynamic BB interpretation。
- 2. 该框架的核心不是“多加一个旋转变量”,而是把刚体运动作为 quotient/gauge direction 从 action 中投影掉。
- 这个思想可以迁移到其他群不变 OT:关键是识别 infinitesimal group orbit,并在 velocity norm 中消去它。
一句话总结
这篇论文把 Procrustes-Wasserstein 从静态对齐距离提升为 Benamou-Brenier 动态 quotient geometry,真正贡献是 rigid-motion 零成本方向的动态实现与等价性证明,而数值算法目前更像一个局部、固定网格的可行原型。
