精读笔记
Problem Setting
[论文标题] Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories(arXiv preprint / 2026)。
这篇论文真正处理的问题是:VLA 能否像 LLM/VLM 一样通过扩大真实世界行为数据和模型规模获得可迁移的机器人控制能力。它不是在定义一个新任务,也不是单纯改进某个 policy architecture,而是在问一个更工程但更根本的问题:机器人领域缺少 web-scale 数据时,怎样构造一个可扩展的行为预训练语料。
困难点在于机器人数据的“可规模化”和“可监督性”天然冲突。真实机器人 teleop 数据带有准确 action 和 embodiment,但采集慢、场景窄、任务重复;UMI 数据更容易跨环境采集,但不是目标机器人本体,且缺少任务级语言标注。以前方法往往卡在二者之一:要么数据规模小但本体对齐好,要么视频/UMI 数据多但语义和动作对齐弱。
这篇的关键矛盾是:如何让非机器人本体采集的大规模真实操作轨迹,成为能提升机器人部署性能的 action-generating pretraining,而不是只学到视觉表征或离线行为拟合。
Motivation
已有路线不够的地方不是 VLA 不会接视觉语言,也不是 diffusion/flow action head 不够强,而是缺少足够多样、带语言条件、可对齐到动作的真实物理交互数据。机器人基础模型的瓶颈越来越像数据覆盖问题:没有大量不同场景、物体、接触模式和操作意图,模型形式再复杂也很难产生真实泛化。
作者的核心观察是:UMI 轨迹提供了比机器人 teleop 更可扩展的真实操作分布,但原始 UMI 轨迹缺少“为什么做这段动作”的语言条件。若能把连续轨迹切成片段,并用 VLM 自动标注每段的状态变化,就能把无结构操作视频变成语言条件行为学习数据。
关键缺口因此是两层 alignment:先把无标注 UMI 操作转成 state-transition-conditioned action learning;再把这种描述式状态转移条件,对齐到人类给机器人的命令式任务指令和目标机器人本体动作空间。
Core Idea
论文最核心的想法是把大规模机器人预训练从“人工定义任务 + 指令执行”改成“视觉状态转移建模”。模型不需要先知道这是整理鞋子、装包还是擦桌子,而是在每个短片段上学习:当前场景是什么,语言描述的目标状态变化是什么,需要产生怎样的动作 chunk 才能让这个变化发生。这个建模方式降低了语言标注门槛,也绕开了大规模人工 task segmentation 的瓶颈。
它引入的 inductive bias 是:操作技能可以通过大量局部状态转移片段获得,而命令式任务执行可以在后续 alignment 阶段映射到这些局部可执行变化。这和直接用少量 instruction-labeled robot data 训练 VLA 的区别在于,后者把语义、动作、本体和任务执行全部压在同一个数据集里学习;Xiaomi-Robotics-1 把它们拆开,先扩大物理交互覆盖,再做本体和 prompt 形式对齐。
本质差异不在 MoT 或 flow matching,而在数据组织方式:它把 UMI 从“robot-free demonstration”提升为 foundation policy pretraining corpus,并用自动状态转移语言把轨迹变成可条件化的行为监督。这比纯 imitation dataset scaling 更 scalable,也比 actionless video pretraining 更接近控制,因为每段都有真实操作动作。
Method
方法中真正有机制必要性的部分可以压缩成四点。
第一,状态转移自动标注解决的是大规模轨迹缺少语言条件的问题。它把每个固定长度片段变成“当前观察到目标变化”的监督样本,使模型学的是可执行变化而不是抽象任务名。核心变化是语言从 high-level instruction 变成 dense transition label。
第二,pre-training/post-training 分离解决的是 UMI 数据规模和机器人部署本体不一致的问题。预训练负责学习广覆盖的操作运动与视觉接触先验,post-training 负责把这些先验接到机器人 action space 和人类命令式 prompt 上。这个分离比直接混训更清晰,因为不同数据源承担不同功能。
第三,跨本体 action 表示与缺失维度 mask 解决的是 heterogeneous embodiment 无法共享监督目标的问题。它不要求所有机器人有相同自由度,而是通过 EE-relative motion、frame alignment 和统一 action vector 让相似操作在不同硬件上尽量对应到相似数值结构。
第四,VLM + DiT/flow matching 的设计解决的是语义理解与连续动作生成的分工问题。VLM 负责视觉语言上下文编码,DiT 负责连续 action chunk 生成。辅助 Choice Policies 主要是让 VLM 表征更贴近动作预测并加速收敛;但作者也发现 DiT 若看到 VLM action tokens 会走 shortcut,因此排除这些 tokens,说明信息流隔离本身是一个重要工程判断。
Key Insight / Why It Works
最重要的 insight 是:机器人泛化目前很大程度上不是缺少更会“推理”的 action head,而是缺少足够覆盖真实接触、物体、环境和局部操作模式的数据。Xiaomi-Robotics-1 的有效性很可能主要来自 data coverage + representation alignment,而不是某个单独架构创新。
状态转移 caption 的作用值得重视。它可能不只是自然语言监督,而是在给每个短轨迹片段提供一个 dense semantic index,使模型能把视觉变化、物体交互和动作片段绑定起来。换句话说,语言在这里更像行为数据的可检索条件和目标状态描述,而不一定是高层 reasoning interface。
pretrain/post-train 的成立依赖一个假设:局部操作能力可以跨 embodiment 迁移,而命令式任务只需要在后训练阶段把 prompt 分布和 action space 对齐。这在移动操作和日常整理任务中是合理的,因为很多技能由短程接触模式组成;但对需要长期记忆、隐式状态估计或策略级规划的任务,这个假设可能不够。
模型 scaling 的证据方向是正的,但数据 scaling 看起来更关键。文中也显示模型规模差异不如数据规模显著,这暗示当前 regime 仍是 data-bound。10B 的提升更像在更大数据和更复杂任务上释放容量,而不是证明参数规模本身带来新能力。
MoT、DiT、flow matching、Choice Policies 大多是强 baseline 级别的工程组合。它们帮助连续动作建模、收敛和推理速度,但论文最可能被迁移的贡献是“用 VLM 自动生成状态转移语言,把大规模 UMI 轨迹转成 VLA 预训练数据,再用 cross-embodiment post-training 对齐”。
需要直接指出:所谓 long-horizon 和 reasoning 能力在本文证据下并不充分。没有显式历史建模时,长程任务成功可能来自训练分布覆盖、短技能链式执行和环境反馈闭环,而不是模型内部形成了稳定的长期状态表示。RoboDojo memory 维度弱于带 memory 的方法也支持这一点。
Relation To Prior Work
这篇属于 VLA foundation policy 的 scaling 谱系,最接近 π0/π0.5、OpenVLA/RT-X、GR00T、Qwen-RobotManip、Xiaomi-Robotics-0,以及使用 UMI 或人类操作视频做大规模预训练的工作。它与 WAM 路线的差异是没有把未来视觉预测作为核心中间变量,而是直接做语言条件 action generation。
与传统 VLA 的本质差异在数据构造:不是主要依赖 instruction-labeled robot trajectories,而是把大规模 UMI 轨迹通过状态转移 caption 转成预训练数据。与 actionless human video 或 world model pretraining 相比,它保留了真实操作动作,因此 supervision 更贴近控制。与 UMI imitation 工作相比,它的重点不是单任务或单本体迁移,而是把 UMI 扩展为 foundation pretraining substrate。
看似新的部分中,VLM backbone、flow matching action head、action chunk、cross-embodiment masking、辅助 action regression 都不是全新思想,更多是已有 VLA/DiT/choice policy 技术的组合。实质新增的信息是大规模 UMI + 自动状态转移语言 + 两阶段 alignment 的系统化验证,尤其是验证了预训练 scaling 能转移到 post-training 后的真机 out-of-the-box 表现。
Dataset / Evaluation
数据覆盖是本文最强也是最难外部验证的部分。预训练声称超过 100k 小时真实 UMI 轨迹,覆盖家庭、商业、工业、办公室、户外等场景;post-training 约 10k 小时 cross-embodiment 数据,包括 in-house mobile manipulators、dual-arm robots、instruction-labeled UMI 和开源 robot datasets。这个规模足以让论文的 claim 从“方法技巧”变成“数据系统能力”。
评测覆盖了三类问题:预训练 scaling 是否降低 action error;post-training 后是否能在未见环境/物体上 out-of-the-box 执行已见任务;少数据 fine-tuning 是否更高效;再加上多个仿真 benchmark 对比 SOTA。整体上支持“scale helps”和“pretraining transfers”这两个核心 claim。
但 evaluation 仍有明显限制。真机 out-of-the-box 的任务类型在 post-training 数据中是 seen tasks,只是环境和物体未见,因此它验证的是场景/实例泛化,不是任务级 zero-shot 泛化。少样本 fine-tuning 任务虽然 held out,但仍可能共享大量底层操作原语。仿真 benchmark 的强结果说明模型/训练 recipe 泛化到标准评测,但不等价于真实部署能力。
文中未充分说明数据去重、环境重叠、物体分布、caption 质量控制、失败轨迹比例、评测任务与训练数据的语义距离。对一个主要依赖数据规模的工作,这些信息对判断真实泛化非常关键。
Limitation
第一,核心能力可能主要来自数据覆盖。论文展示了 scaling curve,但没有充分拆解数据多样性、caption 质量、post-training 数据规模、模型大小和 architecture 的独立贡献。增益来源不清。
第二,状态转移 caption 是强隐式监督。VLM 自动标注可能把大量语义先验注入训练集,包括物体类别、操作意图和结果描述。若 caption 错误、过粗或带偏,模型学到的条件行为会直接受限。文中未充分说明 caption 误差如何影响控制性能。
第三,post-training 并不轻。它需要 10k 小时级别 cross-embodiment 数据,其中大量为 in-house robot data。这说明 UMI 预训练不能直接解决 embodiment gap,只是降低后续学习难度。问题被部分转移到了高质量对齐数据的构建。
第四,泛化边界不清。未见环境和物体不等于未见任务结构;benchmark 上的 composite-unseen 表现较强,但仍可能受训练原子技能覆盖和 benchmark 分布影响。所谓推理更像基于覆盖的 recombination/retrieval,而不是可验证的 symbolic 或 latent planning。
第五,长期状态建模不足。模型以当前 observation 和 action chunk 为主,没有强调 history/memory;在 memory benchmark 上不占优也说明它不是通过显式记忆解决长期依赖。长程 suitcase packing 视频更像系统能力展示,不能单独证明策略具备稳定长程规划。
第六,scalability 上限取决于 UMI 数据是否继续提供边际多样性。固定长度分段和局部状态转移标注对短程操作非常有效,但对需要不可见目标、延迟奖励、多阶段约束或工具使用的任务,局部 transition supervision 可能不够。
Takeaway
- 1. 最值得记住的是数据表征方式:把大规模无任务标签 UMI 轨迹转成 state-transition-conditioned action data,比继续堆小规模 instruction robot demos 更可能扩展。
- 2. VLA scaling 的下一阶段重点可能不是单纯扩大参数,而是扩大真实交互覆盖、提高自动语义标注质量、减少 post-training alignment 成本,并明确数据分布与能力边界。
- 3. 两阶段范式是可迁移 insight:先学广覆盖的物理操作先验,再用较小但目标分布更准的数据对齐 prompt 和 embodiment。
- 这一范式可能适用于 dexterous hand、mobile manipulation、tool use 等数据来源与部署本体不一致的场景。
一句话总结
Xiaomi-Robotics-1 是一篇把 VLA 机器人基础模型推进到数据规模化阶段的工作,其真正贡献不是新 action head,而是证明“大规模 UMI 状态转移预训练 + 跨本体指令对齐”可以把真实世界操作数据转化为可迁移的机器人策略能力。
