1. Xiaomi-Robotics-1 (robotics.xiaomi.com)
Xiaomi-Robotics-1:突破数据瓶颈,通过无实体预训练扩展机器人策略模型
核心问题与方法 机器人基础模型的发展长期受限于大规模高质量数据的稀缺。Xiaomi-Robotics-1提出了一种解决方案:通过大规模无实体(UMI)预训练结合少量真实机器人数据的后训练,来扩展机器人策略模型。该研究旨在验证在真正的大规模训练下,机器人的能力边界。
数据基础
- 预训练数据:使用超过10万小时的无实体(UMI)轨迹,覆盖超过1700个场景(家居、商业、工业、户外),任务多样。通过一个可扩展的自动标注流水线(基于视觉语言模型),将长视频分割成固定时长片段,并为每个片段标注描述夹爪与物体交互状态变化的语言描述。
- 后训练数据:利用跨实体数据集,包括内部真实机器人数据(超过7200小时,在真实家庭环境中收集,如整理沙发、整理鞋柜等)、经过筛选的开源数据,以及高质量的UMI数据。UMI数据通过人工进行时序分割和指令提示标注。
训练范式 遵循大语言模型(LLM)的训练范式,训练分为两阶段:
- 预训练(广度学习):在大规模UMI数据上训练模型,学习从语言描述的状态变化到动作生成的通用表示,旨在让模型接触尽可能广泛的真实世界场景。此阶段展现出清晰的缩放行为:随着数据和模型规模增长,验证集的动作误差稳步下降。
- 后训练(对齐与特化):
- 实体对齐:利用高质量的跨实体真实机器人数据,将预训练获得的通用动作生成能力映射到真实机器人实体上。
- 指令对齐:将模型从“根据状态变化描述生成动作”转变为“理解并执行自然语言指令”。 后训练后,模型可在陌生环境中处理未见过的物体。研究证实,预训练阶段的缩放收益能够直接转移到真实机器人性能上:更强的预训练模型带来更高的真实世界任务成功率,且这种增益未显现饱和迹象。
下游应用与效果 后训练的Xiaomi-Robotics-1可作为强大的机器人基础模型用于下游应用。
- 高效适应新任务:仅需少量小时级的真实机器人示范,即可学习新的复杂任务(如手机打包、打印机填料、洗衣装载、箱子打包)。
- 平均少于10小时示范,总体成功率达75%(基线π0.5为40%)。
- 平均少于40小时示范,总体成功率达85%(基线π0.5为53%)。
- 仿真基准测试:在四个强调泛化能力的主流仿真基准(RoboCasa、RoboCasa365、VLABench、RoboDojo)上均取得了最先进的性能,验证了其泛化能力和缩放收益。
结论 Xiaomi-Robotics-1展示了一条扩展机器人基础模型的实用路径:大规模无实体UMI预训练打破了数据瓶颈,后续的真实机器人与指令对齐将通用能力转移到实体机器人上。模型在预训练阶段表现出良好的数据量和模型规模缩放特性,且这种缩放行为能直接转化为后训练后在陌生环境中的出色表现。最终模型能以极少的数据适应新任务,并在强调泛化的仿真基准上达到最佳水平。