论文
Xiaomi-Robotics-1:用超过十万小时真实轨迹扩展视觉—语言—动作模型
Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories
摘要
Xiaomi-Robotics-1 是基础视觉—语言—动作模型,能够直接在未见环境中按多样语言指令执行移动操作,并以少量微调数据适应新任务。两阶段流程先用 UMI 设备收集的超过十万小时真实操作轨迹预训练,获得广泛可泛化的动作生成能力。可扩展自动标注流程用自然语言描述轨迹片段的场景状态变化,为动作学习提供丰富而精确的条件。后训练将能力对齐到具体机器人形态与人类常用命令。实验显示,预训练数据和模型规模扩大时性能持续改善,该趋势延续至后训练:较强预训练模型在未见环境中的真实机器人直接使用效果更好,也能以较高数据效率微调复杂灵巧任务。多个仿真基准上优于此前方法,RoboCasa365 成功率达到 57.4%,此前最佳为 46.6%;RoboDojo 平均分为 20.07,此前最佳为 13.07。作者表示代码与模型检查点将公开。项目页面:https://robotics.xiaomi.com/xiaomi-robotics-1.html