论文
如何指导您的机器人:密集语言注释为机器人策略学习提供动力
How to Instruct Your Robot: Dense Language Annotations Power Robot Policy Learning
摘要
扩展机器人策略学习受到收集演示的成本的瓶颈,而现有演示的语言注释相对便宜。我们研究语言密度作为从固定机器人或以自我为中心的视频语料库中提取更多信号的杠杆。我们引入了 DeMiAn(密集多方面注释),这是一种两阶段方法,首先使用 VLM 生成的注释沿着四个互补方面重新标记演示片段:物理运动、场景构成、手臂姿势和推理。然后,学识渊博的讲师将任务描述和初始场景快照映射到部署时适合任务的注释,异步运行,因此生成延迟隐藏在策略执行后面。通过超过 100 万个机器人操作片段和 50K 个 EgoVerse 人类自我中心视频,DeMiAn 改进了视觉语言动作策略和基于视频的世界动作模型,而无需收集新的演示。在 RoboCasa 上,讲师的成功率比仅任务基线提高了 5 分,与每任务预言的差距在 3 分以内。没有固定的注释方面在各个任务中占主导地位,这表明选择正确的密集语言很重要。 DeMiAn 还提高了复合任务和分布外性能,并在考虑注释生成 FLOP 后,改变了训练中期和 后训练 中的计算性能前沿。这些结果将密集重新注释定位为机器人策略学习的实用缩放杠杆。