论文
用于视觉-语言-动作学习的从简单到复杂的结构化演示
Simple-to-Complex Structured Demonstrations for Vision-Language-Action Learning
摘要
视觉-语言-动作(VLA)模型通过集成视觉感知、语言理解和机器人动作生成,在机器人操作方面展示了强大的能力。现有的研究主要集中在改进模型架构、训练策略和数据集规模,而很少关注如何收集和组织演示。我们认为示范组织是模仿学习的一个基本但被忽视的方面,因为它直接影响政策学习效率、训练稳定性和政策泛化。为了解决这一差距,我们提出了一种使用双臂机器人平台进行 VLA 学习的从简单到复杂的结构化演示收集策略。我们的方法通过三个一般原则系统地组织数据:(i)将复杂的操作任务分解为逐步可学习的子技能,(ii)标准化交互环境以减少不必要的可变性,以及(iii)根据逐渐增加的任务复杂性组织演示。这种结构化设计使 VLA 模型能够在学习日益复杂的任务组合之前首先获得基本的操作技能,从而有助于更有效地学习长视野操作任务。我们在两个代表性的机器人操作任务上评估了所提出的策略:块抓取和排序以及毛巾折叠。实验结果表明,与直接收集端到端完整任务轨迹的基线方法相比,任务成功率和训练稳定性得到了一致的提高。这些发现强调了示范组织是 VLA 学习中一个先前未被充分探索但重要的因素,并为高效技能获取、可扩展数据集构建和长期机器人操作提供了实用见解。