论文

用于视觉-语言-动作模型的数据高效适应的分层技能检索

Hierarchical Skill Retrieval for Data-Efficient Adaptation of Vision-Language-Action Models

模型训练合成数据

摘要

虽然在大规模机器人数据集上预训练的视觉-语言-动作(VLA)模型为机器人操作提供了坚实的基础,但当适应新任务且特定任务演示有限时,它们的性能可能会下降。检索提供了一种重用现有演示以实现数据高效适应的实用方法,但现有方法通常依赖于视觉相似性、状态动作表示或任务级语言匹配。这些方法可能忽略了长期操作任务的层次结构,其中完整的任务匹配很少,但可重用的技能通常很丰富。为了应对这一挑战,我们提出了分层技能检索(HSR),这是一种用于数据高效 VLA 适应的检索框架。具体来说,HSR 首先将目标任务分解为候选技能序列。它根据从先前数据集估计的语义合理性和技能可靠性来评估每个计划。然后将选定的分解用于混合检索。这将子任务级语言检索与行为特征重新排序相结合,以识别语义相关且与目标任务兼容的演示。最后,我们通过两阶段预训练和微调管道来调整策略,将一般技能的获取与特定任务的适应分开。 LIBERO 基准和几个现实世界机器人操作任务的实验表明,HSR 比最强基准分别提高了平均成功率 10.3% 和 21.3%。这些结果证明了结构化技能级别检索对于数据高效的 VLA 适应的有效性。视频和代码可在 https://hoar012.github.io/HSR-Project 获取。