论文
SkillMemo:专家指导的组合体现操作的技能记忆框架
SkillMemo: Expert-guided Skill Memory Framework for Compositional Embodied Manipulation
摘要
具身视觉运动模型,包括扩散策略(DP)和视觉-语言-动作(VLA)模型,在机器人操纵基准上表现出了良好的性能。然而,它们的潜力仍然从根本上受到大规模具体轨迹数据集稀缺的限制,导致在分布外(OOD)场景中组合泛化不足,捕获可重用技能结构的能力有限。为了解决这个限制,我们提出了基于技能的记忆(SkillMemo)框架,该框架隐式地将长期演示分解为潜在的原子技能,并将技能级别特征集成到动态情景记忆库中以解决组合任务。具体来说,我们首先引入一个基于专家混合(MoE)架构的专家引导轨迹分割模块,该模块隐式地将轨迹划分为由学习的门系数表示的不同技能原语。我们进一步设计了一种技能级情景记忆架构,它将紧凑的技能表示存储为可检索的键值对。在推理过程中,记忆库检索最相关的技能原语,随后将其与模型当前的门控分布融合,从而在细化动作预测之前提供强大的上下文。对模拟基准和现实操作任务的大量实验表明,SkillMemo 持续增强了 DP 和 VLA 主干,实现了最先进的性能并超越 $π_{0.5}$,同时对未见过的任务配置表现出强大的组合泛化能力。