论文

CLASP:使用任务参数化学习的语言驱动机器人技能选择和组合

CLASP: Language-Driven Robot Skill Selection and Composition using Task-Parameterized Learning

智能体系统Agent 工具调用

摘要

让机器人能够理解并执行自然语言命令的任务,同时保持数据效率仍然具有挑战性。视觉-语言-动作(VLA)和视觉-语言模型(VLM)等基础模型提供直观的交互渠道,但需要大量数据;任务参数化模仿学习实现了数据效率,但缺乏自然语言基础。这项工作通过将任务参数化内核化运动原语 (TP-KMP) 与预训练的 VLM 相结合的模块化架构弥补了这一差距。在学习过程中,通过 2 到 5 次动觉演示获得技能,VLM 生成描述每个技能参数和先决条件的技能模式。在执行过程中,VLM 解释命令以选择技能、推理参数绑定并通过协方差加权组合创建新颖的行为。当技能或组合不足时,系统会识别能力差距并请求有针对性的演示,所有这些都无需 微调。 7-DoF 机械臂上的验证显示,在需要技能选择、组合和主动学习的场景中,成功率为 73.3%-100%。