论文
InSight:利用可控VLA自主学习新技能
InSight: Self-Guided Skill Acquisition via Steerable VLAs
摘要
视觉语言动作模型擅长模仿机器人操作,但适配新任务通常需要昂贵的人工示范。视觉语言模型能理解任务,却缺乏实际执行依据。InSight用VLM识别VLA技能库中缺少的动作原语,通过机器人执行检验VLM建议,将成功轨迹中的新原语蒸馏到VLA。机器人能够按指令启动和终止原语,复用已有技能并收集缺失技能的数据,无需每项新任务的完整示范。第一阶段,VLM将现有示范切分为带原语标签的轨迹,微调可按原语控制的VLA;第二阶段,VLM规划原语序列,已知原语由VLA执行,新原语由VLM设定参数的底层控制器尝试。成功任务轨迹中的新原语片段加入训练集后再训练VLA,随后执行已习得技能时无需逐原语调用VLM。六项模拟与真实任务涵盖翻块、关抽屉、清扫、扭转和倾倒,均无目标技能人工示范。硬件上扭转与倾倒成功率为92%和96%,零样本CaP-X基线为32%和16%;组合为含14个原语的任务后,无组合任务示范情况下成功率达到80%。项目:https://insight-vla.github.io/。