论文
Video2Skill:从流媒体体验到可重用的体现技能
Video2Skill: From Streaming Experience to Reusable Embodied Skills
摘要
不同对象和场景的操纵行为差异很大,但它们共享一小部分可重用技能,并且利用这些技能进行规划有助于具体Agent泛化到新任务。然而,Agent只能利用其已知的技能进行规划。从观察到的经验中恢复技能(与规划相反),随着时间的推移建立这些知识,并产生用于训练未来Agent的技能数据。视觉语言模型(VLM)很好地描述了单个操作事件,但它们能否将事件流组织成可重用的技能?我们将这个问题表述为流式体现技能发现(SESD):模型按顺序观看视频并维护一个持久的技能库,以决定其后续决策。为了系统地衡量这种能力,我们引入了Video2Skill,这是一个涵盖机器人桌面操作和人类厨房活动的基准测试,并测试三个核心能力:(i)及时定位操作事件,(ii)对同一转换的事件进行分组,以及(iii)决定何时重用现有技能或创建新技能。在 19 个开源 VLM 中,许多模型将事件分组为近乎偶然的水平,而规模并不总是有帮助。它们的错误取决于感知和库更新的耦合方式:联合模型将不同的转换合并为一项技能,而根据文本描述更新库的模型会重复重复出现的技能。有监督的微调,包括我们的反事实库状态重新平衡(CLaRe),改进了分组,但暴露了更深层次的瓶颈:经过训练的模型巩固了熟悉的技能,但很少扩展库。他们的库停滞在参考大小的一半以下,训练中未见的转换及时定位,但几乎从未赋予新技能。因此,认识到现有技能何时不足就成为核心挑战。