论文
检索,而不是重新训练:将视觉语言动作模型扩展到测试时的新任务
Retrieve, Don't Retrain: Extending Vision Language Action Models to New Tasks at Test Time
摘要
将视觉语言动作 (VLA) 策略扩展到新任务通常需要特定于任务的远程操作演示和每个任务 微调,这使得数据收集和计算方面的适应成本高昂。在本文中,我们证明了目标端每任务适应成本可以通过检索来替代。我们的检索增强策略在目标实施例(查询)和更便宜的实施例(池,例如人手视频)的配对演示上进行一次训练,然后冻结。通过将池端演示附加到检索池,可以在部署时添加新任务。在每个控制步骤检索的轨迹上冻结策略条件,因此新任务通过索引数据而不是更新参数来吸收。 微调 只需要承担一个新的、看不见的体现,而不是每个新任务。我们表明,检索改进了特定主干之外的策略,包括标准 VLA 策略,但其效果在 Cosmos 策略(一种基于视频生成的世界动作模型 (WAM))中尤其明显。在这种情况下,检索提供粗略的任务进展,而 WAM 的未来图像目标提供额外的视觉一致性信号,增强检索条件动作。在 PushT 上,我们研究检索如何为跨实体泛化到未见过的目标角度提供可重用的高级运动先验,而在 RoboTwin 2.0 上,我们的方法在未见过的任务上优于跨实体基线,并且我们还在真实的机器人上演示了该方法。