论文

检索何时有帮助?视觉-语言-动作模型中的情境适应研究

When Does Retrieval Help? A Study of In-Context Adaptation in Vision-Language-Action Models

上下文与知识检索增强

摘要

视觉-语言-动作 (VLA) 模型已显示出作为多面手机器人策略的强大潜力,但使其适应看不见的任务通常需要昂贵的参数更新。最近的工作(例如 RICL)通过检索基于当前VLA观察的专家演示并在测试时将其作为附加上下文提供,从而引入了上下文适应性。因此,这种适应的有效性关键取决于检索机制。在这项工作中,我们系统地研究了 RICL 框架内不同的检索方法如何影响检索质量和任务性能。具体来说,我们比较了四种不同的方法:基于图像的检索、使用VLA状态增强的检索、使用VLA骨干模型特征的检索以及随机检索。我们的实验产生了三个主要发现。首先,在任务成功率中,没有一种检索方法能够始终主导其他方法,但令人惊讶的是,随机检索取得了不平凡的成功率。其次,标准检索质量诊断不能可靠地反映下游VLA性能。第三,来自不同但相关任务的演示可以提供有用的可转移信息。总之,这些结果为理解检索机制如何塑造VLA模型的上下文学习能力及其下游任务性能提供了第一步,同时强调需要更仔细地设计和评估检索机制以实现可靠的测试时适应。