论文

RA-VLA:用于测试时间适应的检索增强 VLA

RA-VLA: Retrieval-Augmented VLA for Test-Time Adaptation

上下文与知识检索增强

摘要

视觉-语言-动作(VLA)模型为一般机器人操作提供了通用的基础,但在面对新的任务分布时,它们表现出明显的脆弱性。虽然上下文模仿学习 (ICIL) 提供了 无需训练 替代方案,但现有框架存在适应瓶颈,阻碍了专家上下文到可执行操作的有效转换。这种失败源于肤浅的检索机制和将策略锚定到其预先训练的先验的固有行为惯性。为了解决这些限制,我们提出了 RA-VLA,这是一种检索增强的 VLA 框架,它将行为一致的上下文检索与基础执行管道集成在一起。通过在可扩展架构中严格遵守功能线索,RA-VLA 可以促进无缝任务适应,同时保持推理效率。我们对 LIBERO 基准和现实世界 UR5e 环境的实证评估表明,RA-VLA 实现了卓越的成功率和计算效率,为 无需训练 机器人适应建立了强大的框架。