论文

检索然后转向:用于生成 VLA 测试时适应的在线成功记忆

Retrieve-then-Steer: Online Success Memory for Test-Time Adaptation of Generative VLAs

摘要

视觉-语言-动作(VLA)模型显示出通用机器人操作的强大潜力,但其闭环可靠性在本地部署条件下通常会降低。现有的评估通常将测试集视为独立的零样本试验。然而,真正的机器人经常在相同或缓慢变化的环境中重复操作,其中成功的执行提供了经过环境验证的可靠行为模式的证据。我们研究了这种持久部署设置,询问部分能力的冻结 VLA 是否可以通过重用其成功的测试时间经验来提高其可靠性。我们提出了一个用于生成 VLA 的在线成功记忆引导测试时间适应框架。在部署过程中,机器人将经过进度校准的成功观察动作片段存储在长期存储器中。在推理时,它检索与状态相关的动作块,通过轨迹级一致性过滤不一致的候选者,并将它们聚合成精英动作先验。为了将此先验纳入动作生成中,我们引入了置信度自适应先验指导,它将精英先验注入到流匹配动作采样器的中间状态,并根据检索置信度调整指导强度。这种设计允许冻结的 VLA 能够利用特定环境的成功经验,同时保留观察条件的生成细化。这种检索然后转向机制可以实现轻量级、非参数测试时间调整,而无需更新参数。仿真和现实实验表明任务成功率和闭环稳定性得到提高,特别是在长范围和多阶段任务中。