论文

检索之前重用:诊断具体多模式策略的测试时间增强的余量和互补性

Reuse Before You Retrieve: Diagnosing Headroom and Complementarity for Test-Time Augmentation of Embodied Multimodal Policies

智能体系统Agent任务评测

摘要

通过对额外的策略行为进行抽样或引入外部示范,冻结的视觉-语言-行动(VLA)策略在测试时不断得到改进。然而,对于决定已部署的策略实际需要哪种干预,几乎没有任何指导。仅当策略的随机执行轨迹中已经存在更好的行为并且可以识别时,附加采样才有用,而当策略无法可靠地表示相关先验操作时,检索最有用。我们通过两个可测量的因素来研究这个决定,即可恢复的空间和检索互补性,它们描述了有多少有用的行为已经可以恢复,以及外部行动先验是否填补了可测量的空白。我们评估可重试或并行执行下的事件级重试选择器,以及跨多个冻结 VLA 策略和环境的检索。选择器在 LIBERO 上所有测试的 VLA 主干上始终如一地恢复大量潜在能力,成功率提高高达 21.0 点,密切跟踪可恢复的余量。它还可以转移到不同的机器人和模拟器,并在退化的观察下保持有效,而自回归 OpenVLA 的实验说明了可用空间和对候选执行轨迹进行排名的能力之间的区别。检索的行为有所不同,它改进了具有最大测量先验行动差距的策略,并在与选择相结合时提供进一步的收益。总之,这些结果通过将可以从冻结策略中恢复的能力与可能需要从外部引入的行为先验分开来为表征测试时间增强机会提供了经验基础。