论文
DiVer:VLA测试时扩展的决策关键验证者学习
DiVeR: Decision-Critical Verifier Learning for VLA Test-Time Scaling
摘要
扩展机器人数据和模型容量已经改进了视觉-语言-动作(VLA)策略,但进一步的进展受到机器人数据的高成本的限制。验证者引导的测试时缩放通过对多个候选操作进行采样并在推理时选择最有可能导致任务成功率的操作,提供了一种有效的替代方案。现有的基于分类的验证器从轨迹级结果中学习,但平等对待所有访问过的状态,即使它们对于候选区分能力的值在整个轨迹上可能有所不同。在许多状态下,合理的行动是相似的,并提供有限的区分能力信号,而只有一组稀疏的决策关键状态允许有意义的不同行动,这些行动可能会严重影响下游结果。为了解决这个问题,我们提出了 DiVer,它根据采样动作表示的分散性来估计决策的关键性。然后,DiVerer 使用该信号重新调整验证者学习的权重,使其朝着行动选择最重要的状态发展,而无需步骤级注释或额外的环境交互。在 LIBERO、RoboCasa 和 Franka Research 3 机器人的真实实验中,DiVereR 通过更有效的验证者引导的动作选择不断改进任务成功率,同时增加的验证者推理开销可以忽略不计。
