论文

DiVer:VLA测试时扩展的决策关键验证者学习

DiVeR: Decision-Critical Verifier Learning for VLA Test-Time Scaling

模型训练奖励建模与过程监督

摘要

扩展机器人数据和模型容量已经改进了视觉-语言-动作(VLA)策略,但进一步的进展受到机器人数据的高成本的限制。验证者引导的测试时缩放通过对多个候选操作进行采样并在推理时选择最有可能导致任务成功率的操作,提供了一种有效的替代方案。现有的基于分类的验证器从轨迹级结果中学习,但平等对待所有访问过的状态,即使它们对于候选区分能力的值在整个轨迹上可能有所不同。在许多状态下,合理的行动是相似的,并提供有限的区分能力信号,而只有一组稀疏的决策关键状态允许有意义的不同行动,这些行动可能会严重影响下游结果。为了解决这个问题,我们提出了 DiVer,它根据采样动作表示的分散性来估计决策的关键性。然后,DiVerer 使用该信号重新调整验证者学习的权重,使其朝着行动选择最重要的状态发展,而无需步骤级注释或额外的环境交互。在 LIBERO、RoboCasa 和 Franka Research 3 机器人的真实实验中,DiVereR 通过更有效的验证者引导的动作选择不断改进任务成功率,同时增加的验证者推理开销可以忽略不计。

DiVer:VLA测试时扩展的决策关键验证者学习的原论文方法或结果图
图 2:DiVerR 概述。 (a) 在每个访问的状态,我们从冻结的VLA策略中采样 $K$ 候选动作,并根据其动作专家表示的分散度估计决策关键性 $u_{t}$。每个轨迹内的分数被标准化并转换为决策权重 $w_{t}$,其与执行的动作表示 $z_{t}$ 和轨迹结果 $y_{t}$ 配对以构建训练数据集 $\mathcal{D}$。 (b) 验证者使用决策加权二元交叉熵进行训练,为具有较大 $w_{t}$ 的状态分配更大的重要性。 (c) 在推理时,验证者在每个决策步骤对 $N$ 采样候选动作进行评分,并执行得分最高的动作块。