论文
VeriSpace:视觉-语言-动作模型的空间空间定位动作验证
VeriSpace: Spatially Grounded Action Verification for Vision-Language-Action Models
摘要
视觉-语言-动作(VLA)模型在机器人操作方面显示出了巨大的前景,但它们在测试时的可靠性仍然受到一次性动作预测的限制,即使很小的动作错误也可能导致抓取失败、碰撞或不正确的任务进展。一个自然的替代方案是为 VLA 系统配备测试时验证,允许在执行之前提出和评估多个候选操作。然而,可靠的动作验证具有挑战性,因为它不仅需要区分候选动作之间细微的几何差异,还需要评估动作是否在实现任务目标方面取得了有意义的进展。我们推出了 VeriSpace,一种 3D 感知动作验证器,用于 VLA 系统中的测试时动作选择。 VeriSpace 通过两个关键组件评估候选动作:双路径 3D 注入场景编码,它构建共同保留视觉语义和显式 3D 几何的场景表示;以及空间空间定位动作推理,它通过对任务相关的空间关系、几何有效性和预期目标进度进行推理来评估每个动作。这些组件共同实现了对微妙但结果关键的候选行动之间更可靠的区分,同时保持与现有 VLA 政策的完全兼容。对公共基准和现实世界机器人操作任务的实验表明,VeriSpace 持续提高了基础 VLA 策略和基于先前验证的方法的决策可靠性,在分布内和分布外设置中产生了显着的收益。