论文

标签:视觉-语言-动作模型中稳定的以对象为中心的推理的目标无关指导

TAG: Target-Agnostic Guidance for Stable Object-Centric Inference in Vision-Language-Action Models

摘要

视觉-语言-动作(VLA)策略在将语言指令和视觉观察映射到机器人动作方面取得了巨大进展,但在有干扰因素的杂乱场景中,其可靠性会下降。通过分析失败案例,我们发现许多错误并不是由不可行的运动引起的,而是由实例级的对象定位错误引起的:该策略通常会产生一个看似合理的抓取轨迹,该轨迹稍微偏离目标,甚至落在错误的对象实例上。为了解决这个问题,我们提出了 TAG(与目标无关的指导),这是一种简单的推理时间指导机制,可以明确减少 VLA 策略中干扰因素和外观引起的偏差。受无分类器指导(CFG)的启发,TAG将原始观察和对象擦除观察下的政策预测进行对比,并将它们的差异作为残余转向信号,增强对象证据在决策过程中的影响。 TAG 不需要修改策略架构,并且可以通过最少的训练和推理更改与现有的 VLA 策略集成。我们在标准操作基准(包括 LIBERO、LIBERO-Plus 和 VLABench)上评估 TAG,它不断提高杂乱情况下的鲁棒性,并减少未遂和错误对象执行。