论文
发现和减轻视觉-语言-动作模型中的位置盲点
Uncovering and Mitigating Positional Blind Spots in Vision-Language-Action Models
摘要
最近的视觉-语言-动作(VLA)模型在机器人操作方面取得了可喜的性能,通常通过预定义对象配置聚合的成功率来衡量,这种评估隐含地假设整个工作空间的空间统一能力。然而,这个假设并不成立:即使指令和所有其他场景因素保持固定,仅仅重新定位与任务无关的干扰因素就可以急剧提高局部、空间相干区域内的失败概率,我们将其称为位置盲点(PBS)。在本文中,我们提出了一个两阶段黑盒框架来发现和缓解 PBS。在发现阶段,我们对工作空间进行网格化,并应用单边对数似然比测试来定位风险显着升高的 PBS 细胞。在缓解阶段,我们通过 LoRA 根据从这些 PBS 区域收集的演示来微调策略,提高那里的能力,同时在很大程度上保持工作区其余部分的性能。我们通过两个基准评估了五种最先进的 VLA 策略的框架,发现 PBS 普遍存在并且在空间上集中在所有这些策略中,失败率高达 0.58。我们的搜索策略的平均 F1 分数为 0.678,分别优于随机搜索和自适应采样基线 0.268 和 0.178。在发现的区域的指导下,有针对性的微调将整体故障率降低了40.00%--85.19%。