论文

VLA(实际上)如何在开放世界环境中工作

How VLAs (Really) Work In Open-World Environments

模型评测评测方法与指标

摘要

视觉-语言-动作模型(VLA)已广泛应用于机器人应用中,在各种操纵问题上取得了巨大成功。最近,VLA 已被用于长期任务,并根据 BEHAVIOR1K (B1K) 等基准进行评估,以解决复杂的家务劳动。在此类基准测试中衡量进度的常用指标是成功率或基于进度不可知标准的满意度的部分分数,这意味着仅考虑对象的最终状态,而不管导致此类状态的事件如何。在本文中,我们认为使用此类评估协议对操作的安全性影响甚微,并且可能夸大报告的性能,从而削弱未来实际部署的核心挑战。为此,我们对 B1K 挑战赛的最先进模型进行了彻底分析,并通过性能的可重复性和一致性、政策操作的安全性、任务意识以及导致任务无法完成的关键要素来评估政策的鲁棒性。然后,我们提出评估协议来捕获安全违规行为,以便更好地衡量策略在更复杂和交互式场景中的真实性能。最后,我们讨论了现有 VLA 的局限性并激励未来的研究。