论文

LIBERO-Occ:通过视点想象力评估和改进场景诱导遮挡下的视觉-语言-动作模型

LIBERO-Occ: Evaluating and Improving Vision-Language-Action Models under Scene-Induced Occlusion via Viewpoint Imagination

模型评测基准与评测资源

摘要

视觉-语言-动作 (VLA) 模型在标准操作基准上取得了出色的性能,但大多数评估都假设与任务相关的对象完全可见。这种假设在现实环境中通常会失败,因为遮挡使得部分操作可以被观察到。在本文中,我们研究 \textit{场景引起的遮挡} 作为 VLA 模型的基本挑战,并介绍 \textbf{LIBERO-Occ},这是 LIBERO 的面向遮挡的扩展。实验表明,最先进的 VLA 在遮挡情况下性能会大幅下降。为了解决这个问题,我们提出 \textbf{观点想象(VIM)},它从被遮挡的主要观察中生成补充视图,并对观察到的和想象的证据进行条件动作预测。 VIM 提高了跨任务套件、遮挡类型和严重程度的鲁棒性,而无需在部署时使用额外的摄像头,这表明视点想象是部分可观察操作中感知完成的一种有前景的机制。我们的基准测试和相应的代码位于:\href{https://github.com/litsh/Libero-Occ}{https://github.com/litsh/Libero-Occ}。