论文

Pro-Bench:跨真实世界异构环境的快速稳健的开放词汇视觉基础

Pro-Bench: Prompt-Robust Open-Vocabulary Visual Grounding Across Real-World Heterogeneous Environments

模型评测基准与评测资源

摘要

开放词汇视觉基础使机器人能够从自然语言查询中本地化与任务相关的实体,而不依赖于预定义的感知分类法。然而,现有的基准在很大程度上依赖于短类别标签和网络抓取的图像,因此尚不清楚开放词汇模型是否可以在实际部署下稳健地支持不同的查询和视觉条件。我们引入了 \textbf{Pro-Bench},这是一个在异构现实环境中用于开放词汇视觉基础的提示条件基准。 Pro-Bench 包括来自独立机器人领域(地下、工业、室内、室外、城市)的 13,000 美元以上的 RGB 帧,以及 74,500 美元的手动实例注释和 515 美元的目标查询,涵盖分类、属性、关系、可供性、状态、部分整体、否定和组合语义。我们在严格的零样本推理中对 16 美元的开放词汇模型配置进行了基准测试,测量了 IoU 阈值上的定位精度、端到端推理延迟、提示引起的性能变化和目标恢复一致性。我们的结果表明,即时鲁棒性强烈依赖于体系结构。大多数模型配置 ($10/16$) 在使用短类别标签时表现最佳,而自由格式查询仅能产生最高的准确率。此外,相似的总 mAP 可以掩盖重新配制中一致目标恢复的显着差异。 Pro-Bench 能够对这些差距进行系统评估,并支持快速稳健的视觉基础。 Pro-Bench:此 https URL。