论文
E3VS-Bench:3D 高斯泼溅场景中视点相关主动感知的基准
E3VS-Bench: A Benchmark for Viewpoint-Dependent Active Perception in 3D Gaussian Splatting Scenes
摘要
3D 环境中的视觉搜索需要实体主体主动探索周围环境并获取与任务相关的证据。然而,现有的视觉搜索和嵌入式人工智能基准(包括 EQA)通常依赖于静态观察或受约束的自我中心运动,因此无法明确评估现实 3D 环境中不受限制的 5-DoF 视点控制下出现的细粒度视点相关现象,例如垂直视点移动引起的可见性变化、显示容器内的内容以及消除只能从特定角度观察到的对象属性的歧义。为了解决这个限制,我们引入了 {E3VS-Bench},这是一个具体 3D 视觉搜索的基准,其中智能体必须在 5-DoF 中控制其视点,以收集视点相关的证据来回答问题。 E3VS-Bench 包含使用 3D Gaussian Splatting 重建的 99 个高保真 3D 场景和 2,014 个问题驱动的片段。 3D 高斯溅射可实现逼真的自由视点渲染,保留在基于网格的模拟器中经常退化的细粒度视觉细节(例如,小文本和微妙属性),从而允许构建无法从单个视图回答的问题,而是需要在 5-DoF 中跨视点进行主动检查。我们评估多个最先进的 VLM 并将其性能与人类进行比较。尽管具有强大的 2D 推理能力,但所有模型都与人类存在很大差距,突出了主动感知和连贯视点规划的局限性,特别是在全 5-DoF 视点变化下。