论文
VCN-Bench:基于先前视觉体验进行空间推理的视频上下文导航基准
VCN-Bench: A Video-Contextualized Navigation Benchmark for Spatial Reasoning over Prior Visual Experience
摘要
空间推理是实体主体的基础,但目前尚不清楚空间理解是否可以进一步指导顺序交互。现有的空间推理基准通常终止于离线预测,而导航基准将空间推理评估为指令遵循和探索的一部分。我们引入了 VCN-Bench,一个 \textbf{V}ideo-\textbf{C}ontextualized \textbf{N} 导航基准,用于探索 MLLM 中先前视觉体验的闭环空间推理。给定覆盖初始位置和目的地的先前视频,Agent的任务是推理出指令指定的目标,并利用推断的空间上下文导航到该目标。 VCN-Bench 基于 Matterport3D 构建,包含五种指令类型、100k 训练集和 1,250 个评估集。导航作为主要评估,而诊断目标识别有助于区分目的地分辨率错误和后续导航失败。我们进一步提出了 MV-DualVLN,这是一种面向规划的基线,联合利用先前的视频和剧集内的观察结果。实验表明,导航性能有限,目的地分辨率与导航差距很大,即使在正确识别目的地后,导航也会频繁失败。