论文
EgoPathBench:评估视觉语言模型中的零样本自我中心路点决策
EgoPathBench: Evaluating Zero-Shot Egocentric Waypoint Decision-Making in Vision-Language Models
摘要
零镜头航路点导航需要视觉语言模型从当前的第一人称观察中选择一系列对代理可行并达到目标的空间动作,这对当今基础 VLM 的集成空间智能提出了共同要求。现有的空间智能基准主要评估对关系、方向或目标的孤立判断,因此不能直接衡量结合目标识别、行动后果评估、距离估计和路径规划所需的组合导航能力。为了填补这一评估空白,我们引入了 EgoPathBench,这是一个用于第一人称航路点决策的数据集和五任务基准。每个问题都呈现一个以自我为中心的 RGB 图像、一个自然语言目标和编号的可见路径点;模型返回可遍历的候选者或有序路线。评估候选可行性、相邻边合法性以及点代理或具体几何下的目标到达情况的预测。 EgoPathBench 包含 31,852 个训练问题、1,345 个验证问题和 1,111 个基准问题,并为每个路线问题保留至少一条经过几何验证的参考路线。在 9 个 VLM 中,最高的 EgoPath 分数仅为 28.3。排名第一的模型在点路径上达到了 35.9% 的成功率,但在具体路径和意图路径上分别只有 2.9% 和 4.0%,这表明当前模型在具体约束下形成完整的、目标一致的路线仍然有限。除了评估数据之外,我们还发布了相应的训练资源。在发布的训练集上对 Qwen 3.5 4B 进行微调,将其 EgoPath 分数从 3.9 提高到 38.9,并改进了三个外部空间基准的所有四项报告评估,增益为 1.4--9.6 分。