论文
SleepWalk:压力测试指令引导视觉语言导航的三层基准
SleepWalk: A Three-Tier Benchmark for Stress-Testing Instruction-Guided Vision-Language Navigation
摘要
视觉语言模型 (VLM) 在多模态感知和语言理解方面取得了快速进展,但仍不清楚它们是否能够可靠地将语言转化为 3D 数字环境中空间连贯、看似可执行的动作。我们引入了 SleepWalk,这是一个基准,用于评估单场景 3D 世界中基于指令的轨迹预测,该预测是根据文本场景描述生成的,并经过过滤以确保可导航性。与之前以跨房间的远程探索为中心的导航基准不同,SleepWalk 的目标是局部的、以交互为中心的体现推理:给定渲染的视觉观察和自然语言指令,模型必须预测尊重场景几何形状、避免碰撞并终止于动作兼容位置的轨迹。该基准涵盖不同的室内和室外环境,并将任务分为空间和时间难度的三层,从而能够在不断增加的组成复杂性下对空间对应进行细粒度分析。使用基于标准化逐点判断的评估协议,我们在 2,472 个精心策划的 3D 环境中评估了三个前沿 VLM,每个场景有 9 条指令。结果揭示了扎根空间推理的系统性失败,特别是在遮挡、交互约束和多步骤指令下:随着任务难度的增加,性能下降。一般来说,当前的 VLM 在某种程度上可以产生同时空间一致、看似可执行且与预期动作一致的轨迹。通过在受控但可扩展的环境中暴露故障,SleepWalk 为在 3D 环境中推进扎根的多模态推理、具体规划、视觉语言导航和具有行动能力的代理提供了关键基准。