论文
探索、建图、记忆、决策:具身VLM为安全关键场景做好准备了吗?
Explore, Map, Remember, Decide: Are Embodied VLMs Ready for Safety-Critical Scenarios?
摘要
Theory of Space框架(ToS)评估好奇心驱动的视觉语言模型(VLM)在部分可观测条件下的空间理解能力。随着AI技术日益应用于安全关键场景,理解VLM是否具备稳健的空间记忆并做出可靠决策至关重要。本文评估VLM的决策是基于物理证据还是被视觉-语言偏差所破坏、其记忆过程是否符合人类认知模式,以及它们如何应对环境危险。我们将ToS框架扩展为一条安全关键、目标驱动的流水线,命名为Explore、Map、Remember与Decide(EMRD)。随后我们通过环境覆盖与时间效率指标量化探索能力(Explore),评估空间保真度(Map),用一组心理学指标评估记忆持久性(Remember),并用焦点指标测量认知决策(Decide)。结果显示,在决策能力方面,VLM经常基于预训练的文本先验选择撤离点,却缺乏能证明其选择合理性的空间依据。我们还发现空间推理在低光照条件下退化,但不受纹理和颜色篡改的影响。研究结果表明VLM的记忆与人类认知存在根本差异,带来不可预测的错位风险。
