论文

ArchSIBench:视觉语言模型的建筑空间智能基准测试

ArchSIBench: Benchmarking the Architectural Spatial Intelligence of Vision-Language Models

模型评测基准与评测资源

摘要

建筑空间智能,即识别和推断建筑空间的能力,是机器人导航、实体交互以及 3D 场景理解和生成等任务的基础。尽管广泛的研究已经评估了视觉语言模型(VLM)的基本空间技能,例如相对方向、距离比较和对象计数,但这些任务仅涵盖了最基本的空间认知水平,很大程度上忽视了对建筑空间的更高层次的认知,包括布局理解、流通模式和功能分区。在这项工作中,我们提出了 ArchSIBench,这是一个基于建筑学、认知科学和心理学视角的建筑空间智能基准。 ArchSIBench涵盖感知、推理、导航、转换、配置五个核心维度,包含17个细粒度子任务。通过具有建筑背景的专家的精心手工标注,我们构建了3000个问答对,以实现建筑空间智能的综合评估。基于ArchSIBench,我们评估了各种VLM,发现大多数模型的建筑空间智能与人类基线存在显着差异;此外,模型在能力维度上表现出很大的可变性。一些最先进的模型无需架构训练即可接近人类评估者的水平。然而,与接受过建筑训练的人类评估者相比,仍然存在明显的差距,特别是在空间转换和配置推理方面。我们相信,ArchSIBench 将为测量和推进 VLM 的建筑空间智能提供重要的见解和系统资源。数据集和代码可在 https://huggingface.co/datasets/ArchSIBench/ArchSIBench 获取。