论文

从生成的角度探索空间智能

Exploring Spatial Intelligence from a Generative Perspective

模型评测基准与评测资源

摘要

空间智能对于多模式 大语言模型 至关重要,但当前的基准测试很大程度上仅从理解的角度对其进行评估。我们询问现代生成或统一多模态模型是否也具有生成空间智能(GSI),在图像生成过程中尊重和操纵 3D 空间约束的能力,以及是否可以测量或改进这种能力。我们推出 GSI-Bench,这是第一个旨在通过基于空间的图像编辑来量化 GSI 的基准。它由两个互补的组件组成:GSI-Real(通过 3D 优先引导生成和过滤管道构建的高质量现实世界数据集)和 GSI-Syn(具有可控空间操作和全自动标记的大规模合成基准)。与统一的评估协议一起,GSI-Bench 可以对空间合规性和编辑保真度进行可扩展的、与模型无关的评估。实验表明,GSI-Syn 上的 微调 统一多模态模型在合成任务和实际任务上都取得了巨大的进步,而且令人惊讶的是,还提高了下游空间理解。这提供了第一个明确的证据,证明生成训练可以切实加强空间推理,为在多模态模型中推进空间智能建立新途径。