论文

IDEAL-Bench:用于分析 3D 布局推理的室内数据集和评估套件

IDEAL-Bench: Indoor Dataset and Evaluation suite for Analyzing 3D Layout reasoning

模型评测基准与评测资源

摘要

空间问答是评估视觉语言模型 (VLM) 中空间智能的主导范式,但它留下了一个空间能力的补充轴未被充分评估:整体 3D 布局推理,它可以从结构化形式的单个图像中预测每个可见物体的姿势和范围。为此,我们推出了 IDEAL-Bench,这是一个评估套件,需要 VLM 预测 10 种房间类型的逼真室内场景的结构化 3D 布局,并根据五个数字维度和感知渲染和比较协议进行评分。通过在受控照明和视点下对语义真实的场景进行完全资产替换,IDEAL-Bench 超越了 CLEVR 风格的简单几何图元,因此任何图像空间差异都可以单独反映空间推理。该基准测试建立在 IDEAL-Scenes 之上,IDEAL-Scenes 是一个由程序生成的数据集,包含 1,000 个可重新渲染的 Blender 环境,具有 真值 布局。对 15 个著名的 VLM 的评估揭示了三个发现:该任务基本上仍未解决,最强的模型总体仅达到 62.1/100;所有模型在对象识别和几何回归之间都表现出明显的不对称性,这表明当前的 VLM 被训练来描述场景而不是测量场景;模型排名部分不同于基于 QA 和原始重建基准的模型排名:顶级共识成立,但中层排名发生重大变化。总的来说,这些发现将 IDEAL-Bench 确立为诊断套件,针对基于 QA 的评估无法显现的几何和结构能力,并为下一代 VLM 中的空间智能进行更严格的评估铺平道路。总之,这些发现将 IDEAL-Bench 定位为未来 VLM 是否实现真正的空间理解而不是语言近似的原则性诊断。