论文
Spatial-IQ:通过分层能力测试解构空间智能
Spatial-IQ: Deconstructing Spatial Intelligence via Hierarchical Capability Tests
摘要
多模态 大语言模型 (MLLM) 擅长视觉解释,但无法完成人类可靠解决的空间推理任务。现有的基准将这些模型评估为黑匣子,限制了它们识别性能较低的根本原因的能力:当模型未能完成空间推理任务时,仍然很难确定障碍是感知的(例如识别对象边界)还是认知的(例如推理遮挡以推断隐藏的几何形状)。我们引入了 Spatial-IQ,这是一个分层诊断框架,它将堆叠 3D 结构中的对象计数分解为按人类空间认知发展阶段组织的 9 个感知和认知子任务,并以心理旋转作为额外的目标探测。使用 NVIDIA Isaac Sim,我们以程序方式生成了包含大约 80,000 个堆叠 3D 结构(每个任务为 真值)的多样化数据集。我们根据人类基线评估三种输出格式(自由响应文本、多项选择图像和图像编辑)的模型。 Spatial-IQ 框架表明,表现最好的模型通常在目标任务(对象计数)上取得成功,但在旨在支持目标任务的较低级别子任务上却没有取得成功,并且模型在保留这些层次链的程度方面有所不同,通常揭示了原始目标任务准确性本身会掩盖的捷径行为。最后,我们证明了对分层子任务进行思想链(CoT)监督的训练模型,结合具有可验证奖励的强化学习,显着提高了子任务之间的空间一致性和目标任务的准确性,支持了所提出的分解作为诊断工具和训练信号的价值。