论文
从事物所在到用途:多模式空间功能智能基准测试 LLM
From Where Things Are to What They Are For: Benchmarking Spatial-Functional Intelligence in Multimodal LLMs
摘要
人类水平的代理智能超越了低水平的几何感知,从识别事物的位置发展到理解它们的用途。虽然现有基准有效评估了多模态 大语言模型 (MLLM) 的几何感知能力,但它们未能探究扎根智能所需的高阶认知能力。为了解决这一差距,我们引入了空间功能智能基准 (SFI-Bench),这是一个基于视频的基准,包含来自各种以自我为中心的室内视频扫描的 1,500 多个专家注释问题。 SFI-Bench 系统地评估了高级推理的两个互补维度:(1) 结构化空间推理,需要理解复杂的布局并形成连贯的空间表示;(2) 功能推理,涉及推断对象可供性及其上下文相关的效用。该基准测试包括条件计数、多跳关系推理、功能配对和基于知识的故障排除等任务,直接挑战模型以集成感知、记忆和推理。我们的实验表明,当前的 MLLM 始终难以将空间记忆与功能推理和外部知识结合起来,这凸显了实现扎根智能的关键瓶颈。因此,SFI-Bench 提供了一种诊断工具,用于衡量更具认知能力和真正扎根的多模式代理的进展。