论文

PinpointQA:室内视频中以小对象为中心的空间理解的基准

PinpointQA: A Benchmark for Small Object-Centric Spatial Understanding in Indoor Videos

模型评测基准与评测资源

摘要

室内环境中可靠的实体交互需要智能体通过视觉观察精确定位日常的小物体。然而,这种基本能力对于多模态 大语言模型 (MLLM) 来说仍然具有挑战性,特别是当必须从室内视频中进行空间理解时。现有的基准研究视频空间智能和体现推理,但没有直接评估模型是否能够定位小目标对象并以足够的精度表达其位置。我们引入 PinpointQA,这是一个基于 ScanNet++ 和 ScanNet200 构建的基准测试。它包含 1,024 个场景和 10,094 个 QA 对,涉及四个逐渐具有挑战性的任务:目标存在验证、最近参考识别、细粒度空间描述和结构化空间预测。 真值 注释是根据对齐的 3D 几何和实例级注释派生的中间空间表示构建的,而评估的模型仅接收采样的 RGB 视频帧。对代表性 MLLM 的评估表明,在整个任务进展过程​​中,性能持续下降,结构化空间预测仍然特别具有挑战性,而有监督的 微调 则显着提高了性能。通过隔离下游具体交互之前的空间基础能力,PinpointQA 既可以作为诊断基准,也可以作为有效的训练资源。该项目页面位于 https://rainchowz.github.io/PinpointQA/。