论文

SSMNBench:通过单视图充分性和多视图必要性诊断基于图像的跨视图人对象理解

SSMNBench: Diagnosing Image-based Cross-View Human-Object Understanding via Single-View Sufficiency and Multi-View Necessity

模型评测基准与评测资源

摘要

多模态 大语言模型 (MLLM) 在单图像感知方面取得了显着进展,但它们推理复杂的以人为中心的跨视图场景的能力在很大程度上尚未得到验证。当前的多视图基准使用固定的“帧袋”来评估模型,从而将模型对视觉干扰的鲁棒性与其融合碎片交叉视图证据的真正能力混为一谈。为了解决这个问题,我们引入了 SSMNBench,这是一个诊断基准,包含 3,300 个精心策划的 QA 对,用于跨视图人类和人类物体理解。 SSMNBench 独特地将任务分为单视图充分性 (SVS) 和多视图必要性 (MVN)。通过系统地扰乱 17 个最先进的 MLLM 中的视图可用性,显露出了关键的局限性:当呈现冗余视图 (SVS) 时,模型会遭受严重的“干扰退化”,并且无法跨摄像机 (MVN) 整合零碎的几何证据。我们的评估表明,现代 MLLM 依赖于多个单图像语义平均和视图偏好,而不是真正的跨视图合成。通过暴露这些基本漏洞,SSMNBench 提供了严格的诊断框架,以推动未来跨视图感知多模式架构的进步。代码位于:$ \href{https://github.com/gtc-gh/SSMNBench}{\text{SSMNBench}} $