论文

TriViewBench:MLLM 中多视图结构推理的受控复杂度缩放

TriViewBench: Controlled Complexity Scaling for Multi-View Structural Reasoning in MLLMs

模型评测基准与评测资源

摘要

多模态 大语言模型 (MLLM) 在标准视觉问答基准上表现出强大的性能,但其在受控结构复杂性下的可扩展性仍然知之甚少。我们介绍了 TriViewBench,这是一种受控三视图视觉推理基准,由具有显式参数化对象计数和遮挡的合成 3D 场景构建。该基准测试包含 1,923 个场景和超过 14K 个问答 (QA) 对,分为四个复杂级别和三个推理类别:局部决策、对象计数和全局恢复。我们在统一的提示协议下评估了 18 个开源和闭源 MLLM。所有 18 个模型无一例外地表现出相同的能力层次结构(本地决策 > 对象计数 > 全局恢复),并且性能随复杂性单调下降:本地决策任务适度下降(相对下降 12.11%),而对象计数大幅下降(59.14%),全局恢复严重崩溃(80.02%)。对象计数的错误分析揭示了两种机械上独立的故障模式:单视图任务主要是由于遮挡盲性而导致计数不足,而多视图任务则由于跨视图身份混淆而导致计数过多。思想链(CoT)提示的总体效益接近于零($Δ= -0.16\%$),并且其对全球复苏的影响受到强烈的能力限制,这表明瓶颈在于跨视图空间表示而不是推理策略。这些发现揭示了当前 MLLM 的基本可扩展性限制,并将 TriViewBench 定位为分析结构推理故障的受控诊断框架。