论文

SpaceConflict:从可报告空间事实到可用状态

Seeing, Saying, but Not Using: From Reportable Spatial Facts to Usable States in Multimodal Large Language Models

应用与实践视觉感知与空间理解

摘要

能正确报告空间事实的多模态大语言模型未必在后续推理中使用该事实。为研究这一区分,我们提出SpaceConflict——面向空间状态构建与使用的23196输入基准。在统一的Supported/Contradictory/Unknown判断接口下,覆盖局部事实绑定(L1)、关系组合(L2)、跨观测一致性(L3)与变换下的状态判断(L4)。在同一世界上提出直接状态查询、完整变换查询与显式初始状态查询,揭示出可用性-利用差距:模型能从视觉证据恢复初始状态,但当该状态必须驱动变换时失败。Qwen3.5-9B的100个正确恢复初始状态的序列中50个在完整变换上失败,显式提供该状态则全部修复;差距随规模缩小但不闭合。为此我们提出操作状态监督(OSS):监督任务相关空间状态及其变换轨迹,并对齐跨上下文的共享事实。OSS在匹配判断的配对准确率上改善最大的是依赖组织与使用状态的L3与L4。评估多模态空间推理因此不仅要问模型能否看见并陈述空间事实,还要问该事实是否成为后续计算中可用的状态。