论文
超越笛卡尔错觉:知觉瓶颈下两阶段多模态心智理论的检验
Beyond the Cartesian Illusion: Testing Two-Stage Multi-Modal Theory of Mind under Perceptual Bottlenecks
摘要
尽管多模态大语言模型(MLLM)在通用推理上展现出令人印象深刻的能力,其具身空间智能仍受“笛卡尔错觉”困扰——即依赖缺乏真实三维拓扑理解的文本概率分布。这一局限在多智能体环境中暴露无遗,这类环境不仅需要场景感知,还需要二阶心智理论(ToM)。具体而言,智能体A必须能够推断智能体B关于环境的信念,而这一信念严格受B的物理朝向和感知限制支配。本文通过一个新颖的视听任务探测MLLM两阶段空间推断的极限:要求智能体A预测智能体B对A相对位置的估计。为解决这一问题,我们提出认知知觉瓶颈(Epistemic Sensory Bottleneck)模块,摒弃僵化的基于规则的坐标变换。取而代之,我们引入基于锚点的具身空间分解思维链(CoT)。这引导MLLM完成“几何到语义”的投影,迫使其先建立B的局部坐标系,再根据A是否落在B的视觉视锥内来动态加权视觉与听觉模态。大量评估表明,尽管当前MLLM在空间对称性和视野外歧义上存在根本性困难(确立了42%准确率的严格零样本基线),我们的知觉受限推理链稳健地优于纯自我中心和他者中心(allocentric)基线。通过系统性地对这些知觉瓶颈进行基准测试,我们的工作揭示了MLLM空间推理的当前极限,并为具身AI中的认知性、模态感知推断奠定了基础范式。
