论文

超越笛卡尔错觉:知觉瓶颈下两阶段多模态心智理论的检验

Beyond the Cartesian Illusion: Testing Two-Stage Multi-Modal Theory of Mind under Perceptual Bottlenecks

模型推理推理策略与问题分解

摘要

尽管多模态大语言模型(MLLM)在通用推理上展现出令人印象深刻的能力,其具身空间智能仍受“笛卡尔错觉”困扰——即依赖缺乏真实三维拓扑理解的文本概率分布。这一局限在多智能体环境中暴露无遗,这类环境不仅需要场景感知,还需要二阶心智理论(ToM)。具体而言,智能体A必须能够推断智能体B关于环境的信念,而这一信念严格受B的物理朝向和感知限制支配。本文通过一个新颖的视听任务探测MLLM两阶段空间推断的极限:要求智能体A预测智能体B对A相对位置的估计。为解决这一问题,我们提出认知知觉瓶颈(Epistemic Sensory Bottleneck)模块,摒弃僵化的基于规则的坐标变换。取而代之,我们引入基于锚点的具身空间分解思维链(CoT)。这引导MLLM完成“几何到语义”的投影,迫使其先建立B的局部坐标系,再根据A是否落在B的视觉视锥内来动态加权视觉与听觉模态。大量评估表明,尽管当前MLLM在空间对称性和视野外歧义上存在根本性困难(确立了42%准确率的严格零样本基线),我们的知觉受限推理链稳健地优于纯自我中心和他者中心(allocentric)基线。通过系统性地对这些知觉瓶颈进行基准测试,我们的工作揭示了MLLM空间推理的当前极限,并为具身AI中的认知性、模态感知推断奠定了基础范式。

超越笛卡尔错觉:知觉瓶颈下两阶段多模态心智理论的检验:论文配图
图 1:笛卡尔错觉困境与建议的二阶 ToM 推理任务的比较。 (A) 传统的 MLLM 屈服于笛卡尔错觉,假设空间关系完全对称的全知全局坐标系。 (B) 在我们提出的任务中,智能体 A 必须预测智能体 B 的内部信念状态 (B​e​l​i​e​fB​(P​o​sA))\left(Belief_{B}\left(Pos_{A}\right)\right)。由于智能体 A 位于智能体 B 的视觉视锥体 (FOV) 之外,因此推理需要进行视角转换 (P​IA→B)\left(PI_{A}\rightarrow B\right) 来显式模拟感官瓶颈,迫使智能体 B(以及智能体 A 对 B 的模拟)依赖于空间音频和自运动,而不是视觉确认。