论文
有信念无行为:测量视觉语言模型中心理理论向协调社会行动的转化
Belief Without Behavior: Measuring the Translation of Theory of Mind into Coordinated Social Action in Vision-Language Models
摘要
有效的社会互动要求智能体把心理状态推断转化为跨言语与非言语通道同时开展的协调行为信号。然而现有基准把心理理论(ToM)推理与具身行为分开评估,社会推断与社会行动之间的差距未被测量。我们提出MOSAIC(Multimodal Orchestration of Social Action, Inference, and Communication,社会行动、推断与通信的多模态编排),一个受控基准:两个具身智能体在合作与竞争场景中互动,需要在系统性变化的心理理论约束下整合言语陈述、空间轨迹、注视方向与面部表情。我们评估13个模型(含11个VLM)、每模型200次试验,发现VLM无法在ToM阶数约束下产生与预期结果一致的行为,而且施加显式ToM阶数约束并未带来与指定推理水平对齐的可靠行为改变。信号层分析揭示两个相继的瓶颈:多数模型无法产生方向一致的非言语信号;即便信号存在,VLM智能体也无法解读他人行为并对其做出反应。作为带显式ToM模块的结构化架构参照点纳入的PCM-LLM在所有条件下都成功,表明显式的信念—行动耦合是此类任务的一个充分要素。
