论文

有信念无行为:测量视觉语言模型中心理理论向协调社会行动的转化

Belief Without Behavior: Measuring the Translation of Theory of Mind into Coordinated Social Action in Vision-Language Models

智能体系统Agent任务评测

摘要

有效的社会互动要求智能体把心理状态推断转化为跨言语与非言语通道同时开展的协调行为信号。然而现有基准把心理理论(ToM)推理与具身行为分开评估,社会推断与社会行动之间的差距未被测量。我们提出MOSAIC(Multimodal Orchestration of Social Action, Inference, and Communication,社会行动、推断与通信的多模态编排),一个受控基准:两个具身智能体在合作与竞争场景中互动,需要在系统性变化的心理理论约束下整合言语陈述、空间轨迹、注视方向与面部表情。我们评估13个模型(含11个VLM)、每模型200次试验,发现VLM无法在ToM阶数约束下产生与预期结果一致的行为,而且施加显式ToM阶数约束并未带来与指定推理水平对齐的可靠行为改变。信号层分析揭示两个相继的瓶颈:多数模型无法产生方向一致的非言语信号;即便信号存在,VLM智能体也无法解读他人行为并对其做出反应。作为带显式ToM模块的结构化架构参照点纳入的PCM-LLM在所有条件下都成功,表明显式的信念—行动耦合是此类任务的一个充分要素。

有信念无行为:测量视觉语言模型中心理理论向协调社会行动的转化:论文配图
图1:MOSAIC 基准设计。(左上)两个智能体在虚拟环境中交互:主体知道奖励位置,并根据被指派的关系模式决定帮助或误导参与者。(左下)四种实验条件将交互模式(竞争 vs. 合作)与ToM约束级别(ToM-0 vs. ToM-1)交叉组合,每个条件每个模型50次试验。(右)每次试验进行10轮;第3、6、9轮除非言语动作外还包含言语交流阶段。在非言语轮次中,每个智能体接收上下文提示、第一人称视角的视觉感知以及结构化的信念-观察状态,并产生动作推理以及运动动作(移动、旋转或保持静止)和情绪表达(肌肉骨骼与生理通道)。在言语轮次中,相同输入之外还补充对话者的语音,智能体生成内心言语推理轨迹和自然语言回答。