论文
心灵还是讯息?多主体社会模拟中的心理审计理论
Mind or Message? Auditing Theory of Mind in Multi-Agent Social Simulation
摘要
语言模型智能体越来越多地用于模拟社交互动,生成的文本读起来就好像智能体彼此理解一样。我们询问这种表象是否基于合伙人的思想模型,或者合伙人所说的表面记录。我们建立了一个社会模拟,其中两个问题都有准确的答案:40 个多问题谈判,其隐藏的偏好权重和其完整的帕累托边界通过构建而已知。两个模型家族在 160 个二元组中进行协商,每个记录在任何测量之前都被冻结,然后 2880 个反事实探针保持证据字节相同,同时一次移动一个因素:读者自己的赌注、合作伙伴的语气、身份标签和递归顺序。这些代理人社交能力强,但经济条件较差。他们在 96.2% 的二人组中达成协议,协议失败次数为零,但只有 0.7% 的交易落在帕累托边界上,他们留下 20.5% 的可用联合价值无人认领,并且在 76.6% 的交易中他们错过了他们的利益完全一致的一个问题;在边境和一致的问题上,从双方都接受的集合中随机抽取的方案也可以。探针定位故障。仅交换读者自己的回报表,而合作伙伴的言语和报价保持不变,会将推断的最高优先级移动 15.0 个百分点,这是以自我为中心的投射而不是推理,而语气重写会将其移动 5.3 个百分点,身份标签移动 0.0 个百分点。最能说明问题的是,智能体在 72.5% 的情况下预测其合作伙伴对此的看法,而该合作伙伴的信念本身只有 51.2% 的情况下是正确的:智能体跟踪对话的效果远远好于跟踪对话背后的思想。