论文

大语言模型是信任告发者还是告发内容?基于狼人杀的信念转移测量

Do LLMs Trust the Accuser or the Accusation? Measuring Belief Shifts in Werewolf

模型评测模型行为与机制分析

摘要

狼人杀类社会推理解谜游戏正被用于评估大语言模型智能体,但现有评估多依赖最终游戏结果。我们提出一种基于狼人杀的信念转移评估基准,通过信念更新来分析沟通能力。利用大语言模型参与的游戏,我们标注了怀疑与指控消息,并测量观察方村民阵营模型在每条消息后信念的变化。我们在1224条标注消息上评估了40种开源大语言模型配置。结果表明,模型规模越大,越能根据游戏历史区分真实狼人与村民,但指控仍显著影响其信念。模型对被指控目标的怀疑程度上升,对指控方的怀疑程度下降,尤其当指控方被信任时,即使指控方为狼人阵营。规模更大的模型能更好地抵抗其已不信任的指控方的指控。总体而言,我们的研究发现,当前参数最多达120B的开源大语言模型在战略沟通中仍难以将指控内容与指控来源的信任度有效整合。该基准及代码可在此链接获取。

大语言模型是信任告发者还是告发内容?基于狼人杀的信念转移测量:论文配图
图 1:信念转变测量流程概述。对于每个游戏,我们都会对指控消息进行注释,并在每条消息之前和之后重建观察代理的视图。该模型首先报告其先前对原告和被指控目标的信念,然后报告由该消息引起的信念转变。