论文
三元狼人:《LLM》中多跳心理理论的小丑角色
Triadic Werewolf: A Jester Role for Multi-Hop Theory of Mind in LLMs
摘要
大语言模型 的心理理论评估通常使用二元社会演绎游戏,其中每个可观察的线索都指向一个隐藏的一面,因此具有强语言先验的模型可以在不模拟对手激励的情况下获得良好的分数。我们用小丑来扩展狼人游戏,这是第三个派系,其对同伴怀疑的效用是倒置的,因为它通过被投票淘汰而获胜,因此最佳游戏需要对三个相反的效用函数进行推理。在 GPT-4.1、DeepSeek-V3.1 和 Llama-3.3-70B 上的 60 场游戏中,小丑自学习开启和关闭,小丑赢得了 60-70% 的游戏,而狼人从未超过 20%,而 GPT-4.1 狼在第一天的 60-70% 游戏中投票淘汰了小丑,这完全是弄巧成拙的行为。自学习有助于 DeepSeek 和 Llama,但会损害 GPT-4.1,其成本落在村民而不是狼人身上。只有 DeepSeek 学会了看起来可疑的微妙策略,而不是故意看起来可疑,并且它从循环中获益最多。三元激励结构暴露了一层多智能体推理,而二元演绎游戏则将其隐藏起来。