论文

MafiaScope:社交演绎游戏中 LLM Agent的非侵入性、时间分辨信念探测

MafiaScope: Non-Invasive, Time-Resolved Belief Probing for LLM Agents in Social Deduction Games

模型评测模型能力评测

摘要

LLM 智能体的公开行为几乎无法揭示其社会推理:正确投票的智能体可能会进行猜测,而撒谎得当的智能体不会留下任何其实际相信的痕迹。我们推出了 MafiaScope,这是一个开放的测试平台,可将社交演绎游戏 Mafia 转变为机器心理理论的测量工具。它区分了智能体失败是因为误读了游戏,还是因为未能根据正确的评估采取行动,这种区别仅从结果和对话记录中是看不见的。在每次公开发言后,每个代理都会私下回答结构化的探测问题,其回答永远不会重新进入游戏,并根据引擎已知的 真值 进行评分。交互式可视化工具从单个代理信念的角度重播游戏,显示时间线对齐的准确性和校准,并支持任何记录步骤的反事实重播。在包含数以万计的解析探测响应的两个模型系列的案例研究中,我们发现陈述的置信度校准不佳,代理高估了他们被怀疑的频率达 1.5 倍,单票反事实重播很少改变游戏结果:结果翻转主要发生在代理已经形成正确的信念状态时,而在不正确的世界模型下做出的决策在重采样下基本保持不变。引擎、可视化工具、录制的游戏和反事实重播语料库均根据开源许可证发布。代码:https://github.com/karpovilia/mafiascope。现场演示:https://karpovilia.github.io/mafiascope/。截屏视频:https://vimeo.com/1208920221。