论文
Avalon-ToM-Bench:用非对称博弈机制评估细粒度心理理论
Avalon-ToM-Bench: Evaluating Fine-Grained Theory of Mind via Asymmetric Game Mechanics
摘要
心理理论(ToM)对智能体交互至关重要,但现有评估要么依赖过度简化心理状态推理的静态场景,要么采用诊断洞察有限的交互设定。我们提出Avalon-ToM-Bench,一个通过《The Resistance: Avalon》非对称信息机制操作化ToM的细粒度基准。它不评估端到端对局,而是用人工构建、视角受限的查询将ToM分解为2×2分类:认识性对动机性推理,交叉推理对行动。对28个大语言模型的基准测试揭示三点洞见:1)是推理问题,不是知识问题。模型表现出较强的游戏规则理解,但ToM能力明显更弱,说明失败源于社会推理而非领域知识缺失。2)是表达问题,不是表征问题。通过线性探针和激活引导的机制分析表明,模型经常在隐藏状态中表征了正确的心理状态推断,却在生成时未能表达出来——线性探针可达77-82%的准确率,而模型自身的思维链仅为62-70%。3)是策略问题,不是深思问题。专门的推理训练带来大幅提升,而测试时思维链仅带来边际收益(平均+11.0分对比+1.1分),表明稳健的ToM依赖于学习到的推理策略,而非增加推理时深思。