论文

超越莎莉安妮:使用认知谢林点评估 LLM 中的心理理论

Beyond Sally-Anne: Evaluating Theory of Mind in LLMs using Epistemic Schelling Points

模型评测基准与评测资源

摘要

大语言模型 (LLM) 中基于文本的心智理论 (ToM) 评估通常涉及类似于 Sally-Anne 任务的认知测试,该任务可以由于接触 预训练 中的相关类似任务而进行游戏,并且不会以泛化到自然设置的方式明显测试模型的功能 ToM 能力。为了解决这些问题,我们引入了认知不对称谢林任务(EAST),这是一种两人对话游戏,旨在对稳健且可推广的 ToM 能力进行基准测试。通过要求 LLM-LLM 二元组在不同的认知透明度状态下独立地收敛于语义谢林点,我们评估模型是否可以稳健地应用 ToM 来实现协调。我们的结果揭示了功能性社会推理中存在显着的能力差距,只有前沿模型才能成功地满足任务的不同认知需求。推理痕迹分析表明,协调失败主要是由认知跟踪错误引起的,例如将私有知识与共同知识混为一谈。尽管在传统静态基准上表现出色,但我们的研究表明,强大的社会推理和认知跟踪仍然是一个关键瓶颈,为未来的 LLM 评估和开发提供了具体目标。