论文

评估推理模型中的心理理论:推理的稳健性

Evaluating Theory of Mind in Reasoning Models: Robustness over Reasoning

模型评测鲁棒性、公平性与可信度评测

摘要

大语言模型 (LLM) 最近在心智理论 (ToM) 测试中表现出强劲的表现,引发了关于底层功能的性质和有效性的争论。与此同时,通过具有可验​​证奖励的强化学习进行训练的面向推理的 LLM 在一系列基准测试中表现出了显着的改进。在这项工作中,我们使用机器心理实验的新颖改编以及既定基准的结果来检查此类推理模型在 ToM 任务中的行为。我们观察到推理模型始终表现出对提示变化和任务扰动的增强的鲁棒性。我们的分析表明,这些收益至少部分来自于模型在提示和任务变化下更稳健地得出正确答案。我们将此视为基于稳健性的帐户的证据,而不是新的 ToM 特定能力的证据。