论文

推理促进心智理论任务中的鲁棒性

Reasoning Promotes Robustness in Theory of Mind Tasks

模型评测模型训练强化学习鲁棒性、公平性与可信度评测RLVR

摘要

大语言模型(LLM)近来在心智理论(ToM)测试上表现强劲,引发对其底层能力性质与真实水平的争论。与此同时,经可验证奖励强化学习(RLVR)训练的面向推理的 LLM 在一系列基准上取得显著改进。本文考察此类推理模型在 ToM 任务中的行为,使用机器心理实验的新颖改编与既有基准的结果。我们观察到,推理模型对提示变化与任务扰动始终表现出更强的鲁棒性。我们的分析表明,所观察到的增益更可能归因于在寻找正确解上的鲁棒性增强,而非全新形式的 ToM 推理。我们讨论这一解释对评估 LLM 社会认知行为的含义。