论文
从捷径到推理:强化学习的鲁棒 后训练 心理理论
From Shortcuts to Reasoning: Robust Post-Training of Theory of Mind with Reinforcement Learning
摘要
心智理论 (ToM) 是现代基础模型系统在现实世界中有效、安全运行所必须掌握的技能。最近的作品探索了通过 后训练 磨练 ToM;然而,我们表明这种进步被普遍存在的“捷径”问题所困扰:通过简单地利用虚假的因果相关性,任务可以达到高达 99% 的准确率,从而导致对 ToM 的错误认识。受此启发,我们首先开发了一个框架来系统地检查 ToM 数据集的捷径,并为未来的开发提供指导。我们发现,与心灵问题(例如“意图”)相比,可简化为纯粹状态跟踪的问题(例如“信念”)尤其容易走捷径,因为“意图”需要超出跟踪的推理。然后,我们使用跨三个 ToM 上下文的四个无捷径数据集,全面研究具有可验证奖励和显式推理链(称为 Thinking-RFT)的强化 微调 是否将 ToM 提升到监督 微调 或 SFT 之上。我们的主要发现如下。首先,Thinking-RFT在所有场景下都有效提升了ToM,比SFT提升了6%,特别是在复杂高阶推理中,比SFT提升了10%,多模态情况下,比SFT提升了7%。它还对未见过的领域和高阶查询具有更好的泛化能力,同时对反事实更加稳健。其次,ToM 特别受益于推理和 RL 的联合效应:Thinking-RFT 比 Non-Thinking-RFT 平均高出 7%。第三,RFT 的工作原理是学习将其推理建立在锚定线索上,例如与因果因素相对应的关键字和状态变化。我们相信我们的研究对于开发有效且强大的 ToM 后训练 数据集和推进关键 ToM 功能很有用。