论文

OSCToM:面向高阶心智理论的RL引导对抗生成

OSCToM: RL-Guided Adversarial Generation for High-Order Theory of Mind

模型训练合成数据

摘要

大语言模型(LLM)在许多语言任务上表现出色,但在复杂社会情境中的心智理论(ToM)推理仍不稳定。包括ExploreToM在内的现有基准并不总能测试那些使这些情境变得困难的递归信念与信息不对称。本文提出OSCToM(Observer-Self Conflict Theory of Mind),一种在基于LLM的ToM任务中建模嵌套信念冲突的方法。关键情形是观察者对另一个体的看法与观察者自身的信念状态相冲突。此类情形超越了简单的视角采择,需要递归的多层推理。OSCToM结合强化学习(RL)、扩展的领域特定语言与组合式代理模型来生成观察者-自我冲突。在我们的实验中,OSCToM-8B在受测系统中取得最佳总体结果。它在FANToM上改进了已报道的ExploreToM结果,并在Hi-ToM与BigToM上保持竞争力。在信息不对称的FANToM基准上,OSCToM达到76%准确率,而ExploreToM报告的为0.2%。数据合成流程的效率也提高了6倍,表明有针对性的训练数据能帮助更小的模型处理高级认知推理。项目代码发布于 https://github.com/sharminsrishty/osct。

OSCToM:面向高阶心智理论的RL引导对抗生成:论文配图
图 1:OSCToM 系统架构。左侧模块描述了构建 OSCT 数据集的对抗性故事生成器(结合 RL 和代理评估)。右侧模块描述了后续的 LLM 微调流程,产生最终的 OSCToM-8B 模型。