一起玩:学习双重代理防御者,通过心理理论进行信念引导
Playing Along: Learning a Double-Agent Defender for Belief Steering via Theory of Mind
摘要
随着 大语言模型 (LLM) 成为对话系统背后的引擎,它们推理对话伙伴的意图和状态的能力(即形成和使用心理理论或 ToM)对于与潜在敌对伙伴的安全交互变得越来越重要。我们提出了一种新颖的以隐私为主题的 ToM 挑战,即 ToM for Steering Beliefs (ToM-SB),其中防御者必须充当双重代理,在共享宇宙中利用部分先验知识来引导攻击者的信念。为了在 ToM-SB 上取得成功,防御者必须与攻击者互动并形成攻击者的 ToM,目的是欺骗攻击者,让他们相信他们已成功提取敏感信息。我们发现,像 Gemini3-Pro 和 GPT-5.4 这样的强大前沿模型在 ToM-SB 上表现不佳,即使在被提示推理攻击者信念(ToM 提示)时,也常常无法在困难场景中利用部分攻击者先验知识来愚弄攻击者。为了缩小这一差距,我们使用强化学习在 ToM-SB 上训练模型作为人工智能双重代理,测试愚弄和 ToM 奖励。值得注意的是,我们发现 ToM 和攻击者愚弄之间存在双向的新兴关系:单独奖励愚弄成功可以改善 ToM,而单独奖励 ToM 可以改善愚弄行为。通过四种具有不同优势的攻击者、六种防御方法以及分布内和分布外 (OOD) 评估,我们发现 ToM 和攻击者欺骗的收益具有良好的相关性,这凸显了信念建模是 ToM-SB 成功的关键驱动因素。结合 ToM 和愚弄奖励的 AI 双代理可产生最强的愚弄和 ToM 性能,在困难场景下优于 Gemini3-Pro 和带 ToM 提示的 GPT-5.4。我们还展示了 ToM-SB 和 AI 双代理可以扩展到更强的攻击者,展示了 OOD 设置的泛化性和我们任务的可升级性。