论文

LLM Wardens:通过第三方对话监督减轻对抗性说服

LLM Wardens: Mitigating Adversarial Persuasion with Third-Party Conversational Oversight

模型评测安全与风险评测

摘要

LLM 的说服能力越来越强,这就提出了如何保护用户免受操纵的问题。在针对四种决策场景的预注册用户研究 (N=120) 中,我们发现具有隐藏目标的对抗性 LLM 在 65.4% 的时间内成功引导用户决策。然后,我们引入一个“典狱长”模型:一个辅助 LLM,它实时监控人类与人工智能的交互轨迹,并在检测到操纵时向用户发出非约束性的私人建议。添加守望者可以将对手的成功率降低一半以上,达到 30.4%,而真正互动的降低幅度要小得多(8.6 个百分点)。为了探究这些结果背后的机制,我们发布了 COAX-Bench,这是一个涵盖 14 个决策场景的模拟基准,包括招聘、投票和文件访问。在 16,212 次模拟的多智能体交互中,有能力的对抗性 LLM 在 34.7% 的情况下实现了其隐藏目标,而 Warden 模型将这一比例降低至 12.3%。值得注意的是,即使监管者模型比他们监督的对手弱得多,也能提供有意义的保护,这表明了对能力更强的模型进行可扩展监督的途径。