论文

学习说服揭示了如何轻易放弃正确的信念 LLM

Learning to Persuade Exposes How Easily LLMs Abandon Correct Beliefs

模型训练强化学习

摘要

说服是自然语言交流的核心动力,影响着 大语言模型 (LLM) 更新信念、解决分歧和达成决策的方式。随着 LLM 越来越多地与人类和彼此进行辩论、建议和协作思考,抵制有害说服成为可靠行为的核心要求。然而我们表明,这一要求还远远没有得到满足:单个有针对性的有说服力的论证就足以将模型的准确性降至接近于零,即使该论证实际上是错误的。我们将这种威胁形式化为对抗性说服,并引入对抗性强化学习框架,训练说服者代理在单次交互中改变目标模型的答案。首先,我们表明,通过反复试验来优化说服策略会暴露出静态提示错过的漏洞:与训练时的被说服者相比,经过 RL 训练的说服者将说服成功率从大约 24% 提高到了 93% 以上。其次,我们发现这些学习到的策略转移到了未见过的模型上,在 Qwen-14B 上实现了 83% 的攻击成功率,在 Llama-3.1-8B 上实现了 79% 的攻击成功率,在 GPT-4o-mini 上实现了 25% 的攻击成功率。第三,我们证明,在针对更难的模型之前引导更具说服力的开放权重模型的课程进一步将 GPT-4o-mini 攻击的成功率从 25% 提高到 38%。此外,我们的结果表明,优化的说服者越来越依赖基于可信度的策略,包括伪造的引文和虚假的权威证据。总之,这些发现暴露了当前 LLM 智能体的一个关键弱点:即使它们最初推理正确,也可能通过优化的自然语言影响而得出错误的结论。这使得说服稳健性成为多智能体和人类人工智能决策系统的必要安全标准。