论文

调查并缓解 LLM 交互中的危害放大

Investigating and Alleviating Harm Amplification in LLM Interactions

模型评测安全与风险评测

摘要

大语言模型 (LLM) 可以充当有用的助手,但它们同样可以充当危害放大器,使恶意用户能够通过扩展交互实现超出其能力的有害结果。这种风险体现在两个方面,即使领域专业知识民主化,允许新手制作专门的有害内容,以及以人工无法匹敌的规模扩展有害操作。然而,现有的作品经常忽视 LLM 在多轮对话中如何造成复合伤害。我们推出 HarmAmp,这是一个针对涵盖十二个风险类别的多回合伤害放大场景的新基准。每个场景都基于现实世界的威胁,并满足严格的标准,即实质性放大、操作特异性和多回合必要性。我们进一步提出 TrajSafe,这是一种主动监控器,可以预测有害轨迹并通过探测用户的真实意图和引导模型更安全地完成等行动进行干预。我们的大量实验表明,TrajSafe 显着降低了多轮交互中产生的危害,同时保持较低的过度拒绝率和目标模型的一般能力。我们的工作提供了一个有前途的范例,可以减轻 LLM 交互中微妙的安全风险。