论文

一回合为时已晚:学习何时干预多回合恶意意图

One Turn Too Late: Learning When to Intervene Against Multi-Turn Malicious Intent

模型训练强化学习

摘要

多轮对话中隐藏的恶意意图对部署的 大语言模型 (LLM) 构成越来越大的威胁。攻击者不是在单个提示中暴露有害目标,而是可以将其意图分布在多个看似良性的回合中,从而使防御不仅成为对话是否有害的问题,而且还成为何时需要干预的问题。现有的跟踪级标记方法仅提供粗略的安全信号,并且无法识别这种干预边界,因此很难区分及时干预与过早拒绝或来得太迟的阻止。这项工作引入了针对多回合防御的回合级伤害启用监督。我们将最早的造成伤害的转变定义为提供候选响应将使累积的互动足以促成有害行动的第一个点。为了大规模实例化这种监督,我们构建了多轮意图数据集(MTID),其中包含自适应攻击部署、匹配的良性硬负例以及该边界的注释。使用 MTID,我们训练 TurnGate,这是一个响应感知监视器,可以学习何时进行干预,并通过多轮强化学习进一步优化其策略。实验表明,轮次边界监督改善了干预定位,而强化学习则进一步改善了安全性与效用的权衡。 TurnGate 的性能优于现有护栏和多轮监控基线,并可跨风险领域、攻击者管道和目标模型进行推广。我们的代码可在 https://github.com/Graph-COM/TurnGate 获取。