论文

TRACE:面向多轮对抗对话评估的轨迹感知推理

TRACE: Trajectory Aware Reasoning for Multi-Turn Adversarial Conversation Evaluation

模型训练强化学习

摘要

多轮越狱攻击已成为LLM面临的关键安全威胁:有害目标被拆解到一系列看似无害的轮次中,以绕过防护栏。现有防御缺乏识别不断演变的操纵模式的推理能力,往往通过对敏感话题相关的良性请求过度拒绁来以有用性换安全性。我们提出Trace,一种具有轨迹感知结构化推理的多轮防御。在生成每条回复之前,模型从轨迹中识别操纵线索,评估用户意图的良性与对抗两种解读,给出越狱评分,并承诺一个动作:允许、警示或拒绝。我们从五个攻击框架整理出4k条多轮对抗对话,配以2.4k条良性对话与600条敏感但无害的对话。我们用SFT与GRPO在多组件奖励下训练Llama-3.1-8B-Instruct,该奖励联合优化良性提示上的有用性与对抗越狱尝试的鲁棒性。在七个多轮攻击基准上,Trace的平均攻击成功率(ASR)为14.5%,最强基线为31.4%,未设防目标为74.9%,同时显著抬高了每次成功越狱所需的攻击成本。Trace还平衡了可用性与安全性,在过度拒绁基准上达到平均93.3%的依从率。

TRACE:面向多轮对抗对话评估的轨迹感知推理:论文配图
图1:一次多轮越狱攻击(左)。在缺乏对对话轨迹的显式推理时,目标模型会顺从。TRACE 生成结构化推理轨迹,提取操纵线索,对良性假设与对抗性假设进行评分,并将其聚合为越狱分数和经校准的行动,成功防御了该攻击。