论文
TRACE:面向多轮对抗对话评估的轨迹感知推理
TRACE: Trajectory Aware Reasoning for Multi-Turn Adversarial Conversation Evaluation
摘要
多轮越狱攻击已成为LLM面临的关键安全威胁:有害目标被拆解到一系列看似无害的轮次中,以绕过防护栏。现有防御缺乏识别不断演变的操纵模式的推理能力,往往通过对敏感话题相关的良性请求过度拒绁来以有用性换安全性。我们提出Trace,一种具有轨迹感知结构化推理的多轮防御。在生成每条回复之前,模型从轨迹中识别操纵线索,评估用户意图的良性与对抗两种解读,给出越狱评分,并承诺一个动作:允许、警示或拒绝。我们从五个攻击框架整理出4k条多轮对抗对话,配以2.4k条良性对话与600条敏感但无害的对话。我们用SFT与GRPO在多组件奖励下训练Llama-3.1-8B-Instruct,该奖励联合优化良性提示上的有用性与对抗越狱尝试的鲁棒性。在七个多轮攻击基准上,Trace的平均攻击成功率(ASR)为14.5%,最强基线为31.4%,未设防目标为74.9%,同时显著抬高了每次成功越狱所需的攻击成本。Trace还平衡了可用性与安全性,在过度拒绁基准上达到平均93.3%的依从率。
