论文

TRACE:轨迹返回归因和对比擦除以实现多转弯安全

TRACE: Trajectory Return Attribution and Contrastive Erasure for Multi-Turn Safety

模型评测安全与风险评测

摘要

安全一致的大语言模型 (LLM) 通常会拒绝有害的请求,但一旦同一目标分散到多个回合,就会遵守。偏好目标对单个提示的整体反应进行评分,因此仅靠训练损失无法控制未见历史的风险。我们的分析给出了充分的条件,在这些条件下,受监督的单轮上下文中的抑制会产生多轮轨迹风险的界限。该界限考虑了覆盖范围、转移松弛和泄漏,并表征了相对于在训练有素的政策背景下评估的基本政策风险预算的收缩。 TRACE(轨迹返回归因和对比擦除)将这一原则转化为词元级别的目标。在安全响应中,每个词元都根据拒绝归因优势的折扣回报进行加权。其优点是将冻结的参考模型与其拒绝消除的副本进行比较,允许较早的响应词元从后来的拒绝相关证据中获得信用。在拒绝响应的高差距位置,TRACE 将观察到的词元与擦除目标中策略选择的替代方案相结合。梯度范数惩罚取代了保留集。在五个开放权重模型和七个多轮攻击中,TRACE 在所有 35 个模型和攻击对中给出了最低的攻击成功率 (ASR),而在 MMLU 和 HellaSwag 上评估的模型效用最多下降了 1\.23 个点。源代码可以在补充材料中找到。