论文

TRACE:有害微调在检查点更新中留下的连续痕迹

Harmful SFT Leaves a Continuous Trace in LLM Checkpoint Updates

模型评测安全与风险评测

摘要

训练后的大语言模型的安全审核通常依赖于模型行为,需要模型执行并取决于可用评估的覆盖范围。这项工作提出了一个不同的问题:在监督微调 (SFT) 期间优化的目标行为是否直接在检查点更新中留下可读证据?我们发现有害合规 SFT 会在检查点更新空间中引发连续的、依赖于目标的排序。使用由纯粹的有害合规性、安全性目标和良性实用性 SFT 定义的参考几何体,我们发现检查点级坐标 s_H 跟踪受控的有害目标组成,四个 7-8B 骨干模型 之间的 Spearman 相关性为 0.986-0.992,在较大的模型尺度上保持相同的顺序。匹配的遵从与拒绝控制表明,此检查点跟踪反映了 SFT 目标而不是有害输入暴露,而附加控制排除了基于有害示例计数或通用训练强度的简单解释。在此结构的基础上,我们引入了 TRACE,这是一种仅权重审核方法,可定位相对于冻结的有害和无害参考原型的未知检查点更新,并将该几何图形转换为连续的有害目标评分。 TRACE 既不需要模型查询,也不需要访问未知的 SFT 数据,并且可以直接从检查点更新进行评估。在分布变化、未见数据、不同的 SFT 配置、部分检查点访问和 LoRA/完整参数微调 中,跟踪保持稳定,并且与独立测量的攻击成功率呈正相关。即使有害目标比例较低,TRACE 仍能提供丰富的信息,在行为评估不可用或不完整时提供补充审核信号。代码可在 https://anonymous.4open.science/r/Code4TRACE-54D3. 获取

TRACE:有害微调在检查点更新中留下的连续痕迹:论文原图
图 16:$s_{H}$ 与攻击成功率之间的检查点级关联。每个面板对应一个骨干模型。