论文

从参数动态到风险评分:量化LLM微调中的样本级安全退化

From Parameter Dynamics to Risk Scoring : Quantifying Sample-Level Safety Degradation in LLM Fine-tuning

模型评测评测方法与指标

摘要

大语言模型(LLM)的安全对齐极其脆弱:在少量良性样本上微调即可抹除从数百万偏好示例学到的安全行为。既有研究通过比较微调前后的参数与隐藏状态来解释该现象,但忽视其在微调过程中的动态演化。本文通过分析参数动态揭示安全退化的关键机制:良性微调使参数向危险对齐方向累积漂移,逐步侵蚀模型安全。这一发现提示:对该漂移贡献更大的样本具有更大的微调风险。基于该洞见,我们提出样本级安全退化量化(SQSD)方法:通过测量每个训练样本诱导的参数更新在危险与安全方向之间的投影差,为其计算连续风险分数。跨多模型与数据集的大量实验证明SQSD有效量化样本级微调风险,并在模型架构、参数规模与参数高效方法间展现强迁移性。

从参数动态到风险评分:量化LLM微调中的样本级安全退化:论文配图
图 1:安全降级机制和 SQSD 概述。 (a):微调轨迹显示参数空间中累积参数向危险对齐方向漂移。 (b):SQSD 通过测量样本引起的参数更新和安全相关方向之间的投影差距来计算风险评分。较大的危险预测减去安全预测表明风险较高。