论文
EOPSA:高效的on-policy自蒸馏安全对齐
EOPSA: Efficient On-Policy Self-Distilled Safety Alignment
摘要
按策略自我蒸馏 (OPSD) 已成为一种有前途的安全调整范例,通过以拒绝为导向的特权提示为条件的教师进行蒸馏,提供密集的、词元级的监督。然而,我们发现这种范式存在严重的低效率问题,从而降低了训练效率和一般推理能力。具体来说,我们诊断出两个基本瓶颈:(1)长期rollout时的监督崩溃,随着学生世代前缀的延长,教师的纠正效率急剧下降,将噪声梯度注入后期词元中; (2)风格转变带来的梯度稀释,其中蒸馏目标主要由特权提示引起的与安全无关的风格差异主导,洗掉真正的安全信号并损害基础推理。为了解决这些问题,我们提出了高效的按策略自蒸馏安全对齐(EOPSA),它将计算和梯度预算专门集中在可靠监督的、安全关键的词元上。 EOPSA 包含两个协调机制:(i) 自适应rollout调度,它动态地限制生成范围,由新颖的教师救援率 (TRR) 指标指导,严格在可靠的监督制度内运行; (ii) 选择性蒸馏,过滤掉安全中性标记,将梯度更新仅限于安全关键转换。对高达 32B 参数的推理模型的广泛评估表明,EOPSA 将rollout计算量减少了 $\sim$50%,并仅通过 $\sim$2% 的词元进行反向传播,在安全合规性和推理保留方面始终优于全词元蒸馏基线。