论文

宪法 同策略 安全 蒸馏

Constitutional On-Policy Safe Distillation

摘要

同策略 self-蒸馏 (OPSD) 通过使用以特权信息为条件的教师来提供密集的 词元级 监督,成为一种高效的 后训练 范式。先前的工作表明,OPSD 可能会在可验证的推理任务中崩溃,而安全对齐的不同之处在于它是由高层宪法而不是明确的目标答案指导的。然而,试点研究表明,安全 OPSD 仍然遭受严重崩溃,其中体质调节将教师分布收缩为简短且过于保守的反应,而反向 KL 进一步放大了这种收缩,导致表达能力降低。我们将这种效应形式化为非正交语义空间中安全边界下的几何泄漏,其中安全压力转移到表达维度。基于此分析,我们提出了宪法 同策略 安全 蒸馏 (COPSD),它首先通过 Cross-SFT 冷启动来校准教师,然后执行宪法条件 同策略 蒸馏。针对 12 个安全性和通用基准的 3 个多模态 大语言模型 (MLLM) 的实验表明,COPSD 比基准提高了安全性和有用性,同时降低了通用推理的安全税。