论文
DOG-DPO:安全对准的几何动态优化
DOG-DPO:Dynamic Optimization in Geometry for Safety Alignment
摘要
大语言模型 的安全对齐依赖于偏好数据,但当前的管道通常在大型冗余数据集上进行训练。现有的数据选择方法通常对每个偏好对进行独立评分,将方向偏好信息分解为标量质量或多样性分数。这种以样本为中心的视图在多数据集设置中尤其受到限制,其中共享的安全方向与数据集特定的残余风险共存。我们提出了 DOG-DPO,一种 无需训练 数据选择框架,它将偏好对视为结构化几何信号。 DOG-DPO 首先将每个偏好对表示为模型表示空间中的方向。然后,它将多数据集偏好几何结构分解为全局锚子空间和数据集特定的残差子空间。最后,它通过最大化基于多样性的覆盖范围来选择子集,鼓励在 DPO 训练之前对对齐方向进行广泛的、非冗余的覆盖。在六个安全基准和两个模型主干中,DOG-DPO 仅使用 11% 的偏好对就实现了强大的实用性与鲁棒性权衡。它恢复了全数据训练的大部分安全收益,同时保持完全无教师无需训练,并且比代表性选择基线快得多。