论文

Suan:纠正 大语言模型 中的直接偏好安全对齐

Suan: Rectifying Direct Preference Safety Alignment in Large Language Models

模型训练偏好优化

摘要

将坚固的安全护栏集成到 大语言模型 (LLM) 中对于提供有用且无害的响应至关重要。虽然专有系统表现出可靠的安全控制,但其底层方法和权衡在很大程度上仍未公开。在开放权重模型中实现可比的安全性仍然是一个持续的挑战,因为训练后的变体经常遭受过度拒绝和总体质量下降的困扰。为了克服这些缺点,我们引入了 Suan,一种新颖的偏好优化算法。与现有方法不同,我们直接在梯度级别制定优化目标,绕过标准变分推导。因此,我们获得了更具可解释性和稳健性的训练动态。对各种竞争基线和基准的广泛评估表明,Suan 实现了卓越的安全性,同时完全保留了响应效用。