论文
PolicyAlign:针对 大语言模型 的直接基于策略的安全调整
PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models
摘要
大语言模型(LLM)的安全对齐通常取决于高质量的监督数据,例如安全演示或偏好对。然而,在现实世界的部署中,新兴的安全要求通常被指定为自然语言策略,而相应的监管数据可能成本高昂、延迟或不可用。这造成了快速发展的安全政策与传统的数据驱动调整方法之间的不匹配。为了解决这个问题,我们提出了 PolicyAlign,这是一个简单而有效的框架,用于将 LLM 与安全策略直接对齐。给定安全策略,PolicyAlign 首先合成违反策略的指令,然后执行 同策略 自 蒸馏 以内部化策略引导的行为。为了提高训练稳定性和数据效率,我们进一步引入了策略敏感过滤,它选择策略引起最大行为转变的指令。跨多个模型的实验表明,PolicyAlign 持续提高安全性,同时保持较低的过度拒绝并保留一般功能。 PolicyAlign 还推广到医疗、法律和金融安全场景,突出了其作为基于策略的 LLM 安全调整的可扩展和可维护方法的潜力。该代码发布于 https://github.com/Qwen-Applications/PolicyAlign。