论文

用于平衡安全调整的可配置奖励模型

Configurable Reward Model for Balanced Safety Alignment

模型训练奖励建模与过程监督

摘要

让 大语言模型 (LLM) 与异构且快速发展的安全要求保持一致仍然是一项严峻的挑战。现有的指令调整 LLM 和独立安全分类器通常无法推广到新的安全配置,从而激发了对可根据不断变化的规范进行显式配置的奖励模型 (RM) 的需求。我们引入了可配置安全奖励模型(CSRM),该模型针对校准的安全合规性和奖励模型进行了联合优化。我们的方法受到以配置为目标的数据增强的支持,该数据增强强制遵守指令,同时保留相对严重性结构。由此产生的 RM 对细粒度安全配置和对话的细微差别很敏感,从而大大提高了对以前未见过的安全配置的泛化能力。 CSRM 在最新的可配置安全基准测试中实现了最先进的性能,包括 CoSapien (94.6% F1) 和 DynaBench (75.8% F1),而无需额外的人工注释。当用于下游安全调整时,CSRM 生成 LLM,与现有基线相比,其有用性-安全性权衡得到显着改善。