论文

强化学习对齐的泛化局限:组合攻击暴露防护缺口

Generalization Limits of Reinforcement Learning Alignment

模型评测安全与风险评测

摘要

大语言模型(LLM)的安全性依赖于对齐技术,例如来自人类反馈的强化学习(RLHF)。然而,最近的理论分析表明,基于强化学习的训练并没有获得新的能力,而只是重新分配现有能力的利用概率。在这项研究中,我们提出了针对 OpenAI gpt-oss-20b 的“复合越狱”,它利用了对齐的泛化失败。这种方法结合了多种攻击技术——每种攻击技术都单独防御——以使指令层次结构维护过程饱和。我们的评估表明,攻击成功率 (ASR) 从单独方法的 14.3% 增加到组合方法的 71.4%。这些结果为以下假设提供了经验证据:安全训练并不像模型能力那样广泛推广,凸显了使用复合攻击场景进行多方面安全评估的必要性。