论文

ARES:策略-奖励系统的自适应红队测试与端到端修复

ARES: Adaptive Red-Teaming and End-to-End Repair of Policy-Reward System

模型训练奖励建模与过程监督

摘要

基于人类反馈的强化学习(RLHF)是大语言模型(LLM)对齐的核心,但它引入了一个关键漏洞:不完善的奖励模型(RM)在未能惩罚不安全行为时会成为单点故障。现有红队测试方法主要针对策略层面的弱点,却忽视了我们所称的系统性弱点——核心LLM与RM同时失效的情形。我们提出ARES,一个系统性地发现并缓解此类双重漏洞的框架。ARES采用一个"安全导师"(Safety Mentor),通过组合结构化组件类型(主题、人设、战术、目标)动态构造语义连贯的对抗性提示,并生成相应的恶意与安全响应。这种双重目标方法同时暴露核心LLM和RM中的弱点。利用所获得的漏洞信息,ARES实施两阶段修复流程:先微调RM以更好地检测有害内容,再利用改进后的RM优化核心模型。在多个对抗性安全基准上的实验表明,ARES在保持模型能力的同时大幅增强安全鲁棒性,为全面的RLHF安全对齐确立了新范式。