论文

RubricArmor:对抗性进化改进了基于LLM的 Rubric 生成

RubricArmor: Adversarial Evolution Improves LLM-Based Rubric Generation

模型训练奖励建模与过程监督

摘要

基于 Rubric 的强化学习 (RL) 通过根据特定于查询的评估标准评估响应,为对齐大语言模型 (LLM) 提供可解释的奖励。要大规模构建评分细则,基于LLM的评分细则生成的一种简单方法是提示LLM直接从查询生成评分细则。然而,由LLM直接生成的评分标准很容易受到奖励黑客的影响,因为省略或未指定的标准允许策略以低质量的响应获得高评分奖励。现有的基于LLM的评分标准生成方法提高了生成标准的粒度和覆盖范围,但不能主动防范奖励黑客。为了解决这一限制,我们提出了 RubricArmor,这是一种对抗性框架,可以在后续 RL 中出现之前在标题生成阶段暴露和减轻潜在的奖励黑客。具体来说,RubricArmor 执行对抗性进化,其中攻击步骤和修复步骤在多轮中交替。攻击步骤通过构建满足当前规则但无法正确完成任务的对抗性响应来模拟策略的奖励黑客。然后,修复步骤修改规则以检测攻击步骤暴露的响应缺陷,同时保留其他有效标准。大量实验表明,RubricArmor 的性能优于竞争性的 rubric 生成基线,并转化为更有效的下游基于 rubric 的强化学习。

RubricArmor:对抗性进化改进了基于LLM的 Rubric 生成的原论文方法或结果图
图 2:RubricArmor 演化轮次概述。攻击发现构建满足当前标准的对抗性响应,并独立确认其缺陷以及由此导致的响应质量损失。已验证的评分标准修复修改评分标准以检测已确认的缺陷,验证对抗性响应是否获得较低的奖励,并审查修订后的标准。每个被接受的标题都会成为后续攻击的目标。