论文
RubricArmor:对抗性进化改进了基于LLM的 Rubric 生成
RubricArmor: Adversarial Evolution Improves LLM-Based Rubric Generation
摘要
基于 Rubric 的强化学习 (RL) 通过根据特定于查询的评估标准评估响应,为对齐大语言模型 (LLM) 提供可解释的奖励。要大规模构建评分细则,基于LLM的评分细则生成的一种简单方法是提示LLM直接从查询生成评分细则。然而,由LLM直接生成的评分标准很容易受到奖励黑客的影响,因为省略或未指定的标准允许策略以低质量的响应获得高评分奖励。现有的基于LLM的评分标准生成方法提高了生成标准的粒度和覆盖范围,但不能主动防范奖励黑客。为了解决这一限制,我们提出了 RubricArmor,这是一种对抗性框架,可以在后续 RL 中出现之前在标题生成阶段暴露和减轻潜在的奖励黑客。具体来说,RubricArmor 执行对抗性进化,其中攻击步骤和修复步骤在多轮中交替。攻击步骤通过构建满足当前规则但无法正确完成任务的对抗性响应来模拟策略的奖励黑客。然后,修复步骤修改规则以检测攻击步骤暴露的响应缺陷,同时保留其他有效标准。大量实验表明,RubricArmor 的性能优于竞争性的 rubric 生成基线,并转化为更有效的下游基于 rubric 的强化学习。
