CARE:面向大语言模型后训练的对比锚点式评分准则演化
CARE: Contrastive Anchor-based Rubric Evolution for Large Language Model Post-Training
摘要
基于评分标准的强化学习将开放式指令分解为特定于提示的灵活评分标准,使其比强化学习更适合对开放式任务的LLM进行训练后提供可验证的奖励。然而,随着政策的发展,静态的评分标准不可避免地会受到黑客攻击,而现有的动态方法会带来新的问题:无向的评分标准提取、不可靠的黑客检测以及无限制的评分标准扩散。我们提出 $\textbf{CARE}$ ($\textbf{C}$ontrastive $\textbf{A}$nchor-based $\textbf{R}$ubric $\textbf{E}$volution),它将每个标题演化步骤建立在由以提示及其标题为条件的前沿模型生成的高质量锚响应中。在每个训练步骤中,CARE 都会将得分最高的 rollout 与锚点进行对比,从而实现两种互补机制:一个自适应分支,可以反应性地修复奖励错误指定;还有一个大通分行,主动将前沿质量差距转化为更清晰的标准。两个分支 $\textbf{在高奖励区域保持判别准确性}$——奖励过度优化主要起源的精确区域。使用 Qwen2.5-7B-Base 和 Qwen2.5-7B-Instruct 在 WildChecklist-9K 上进行的实验表明,CARE 在 Arena-Hard-2.0、InfoBench 和 FollowBench 上实现了最先进的性能,并且是 $\textbf{only}$ 方法,其针对 GPT-4.1 锚点响应的获胜率在 300 个训练步骤中显示出持续改进; Llama-3.1-8B-Instruct 和 Qwen3-8B 的其他结果进一步表明 CARE 可以推广到模型系列。