论文
量规依据对齐RL:面向可泛化推理的结构化裁判奖励
Rubric-Grounded RL: Structured Judge Rewards for Generalizable Reasoning
摘要
我们认为,将奖励分解为加权的、可验证的标准并使用LLM法官对其进行评分提供了部分信用优化信号:每个响应都根据多个特定于任务的标准进行评分,而不是二元结果或单个整体分数。我们将\emph{基于标题的强化学习(RL)}形式化:一个框架,其中策略针对由冻结的LLM法官产生的结构化、多标准奖励进行优化,而辅助基础策略的条件从未见过。我们通过从科学和技术信息办公室 (OSTI) 衍生的大约 100,000 份科学和技术文档的语料库中派生标题,并使用组相对策略优化 (GRPO) 来训练 Llama-3.1-8B-Instruct,从而实例化该框架。通过基于 GRPO 的训练,该模型在保留的评分标准评估中获得了 71.7\%$ 标准化奖励。经过 GRPO 调整的策略还在四个并非源自训练语料库的推理基准(GSM8K、MATH、GPQA Main 和 GPQA Diamond)上对基本模型进行了改进。这些结果提供了证据,表明结构化的、基于文档的奖励可以提高坚持的标准绩效,并诱导超出用于构建训练环境的语料库的可转移推理行为。
