论文
ARES:用于可扩展 LLM 强化学习的自动评分标准合成
ARES: Automated Rubric Synthesis for Scalable LLM Reinforcement Learning
摘要
基于评分标准的奖励提供了一种有前途的方法,可以将 大语言模型 的强化学习 (RL) 扩展到具有自动可验证答案的任务之外。然而,扩展基于量规的强化学习仍然具有挑战性:现有方法通常依赖于专家编写的量规和手动构建的问题集,而固定的任务级别量规可能无法捕获单个问题的评估要求。我们提出了 ARES(Automated Rubric SynthEsis for Scalable RL),这是一个用于大规模自动构建基于 Rubric 的 RL 数据的框架。从原始预训练文档开始,ARES 将源知识转换为独立的问答对,并共同生成特定于问题的加权规则,从而实现对开放式响应的实例级奖励监督。为了提高多样性和质量,ARES 条件生成域标签和角色信息,并应用验证过滤器来实现问题自包含、答案 忠实性 和标题有效性。使用 ARES,我们在 10 个域中构建了 10 万个带有标题注释的实例。七个基准的实验表明,使用 ARES 训练的基于标题的 RL 的性能优于持续预训练、有监督的 微调 和二元奖励 RL,并且在医疗保健和指令遵循等多维开放式任务上收益最大。