论文

DEEPRUBRIC:用于深度研究代理高效强化学习的证据树评分标准监督

DEEPRUBRIC: Evidence-Tree Rubric Supervision for Efficient Reinforcement Learning of Deep Research Agents

模型训练强化学习合成数据Agentic RL

摘要

深度研究人员通过对检索到的证据进行搜索和推理来合成长篇报告。使用基于规则的奖励的强化学习通过根据可检查的标准对其进行优化来改进这些代理,这些标准将报告质量转化为奖励信号,但其效率取决于这些标准是否可靠地捕获了任务范围和证据需求。大多数现有研究要求 LLM 为给定的查询生成评分细则,但当模型无法推断出潜在的信息需求时,生成的评分细则可能不完整并降低强化学习效率。为了获得更可靠的查询-Rubric监督,我们引入了DeepRubric,这是一个逆转这一过程的数据构建框架:它不是推断给定查询的评估标准,而是首先确定应该评估有证据支持的报告,然后从这些评估目标合成对齐的查询-Rubric对。从采样的种子主题开始,DeepRubric 通过递归扩展有证据支持的子问题来构建证据树,其叶子作为原子且可验证的评估目标。然后,它使用证据树来综合训练查询和评分标准,确保奖励准确评估查询所请求的信息。使用 DeepRubric,我们构建了 9K 个查询 - rubric 监督示例,并使用基于 rubric 的 GRPO 训练 DeepRubric-8B,在三个基准测试中实现了与先前开放的最先进的深度研究模型相当的性能,而 RL GPU 小时大约减少了 13 倍。