论文

深度研究作为强化学习的标准

Deep Research as Rubric for Reinforcement Learning

模型训练奖励建模与过程监督

摘要

开放式推理和长格式生成任务缺乏用于基于奖励的策略优化的可靠自动验证信号。评分标准提供了一种有前途的替代方案,但现有的方法将它们视为给定的工件——无论是手工制作的还是即时生成的——并且常常错过最重要的特定于任务的知识密集型维度,从而扭曲了奖励信号。我们的主要观察是,标题构建本身就是一个研究问题:识别什么使响应正确或富有洞察力需要发现和综合外部知识。我们提出深度研究作为评分标准(DR-rubric),这是构建此类评分标准的两阶段框架。第一阶段通过迭代多轮代理搜索引出领域事实、结构约束和故障模式;第二阶段将这些证据提炼成原子的、可独立验证的约束,以实现基于 GRPO 的策略优化。由于训练中的模型可以作为自己的评分生成器,因此 DR-rubric-8B 支持引导评分生成,无需前沿模型协助。我们根据代理研究和专家推理的 6 个基准进行评估。实验表明,DR-Rubric 仅用 1K - 3K 训练实例即可实现强大的竞争性能,其中 GPT-5 生成的 rubric 特别有利于代理任务的广度覆盖,Gemini 生成的 rubric 在代理和专家推理任务中产生最平衡的性能,而 bootstrap rubric 则表现出从专业化到再平衡的演变,在第三次迭代中实现了最佳的整体性能。结果表明,将静态评估模板的标题构建重新构建为证据驱动的研究过程,可以为开放式任务产生更具可扩展性、更细粒度的奖励信号。