论文
RubricEM:元强化学习,以 Rubric 为指导的策略分解,超越可验证的奖励
RubricEM: Meta-RL with Rubric-guided Policy Decomposition beyond Verifiable Rewards
摘要
训练深度研究代理,即计划、搜索、评估证据和合成长篇报告的系统,使强化学习超越了可验证的奖励制度。他们的输出缺乏 真值 答案,他们的轨迹跨越许多工具增强的决策,而标准 后训练 几乎没有提供将过去的尝试转化为可重用经验的机制。在这项工作中,我们认为,评分标准不仅应该充当最终答案评估器,还应该充当构建策略执行、判断反馈和代理记忆的共享界面。基于这一观点,我们引入了RubricEM,一种以规则为导向的强化学习框架,它将阶段性策略分解与基于反射的元策略演化相结合。 RubricEM 首先通过调节规划、证据收集、审查和对自行生成的评估规则进行综合,使研究轨迹具有阶段性。然后,它将功劳归于 Stage-Structured GRPO,该 GRPO 使用阶段性标题判断为长期优化提供更密集的语义反馈。与此同时,RubricEM 训练了一个共享骨干反射元策略,将判断的轨迹提炼成可重复使用的基于 rubric 的指导,以供未来的尝试。由此产生的 RubricEM-8B 在四个长格式研究基准中实现了强劲的性能,优于可比的开放模型并接近专有的深度研究系统。除了最终性能之外,我们还进行彻底的分析以了解 RubricEM 的关键要素。