论文
面向智能体的推理奖励模型探索
Exploring Reasoning Reward Model for Agents
摘要
Agentic强化学习(Agentic RL)已在使智能体执行复杂推理与工具使用方面取得显著成功。然而,多数方法仍依赖稀疏的基于结果的奖励进行训练。这类反馈无法区分中间推理质量,导致训练结果次优。本文提出智能体推理奖励模型(Agent-RRM),一个为agentic轨迹产生结构化反馈的多面奖励模型,包括(1)显式推理轨迹、(2)通过突出推理缺陷提供改进指导的聚焦性批评,以及(3)评估过程表现的整体分数。利用这些信号,我们系统研究三种整合策略:Reagent-C(文本增强的精炼)、Reagent-R(奖励增强的引导)与Reagent-U(统一反馈整合)。跨12个多样基准的大量评估表明,Reagent-U带来显著性能跃升,在GAIA上达到43.7%、在WebWalkerQA上达到46.2%,验证了我们的推理奖励模型与训练方案的有效性。代码、模型与数据集均已发布以促进后续研究。
