论文
TRACE:通过贡献估计为长程Agent分配轮次奖励
TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents
摘要
多轮代理在产生最终答案之前通过扩展的工具交互序列解决复杂的任务,这使得信用分配成为 后训练 期间的基本挑战。结果奖励为短期推理提供了可靠的监督,但随着轨迹增长到数十或数百个工具调用,结果奖励变得稀疏且高方差。它们也可能具有误导性:失败的执行轨迹可能包含许多有用的操作,使代理更接近目标,但仅结果的训练却给他们带来了与最终错误相同的负面优势。我们提出了 TRACE(通过信用估计进行轮级奖励分配),这是一种用于代理强化学习的密集信用分配方法。 TRACE 将执行轨迹表示为工具调用边界处的状态转换,从冻结的参考模型中获取标准答案对数概率,将其转换为对数比状态值,并随着这些值的时间差异变化而得出每个操作的奖励。这不需要额外的批评者或过程标签训练,并且其一步对数比 TD 组件可以跨冗余工具调用进行望远镜。在长期复杂搜索中,TRACE 使用纯 RL 显着提高了基础模型工具的使用能力,无需冷启动监督 微调 阶段、代理中间训练阶段或实时网络数据训练。在封闭网络 BrowseComp-Plus 基准测试中,Qwen3-4B 从 7.2提高到 35.6,Qwen3-30B-A3B 从 8.4提高到 42.6。学习到的搜索行为也会转移到开放网络基准测试中,并且学习曲线显示强化学习训练期间的早期改进和更快的收敛。