论文
TRACE:智能体强化学习的统一轨迹采样预算分配
TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning
摘要
具有可验证奖励的强化学习(RLVR)是增强 大语言模型 中的推理和代理行为的一种有前途的方法。然而,轨迹采样密集型策略优化通常受到奖励对比不足的限制,当过于简单或复杂的提示产生低方差反馈时,以及当仅结果奖励为多轮执行轨迹中的每个决策分配相同的最终评估时,就会出现这种情况。过去的努力主要集中在将可用的采样轨迹资源分配给有希望的提示,但它们仅利用提示级别的样本信息性,而忽略了同一采样轨迹中各轮次的前缀级信息性的变化。这项工作的目标是多回合代理强化学习,通过将每个 ReAct 风格的思想-行动-观察回合建模为语义上不同的节点,允许预算分配从提示根扩展到具有进一步延续的回合级前缀,这自然形成树结构的采样轨迹。我们引入了对比探索树滚动分配(TRACE),这是一个统一的滚动分配框架,可以在固定采样预算内增强奖励对比。从技术上讲,TRACE 将采样轨迹预算分配给最有可能产生混合终端奖励的提示根和中间前缀。共享的可概括预测器根据前缀历史估计这些锚点的条件成功概率,以指导这种分配。由此产生的自适应树结构丰富了仅结果反馈并放大了策略更新信号。根据经验,TRACE 在典型的代理基准上实现了具有竞争力的性能和效率提升,例如,在相同的采样成本下,与竞争基准相比,Qwen3-14B 多跳 QA 平均准确度提高了 2.8 个百分点。