论文

教幅度而非方向:多轮多步LLM智能体的验证器有界信用分配

Teach the Magnitude, Not the Direction: Verifier-Bounded Credit Assignment for Multi-Turn Multi-step LLM Agents

模型训练强化学习RLVRAgentic RL

摘要

可验证奖励强化学习(RLVR)为训练多轮工具使用智能体提供了验证器有界的性能上限,但其轨迹级信用分配将异质的逐轮结果混为单一奖励信号。在线策略蒸馏提供密集的逐token监督,但要么受教师上限约束,要么易发生梯度集中坍缩。我们提出CrEST,一个层次化信用分配框架,在保留RL验证器有界上限的同时,融入来自特权自教师的密集token级信号。CrEST在两个层面解决信用分配:轮次分段验证优势应对轮间稀释,熵门控自教师调制细化轮内token贡献。在BFCL V3与WildToolBench上的实验显示,CrEST在两个模型规模上一致超越RL与蒸馏基线,在长轨迹与严格会话级指标上收益最大。我们的工作表明,教师在策略优化中的角色可以从决定更新方向简化为调制更新幅度,从而在不牺牲验证器有界上限的前提下实现密集信用分配。

教幅度而非方向:多轮多步LLM智能体的验证器有界信用分配:论文配图
图1:在 2 轮轨迹(第 1 轮成功,第 2 轮失败)上信用分配策略的比较。GRPO 统一广播单一轨迹级奖励,错误地强化了失败轮次的 token。OPSD 提供稠密的 token 级信号,但将梯度集中于低熵的格式 token,且受教师上界限制。CrEST(我们的方法)结合轮级优势(轮间信用)与熵门控的自教师调制(轮内信用),正确地将负优势分配给第 2 轮,同时将梯度质量集中于第 1 轮高不确定性的内容 token。