论文
教幅度而非方向:多轮多步LLM智能体的验证器有界信用分配
Teach the Magnitude, Not the Direction: Verifier-Bounded Credit Assignment for Multi-Turn Multi-step LLM Agents
摘要
可验证奖励强化学习(RLVR)为训练多轮工具使用智能体提供了验证器有界的性能上限,但其轨迹级信用分配将异质的逐轮结果混为单一奖励信号。在线策略蒸馏提供密集的逐token监督,但要么受教师上限约束,要么易发生梯度集中坍缩。我们提出CrEST,一个层次化信用分配框架,在保留RL验证器有界上限的同时,融入来自特权自教师的密集token级信号。CrEST在两个层面解决信用分配:轮次分段验证优势应对轮间稀释,熵门控自教师调制细化轮内token贡献。在BFCL V3与WildToolBench上的实验显示,CrEST在两个模型规模上一致超越RL与蒸馏基线,在长轨迹与严格会话级指标上收益最大。我们的工作表明,教师在策略优化中的角色可以从决定更新方向简化为调制更新幅度,从而在不牺牲验证器有界上限的前提下实现密集信用分配。
