论文
淹没在常规中:多轮智能体训练中的信号稀释
Drowning in Routine: Signal Dilution in Multi-Turn Agent Training
摘要
多轮智能体将后续决策与例行执行交织在一起:一些行动改变了下游回报分配,而另一些行动是必要的,但与奖励相当。轨迹级贡献分配的成本通常归因于长期视野,实际上由决策密度 $ρ$ 控制:其行为影响回报的回合占比。当决策密度较低时,常规回合会产生信号稀释:它们向 GRPO 等轨迹级估计器添加梯度方差,而不添加预期信号。在明确的假设下,只要临界误差保持受控,所得到的转弯水平到轨迹水平的信噪比规模为 $ρ^{-1/2}$。相同的分析确定了互补机制:在高决策密度下,轨迹级方法可以保持竞争力,同时避免批评者的成本。在 $ρ$ 精确可调的受控环境中,预测缩放可通过 $R^2 = 0.999$ 恢复,并且训练步骤差距随着 $ρ\to 0$ 显着扩大。