论文

覆盖范围,而非目标:多轮代理信用分配的结构机制

Coverage, Not Targeting: A Structural Regime in Multi-Turn Agent Credit Assignment

模型训练强化学习

摘要

多回合代理强化学习越来越多地将信用分配视为目标问题:给定终端可验证的奖励,每回合方法将信用分配到重要的回合上。我们确定了预测何时是正确举动的结构量,即验证者信息密度 V_d = k/C(验证者暴露其每轮正确性的代理 C 步因果链的分数),并表明最终状态验证者深陷低 V_d 状态,其中目标是错误的轴。在 tau^2-bench 上的受控共享采样轨迹比较中,将奖励密度与信用几何分开,连续密集的奖励分布均匀地击败了稀疏的二元结果奖励(对 4/5 种子来说是净有害的),而将相同的优势集中在进度回合或随机回合上同样有害:目标是二阶的。该机制是覆盖率:终端状态验证将可观察信号折叠为单个最终写入回合(98% 的部署中 k=1),而成功需要先决条件工具调用的 5-8 步骤链。合成相边界将交叉置于 V_d* ~ 0.8,而在 tau^2-bench 上测得的 V_d 约为 0.15,在 BFCL V3 上测得约为 0.4; uniform 在 BFCL 上也获胜,其中匹配浓度的洗牌对照对 8/8 种子呈阴性。该效应在 ToolACE-2-8B 上的模型系列中重现(超过 32 个预注册种子的 Delta = -0.048;独立的 20 个种子复制本身就很重要),并且预注册的匹配预算宽度扫描追踪单调剂量反应,其赤字仅在全链覆盖时消失,奖励-去臂达到全覆盖平价。统一重新分配是每轮方案必须打破的零信息覆盖默认值;我们提供了任何目标声明都应该明确的匹配浓度改组控制。