论文
没有 真值 的信用:根据执行的重放审核 LLM 代理中的步骤级信用分配
Credit Without Ground Truth: Auditing Step-Level Credit Assignment in LLM Agents Against Executed Replay
摘要
根据在单代理工具环境 (ALFWorld) 中执行重放的策略条件 真值 进行审核,我们审核的任何步骤级信用信号(LLM 判断分数、结果条件对数概率比率或策略自身的置信度)都没有显示出超出其自身边际匹配洗牌控制的可靠增量保真度。校正重放目标可靠性会使隐式保真度限制在接近零的范围内,并且在达到的目标可靠性下判断保真度不确定。现有的评估根据注释步骤*正确性*对这些信号进行评级;我们根据步骤“贡献”对它们进行审核——在每个决策点对政策自身的替代方案进行重新采样,并滚动对结果进行更改——然后它们就会分崩离析。 真值 的结构如下:定义的决策点中的 30.5% 在达到的采样分辨率下表现出非零重放对比度,并且可测量性取决于模型 - 两个相似规模的策略之间,没有策略支持的反事实的点的比例相差两倍(13.1% 与 26.8%)。失败模式是可识别的:隐性信用与政策的流畅性相呼应(中位等级相关性+0.75,在修正工具下的第二个家庭中复制为+0.70),而结果调节不添加因果信息(部分相关性-0.004,Qwen)。仅置信路由器可以在机会级别恢复关键步骤,但每回合的判断成本降低 13.1%(每条轨迹 14.0%)。在七臂预注册训练实验中,没有任何臂能够可靠地优于未经训练的策略,并且检查点的明显工具签名在统计上与本设计中有效训练剂量的调解一致——稀疏信用保留了更少的例子,优化器步骤中的数量级分布——而不是信用内容。信用规则的比较必须与有效样本量相匹配,否则它们衡量的是剂量,而不是信用。