覆盖而非归因:基于失败贡献分配零阶扰动预算未能提高大语言模型智能体在样本池内的样本效率
Coverage, Not Credit: Failure-Credit Routing of Zeroth-Order Perturbation Budgets Does Not Improve On-Pool Sample Efficiency for LLM Agents
摘要
轨迹级信用分配可以仅使用可验证的信号来定位使用 LLM 代理的工具的哪个模块导致失败。我们询问这种失败信用是否应该路由固定的零阶/进化策略(ZO/ES)扰动预算。在合成环境和冻结的 Qwen2.5-1.5B/3B 和 SmolLM2-1.7B 代理、三个任务系列、六种分配方案、信用噪声扫描、配对种子和精确的符号翻转测试中,我们发现在任何池内比较中,与统一分配相比,没有统计上可检测到的改进(没有至少 2 个百分点的增益)。联合 soft-plus-sigma 方案相当于 1.5B 和 3B 上 +/- 0.02 AUC 裕度内的均匀分布;将全部预算集中在信用 argmax 上在 1.5B 上略有等效,其中该模块是经过验证的瓶颈,而在 3B 上则明显更差。逆倾向去偏不能挽救路由,并且在 BFCL 派生系列上,内部误路由成本高达 -0.074 AUC,端到端成本高达 -0.118。在六个固定步骤计划中,损失与瓶颈饥饿率呈线性关系(R^2 = 0.94,描述性),并且预先注册的无信用覆盖底线消除了检测到的损害。匹配预算突增和逐步补偿追赶计划与累积参数移动不足而不是更新频率造成的危害是一致的。我们的主要估计是固定任务池上的优化效率。对于不可见的 BFCL 函数,该研究的一个例外是软路由在保留端点上超出了统一性(+0.047,p = 0.031,n = 6)。一个看似合理但未经测试的解读是,路由偏好的调用者改进会转移,而统一的池内收益反映了特定于我们的工具的合成器行为。我们明确报告了此异常,并记录了三种故障模式,这些模式可以默默地使冻结 LLM 上的 ZO/ES 实验失效。