论文

授权危险带:为什么中等能力的子Agent过度信任继承的过时状态

The Delegation Danger Band: Why Mid-Capability Sub-Agents Over-Trust Inherited Stale State

模型评测鲁棒性、公平性与可信度评测

摘要

Agent框架越来越多地通过分叉子Agent来委派工作;常见的默认设置使子级继承父级的完整工作上下文。我们测量继承状态的影响如何随能力变化,其中 $C_m$ 表示干净的分叉新鲜准确性。我们比较了 3 种继承策略:重置(分叉新鲜:仅基础证据)、选择性(策划的移交:+ 有用的先前结论)和完全(隐式分叉:+ 有用的结论和被取代结论的 $d$ 副本)在冻结、封闭集、动作评分基准上的同族阶梯 (Qwen3 0.6/1.7/4/8B)。每个任务都可以从基础证据中解决,因此性能损失可以归因于对陈旧状态的依赖。 (1) 在 2 个合成原语以及 MuSiQue 和 HotpotQA 中,随着测量能力 $C_m$(斜率的置信区间 CI,每个系列均排除零),对被取代状态的遵从度急剧下降。 (2) 在 Qwen3 综合阶梯上,净继承损害遵循非单调模式:中等能力模型 (Qwen3-1.7B) 是净损害统计显着的局部最小值,低于其新分叉基线 ($Δ(32)=-0.19$ [-0.25, -0.12]) 和两个邻居,而最弱的模型保持接近中性,最强的模型保持稳健。我们将此有害能力范围称为危险带。模型内计数难度扫描表明,即使在匹配的 $C_m$ 上,效果也取决于模型类别,并且实时父子分叉再现了模型中间的伤害。 (3) 策划的选择性切换在所有 3 个数据集上比 Full 提高了平均准确度,在带内模型中最大,而固定阈值功能路由器在其他数据集上失败;可转移路由器需要预测重用收益和陈旧上下文惩罚之间的平衡。基准测试被冻结并进行版本哈希处理。