可重推性决定分阶段Agent管道在上游故障后恢复的内容
Re-derivability Decides What a Staged Agent Pipeline Recovers After an Upstream Fault
摘要
一个变量设置了上游故障对语言模型Agent分阶段管道的成本:可重推性,一个阶段需要多少内容可以从原始问题中重建。在这个问题上,让检查员Agentgrounding比在四个开放权重骨干上的盲目检查员的价值+0.608 [+0.517,+0.700]到+0.358,并且在两个Qwen骨干上,盲检查员根本不改变任何项目。这种正面交锋是探索性的。一个确定性故障进入第一阶段,我们将原始问题重新暴露给下游阶段的 $k = 0,\dots,3$,其中Agent、项目、故障和拓扑保持固定,每臂 120 个 gsm_hard 项目,温度为零。四个主干网中的四个主干网的故障准确率从 +0.233 上升到 +0.392,最大的 Holm 调整 $p$ 为 $2.1\times10^{-6}$。已注册的杀死测试排除了词元。消隐每个单词可以固定字槽,并且保留跟踪四个单词中的四个单词的可见分数,在主单词上从 0.221 攀升至 0.692。这两个家庭是确认性的,而这里的其他一切都是探索性的。交互不包括注册管道下四个主干中两个的零、三级管道下四个主干上的四个以及完整消息历史记录下四个主干上的三个(主要为 +0.317)。在 Llama-3.1-8B 上,故障在任何剂量下都不会带来可检测的成本,因此其他三个都具有有关故障成本的所有声明。可重推导性还决定了架构的成本,并且我们测量的任何分解都无法可靠地击败一次直接调用。在没有注入错误的情况下,注册的管道会输给该调用 -0.267、-0.125 和 -0.317,并且在 Phi-4 上,在 $p = 0.118$ 处读取 +0.058,测试无法与零分离。有效的修复是廉价且预先加载的:第一个重新grounding的阶段在 Qwen3-14B 上为每项 +59.8 词元购买了 +0.394 的匹配保留,而之后的阶段则什么也不买。