论文
重试为何失败:LLM智能体流水线中的上下文污染
Why Retrying Fails: Context Contamination in LLM Agent Pipelines
摘要
当 LLM 代理在多步骤工具增强任务失败并重试时,失败的尝试通常保留在其上下文窗口中 - 污染下一次尝试并将每步错误率提升到基准水平以上。这种环境污染的重启现象在实践中被广泛观察到,但完全缺乏正式的处理。我们引入了上下文污染重启模型(CCRM):一系列 T 工具调用步骤,每个步骤都以基本速率 epsilon_0 失败;在任何失败的尝试之后,后续尝试都会在受污染的上下文中运行,并且错误率 epsilon_1 > epsilon_0 会升高。在这个模型下,我们得出五个主要结果。 (R1) P 的精确封闭式公式(最多成功 K 次尝试)。 (R2) 级联开销定理给出了由污染引起的额外尝试 Delta K 与干净重启基线的比较。 (R3) 最优预算分配定理,确定管道深度 T*,在固定总预算 B=KT 的情况下最大化成功概率;我们证明封闭形式 T* = sqrt(B * log(1/(1-epsilon_1)) / log(1/(1-epsilon_0))),其中 K*=B/T*。 (R4) 通过 Le Cam 方法得出的信息论下界显示 K_CCRM 严格达到 O(1)。 (R5) 干净重启优势定理,量化重试之前清除上下文的确切好处。我们在真实的 SWE-bench 验证数据上验证 CCRM:IID 模型高估了 pass@3 17.4 个百分点(98.6% vs. 81.2%),而 CCRM 拟合误差小于 0.001,这意味着 epsilon_1/epsilon_0 = 7.1 的级联比。蒙特卡罗实验证实了所有理论预测。