论文
编码智能体 中上下文腐烂何时以及如何出现:代码审计中代理技能的白盒研究
When and How Context Rot Appears in Coding Agents: A White-Box Study of Agent Skills in Code Auditing
摘要
代理技能打包了通用代理使用的程序指令和检查,但加载技能并不能保证每个要求在整个工具使用轨迹中都保持活动状态。我们在生产衍生的白盒代码审核工作流程中研究这个问题。保持任务和 24 个工件检查固定,我们改变周围的环境,并对首先出现的故障进行分类:丢失需求、编辑漂移、检查失败或非代理评估器/运行时故障。使用 gpt-5.4-mini 的 Codex 在 10,991 字符的干净上下文中通过了 8/10 的运行,但在 299,140 字符的相关上下文和等长的不相关上下文中仅通过了 3/10。这个 50% 的差异很大,但在双边费舍尔检验下仍处于趋势水平 (p = 0.0698)。然而,在两种长条件下,需求覆盖率都保持在 92% 以上,这表明一些遗漏可能会使原本完整的工件失效。第二个任务通过了所有干净和长的运行,因此证据不支持通用的上下文长度阈值。详细的外部检查表通过了 10/10 次运行,而一般自检则通过了 5/10 次 (p = 0.0325)。编码代理支架可以通过选择较小的工作集来提供帮助,但它们并不能消除故障。我们不会引入上下文腐烂或新的通用监控方法;我们为白盒代码审计提供有界故障分类和实证案例研究。