论文

编码智能体 的工作集:存储库规模任务中的一致性债务

The Working Set of a Coding Agent: Coherence Debt in Repository-Scale Tasks

智能体系统Agent任务评测

摘要

代码仓库级任务要求智能体在有限上下文窗口中维持测试、导入、配置与迁移规则的一致性。本文将其建模为相互依赖的事实图:每次修改所需的事实来自当前上下文或模型参数记忆,两者都未覆盖的部分构成一致性欠缺。研究在七个模型、五种Harness配置中提供或移除这些信息,并注入故障。两个信息通道都为空时,没有模型能完成涉及未见API的任务;把所需事实加入提示后可以恢复成功。对真实库重命名以破坏模型的既有记忆后,七个模型均在同一位置失败,测试通过与失败的模式也相同。关键是信息是否可用,而非距离修改位置有多远:移除某项事实会影响其支撑的工作,远处提供的信息与近处提供的信息同样有效。全部通过测试的Harness配置,词元消耗仍可相差十倍以上,因为它们重建相同内容的频率不同;缺失事实时,增加花费也无法恢复任务表现。信息缺失往往导致错误操作,而非停止操作:智能体可能编造文件或猜测数值,因此仅检查读取记录难以识别问题。报告受阻的频率也因模型而异。信息可用不代表每次修改都正确:规范与代码不一致时,智能体可能遵循较差的规范,过时的规范文件因此可能比没有文件更有害。由于参数记忆能替代读取,在模型可能已熟悉仓库的SWE-bench上,读取行为不再能预测成功。Harness应确保智能体写入时能获得所需事实,并依据实际生成结果核查信息使用情况。