论文

编码Agent执行修改时究竟需要哪些上下文?

What Context Does a Coding Agent Actually Need to Act?

上下文与知识上下文工程

摘要

现代编码Agent能把整个代码仓库放进上下文,但多数读取未必有用。论文聚焦修改代码的时刻,区分定位修改位置与实际执行修改:用标准定位结果固定工作位置,只改变代码表示方式,并以SWE-bench Verified上的真实问题解决结果评估上下文。在未参与开发的仓库上,独立评估器发现自然语言摘要只能回答45个代码行为问题中的4个,原始代码能回答27个;前沿模型与3B模型生成的摘要同样较差,说明差异主要来自表示方式。对全部70个多文件实例,按数据检查前冻结的方案,将文件其余部分保留为UML骨架和签名,并未比直接删除解决更多问题,精确McNemar检验p=0.75,预注册假设未获支持。压缩上下文以约三分之一词元达到完整文件的表现;按已解决问题计,上下文词元成本为19K,而非94K。另一个发现是,温度为0的API推理在字节完全相同的重复运行间,约9%的实例结果会翻转,构成小效应的测量噪声。论文发布经参考方案核验的环境、证明每个参考修改都能由各实验组上下文表达的逐实例检查、确定性补丁构建工具,以及包含未获支持结果的预注册假设。