论文

编码智能体 中的潜在编程视野

Latent Programming Horizons in Coding Agents

模型评测模型行为与机制分析

摘要

解决软件工程任务的 编码智能体 需要花费数十个步骤进行推理、编辑代码和运行测试,但人们对底层语言模型在内部代表其正在处理的程序的内容知之甚少。我们证明,编码智能体 下语言模型的残差流对进化程序的属性进行线性编码:隐藏状态的逻辑回归探针能够解码当前代码是否解析、通过其测试套件、减少失败测试的数量并引入回归,在两个模型和两个基准测试中的正确性达到 AUC 高达 0.83。我们的第二个发现更令人惊讶:这些表示领先于代理自己的编辑。经过训练来预测未来编辑结果(在具体化并写入磁盘之前)的探针最多可以提前大约 25 步实现高于概率的性能。我们称之为代理的潜在编程视野。作为外部有效性的证明,我们表明探针无需重新训练即可跨基准转移。我们的积极结果呼吁对 编码智能体 的机械解释进行更多研究。