论文
不要责怪 大语言模型:代理利用进化如何塑造 编码智能体 质量
Don't Blame the Large Language Model: How Agent Harness Evolution Shapes Coding Agent Quality
摘要
编码智能体 是使用 大语言模型 (LLM) 解决软件工程任务的自治系统,依赖于代理工具:开发人员和 大语言模型 之间的中间件层,用于协调系统提示、工具执行、上下文管理和迭代推理循环。虽然这些代理工具以极快的速度发展,但没有研究探讨这种发展如何随着时间的推移影响代理质量(即有效性和效率)。从业者会在代理工具更新后定期报告质量回归,但始终将其归因于底层模型而不是工具本身。在本文中,我们通过进行第一个受控纵向研究来解决这一差距,该研究隔离了代理利用的贡献。与之前修复代理工具并改变模型的工作不同,我们修复模型并仅改变代理工具,评估 35 个连续版本以衡量它们对代理有效性和效率的影响。我们首先实证研究了五种主要开源代理工具(即 Codex、Qwen Code、Gemini、OpenCode 和 OpenHands)的开发和发布演变,揭示了每天超过两次发布的极端发布速度以及数月内数千个问题。然后,我们对 Qwen Code CLI 的 35 个连续版本进行受控深入研究,针对 50 个分层 SWE 基准验证任务对每个版本进行评估,同时保持底层 LLM 不变。我们将由此产生的质量波动追溯到特定的开发模式和架构组件,并用具体的定性证据来说明我们的发现,这些证据将单个拉取请求与测量的质量变化联系起来。