论文
编码智能体的成本浪费:重复检索、脚本与测试
Analyzing and Mitigating Cost-Inefficient Behaviors in Coding Agents
摘要
虽然有效,但编码代理通常会产生大量的金钱成本。他们反复出现的成本低效行为仍未得到充分探索。我们对编码代理的行为成本低效率进行了首次研究,分析了 SWE-bench Verified 上四种配置的 Claude Code 和 Mini-SWE-Agent 的 1,200 个轨迹。我们确定了三种成本低效的行为:已被先前结果覆盖的重复检索、相似脚本生成和测试重新执行。然后,我们评估三种缓解策略:结构感知检索、代理综合技能和开发人员设计的技能,以及留出的SWE-bench Verified 和 Pro 任务上超过 10k 的轨迹。我们的主要发现是:(1)这三种行为影响79.00%--98.00%的编码任务,最多占任务成本的22.75%。 (2)结构感知检索会引入检索开销并改变代理委托,导致检索效率提升不一致,成本增加高达28.14%。 (3) 智能体综合技能往往会产生低级、特定跟踪的指导,限制了其有效性和通用性。 (4) 相比之下,开发人员设计的技能提供了高级、与跟踪无关的指导,可将成本降低高达 41.73%,大约是代理合成技能最大收益的两倍。
