论文
EvoCode-Bench:在多轮迭代交互中评估编码智能体
EvoCode-Bench: Evaluating Coding Agents in Multi-Turn Iterative Interactions
摘要
编码智能体越来越多地被用作迭代开发伙伴,但大多数基准仍是先给定一份规约、再做一次最终评估。这遗漏了一个基本问题:随着需求变化,智能体能否让自己维护的代码库持续保持可用?我们提出EvoCode-Bench,一个包含26个有状态编码任务、227个被评估轮次的基准。每个任务将智能体的工作区保留5-15轮,通过可观测行为表述需求,并使用累积的可执行测试同时检查新需求与仍然有效的先前需求。我们用两个指标评估13个编码智能体:MT@4,一种四次尝试、失败即止的多轮分数;以及SR,从参考完成的前序状态出发的单轮分数。对大多数智能体而言,SR比MT@4高出22-40分。这一差距还改变了排名:SR最高(78.9)的智能体在持续执行上仅排第三(MT@4为44.0)。即使最强的智能体在多轮指标上也只取得约50%的成功率,且总通过率到第5轮已跌破首轮表现的一半。失败分析显示出按能力分层的行为:较弱智能体早早失败,而较强智能体存活得足够久,从而暴露出规约追踪与回归方面的失败。我们发布了基准数据与Harbor多轮基础设施。
