论文

EvoCode-Bench:在多轮迭代交互中评估编码智能体

EvoCode-Bench: Evaluating Coding Agents in Multi-Turn Iterative Interactions

智能体系统Agent任务评测

摘要

编码智能体越来越多地被用作迭代开发伙伴,但大多数基准仍是先给定一份规约、再做一次最终评估。这遗漏了一个基本问题:随着需求变化,智能体能否让自己维护的代码库持续保持可用?我们提出EvoCode-Bench,一个包含26个有状态编码任务、227个被评估轮次的基准。每个任务将智能体的工作区保留5-15轮,通过可观测行为表述需求,并使用累积的可执行测试同时检查新需求与仍然有效的先前需求。我们用两个指标评估13个编码智能体:MT@4,一种四次尝试、失败即止的多轮分数;以及SR,从参考完成的前序状态出发的单轮分数。对大多数智能体而言,SR比MT@4高出22-40分。这一差距还改变了排名:SR最高(78.9)的智能体在持续执行上仅排第三(MT@4为44.0)。即使最强的智能体在多轮指标上也只取得约50%的成功率,且总通过率到第5轮已跌破首轮表现的一半。失败分析显示出按能力分层的行为:较弱智能体早早失败,而较强智能体存活得足够久,从而暴露出规约追踪与回归方面的失败。我们发布了基准数据与Harbor多轮基础设施。

EvoCode-Bench:在多轮迭代交互中评估编码智能体:论文配图
图 1:EvoCode-Bench 概述。 (a) 每轮包含指令、参考解决方案以及经过人工审查和预言机验证检查的累积测试。 (b) MT@4 在各轮中保持一个 Docker 环境和代理会话,并具有故障停止终止功能。 (c) SR 在每个目标轮之前快进到参考状态。