论文
LoopsBench:编码智能体 评估中从Harness工程到循环工程
LoopsBench: From Harness Engineering to Loop Engineering in Coding Agent Evaluation
摘要
编码智能体 基础设施正在从Harness工程转向回路工程,因为 编码智能体 被部署用于持续的长期软件开发。现有的基准通常以本地化任务或最终状态结果为中心,对持续执行的洞察力有限。我们在 编码智能体 评估中引入了 LOOPSBENCH,这是循环工程的长期基准。每个任务都是对可单独测试的开发单元的依赖 DAG,具有源证明的先决条件边缘。 LOOPSBENCH 包含来自真实来源的 112 项任务,涵盖 8 种编程语言和 9 个领域。其流程感知运行时沿就绪边界发布测试,并保留已完成的节点作为回归义务。我们评估前沿 编码智能体 与广泛使用的循环实现的搭配。最强的配置,带有 Claude Code 和外部延续的 Opus-4.7,解决了 25.00% 的任务。记录的计划仅恢复源恢复的必备 DAG 的一部分,并且回归事件在评估的循环配置文件中保持可见。我们在 microsoft/Loopsbench 开源了基准测试数据和代码,包括所有任务、超过 5,300 个开发单元和可执行测试。