论文

LoopArena:评测模型作为循环工程运行时控制器的能力

LoopArena: Benchmarking Models as Runtime Controllers for Loop Engineering

智能体系统Agent HarnessAgent任务评测长程任务评测

摘要

循环工程正在成为一种围绕编码代理组织开发工作的实践。从业者不是手工编写每个提示,而是设计循环来监控进度、分配工作、运行检查并决定代理下一步应该做什么。即使使用功能强大的编码代理,循环也可能会信任过时的进度注释,跳过所需的验证,将预算花在错误的方向上,或者在任务安全提交之前停止。然而,一次端到端运行的最终结果无法判断成功或失败是否反映了循环的指导或编码代理执行任务的能力。我们引入了 LoopArena,这是一个基准,用于评估一个模型如何引导单独的编码代理完成长期运行的任务。接受评估的模型是 \textbf{Controller}:在每轮编码之后,它都会收到运行的结构化摘要,并指示单独的固定编码代理 \textbf{Worker} 下一步要做什么或验证,或者决定是否停止。 LoopArena 在执行范围和成本不同的三种互补设置中评估这种能力。类型 I 通过执行验证问题对下一步循环合约选择进行评分,而无需在评估时运行 Worker。类型 II 对完整任务的选定部分执行重复控制,而类型 III 从其原始状态评估配对的完整任务。在完整任务中,观察到的最佳严格成功率为 \textbf{24.69\%},为长视野循环控制留下了很大的改进空间。在控制器中,估计推理成本的成对减少平均为 \textbf{64.4\%},并且类型 II 在主要核心标准下产生类似的排序(Spearman 的 \(ρ=\textbf{0.9747}\))。我们在 https://github.com/AMAP-ML/LoopArena 发布了基准数据和评估代码。

LoopArena:评测模型作为循环工程运行时控制器的能力:论文配图
图1:环阿伦纳剂Harness。这两个条件都是从恢复的任务状态开始的,使用同样的工人、编码工具和任务评价员。在主计长指导的条件下,临时记者智能体总结了工人在每一轮之后的进展,智能体Harness则以决定性的方式将报告编成证据包。主计长阅读了这一结构化的、只读的摘要,并签发了一份环形合同,具体说明下一个工人部分,或决定停止。在无控制状态下,工人在没有主计长指导下工作。