论文

单独通过,一起失败:并行大语言模型代理开发中语义协调的基准测试

Passes Alone, Fails Together: Benchmarking Semantic Coordination in Parallel LLM-Agent Development

智能体系统Agent任务评测

摘要

并行编码代理可以生成单独工作但在合并时失败的补丁。当一个代理更改另一代理仍然依赖的接口或规则时,就会发生这种情况。我们用 stale(语义协调的基准)来研究这些失败。我们的评估对每个补丁及其组合运行相同的测试,仅计算组合补丁所引入的故障。我们使用三层:具有受控界面更改的合成任务、合并的拉取请求对以及使用真正的 Django 助手的构造任务。在 417 个挖掘的 Django 对的 834 次运行中,只有一对在纠正评分程序后出现干扰。在使用 12 个 Django 助手构建的任务中,97% 的运行发生干扰。描述已完成并发更改的消息恢复了 82% 的运行。即使代理在使用真实代码的受控任务上失败,经过审查的拉取请求也可能包含一些未解决的并行更改。构建的故障率并不能估计这些问题在实践中发生的频率。