论文

NP-Bench 与 Nerveplane:验证并行编码协调

Verifying Coordination in Parallel Coding Agents: NP-Bench and a Scheduling Planner

智能体系统Agent 协作

摘要

一个编码智能体的团队可能看起来不错,但作为一个团队却会失败:每个人都通过了自己的测试,而合并的结果却被破坏了,并且单个智能体评估永远无法捕获它。当团队在一个代码库上并行运行多个 LLM 编码智能体时,智能体会发生冲突:两个重写相同的函数,一个代码针对队友刚刚更改的合同,并且工作完成后集成失败。大多数协调工具都会做出反应(注意冲突,然后发出警告),但以智能体的速度,警告会在浪费的编辑之后到达。我们将问题重新定义为调度:获取每个工作项的声明范围,将工作划分为不相交的范围,并沿着生产者->消费者图进行顺序合并,所有这些都是预先完成的。我们将此规划器构建到 Nerveplane 中,并使用 NP-Bench 对其进行评估,NP-Bench 是一个基于环境的三臂基准(无协调;反应性检测;主动规划),可在确定性模拟和实时智能体中验证真实 git 合并的集成。规划器将清洁集成从 1/9 场景提升到 9/9 场景,并将合并冲突从 13 减少到 0,差距随着智能体数量的增加而增加。在实时破坏合同变更中,它挽救了每个种子上两个基线都错过的结果:在前沿模型上,干净集成率从 0(无协调和反应性检测)上升到 1.0,在小模型上上升到 0.6,而智能体尊重指定的范围(0/5 泄漏)。跨会话记忆将强模型和弱模型的重复错误率从 1.00 降低到 0.00。我们还报告了一个负面结果:将事实路由到智能体并不能挽救窗口拟合尺度下的长上下文准确性;它的价值在于成本和容量,而不是注意力。在两个能力层和两个供应商中,随着模型变得更强,收益并没有缩小,因为它来自于工作分配方式,而不是模型推理。