索赔平面:并行 编码智能体 的可靠性增益和选择性并发限制:确定性预写准入的 30 对、三种子验证研究
Claim Plane: Reliability Gains and the Limits of Selective Concurrency for Parallel Coding Agents: A 30-Pair, Three-Seed Confirmatory Study of Deterministic Pre-Write Admission
摘要
并行 编码智能体 可以生成本地有效的更改,这些更改在组合时会失败。声明平面将这种故障模式解决为针对版本化变更意图的确定性预写入准入。本文报告了对 30 个冻结 CooperBench 特征对的验证性研究,在 15 个冲突标签和 15 个干净标签之间进行平衡,具有 3 个编码器种子、4 个协调臂和 360 个已完成的执行。 DeepSeek V4 Pro一次生成了60个特征级规划器声明;所有手臂和编码器种子中的声明都被冻结,而 DeepSeek V4 Flash 则执行编码工作。静态声明平面将无约束并行执行下的配对通过率从 23.3% 提高到 50.0%,配对任务集群差异 +26.7 个百分点(95% 引导 CI 9.6 到 60.0),并将集成成功率从 65.6% 提高到 96.7%。在有冲突标签的配对中,配对通过率从 6.7% 上升到 60.0%。然而,静态准入串行化了 96.7% 的执行,包括 93.3% 的干净案例,因此在很大程度上通过崩溃到串行执行来恢复可靠性。动态准入更具选择性,序列化了 66.7% 的冲突案例和 13.3% 的干净案例,但 90 次处决中有 46 次因未申报的范围而失败,将配对通过率降至 22.2%。这 46 个区块中的 45 个目标文件已存在于冻结申报中,这表明该地区覆盖范围不足且修改处理不充分,而不是完全未知的文件。结果支持预写准入作为一种可靠性机制,但它们没有建立有用的挂钟并行加速:提供程序调用在物理上是连续的,并且保守的策略很大程度上串行化了工作负载。完整的研究工件、哈希值和集群引导分析已公开发布以供复制。