论文

BulkPR-Bench:交互拉取请求的队列级治理基准测试

BulkPR-Bench: Benchmarking Queue-Level Governance of Interacting Pull Requests

智能体系统Agent任务评测

摘要

编码代理基准越来越多地涵盖长期、端到端和交互式开发,但通常保留一个请求的结果或固定的更改顺序。顺序策略可以一次处理一个候选者的拉取请求 (PR) 队列,但是当排队的 PR 交互时,最大化安全交付可能需要共同决定要合并哪些更改以及按什么顺序。我们引入了 BulkPR-Bench,这是一个可执行基准测试,其中代理必须恢复相应的 PR 关系,并在滚动发布协议下按可执行顺序返回一个大型安全子集。该套件包含 581 个新编写的候选 PR,这些 PR 是针对 18 个真实存储库的冻结快照。注册的逐状态存储库执行,包括隐藏的安全检查,验证标准关系图;然后,精确预言机计算最大的安全子集。我们的主要指标关系交付分数 (RDS) 对已实现的合并跟踪中的关系组的安全交付和正确拒绝进行评分; Global Safety-Gated Yield (Global-SGY) 单独衡量已实现的全队列计划的严格交付。在批量大小 $K=32$ 的缓冲主要协议下,六个模型中三个最高的 RDS 估计值为 66.6%、62.0% 和 57.9%,而最强的顺序基线为 53.1%。 324 个模型运行中只有 8 个准确地完成了队列。关键关系召回率范围为 35.2% 到 57.7%,并且使用标准关系提供的诊断运行显示出大量的剩余空间。因此,关系组的收益尚未转化为可靠的全队列治理。