论文

SWE-Prometheus:测量真实仓库中的工程治理改进

SWE-Prometheus: Measuring Engineering Governance Improvements in Real-World Repositories

智能体系统Agent任务评测

摘要

基于大型语言模型的编码智能体在仓库级软件工程任务上取得了长足进步。然而,现有的仓库基准通常从一个人工确定的issue出发,评测补丁是否满足某个功能信号。我们提出SWE-Prometheus,一个面向更宏大任务——改进仓库工程治理——的基准。每个任务提供固定快照和开放式目标,要求智能体识别风险、确定干预优先级并验证由此产生的变更。SWE-Prometheus通过成对证据、干净环境探针、行为门控以及同一证据的两份独立教师评分,评测六个治理维度。该基准包含60个仓库;十个模型在一个共享的22仓库公开子集上评测,其平均归一化治理改进(NGI)从0.0568到0.5760,观察到的行为破坏率从0%到23%。在一个冻结的10仓库批次上,一个不感知仓库的模板获得平均NGI 0.272,但其收益集中在测试与CI、质量门控和文档;它在任何仓库上都没有改进可复现环境和依赖与安全。该基线使添加治理产物与产生有执行证据支撑的改进之间的区别可被测量。无操作(no-op)条件的中位NGI为零、标准差0.073;两位教师对同一无操作证据的60个维度分中有57个完全一致。对于条件均值最高的两个系统,共同有效NGI相近,而包含行为失败的全池比较更有利于Kimi-K3。这些结果表明,仓库治理评测应同时报告改进、行为保持、证据质量和覆盖率。

SWE-Prometheus:测量真实仓库中的工程治理改进:论文配图
图 1:SWE-Prometheus 的动机。已有的 issue 级 SWE 基准给智能体一个局部化缺陷,并对照目标测试为补丁打分,而对测试与 CI 就绪度、干净环境下的行为验证、补丁目标之外的质量与可维护性,以及文档、可复现性、依赖与安全健康状况均不作评估。SWE-Prometheus 用一份治理简报取代 issue,要求智能体自行诊断并改造仓库,并由干净环境验证器生成一份“基线-处理后”配对报告进行评分。