论文
SWE-Prometheus:测量真实仓库中的工程治理改进
SWE-Prometheus: Measuring Engineering Governance Improvements in Real-World Repositories
摘要
基于大型语言模型的编码智能体在仓库级软件工程任务上取得了长足进步。然而,现有的仓库基准通常从一个人工确定的issue出发,评测补丁是否满足某个功能信号。我们提出SWE-Prometheus,一个面向更宏大任务——改进仓库工程治理——的基准。每个任务提供固定快照和开放式目标,要求智能体识别风险、确定干预优先级并验证由此产生的变更。SWE-Prometheus通过成对证据、干净环境探针、行为门控以及同一证据的两份独立教师评分,评测六个治理维度。该基准包含60个仓库;十个模型在一个共享的22仓库公开子集上评测,其平均归一化治理改进(NGI)从0.0568到0.5760,观察到的行为破坏率从0%到23%。在一个冻结的10仓库批次上,一个不感知仓库的模板获得平均NGI 0.272,但其收益集中在测试与CI、质量门控和文档;它在任何仓库上都没有改进可复现环境和依赖与安全。该基线使添加治理产物与产生有执行证据支撑的改进之间的区别可被测量。无操作(no-op)条件的中位NGI为零、标准差0.073;两位教师对同一无操作证据的60个维度分中有57个完全一致。对于条件均值最高的两个系统,共同有效NGI相近,而包含行为失败的全池比较更有利于Kimi-K3。这些结果表明,仓库治理评测应同时报告改进、行为保持、证据质量和覆盖率。
