论文

SpecBench:评估软件工程 LLM 代理的规范级推理

SpecBench: Evaluating Specification-Level Reasoning for Software Engineering LLM Agents

模型评测基准与评测资源

摘要

软件工程 (SWE) 代理正在从代码生成过渡到完整的软件开发生命周期自动化。此生命周期的一个关键阶段是规范设计:通过专家评审将最初的建议转化为经过仔细考虑的需求。 SWE-Bench 等现有基准测试以实现为重点,通过测量代理在给定固定、精确的设计要求的情况下生成代码的能力。此表述假设规格正确且完整。在现实世界中复杂且关键的软件系统中,初始规范通常不完整且存在缺陷,在接受实施之前需要进行广泛的专家审查和修订。为了填补这一空白,我们引入了 SpecBench 来评估规范级推理:生成完整、明确、一致且正确的系统规范的能力。 SpecBench 任务源自成熟开源项目使用的征求意见 (RFC) 流程。对于每项任务,都会向代理提供初始设计提案、项目代码库以及所有过去的项目 RFC 讨论。代理的任务是识别规范缺陷:初始提案中的遗漏、模糊、不一致或不正确的假设。我们根据专家维护者在历史 RFC 审查期间提出的批评来评估预测。 SpecBench 包含来自 5 个不同存储库的任务:Kubernetes、React、Rust、TVM 和 vLLM。我们在 SpecBench 上评估最先进的 SWE 代理,分析它们在没有执行反馈的情况下推理系统设计的能力。表现最好的代理 GPT-5.4 达到了 44.4% 的准确率。