论文

正确的代码,错误的贡献? SWE-CC:编码智能体的基准存储库策略合规性

Correct Code, Broken Contributions? SWE-CC: Benchmarking Repository Policy Compliance for Coding Agents

智能体系统Agent任务评测

摘要

自主编码智能体现在可以解决大部分现实世界的 GitHub 问题。然而,通过功能测试与生成可接受合并的高质量贡献有着根本的不同。成熟的开源项目发布特定于存储库的贡献策略,跨越样式、git、测试工作流程,以确保代码质量和长期可维护性。由于现有基准仅在单元测试上评估补丁,因此智能体是否符合存储库治理仍然未知。在本文中,我们介绍了 SWE-CC,这是一个评估自主软件工程中代码和流程合规性的基准。我们开发了一个半自动化管道,将 12 个开源存储库中的开发人员文档转换为 823 个机器可检查的原子策略。 SWE-CC 引入了两个功能:1)代表每个策略的轻量级确定性检查器函数,2)检查智能体运行时行为和最终可交付成果的全面审核机制。我们在从 SWE-bench Verified 扩展的 500 个端到端软件贡献任务中评估了智能体工作流程的合规性。我们对两个智能体支架下的四个LLM的评估表明,现代智能体存在编码合规性问题:尽管智能体生成功能正确的补丁,但它们仍然违反了适用项目策略的 43.1%,其中近一半的违规发生在中间执行步骤期间。这些结果表明,功能正确性并不能保证现实世界的就绪性,强调未来的软件工程智能体必须可靠地符合存储库治理,以实现安全且值得信赖的部署。

正确的代码,错误的贡献? SWE-CC:编码智能体的基准存储库策略合规性的原论文方法或结果图
图 2:SWE-CC 基准建设管道。 LLM智能体从项目文档中提取原子策略,将其过滤为 823 个可检查、强制的策略,并将每个编译为检查器函数。在 SWE 基准问题上,检查器功能对智能体的最终输出和轨迹进行评分。我们用一个策略示例来说明这一点:提交摘要 $\leq$ 71 个字符。