论文
正确的代码,错误的贡献? SWE-CC:编码智能体的基准存储库策略合规性
Correct Code, Broken Contributions? SWE-CC: Benchmarking Repository Policy Compliance for Coding Agents
摘要
自主编码智能体现在可以解决大部分现实世界的 GitHub 问题。然而,通过功能测试与生成可接受合并的高质量贡献有着根本的不同。成熟的开源项目发布特定于存储库的贡献策略,跨越样式、git、测试工作流程,以确保代码质量和长期可维护性。由于现有基准仅在单元测试上评估补丁,因此智能体是否符合存储库治理仍然未知。在本文中,我们介绍了 SWE-CC,这是一个评估自主软件工程中代码和流程合规性的基准。我们开发了一个半自动化管道,将 12 个开源存储库中的开发人员文档转换为 823 个机器可检查的原子策略。 SWE-CC 引入了两个功能:1)代表每个策略的轻量级确定性检查器函数,2)检查智能体运行时行为和最终可交付成果的全面审核机制。我们在从 SWE-bench Verified 扩展的 500 个端到端软件贡献任务中评估了智能体工作流程的合规性。我们对两个智能体支架下的四个LLM的评估表明,现代智能体存在编码合规性问题:尽管智能体生成功能正确的补丁,但它们仍然违反了适用项目策略的 43.1%,其中近一半的违规发生在中间执行步骤期间。这些结果表明,功能正确性并不能保证现实世界的就绪性,强调未来的软件工程智能体必须可靠地符合存储库治理,以实现安全且值得信赖的部署。
