论文

通过率能说明全部情况吗?评估基于 LLM 的问题解决中的设计约束合规性

Does Pass Rate Tell the Whole Story? Evaluating Design Constraint Compliance in LLM-based Issue Resolution

模型评测基准与评测资源

摘要

存储库级问题解决基准已成为评估基于 LLM 的代理的标准测试平台,但成功仍然主要通过测试通过率来衡量。然而,在实践中,可接受的补丁还必须符合特定于项目的设计约束,例如架构约定、错误处理策略和可维护性要求,这些约束很少在测试中进行编码,并且通常仅在代码审查讨论中隐式记录。本文介绍了 \textit{设计感知问题解决方案} 并提出了 \bench{},这是一个使此类隐式设计约束变得明确且可测量的基准。 \bench{} 是通过挖掘和验证来自现实拉取请求的设计约束、将它们链接到问题实例并使用基于 LLM 的验证器自动检查补丁合规性来构建的,在六个存储库中生成 495 个问题和 1,787 个经过验证的约束,与 SWE-bench-Verified 和 SWE-bench-Pro 保持一致。使用最先进的代理进行的实验表明,基于测试的正确性大大高估了补丁质量:不到一半的已解决问题完全满足设计要求,设计违规很普遍,功能正确性与设计满意度的统计关联可以忽略不计。虽然提供针对特定问题的设计指导可以减少违规行为,但仍然存在大量不合规情况,这凸显了当前代理能力的根本差距,并激励设计意识评估超越功能正确性。