论文

PonyEval:评估基于 LLM 的程序修复,以实现功能安全和面向参与者的 Pony Software

PonyEval: Evaluating LLM-Based Program Repair for Capability-Safe and Actor-Oriented Pony Software

智能体系统Agent任务评测

摘要

存储库级问题解决基准使可执行评估成为软件工程代理的核心,但它们的语言覆盖范围仍然集中在主流生态系统中。 Pony 提出了一种不同的机制:它结合了参与者、参考功能、提前编译和快速发展的历史工具链,使得补丁生成和忠实重放变得困难。我们引入了 PonyEval,这是一个 SWE 基准测试,包含来自 15 个 Pony 存储库的 291 个真实 GitHub 问题拉取请求对。每个实例都绑定一个问题声明、一个历史基础提交、一个开发人员黄金补丁、一个黑盒测试补丁和一个可重现的运行时映射。冻结版本通过了离线审核,要求特定于问题的测试在基本状态上失败并在黄金补丁后通过;它不包含重复的实例标识符或规范存储库-PR 对。在单独的全套语义选择审核中,三名独立的机器审核员将所有 291 个实例标记为包含或排除;他们的 Fleiss kappa 为 0.8968,其中有 249 个一致包含,32 个一致排除。为了重播 11 年的存储库历史,我们重建了 72 个运行时映像,涵盖 289 个独特的基本提交,并验证它们在五个异构计算节点上的可用性。我们为 GPT-5.6-sol、DeepSeek-V4-Pro、GLM-5.2、MiniMax-M3 和 Kimi-K3 定义了与 mini-SWE-agent 2.4.6 的匹配评估,然后进行严格的补丁应用、编译和隐藏测试验证。在每个模型实际生成的补丁中,条件分辨率范围从 10.21% 到 24.68%。这些比率表征了生成补丁的质量,而不是所有 291 个基准任务的成功率。