论文
OdinEval:Odin 编程语言中基于 LLM 的程序修复的可重现基准
OdinEval: A Reproducible Benchmark for LLM-Based Program Repair in the Odin Programming Language
摘要
存储库级修复基准仍然集中在几种主流语言上,使得 Odin 等系统语言基本上未经测试。我们推出了 OdinEval,这是一个根据公共 Odin 存储库中记录的缺陷构建的可重复基准。每个实例将一个问题绑定到基础和修复提交、参考补丁、特定于问题的回归测试、历史工具链和执行记录。纳入条件测试在基础修订版上失败,并在参考修订版后通过。当不存在可用的开发人员测试时,黑盒测试由同一模型的三个实例独立审查,在两种历史状态下执行,并根据版本化测试编写技能记录的反馈进行修改。我们在一种共享协议下对 168 个过滤实例评估了六种语言模型。 Kimi-K3 的 Resolved 得分最高,为 66.7%,而 Qwen3.8-Max 的 Repro 得分最高,为 96.4%。该版本包括冻结数据、源档案、容器、验证器、模型补丁和审计清单。