论文

RealBench:贴近实际开发的仓库级代码生成基准

RealBench: A Repo-Level Code Generation Benchmark Aligned with Real-World Software Development Practices

模型评测基准与评测资源

摘要

软件开发中的代码编写需要大量时间与精力,大模型代码生成已取得进展。HumanEval、EvoCodeBench等基准多要求从自然语言需求生成代码,但企业与协作开发通常依据结构化设计或规范,这一差距可能使现有分数不能反映实际自动化价值。我们提出RealBench,一个贴近真实开发的仓库级代码生成基准。每个样本同时给出自然语言需求和作为系统设计的UML图,并系统评估先进大模型使用结构化设计生成代码的能力。结果显示,仓库级生成表现明显更差,且模型之间差异较大;模型擅长寻找和创建UML规定的模块,但所生成模块常有语法与逻辑错误。较小仓库一次整体生成效果最好,复杂仓库逐模块生成则优于其他策略。