论文
ClassEval-Pro:类级代码生成的跨域基准
ClassEval-Pro: A Cross-Domain Benchmark for Class-Level Code Generation
摘要
LLM 在函数级代码合成和存储库级代码修改方面都取得了出色的成果,但是介于这两个极端之间的功能(组合代码创建,即根据规范构建完整的内部结构化类)仍然没有得到充分利用。当前的评估要么仅限于孤立的功能,要么依赖于手动策划的类级任务,这些任务的扩展成本很高,并且越来越容易受到数据污染的影响。我们推出了 ClassEval-Pro,这是跨越 11 个领域的 300 个类级任务的基准,通过自动化的三阶段管道构建,结合了复杂性增强、跨域类组合以及 2025 年 1 月后贡献的实际 GitHub 代码的集成。每项任务均由 LLM Judge Ensemble 进行验证,并且必须通过行覆盖率超过 90% 的测试套件。我们评估了五代策略下的五个前沿 LLM。最好的模型仅达到 45.6% 的类级别 Pass@1,最强模型和最弱模型之间存在 17.7 分的差距,证实了基准测试的判别能力。策略选择与模型能力密切相关:自下而上等结构化方法将较弱的模型提高了高达 9.4 个百分点,而组合生成则下降至低至 1.3%。对 500 多个手动注释的故障进行的错误分析表明,逻辑错误 (56.2%) 和依赖错误 (38.0%) 占主导地位,将跨方法协调确定为核心瓶颈。