论文
评测 LLM 生成代码:结合基准与开发者审查
Evaluating LLM-Generated Code: A Benchmark and Developer Study
摘要
代码生成是 大语言模型 被广泛采用且非常成功的任务之一。鉴于这种受欢迎程度,有许多专门用于代码生成的基准可以帮助选择最佳模型。然而,他们主要关注测量解决方案的正确性,而忽略了其他方面,例如代码质量和可用性。本文旨在描述一种针对 大语言模型 生成的代码的自定义三方面评估方法,以弥补这一差距。该方法包括基于复杂的多级计算机科学项目的专用正确性基准、代码质量验证以及开发人员对通过结构化代码审查过程收集的生成代码样本的意见调查。通过评估和比较三个通用 大语言模型:GPT-4.1、DeepSeek-V3-0324 和 Claude Opus 4,证明了所提出的方法的用法和实用性。结果表明,从开发人员那里收集的评论可以产生许多新的发现,特别是与处于生产就绪状态的代码相关的发现,这是使用标准的以正确性为中心的基准测试方法不可能获得的。