论文
对泰坦进行基准测试:.NET 生态系统中 LLM 代码生成质量的多维实证评估
Benchmarking the Titans: A Multi-Dimensional Empirical Evaluation of LLM Code Generation Quality in the .NET Ecosystem
摘要
评估 大语言模型 (LLM) 代码生成质量不仅需要检查生成的代码是否正确,还要检查它是否可维护、高效和风格合理,所有这些都是对软件工程从业者直接重要的品质。现有的基准将评估减少到单个 Pass@k 指标,这模糊了功能正确性和结构质量之间的关键权衡。另一个限制是几乎只关注 Python,使得 C# 和 .NET 等企业相关生态系统没有专门的评估。本文提出了一个用于 C# 代码生成的自动化、多维评估框架,并将其应用于四个最先进的 LLM:GPT、Gemini、Claude 和 Grok。我们对源自 HumanEval 的 85 个算法任务进行了对照实验,总共生成并评估了 340 个解决方案,其中每个解决方案都从三个独立的维度进行评估:通过自动化单元测试的功能正确性、通过 Roslyn AST 分析的静态代码质量以及通过对抗性 BenchmarkDotNet 分析的运行时效率。我们的主要发现揭示了正确性和质量属性之间的巨大差距(Pearson r = 0.075),表明 Pass@k 排名系统地歪曲了软件工程环境中的完整 LLM 性能概况。我们进一步描述了 GPT 的双峰故障行为。