论文

程序修复的稠密与 MoE 模型多维评估

Beyond the Leaderboard: Multi-Dimensional Evaluation of Dense and Mixture-of-Experts Models for Automated Program Repair

模型评测评测方法与指标

摘要

使用语言模型的自动程序修复(APR)通常通过生成的补丁是否通过测试套件来评估,这可以隐藏可维护性、安全性和计算成本方面的差异。受 ISO/IEC 25010 软件质量模型启发,我们提出了加权质量指数 (QI),该指数在可配置的加权方案下结合了功能正确性、可维护性、安全性和生成效率。我们在 40 个 QuixBugs 和 90 个 Defects4J bug 上评估了三个密集 Qwen2.5-Coder 模型(3B、7B、14B)和 16B-参数 DeepSeek-Coder-V2-Lite Mixture-of-Experts (MoE) 模型(2.4B 活动参数),所有这些模型都在相同的硬件上本地运行以控制基础设施影响。模型排名随着权重方案的变化而变化,这表明单一指标评估可以隐藏权衡。 MoE 模型与 7B 和 14B 密集模型(McNemar 的精确测试)相比,在使用较少 3-6 倍的活跃参数的情况下,在正确性方面几乎没有显着差异,而在三个密集尺度上,正确性显着增加。这些结果表明,对于稀疏代码模型,活动参数计数比总参数计数更能提供更多信息。

程序修复的稠密与 MoE 模型多维评估:论文原图
图 1:每个模型在四个质量维度上的得分。