论文

SONAR:针对没有参考的 LLM 消费者的任务感知代码摘要评估

SONAR: Task-Aware Code Summary Evaluation for LLM Consumers Without References

模型评测评测方法与指标

摘要

传统上,源代码摘要是从人类开发人员的角度进行评估的,其质量取决于它们与开发人员编写的参考的相似程度以及它们与人类偏好的一致程度。但这忽视了一个日益增长的现实:基于 LLM 的工具和代理越来越多地使用代码摘要作为软件工程 (SE) 任务的输入,而摘要对于任务中的使用代理有用的原因在很大程度上仍未被探索。为了弥补这一差距,我们提出了 SONAR,这是一个无参考框架,可以从四个维度评估源代码摘要:正确性、抽象性、简洁性和流畅性。 SONAR 没有针对预先编写的“金标准”进行优化,而是引入了一种新颖的基于代码重新生成的方法,该方法使用摘要来重新生成代码,并利用该重建作为摘要的质量信号。这提供了经验基础,既不需要参考摘要,也不需要人类或 LLM 的主观判断。我们根据 SONAR 对四个下游 SE 任务影响 LLM 性能的能力来评估 SONAR 的维度。我们发现正确性(其次是抽象性)与 LLM 性能显着相关,相关性比最佳基线高出 14 倍。尽管简洁性和流畅性受到人类开发人员的广泛重视,但对于 LLM 消费者来说仍然基本上无关紧要,这表明摘要的有用性取决于任务和消费者。通过使用 SONAR 对 11 个流行的 LLM 进行大规模评估,我们进一步确定了不同模型在每个质量维度上的优缺点,同时提供见解以促进未来任务感知摘要的研究。