论文

ReFEree:用于评估现实世界代码摘要中事实一致性的无参考和细粒度方法

ReFEree: Reference-Free and Fine-Grained Method for Evaluating Factual Consistency in Real-World Code Summarization

模型评测评测方法与指标

摘要

随着 大语言模型 (LLM) 能够生成长的描述性代码摘要,准确可靠地评估事实一致性已成为一项关键挑战。然而,以前的评估方法主要是针对孤立代码片段的简短摘要而设计的。因此,他们很难提供多句子功能的细粒度评估,并且无法准确评估现实世界代码摘要中常见的依赖上下文。为了解决这个问题,我们提出了 ReFEree,一种无参考且细粒度的方法,用于评估现实世界代码摘要中的事实一致性。我们定义特定于代码摘要的事实不一致标准,并使用这些标准和依赖信息在段级别对其进行评估。然后将这些分段级别的结果聚合成细粒度的分数。我们使用人工注释的事实一致性标签构建了代码摘要基准。评估结果表明,ReFEree 在 13 个基线中实现了与人类判断的最高相关性,比之前的最先进技术提高了 15-18%。我们的代码和数据可在 https://github.com/bsy99615/ReFEree.git 获取。