论文
超越精度:长格式 LLM 生成中事实性评估的重要性感知召回
Beyond Precision: Importance-Aware Recall for Factuality Evaluation in Long-Form LLM Generation
摘要
评估 大语言模型 (LLM) 生成的长格式输出的真实性仍然具有挑战性,特别是当响应是开放式的并且包含许多细粒度的事实陈述时。现有的评估方法主要关注精度:它们将响应分解为原子声明,并根据维基百科等外部知识源验证每个声明。然而,这忽略了事实性的一个同样重要的维度:回想一下,生成的响应是否涵盖了应包含的相关事实。我们提出了一个综合的事实性评估框架,联合衡量精确度和召回率。我们的方法利用外部知识源来构建参考事实并确定它们是否被捕获在生成的文本中。我们进一步引入基于相关性和显着性的重要性感知加权方案。我们的分析表明,当前的 LLM 在精确度方面的表现比在召回方面的表现要好得多,这表明事实的不完整性仍然是长格式生成的主要限制,并且模型通常比完整的相关事实更擅长覆盖非常重要的事实。