论文

LLM-ReSum:通过自我评估进行 LLM 反思总结的框架

LLM-ReSum: A Framework for LLM Reflective Summarization through Self-Evaluation

模型评测评测方法与指标

摘要

对 大语言模型 (LLM) 生成的摘要进行可靠评估仍然是一个开放的挑战,特别是跨异构域和文档长度。我们对跨越 5 个领域的 7 个数据集的 14 个自动摘要指标和基于 LLM 的评估器进行了全面的元评估,涵盖从短新闻文章到长科学、政府和法律文本(2K-27K 字)的文档,以及超过 1,500 个人工注释的摘要。我们的结果表明,传统的词汇重叠度量(例如 ROUGE、BLEU)与人类判断表现出弱相关或负相关,而特定于任务的神经度量和基于 LLM 的评估器实现了更高的一致性,特别是对于语言质量评估。利用这些发现,我们提出了 LLM-ReSum,这是一种自我反思总结框架,它将基于 LLM 的评估和生成集成在闭合反馈环中,无需模型微调。在三个领域中,LLM-ReSum 将低质量摘要的事实准确性提高了 33%,覆盖率提高了 39%,在 89% 的情况下,人类评估者更喜欢精致的摘要。我们还引入了 PatentSumEval,这是一种新的人工注释的法律文档摘要基准,包含 180 个专家评估的摘要。所有代码和数据集将在 GitHub 上发布。