论文
LongSumEval:基于问答的评估和反馈驱动的长文档摘要细化
LongSumEval: Question-Answering Based Evaluation and Feedback-Driven Refinement for Long Document Summarization
摘要
评估长文档摘要仍然是摘要研究的主要瓶颈。现有的指标与人类判断的相关性较弱,产生的总分无法解释缺陷或指导改进,从而阻碍了需要可验证准确性的应用程序的有效改进。我们引入了 LongSumEval,这是一个通过结构化问答反馈桥接评估和生成的统一框架。该框架将摘要质量运作为问答对的可回答性和事实一致性,生成可解释的分数和可操作的反馈,以识别覆盖范围差距和事实不一致。这解决了评估独立于生成目标进行的情况的不一致。与既定指标相比,我们基于 QA 的评估模块在七个基准上的元评估表明,与人类判断的一致性要强得多。结构化反馈可以通过自我改进实现显着的质量改进,而无需重新培训。通过证明评估反馈可以作为生成的可执行指令,这项工作建立了一个将评估与改进相结合的通用范式,对需要可验证的准确性和透明的质量控制的可控文本生成具有直接影响。所有代码和数据集都将在 GitHub 中发布,以确保可重复性。