论文
保留重要内容:摘要评估中超越饱和的语义支架
Preserving What Matters: Semantic Scaffolds Beyond Saturation in Summarization Evaluation
摘要
摘要存在于无数的生产系统中,使得模型选择成为依赖于衡量摘要质量的常规决策。现有的指标很难支持这一点:ROUGE 仅捕获表面重叠,而大语言模型作为评判分数饱和到几乎相同的值,无法有效地对模型进行排名。我们在三个公共数据集、两个专有数据集和多语言设置中观察到这种饱和度。受此启发,我们引入了语义支架,这是一个评估框架,它从源文本中提取事实、问题和实体属性的层次表示,将每个标记为要点或支持细节,并重新使用该结构作为评分摘要的固定参考。从这种表示中,我们得出三个诊断指标:事实保留分数(FPS)、问题保留分数(QPS)和实体保留分数(EPS),旨在奖励保留基本信息,同时惩罚细节过载,并将它们定位为可解释的诊断,在整体轴崩溃时仍然提供信息。最后,我们分析了 ROUGE 和 LLM 作为评判分数的四种反复出现的失败模式,证明基于支架的评估在传统指标崩溃的情况下仍然提供信息。