论文

信息满意度:以读者为中心的摘要评估轴

Information Satisfaction: A Reader-Centered Axis for Summarization Evaluation

模型评测评测方法与指标

摘要

摘要评估的大部分工作侧重于一般摘要质量(例如 ROUGE、BERTScore)或特定的所需属性(例如可读性、真实性)。然而,这些指标无法衡量摘要对单个用户的效用。例如,了解最新疫苗研究的生物医学研究人员将与家庭医生有不同的信息需求。以查询为中心的摘要捕获了部分这种需求,但在实践中,用户很少陈述查询中相关的所有内容:单个简短查询可能不足以区分研究人员的需求和医生的需求。相比之下,读者的背景或角色(他们的角色和专业知识)在查询中相对稳定,并且可以恢复大部分缺失的上下文,这使其成为评估摘要是否满足读者需求的实用信号。在这项工作中,我们评估了流行的摘要指标对信息和角色差异的敏感程度,并发现许多流行的指标(包括强大的 LLM 作为判断指标)未能通过信息内容的基本扰动测试。我们还进行了专家的人工评估,根据给定特定人的背景和用例的信息满意度来衡量摘要偏好。我们发现传统的指标和基于 LLM 的指标都不足以衡量信息满意度,并且与人类判断的一致性较差。