论文

校准基于模型的评估指标以进行汇总

Calibrating Model-Based Evaluation Metrics for Summarization

模型评测评测方法与指标

摘要

摘要评估的最新进展是基于基于模型的指标来评估质量维度,例如完整性、简洁性和 忠实性。然而,这些方法通常需要 大语言模型,并且预测分数经常被错误校准,限制了它们的可靠性。此外,评估单个文档的不同摘要的平均质量通常需要访问多个参考摘要。在这里,我们提出了一个通用框架,可以生成个人和平均代理分数,而不依赖于参考摘要、人工注释或昂贵的基于模型的指标。我们还提出了组等渗回归分箱(GIRB),这是一种调整原始预测以更好地与 真值 评估指标保持一致的校准方法。虽然我们关注连续值场景,例如摘要,但该方法适用于离散值任务,例如回答问题。对七个数据集的实验表明,我们的方法始终优于现有基线。