论文
评分规则:文本评价指标的统计与策略对齐
Scoring Rules! Statistical and Strategic Alignment for Text Evaluation Metrics
摘要
基于参考文本的评估指标,这些指标广泛用于评估自然语言生成系统,通过比较候选响应与参考响应来评分。评估指标的可靠性通常通过其与人类评分的统计相关性来判断。然而,随着这些指标被越来越多地用作优化目标,单独的统计相关性不再足够:代理可能会通过战略手段操纵这些评估指标。我们通过两个互补的概念来研究这一问题。一个指标是统计上对齐的,它与人类评分相关且能抵抗不增加任务相关性信息的扰动。另一个指标是战略上对齐的,它能抵抗不相关的扰动。我们做出了两个贡献。首先,我们提出了基于参考文本的评估指标测试原则,包括人类评分相关性、降级敏感性以及抗扰动性。这些原则评估一个指标是否与人类判断一致,是否能抑制低努力的信息损失,以及是否能抵抗战略评分的膨胀。其次,我们开发了一个统一的设计框架,用于基于信息量的评估指标,将现有的和新的指标分解为四个选择:信息度量、估计方法、文本表示和预测机制。在同行评审、摘要生成和问答任务中,我们发现强的人类评分相关性并不意味着战略对齐:LLM-as-a-Judge在评分上表现出高相关性,但容易受到操纵。相反,基于信息量的指标显著提高了抗操纵性。我们的框架还揭示了一个在我们的实验中表现出最强整体抗性的新指标,同时在人类评分相关性方面保持竞争力。