论文
超越聚合评分:用于评估基于参考的自动评估方法的行为正确性假设
Beyond Aggregate Scores: Behavioral Correctness Assumptions for Assessing Reference-Based Automatic Evaluation Methods
摘要
基于参考的自动评估方法在评估自然语言生成系统中发挥着至关重要的作用。现有的元评估主要衡量与人类判断或基准标签的一致性,对受控条件下评估者行为的了解有限。我们引入了行为正确性假设,这是用于评估基于参考的自动评估方法的补充框架。我们定义了正确性保留和正确性改变假设的分类法,并通过指定预期评分行为的受控响应转换来操作它们。我们评估不同的词汇、字符级、语义、基于 LLM 和混合评估器,并分析它们的假设级行为、稳定性、敏感性、重复运行可变性、配置敏感性和再现性。我们的实验揭示了评估范式之间不同的行为权衡:没有评估者满足所有提出的正确性假设,并且具有相似总体表现的评估者可以表现出截然不同的行为概况。这些发现表明,行为正确性假设提供了传统聚合元评估所掩盖的诊断信息。
