论文

我们可以相信法官吗?通过答案扰动验证事实性评估方法

Can We Trust the Judges? Validation of Factuality Evaluation Methods via Answer Perturbation

模型评测评测方法与指标

摘要

评估大型语言模型 (LLM) 的事实正确性对于许多应用程序至关重要。但我们的评估工具本身值得信赖吗?尽管基于事实的指标兴起,但它们的敏感性和可靠性仍未得到充分探索。本文介绍了一个元评估框架,该框架使用黄金标准答案的受控损坏来系统地测试这些指标。我们的方法生成具有已知退化程度的排名输出,以探究指标如何捕获真实性的细微变化。我们的实验表明,基于管道的方法(例如 RAGAS 的事实正确性度量)比 LLM 作为判断方法更好地跟踪退化。我们还提出了事实正确性度量的新变体,该度量提供了竞争性和成本效益。