论文

你的答案有多正确?开放式 QA 评估的语义正确性框架

How Correct Is Your Answer? A Semantic Correctness Framework for Open QA Evaluation

模型评测评测方法与指标

摘要

开放式问答的可靠评估仍然是衡量现代 LLM 答案正确性的瓶颈。与多项选择任务不同,自由形式的答案在许多表面形式上可能是正确的,但也可能在性质上不同的方式上失败,包括不完整性、矛盾、过度生成和对错误前提的认可。现有的基于判断和基于相似性的指标常常会破坏这些区别。我们通过三个可重用的贡献来解决这一差距。首先,我们引入了一种语义正确性分类法,它将开放式答案分配给八个有序类别,将冗长但正确的答案与受幻觉内容污染的答案分开。其次,我们发布了 CAP-Correctness(一个涵盖广泛使用的 QA 数据集的 8800 个示例基准)和 CAP-Statements(一个 11000 个示例数据集,用于将问答对转换为声明性语句,以进行自然语言推理 (NLI) 训练和基于语句的评估。第三,我们介绍 CAP(上下文感知精度),这是一种基于参考的指标,可使用双向 NLI 对问题条件语句进行评分。在单调性协议下测试指标是否尊重分类法的预期顺序,CAP 优于既定基线。