论文
我们评估的是知识还是措辞?使用 ParaEval 降低 MCQA 敏感性
Are We Evaluating Knowledge or Phrasing? Mitigating MCQA Sensitivity with ParaEval
摘要
多项选择 (MCQA) 基准是评估预训练 大语言模型 的标准,但它们对对数似然评分的依赖使得它们不可靠。具体来说,标准分数对答案的确切措辞(表面形式)高度敏感,将模型对特定短语的熟悉程度与其实际能力混为一谈。我们使用受相同知识训练的 1B-8B 模型的受控测试台来演示此缺陷。尽管拥有相同的知识,但标准指标错误地报告了超过 2 个百分点的绩效差距。为了解决这个问题,我们提出了 ParaEval,这是一个评估框架,它使用每个答案选项的多个释义来查询模型。通过根据最有利的措辞对每个模型进行评分,ParaEval 成功地将错误性能差距降低到 1 分以下。我们确认这些评估工件以及 ParaEval 的改进仍然存在于前沿 70B 和 120B 开源模型中。最终,ParaEval 提供了一种强大而有效的方法来评估真正的底层功能,而不是表面形式的熟悉程度。