论文

措辞效应:量化 LLM 基准性能中的双向漂移

The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance

模型评测评测方法与指标

摘要

基准分数来自每个问题的单个措辞。这个单一的措辞被视为代表了提出同一问题的所有方式,但事实并非如此。我们表明,在保持其含义和答案固定的情况下重新表述问题通常会双向翻转模型的答案,因此一些失败会变成成功,一些成功会变成失败。我们称之为漂移。 BenchDrift 沿四个轴(即语言、指称、实用和结构)生成基准问题的保留意义的变化,并测量每个轴下正确性翻转的频率和原因。在八个模型和三个基准测试(GSM8K、MMLU、MATH-Hard)中,我们观察到两个方向的漂移都很大。有两个发现很引人注目。首先,措辞敏感性不会随着模型的改进而减弱。相反,它改变了符号。弱模型从改写中获得的收益多于失去的损失,而强模型的损失远大于获得的收益。因此,我们发现,基准测试中最好的模型的得分最依赖于它们所给出的措辞。其次,这些模型在哪些改写成本最正确的答案上基本达成一致,尽管它们的漂移程度不同,因此脆弱性属于改写而不是模型。此外,无论问题是变短还是变长,都会重新表述模型确信的中断答案。代码和数据:https://github.com/IBM/BenchDrift/tree/demo-ui