论文
无标签策略下的准确性和顺序敏感性存在差异
Accuracy and Order Sensitivity Diverge Under Label-Free Strategies
摘要
多项选择基准广泛用于评估 大语言模型,但 MCQ 分数将知识与对选项顺序的敏感性混为一谈,这使得它们成为模型知识的不可靠衡量标准。在本文中,我们测试了阻止模型在提交答案时看到选项标签是否可以消除位置影响,从而提高性能。我们评估了两种不同的减轻偏见的策略。第一个使用生成然后匹配的方法,第二个对孤立的选项进行评分,这在结构上是不偏不倚的。两者都不能可靠地提高准确性。完整的分解表明,瓶颈在于保留选项,而不是匹配步骤。唯一与基线一致的配置是显示与 LLM 匹配器配对的模型所有选项的配置。然而,完全消除位置影响仍然不能可靠地产生精度增益,而循环排列通常可以提高精度增益。对于两阶段提示,回忆不平衡的总体测量和顺序敏感性的每个问题的直接测量都未能显示出可靠的去偏。