论文
将多项选择评估的界限扩展到一百个选项
Pushing the Boundaries of Multiple Choice Evaluation to One Hundred Options
摘要
多项选择评估广泛用于 大语言模型 基准测试,但在低选项设置下接近上限的准确度可以通过掩盖真实能力的捷径策略来维持。因此,我们提出了一种大规模选项评估协议,将候选集扩展到一百个选项,并大幅减少机会性能的影响。我们将此框架应用于韩语拼写错误检测任务,其中模型必须从大型候选集中挑选单个不正确的句子。通过固定目标以及重复的重采样和洗牌,我们获得了稳定的估计,同时将内容驱动的故障与位置伪影分开。通过实验,结果表明,低选项设置下的强大性能可能会夸大模型的能力。这种明显的优势往往会在高 $N$ 的密集干扰下减弱,从而揭示出传统基准往往会掩盖的差距。我们确定了两种失败模式:语义混乱和不确定性下对早期选择的立场偏见。为了隔离上下文长度的影响,我们运行了填充控制和长度匹配测试,这表明主要瓶颈是候选排名而不是上下文长度。总之,这些发现支持大规模期权评估作为极端干扰密度下压力测试模型可靠性的通用框架,超出了低期权基准所能揭示的范围。