论文
您的基准尚未饱和:通过答案池恢复多项选择评估
Your Benchmark Is Not Saturated: Reviving Multiple-Choice Evaluation with Answer Pooling
摘要
多项选择基准评分便宜,但区分模型的能力逐渐接近上限;常见补救办法是编写更难的题目,这既缓慢,又要在每个基准上重复。看似饱和的基准其实仍包含更困难的任务。每道题的干扰选项只为该题设计,因此模型可通过排除少数选项得分。我们提出AnswerPool:取共享上下文的$N$道题,把所有选项合并成一个列表,再要求模型为每道题指定答案。无需编写新题或修改标签。对于五道四选项题,整组猜对的概率从$10^{-3}$降至$5\times10^{-7}$;真正识别答案的模型仍能保留其多选成绩,所以合并选项后的准确率下降衡量了原格式赋予选项排除的额外得分。删除答案池中的正确答案,可构造真值确定的不可回答题目,并在同一次评测中衡量弃答能力。在八个文本、图像和视频基准、十八个模型上,答案池对所有模型都更难,较弱模型获得的排除法额外得分最多;八个开放权重模型中有七个仍对87%至100%的不可回答题作答。