论文
大语言模型 系统地支持流行选项:跨 MCQ 的证据和缓解措施
Large Language Models Systematically Favor Popular Options: Evidence and Mitigation Across MCQs
摘要
多项选择题 (MCQ) 是评估 大语言模型 (LLM) 的标准格式,但答案选项的流行可能会混淆评估。现代 LLM 系统性地更喜欢流行但不正确的选项,而不是不那么流行的正确选项,我们称之为 \textbf{流行偏差} 的漏洞。这种模式与置信度错误校准一致:即使流行选项的准确性下降,模型置信度仍然很高。为了系统地隔离这种现象,我们引入了 \textbf{PopMCQ},这是一个具有六种受控策略的基准,可以改变选项的受欢迎程度,同时保持正确答案固定。在我们最具对抗性的环境中,所有干扰项都比正确选项更受欢迎,模型在 66% 的情况下会选择受欢迎但错误的答案。为了减轻这种偏差,我们提出了 \textbf{PopDebias},这是一种轻量级的推理时间校正,可以估计并消除模型预测中的流行度先验。它不需要 微调,在测试时是无标签的(仅使用小的校准分割进行参数拟合),并且增加的计算成本可以忽略不计。在 22 个开源 LLM(0.5B 到 32B 参数)上的实验显示出一致的改进,在强大的流行压力下,准确率提升高达 54.1 个百分点。代码和数据可获取https://github.com/DataScienceUIBK/PopMCQ