论文

当模型遵循错误答案时:多项选择 QA 中源归因线索的稳健性审核

When Models Defer to Wrong Answers: A Robustness Audit of Source-Attributed Cues in Multiple-Choice QA

模型评测鲁棒性、公平性与可信度评测

摘要

语言模型经常收到一个问题以及关于另一个来源回答的内容的声明。我们审核此类主张是否会破坏多项选择题回答中答案的稳定性。对于每一项,我们都会在误导性条件下固定一个错误选项,并改变附加的提示模板。我们引入了\emph{中性条件误导性线索采用率}(NC-MCAR),它仅在有效的线索试验中测量切换到该选项,其中相同的模型首先在中性提示下选择正确答案。这是答案不稳定性的衡量标准,而不是证明模型知道答案或所有尊重都是非理性的。我们在 MMLU-Pro 和 IndicMMLU-Pro 上评估英语、印地语、孟加拉语、泰米尔语和泰卢固语的四种指令遵循模型。在 220{,}000 个输出中,专家模板产生 41.1\% 的聚合 NC-MCAR,而多数模板为 12.5\%。这两种情况使用相同的错误选项和最终指令。填充准确性仍然远高于专家错误的准确性,而正确提示提示的有效响应准确性很高。审计文件在测试的强制选择提示下回答了与证据对齐相关的不稳定性:一个未经验证的原始来源声明可能会超过先前与任务证据一致的答案。