论文

谁翻转?自模型和跨模型反驳揭示了 LLM 中答案的不稳定性

Who Flips? Self- and Cross-Model Counterarguments Reveal Answer Instability in LLMs

模型评测鲁棒性、公平性与可信度评测

摘要

标准准确度基准评估 大语言模型 (LLM) 是否得出正确答案。然而,他们并没有测试模型在受到合理的反驳挑战时是否维持该答案。我们引入了一种评估答案稳定性的受控协议:在模型正确回答多项选择题后,我们用连贯的论证来质疑模型的答案,并衡量模型是否翻转。该设置 a) 将争论内容与公开的社会压力隔离开来,b) 改变争论长度、自我归因和跨模型来源。在 7 个前沿模型和 57 个 MMLU 受试者中,翻转率范围从 17.5% 到 97.3%,揭示了稳定性的巨大差异,而这些差异是仅通过准确性指标无法捕捉到的。我们发现自我归因持续增加翻转率(平均 7.1 个百分点,最高 18.7 个百分点)。此外,跨模型汇集错误答案论据并为每个问题选择最有效的一个,会比依赖任何单一来源模型产生更强的对抗性挑战。从这个跨模型池中,我们构建了 MaxFlip,这是一个精心策划的基准,与自行生成的挑战相比,答案翻转次数最多可提高 23.6 个百分点。我们发布了协议、挑战记录和 MaxFlip,以支持稳定性评估以及标准精度基准。材料可在 https://github.com/nafisenik/WhoFlips、https://hf.co/datasets/nafisehNik/WhoFlips 获取。