论文

鲁棒性的幻觉:总体准确性隐藏了任务无关上下文下的预测翻转

The Illusion of Robustness: Aggregate Accuracy Hides Prediction Flips under Task-Irrelevant Context

模型评测鲁棒性、公平性与可信度评测

摘要

随着 大语言模型 (LLM) 的能力不断增强,它们越来越多地部署在上下文丰富的环境中,其中任务输入通常伴随着较长的、部分不相关的上下文。在受控环境中,我们发现最先进的模型通常在总体水平上对与任务无关的上下文表现出稳健性:将其添加到基准问题中不会导致整体准确性发生很小的变化。然而,这种总体稳定性掩盖了每个示例的显着不稳定性。即使是由随机组合字符形成的语义上无意义的伪词,也可以显着改变一小部分示例的模型预测,从而降低某些示例的性能,同时改善其他示例的性能。这种双向效应在各种模型和数据集中都一致存在,但受影响的示例很大程度上是特定于模型的。我们进一步表明,这种不稳定性受到上下文类型、上下文长度、测试时计算和模型开发阶段的调节。总之,我们的研究结果揭示了被总体准确性所掩盖的上下文引起的尾部风险,从而激发了对语言模型的每个示例的可靠性评估。