论文
大语言模型 中上下文不变性失败
Failure of contextual invariance in large language models
摘要
标准评估实践假设,当提示嵌入到上下文等效的话语中时,大语言模型 (LLM) 输出是稳定的。在这里,我们在性别推断的背景下测试这个假设。使用受控代词选择任务,我们引入了最少的、理论上无信息的话语上下文,并发现这会导致模型输出发生巨大的系统性变化。一旦引入语境,与文化性别刻板印象的相关性就会在脱离语境的环境中减弱或消失,而理论上不相关的特征,例如代表不相关所指对象的代词的性别,则成为模型行为最有信息性的预测因素。默认上下文分析表明,在模型中 19--52% 的情况下,在考虑了上下文对个体输出的所有边际影响后,这种依赖性仍然存在,并且不能归因于简单的代词重复。这些发现表明,即使在几乎相同的语法公式下,LLM 输出也违反了上下文不变性,这对高风险环境中的偏差基准测试和部署产生了影响。