论文
LLM如何在否定条件下改变答案?
How Do LLMs Change Predictions Under Negation?
摘要
否定是人类语言的一个基本特征,但大型语言模型 (LLM) 在处理否定时仍然不可靠。我们根据我们的否定基准评估了最近的开源和闭源LLM,发现在 37-71% 的情况下,他们在否定下重复相同的答案(例如,“马德里”代表“什么不是西班牙的首都?”)。为了理解和解决这种脆弱性,我们从机制层面检查模型在否定情况下如何运行。我们的主要发现是,专门的注意力头和 MLP 神经元通过以下方式联合实现否定:(1) 抑制原始答案的检索(例如“马德里”),同时 (2) 在答案类别中提升受青睐的候选答案(例如“巴黎”)。这与人类否定处理的描述形成鲜明对比,在人类否定处理中,有关原始答案的信息有助于确定应该排除什么。此外,我们发现这种与人类处理的差异是否定失败的关键根源:模型的机制依赖于抑制原始答案,而不是用它来确定要排除的内容,因此模型可以重复原始答案 当抑制太弱或者对特定答案的偏见阻止它选择替代方案时,就给出答案。为了解决模型否定机制中的这一弱点,我们提出了一个训练目标,要求答案偏好发生更大的变化,以获得更有信心的原始预测,并表明与标准微调基线相比,它可以减少否定失败,并且一般能力的退化更少。总之,我们的结果证明了机制分析如何揭示语言能力失败的原因并指导针对潜在限制的培训。