论文
语言模型如何处理否定
How Language Models Process Negation
摘要
我们研究大语言模型 (LLM)如何机械地处理否定。首先,我们确定,尽管开放权重模型经常对涉及否定的问题提供错误的答案,但它们确实拥有正确处理否定的内部组件。它们的准确性较差是由于后层注意力行为提倡简单的捷径;消除这些注意力模块极大地提高了否定相关问题的准确性。其次,我们揭示模型如何处理否定。我们考虑两个假设:模型可以使用注意头来关注被否定的短语并抑制相关概念,或者它们可以直接构建整个否定短语的表示(例如,将“非气体”表示为促进液体和固体的向量)。我们在 Mistral-7B 和 Llama-3.1-8B 上应用了一系列观察和因果解释技术,以表明模型实现了这两种机制,其中“建设性”机制更为突出。结合起来,我们的工作加深了对 LLM 内部结构的理解,强调了 LLM 中结构主导的计算和竞争机制的共存。