论文

论大语言模型中词汇的持续影响

On the Persistent Effects of Lexicality in Large Language Models

模型评测模型行为与机制分析

摘要

从 大语言模型 (LLM) 中提取的表示在许多下游应用中发挥着重要作用。然而,这些表示的结构通常受到词汇重叠而不是语义内容的影响。我们对这种词汇影响和语义内容之间的关系及其对下游任务的影响的理解仍然有限。在这项工作中,我们研究了表征来量化词汇重叠相对于语义内容的影响。我们考虑了几种对抗性语义压力测试,并进一步将我们的发现与信息论的观点联系起来。我们发现词汇影响延伸到模型的深度,一致地跨越架构、训练机制和目标函数,包括针对语义相似性训练的模型。此外,我们观察到词汇和语义信号同时退化的中深度区域,表明表面形式和含义的表征都很差的过渡状态。我们使用摘要和模型编辑作为案例研究,进一步证明了词汇影响对 LLM 下游使用的影响。