论文

根据模糊词对的收敛表示进行不同的 大语言模型 预测

Divergent large language model predictions from convergent representations in ambiguous word pairs

模型评测模型行为与机制分析

摘要

在这项工作中,我们研究了仅解码器 Transformer 如何通过对跨越三个参数大小的三个模型(GPT-2-Small-117M、Llama-3.2-3B、Qwen2.5-32B)的逐层分析来解决词汇歧义。对于同音异义词和多义词,我们发现表示在中间层变得最大程度不同,然后在后面层部分重新收敛,而它们的下一个标记预测之间的 KL 散度在最后层达到最大。激活修补实验提供了因果证据,表明尽管嵌入空间的相似性明显增加,但后期表示差异直接决定输出。我们的单层消融实验表明,尽管存在本质上不同的逐层漏洞,但模型仍实现了等效的消歧作用。这些发现为最近的观察提供了一种机制,其中模型的内部嵌入相似性显示出与其行为输出的低相关性,尽管表现强劲。因此,语义区别仍然存在,但对于嵌入的相似性度量来说变得越来越不可见,这对基于嵌入的方法(例如依赖于后期层余弦相似性的语义搜索、检索和聚类)产生影响。