论文

拉盖尔几何用于解读大语言模型

Laguerre Geometry for Interpreting Large Language Models

模型评测模型行为与机制分析

摘要

既有假说把LLM中的一个概念表示为单点、线性方向或高斯簇,但这些结构如何以及为何出现仍不清楚。我们证明概念几何可以经拉盖尔几何精确刻画:概念被定义为区域——拉盖尔-Voronoi单元或单元之并——使我们能严格定义、度量并分离概念。基于该表述,我们显示更细粒度的概念结构(如包含与层级)自然地由拉盖尔权重揭示。随后我们把这种几何推进Transformer内部:把每层分解为分段线性算子,我们显示token的隐轨迹由两个耦合机制支配——静态的自包含分段线性流之树,与跨token注意力激发时把轨迹在树间搬运的动态输运。该分解产生几何透镜(Geometric Lens):一个免训练、免超参的方法,读出隐向量在任意层编码的精确概念。我们还开发拉盖尔自编码器:一个二维可视化器,在单一视图中同时呈现决策几何与模型的完整推理轨迹。最后我们超越解释性几何走向可操作的的可解释性:显示几何透镜在模型被上下文干扰提示时恢复正确的时事token。代码见GitHub。

拉盖尔几何用于解读大语言模型:论文配图
(a) 图 3:大语言模型内区域间运输的示意图。橙色箭头表示来自单个标记“is”的流量,蓝色箭头表示整个提示“法国首都是”。