论文

上下文为王:上下文规范如何塑造概念的几何形状

Context Is King: How In-Context Specification Shapes the Geometry of Concepts

模型评测模型行为与机制分析

摘要

大语言模型 将结构化概念置于几何忠实的流形上:工作日位于一个圆上,月份位于另一个圆上,通常被视为网络存储和查找的固定世界模型。我们证明上下文为王:模型实际使用的结构是由上下文规范设置的。声明性规则不仅修复了几何编码的关系,还修复了其拓扑类型:相同的标记根据命令形成循环或分支树,甚至可以在没有继承先验的任意、无意义的标记上构建,这是重新标记的存储形状无法做到的。当规范与强大的预训练先验发生冲突时,上下文集几何在有能力的模型中占主导地位,从相同的激活中读取(与强加的结构的表征相似性为 0.6--0.9,而与先验的相似性接近于零),跨越我们测试的先验和我们研究的两个系列(Gemma,Qwen)。激活修补显示地图是按因果关系使用的,而不是探测关联:将一个实体的激活交换为另一个实体的激活,使模型在强加的顺序下回答另一个实体的后继者。粗略的地图很容易形成,甚至在小型和基础模型中也能呈现;什么规模的门正在干净地使用它:干净的优势和因果交叉仅出现在较大的模型(直到 Gemma-31B 和 Qwen-27B)中,并在下面减弱或逆转,因此大型模型中存在的机制可能在同一家族的较小模型中不存在。模型是否重新构建此几何图形或重新配置存储的几何图形,我们保持开放;在操作上,它使用的几何图形是上下文指定的几何图形。