论文
真理方向的剖析:小语言模型中的知识依赖维度、关系律和共享类别几何
The Anatomy of a Truth Direction: Knowledge-Dependent Dimensionality, a Relational Law, and a Shared Category Geometry in Small Language Models
摘要
Bürger 等人(2024)证明,大语言模型 中的真值表示在语句极性上是通用的,但驻留在多维子空间内。语句的真值可以从语言模型的残余流中线性读取,但不清楚该表示有多少适合单个方向、哪个组件构建它或者它是由什么组成的。我们基于这些问题进行了一项研究,使用一种工具:无需训练 轴,真/假最小对上隐藏状态差异的奇异值分解 (SVD) 的主导方向,在没有标签的情况下识别最多一个全局符号。对来自 6 个不同架构系列(包括 MoE)的 14 个模型进行广泛评估,读取和提取的成本为每个词元 $O(d)$。我们以预先注册的预测来结束,预测该安排是否扩展到其真实性是计算而不是检索的类别。