论文

更新几何:词汇量的 Fisher 对齐

The Geometry of Updates: Fisher Alignment at Vocabulary Scale

模型评测模型行为与机制分析

摘要

具有共享词汇表的 LLM 家族的 无需训练 源选择出现在科学字符串领域,例如 SMILES、蛋白质和基因组序列,其中候选语料库共享标记器,但预测目标不同。这创建了一个激活暗机制:如果没有关于标签条件误差几何的假设,表示相似性度量可能无法提供信息,而经典的更新几何度量在词汇规模上的计算量是令人望而却步的。我们表明,在共享输出头设置中,表示度量(例如 CKA)对于传输是不可识别的;模型可以共享相同的表示,但具有正交的头部更新。关键的特性是,头 Fisher 对齐恰好是联合激活误差空间中核均值嵌入之间的余弦,暴露激活、误差和耦合因素,而不需要具体化的 Fisher 矩阵。 FisherSketch 直接在单个流传递中估计这个余弦,使得 K=128,256 头 Fisher 对齐具有 16 KB 任务签名 (m=4096) 和 192 KB 每任务流状态,足够小,可以存储在模型哈希旁边,但编码与传输相关的更新结构。除了源选择之外,相同的签名和边际还提供了一种诊断工具,用于研究 LLM 任务相似性是否由激活、错误或其耦合驱动;共享参数和内部层验证以及 Llama-3.1-8B 语言器转换实验表明,当激活相似性无法区分任务时,FisherSketch 仍能提供丰富的信息。