论文
用稀疏自编码器寻找大模型中的信念几何结构
Finding Belief Geometries with Sparse Autoencoders
摘要
理解内部表征的几何结构是机制可解释性的目标之一。此前,使用隐马尔可夫模型序列训练的Transformer会在残差流中形成单纯形状的概率信念状态,顶点对应潜在生成状态。自然文本训练的大模型是否也形成类似结构仍未明确。本文结合稀疏自编码器、其特征的k子空间聚类与AANet单纯形拟合,寻找候选子空间,并在具有已知信念几何结构的多分隐马尔可夫模型Transformer中验证流程。应用于Gemma-2-9B后,研究识别13个K≥3的重点候选簇。关键在于区分真实信念编码与铺砌伪影:潜变量虽可构成单纯形子空间,其混合坐标未必比单独特征提供更多预测信息。因此,以重心预测作为主要辨别检验。13个簇中,3个在近顶点样本上显著获益(Wilcoxon p<10的−14次方),4个在内部样本上获益,共5个不同簇通过至少一个划分;空假设簇均未通过。簇768_596还取得数据集中最高的因果引导得分,是被动预测与主动干预一致的唯一案例。结果作为Gemma-2-9B可能存在信念几何结构的初步证据,并说明后续确认所需的结构化评价。