论文

HiPACE:稀疏自编码器特征吸收的分层相变边界分析与受控评测

HiPACE: Hierarchical Phase-Boundary Analysis and Controlled Evaluation of Feature Absorption in Sparse Autoencoders

模型评测模型行为与机制分析

摘要

稀疏自编码器(SAE)将LLM激活分解为稀疏字典原子,使每个不同概念拥有自己的特征。一个反复出现的行为使这一前提复杂化:特征吸收,即父概念与其子概念——例如果实与{苹果、香蕉、梨}——坍缩为共享的家族方向。先前工作以实证方式记录了吸收现象;缺少的是对共享方向何时是活跃语义家族的成本最优表示的闭式预测。本文填补这一空白。对于具有k个活跃子概念和残差尺度α的分层伯努利生成器,L0惩罚重构目标存在闭式相变边界λ_c(k,α)=α²k/(k-1):高于它时,纯父概念吸收严格比纯子概念编码更便宜。基于这一边界,我们提出HiPACE评测协议,在真实SAE字典中检验边界的结构性后果——在WordNet家族上测量父子解码器结构,在测试未见家族前冻结由发现选择的统计量,并把真实家族与随机化的同胞零假设对照。该边界在其原生区域内证明是尖锐的,在全部30个测试单元中把合成转变预测在±15%以内。在Pythia-160m的SAE中,父子解码器差距以高达-0.93的偏相关恢复预测排序,且在锁定的留出集上保持并排除同胞零假设(p=0.002)。受控激活组成把理论的活跃子概念数与恢复的家族方向联系起来,残差流干预表明带符号家族方向会提高父类别logit,符号翻转下逆转、随机对照下消失——在家族子空间层面确立了因果充分性。

HiPACE:稀疏自编码器特征吸收的分层相变边界分析与受控评测:论文配图
图 2:HiPACE 概览。该框架将层级家族模型及其阶段边界分析,与家族级 SAE 字典测量、在未见语义家族上的冻结验证以及受控的机制后续分析连接起来。小写 k 表示样本级活跃子成员数量;大写 K 表示家族总规模。