论文
稀疏自编码器转向副作用的预干预预测
Pre-Intervention Prediction of Sparse Autoencoder Steering Side Effects
摘要
稀疏自动编码器 (SAE) 特征越来越多地用于引导语言模型,但特征引导很少是干净的:相同的干预可能在不同上下文中表现不一致,并扰乱不相关的特征。我们引入了一个预干预筛选框架,用于根据转向前计算的特征统计来预测 SAE 转向副作用。我们沿着转向模块化、效果稳定性和附带传播两个轴来操作副作用,并评估 ReLU、JumpReLU 和 TopK SAE 词典中的 GPT-2-small、Pythia-70M-deduped、Gemma-2-2B 和 Llama-3.1-8B。在这些设置中,解码器几何、激活统计、共激活结构和直接 logits 足迹比仅频率和激活幅度基线更好地预测转向模块化。 GPT-2-small、Pythia-70M 和 Llama-3.1-8B 中的信号最强,在与幅度相关的混杂因素中它能幸存下来,而 Gemma-2-2B 中的信号较弱。 Held-out 筛选表明,通过预测的清洁度对未见的特征进行排序可以选择更干净地引导新上下文的特征,但成功的轴因设置而异:GPT-2 改善得最干净,Pythia 主要改善稳定性,Llama 主要改善抵押品,而 Gemma 仅部分改善。受控的 Llama Scope 宽度比较表明,尽管筛选回报变得不太稳定,但预测信号在 32K 到 128K 字典宽度变化下仍然存在。总体而言,SAE 转向副作用是可以提前预测的,但有用的预测器签名和转移的模块化轴取决于模型和字典设置。