论文

用于特征发现和长上下文归因的轮次平均 SAE

Turn-Averaged SAEs for Feature Discovery and Long-Context Attribution

模型评测模型行为与机制分析

摘要

稀疏自动编码器(SAE)已成为提取语言模型中可解释特征的有用工具。然而,标准 SAE 架构对单个词元激活进行操作,这意味着活动特征的数量与上下文长度成线性比例,并且研究长模型转录本变得困难。我们引入了回合平均 SAE,它通过学习重建整个回合的平均模型激活来表示具有固定数量特征的单个人类或助理回合。我们发现,当用 LLM 进行判断时,回合平均特征比每个词元特征更完整地描述了单个回合的高级特征。我们还证明,回合平均 SAE 极大地简化了 SAE 的常见下游使用,例如归因图。从广义上讲,回合平均 SAE 使可解释性技术在长上下文长度下变得实用。