论文

ICA Lens:无需训练另一部词典即可解释语言模型

ICA Lens: Interpreting Language Models Without Training Another Dictionary

模型评测模型行为与机制分析

摘要

在语言模型表示中找到可解释的方向对于理解和控制模型行为至关重要。稀疏自动编码器 (SAE) 已成为实现此目的的标准工具,但将它们用作默认的第一镜头通常需要训练、存储和评估大型过完备字典。这个瓶颈限制了快速探索并提出了一个基本问题:在训练另一个神经字典之前,从激活几何中已经可以看到多少可解释的结构?我们的直觉很简单:许多可解释的方向都是对标记的选择性,并且这些方向应该看起来不像随机方向那么高斯。因此,我们重新审视独立成分分析(ICA),这是一种寻找非高斯方向的经典方法,作为语言模型可解释性的紧凑透镜。我们发现 ICA 在 LLM 可解释性方面被低估了,因为之前的使用通常依赖于现成的 ICA 实现,这些实现在 LLM 激活上很脆弱,并且缺乏用于检查和评估恢复方向的系统工具。为了弥补这些差距,我们引入了 ICALens,这是第一个对 LLM 表示进行稳定、高效和可审核的 ICA 分析的实用工作流程。它将优化的 GPU 并行 FastICA 管道与 LLM 特定的稳定性配方和更好的拟合诊断相结合,从而实现高效可靠的分层分析。在 GPT-2 Small、Gemma 2 2B 和 Qwen 3.5 2B Base 中,ICALens 可以有效地恢复紧凑的、人类可解释的方向,而无需进行每层基于梯度的字典训练。在 SAEBench 上,ICA 在稀疏探测方面与公共 SAE 具有竞争力,并且在中小预算下的目标探测扰动方面优于公共 SAE。这些结果表明 ICA 不应被视为弱基线,而应被视为探索语言模型表示的有效且互补的第一镜头。