论文
大规模解读语言模型隐状态:OmniLens
Interpreting Language Model Hidden States at Scale
摘要
Lens方法通过将中间激活映射到输出词表来解读大语言模型(LLM),揭示下一token预测如何在网络中逐步形成。训练式lens依然昂贵:仿射翻译器参数随模型宽度二次增长,而精确的全词表Kullback-Leibler(KL)训练占据内存主导。因此,已有的训练式lens最多只应用于20B参数的模型,且仍局限于特定组件类型。我们提出OmniLens,将单一lens家族应用于任意模型宽度的激活——无论是残差流、注意力还是MLP——并结合两种独立的扩展技术。第一,低秩翻译器使每个lens的参数随模型宽度线性增长,可训练参数最多减少98.4%。第二,Subset-KL只物化选定的词表logits:其Top-k模式将峰值训练内存最多削减70%,其重要性采样变体则保留全KL的无偏随机梯度。这些节省使得为LLaMA-3.3-70B构建482个lens的密集集成成为可能,在相同深度下提供残差流设计6倍的覆盖。全模型覆盖进而揭示了单组件lens无法揭示的现象:行为最可见的组件未必是干预最有效的组件,最有效的干预位于以往lens研究考察的注意力头之外。在三个案例研究(提示词注入检测、多跳记忆注入和毒性定位)中,OmniLens以显著更低的成本复现了已发表的关键结果。
