论文

大规模解读语言模型隐状态:OmniLens

Interpreting Language Model Hidden States at Scale

模型评测模型行为与机制分析

摘要

Lens方法通过将中间激活映射到输出词表来解读大语言模型(LLM),揭示下一token预测如何在网络中逐步形成。训练式lens依然昂贵:仿射翻译器参数随模型宽度二次增长,而精确的全词表Kullback-Leibler(KL)训练占据内存主导。因此,已有的训练式lens最多只应用于20B参数的模型,且仍局限于特定组件类型。我们提出OmniLens,将单一lens家族应用于任意模型宽度的激活——无论是残差流、注意力还是MLP——并结合两种独立的扩展技术。第一,低秩翻译器使每个lens的参数随模型宽度线性增长,可训练参数最多减少98.4%。第二,Subset-KL只物化选定的词表logits:其Top-k模式将峰值训练内存最多削减70%,其重要性采样变体则保留全KL的无偏随机梯度。这些节省使得为LLaMA-3.3-70B构建482个lens的密集集成成为可能,在相同深度下提供残差流设计6倍的覆盖。全模型覆盖进而揭示了单组件lens无法揭示的现象:行为最可见的组件未必是干预最有效的组件,最有效的干预位于以往lens研究考察的注意力头之外。在三个案例研究(提示词注入检测、多跳记忆注入和毒性定位)中,OmniLens以显著更低的成本复现了已发表的关键结果。

大规模解读语言模型隐状态:OmniLens:论文配图
图2:OmniLens一览。钩子被放置在模型中任意用户定义的位置;每个lens应用式(3)的低秩转换器,并按照第4节的Subset-KL目标针对模型的最终分布进行训练。