论文

第一个标记是一条线索:从 J 角度描述多标记概念

The First Token Is a Clue: Verbalizing Multi-Token Concepts from the J-lens

模型评测模型行为与机制分析

摘要

雅可比透镜(J 透镜)是解释 LLM 的最新工具。它将隐藏状态读取为词汇标记的排名列表,使多标记概念没有自己的表示。最初的 J-lens 工作通过 Template Lens 和 Oracle Lens 解决了这一限制,Template Lens 预先计算固定短语词汇表的向量,Oracle Lens 则微调组件以提出短语并重建短语向量。我们询问是否可以直接从 J-lens 和冻结模型中恢复多标记概念及其向量。我们发现多标记概念的第一个标记与单标记概念的可读性大致相同。给定正确的第一个词元和源提示,冻结模型在 88.3% 的双词元情况下恢复第二个词元。我们证明了完整概念的向量可以在单个前向传递中从后续隐藏状态中恢复。因此,我们使用 J-lens 提出第一个标记,并让冻结的模型完成候选概念。然后,我们为每个候选者恢复一个向量,并将其与完整词汇表一起评分。在 Gemma-3-12B-IT、Llama-3.1-8B 和 Qwen3-14B 上的 496 个多跳完型填空中,我们的方法实现了 43.1% 的平均 $\mathrm{Rank@}10$ ,而 Template Lens 的平均率为 27.6%。如果没有 J-lens 线索,性能会下降到 21.6%,这表明第一个标记线索大大提高了读出能力。使用恢复向量进行因果概念交换的平均 $\mathrm{succ}@10$ 为 61.4%,而相同干预下的 Template Lens 为 26.2%。这些结果表明,第一个词元线索可以指导多词元概念恢复,而后续隐藏状态则为读出和干预提供向量。