论文
识别转码器中的时间特征以实现时间敏感的事实回忆
Identifying Temporal Features within Transcoders for Time Sensitive Factual Recall
摘要
大语言模型 (LLM) 会遭受时间错位的困扰,这通常是由于其训练语料库的矛盾性质造成的。虽然当前的缓解策略依赖于计算成本高昂的微调或上下文繁重的检索增强生成(RAG),但控制时间敏感召回的内部机制仍未得到充分探索。与之前识别注意力头和 MLP 层等时间组件的研究不同,我们通过转码器电路跟踪隔离各个 MLP 特征,提供了时间回忆的第一个特征级图。我们确定了三个节点类别(公共时间、年份公共和时间语义),它们相互作用以在事实回忆期间生成时间过滤器。通过分析 Gemma 2 2B、LLaMA 3.2 1B 和 Qwen3-4B,我们表明这些特征并不遵循简单的线性管道,而是通过跨层的并行和混合句法语义相互作用来表示时间。我们还发现了一类现有 EAP-IG 方法不可见的高层时间组件,将代码转换器建立为时间敏感的事实回忆中时间可解释性的更完整的镜头。这些发现提出了 MLP 组件,可用于对时间敏感的事实回忆进行潜在的针对性干预