论文

MechELK:用于引出 大语言模型 中潜在知识的机械可解释性框架

MechELK: A Mechanistic Interpretability Framework for Eliciting Latent Knowledge in Large Language Models

模型评测模型行为与机制分析

摘要

大语言模型 (LLM) 经常在其内部表示中编码事实和推理知识,而这些知识并未忠实地反映在其表面级输出中 - 这种现象称为 \emph{潜在知识}。现有的引出潜在知识的方法,例如对比一致性搜索(CCS),依赖于对比激活模式并难以完成复杂的多步骤推理任务,而机械可解释性工具主要用于\emph{理解}模型行为而不是\emph{提取}隐藏知识。我们提出了 \textbf{MechELK},一个统一的三阶段框架,连接了机械可解释性和潜在知识启发。 MechELK 通过以下方式运行: (1) \textbf{Locate} —— 使用稀疏自动编码器 (SAE) 特征分析和激活修补来识别知识承载表示; (2) \textbf{Verify}——利用因果探测来区分真实的潜在知识和虚假的相关性; (3) \textbf{Elicit}——将表示工程应用于表面隐藏知识而不修改模型权重。在 TruthfulQA(精心设计的欺骗性对齐基准)和 Quirky LM 数据集上进行评估时,MechELK 的平均引出准确度为 84.7%,比 CCS 好 6.2%,比直接线性探测好 9.1%。至关重要的是,MechELK 在 78.3% 的模型表面输出不正确或回避的情况下成功识别了潜在知识,证明了其在人工智能安全应用(包括欺骗性对齐检测)中的实用性。