论文

检索就足够了:使用工具代理的 无需训练 可解释性

Retrieval is Enough: Training-Free Interpretability with a Tool-Using Agent

模型评测模型行为与机制分析

摘要

神经网络激活的可解释性方法涵盖了广泛的成本范围,从廉价的 无需训练 技术(例如线性探针、PCA、SVD)到更昂贵的基于训练的技术(例如 SAE 和激活预言机)。基于训练的方法通常更强大,部分原因是它们在训练期间利用大型激活数据集。这就提出了一个自然的问题——它们实际上是否能提供超出训练数据集本身可恢复的洞察力?为了解决这个问题,我们为 LLM 代理配备了与其文本上下文配对的激活向量数据库,以及用于操纵激活的工具 - 投影潜在空间中的方向,计算激活差异和平均值。代理迭代地查询数据库,根据检索到的样本形成假设,并通过构建线性探针来验证它们。我们将此方法称为 HARP,即假设驱动的代理检索和探测。尽管不涉及任何训练,HARP 在概念发现、概念检测、模型引导和秘密启发方面均优于激活预言机和基于 SAE 的代理。 无需训练 设计还使 HARP 变得更便宜、更灵活:只要现有数据集不足,就可以按需对新数据集建立索引。更广泛地说,我们的结果表明,当前基于训练的方法尚未提取超出其训练数据的见解,并激发了明确要求可解释性方法来证明此类见解的基准。我们在 https://github.com/SriramB-98/HARP 发布我们的代码