论文

修剪、解释、评估:跨层转码器原生框架,通过特征归因实现高效电路发现

Prune, Interpret, Evaluate: A Cross-Layer Transcoder-Native Framework for Efficient Circuit Discovery via Feature Attribution

模型评测模型行为与机制分析

摘要

现有的特征解释管道通常在统一采样的单元或详尽的特征集上运行,从而在与目标行为无关的单元上产生大量成本。为了解决这个问题,我们引入了第一个 CLT 原生端到端剪枝框架 PIE,它开创了先剪枝后解释的范例。 PIE连接剪枝、自动解释和解释评估,建立全面的基准测试环境,系统地衡量剪枝下的行为保真度和下游可解释性。在此框架内,我们采用强相关性基线并提出特征归因修补(FAP),这是一种基于补丁的归因方法,通过聚合梯度加权写入贡献来对 CLT 特征进行评分。此外,我们引入了 FAP-Synergy,一种系统的协同感知重排序程序。我们使用 KL 散度行为保留来评估剪枝,并使用 IOI 和 Doc-String 数据集上的 FADE 风格指标来评估解释质量。跨越 {50, 100, 200, 400, 800} 中 K 的预算限制,我们严格的基准测试揭示了不同的操作制度:虽然基础 FAP 和改编基线在宽松的预算下表现强劲,但 FAP-Synergy 在高度受限、严格的预算制度中表现出色。至关重要的是,我们展示了实用的“有效预算”优势:在 Llama-3.2-1B 和 Gemma-2-2B 的 IOI 任务中,K=50 时的 FAP-Synergy 在功能上与 K=75 时基线电路的行为保真度相匹配。由于下游评估成本按特征线性扩展,Synergy 有效地为管道提供了 25 个“免费”特征,实现了 K=75 保真度,同时将解释成本降低了 33%。