论文
具有代理的语言模型的自动可解释性和特征发现
Automated Interpretability and Feature Discovery in Language Models with Agents
摘要
我们引入了一个用于机械解释的自主多智能体框架,该框架可以自动解释和查找 大语言模型 中的内部特征。该系统运行两个耦合循环:(1)解释细化,代理提出竞争假设,并通过有针对性的提示控制和多指标评估迭代测试它们; (2)特征发现,其中代理生成提示集,在激活空间中构建k近邻图,并使用统计可分离性和语义一致性标准检索候选特征。在 Gemma-2 系列模型和权重稀疏 Transformer 中的 MLP 神经元上,我们的代理改进了一次性自动解释,发现了语言特定和安全相关的特征,并生成了可审计的解释痕迹,表明代理驱动的经验循环比一次性标签产生了更清晰、更可证伪的解释。