论文
语言模型智能体能成为机制可解释性中称职的电路解释者吗
Can Language Model Agents be Helpful Circuit Explainers in Mechanistic Interpretability?
摘要
机制可解释性在自动定位电路上已取得长足进展——但解释被定位组件做什么仍然劳动密集且难以标准化。本工作中——我们研究在电路已被识别后——语言模型(LM)智能体能否协助这一解释问题。我们介绍AgenticInterpBench——由84个半合成transformer电路与163个组件级标注构建的电路解释基准。我们提出HyVE(假设、验证、解释)——智能体解释者:经观察、假设生成与因果验证的迭代循环分析每个组件——最终产出组件级解释与电路级任务描述。跨四个LM骨干——HyVE恢复出有用的组件级与任务级解释——但没有骨干全面最优。我们的分析显示:强骨干通常形成基于观察的假设——而失败更多出现在验证循环后期——经不完整的验证计划、代码执行错误或未解决的假设。Llama-3-8B算术电路的案例研究表明同一形式化可扩展到自然训练模型。总体而言——LM智能体是有前景的电路解释者——但可靠验证仍是关键障碍。
