论文

语言模型智能体能成为机制可解释性中称职的电路解释者吗

Can Language Model Agents be Helpful Circuit Explainers in Mechanistic Interpretability?

智能体系统Agent 架构与控制循环

摘要

机制可解释性在自动定位电路上已取得长足进展——但解释被定位组件做什么仍然劳动密集且难以标准化。本工作中——我们研究在电路已被识别后——语言模型(LM)智能体能否协助这一解释问题。我们介绍AgenticInterpBench——由84个半合成transformer电路与163个组件级标注构建的电路解释基准。我们提出HyVE(假设、验证、解释)——智能体解释者:经观察、假设生成与因果验证的迭代循环分析每个组件——最终产出组件级解释与电路级任务描述。跨四个LM骨干——HyVE恢复出有用的组件级与任务级解释——但没有骨干全面最优。我们的分析显示:强骨干通常形成基于观察的假设——而失败更多出现在验证循环后期——经不完整的验证计划、代码执行错误或未解决的假设。Llama-3-8B算术电路的案例研究表明同一形式化可扩展到自然训练模型。总体而言——LM智能体是有前景的电路解释者——但可靠验证仍是关键障碍。

语言模型智能体能成为机制可解释性中称职的电路解释者吗:论文配图
图 2:HyVE 的管道。 HyVE 通过迭代观察 →\rightarrow 假设 →\rightarrow 验证循环来解释每个局部组件。被驳斥的假设将作为附加背景反馈到下一轮。处理完所有组件后,它会分配角色标签并综合电路级摘要。