论文
MechRL:强化学习代理执行电路发现以实现机械可解释性
MechRL: Reinforcement Learning Agents Perform Circuit Discovery for Mechanistic Interpretability
摘要
机械可解释性试图通过找到模型的电路来解释模型的行为:模型计算的稀疏子图对其有因果关系。自动化方法使这种搜索变得系统化,但每一种行为都会重新开始,而花在寻找一个回路上的努力对下一个回路毫无作用。因此,电路发现已经自动化,但并未摊销。我们问电路发现本身是否可以学习。我们将其框架为 GPT-2 小计算图上的顺序决策问题,其中策略删除边缘,直到到达保留行为的紧凑子图,并由通过因果干预定义的 忠实性 奖励引导。经过十二种行为训练的单一策略可以为每个行为恢复忠实的回路,一旦冻结,它就会转移到训练期间从未见过的行为,无需进一步搜索即可恢复其已知的回路。短暂的热启动改善了这些转移的电路,返回的电路比从头开始训练要小得多。虽然学习到的策略与电路大小或成本的每个行为搜索不匹配,但它表明电路发现是一个可学习、可转移的过程,而不是对每个行为重复搜索。