论文
MURANO:设计、运行和重现机械可解释性实验作为可组合管道
MURANO: Design, Run, and Reproduce Mechanistic Interpretability Experiments as Composable Pipelines
摘要
本文介绍了 Murano,这是一个开源框架,用于设计、运行和复制 大语言模型 的机械解释性研究,旨在供跨学科的研究人员使用。这些研究通常将加载、记录、归因、干预和评估结合起来,而现有的库往往侧重于该工作流程的不同部分。因此,使用多个库的研究人员可能需要调整一个库的输出以供另一个库使用。为了弥合这一差距,Murano 将这五个领域的操作表示为可组合的步骤。步骤交换命名的结果工件并声明它们所需的输入和它们产生的输出。管道按照提供的顺序执行其步骤,并且当组件标识在操作之间传递时,Murano 使用规范地址。 Murano 以现有的可解释性和机器学习库为基础。我们通过已建立的可解释性研究的两个复制品和一个说明性稀疏自动编码器案例研究来展示 Murano。