论文

S^3martCirc:自监督智能电路发现

S^3martCirc: Self-supervised Smart Circuit Discovery

模型评测模型行为与机制分析

摘要

大语言模型 (LLM) 在从文本摘要到问题回答等各种任务中表现出了卓越的性能。尽管具有这些功能,但它们的黑匣子性质掩盖了内部决策过程。机械可解释性(MI)旨在通过将神经网络逆向工程为人类可理解的算法来解决这个问题。目前LLM的 MI 方法通常遵循两阶段范式:首先确定重要组件(电路发现),其中组件通常是单个节点,例如注意力头或前馈神经元,然后确定它们在特定任务中所扮演的角色(功能解释)。然而,这种顺序方法忽略了一个基本见解:组件的重要性及其功能作用本质上是相互依赖的。统一这些阶段提出了两个关键挑战:(1)功能角色通常与特定节点或组件相关联,限制了泛化;(2)它们的识别依赖于主观解释而不是可量化的指标。为了应对这些挑战,我们提出了 S^3martCirc(自监督智能电路发现),这是一个同时发现电路和解释功能的统一框架。 S^3martCirc 将节点行为抽象为两个通用计算角色,这些角色可跨任务进行推广,并定义用于分配它们的定量指标,从而能够共同发现重要性和功能角色,而不是按顺序发现。大量实验表明,我们的框架在电路发现方面优于现有方法。