论文

Weight Patching:迈向LLM中的源级机制定位

Weight Patching: Toward Source-Level Mechanistic Localization in LLMs

模型评测模型行为与机制分析

摘要

机制可解释性致力于将模型行为定位到因果实现该行为的内部组件。先前工作推进了激活空间定位与因果追踪,但在激活空间中显得重要的模块可能只是聚合或放大上游信号,而非在其自身参数中编码目标能力。为弥补这一空白,我们提出Weight Patching,一种参数空间干预方法,用于在一对架构相同、但在目标输入下表达目标能力强度不同的模型中进行源导向分析。给定基座模型与行为特化的对应模型,Weight Patching在固定输入下将特化模型中选定模块的权重替换到基座模型中。我们在指令遵循上实例化该方法,并提出一个以向量锚点行为接口为核心的框架,为开放式生成中任务相关控制状态是否形成或恢复提供共享的内部判据。在此框架下,分析揭示了从浅层候选源侧载体,到聚合与路由模块,再到下游执行电路的层级结构。恢复得到的组件分数还可指导机制感知的模型合并,在所评估的专家组合上改进选择性融合,并提供额外的外部验证。

Weight Patching:迈向LLM中的源级机制定位:论文配图
图 1:权重补丁与标准激活补丁。标准激活补丁干预干净/损坏输入下的激活,而权重补丁干预固定输入下的参数。在我们的指令跟踪分析中,激活侧伴随干预使用具有相同恢复逻辑的固定输入跨模型形式。