论文

从电路证据到机械理论:归纳逻辑方法

From Circuit Evidence to Mechanistic Theory: An Inductive Logic Approach

模型评测模型行为与机制分析

摘要

机械可解释性产生了神经网络行为的电路级因果分析,但发现的电路通常仍然是孤立的实验制品:对于电路计算什么、它们如何关联,或者两个发现何时为同一机制提供证据,没有共享的正式表示。这项工作通过将电路解释视为归纳理论构建,为累积机械科学提供了正式的基础设施。每个电路都有两个层次的特征:因果功能签名(CFS),它根据因果归因证据和词元角色配置文件中的组件行为,以及架构签名 $τ_{\mathrm{arch}}$,通过归纳逻辑编程(ILP)从尺度不变的结构谓词中学习。这些共同构成了一个正式的一致性层,使机械主张变得明确,可以通过 $θ$ 包含进行比较,并且可以跨模型尺度移植。 CFS 揭示了跨任务类型的定性不同的计算策略,包括注意力介导的复制与 MLP 介导的结合。 ILP 签名比图内核和特征向量基线实现了更好的结构分离,并支持跨模型规模和架构系列的原则性转移。