论文
通过对比分层消融提取 大语言模型 的神经元锚定规则
Neuron-Anchored Rule Extraction for Large Language Models via Contrastive Hierarchical Ablation
摘要
可解释人工智能的中心目标是用符号表达 大语言模型 (LLM) 决策逻辑,并将其扎根于内部机制。现有的规则提取方法通常学习无根据的符号代理,而机械可解释性将行为与神经元联系起来,但通常需要手工制作的假设和昂贵的干预。我们引入了 MechaRule,这是一种通过本地化稀疏激动剂激活(其消融会破坏规则相关行为)来在 LLM 电路中进行规则提取的管道。 MechaRule 依赖于两个发现。首先,在固定的基线/翻转机制中,稀疏的激动剂效应可能会表现出过度的效果:一些高效激活在较大的组中仍然可检测到,主导较弱的激活,并翻转许多相同的示例。在这种机制中,当 k << N 是激动剂时,采用置信引导保守修剪的自适应群体测试需要对 N 个候选者进行 O(k log(N/k) + k) 次干预。其次,激动剂在与接近忠实的规则行为一致的数据分割上更可靠地定位;光谱分割提供了无规则的后备,而不忠实的分割会降低定位。根据经验,在算术和越狱方面,MechaRule 在匹配的强力验证中召回了 97.0% 的最高效果激动剂,而平均而言,详尽消融成本仅为 2.14%。消除局部激动剂可以消除 97.6--100.0% 合格的正确算术答案和越狱,并且可以纠正算术错误或诱发高达 72.8% 和 32.5% 的越狱。