论文
大语言模型 中的多成分因果追踪
Multi-component Causal Tracing in Large Language Models
摘要
因果追踪系统地干预 大语言模型 (LLM) 的内部表示,以揭示和量化将特定输入或计算与感兴趣的特定指标联系起来的因果路径,从而量化 LLM 的行为。基于之前的单组件或单层研究,本文提出了一个统一的框架,用于同时因果追踪多个组件。该框架系统地识别对所需目标性能指标(例如准确性和公平性)最关键的组件子集(例如注意力头和多层感知器神经元)。这是通过将灵活的干预措施应用于广泛的期望指标来实现的。为了解决多组件问题的组合复杂性,设计了一种有效的算法,利用软干预和精心设计的度量转换,将组合搜索问题转换为可以在适当约束下有效解决的连续问题,从而生成用于选择组件的正确二元决策。实验结果表明,所提出的方法可以有效地识别对目标指标有很大影响的模型组件子集,优于现有的基线方法。我们的代码可在 https://github.com/ZiruiYan/multi-component-causal-tracing 获取。