论文
稀疏权重Transformer中的单个参数能否得到解释?
Individual Parameters in Weight-Sparse Transformers Appear Interpretable
摘要
机制可解释性希望理解神经网络整体及每个组件的作用。主流电路分析往往围绕特定行为,在对应输入子分布上逆向分析组件,但同一组件可在不同输入子集上执行不同功能。论文研究能否在完整训练分布上解释单个权重,具体刻画哪些输入会在消融该权重后改变模型预测。自动LLM流程生成简短、可读的权重作用说明,再以未参与生成的文本验证;只有说明可以泛化,才将权重计为可解释。两个稀疏和两个稠密Transformer的比较显示,稀疏模型的可解释权重比例更高,排除不可靠说明后差距进一步扩大。稀疏模型有12%—31%的权重可由一条简短说明识别其用途。