论文

DMDIntel:借助动态模态分解解释大语言模型

DMDIntel: Interpreting Large Language Models via Dynamic Mode Decomposition

模型评测模型行为与机制分析

摘要

在这项工作中,我们提出 DMDIntel,它使用动态模态分解(DMD)使大语言模型在分类任务中的预测可被解释。它开发了一个输入归因流水线:首先把大语言模型的隐藏状态分解为显著模式(也称为模态),然后依据输入 token 在这些模态上的投影值为它们赋予排名。跨三个数据集和三个模型家族的严格实验一致表明,用 DMDIntel 得到的输入 token 排名归因远超主成分分析、积分梯度和 SHAP 等最先进技术。

DMDIntel:借助动态模态分解解释大语言模型:论文配图
表7:逐层敏感性分析。Δmax\Delta_{\text{max}} 表示从层 ℓ∗\ell^{*} 到 ℓ∗−1\ell^{*}-1 或 ℓ∗+1\ell^{*}+1 所观察到的最大 DMD 性能差异。表8:跨模型和数据集的详细归因结果。最佳结果以粗体标注。(g) Llama-3.2-3B-inst:负向情感(h) Qwen3-4B-inst:负向情感(i) Mistral-7B-v0.3-inst:负向情感(j) Llama-3.2-3B-inst:正向情感(k) Qwen3-4B-inst:正向情感(l) Mistral-7B-v0.3-inst:正向情感(m) Llama-3.2-3B-inst:HateXplain(n) Qwen3-4B-inst:HateXplain(o) Mistral-7B-v0.3-inst:HateXplain(p) Llama-3.2-3B-inst:FakeEdit(q) Qwen3-4B-inst:FakeEdit(r) Mistral-7B-v0.3-inst:FakeEdit图2:跨各种模型和数据集配置的特征值分布与模态动力学。表9:重构误差 ϵ\epsilon。表10:比较各模型系列和基准数据集的峰值 GPU 显存使用(GB)与每样本归因计算时间(秒)的详细效率评估。对于 Sentiment 数据集,报告负向/正向上下文传递的执行时间。表11:我们提出的方法(DMDIntelHoDMD−a​v​g​a​m​p{}^{\textsc{HoDMD}-avgamp})在 Sentiment 数据集上、三个模型系列在不对隐藏状态去噪时的负向与正向情感类别评估结果。表12:我们提出的方法(DMDIntelDMD−a​m​p{}^{\textsc{DMD}-amp})在 HateXplain 和 FakeEdit 数据集上、三个模型系列在不对隐藏状态去噪时的评估结果。表13:阈值 τ=0.5\tau=0.5 下跨负向和正向类别的情感分析对比评估结果。表14:Sentiment 数据集 top-1010 排名 token 的结果。表15:HateXplain 和 FakeEdit 数据集 top-2020 排名 token 的结果。表16:HateXplain 和 FakeEdit 数据集在阈值 τ=0.5\tau=0.5 下的对比评估结果。表17:为计算情感分析数据集的归因而选择 top-7 模态。