论文

可解释而不可操作:机制方法在内部表征近乎完美时仍无法纠正语言模型错误

Interpretability without actionability: mechanistic methods cannot correct language model errors despite near-perfect internal representations

模型评测模型行为与机制分析

摘要

语言模型在内部表征中编码的任务相关知识远超其输出表现,但机制可解释性方法能否弥合这一“知识—行动”差距尚未得到系统性检验。我们使用400个经医生裁定的临床病例(144例危险、256例良性),比较了四种机制可解释性方法——概念瓶颈转向(Steerling-8B)、稀疏自编码器(SAE)特征转向、结合激活修补的 logit lens,以及结合真值分离向量(truthfulness separator vector, TSV)转向的线性探针(Qwen 2.5 7B Instruct)——用于纠正假阴性分诊错误。线性探针以98.2%的AUROC区分危险与良性病例,而模型的输出灵敏度仅为45.1%,形成53个百分点的知识—行动差距。概念瓶颈转向纠正了20%的漏检危险,但破坏了53%的正确检出,与随机扰动不可区分(p=0.84)。SAE特征转向尽管有3,695个显著特征,效果为零。TSV转向在高强度下纠正了24%的漏检危险,同时破坏6%的正确检出,但仍留下76%的错误未被纠正。当前机制可解释性方法无法可靠地将内部知识转化为纠正后的输出,这对假设可解释性能够实现有效纠错的AI安全框架具有重要启示。

可解释而不可操作:机制方法在内部表征近乎完美时仍无法纠正语言模型错误:论文配图
图 3:按危险类别划分的概念激活热图。 18 个危险类别和良性案例中前 10 个概念的平均概念激活(S 型空间)。较暗的细胞表示较高的平均激活。热图的稀疏性反映了概念激活空间的整体稀疏性(99.92%的激活<0.01<0.01)。