论文

理解虚构并重新思考激活解释中的重构

Understanding Confabulation and Rethinking Reconstruction in Activation Explanations

模型评测模型行为与机制分析

摘要

自然语言自动编码器 (NLA) 生成模型激活的无监督文本解释:语言描述器描述激活,重建器学习从该文本中恢复它。在已建立的点重建 NLA 训练方案下,解释对于预测模型行为变得更加有用,同时也越来越多地引入不受支持的细节并表现出书写缺陷。为了单独评估这些变化,我们引入了一个针对非结构化 NLA 解释的标准化评估框架,衡量从解释中可恢复的信息、其主张的上下文支持以及写作质量。为了解决虚构和写作缺陷,我们超越了预测单个激活:解释可以区分可能激活的分布,即使它们的平均值和最佳点重建奖励相同。我们引入了 Flow-NLA,它对与解释兼容的激活分布进行建模,并使用扩散似然界限来训练言语表达器。在 Qwen、Gemma 和 Apertus 中,这种更丰富的信号保留了点重建的效用收益,同时抑制了虚构和书写缺陷的增长,为改进激活衍生训练开辟了方向,以鼓励更多信息丰富、受支持和可读的解释。代码和评估提示将在接受后公开发布。