论文

训练模型而非读者:可验证激活解释的可解码性监督

Train the Model, Not the Reader: Decodability Supervision for Verifiable Activation Explanations

模型训练监督微调与指令调优

摘要

自然语言自编码器以重建为激活解释打分:若激活能从解释再生,解释即被视为忠实。该测试在结构上对个别虚假论断不敏感——若翻转一个论断不改变重建,该论断永远不受惩罚。我们展示该测试以两种都不忠实的方式通过:在已发布的Qwen-2.5-7B言语化器上,解释的重建远高于随机水平,但约2%的具体论断是重建真正依赖的——分数追踪的是要旨而非具体事实;在精确合成真值下,标准训练持续发展出协同适配的私有代码(重建依赖的虚假措辞),不动目标模型的修复无济于事。我们贡献两个审计协议(落地与真值之比、换独立评估者)与RECAP(经共训辅助预测器的可读编码):与目标模型一同训练的线性头,使指定内容保持可解码。在RECAP训练的沙箱模型上,新鲜言语化器真实陈述指定内容、私有代码消失,代价仅+0.001 nat;在预训练Pythia-160M上复现。内容可被探针可靠解码,尽管新鲜言语化器仅部分传达(真值0.44–0.46对近零对照)。对可解释性:高重建不能为个别论断背书。对AI安全:RECAP让指定内容可对照探针检查,而非由模型可操纵的散文断言。独立探针把言语化器的真论断排在假论断之上(AUC 0.96对无RECAP的0.82);面对编辑解释以刷分同时说谎的对手(压制约87%的谎言惩罚),RECAP探针仍能标出谎言(AUC 0.95),对照探针塌到随机(0.51)。