论文
当激活预言机学会不阅读时:微调预言机中特定概念的盲点
When Activation Oracles Learn Not to Read: Concept-Specific Blind Spots in Fine-Tuned Oracles
摘要
激活预言 (AO) 是经过训练的语言模型,用于回答有关另一个模型内部激活的自然语言问题。它们提供了一个灵活的接口,用于从模型状态读取隐藏信息,特别是当相关信息在内部表示但在可见行为中不存在或不完整时。然而,AO 本身就是学习系统:它们的答案是由训练数据、目标和学习的报告行为决定的,而不是所表示信息的中立读数。我们在受控的禁忌词猜测环境中研究这一点,其中主题模型经过微调以在内部使用隐藏的概念,同时避免直接披露。与接受此类主题训练的 AO 成为专业阅读者的预期相反,我们发现经过微调的 AO 可以成为特定于概念的反阅读者:它们选择性地无法恢复在自己的训练期间持续存在的概念。这种失败不能简单地用主题或预言表示中概念的缺失来解释:目标在预言中仍然可解码,而 LogitLens 和层消融分析表明失败出现在 AO 读出路径中。我们的结果表明,行为泄漏、表示级可解码性和 AO 可语言性可能会分崩离析,从而引发对学习可解释性接口的可靠性问题。