论文
内省耦合:自我解释训练跟踪行为变化,尽管有固定的监督
Introspective Coupling: Self-Explanation Training Tracks Behavioral Change Despite Fixed Supervision
摘要
训练语言模型(LM)来生成对其预测的解释何时会产生忠实的内省,而不是肤浅的模仿?我们研究了经过训练的 LM,以解释输入的哪些特征影响了他们的行为,使用模型对修改输入的反事实行为作为监督。令人惊讶的是,我们发现,LM 接受来自自身早期检查点的固定反事实解释的训练,甚至来自不同家庭中行为相似的模型,通常会产生更忠实于自己当前行为的解释,而不是训练目标的解释。当训练解释在训练过程中与当前行为保持充分相关时,即使行为本身发生变化,LM 解释和行为之间的这种“内省”耦合就会发生。我们还表明,内省耦合会跟踪行为变化:当与其他 后训练 目标同时提供解释训练时,解释会跟踪这些变化,而无需更新监督。这种现象出现在多个任务中,包括阿谀奉承和拒绝,并且对标签噪声具有鲁棒性。总的来说,我们的结果表明,即使反事实解释的固定数据集也可以提供可扩展且可概括的 后训练 信号进行内省。