论文
通过特定任务的自我报告揭示隐藏的模型行为
Revealing Hidden Model Behaviors with Task-Specific Self-Reports
摘要
微调 可以赋予语言模型一种隐藏的行为——它可能在狭窄的条件下给出错误的答案,或者仅在提示涉及特定主题时给出有害的建议。我们引入了用于自我报告的稳定适配器(SAR),这是一种轻量级 LoRA 适配器,它使微调模型仅使用模型和训练数据集以简单的语言描述其自身的隐藏行为。在七种植入行为中,SAR 可以检测到每一种行为中的隐藏行为,即使模型已经泛化为仅靠训练数据无法预测的广泛错位。内省适配器 (IA) 是最接近的现有基线,它检测到我们套件中的一些行为,但完全错过了其他行为——在错过的地方,它会产生幻觉,持续报告错误的行为。 SAR 在 IA 失败的每种情况下都会保留积极信号,并将幻觉发生率大致减半。这为从业者提供了更可靠的工具来审核微调模型并回答“它实际上学到了什么?”类型的问题。